Tencentのエージェント「Gander」、会話を続けながら裏で作業を進める

Tencentが公開したマルチモーダルエージェント「Gander」が、The Decoderで紹介された。音声・画像・テキストを処理しながら、タスクの実行はバックグラウンドで進める設計が特徴だ。会話の継続を担う「小脳(cerebellum)」と、ファイル検索やコード作成といった複雑な仕事をこなす交換可能な「脳(brain)」に役割を分けるアーキテクチャで、ユーザーは会話の途中で割り込んだり、タスクを変更したりできる。

注目されるのは評価結果で、ベンチマークではユーザーを遮断したのはわずか8%にとどまり、競合より少なかった一方、タスクの精度では劣ったという。「話しかけやすいエージェント」と「正確に仕事を終わらせるエージェント」のトレードオフを、役割の分離でどこまで解消できるのか。音声アシスタントとエージェントの境界が溶けていくことを示すリリースと言えそうだ。

MicrosoftのSuleyman氏、AI規制をめぐり「中国をブギーマンにするな」

MicrosoftのAI責任者Mustafa Suleyman氏はCNN「Fareed Zakaria GPS」に出演し、中国のAI進展への懸念を、ガードレール(安全策)整備を怠る口実に使うべきではないとの見解を示した。「AI安全性に向けた我々自身の取り組みを進めない言い訳に、中国をブギーマン(恐怖の的)にすべきではない」と述べたという。

米国ではいま、大手AI企業による開発減速の取り決めが違法な協定だとして提訴されたことが報じられるなど、規制と競争のバランスをめぐる議論が活発だ。競争圧力を規制回避の理由にしない──この発言がMicrosoftのAI責任者から出た意味は小さくない。

Bengio氏は「エージェントはなぜ嘘をつき、ごまかし、協調するのか」──Ng氏は絶滅リスクを「SF」

AI安全性研究の重鎮Yoshua Bengio氏が、自身のブログに「Why are AI agents lying, cheating and coordinating?(なぜAIエージェントは嘘をつき、不正を行い、協調するのか)」と題する論考を公開し、Hacker Newsで取り上げられつつある。本パイプラインで取得できたのは見出しレベルの情報のため内容は割り引いて読む必要があるが、エージェントの欺瞞的挙動という安全性研究の中心課題に正面から向き合うタイトルだ。

同じ頃、機械学習教育で知られるAndrew Ng氏がインタビュー動画で「AIによる絶滅の恐れはSF(空想科学)だ」と語ったと伝えられている。こちらも見出しベースの情報ながら、リスク認識の温度差がくっきり分かれた形だ。リスクの重みづけに合意がないままエージェントが社会に組み込まれていく現状では、両極の発言がともに参照点として引用され続けそうだ。

GitHub NextがJev互換OSS「LocalJev」を公開、C++実装「laya.cpp」も登場

判定特化モデル「Jev」(TypeSafe AI)をめぐる動きがさらに加速している。Zennのガイド記事によれば、GitHubの先端技術部門GitHub Nextが9月19日、Jev互換のOSS「LocalJev」を公開した。Jev本体はアーリーアクセスのWaitlist制で招待が来ないと試せない状態が続いていたが、LocalJevを使えば待ち時間をスキップして手元で動かせるという。直近ではオープン実装「openjev」もHugging Faceに登場しており、互換実装の選択肢が一気に広がった形だ。

同じ流れで、Jev風のオープンモデル「Laya」をスタンドアロンのC++で高速化する「laya.cpp」も公開された。ggmlベースにカスタムCUDAカーネルを備え、PythonもPyTorchも不要。JEV互換エンドポイント付きのHTTPサーバーも含む。RTX PRO 6000 Blackwell(450W制限)での計測では、選択・採点・真偽判定を含む固定250問のコーパスで、バッチ1のBF16処理がPython実装の149問/秒に対しC++実装で366問/秒と、約2.5倍のスループットを示したという。ライセンスはMIT。「本命の公開待ち」から「実装の書き換え合戦」へ──エコシステムの成熟度が一段上がったと言えそうだ。

Cloudflareに「検索は残してAI学習だけ拒否」する設定

Cloudflareが、Webサイトを検索結果に残したまま、AIの学習利用だけを断れる設定「Disallow AI Training」を発表した。無料プランを含む全プランで提供される。クロールを全面的に拒否すると検索流入まで失いかねなかった従来のオール・オア・ナッシングに対し、「AI学習のみ」を切り出して拒否できる点が新しい。

国内の解説記事(Qiita)は、混合用途クローラーが全体の36.6%を占めることや、この設定による検索遮断が1%未満・学習制限17%といった数値を見出しで伝えている。本パイプラインでは本文の途中までしか取得できていないため、それぞれ何の比率かといった詳細は元記事で確認したい。AIとの共存を前提にしたサイト運営の選択肢が増えつつあるのは間違いなさそうだ。

ワールドモデル企業、「何を作っているか」は秘密だらけ

TechCrunchの特集記事は、ワールドモデル(世界モデル)分野が資金も注目も集める一方で、創業者からデータ供給者まで「実際に何を作っているのか」を明かそうとしない実態を指摘した。取得できたのは要約レベルだが、巨額の資金を集めながら技術的な中身が外部から検証しにくい状態が続くことへの疑問が記事の核とみられる。研究からプロダクトへの距離が読みにくい領域だけに、情報開示のあり方が今後の論点になりそうだ。

Kimi K3(2.8兆パラメータ)をGB10 16基で──コーディング30 tok/s

個人規模の取り組みでは、Moonshot AIの「Kimi K3」(2.8兆パラメータ)をGB10 16基のクラスタで動かす試みがr/LocalLLaMAで公開された。独自のランタイムパッチとネットワーク構成の最適化により、コーディング生成のデコードで約30 tok/s(ピーク約38 tok/s)、プリフィルは約750〜910 tok/sを達成したという。ネットワークはMikroTikスイッチ2台と400G→100Gブレイクアウトケーブル4本で構成し、vLLMベースのカスタムスタックに手を入れたMLA/KVカーネルを使用。50万トークン級の圧縮を挟みつつ数十万トークンのコンテキストを安定して回せたとされ、パッチや設定はGitHubで公開されている。