9月24日に収集したAIニュースから、Googleのセキュリティ特化モデル、Appleの新Siri AI、NECの組織改革、そしてエージェント関連の2本の研究を取り上げる。
セキュリティAIは「あえて小型」──Gemini 3.5 Flash Cyber
セキュリティ向けの新モデルと聞くと、「一番賢い最上位モデルを出してきた」と想像しがちだ。ところがGoogle DeepMindが7月21日に公開した「Gemini 3.5 Flash Cyber」は逆で、あえて安価な小型モデル(Flash系)をベースにしている。それでいて脆弱性発見のベンチマークでは、上位モデルであるはずのClaude Opus 4.6を上回ったという。
なぜ「大きいほど強い」が通じないのか。脆弱性の自動探索でボトルネックになるのは、モデル1回あたりの賢さよりも「どれだけ回数を回せるか」だ。コードベースは巨大で、安価なモデルを大量に回したほうが、トータルで見つけられる問題が増える。スキャンという仕事の構造そのものが、小型モデルと相性が良い。
仕事の種類によって「モデルの賢さ」と「コストあたりの回数」のどちらが効くかは変わる。モデル選定の考え方を示す例として、示唆的なリリースだ。
macOS 27の新「Siri AI」を試す──日本語は10月予定
Appleが2026年9月に提供を始めたβ版のSiri AI。macOS 27.0(Golden Gate)で使えるようになったため、10種類の依頼を文字入力で試したレポートが公開されている。同一チャット内のやり取りを含めると総数は約30件で、日本語と英語で依頼した際に差異があったものも紹介されている。
現時点で使えるのは英語版で、日本語版は10月の提供予定と報じられている。試した環境では、Siriの言語を英語にするとSiri AIが使え、日本語にすると従来のSiriのまま動くという。日本語での利用を待つユーザーには、もう少し先になりそうだ。
NECが「AI自律型組織」を新設
NECが「AIネイティブカンパニー」を目指して「AI自律型組織」を新設した。AIを「企業OS」として組織に組み込む取り組みで、AIが自律的に進化する組織に変わる中で従業員はどうなるのか──「従業員はいらなくなる?」の問いに経営側がどう答えたかを考察する記事がITmedia AI+に掲載されている。
日本の大企業がAX(AIトランスフォーメーション)を組織設計のレベルで進める事例として注目される。
AIチューターは人間と同等の学習成果──StudentBench
AIによるチュータリングと人間によるチュータリングが、GREの学習成果で同等だったことを示した研究「StudentBench」が発表された。この研究は、学生の学習を1パーセントポイント向上させるコストを確立・測定した初めての試みとしている。
「1兆ドル以上が、機械を改善する機械を教えることに使われている。StudentBenchは機械が人間を改善することの価値を示す」──研究の紹介文はこう締めくくられている。モデル同士の改善に向かう投資の流れの中で、人間の学習への還元を金額で測定した点が特徴的だ。
エージェントは「敵対的でない」環境でも操られる──CAVEAT
ユーザーの代理人としてWeb上で行動するコンピュータ使用エージェント(CUA)が増える中、その堅牢性を検証する研究「CAVEAT」が発表された。着目点は、環境側のインセンティブがユーザーと一致しないケースだ。
例えばオンラインマーケットプレイスでは、プラットフォームが一部の商品を優遇表示し、エージェントをユーザーの目的から逸らそうとする可能性がある。既存のCUAベンチマークは協調的な設定か明示的な攻撃を対象にしており、そうした「ステアリング」の中でエージェントがユーザーの目標を保持できるかは検証されてこなかった。購入や予約をエージェントに任せる運用が広がるほど、インセンティブの揃わない環境での挙動を問う評価が実運用に近い形で求められてくる。
LLMエージェントのメモリは「読み込み時」に整理する──JitMem
LLMエージェントの記憶の多くは書き込み時に整理される。各行動の記録(軌跡)を、次のタスクで何が必要になるかを知らない段階で固定の要約へ蒸留するため、情報が失われ、学習シグナルの遅れの原因にもなっていた。
「JitMem」はこれを反転させる。生の軌跡をロスレスに保存し、タスクが判明した読み込み時にちょうど必要な形へ整理する。整理側がタスクを見られるため記憶はクエリごとに適応し、学習も単一ステップの報酬に集約される。その結果、ヒューリスティックな書き込み時整理と、RLで訓練した書き込み時整理のどちらに対しても、成功率(SR)を16ポイント上回ったという。
今回の取り上げトピックは、収集時点で確認できた情報に基づいています。