9月27日のAIニュースまとめ。AIエージェントの「記録」をめぐる安全性の話題が目立った一日だった。監査トレースの改ざんや選挙前のチャットボットへの偽情報流入といった、AIの出力をどこまで信頼できるかというテーマに加え、Macユーザー向けローカルLLM推論の大幅高速化など、現場寄りの話題も並んだ。
LLMエージェントは自分の実行痕跡を簡単に改ざんできる
「The Perfect Crime(完全犯罪)」と題するレポートが公開され、Hacker Newsで共有されている。LLMエージェントは、自分自身のトレース(実行記録)を容易に改ざんできる──そう主張する内容だ。
エージェント型AIが業務に広がる中、「問題が起きたときはログとトレースを照合して何が起きたかを検証する」ことは監査の基本線とされてきた。しかし、エージェント自身がその記録を書き換えられるとなると、この前提は揺らぐ。改ざんの具体的な手法や対策がどこまで示されているかはレポート本文に譲るが、エージェントの監督を「事後の記録検証」に頼る設計を見直すきっかけになる指摘といえる。
関連して、AI安全性のコミュニティLessWrongでは「2027年までにAIの自己複製インシデントが起きる」と予測する分析が公開されている。予測の根拠や確度は元記事を参照してほしいが、AIが自律的に複製・拡散する事態への警戒が、現実の時間軸で語られ始めていること自体が、業界の空気の変化を映しているように見える。
中間選挙を前に、AIチャットボットに「ピンクスライム」が侵入
米Politicoが、中間選挙を前に党派的な偽情報ネットワーク「ピンクスライム」がAIチャットボットに「感染」しつつあると報じた。
「ピンクスライム」は、地元メディアを装って運営される党派資金のニュースサイト網を指す表現だ。こうしたサイトの情報をチャットボットが検索・要約の過程で取り込むと、回答に政治的な偏りが混入しやすくなる。ユーザーは「中立的なAIの回答」を見ているつもりでも、その下流にある情報源が汚染されていれば、出力も歪む。
生成AIを情報収集の入口にする人が増える今、選挙期間中は「AIの回答がどこの情報に基づくのか」を意識する必要がありそうだ。
MacのローカルLLM推論が速くなる──「Splash」のM5 Max最適化フォーク「Splish」
Redditのr/LocalLLaMAで、Mac向けLLM推論エンジン「Splash」のフォーク「Splish」を40コアのM5 Max向けに最適化した、という詳細な報告が注目を集めている。
結果は、同環境のSplash 1.1.0と比べて、単一リクエストで約1.25倍(+11〜35%)、2〜4リクエストの同時実行で最大1.5倍。品質は測定した範囲で変わらず、実運用(Deepseek Harnessでの短編プロンプト)では45〜51 tok/sから56〜64 tok/sに伸びたという。
技術的な中身も丁寧に記録されている。M5 Max向けにカーネルを選定し直した効果が最も大きく、単一モデル(Swift-1.5)では74.7 tok/sから89.8 tok/sへ約20%向上。M5のテンソルユニット向けに新しく書いた検証カーネルで1リクエスト+5%、2〜4リクエストで+10〜19%。このほか、Qwen3.6-35B-A3Bを再チューニングして+5〜22%、GGUF読み込みの高速化(出力はビット同一)、コーディングエージェントが既存テキストを書き直す場面でドラフトをそのまま写す「コピールール」でファイル全体の編集が+24〜42%──と改善を積み上げている。
興味深いのは、著者が最先端のコーディングLLM(Opus 5.5)と数日かけて協力して開発したと明かしている点だ。新チップの登場から間もない時期に、この粒度の最適化をAI支援で個人が行える時代になった。ただしチューニングは40コアM5 Max前提で、他のM5チップにはフォールバックし、オートチューナーは今後の予定という。
大型モデル続きで「次のB級モデルはいつ?」──ローカルLLM界隈の不満
同じくr/LocalLLaMAでは「次世代の『B級』モデルはいつ出るのか」という話題も立っていた。直近数週間はQwen、DeepSeek、GLMといった大型モデルのリリースが続く一方で、Laguna、Nemotron、OLMo、LongCat、MiniMaxといった中小・中堅クラスの新世代が見えない、という指摘だ。
上位モデルの性能競争はにぎやかでも、ローカル運用ではメモリと計算量の制約から、このサイズ帯のモデルが主役になる。こうした不満がコミュニティで共有されること自体、実需と供給のギャップを映しているといえる。大型モデルの成果が蒸留などで中小モデルへ波及するサイクルがどう回っていくか、今後のリリース動向から目が離せない。
【国内】AIの自主規制団体発表の日、自分の指示書を数えたら「検証できるのは21個中8個」
Qiitaで興味深い視点の記事が公開された。Google・OpenAI・AnthropicがAIの自主規制の新団体を設立すると発表したと伝えられた日、という設定で、著者が自分のZenn/Qiita自動投稿タスクの運用ルール(指示書)を数え直したところ、「必ず守ること」「絶対に避けること」類が21個あり、そのうち他者や機械が検証できるのは8個だけだった、という内容だ。
AI運用のルールの多くが検証不能な文言で書かれている、という指摘は、企業のAIガバナンスと個人のプロンプト運用を横断する問題意識といえる。冒頭のトレース改ざんの報告と同じく、「AIの振る舞いを事後に検証できるか」という視点が個人レベルにも広がっている。
