モデル価格の「安さ」の実態を読み解く検証記事と、AI評価の方法論を問い直す失敗談が目を引く一日だった。大手モデルの値下げが進むいま、数字の裏側を確認する動きが広がっている。
Opus 5.5とGPT-6 Solの「値下げ」は何を変えたか
Zennで注目を集めているのが、AnthropicとOpenAIが相次いで発表した値下げの中身を検証する記事だ。両社の発表は2026年9月22日、AnthropicがClaude Opus 5.5を、約100分後にOpenAIがGPT-6 SolとGPT-6 Lunaを公開するという形でほぼ同時に行われた。
記事は、見出しを飾る値下げの数字を「安くなったもの、変わらなかったもの、見えないもの」に切り分けて読み解く。トークン単価の表向きの下げ幅だけを比べても実際の請求額は変わらず、キャッシュの効き方や処理の速さといった、利用条件に依存する部分まで見て初めてコスト比較として意味が出る、という視点だ。複数のモデルを使い分けるのが当たり前になった今、この種の検証は実用価値が高い。
AIの評価をAIに任せると「甘い正解」が生まれる
同じくZennで、評価データの作り方をめぐる失敗談が話題になっている。Claude Codeに組ませた音声認識の比較で、Apple標準の音声認識の誤り率はWhisperの約6分の1(5.4%対33.6%)という結果が出たものの、正解データが「Appleの出力を人間が直したもの」だったため、翌日にこの数字を撤回したという。
問題の本質は、AIの出力を人が修正したものを正解に使うと、同じ仕組みで動く元のAIに有利に働く点にある。Appleの書き方を残した正解データの上では、Appleは「自分の字の上を」進めることができ、WhisperはAppleの表記につまずく。AIの文字起こしや要約を人が直して評価の正解にしているケースは少なくないはずで、評価の設計から見直す必要性を示す好例と言える。
Nikon、AI疑惑で顕微鏡動画コンテストの受賞作を再審査
Nikonが顕微鏡動画の国際コンテスト「Small World in Motion」について、AIによる生成・加工の疑いが指摘された受賞作品の審査をやり直していることが分かった(PetaPixel)。AI生成画像をめぐる騒動は報道写真や芸術分野で相次いできたが、今度は科学画像の祭典に同じ問いが届いた形だ。撮影技術と生成技術の境界が曖昧になるなか、審査の基準をどう更新するかが問われそうだ。
ケンブリッジ大学、TurnitinのAI学習計画に反対
学生課題の剽窃チェックで広く使われるTurnitinが、提出物をAIの学習に使う計画を進めているのに対し、ケンブリッジ大学が反対の姿勢を示したと、同大の学生紙Varsityが報じた。学生の提出物には未発表の研究アイデアや個人的な文章が含まれるため、その二次利用は同意と契約の観点から慎重に扱うべきだ、という理屈だ。検証ツール側のデータポリシーを見直す動きが他大学・他機関にも波及するか注目される。
4GB GPUで8Bモデルの学習を検証したら「アダプタが空」だった
ローカルLLM界隈では、ファインチューニングCLI「Soup」(Apache-2.0)の主張を実際に確かめた記事が話題だ。Soupは、凍結したベースモデルの重みをVRAMに置かず、ホストRAMからデコーダ層を1層ずつGPUへ流し込む「Layer Streaming」により、4GB GPUでも8Bモデルのファインチューニングが可能だと主張している。
筆者はRTX 5060 Tiで実際に検証。学習自体は本当に動いたものの、出来上がったアダプタの中身が空だったという。本家READMEのベンチマーク数値には開発者自身の注記が付いているとおり、目新しい手法の主張は手元で確かめてから信用したい──そんな教訓を残す記事になっている。
そのほか気になった話題
- ZennでSparsely-Gated MoEをRouter・Top-k・負荷分散まで実装目線で読み解く解説記事が公開された。MoEを「巨大なのに軽いモデル」ではなく、tokenごとにExpertを選ぶ疎なFFNとして理解する構成になっている。
- 同じくZennで、Claude Codeのサブスクリプション枠が足りなくなった開発者が、他社製モデルをサブエージェントとして協働させる運用を紹介している。
- Inference Reviewは「AIは数学者を廃れさせない」と題する論考を公開。AIの数学能力が向上する時代に人間の数学者に残る役割を論じている。
