2026年9月28日の海外・国内AIニュースまとめ。今回はローカルLLM界隈の注目プロジェクトが2本。16GB VRAMのゲーミングGPUでGemma4 26Bを動かす自作推論エンジン「Gem16」と、340Mパラメータで運用現場の判断をこなす分類特化モデル「GLiNER2.5-Decide」だ。さらに、LLM各社に3Dプリントの橋を設計させて実際に破壊テストする実験、国内事情として日立が語る「SIerの御用聞き」から新職種FDEへの変化、そしてハルシネーションの仕組みをOpenAIの研究から読み解く記事と、Claudeによる920万件規模のデータ解析事例を紹介する。

16GB GPUにGemma4 26Bを載せる――自作推論エンジン「Gem16」

RedditのLocalLLaMAコミュニティで、RTX 5080 Laptop GPU(16GB VRAM)向けに自作した推論エンジン「Gem16」が公開された。作者によれば、以前話題になったNinferに触発されて始めた個人プロジェクトで、コードはほぼすべてCodexで書き、多くの週末をかけて実用レベルまで仕上げたという。

当初は12Bモデルを十分なコンテキスト付きでVRAMに載せるのが精一杯と考えていたが、EXL3風のカスタム量子化を導入した結果、26Bモデルも16GB VRAMに収まり、220kトークンのコンテキストまで確保できた。自作の動機の一つは、vLLMが16GB VRAM環境でMTP(マルチトークン予測)を動かせなかったことで、完成品はvLLM/faster並みかそれ以上の速度を達成しているとのこと。LinuxとWindowsの両方で動き、シングルユーザー専用(12Bなら2セッション同時)という割り切りも特徴だ。性能は次の通り。

  • 12B(音声・画像入力対応): prefill 5,800トークン/秒、decode 87トークン/秒
  • 26B(画像入力対応): prefill 5,660トークン/秒、decode 182トークン/秒

なお12Bのネイティブ音声理解には、コンテキストが約8kを超えると音声トークンを認識しなくなる問題があるという。作者はこれをモデル側の不具合とみており、Hugging Faceの公式ディスカッションでも同様の報告が上がっていると指摘している。

340Mパラメータで運用判断をこなす「GLiNER2.5-Decide」

Hugging Faceのトレンドに、GLiNER2.5ファミリーの分類特化モデル「GLiNER2.5-Decide」が上がっている。DeBERTa-v3-large系のエンコーダを持つ340Mパラメータのモデルで、推論のたびに任意のラベルセットを渡せる設計が特徴だ。プロンプトテンプレートもトークン生成も不要で、意図判定・ルーティング・感情・優先度・ポリシー判定・マルチラベルタグを1回のforward passで処理できる。

想定されているのは運用現場の「判断」そのものだ。カスタマーサポートの意図分類、銀行取引のリクエスト判別、旅行・クリニックの予約系振り分け、レビューの感情とアスペクト分析、メールやチケットの振り分け、人間へのエスカレーション要否、モデレーション、緊急度・重大度の評定、スパム判定など、業務で必要になる細かい分類を1モデルでカバーする。1回の呼び出しで「意図・緊急度・担当チーム」のような複数の判断ヘッドを同時にスコアリングできる点も実運用向きだ。

一方で開発元は「汎用モデルではない」と明言している。推論や説明、オープンクエスチョンへの回答はできない専用機であり、そうした割り切りを代償に340MというサイズでCPU実行も可能にしている。英語特化で、多言語入力には別途GLiNER2.5-multi-Decideが用意されている。ライセンスはApache 2.0。

LLMに3Dプリントの橋を設計させて破壊テストする実験

同じくLocalLLaMAで、LLMの物理的な設計能力を試す実験が話題になっている。複数のLLMに、固定された制約条件(スパン2フィート≒約61cm、フィラメント500g未満、印刷時間18時間以内)で橋のCADコードを生成させ、実際に3Dプリントして荷重テストで破壊するというものだ。

結果は振れ幅が大きかった。部品どうしが噛み合う形状すら設計できないモデルがあった一方、最上位のモデルが設計した橋は100ポンド(約45kg)超えの荷重に耐えたという。投稿者は「既存のベンチマークでは物理的直感・空間推論・実用的なコード生成を同時に評価できない」と指摘し、この種の標準化されたベンチマークとリーダーボードの必要性を訴えている。

ベンチマークスコア上では接近したモデル群も、現実世界の制約に置き換えると大きな差が出る――という示唆を含む実験として興味深い。

「御用聞き」からFDEへ――日立の現場で変わるもの

国内ニュースから。ITmedia AI+が、日立で「FDE(Forward Deployed Engineer)」として顧客の現場に入る3人のエンジニアへのインタビュー記事を掲載した。

「SIerは御用聞き」と揶揄された時代から、AI時代の新たな職種としてFDEが注目されるなかで、記事では仕事内容がどう変わり、コンサルタントや従来のSEと何が違うのかを現場の3人に聞いている。パイロットから本番導入まで顧客と伴走する役割が、生成AIの企業導入が進む局面でどう機能するかを示す事例として、日本のSIer業界の方向性を占う材料になりそうだ。

なぜAIは「知らない」と言えないのか――ハルシネーションの仕組み

Qiitaでは、OpenAIの研究をもとにLLMが「わからない」と言えない理由を整理した記事が公開された。本来は知らないはずの質問にも、もっともらしい嘘(ハルシネーション)を自信満々に返してしまう背景にある仕組みを、一般人にも分かる形で読み解いている。

同じテーマの実例としては、技術書の「次の一冊」をAIチャットに相談したら実在しない本を薦められた、という体験をまとめた記事も公開された。「Reactを一通り触れたので次に何を読むべきか」と尋ねると、いかにもそれらしいタイトルと著者名の本を3冊、理由付きで即答してくれる。便利な反面、たまに完全に架空の本を提示してくる事故が起きるという。推薦という用途では、存在確認が簡単なだけに被害は軽いが、「もっともらしい組み合わせ」を生成するLLMの性質がそのまま露出する好例といえる。

Claudeで920万件のニュース記事を解析した事例

Qiitaではこのほか、Redditで話題になった「CLSTR」プロジェクト――920万件規模のニュースデータを、データ処理パイプラインとClaudeを組み合わせて解析した事例を紹介する記事も公開された。大量のデータ前処理とLLMの解析を組み合わせる構成になっており、大規模データに対するLLM活用の実例として参考になる。


今回はローカル推論の自作エンジン、小型特化モデル、物理世界でのLLM評価、国内の職種変化、ハルシネーション理解、大規模解析と、粒度は違えど「実運用に近い場所でのAI」という共通線が走る1日だった。「16GB VRAMで何が動くか」「小さいモデルで何を任せられるか」という観点は、フロンティアモデルの話題と並んで現場の関心を集め続けそうだ。