OpenAI、IPO申請を数日〜数週間以内に準備か
Wall Street Journalの報道によると、OpenAIが初期公開(IPO)の申請を「数日から数週間以内」に準備しているという。Goldman SachsやMorgan Stanleyなどの銀行が目論見書の作成を支援しており、金曜日にも提出される可能性があるとしている。
OpenAIは声明で「戦略的選択肢を定期的に評価している」と述べるにとどめたが、AI業界最大のスタートアップの上場は、市場全体に大きな影響を与えることは間違いない。直近の評価額はすでに3,000億ドル規模と報じられており、テクノロジーIPOとしても歴史的な規模になる可能性がある。
AIチャットボット、選挙ニュースの正確性で9割失敗
Forum AIの新しい調査によると、ChatGPT、Google Gemini、Anthropic Claude、xAI Grokの主要4チャットボットは、選挙や地政学に関する質問に対する回答で「正確性、バイアス、情報源の選択」のいずれかで9割の確率で失敗した。
3,100以上の質問を投げかけた結果、特に選挙関連の回答で顕著な不正確さが見られたという。中間選挙を目前に控える米国において、AIチャットボットが情報源として信頼できないことは重大な懸念だ。AI企業にとって事実確認の精度向上は急務となっている。
Google AI StudioがプロンプトからネイティブAndroidアプリを生成
Google AI Studioが、プロンプトからネイティブAndroidアプリを生成できるようになった。KotlinとJetpack Composeでビルドされ、ブラウザエミュレータでテスト可能だ。
The Decoderはこれを「アプリ市場版SaaSpocalypse」と表現している。トラッカーやチェックリストといったシンプルなユーティリティアプリについては、Play Storeの存在意義が薄れる可能性がある。一方、Appleはvibe-coding系アプリの一貫したブロック姿勢をとっており、両社のアプローチの対比が興味深い。
AIによるコード生成がアプリ開発の民主化を加速する一方で、品質保証やセキュリティの課題も生じるだろう。
Airbnb CEO、中国産AIモデル(Qwen)利用を擁護
AirbnbのBrian Chesky CEOは、同社がAlibabaのQwen大規模言語モデルをカスタマーサポートチャットボットに使用していることへの米下院調査に対し、「米国の法律立案者が技術を誤解している」と反論した。
「中国企業にデータを提供していない。彼らはいかなるデータにもアクセスできない」と述べ、オープンソースモデルの使用はデータ漏洩とイコールではないと強調した。この発言は、米中対立の文脈でオープンソースAIモデルの利用をめぐる議論に一石を投じるものだ。
中国製オープンソースモデルの性能向上が進む中、セキュリティと性能のバランスをどう取るかは、多くの企業が直面する判断になりつつある。
ツール呼び出しコスト比較: 品質差2%でコスト10倍の実測結果
RedditのMachineLearningコミュニティで、5つのモデル(Opus 4.7、GPT 5、Sonnet 4.6、DeepSeek V4 Pro、Tencent Hunyuan)を使ったツール呼び出しの詳細なコスト比較が話題を呼んでいる。
15k行のPythonプロジェクトで8つのリファクタリングタスクを実行した結果、最も高価なOpus 4.7(約15ドル)と最も安価なTencent Hunyuan(約1.5ドル)の品質差はわずか2%ポイント未満だった。日常的なリファクタリングでは、安価なモデルでも十分機能することが分かった。
ただし、複雑なネストされたデコレータのリファクタリングでは高価なモデルが圧倒的に優れており、タスクの複雑さに応じたルーティングの重要性も示されている。興味深いことに、投稿者はM2 Ultra Mac Studio(192GB)でローカル推論も行っており、1日の支出を約40ドルから9ドルに削減したという。
参照:
- OpenAI preparing for IPO filing in days or weeks, WSJ reports — Bloomberg
- Chatbots Struggle With News Accuracy and Sourcing Ahead of Midterms — Bloomberg
- Google tests the app market version of the SaaSpocalypse — The Decoder
- Airbnb CEO says US misunderstanding use of Chinese open-source AI models — Bloomberg
- under 2% quality gap but 10x cost difference: tested 5 models on identical tool calling tasks — Reddit MachineLearning