スケーリングの限界——元 OpenAI 研究者が $100 億の訓練データ投資を予測、AI 戦略が変わる
元 OpenAI の Andrew Ho が「単純なスケーリングでは LLM の汎用性は実現しない」と指摘。今後 AI ラボは $100 億規模の高質訓練データ投資に向かい、プログラミング・数学偏重の「スペシャライゼーション問題」を解決へ。AI 開発の次の段階へ。
AI 開発の時代が転換期を迎えている。
元 OpenAI の研究者 Andrew Ho は、AI コミュニティが直面する根本的な課題を指摘した:単純なスケーリング(パラメータ数の増加)では、LLM は汎用性を獲得できない。そして、この問題を解くには、業界全体で $100 億規模の高質訓練データへの投資 が不可欠だという。
「スケーリングの壁」とは何か
Ho と Cambridge の研究者 Adam Hunt の分析によると、最新の LLM には逆説的な現象が起きている:
モデルサイズが大きくなるほど、スペシャライゼーション(特定領域への特化)が進み、汎用性が低下している
具体的には:
- プログラミング能力: 向上
- 複雑数学: 向上
- 言語品質: 停滞・悪化
- 基本論理: 停滞・悪化
なぜこんなことが起こるのか。強化学習(RL)が理由だ。RL は「報酬信号が明確な領域」でのみ効果的だ。コーディング、数学は採点しやすい。だが、言語の微妙なニュアンス、創造的問題解決は評価困難。結果、モデルはスコア可能な領域に「のめり込み」、他を放置する。
創造的推論への失敗
Google DeepMind の Tom Zahavy は、さらに根深い問題を指摘している:
言語モデルは演繹と帰納に優れるが、「先例のない原因を発明する能力」としての創造的推論に失敗している。
つまり、既存データから「学ぶ」ことは得意だが、「新しい発想を生み出す」ことは苦手ということ。これは LLM の本質的な限界かもしれない。
では、どう解くのか
Ho の答えは単純:訓練データの質と専門性を上げる。
彼は OpenAI を離れ、新会社を設立。戦略は以下の通り:
- バイオインフォマティクス用の専門化データセット構築
- 実験室作業(wet lab)の標準化されたデータ化
- 化学・材料科学・ヘルスケア領域への展開
つまり、「汎用 LLM」ではなく「領域特化モデル」に賭けるということだ。
なぜ $100 億なのか
Ho の予測は具体的だ。業界全体で、高質な訓練データの獲得・キュレーション・検証に $100 億以上 が投じられるようになるということ。
これは決して「大げさ」ではない。データセット構築には:
- 人間の専門家による annotation
- 品質検証プロセス
- 継続的な更新・拡張
という地道な作業が伴う。企業ごと、領域ごとに同じコストが重複する。業界全体では、確かに $100 億規模の投資が見込まれる。
AI 業界への含意
これまでの AI 競争は「パラメータサイズ」「計算量」を巡るものだった。でも、Ho の主張が正しければ、次の競争軸は「データの質」「キュレーション能力」 になる。
つまり:
- スケール企業の優位性が減少(Google、Meta は膨大なデータを持つが、「質」では劣る可能性)
- 専門家チーム力が価値化(領域知識を持つデータ科学者の価値上昇)
- 標準化されたデータセット市場の成長(業界データの売買、共有の拡大)
現在の兆候
実は、この転換は既に始まっている。
OpenAI の GPT-5.6 Luna への $0.20/百万トークン の値下げは、一見するとスケーリング戦略だが、実は「Sol で効率を確保した上で、Luna で汎用性より『高速・安価』を優先」という割り切りだ。高度な推論が必要なら Sol を選ぶ。つまり、「一つのモデルで全て」の時代は終わり、「タスク・予算に応じた多モデル使い分け」の時代へシフトしている。
Ho の $100 億予測は、この新時代の正体を言い当てたものだ。「高品質なデータ」が、次の AI 時代の新しい鉱脈になるということである。