xAI、格安価格の「Grok 4.7」公開、ベンチマークではClaudeとGPT-6に大差
xAIが新モデル「Grok 4.7」を発表した。入力100万トークン2ドルと価格競争力は高いが、総合知能指数はClaude Fable 5.1・GPT-6の53点に対し46点にとどまり、特にエージェント型コーディングで大きく差をつけられた。
イーロン・マスク氏率いるxAIが、新モデル「Grok 4.7」を公開した。同社は「コーディングと知識作業に対応した最も能力の高いモデル」と位置づけているが、第三者機関のベンチマークでは、Claude Fable 5.1やGPT-6に大きく水をあけられる結果となった。
価格は破格、性能は中位
Grok 4.7の価格は入力トークン100万当たり2ドル、出力トークン100万当たり6ドル。西側の最先端モデルというより、中国製モデルに近い価格帯を採用している。
一方、Artificial Analysis Intelligence Index(v4.3.2)での総合スコアは46点。655種類のモデル中16位にランクインし、同価格帯モデルの中央値(11点)は大きく上回ったものの、Claude Fable 5.1とGPT-6のそれぞれ53点には届かなかった。コンテキストウィンドウは50万トークンで、テキスト・画像入力とテキスト出力に対応する推論モデルだ。
エージェント型コーディングで差が拡大
性能差がより顕著に表れたのが、エージェント型コーディングの実力を測るTerminal-Bench 4.0だ。Grok 4.7のスコアは26%にとどまり、GPT-6 Astraの60%、Claude Fable 5.1の55%と比べて半分以下の水準にとどまっている。
xAIはこれまでも積極的な価格戦略で市場シェアの拡大を狙ってきたが、開発者が最も重視する実務性能、特にコーディングタスクでの遅れが今回の結果で改めて浮き彫りになった形だ。
読者への影響
Grok 4.7は入力・出力コストの安さから、大量のリクエストを処理する用途では依然として選択肢になり得る。しかし、コーディングエージェントとしての精度を重視する開発者にとっては、価格差を性能差が上回る場面が多く、Claude FableやGPT-6を選ぶ理由は引き続き強い。モデル選定の際は、単純な価格比較だけでなく、実際に使うタスクの種類に応じたベンチマークを確認することが重要になる。