NvidiaのSoL-Pi、コーディングエージェントのハーネス最適化でトークン消費を半減
Nvidia研究チームが開発したSoL-Piは、AIエージェントとツールをつなぐ「ハーネス」層を自動最適化し、Codex・Claude Code比で最大54%のトークン削減を達成した。モデル自体は変更していない。
Nvidiaの研究チームが開発した「SoL-Pi」は、コーディングエージェントが消費するトークン量を大幅に削減するシステムだ。モデル自体には手を加えず、エージェントと開発環境をつなぐ「ハーネス」層を自動最適化することで、CodexやClaude Codeと比較して最大54.3%のトークン削減を実現したという。
モデルではなく「ハーネス」を最適化する発想
ハーネスとは、AIモデルがファイル編集やコマンド実行などの操作を行う際に、モデルと実行環境の間を仲介する制御層を指す。多くのコーディングエージェントの改善はモデル自体の性能向上に焦点を当てがちだが、SoL-Piはこの仲介層の設計を自動探索することで効率を引き上げるアプローチを取る。
研究チームは535の実行環境で152通りの最適化方向を試し、3,000件以上の実行と6万件を超えるエージェント・環境間のやり取りを生成して、有効な手法を絞り込んだ。最終的に採用されたのは以下の4つのメカニズムだ。
採用された4つのメカニズム
1つ目の「Action Fusion」は、ファイル編集とその後のコマンド実行を1回のリクエストにまとめる。2つ目の「Online Context Compact」は、計画の1ステップが完了するたびにコンテキストを圧縮すべきか評価する。3つ目の「ObservationPack」は、長いツール出力を安定した参照ハンドルに置き換えて保持する。4つ目の「Evidence-Preserving Reducer」は、安価なモデルを使ってビルドログやテストログを圧縮する。
ベンチマークでの数字
51タスクからなる「EdgeBench」でのGPT-5.6 Sol実装の比較では、SoL-Piの効率重視構成はCodexの総トークン数(30億5,370万)に対して10億9,900万まで削減し、APIコストも1,787ドルから894ドルへとほぼ半減した。ただし平均スコアはCodexの34.738に対し42.003で、比較対象のPi(44.833)をやや下回る場面もある。
性能重視の構成ではAPIコスト1,271ドルでスコア47.208を記録し、コストと精度のバランスを取る選択肢も用意されている。GPT-5.6 Sol向けに開発したハーネスをClaude Opus 5にそのまま転用した場合でも、Pi比でトークン44.7%減・APIコスト33.5%減を達成し、性能は94.3%を維持した。モデルに依存しない設計であることが示された形だ。
Terminal-Bench 4(63のCPU専用タスク)ではPi比で総コスト26.3%減(286.45ドルから211.12ドルへ)、20エージェントによるマルチエージェント実験でもPiベースライン比で26.8%のAPIコスト削減が確認されている。
読者への影響
コーディングエージェントを日常的に使う開発者にとって、トークン消費量はそのままコストに直結する。SoL-Piの手法自体はNvidiaの研究プロトタイプであり、今すぐCodexやClaude Codeに組み込まれるわけではないが、モデルを変えずにハーネス側の工夫だけでコストを半減できるという結果は、既存のエージェントツールの実装方法を見直す動機になり得る。一方で、コンテキスト圧縮によってユーザーの元の指示が平均17%しか保持されないケースがあるとの指摘もあり、圧縮とプロンプトキャッシュの再利用効率にはトレードオフが残る。