Anthropic が Claude Sonnet 5 をリリース、エージェンティック機能で Opus と同等性能を低価格実現
Anthropic は Claude Sonnet 5 をリリース。前モデル Sonnet 4.6 から大幅に向上し、Opus 4.8 と同等の性能を実現。複雑なツール利用・推論・コード作成に対応。導入期間は入力 $2/M トークンという破格の価格設定。
Anthropic は 6 月 30 日、新しい中規模モデル「Claude Sonnet 5」をリリースした。同社は本モデルを「これまで最もエージェンティックな Sonnet である」と位置付けており、ソフトウェア開発やツール利用、複雑な推論で前世代を大きく上回る性能を実現している。ブラウザやターミナルなどを自律的に操作する能力を持ち、これまで大型で高価なモデルが必要だったタスクを低コストで処理できる時代が到来した。
性能の大幅な向上
Claude Sonnet 5 は前世代モデル「Sonnet 4.6」から顕著な性能向上を達成している。エージェンティックタスクの指標となるベンチマークで、特にコード実行能力を示す「Terminal-Bench 2.1」では 80.4%(前モデル比 13.4 ポイント向上)、ソフトウェア開発全般の「SWE-bench Pro」では 63.2%(5.1 ポイント向上)という成績を記録した。
特筆すべきは、知識作業能力を測定する「GDPval-AA v2」で 1,618 ポイントを達成し、より高価な上位モデル「Opus 4.8」の 1,615 ポイントを上回った点である。高度な推論問題「Humanity’s Last Exam」でも 57.4%を達成し、Opus 4.8 の 57.9%に迫る性能を示している。これは Sonnet グレードのモデルが初めて Opus 級の性能に到達したことを意味する。
エージェンティック機能への最適化
Claude Sonnet 5 は複数段階のタスク自動実行に最適化されている。ブラウザやターミナルなどのツールを明示的な指示なしに自動選択し、複数の作業を自力で完走できる。また、生成した出力の検証を自動的に行い、エラーや矛盾を自己訂正する能力を備えている。
これらの能力により、営業管理システムの更新と顧客への通知を同時実行する、データ分析から報告書作成まで一貫して処理するなど、従来は人間が各ステップを監督する必要があったワークフロー全体を、モデルが自律的に遂行可能になった。
価格体系と利用範囲
Anthropic は導入期間として 2026 年 8 月 31 日までの限定価格を設定している。この期間、入力トークンは 100 万あたり 2 ドルと、通常価格(3 ドル)から 33% 割引された価格で提供される。出力トークンは 10 ドル(標準価格は 15 ドル)で同様に割引設定だ。
9 月 1 日以降は標準価格に引き上げられるものの、Opus 4.8、GPT-5.5、Gemini 3.1 Pro といった競合製品より一貫して廉価である。Anthropic は「モデルが自律的に動作するため、タスクあたりのトークン消費量が増加する可能性がある」と指摘しており、実際の利用コストは単価以上の配慮が必要だ。
Claude Sonnet 5 はすべての Anthropic プラットフォームで利用可能だ。Free・Pro プランでデフォルトモデルとなり、Claude Code や Claude API(claude-sonnet-5)でも利用可能。Max・Team・Enterprise ユーザーにも即座にアクセスできる。
市場への影響と業界シフト
Claude Sonnet 5 の登場は AI エージェント市場に構造的な変化をもたらす。性能比較が「最高性能」から「性能とコスト効率のバランス」へシフトしており、企業が採用する判断基準が変わり始めている。
開発ツール企業 Zapier のシニアエンジニアは「日々のオートメーションにおいて必須の選択肢」と評価し、自動化ツール開発での採用を想定している。これは単なる「性能が上がった」のではなく、コスト制約のある本運用環境で実用的なエージェント機能を初めて提供する転機を示唆している。
一方で、OpenAI・Google・他の競合企業もエージェンティック機能を重視した開発競争に加速している。中規模モデルの性能上昇とコスト低下は、生成 AI の利用形態を「質問応答」から「自動実行」へ転換させ、企業のワークフロー自動化投資を急速に拡大させるだろう。
【アップデート】実質コストの上昇――トークン消費量分析
リリース後の詳細分析により、Claude Sonnet 5 の実質的な利用コストがトークンレート据え置きながら大幅に上昇していることが判明しました。
表面的な価格と実質コストの乖離
Anthropic の公式な単価設定(入力 $3/百万トークン、出力 $15/百万トークン)は前モデル Sonnet 4.6 と同一です。しかし、実測データでは以下の乖離が発生:
- タスクあたりの出力トークン消費量:約 40% 増加
- エージェントループの実行回数:平均 3 倍(複数試行による最適化)
- 結果:実際のコスト/タスク:Sonnet 4.6 の $1.20 から $2.29 へ倍増近く
トークンレート上は「同一価格」ですが、実際のコスト効率では Opus 4.8 と変わらなくなる場合もあります。
技術的背景
Anthropic の声明で示唆されていた「タスクあたりのトークン消費量が増加する可能性」は、実装の段階で実際に発生していました。エージェンティック機能の最適化により、Claude Sonnet 5 は以下の行動パターンを示します:
- 初回試行の出力長増加:タスク詳細の理解が深いため、各ステップで冗長な解説やコンテキスト保持が増加
- 検証ループの多層化:自己訂正メカニズムが複数回実行され、出力が追加される
- プロンプト拡張:ツール利用時に内部プロンプトが自動拡張
これらはすべて正当な技術的選択ですが、ユーザーが想定する「低価格エージェント」という売却メッセージとは乖離しています。
業界へのメッセージ
この事例は Anthropic の「価格戦略の透明性」に対する懸念を高めます。同様に OpenAI(GPT-5.5 のプロンプト長制限)や Google(Gemini のトークン削減施策)も、表面上の単価を据え置きながら実質的なコスト構造を変更する傾向が報告されています。ユーザーが実利用コストを予測するには、単価だけでなく「実測ベンチマーク」に基づく選択が必須となっています。