AIエージェントが「月1,000回呼ばれる」ようなシステムを構築するとき、モデルの選び方はコストに直結する。2026年10月、AnthropicがClaude Haiku 5.5を発表し、APIの価格を前モデル比で最大90%引き下げた。同時期にOpenAIのGPT-6 Luna、GoogleのGemini Flash Liteも軽量・低価格帯で存在感を増している。価格競争が加速するいま、どのAPIをどう選ぶかを整理した。

Claude Haiku 5.5とは何か

Haiku 5.5はAnthropicの軽量・高速モデルで、上位のSonnetやOpusを補佐する位置づけだ。対象ユースケースは、要約、分類、データベース照会、エージェントの中継処理など、「大量に反復する軽めのタスク」。Sonnetで深く考える必要はないが、毎秒何十件も捌く必要があるような場面に向いている。

性能面では前世代(Haiku 4.5)から大幅に向上した。Anthropicが公開したベンチマークによると、知識業務の評価(GDPval-AA v2.1)ではHaiku 4.5の735に対してHaiku 5.5は1,620と2倍超のスコアを叩き出している。PC操作の評価(OSWorld 2.1)でも15.7%から72.4%へと急伸しており、エージェント型タスクへの対応力が格段に上がっている。

新機能として「effortレベル」が加わった。medium(デフォルト)、low、highから選択でき、タスクの複雑さに応じて推論の深さを調整できる。より速く・より安く処理したいときはlowに、精度を求めるときはhighに切り替えるだけだ。

価格の変化:何がどれだけ安くなったか

価格変更の核心は、100,000トークン未満のリクエストで約90%の値下げという点だ。

モデル入力(/1Mトークン)出力(/1Mトークン)
Haiku 4.5(旧)$1.00$5.00
Haiku 5.5(10万トークン未満)$0.10$0.50
Haiku 5.5(10万トークン以上)$0.50$2.50

リクエストの約90%は短い区分(10万トークン未満)に収まるとAnthropicは説明している。単純計算で、従来と同じ量のリクエストをすべてHaiku 5.5に切り替えると、コストはおよそ75%削減できる見込みだ。

なお「10万トークン」というのはプロンプト+レスポンス合計のトークン数ではなく、1リクエストのコンテキスト長を指す。新しいトークナイザーが採用されており、同じ文章でも以前よりトークン数が若干増えるため、実際の削減率は計算上の90%を若干下回る可能性がある点は留意したい。

競合モデルとの価格比較

同時期にOpenAIとGoogleも軽量モデルを投入しており、価格競争は激化している。

モデル入力(/1Mトークン)出力(/1Mトークン)
Claude Haiku 5.5(短い区分)$0.10$0.50
OpenAI GPT-6 Luna$0.10$0.50
Google Gemini 3.5 Flash-Lite$0.30$2.50
Google Gemini 3.8 Flash$0.75$3.75
Claude Sonnet 5.5$2.00$10.00

Haiku 5.5とGPT-6 Lunaは入出力ともに同一の価格に揃えてきた。Gemini Flash-LiteはHaikuより入力が高く出力がやや割高で、Gemini 3.8 Flashはさらに上の価格帯だ。

ただし注意が必要なのは、価格が同じでも性能は異なるという点だ。Anthropicのベンチマーク(あくまで自社発表値)では、Haiku 5.5はGPT-6 Lunaを知識業務・エージェント系タスクで上回っているとされるが、独立した第三者検証はまだ少ない。価格表だけで判断するのではなく、自社のワークロードで実際に試してみることが不可欠だ。

性能でどう変わったか:旧Haiku 4.5との比較

Haiku 5.5がHaiku 4.5とどれほど違うかを見ると、単純なアップデートではないことがわかる。

評価指標Haiku 4.5Haiku 5.5GPT-6 Luna
知識業務(GDPval-AA v2.1)7351,6201,437
知識業務(AA-Briefcase v1.1)6141,5781,336
PC操作(OSWorld 2.1)15.7%72.4%48.9%
エージェント型コーディング(Terminal-Bench 4.0)0.0%39.2%16.4%

Terminal-Benchのゼロから39.2%への飛躍が象徴的だ。Haiku 4.5では事実上不可能だったエージェント型のコーディングタスクが、5.5では現実的な選択肢になってきた。もちろん上位のSonnet 5.5(70.6%)には届かないが、コスト差を考えれば「まずHaikuで試してみる」という戦略が成り立つ。

どんな用途に使うべきか

Haiku 5.5が本領を発揮するのは次のようなケースだ。

向いている用途

  • 大量のテキスト分類・ラベリング(問い合わせカテゴリ分け、感情分析など)
  • 短い要約・抽出タスク(ニュース見出し生成、キーワード抽出)
  • エージェントのルーティング処理(どのツールを呼ぶか判断するだけのステップ)
  • チャットボットのファーストレスポンス(簡単な質問を捌き、複雑なものをSonnetへ渡す)
  • 大量データのバッチ処理

Sonnet/Opusが必要な用途

  • 複雑なコーディング・デバッグ(FrontierCode等のベンチマークではSonnet 5.5が52.1%対Haiku 5.5の46.4%)
  • 長文の文書生成・編集
  • 多段階の推論が必要なエージェントの主要ステップ
  • 高精度が求められる医療・法律・金融など

実際の導入例として、Box社はHaiku 4.5比で精度11ポイント改善しつつレイテンシを約半減と報告し、Asana社はタスク完了のレイテンシが30%以上短縮したとしている(いずれも比較対象の詳細は非公開)。

Haiku 5.5への移行方法

APIのモデル識別子を変更するだけで切り替えられる。

import anthropic

client = anthropic.Anthropic()

message = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=1024,
    messages=[
        {"role": "user", "content": "この文章を100字で要約してください。"}
    ]
)

effortレベルを指定する場合は次のように書く。

message = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=1024,
    thinking={"type": "enabled", "budget_tokens": 1000},
    messages=[...]
)

なお、セキュリティ設定がHaiku 4.5より厳しくなっており、ペネトレーションテストや生物学関連の用途は標準の安全対策でブロックされる。こうしたユースケースでは別途検証プログラムへの申請が必要になる。

Sonnet 5.5のキャッシュ価格も変更

Haiku 5.5のリリースと合わせて、上位モデルのSonnet 5.5についてもキャッシュ読み取り価格が変更された。

  • 旧: $0.20/1Mトークン
  • 新: $0.10/1Mトークン(50%引き)

エージェントが同じシステムプロンプトやコンテキストを何度も参照するケースでは、キャッシュの再利用が多いほど恩恵が大きい。Anthropicによれば、典型的なエージェント業務で約20%のコスト削減になるという。

API毎月クレジットの配布開始

同週からAnthropicはAPIクレジットの毎月配布を開始した。

  • Max 5x: 月$100
  • Max 20x: 月$200
  • Team(全員合計): 最大$500

全モデルで利用できるため、Haiku 5.5でコストを試算しながら本番投入前にシステムを検証するのに使える。

まとめ:エージェント時代のAPI選び

AIエージェントが社内システムの各所に組み込まれていく2026年後半、API価格はシステムの総コストに直接影響する。重要なのは「最高性能のモデルを使えばいい」という発想から「タスクに応じてモデルを使い分ける」発想への転換だ。

  • ルーティング・分類・要約など大量・反復タスク → Haiku 5.5
  • 複雑な推論・コーディング・長文生成 → Sonnet 5.5
  • 最高精度が必要な判断 → Opus(ファストモード)

Claude Haiku 5.5とGPT-6 Lunaが同じ価格水準で競合するなか、どちらが自社ワークロードに合っているかは実際に試してみるしかない。幸いなことに、月$100〜$200のAPIクレジットがあれば十分な試験ができる。まずは小さなタスクから始めて、精度とコストのバランスを確かめてみよう。