Cloudflareは、文章を生成する通常のLLMとは異なり、あらかじめ決められた選択肢に確率を割り当てる「意思決定モデル」Clefと、その軽量版Clef-flashを発表した。Workers AIチームが自社開発した初のモデルで、Apache 2.0ライセンスのもとHugging Faceで重みが公開されており、クラウド経由でもオンプレミスでも利用できる。

想定する用途は、カスタマーサポートの問い合わせを緊急度別に振り分けたり、適切なチームへ自動的にルーティングしたりといった、AIエージェントが人の判断を介さずに構造化された意思決定を下す場面だ。

競合Jevを大きく上回る速度

性能面での最大の売りは速度だ。中央値のレイテンシーはClef-flashが39ミリ秒、Clefが209ミリ秒で、競合製品Jevの524ミリ秒以上を大きく下回る。Cloudflareによれば、43件のベンチマーク全てでJevより高速であり、Decision Indexと呼ばれる品質指標でもClefが61.2、Jevが57.9というスコアを記録した。

モデルはそれぞれQwen3.8-27B(Clef)、Qwen3.5-9B(Clef-flash)をベースに、RLCD(Reinforcement Learning for Calibrated Decisions)という手法で後段学習されている。テキストだけでなく画像も入力できる点はJevとの違いで、コンテキストウィンドウも64,000トークンとJevの2倍を確保した。価格はClefが入力100万トークンあたり0.24ドル、Clef-flashが0.09ドルとなっている。

開発者がすぐに使える設計

ClefはJevのAPI仕様と互換性があるため、既存の実装を大きく変えずに乗り換えられる点も特徴だ。Cloudflareは今回、強化学習による微調整プラットフォームも同時に発表しており、顧客は自社データを使ってClefを特定業務向けにチューニングできるようになる。初期段階ではCloudflareの専門チームがこの微調整作業を支援する計画だ。

モデルはWorkers AI上でホストされているため、エッジでの低遅延処理がそのまま使える。Hugging Faceからダウンロードしてローカルで動かすことも可能で、応答速度が求められる自動振り分けや不正検知などの実務アプリケーションに組み込みやすい設計になっている。