10月3日、The Decoderが「Cloudflare says its new Clef model means humans no longer need to be in the loop for AI agents」と題した記事を公開した。CloudflareがAIエージェント向けの新しい「決定モデル(decision model)」ClefおよびClef-flashをリリースし、人間を介さずにエージェントが自律的に意思決定できる仕組みを提供するというもので、速度面での優位性とベンチマーク結果が詳しく紹介されている。
人間なしで意思決定できるAIエージェントへ
Cloudflareが新モデルClefとClef-flashを公開した。これらは「決定モデル(decision model)」と呼ばれる種類のモデルで、長い文章を生成するのではなく、与えられた入力に対して複数の問いに同時回答し、それぞれの確率を返すのが特徴だ。
例えば、カスタマーサポートのメッセージが入力されると、「どのチームが担当すべきか(技術チーム: 100%)」「緊急度は高いか(高い: 100%)」といった分類結果を並列で出力する。下流のコードはその結果を使ってチケットのルーティングやエスカレーションを自動的に処理できる。
Cloudflareはこの仕組みについて「エージェントの意思決定に、もはや人間がループの中にいる必要はない」と述べており、エージェントは「コンテキストを収集し、意思決定し、アクションを実行するか、必要に応じて人間に委ねる」ことができるとしている。
モデル名「Clef(クレフ)」は音楽の「音部記号」に由来する。五線譜上の音の意味を定める音部記号のように、後続のアクションの枠組みを設定するという意味合いだ。
Clef-flashの応答は39ミリ秒
このカテゴリの先行製品として、元OpenAI研究員Diogo Almeida氏が創業したTypeSafe AIが2025年9月中旬にJevを投入している。Cloudflareは対抗軸として速度を前面に出す。
43のベンチマークにおいて、CloudflareはClefおよびClef-flashが関連する競合決定モデルすべてより高速だと報告している。具体的な中央値レイテンシは以下のとおり:
- Clef-flash:約39ミリ秒
- Clef:約209ミリ秒
- Jev:約524ミリ秒
Cloudflare自身のベンチマーク(Decision Indexスコア)では、ClefはJevより高い精度(61.2点 vs 57.9点)を示し、Clef-flashはJevとほぼ同等の精度(57.1点)を大幅に低いレイテンシで実現している。
ただし、ベンチマーク別に見ると結果は一様ではない。以下の比較表が示すとおり、When2CallではJevがClefを上回り、PhishNChipsではDiffusionGemma Jevが最高スコアを記録している。総合的な優位性はDecision Indexスコアと速度に基づくものであり、個別タスクによっては競合が上回るケースもある点に留意が必要だ。
| ベンチマーク | Clef | Clef-flash | Jev | DiffusionGemma Jev | Kev 9B | Laya |
|---|---|---|---|---|---|---|
| API Bank | 91.93 | 93.11 | 88.19 | 83.66 | 56.30 | 11.41 |
| When2Call | 72.37 | 65.58 | 80.97 | 75.44 | 49.62 | 11.94 |
| PhishNChips | 79.60 | 75.05 | 62.55 | 85.35 | 50.75 | 50.15 |
なお、Clefは画像も処理できる一方、Jevは現時点でテキストのみ対応。コンテキストウィンドウもClefが64,000トークンと、Jevの2倍の容量を持つ。
また、CloudflareはすでにClefを自社の脅威インテリジェンスチームのWebサイト分類に試験的に使っており、あるドメインに対して「ファッション系サイト: 95%」「オンラインストア: 85%」「フィッシングサイト: 1%未満」という結果を返した例を示した。取得・レンダリング・分類の全工程で2.2秒かかったのに対し、汎用言語モデルでは4.7秒かかり、返せるカテゴリ数も2つだけだったという。
Qwen3ベースのモデル構成とカスタマイズ機能
ClefのベースモデルはQwen3.8-27B、Clef-flashはQwen3.5-9Bだ(元記事の表記に準拠しているが、一般的なQwenの命名規則であるQwen3-8BやQwen2.5-9Bとは異なる表記であるため、詳細はCloudflareの公式情報を参照されたい)。Cloudflareは基盤モデルの重みは変更せず、独自の合成データで追加コンポーネントを訓練する手法を採った。このコンポーネントがモデルの内部計算から選択肢と確率を導出する。
訓練手法には、TypeSafe AIがJevの訓練に用いたRLCD(Reinforcement Learning for Calibrated Decisions)の独自変種を採用している(リンク先のarXiv IDは元記事に準拠しているが、フォーマットが通常のYYMM.NNNNN形式と異なるため、参照の際は確認を推奨する)。RLCDは1回の呼び出しで複数の問いに答えさせながら、確率が実際の正答率と一致するよう(較正されるよう)モデルを訓練する手法だ。
カスタマイズ面では、ユーザーが自分のタスク向けにClefをファインチューニングできる強化学習サービスも同時に展開する。当初は専任エンジニアチームが顧客と一緒に対応し、後日セルフサービスのプラットフォームに移行する計画だ。ファインチューニングのパイプラインはAI Gatewayでのリクエスト記録→コンテナ上でのRL学習→Workers AIへのデプロイという流れで、カスタムモデルの実行には2025年末に買収したReplicateの技術が使われる。
ClefおよびClef-flashはWorkers AI上で稼働しており、Apache-2.0ライセンスでHugging Faceからも入手可能だ。
なお、決定モデルというカテゴリではTypeSafe AIのJevが先行し、2025年9月末にはOpenAIもGPT-6 LunaをベースにしたDecisions APIを投入しており、主要プレイヤーが出揃いつつある。CloudflareはJevとのAPI互換性を維持しており、既存ユーザーが乗り換えやすい設計にしている点も差別化要因の一つだ。
詳細はCloudflare says its new Clef model means humans no longer need to be in the loop for AI agentsを参照していただきたい。
