10月1日、The Newsが「OpenAI's new API to give AI agents a watchdog」と題した記事を公開した。AIエージェントの各アクションをフロンティアモデルで監視すると約$372かかるコストが、専用の分類モデルを使うと約$2.94——127分の1以下——に抑えられるという具体的な数字が、OpenAIの新API「Decisions API」への注目を集めている。
コスト差が浮き彫りにする課題:$372 vs $2.94
AIエージェントがWeb上で自律的に作業する場面を想像してほしい。ファイルを開く、リンクをクリックする、フォームを送信する——こういった一つひとつのアクションについて「これは安全か?」を判断するたびにフロンティアモデルを呼び出していては、コストが膨大になる。
サイバーセキュリティスタートアップのQueryStory創業者Shapor Naghibzadehは、この課題を具体的な数字で示した。エージェントの各アクションを監視するデモアプリを構築し、フロンティアモデルを使った場合の監視コストは約$372だったのに対し、高速分類モデルを使うと約$2.94で済んだという。約127分の1のコスト差だ。
このデモでは、監視モデルが各アクションを3種類に分類する:
- 明らかに危険なアクション → 即座にブロック
- 疑わしいアクション → 人間に判断を委ねる
- その他 → そのまま実行を許可
OpenAI自身も、エージェントが予期しない挙動を起こした事例を受けて、別のモデルでエージェントの行動を監視する手法を採用していると述べている。ただし「相当な計算コストがかかる」とも認めており、Decisions APIはその解決策の一つになりうる。
AIエージェントの「番犬」、Decisions APIとは
こうしたコスト問題への対応として、OpenAIがテスト中なのがDecisions APIだ。AIエージェントが下す個々の判断を、大規模言語モデル(LLM)全体を使わずに処理するための仕組みである。
通常のLLMは、質問に対してテキストを生成する形で応答する。これは柔軟性が高い反面、「画像をどのカテゴリに分類するか」「次にどのアクションを選ぶか」といった単純な二択・多択の判断にも同じコストがかかる。Decisions APIはこれを解決するアプローチで、あらかじめ定義された選択肢の中から一つを選ぶという処理に特化している。
CEOのSam Altmanによれば、このAPIは特定の判断に集中することでモデルを高速化しつつ、画像理解・多言語対応・安全フィルタといった能力は引き続き利用できるという。
現時点では限定プレビューとしてのみ提供されており、一般公開のスケジュールや詳細なパフォーマンス指標はまだ明らかになっていない。なお、元記事ではこのAPIの発表がどのイベントや文脈で行われたかは明記されていない。
TypeSafe AIのJevとの類似性
Decisions APIのアーキテクチャは、TypeSafe AIが開発したJevと似たアプローチをとっている。JevはLLMのように長いテキストを出力するのではなく、各選択肢に確率値を割り当てる高速分類器として設計されたモデルだ。前述のNaghibzadehのデモで$2.94という低コストを実現したのも、このJevを使った実装によるものである。
TypeSafe AIのCEOであるDiogo Almeida(元OpenAIエンジニア)は、OpenAIがこの領域に参入してきた事実は、こうしたソリューションへの需要が高まっていることの表れだと見ている。
Decisions APIが実際にJevや類似システムと同等のパフォーマンスを発揮するかどうかは、現時点では不明だ。
エンジニア視点での整理
AIエージェント開発において、「すべての判断にLLMを使う」設計はスケールしない。大きなモデルと、単純なタスクを担う小さな特化モデルを組み合わせるアーキテクチャはすでに一般的になりつつあるが、OpenAIがそのための専用APIを公式に提供し始めた点は、エージェント開発のプラクティスに影響を与える可能性がある。
限定プレビュー期間中の動向と、正式公開後のパフォーマンス・価格体系に注目したい。
詳細はOpenAI's new API to give AI agents a watchdogを参照していただきたい。