10月1日、Daniel Curtisが「TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Text」と題した記事を公開した。元OpenAI研究者が設立したTypeSafe AIが、テキストではなく型付き確率を返す決定専用モデル「Jev」をリリースした。テキスト生成を一切行わず、分類・スコアリング・ルーティングに特化するというアーキテクチャの根本的な違いが、リリース翌日にVercelの有料チームの13%が導入するという異例の速度で広がる背景にある。
LLMではなく「決定機械」を作った
TypeSafe AIが公開したJevは、テキストを生成しない。代わりに、型付きの確率的な決定を返す。
通常のLLMは「はい」「いいえ」「おそらく」といった自然言語を返し、呼び出し元のコードがそれをパースして判断する。Jevはその構造を逆転させる。呼び出し元が「状態(文字列または構造化データ)」と「型付きの質問群」を渡すと、Jevは単一の並列パスでそれらを一括評価し、Choice(選択)、Score(スコア)、Noul(null可能な値)の形式で確率分布と確信度を返す。呼び出し元はしきい値以上なら処理を続行し、以下ならエスカレーションするという設計になる。
料金体系も特徴的で、入力は100万トークンあたり$0.042、出力は無料。コンテキストウィンドウは32,000トークン、エンドツーエンドレイテンシの公称値は70ms〜500msとされている。学習手法には「Reinforcement Learning for Calibrated Decisions」と呼ばれる独自手法を用いている。
TypeSafe AIはサンフランシスコを拠点とするAIラボで、共同創設者のDiogo Almeida氏はRLHFの共同発明者であり、ChatGPTの研究に携わった人物だ。
「確率を返す」ことの意味
LLMで分類タスクを行う場合、一般的にはプロンプトで「YesかNoで答えろ」と指示し、出力をパースする。ただし確信度の情報は失われることが多い。
Jevが返す確率分布はその問題への直接的な解答だ。Bryo AIのCTO Nikhil Mudholkar氏は、Gmailの分類精度ではGeminiがやや上回るものの10〜20倍高コストであると指摘しつつ、「Jevだけが実際の確率を返してくれる」と評価した。
一方、EarendilのCTO Armin Ronacher氏は元記事中で、この設計は「ハルシネーション問題をある程度ユーザーに委ねている」と指摘した。50%の確率をどう扱うかは呼び出し元が判断しなければならない、という意味だ。
Hacker Newsでは、あるデベロッパーがより本質的な批判を提起している:
まず、本当に新しいものをリリースしたチームに祝福を。
ただ「ハルシネーションしない」という主張は正確ではないのでは? 確かに不正な型を出力することはできないが、完全に間違った正しい型の値を出力することは可能だ。LLMでも適切なハーネスを使えば構造化出力を強制できる。Jevは分類・ルーティング・スコアリングには非常に便利だろうが、今日私たちがコードや自動化に使っているコード生成モデルとは全く別物だ。
このコメントは本質を突いている。Jevは汎用生成モデルの代替ではなく、分類・スコアリング・ルーティングに特化したモデルとして評価すべきものだ。
採用状況と実測値
Vercelはリリース翌日にJevをAI Gatewayに追加した。24時間以内に**有料チームの約13%**が導入したという。NetlifyもJevを追加し、LangChainはTypeSafeClassifier統合とモデルルーティング、ツール呼び出し前にスクリーニングするAutoModeミドルウェアを公開した。ElixirコミュニティでもJev向けクライアントが数日で5件登場している。
実測値については、OpenChamberが12,759件のローンチツイートを分析した結果、ユーザー報告のスピードアップの中央値は7倍(公称値193.6倍に対して)、コスト削減の中央値は30倍、レイテンシの実測中央値は76ms(上位四分位は270ms)だった。タイトルの「76ms」はこの実測中央値を指しており、公称値の70ms〜500msとは出典が異なる点に留意したい。
Vercelのエンジニア Pranit Sharma氏は、安全性分類器がそれまで使っていたLLMと比べて5〜18倍高速で動作したと報告している。
Redditでは、あるデベロッパーが200〜300msのレイテンシでのエージェント用途に「absolutely insane(最高すぎる)」と書き込んでいる。
使用上の注意点
公式ドキュメントのjaggedness(モデルの不安定領域)ページには、カウント・算術演算・日付比較が不安定であること、大きなノイズの多い入力では精度が落ちることが明記されており、数値処理はコード側で行うよう推奨されている。
バージョン指定はjev-latestやjev-previewといった可変エイリアスではなく、jev-1.13.0のように固定バージョンを使うことが推奨されている。ベンチマーク時にはSystem One adapterを使うと既存モデルと同じスキーマで比較できる。導入は公式クイックスタートから始められる。
詳細はTypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of Textを参照していただきたい。