9月26日、Paul Nashawaty が「Subconscious Raises $5.1M for AI Agent Inference Efficiency」と題した記事を公開した。この記事では、AIエージェントの推論コストを最大80%削減するインフラ基盤を開発するスタートアップ「Subconscious」が510万ドルの資金調達を完了したことについて詳しく紹介されている。
月4万ドルの請求書を6,000ドルに
AIエージェントを本番環境で動かしたことがある開発者なら、トークンコストの膨張は既知の問題だ。Subconsciousが公開した事例はその規模を具体的に示している。
20人規模のエンジニアリングチームが、コーディングエージェントをClaude上で運用したところ、月間のAIコストは4万ドルに達していた。同チームがSubconsciousのホスティング上でオープンウェイトモデルに切り替えた結果、コストは6,000ドルまで下がった。85%減だ。これは元記事で紹介されている単一の事例に基づく数字であり、すべての環境で同様の削減率を保証するものではない。
さらに個別のトレースでも同様の傾向が示されている。あるエージェントが4,571ターン、9,556回のツール呼び出しに及ぶ長大なタスクを実行した際、通常のインフラであれば26億トークンが課金される計算になる。Subconsciousでは4億4,900万トークン(82%削減)だった。
この数字は合成ベンチマークではなく、実運用環境から得たものだと記事は強調している。
何をしているのか:推論層での動的コンテキスト圧縮
Subconsciousの核心は動的コンテキスト圧縮(dynamic context compression)だ。モデル本体やアプリケーションコードへの変更なしに、推論レイヤーでコンテキストウィンドウのトークンを削減する。
重要なのは、圧縮しても精度が落ちないどころか、わずかに向上している点だ。DeepSWEベンチマーク(実際のGitHubリポジトリを用いたソフトウェアエンジニアリングタスクでコーディングエージェントの性能を評価する指標)での結果は以下の通りだ。
| 環境 | スコア | タスク単価 |
|---|---|---|
| 標準インフラ | 44% | $3.92 |
| Subconscious | 46% | $2.79 |
長いトレースではコンテキストにノイズが蓄積しやすく、圧縮がそのノイズを除去することで精度が改善したと考えられる。
また、コンテキストウィンドウを500万トークン超まで拡張でき、SGLang比でタスク完了が2倍速く、同時リクエスト数が2.3倍(TriEベンチマーク)という結果も公開している。同時リクエスト数の改善は、複数エージェントを並列実行するプラットフォームチームにとって直接的なGPUコスト削減に効く。
競合との立ち位置
推論最適化の領域にはvLLMやSGLangといった既存OSSが存在する。Subconsciousが差別化として打ち出すのは「汎用推論サーバーではなく、長期・高ターン数のエージェントワークロードに特化した設計」だという点だ。
CEOのJack O'Brienは、オープンモデルが「今夏ようやく十分な品質に達した」とコメントしている。フロンティアモデルのAPI料金を払い続ける代わりに、オープンウェイトモデルを最適化された推論基盤で動かすという選択肢が現実的になりつつある。Subconsciousはそのトレードオフを成立させる性能レイヤーとして位置づけている。
エアギャップ環境対応という差別化
もう一つ見落とせない機能がオンプレミス・エアギャップ対応だ。トークンを外部クラウドエンドポイントに送らず、閉じた環境内に推論最適化レイヤーをデプロイできる。
ECI Researchの調査では、政府・規制業種の回答者の46.9%が接続・非接続の混在環境で、24.9%が主にエアギャップ環境で業務を行っていると報告されている。機密性の高いワークロードでSaaS型AIエンドポイントが使えない組織にとって、これは商業的にも技術的にも意味のある選択肢になる。
今後の焦点
今回の資金調達ラウンドはMassVentures(マサチューセッツ州政府系のベンチャー投資機関)がリードし、Foothill Ventures、Underscore VC、E14 Fund(MITのスタートアップ支援プログラム「E14」に紐づく投資ファンド)などが参加した。プレシードとシードを合わせて510万ドル。Subconsciousは同じくMIT発のスタートアップであり、E14 Fundの参加はその研究的背景とも符合する。
推論最適化自体は長期的な防御壁にはなりにくい。モデルプロバイダー側でのコスト効率改善も進んでいるためだ。記事では、実質的なロックインはエージェントフレームワークや開発ツールとの深い統合から生まれると分析しており、30秒でセットアップできるCLIオンボーディングがその入口として戦略的重要性を持つと指摘している。
詳細はSubconscious Raises $5.1M for AI Agent Inference Efficiencyを参照していただきたい。