9月25日、TechTargetが「Anthropic, OpenAI launches show shift toward multi-model enterprise AI」と題した記事を公開した。主要AIプロバイダーが「最強のフラッグシップモデル1本」を競う時代は終わりを迎えつつある——OpenAIとAnthropicによる相次ぐ新モデルリリースを受け、エンタープライズAIはマルチモデル運用へと構造的にシフトしている。この記事では、その現状と設計上の要点について詳しく紹介されている。
「どのモデルを使うか」から「どう管理するか」へ
AnthropicとOpenAIはそれぞれ新モデル群をリリースした。元記事によれば、各プロバイダーは価格帯・性能・専門性の異なる複数モデルをラインナップとして揃え始めており、「1社1モデル」から「ポートフォリオ型」への移行が鮮明になっている。
※なお、本記事内のモデル名については元記事の記載に基づいているが、一部モデルについては元記事で実在が確認できなかったため、モデル名の記載を省略している。
エンタープライズ向けパーソナライズAIを手がけるGlokal AIのCTO、Jeet Pattanaik氏はこう指摘する。
「意思決定の軸が、調達からアーキテクチャに移っている。組織全体で1つのモデルを選ぶのではなく、ITチームはワークロードごとに適切なモデルを判断し、プロバイダーが新モデルをリリースするたびにその判断を見直す必要がある」
必ずしも企業がマルチモデル戦略を意図して採用しているわけではない、という点も重要だ。各チームが個別にプロバイダーを選び、後からオーケストレーションやガバナンスが追加される形で、気づけばモデルのポートフォリオが出来上がっているケースも多いという。
現場での実例:Palo Alto Networksの「モデル選択型」サイバーセキュリティ
マルチモデル化の具体的な事例として記事が挙げているのが、Palo Alto Networksのサイバーセキュリティサービスだ。AnthropicおよびOpenAIのモデルとオープンウェイトモデルを組み合わせ、セキュリティタスクごとに使用モデルを動的に切り替える構成を取っている。
この背景にある問題意識は、単一モデルへの依存リスクだ。元記事ではPalo Alto Networksの事例としてマルチモデルによる脆弱性検出の補完効果が紹介されているが、具体的な数値については元記事の該当箇所を直接確認していただきたい。複数モデルを組み合わせることで、それぞれが見逃した脆弱性を補完し合えるという考え方は、セキュリティ領域でのマルチモデル採用を後押しする根拠となっている。
Salesforceも同様の方向性で、AgentforceなどのプラットフォームでNvidiaとの連携を通じてオープンモデルを組み込み、複数プロバイダーのモデルを使い分けられる環境を整備している。
モデル選定の優先順位:まずデータ感度から
マルチモデル環境の管理において、Pattanaik氏が提示する選定の優先順位は明確だ。
- データ感度(利用できるモデルを絞り込む)
- 信頼性・レイテンシ
- 能力とコスト(要件を満たす最安モデルを選ぶ)
実際の運用イメージとしては、複雑な推論やコーディングには高性能モデルを使い、大量の要約・分類・抽出タスクには安価で高速なモデルを充てるといった形になる。OpenAIが新モデルに設定した価格体系は、こうした使い分けをより現実的なものにしている。
エンジニアが押さえるべき設計の要点:オーケストレーション層と抽象化
マルチモデル環境を機能させるために必要なのが、アプリケーションとモデルの間に置くオーケストレーション層(AIオーケストレーション)だ。タスク・必要な能力・データの制約などに基づいて、各リクエストに適したモデルを動的に振り分ける役割を担う。この層があることで、モデルごとのパフォーマンス比較やトレース、ガバナンスの適用が一元的に行える。
AIエージェントが絡むとさらに複雑になる。エージェントが「計画→情報取得→推論→アクション」のような複数ステップのワークフローをこなす場合、各ステップでのルーティングが発生し、どこで問題が起きたかの追跡が難しくなる。
Pattanaik氏が設計の核として強調するのは次の2点だ。
「重要なのは、アプリケーションをモデルから切り離す抽象化層を構築することと、evalsを使ってワークロードをまたいだモデルのパフォーマンスを計測することだ」
ここで言うevals(エバルズ)とは、LLM(大規模言語モデル)の出力品質を定量的に評価するためのフレームワークや手法の総称だ。正確性・一貫性・タスク達成率といった指標を用いてモデルを比較・監視する仕組みであり、複数モデルを使い分けるマルチモデル環境では、どのモデルがどのタスクで優れているかを継続的に把握するための基盤となる。OpenAIやAnthropicも自社のevals手法を公開しており、エンタープライズ導入においては不可欠な概念として定着しつつある。
プロンプトとワークフローのロジックをモデルから分離しておくことで、アプリケーションを作り直すことなくモデルを差し替えられる。モデルの性能・価格・サービス提供状況がプロバイダー都合で変化する中、アプリケーションの寿命を個々のモデルやプロバイダーの寿命に依存させないための設計として、この抽象化層の重要性は今後さらに高まるだろう。
詳細はAnthropic, OpenAI launches show shift toward multi-model enterprise AIを参照していただきたい。