NVIDIAが「モデルの自動振り分け」でAIエージェントのコストを3分の1に削減 — 単一の巨大モデルに頼らない「チーム制AI」という新設計
DRANK

8月11日、NVIDIAが「NVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AI」と題した記事を公開した。エージェントAI向け軽量モデル「Nemotron 3.5 Lightning」とモデルルーティングライブラリ「NeMo Switchyard」の同時リリースを詳しく紹介している。コストを約3分の1に削減するモデルルーティングが核心今回の発表で最も実践的なのが、オープンソースのモデルルーティングライブラリ「NeMo Switchyard」だ。エージェントAIシステムでは、コーディング・推論・軽量タスクなど用途ごとに適したモデルが異なる。しかし単一モデルで全リクエストを処理すると無駄が生じ、手動でルーティングを実装すると開発コストがかかる。NeMo Switchyardはこの問題を、エージェントワークフローの各ステップで最適なモデルへ自動的にリクエストを振り分けることで解決する。NVIDIAの内部ベンチマークでは、フロンティアモデル単体(元...

by @tf_official
Related Topics: AI Machine Learning Deep Learning