10月10日、AWSが「ICYMI: What landed for AI builders in September 2026」と題した記事を公開した。2026年9月、Amazon Bedrock・AgentCore・Strandsにわたって大量の新機能が投入された。コスト削減・高速推論・モデル選択の拡充と、AIエージェントの実運用を直撃する更新が揃っており、特にStrands新ツール群のトークン削減幅とローカル推論速度は、運用コストとレイテンシを厳しく管理したいチームにとって見逃せない内容だ。
注目:Strandsの新ツール群——コスト削減と高速ローカル推論
エンジニアが最も注目すべき更新は、オープンソースツールキット「Strands」に追加された2つの機能だ。
Strands Harness:トークン消費28%削減
Strands Harnessは、1行のPythonまたはTypeScriptコードで本番向けエージェントを立ち上げられる新しいオープンソースのエージェントハーネスだ。コンテキスト管理、プロンプトキャッシング、メモリが組み込まれており、どこにでもデプロイできる。
特筆すべきは、精度を維持しながら既存の主要エージェントハーネスと比較してトークン使用量を28%削減する点だ。元記事ではこの比較対象として、LangChainやLlamaIndexなど広く使われているハーネスが念頭に置かれている。LLMのAPIコストがそのまま運用コストに直結する昨今、28%という削減幅は大規模エージェント運用では月次コストの差として明確に現れやすい。
Strands Decider 2B:ローカルで約115msの意思決定
Strands Decider 2Bは、20億パラメータの小型決定モデルだ。テキストを生成するのではなく、あらかじめ定義された選択肢の中から一つを選ぶという設計になっている。ツール選択、ルーティング、ガードレールなどのエージェント的タスクに特化しており、ローカル実行で約115msの応答時間を実現する。コード・データ・モデルウェイトはすべてGitHubとHugging Faceで公開されている(元記事に具体的なリポジトリURLの記載はなく、公開時点では各プラットフォームでの検索が必要)。
クラウドAPIを経由せずローカルで高速な意思決定ループを回せる点は、レイテンシやコストを厳しく管理したい用途に刺さる。小型モデルをオーケストレーション判断専用に使い、生成タスクは別の大型モデルに渡す、という構成が現実的な選択肢として浮上する。
AgentCoreのランタイム改善:コールドスタートの短縮とゼロスケール
Amazon Bedrock AgentCoreのランタイムにも改善が入った。メモリ管理の効率化によりサーバーレスエージェントのコールドスタートレイテンシが低下し、ピーク時のメモリではなく実際の使用量に応じた従量課金になった。アイドル時はセッションがゼロにスケールし、ハードウェア分離環境で動作する。
また、Amazon Bedrock Managed Agents(OpenAIモデル対応)がパブリックプレビューとして提供開始された。AWSはOpenAIと提携し、OpenAIのモデルをAmazon Bedrockのマネージドインフラ上で提供している。この連携により、OpenAIのモデルをAWS外部のAPIとして直接呼び出すのではなく、BedrockのエンドポイントからIAMパーミッション・CloudTrailによる監査をそのまま活かした形で利用できる。企業のガバナンス要件を満たしつつOpenAIの最新モデルを使いたいケースで効いてくる仕組みだ。永続セッションとヒューマンアプルーバルワークフローも組み込まれている。
モデル選択の拡充:GPT-6系・Claude・Kimi・Grokが追加
Amazon Bedrockで利用できるモデルの幅が大きく広がった。主な追加は以下のとおりだ。
- GPT-6 Astra:最大100万トークンの入力コンテキスト。ドキュメント分析・ソフトウェア開発向けのフラグシップモデル。GPT-6 Astra Ultrafastは最大毎秒300トークン、通常比最大6倍の高速推論を提供
- GPT-6.1 Sol / GPT-6 Sol:コーディングや業務ワークフロー向けの中間モデル
- GPT-6.1 Luna:抽出・要約・分類・ルーティングなど高ボリュームタスク向け
- Claude Opus 5.5:アダプティブシンキングと推論深度の上限を設定する
effortパラメータを持つ長時間タスク向けモデル。Claude Opus 4系からの後継にあたり、複雑な推論タスクでの使い分けが想定されている - Claude Sonnet 5.5:Claude Sonnet 5比でコスト30%削減、速度30%向上。Sonnet系はバランス重視の中間モデルとして位置づけられており、Sonnet 5.5はその実運用コスパをさらに引き上げた改良版だ
- Kimi K3(Moonshot AI):2.8兆パラメータのオープンモデル。この規模のパラメータ数はMixture-of-Experts(MoE)アーキテクチャによるもので、推論時に実際に活性化するパラメータは総数より大幅に少なく、単純なDenseモデルの2.8兆パラメータとは性質が異なる。100万トークンコンテキスト、ネイティブビジョン対応。Moonshot AI曰く従来版比2.5倍高速
- Grok 4.6 / 4.7(xAI):50万トークンコンテキスト、推論強度の設定と自己検証に対応
GPT-6系が複数のグレードで揃い、Claudeの最新世代、Kimi K3、Grokと、ベンダーをまたいだ選択肢が一つのプラットフォームに集約されてきた。用途・コスト・推論速度に応じた使い分けがより現実的になる。
ナレッジベースの同期とコネクター追加
Amazon Bedrock Managed Knowledge Baseには、実運用で地味に効く更新が入った。
データソースの自動同期スケジューリング(日次・週次・月次)が設定可能になり、エージェントが常に最新の情報を参照できるようになった。SharePoint・OneDrive・Confluenceについては、管理者アカウントへの依存を減らすユーザー管理セットアップも提供される。
また、ServiceNow・Confluence Data Center・Salesforce・Zendeskがネイティブコネクターとして追加され、カスタムのデータ取り込みパイプラインを自前で構築・保守する必要がなくなった。エンタープライズ系SaaSとの接続が標準で整備されることで、社内ナレッジをエージェントに組み込む際の初期構築コストが下がる。
詳細はICYMI: What landed for AI builders in September 2026を参照していただきたい。