9月29日、Artificial Analysisが「GPT-6.1 Sol replaces GPT-6 Sol after just 7 days, with near-Astra intelligence」と題した記事を公開した。GPT-6 Solがリリースからわずか7日で廃止され、後継のGPT-6.1 Solに置き換わった——LLM市場のモデル交代サイクルが急速に短縮するなか、それでも7日という数字は際立っている。さらに注目すべきは性能面だけでなく、最高性能モデルであるGPT-6 Astraと僅差の性能を、そのコストの4分の1以下で実現したという点だ。
わずか7日でモデル交代——モデル競争の加速を示す一例
LLM市場では新モデルのリリースサイクルが急速に短縮しているが、GPT-6 Solのリリースからわずか7日でGPT-6.1 Solに置き換わったという事実は、その速度を端的に示している。
Artificial Analysisが独自に算出するIntelligence Index(複数のベンチマークを統合した総合スコア)での比較では、GPT-6.1 SolはGPT-6 Solから4ポイント上昇し、GPT-6 Astraとの差をわずか1ポイントにまで縮めた。
コスト効率が最大の見どころ
性能向上よりも注目すべきは、コスト効率の改善だ。
価格設定はGPT-6 Solと同じ入力100万トークンあたり$2、出力100万トークンあたり$10だが、キャッシュ読み取りの割引率が90%から**95%**に引き上げられた。エージェント的なワークロード(複数ステップのタスク処理など、繰り返しのコンテキスト読み込みが発生する用途)では、この差が実コストに効いてくる。
max effortでの1タスクあたりのコストを比較すると:
- GPT-6.1 Sol:$0.72
- GPT-6 Sol:$1.05(31%高い)
- GPT-5.6 Sol:$1.99(64%高い)
- GPT-6 Astra:$3.26(4.5倍以上)
GPT-6 Astraとほぼ同等の性能を、4分の1以下のコストで実現している計算になる。Artificial Analysisによれば、すべてのエフォートレベルにおいて、同等の性能を持つモデルの中でGPT-6.1 Solより安価なモデルは存在しない。
これをArtificial Analysisは「コスト効率のPareto最前線を更新した」と評している。ここでいう「Pareto最前線」とは、パレート最適の概念に基づいており、「コストを下げようとすると性能が落ち、性能を上げようとするとコストが上がる」というトレードオフが存在しない、現時点での最良のコスト・性能バランスを指す。GPT-6.1 Solはそのトレードオフ曲線上で新たな優位点を確立したという意味だ。
各ベンチマークでの具体的な改善
Intelligence Indexを構成する個別ベンチマークでも、複数の項目で顕著な上昇が見られた。それぞれのベンチマークが測定する能力領域と合わせて整理すると、GPT-6.1 Solの改善がコーディング・知識・文書理解といった広範な領域にわたることがわかる:
- Terminal-Bench 4.0(ターミナル操作エージェントの評価):+12ポイント——エージェントとしての実環境操作能力で最大の伸びを示した
- AA-Omniscience Accuracy(知識の正確性評価):+8ポイント、かつハルシネーション率が60%→**54%**に低下——事実回答の信頼性が実質的に向上している
- GDP.pdf(文書理解):+6ポイント
- Humanity's Last Exam(高難度の学術問題):+5ポイント
- AA-Briefcase v1.1(エージェント的な知識業務):+4ポイント
AA-Briefcase v1.1については補足が必要だ。全体ではEloスコアが約80上昇しており、採点ルーブリックスコアと分析品質Eloが向上している。一方でプレゼンテーションEloはやや低下している。プレゼンテーションEloとは回答の構成・表現の質を評価する指標であり、分析内容の正確さとは独立して測定される。つまり、「何を答えるか」の質は上がったが「どう伝えるか」の洗練度がわずかに後退した形だ。実務上の影響は限定的とみられるが、出力の体裁が重要な用途では留意する必要がある。
コーディングエージェントでも前世代を逆転
Artificial Analysis Coding Agent Indexでは、xhigh effortの設定でGPT-6 Astraを1ポイント上回り、コストはGPT-6 Astraの15%未満という結果が出ている。同じmax effort同士の比較では、GPT-6 Solから3ポイント上昇し、GPT-6 Astraとは2ポイント差だ。
なお、xhigh effortはmax effortより3ポイント高いスコアを記録しており、エフォートレベルの選択がコーディングタスクの品質に影響することも示されている。
トークン消費量はやや増加
一点、注意が必要なのがトークン効率だ。GPT-6.1 Solは各エフォートレベルでGPT-6 Solより出力トークンを10〜30%多く消費する。ただし、性能向上を加味した「トークン効率のPareto最前線」——前述の通り、コストと性能のトレードオフが存在しない最良点——においては、低・中エフォートレベルでPareto最適の位置にある。同等の性能を得るためのトークン消費量という観点では、依然として競争力があるとの評価だ。
詳細はGPT-6.1 Sol replaces GPT-6 Sol after just 7 days, with near-Astra intelligenceを参照していただきたい。