AlibabaのQwen3.8 Max、特定ベンチマークでClaude Opus 4.8と同等スコアに — ハルシネーション率は23%→40%に急増、コスパではKimi K3に劣勢
DRANK

8月6日、The Decoderが「Qwen3.8 Max catches Claude Opus 4.8 but Kimi K3 still scores higher for 25 percent less」と題した記事を公開した。AlibabaのQwen3.8 MaxがArtificial Analysis Intelligence Index(AAII)上でClaude Opus 4.8と同等のスコアに達した一方、ハルシネーション率の大幅な悪化とコスト増加が確認されており、実用面での評価は単純ではない。

by @tf_official
Related Topics: AI Machine Learning AI Text Generator