DeepSeek-V4.1 FlashのKVキャッシュをトークンあたり890バイトに圧縮する新アーキテクチャ — 「これはV5 Flashと呼ぶべき代物だ」
DRANK

9月17日、zartbot(個人ブログのURLドメインから個人開発者と推定される)が「DeepSeek-V4.1 Flash: Pushing the Limits of KV Cache Compression · zartbot」と題した記事を公開した。DeepSeek-V4.1 FlashのKVキャッシュ圧縮技術とモデルアーキテクチャの詳細を、テクニカルレポートの精読をもとに解説した内容だ。

by @tf_official
Related Topics: AI Machine Learning Deep Learning