LLMのリトライ処理は統計をこっそり歪める — DeepSeek-V4論文に隠れていた警告を10万件の実験で検証した
DRANK

7月31日、Quesmaが「A lesson about retries, hidden in the DeepSeek-V4 paper」と題した記事を公開した。LLMのリトライ処理が統計的バイアスを引き起こし、ベンチマーク結果を歪める可能性があることを、10万件の実験で実証した内容だ。

by @tf_official
Related Topics: AI Machine Learning DevOps