LLM推論のオートスケールでCPU使用率は使えない — Together AIが実験で示した「GPU使用率もTTFTも反応しなかった」理由
DRANK

7月31日、Together AIが「Autoscaling endpoints for LLM inference」と題した記事を公開した。LLM推論エンドポイントのオートスケーリングでは、WebサービスやバッチMLワークロードで通用するメトリクスがそのまま機能しない——この記事はその理由を実験データで明示し、現場で使える設計指針を示している。

by @tf_official
Related Topics: AI Machine Learning DevOps