NVIDIAのエッジAI推論がリファレンス実装の6.4倍速に — プリフィルトークンの96%をKVキャッシュから供給する仕組み
DRANK

9月17日、NVIDIAが「TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor」と題した記事を公開した。この記事では、NVIDIAのエッジ推論ソフトウェア「TensorRT Edge-LLM」がJetson AGX Thor上でMLPerfエッジエージェントベンチマークをリファレンス実装の6.4倍の速度で完了したことについて詳しく紹介されている。

by @tf_official
Related Topics: AI Machine Learning IoT