RAGの検索結果を「全部まとめてLLMに渡す」のをやめたら、入力トークンが65%削減できた話
DRANK

7月23日、Towards Data Scienceが「Loop Engineering for RAG Generation: iterate top-k one at a time」と題した記事を公開した。この記事では、RAG(検索拡張生成)パイプラインにおいてtop-K候補を一括ではなく1件ずつ順次処理する手法と、その切り替えロジックについて詳しく紹介されている。

by @tf_official
Related Topics: AI Machine Learning Python