RAGの誤答はハルシネーションではなく抽出の設計問題 — 型付きPydanticオブジェクトで防ぐ7つのパターン
DRANK

7月24日、Towards Data Scienceが「Most RAG Hallucinations Are Extraction Errors: Seven Patterns for a Typed Generation Contract」と題した記事を公開した。RAGにおける誤答の多くはLLMの"ハルシネーション"ではなく抽出パイプラインの構造的な問題であるという主張と、それを防ぐ7つのパターンが詳しく解説されている。「ハルシネーション」という言葉が問題を隠しているRAGのシステムが間違った答えを返したとき、チームはすぐに「ハルシネーションだ」と言う。しかしこの記事はその診断を正面から否定する。厳密な意味でのハルシネーションとは、モデルがコンテキストとは無関係にパラメトリック記憶から事実を捏造することだ。RAGではモデルは取得したドキュメントを読んでいる。だとすれば誤答の原因は上流、つまりパース・クエリ生成・検索・生成コントラクトのいずれかにある。「ハルシネーション」と呼ぶことで、どこを直すべきかの議論が閉じてしまう。正確な原因を名付けることで、議論が再び開く。記事が提示する対案...

by @tf_official
Related Topics: AI Machine Learning Python