如何评估 RAG 系统的效果?

RAG 面试题发布于

一、评估维度

  • 检索质量:检索到的文档是否相关。
  • 生成质量:回答是否准确、完整、流畅。
  • 端到端效果:整体回答是否满足用户。

二、检索评估指标

  • Recall(召回率):相关文档中被检索到的比例。
  • Precision(精确率):检索到的文档中相关的比例。
  • MRR:第一个相关文档的排名倒数。
  • NDCG:考虑排名的相关性。

三、生成评估指标

  • Faithfulness(忠实度):回答是否基于检索文档,无幻觉。
  • Answer Relevancy(回答相关性):回答是否切题。
  • Context Precision(上下文精确率):检索上下文是否相关。
  • Context Recall(上下文召回率):关键信息是否被检索到。

四、评估方法

  • 人工评估:准确但慢。
  • LLM-as-Judge:用 LLM 打分,快但有偏差。
  • RAGAS:开源 RAG 评估框架,自动计算上述指标。
  • TruLens、DeepEval:其他评估工具。

五、优化方向

  • 检索差 → 优化分块、Embedding、检索方式。
  • 生成差 → 优化 Prompt、调 LLM。
  • 端到端差 → 考虑重排(Rerank)、多轮检索。