22.2 进阶 RAG 与评测:从可运行到可信赖#

上一节 的索引、召回、重排解决了如何得到候选文档,但真实系统面对的问题往往表述含糊、答案分散于多处、且需要判定生成是否含有幻觉。本节补充两部分内容:其一是进阶检索技术(Advanced Retrieval),涵盖查询改写、多跳迭代检索、基于知识图谱的检索与由智能体自主决定检索行为的方案[^hyde][^ircot][^graphrag][^selfrag];其二是 RAG 评测,即把检索质量与生成质量两段分别量化,借助 recall@k、nDCG、faithfulness 等指标与 RAGAS、LLM-as-judge 实现自动化,从而避免以少数成功样例误判整体质量[^ragas][^ndcg]。

登录后才可看