十八、RAG 效果评估:怎么知道你的知识库好不好用
RAG 效果评估:怎么知道你的知识库好不好用专栏导航:这是《LangChain 30篇精讲》系列的第 18 篇,模块四:RAG 实战的第五篇(本模块收官)。前面四篇我们把 RAG 的索引、检索、生成、可信度都优化了一遍。但有个根本问题始终没解决:你怎么知道这些优化到底有没有用?本篇讲的就是——用数据说话。写在前面:"感觉效果还行"是项目最大的风险我在技术群里见过无数次这样的对话:产品:“这个知识库问答效果不太行啊,用户反馈答得不准。”研发:“我觉得还行啊,我测了几个问题都能答上来。”产品:“那你优化一下。”研发:(改了个参数)“好了,你再试试。”产品:“好像好一点了?”研发:“那就先这样吧。”这段对话里,没有一句是有数据支撑的。问题在哪?优化方向不明确—— 不知道是检索差还是生成差,只能瞎试优化效果无法验证—— 改完感觉"好像好了一点",到底好了多少