RAG学习笔记
评价rag指标的方式
Persion@K :前k个检索结果中相关文档的比例,主要反映检索的精准度(法律咨询,金融风控场景)
MRR:平均倒数排名,反应系统快速定位相关文档的能力(客服,搜索这类需要快速响应的)
NDCG: 归一化折扣累计增益,结合文档相关性和排名位置,评估排序质量的综合指标(电商推荐,新闻排序等需要区分相关度优先级)
Recall@k :前k个结果覆盖所有文档的比例,反应检索的全面性(医疗诊断,科研文献检索这类不能漏检的场景)
面试的时候如何回答:如何进行rag调优后的效果评估,请给出真实的应用场景中采用的效果评估标准与方法
面试的时候从工程思维进行回答
什么是工程思维:从需求出发,最终目的都是为了解决核心需求
是否搜得到目标答案:查看检索召回的前三个是否包含正确答案
模型是否回答正确:看答案是否等于基于rag提供的材料的内容整理得到的
rag检索的速度快不快:用户的使用体验如何
rag检索一次耗费的时间和token成本如何:根据用户需求和成本去考虑是否要进行复杂设计
实际测试
真实业务中的高频问题回答准确率如何
边界问题:搜不到或者模糊答案的结果是否正确
多跳问题:需要多文档查询的是否能进行正确的文档内容收集
命中率:查看命中率是否下降
小技巧:在前端页面增加 点赞/点踩功能,直接收集一线用户的体验,进行效果的判断
使用现有的rag检测插件或者系统来进行功能测试以及系统性调优
细节:你修改了参数是不是得通知下游系统,说参数改变了,要读取新数据,此时就得用个通知机制。有消息队列的用消息队列,没消息队列的用Redis也能做(我们就是用的redis简单通知)
阅读博客连接:
面试官问我RAG怎么评估,我说:看Top 3有没有正确答案、用户点不点赞
浙公网安备 33010602011771号