面试官皱眉:“你懂RAG测评吗?” 我:“何止懂?我直接用Ragas把系统的幻觉率干到了0”,他愣了…
1. 什么是Rag评估?
RAG 评估,就是用一套可量化的指标体系,持续测量 RAG 系统「回答得好不好」,并且能把「好不好」这个笼统的感受,拆解成具体是哪个环节出了问题。
目前主流的RAG评估体系通常分为以下三个核心维度:
- 检索质量 (Retrieval Quality) 主要看检索模块有没有把真正相关的文档找出来。如果这一步做不好,后续大模型再生成得再好也是“垃圾进,垃圾出”。常用的指标有上下文召回率,上下文精准率等。
- 生成质量 (Generation Quality) 主要评估大模型拿到上下文后回答得好不好。这里有两个最关键的指标: _ 忠实度/防幻觉 (Faithfulness):检测模型生成的答案是否严格基于检索到的上下文,有没有自己瞎编乱造(即产生幻觉)。 _ 答案相关性 (Answer Relevance):检测生成的答案有没有正面、准确地回应用户的提问。* AnswerAccuracy(答案准确性): 根据给定的 user_input,衡量答案与真实答案的准确性。此指标平均两个不同的评判提示来进行评估。
2. 为什么需要对Rag做评测?
- 防止它一本正经地胡说八道(防幻觉) RAG 最怕的就是瞎编。如果不评测,你根本不知道它是真的查到了资料在回答,还是在凭印象乱编。评测能帮你揪出那些“看着很对,其实是错的”答案。
- 方便出了问题知道该骂谁(找病灶) RAG 分两步:先“翻书”(检索),再“答题”(生成)。 如果答错了,到底是“书没找对”,还是“脑子不好使”?有了评测,你就能一眼看出来是该去优化找资料的环节,还是该去换个大模型。
- 别光靠感觉,要有实锤(看疗效) 改完代码后,系统到底变聪明了还是变笨了?不能光凭肉眼看几个例子。评测能给出一堆客观的分数,让你明明白白地知道这次优化有没有效果。 一句话总结:不做评测就是蒙眼狂奔,做了评测才能心里有底。
3. 如何给Rag做评测?
Rag核心测评指标如下:

根据评估对象的不同,可以分为以下三个核心的评估指标:
- 检索资料(Context)和用户问题(Query)——上下文相关性(Context Relevance)
- 模型生成的回答 (Response) 与 检索到的资料 (Context)——忠实度 / 依据性(Faithfulness / Groundedness)
- 模型生成的回答 (Response) 与 用户提问 (Query)——答案相关性(Answer Relevance)
现在市面上有很多给Rag做评测的框架:TruLens、 RAGAS(RAG首选)、DeepEval(Python单测集成)、Phoenix 等
注:本文主要使用rags(https://docs.ragas.org.cn/)框架做演示))
3.1 如何构建评测集?
基于LLM生成
基于LLM生成的核心逻辑是,让大模型阅读你的“知识文档”来自动出题。这种方式可生成:
- 原始问题、
- 标准答案(作为评估基准的groud truth)。
人工构建
人工构建指的是,从已有的知识中,人工的构建一些Q&A对,一般是由专业的人员基于文档内容、历史用户问题等提炼出来的常见的问题和答案。这种方式构建出来的数据也是包含:
- 原始问题
- 真实答案
线上指标 rag系统上线以后根据用户的追问率,踩率,转人工率,空回答率等真实问题作为评测
接下介绍如何基于文档生成测评集,人工构建和线上指标 相对简单,仅操作复杂
3.2 基于文档生成测评集
比如我们提前准备一份文档,markdown格式最好,放到docs目录下

运行以下代码:
▼python复制代码import os from dotenv import load_dotenv from langchain_community.document_loaders import DirectoryLoader from openai import OpenAI from ragas.embeddings.base import embedding_factory from ragas.llms import llm_factory from ragas.testset import TestsetGenerator from ragas.testset.persona import Persona # 1. 加载环境变量 load_dotenv() # 2. 加载文档 path = "docs/" loader = DirectoryLoader(path, glob="**/*.md") docs = loader.load() # 3. 配置 LLM openai_client = OpenAI( api_key=os.getenv("OPENAI_API_KEY"), base_url="https://dashscope.aliyuncs.com/compatible-mode/v1", ) llm = llm_factory("qwen3.7-max", client=openai_client) # 4. 配置 Embeddings embeddings = embedding_factory("openai", model="text-embedding-v4", client=openai_client) # 5. 配置角色(因为文档是关于 时刻表及航班日期变更、行李政策相关的,所以角色设定为以下 ) #角色提供了上下文和视角,确保生成的查询自然、针对特定用户且多样化。通过根据不同用户视角定制查询,我们的测试集覆盖了广泛的场景 personas = [ Persona( name="首次乘机旅客", role_description="第一次乘坐飞机,可能会感到焦虑。需要清晰的飞行流程指引、安全协议说明以及整个旅程的预期指导。", ), Persona( name="常旅客", role_description="经常出行,重视效率和舒适度。对忠诚计划、快速通道服务和无缝旅行体验感兴趣。", ), Persona( name="愤怒的商务舱旅客", role_description="要求顶级服务,对任何延误或问题都容易感到恼火。期望立即解决问题,如果标准未达到会迅速表达不满。", ), ] generator = TestsetGenerator( llm=llm, embedding_model=embeddings, persona_list=personas, ) dataset = generator.generate_with_langchain_docs(docs, testset_size=10) df = dataset.to_pandas() print(df) df.to_csv("rag_testset.csv", index=False) print("测试集已成功导出为 rag_testset.csv")
评测集生成如下:

不管是针对Context Precision、Context Recall两个指标做评测,还是要针对另外几个指标做评测,我们还需要基于这份数据集,生成我们自己的RAG问答系统的答案+参考资料才行。
3.3 构建一个简答的rag系统并做评测
▼python复制代码import os import asyncio from dotenv import load_dotenv from langchain_core.documents import Document from langchain_core.output_parsers import StrOutputParser from langchain_core.prompts import ChatPromptTemplate from langchain_openai import ChatOpenAI, OpenAIEmbeddings from langchain_text_splitters import MarkdownTextSplitter load_dotenv() #一:构建一个简单的rag系统 # 读取知识库文档 with open("docs/知识库.md", "r", encoding="utf-8") as f: knowledge_base_content = f.read() # 使用 LangChain 的 Markdown 文本分割器切割(本例子使用Markdown 切割器仅供参考) markdown_splitter = MarkdownTextSplitter( chunk_size=600, # 每个分块的最大字符数 chunk_overlap=50 # 分块之间的重叠字符数 ) # 分割文档 chunks = markdown_splitter.split_text(knowledge_base_content) # 创建 LangChain 文档对象 langchain_documents = [ Document(page_content=chunk) for chunk in chunks if chunk.strip() ] print(f"文档被分割成 {len(langchain_documents)} 个块") from langchain_core.vectorstores import InMemoryVectorStore import openai # 创建 LangChain 的 OpenAI 客户端 openai_client = openai.OpenAI( api_key=os.getenv("OPENAI_API_KEY"), base_url="https://dashscope.aliyuncs.com/compatible-mode/v1" ) # 创建 LangChain 的 LLM 和 Embeddings llm = ChatOpenAI(model="qwen-max", api_key=os.getenv("OPENAI_API_KEY"),base_url="https://dashscope.aliyuncs.com/compatible-mode/v1") embeddings = OpenAIEmbeddings(api_key=os.getenv("OPENAI_API_KEY"), base_url="https://dashscope.aliyuncs.com/compatible-mode/v1", model="text-embedding-v4" , check_embedding_ctx_length=False) vector_store = InMemoryVectorStore(embeddings) # 分批添加文档到向量存储(每批最多10个,避免API限制) batch_size = 10 for i in range(0, len(langchain_documents), batch_size): batch = langchain_documents[i:i + batch_size] vector_store.add_documents(batch) print(f"已添加批次 {i // batch_size + 1}, 当前共 {min(i + batch_size, len(langchain_documents))} 个文档") # 创建向量存储的检索器 retriever = vector_store.as_retriever(search_kwargs={"k": 5}) #提示词模板 template = """你是一个严格的客服助手。请仅根据以下提供的上下文信息回答问题。 重要规则: 1. 只能使用上下文中明确提到的信息 2. 如果上下文中没有足够信息,请说"根据提供的信息无法回答" 3. 不要添加任何上下文中不存在的内容 4. 不要使用你自己的知识 上下文: {context} 问题:{query} 回答:""" prompt = ChatPromptTemplate.from_template(template) qa_chain = prompt | llm | StrOutputParser() def format_docs(relevant_docs): return "\n".join(doc.page_content for doc in relevant_docs) #测评集问题 #用户问题根据上一步生成的测评集取得的 sample_queries = [ "Ragas航空公司 改 时间 咋办 怕", "作为Ragas航空公司的一名商务舱旅客,我对航班时刻表的更改感到极其不满,如果我拒绝所有替代航班并决定申请全额退款,具体的操作步骤是什么,且退款至我的信用卡需要多长时间?", "作为一个经常到处飞的常旅客我就是想问下如果我之前买那种不可退票的机票然后我现在想要改的话是不是说我可以得到那个旅行积分的啊,这个旅行积分到底是怎么一回事能不能给我说说?", "我头一回坐飞机心里慌得很要是我买Ragas航空公司的机票怀疑时间变了但是没收到通知咋整啊是不是被骗了那个什么管理我的预订怎么弄还有垃圾邮件在哪看客服电话能打吗你快给我说说步骤吧我啥都不懂", "我买是商务舱票,为啥行李限额显示跟经济舱一样只有1个包?你们是不是弄错,快点给我解决这问题!", "首飞好紧张,怎么登路管理我的预订改期和查行李?", '作为一名支付了高昂票价的商务舱旅客,我对任何潜在的延误都感到极度恼火,现在我需要立刻通过"管理我的预订"系统来更改我的航班日期,请详细列出我必须遵循的具体操作步骤,并且明确告诉我,作为尊贵的商务舱旅客,我的托运行李限额究竟是多少,以确保我不会在机场遭遇任何不必要的麻烦或额外费用?', "我那个航班日期想改但不知道票行不行,万一没收到通知,管理我的预订里面能查吗,还有网站报错弄不了咋办啊?", '第一次坐飞机 怎么在"管理我的预订"里改签航班 没收到通知或网页报错怎么办', '如何通过"管理我的预订"功能查看行李限额与航班变更?', '我是一名尚务舱旅客,我的航班好像被你们偷偷改了,而且我根本没收到通之!我现在非常生气,立刻告诉我怎么通过"管理我的预订"来查看我的航班更新,顺便给我确任一下我作为尚务舱乘客到底能带几个多重的托运行里,要是我的行里因为你们的错务被收费,我绝对会投述到底的!' ] #测评集期待答案根据上一步生成的测评集取得的 expected_responses = [ "当Ragas航空公司因运营原因(如天气状况、飞机维护或机场限制)更改起飞时间、到达时间或航班号时,会发生时刻变更。此外,乘客可因个人原因申请更改航班日期,具体情况取决于票价规则和可用性。", '若要申请全额退款,您需要在"管理我的预订"中点击"取消航班",然后选择"申请全额退款"。如果您使用信用卡或借记卡付款,退款处理时间为7个工作日;若为银行转账,则需要20个工作日。', "根据票价规则,对于不可退票的机票,在修改车票时,您可以支付修改费或获得旅行积分。", '如果您怀疑航班已更改但未收到任何通知,请按照以下步骤操作:第一步,登录"管理我的预订",查看是否有任何更新;第二步,检查你的垃圾邮件/垃圾邮件文件夹,看看有没有错过的邮件;第三步,请致电Ragas航空公司客服,询问您的航班状态。', '根据规定,经济舱的托运行李限额是1个包(最大:23公斤),而商务舱的托运行李限额是2个包(最多32公斤)。行李限额根据票价类型和目的地而异,请在预订确认邮件中查看具体的津贴,或登录"管理我的预订"进行核实。', '别紧张,您可以登录"管理我的预订"(输入预订参考号码和姓氏)来完成:1. 改期:查看票价规则,选择"更改航班"及新日期并支付费用;2. 查行李:查看根据您的票价类型和目的地而定的具体行李限额。', '要通过"管理我的预订"更改航班日期,您首先需要登录系统,输入您的预订参考号码和姓氏以查看票价规则;接着选择"更改航班"并选择新的航班日期(视可用性而定),支付任何适用的差价或改乘费用后,点击"确认新航班"即可获得新机票。此外,作为商务舱旅客,您的托运行李限额为2个包,每个包最多可达32公斤。请务必确保您的行李符合航空公司的尺寸、重量和内容限制,以避免安检延误或产生额外的行李费用。', '要确认机票是否允许更改,请登录"管理我的预订",输入预订参考号码和姓氏以查看票价规则。可退票可免费改签,不可退票需支付修改费或获得旅行积分,基础经济舱或促销机票不允许修改。若未收到航班变更通知,您可以登录"管理我的预订"查看更新,检查垃圾邮件文件夹,或致电Ragas航空公司客服。若遇到网站报错等系统问题,请尝试更换浏览器、清除缓存和Cookie,或切换至其他设备;如问题依旧,请致电客服并提供预订参考号及错误信息截图。', '作为首次乘机旅客,您可以按照以下指南操作:\n1. 更改航班日期:登录"管理我的预订",输入预订参考号码和姓氏查看票价规则。接着选择"更改航班",挑选新的航班日期,支付适用的差价或改乘费用,最后点击"确认新航班"。\n2. 未收到变更通知:若未收到通知,请先登录"管理我的预订"查看是否有更新,并检查垃圾邮件文件夹。若仍无信息,请致电Ragas航空公司客服询问航班状态。\n3. 网页报错等系统问题:若遇到网站错误,请尝试更换浏览器、清除缓存和Cookie,或切换到手机、平板等其他设备。若问题依旧,请致电客服并提供您的预订参考号和错误信息截图。', '您可以登录"管理我的预订"查看具体的行李津贴限额;若未收到航班变更通知,也可通过该功能查看航班状态是否有任何更新。', '如果您怀疑航班已更改但未收到任何通知,第一步是登录"管理我的预订"查看是否有任何更新。关于您的行李限额,作为商务舱乘客,您的托运行李限额为2个包(最多32公斤)。请注意,如果行李超过允许的重量或行李数量,将收取行李费用。' ] from ragas import EvaluationDataset # 异步处理单个查询 async def process_query(query, reference): #根据问题去rag进行检索 relevant_docs = await retriever.ainvoke(query) #调用大模型,根据用户问题和检索到的文档生成答案 response = await qa_chain.ainvoke({"context": format_docs(relevant_docs), "query": query}) return { "user_input": query, "retrieved_contexts": [rdoc.page_content for rdoc in relevant_docs], "response": response, "reference": reference, } # 并发执行所有查询 async def process_all_queries(): tasks = [process_query(q, r) for q, r in zip(sample_queries, expected_responses)] results = await asyncio.gather(*tasks) return list(results) # 运行异步任务 dataset = asyncio.run(process_all_queries()) print(f"已完成 {len(dataset)} 个查询的处理") # 创建评估数据集 evaluation_dataset = EvaluationDataset.from_list(dataset) from ragas import evaluate from ragas.llms import LangchainLLMWrapper from ragas.metrics import LLMContextRecall, Faithfulness, FactualCorrectness,AnswerAccuracy,ContextRelevance,ResponseRelevancy # LLMContextRecall(LLM上下文召回): 衡量的是有多少相关文档被成功检索了出来。它的核心关注点在于不要遗漏重要的结果。 # ContextRelevance(llm上下文精确率): 根据用户输入对检索到的上下文的相关性进行评分。 # 输入:data:包含键 user_input, retrieved_contexts 的字典列表 输出:0.0:retrieved_contexts 与 user_input 不相关 0.5:retrieved_contexts 与 user_input 部分相关 1.0:retrieved_contexts 与 user_input 完全相关 # AnswerAccuracy(答案准确性): 根据给定的 user_input,衡量答案与真实答案的准确性。此指标平均两个不同的评判提示来进行评估。 # Faithfulness(忠诚度): 判断AI 生成的 response(回答)在事实层面与 retrieved context(检索到的上下文)的一致性。 # ResponseRelevancy (答案相关性): 根据给定的问题对答案的相关性进行评分。包含不完整、冗余或不必要信息的答案会受到惩罚。分数范围从 0 到 1,1 为最佳。 evaluator_llm = LangchainLLMWrapper(llm) # 评估 result = evaluate( dataset=evaluation_dataset, metrics=[LLMContextRecall(), ContextRelevance(),Faithfulness(), ResponseRelevancy(),AnswerAccuracy()], llm=evaluator_llm, embeddings=embeddings, ) print(result)
测评集结果 {'context_recall': 0.7803, 'nv_context_relevance': 0.9545, 'faithfulness': 0.5597, 'answer_relevancy': 0.7836, 'nv_accuracy': 0.7273}
问题:faithfulness': 0.5597 忠实度得分较低 原因:1. 检索质量不足 2.关键信息分散在多个 chunk 中,但只检索到部分 3 提示词约束不够强 修改:1、提示词修改为现在的。原先的:根据以下参考资料生成答案 2、提高召回的分片 3->5
再次测评: {'context_recall': 0.9333, 'nv_context_relevance': 0.9286, 'faithfulness': 0.8889, 'answer_relevancy': 0.7817, 'nv_accuracy': 0.7222}
忠实度明显提高,本次测评仅提供问题解决思路。具体问题应根据具体业务场景和测评结果
