2026.05.19
本次汇报聚焦大语言模型的幻觉评估与回答可信度。报告首先解读 Ragas 对检索增强生成(RAG)管道的无参考自动评估方法,随后介绍 TrustScore 如何在缺少参考文档和标准答案的闭卷问答中评估模型回答是否可信。
RAG 将检索与生成组合在一起,传统的困惑度和短答案匹配指标既难以反映长文本质量,也难以定位问题究竟来自检索还是生成。人工构造标准答案成本高,而闭源模型通常不公开概率和隐藏状态。在闭卷问答场景中,既没有检索上下文,也没有人工答案,用户更难判断模型回答中的事实是否可靠。
Ragas 从三个维度评估 RAG:忠实度检验答案中的原子陈述能否由检索上下文支持;答案相关性通过由答案反推问题并计算语义相似度,衡量是否答非所问;上下文相关性则考察检索片段是否包含回答所需信息并减少噪声。其 WikiEval 数据集使用人类偏好对高、低质量样本进行对照验证。
TrustScore 则以行为一致性为核心。系统将原始问答转化为含干扰项的选择题,多轮观察模型是否始终坚持自己的回答,形成 Trust BC;当可获取外部知识时,再使用检索与蕴含判定形成事实核查分数 Trust FC,并将两者融合为 Trust OV。
Ragas 通过 LLM 分解陈述、逐项验证,并分别评估检索和生成模块,可用于 RAG 链路调试和 Prompt 优化。TrustScore 为选项构造同类实体、语义近邻或随机词等干扰项,以提升测试辨别力;外部核查模块可从语料库检索证据后判断回答与证据之间的蕴含关系。
实验显示,Ragas 在忠实度判断上与人工偏好具有较高一致性,但长上下文的相关性评估仍具挑战。TrustScore 的结果表明,传统字面重合指标难以评价长文本回答,而行为一致性测试能在无标准答案时识别模型的知识边界。两类方法分别适用于 RAG 管道诊断与闭卷问答监控,后续仍需解决多次调用带来的成本和实时性问题。