← 术语图鉴

评测

Eval · 也叫 评测集 / 测试用例 / evals / 正样本 / 负样本

一组带标准答案的问题:每次改提示词、换模型之后都跑一遍,用通过率判断是变好还是变坏。

你可能会说:

  • “改了提示词之后,AI 是变好了还是变差了,怎么知道?”
  • “换一个模型,回答质量会不会掉?”

它是什么

一条评测用例包括:问题、怎样算答对(必须出现的要点、必须引用的出处),以及它属于哪一类。答案在资料里、应该答出来的,叫正样本;资料里没有、应该拒答的,叫负样本。

先有正确答案,才谈得上好坏。标准答案最好由人确认过;判定也别比对整段文字,模型每次措辞都不同,比对几个关键要点就够了。

评测本身也会出错:负样本的话题如果其实在资料里,模型答对了反而被判失败。写用例时要先在资料里搜一遍,确认它真的没有。

打个比方

像一份有标准答案的模拟卷:每次复习完做一遍,分数说话,不靠"感觉好像进步了"。

在这个网站里

兄弟项目里的知识库 Agent,先写好 25 条用例(正样本 15 条、负样本 10 条)再写代码,通过标准是正样本 90% 以上、负样本全部拒答。后来又把维护者写的正式答案也变成用例:第一次跑,2 条过了 1 条,没过的那条漏了一个关键要点(第 25 课)。

容易搞混的地方

常见误解

评测通过率 100%,说明 AI 没问题了

正确理解

只说明它通过了这几道题。题出错了、判定写宽了,通过率照样好看。

常见误解

把 AI 答得好的回答直接存成标准答案

正确理解

那只是它这一次碰巧答对。标准答案要由人确认过,才是可靠的期望值。

你可以这样告诉 AI

复制下面这段,贴给你的 AI

先帮我列出评测用例:哪些问题必须答出来、要命中哪些要点和出处;哪些问题资料里没有、必须拒答。每条负样本,先在资料里搜一遍,确认真的没有。

先知道

  • 大模型——一个读过海量文字的续写程序:给它一段开头,它按概率一个词一个词地往下写。
  • 验收标准——事先约定的、能逐条检查的完成条件:满足了就算做完,不满足就没做完。

接着看

  • 回归——原本正常的东西,因为一次改动又坏了。它不是新功能的 bug,而是"倒退"。
  • 日志——程序运行时记下的流水账:什么时候、发生了什么、出了什么错。事后排查全靠它。

在这些课里出现