你可能会说:
- “改了提示词之后,AI 是变好了还是变差了,怎么知道?”
- “换一个模型,回答质量会不会掉?”
它是什么
一条评测用例包括:问题、怎样算答对(必须出现的要点、必须引用的出处),以及它属于哪一类。答案在资料里、应该答出来的,叫正样本;资料里没有、应该拒答的,叫负样本。
先有正确答案,才谈得上好坏。标准答案最好由人确认过;判定也别比对整段文字,模型每次措辞都不同,比对几个关键要点就够了。
评测本身也会出错:负样本的话题如果其实在资料里,模型答对了反而被判失败。写用例时要先在资料里搜一遍,确认它真的没有。
打个比方
像一份有标准答案的模拟卷:每次复习完做一遍,分数说话,不靠"感觉好像进步了"。
在这个网站里
兄弟项目里的知识库 Agent,先写好 25 条用例(正样本 15 条、负样本 10 条)再写代码,通过标准是正样本 90% 以上、负样本全部拒答。后来又把维护者写的正式答案也变成用例:第一次跑,2 条过了 1 条,没过的那条漏了一个关键要点(第 25 课)。
容易搞混的地方
常见误解
评测通过率 100%,说明 AI 没问题了
正确理解
只说明它通过了这几道题。题出错了、判定写宽了,通过率照样好看。
常见误解
把 AI 答得好的回答直接存成标准答案
正确理解
那只是它这一次碰巧答对。标准答案要由人确认过,才是可靠的期望值。
你可以这样告诉 AI
复制下面这段,贴给你的 AI
先帮我列出评测用例:哪些问题必须答出来、要命中哪些要点和出处;哪些问题资料里没有、必须拒答。每条负样本,先在资料里搜一遍,确认真的没有。
接下来去哪
先知道
接着看
在这些课里出现