AI 评测不是一张准确率表
一个 AI 功能准备上线时,团队最容易问:“准确率多少?”这个问题看似客观,却经常把复杂决定压缩成一个无法承担责任的数字。
同样的平均分,可能对应完全不同的产品:一个在常见问题上稳定,却偶尔越权;另一个严格守住权限,但在证据不足时经常请求人工。谁更适合上线,取决于任务风险、失败去向和业务目标,而不是小数点后的差异。
评测不是为了给模型排名。它是一套帮助团队决定继续、缩范围、回退或停止的系统。
先定义“做对了”是什么
如果任务边界不清,评测只能测到表面。对一个带证据的问答功能,“回答通顺”不等于做对;至少还要看是否使用了适用来源、证据不足时是否拒答、用户是否能核对、越权材料是否被隔离。
对一个会调用工具的 Agent,最终内容正确也不够。它可能用了错误对象、重复执行写操作,或者在用户取消后继续运行。结果分数掩盖了过程风险。
所以,评测定义应当从任务合同推导:目标结果、不能破的边界、允许的退路和完成证据分别是什么。
五层指标,回答五种不同问题
任务结果看用户的核心工作是否完成,输出是否正确、完整、可核。
过程质量看检索、工具、结构解析、状态迁移和循环中的哪一步造成差异。
产品体验看用户是否理解、采纳、修改、放弃或转人工,以及原因是什么。
业务价值看产品是否改变了周期、返工、风险发现或人工负担,而不是只增加一次生成。
风险与资源看越权、泄露、危险动作、延迟、稳定性和单位成本是否在边界内。
这五层不能混成一个总分。过程指标帮助定位,业务指标帮助判断价值,风险指标决定能否继续。它们的责任不同。
测试集要包含系统不愿看到的样本
只从正常历史数据随机抽样,通常会高估产品。真正有决策价值的测试集,应当主动加入边界与反例:资料缺失、来源冲突、对象版本变化、超长输入、权限不足、工具超时、用户取消、危险指令和结果未知。
样本还要按来源和目的分层。主流程集检验基本能力,边界集检验稳健性,权限集检验最小权限,恢复集检验失败去向,历史回归集确保修复没有破坏旧能力。
每条样本都需要可判定的期望行为。不是所有问题都应“答对”;有些正确行为就是拒绝、澄清、暂停或转人工。
Bad Case 不是 Prompt 工单
结果出错后直接修改 Prompt,是最常见也最昂贵的捷径。一个 Bad Case 可能来自任务定义错误、源知识过期、权限过滤失效、工具返回异常、上下文压缩丢字段、模型判断偏差或页面误导。
正确顺序是从最终错误向前找第一次偏离。事实没进系统,就补知识或数据;规则明确却未执行,就补确定性控制;工具结果未知,就修状态与对账;只有偏离确实发生在语言理解或生成时,Prompt 或模型调整才是合适动作。
每次修复都应写成可检验假设:观察到什么、认为根因在哪一层、做哪个最小改动、可能伤到哪里、用哪些样本验证、失败时如何回退。
回归集记录的是团队学到的东西
有代表性的 Bad Case 修复后,应进入回归集,并绑定对应需求、风险和版本。这样模型、Prompt、知识、规则或工具任一变化时,团队都能检查旧问题是否重新出现。
回归集不是失败截图仓库。样本需要去重、分级和淘汰;已经由确定性规则彻底封死的问题,可以转为更便宜的自动测试。仍依赖语义判断的样本,则保留统一评分说明和必要复核。
没有回归,所谓持续改进只是持续忘记。
发布门不能用平均分冲掉硬风险
一张总分表很方便,却会产生危险的补偿逻辑:常见问题表现更好,似乎可以抵消一次越权;文案更流畅,似乎可以抵消证据缺失。
真正的发布门应该有优先级。高影响错误、权限越界、危险外部动作和无法回退的状态错误属于硬门;任务质量、采用、延迟和成本可以在明确边界内权衡。任何硬门失败,都应回到修复、降级或缩范围。
Gate 的输出也不只有通过和失败。它可以决定继续小范围、关闭某项工具、只保留草稿能力、增加人工确认,或者停止项目。评测因此成为产品设计的一部分,而不是上线前的考试。
评测系统也要防止被刷分
当团队只追一个指标,系统会自然朝那个指标优化。测试集被反复查看,模型和提示词可能记住评分偏好;人工评分知道新旧方案身份,也会产生期待偏差;版本中途变化,却被混在同一张表里。
评测需要版本化输入、盲评或抽查、冻结回归、分歧记录和独立护栏。用模型做裁判时,同样要校准裁判并抽样复核。分数越自动化,越要知道自动化没有覆盖什么。
好评测交付的是决定
一份成熟评测报告不应停在“平均分提升”。它要说明哪些用户和任务可以进入下一阶段,哪些能力被关闭,哪些失败仍需人工,单位成本和等待是否可接受,什么新证据会改变当前结论。
评测的价值不是证明 AI 很聪明,而是让团队在不确定性中作出可追溯、可回退的决定。准确率可以是证据之一,但永远不该是责任的替身。