产品规格与评测
AI 产品契约与评测
把“效果要好”拆成输入边界、合格结果和失败处理,让需求、开发与验收使用同一套条件。
- 本页重点
- 任务边界、结果契约与评测门禁。
- 公开边界
- 仅展示契约结构与判断,不含业务样本、内部字段或结果数据。
核心判断
格式、字段和权限先做硬约束;相关性、完整性和表达质量分开评测。
这里把契约拆成需求评审、开发和 QA 都能检查的字段、样例和判定条件,让争议回到具体证据。
从问题到验证
- 业务问题
- 任务契约
- 评测样例
- 发布判断
- 任务边界
- 明确系统负责什么,以及何时必须停止或转人工
- 结果契约
- 分开定义格式不变量、内容质量和引用要求
- 评测门禁
- 覆盖成功、边界、失败和降级路径,再决定是否进入下一状态
只保留结构,不含业务样本、内部字段或阈值。
谁需要这份契约
面向需要共同交付 AI 能力的业务、产品、研发和 QA。目标不是让模型在演示样例上显得聪明,而是让不同角色对“什么能做、什么算对、失败怎么办”拥有一致判断。
问题不只在模型
表面上是模型回答不稳定,真实问题往往是任务对象、数据范围、输出约束和验收责任没有被写进同一份产品契约。没有契约,模型问题、数据问题和需求问题会混在一起。
先分硬约束和质量评测
不使用单一准确率覆盖全部质量。可由代码确定的格式、字段和权限作为硬约束;相关性、完整性和表达质量进入分维度评测;证据不足和高责任动作保留人工确认。
用代表、边界和失败样例验收
以代表样例、边界样例和失败样例验证契约是否可执行。每个判定条件对应来源、责任角色和失败处理,避免只记录一个无法解释的总分。
检查清单
- 先写完成条件,再讨论模型能力
- 把不可变规则从 Prompt 中拿出来
- 让每个失败状态都有责任边界和下一步