跳转到主要内容 / Skip to main content
FDE 指南
模板与工具

真实样本评测表模板

用真实业务样本评测 AI 效果的表格模板:样本记录、结果对比、错误分类、指标汇总。

作者:FDE 指南编辑组类型:参考资料发布:最后更新:

怎么用这份模板

配合八步法的 评测步骤 使用。核心原则:样本必须真实、标准答案必须由业务专家确认、错误必须分类

第一步:样本记录表

每个测试样本一行:

编号样本描述来源类型(常见/边界)标准答案(业务专家填)
001某客户询价 A 产品 100 件2024 年报 Email常见报价 12,000 元,交期 2 周
002含特殊折扣条款的合同历史合同库边界需人工审核折扣条款

样本数量建议 30-100 个,常见情况和边界情况都要有。

第二步:结果记录表

编号AI 输出结果(正确/部分正确/错误/无法处理)人工修正耗时备注
001报价 12,000 元正确0
002直接给出折扣价错误10 分钟未识别特殊条款

第三步:错误分类表

把"错误"和"部分正确"的样本归类:

错误类型数量例子改进方向
数据缺失查不到客户历史价补数据源
规则未覆盖特殊折扣条款补充规则 / 转人工
AI 理解错误误解产品型号改 prompt / 加示例
边界情况金额超出范围设定自动转人工条件

第四步:指标汇总表

指标结果成功标准是否达标
完成率(正确+部分正确)开工前约定的值
错误率
单次节省时间
单次成本

第五步:评测结论

用三句话写结论:

  1. 这个方案在哪些场景下表现好?
  2. 在哪些场景下不可靠,怎么兜底?
  3. 建议:进入试点 / 改进后复测 / 停止?

常见错误

  • 用编造的干净数据测试,上线后傻眼
  • 只记录"对了多少",不分析"错在哪"
  • 没有业务专家确认标准答案,评测变成自说自话

你现在可以做什么

  1. 向业务部门要 30 个真实历史案例
  2. 请业务专家标出标准答案
  3. 跑一遍批量测试,按上面的表格记录,得出评测结论