跳转到主要内容 / Skip to main content
FDE 指南
FDE 实战方法

第六步:使用真实样本评测

FDE 八步法第六步:用真实业务样本评测效果,用数据说话,而不是凭感觉。

作者:FDE 指南编辑组类型:指南框架发布:最后更新:

先说结论

Demo 里跑通 3 个例子不算数。要收集几十上百个真实样本,测出完成率和错误率,才知道方案到底行不行。

企业工作示例

合同审查助手项目。团队收集了 80 份历史合同做测试,发现:常见条款问题 AI 识别率很高,但"补充协议与主合同冲突"这类问题经常漏检。于是调整方案:AI 负责常规条款筛查,补充协议必须人工复核。如果不做真实样本评测,这个坑要到出事故才会暴露。

操作步骤

  1. 收集真实样本:向业务部门要 30-100 个历史真实案例,覆盖常见情况和典型边界情况。
  2. 标注标准答案:请业务专家给出每个样本的正确结果。
  3. 跑批量测试:让 MVP 处理所有样本,记录每一个的结果。
  4. 算指标:完成率、错误率、节省时间,和第四步定的成功指标对照。
  5. 分析错误:把错误分类——是数据问题、规则问题,还是 AI 能力边界问题。

评测要看什么

看什么为什么
完成率AI 能独立处理的比例
错误率出错的比例,以及错误的严重程度
错误类型决定是改 prompt、改流程,还是加人工环节
节省时间和基准值对比,验证业务价值

模板见 真实样本评测表

常见错误

  • 用编造的数据测试:编的数据太干净,测不出真问题。
  • 只测成功案例:专挑 AI 答得好的例子,自欺欺人。
  • 没有标准答案:没法判断对错,评测就失去意义。
  • 测完不改进:评测的目的是找到改进方向,不是给自己打分。

检查清单

  • 测试样本来自真实业务,数量足够(至少 30 个)
  • 每个样本有业务专家确认的标准答案
  • 记录了完成率、错误率和错误分类
  • 评测结果和预先定义的成功指标做了对照
  • 根据错误分析制定了改进措施

下一步

第七步:接入系统并小范围上线