AI试点验收不能只有“回答准确率达到某个数”的一句要求。需要说明统计哪些任务、什么算正确、哪些错误不能接受,以及结果由谁核对。同一套数字也不能直接用于内部摘要与能修改订单的智能体。

把验收对象写成可执行任务

以售后资料查询为例,任务可定义为:员工提出问题,系统在许可资料中检索,回答保留适用条件并展示有效出处。输出内容看起来合理,却引用了旧版本,仍属于失败。若是创建待办,还要核实任务是否真的进入业务系统,不能只看模型宣布完成。

准备四类固定样本

  • 正常任务:有明确资料与结果,覆盖真实高频问题。
  • 资料不足:答案不在已批准资料内,系统应说明不足。
  • 权限限制:用户试图查询无权访问的资料,服务端应拒绝。
  • 异常链路:接口超时、重复提交或资料更新后,系统能合理处理。

样本由业务人员提供,标准答案标注来源。调试使用的题目与最终验收题目适当分开,避免只为熟悉样本优化。问题集合也要覆盖简称、口语与不同输入长度,而不是只测试最规范的问法。

指标分别衡量什么

事实准确性核对内容,来源可追溯性核对依据,操作成功率核对系统状态,人工修改时间衡量能否节省实际工作。响应时间与费用作为运行指标单独记录。资料泄露、误付款等严重错误不宜用大量普通成功任务平均掉,应按业务后果单列放行条件。

验收记录如何保留

记录任务输入、资料版本、模型与提示词版本、结果、人工判定和失败原因。修改系统后回放同一组问题,确认改进没有破坏原来可用的任务。试点规模和通过门槛由企业负责人确认;没有真实样本支持时,不承诺固定准确率。

技术参考:OpenAI评估实践。具体指标仍应根据本企业任务制定。

延伸阅读:企业AI项目规划:试点、需求、ROI与验收