自动化跑起来的第一周,效果通常让人满意。三个月后出问题,多半是没人盯准确率,模型本身倒没变差。

抽检比例按出错代价定

不用全量人工复核,那等于没省人力。按业务风险分档抽检更实际:对外发送的内容、涉及金额的单据、进入申报流程的数据,抽检比例给到 10% 到 20%,甚至逐份过;内部参考用的摘要、分类、提醒,按 1% 到 5% 抽就够。抽样别只挑月初的好数据,月末、季末业务量大的时段更要覆盖。

抽检结果记录下来,形成一条准确率曲线。判断标准提前定,比如连续两周低于 95% 就触发排查,不要等业务部门抱怨了再动。抽检样本要带编号留档,出问题时能翻回去看当时识别成什么样,只记一个正确率数字,排查时等于没有依据。

成本也要一起看。识别一次的成本、人工复核一次的工时、出错返工一次的代价,三项加起来才是真实账。自动化的价值来自规模,量小的时候准确率稍低一点也划算,量上来之后错误率低于某个线就必须停掉返工。

错误分类:是模型的问题还是数据的问题

同一类错误集中出现,先查输入。很多"AI 识别不准"的抱怨,根子在源系统的字段缺失、编码不一致、同一客户三种写法。把数据源头清一遍,准确率往往立刻回升,这类修复比换模型便宜得多。

确认是模型侧的问题,再看是提示词没写清、样本不足,还是任务本身超出能力范围。前两种可以通过补充说明和样例改进,第三种就该老老实实把这一步退回人工,不要硬撑。

回退机制和人工兜底

每一条自动化流程都要留退路。单据审核类,设一个"待人工处理"队列,置信度低或字段缺失的直接进去,不静默丢弃。对外沟通类,改成先生成草稿再人工确认发送,比直接代发稳妥。

回退还有一个常被忽略的部分:执行记录。哪一版流程、什么时候上线、改动内容是什么,按版本留档。出现批量错误时能快速回滚到上一版,这比逐条排查省事。

谁来负责这件事

自动化上线不等于交出去。明确一个人负责准确率,每月出一份简短报告,写清抽检量、错误率、已修问题、待修问题。这项工作要求不高,但少了它,系统会以很慢的速度悄悄退化,等发现时已经积累了一批错数据。

天蓬数科 · 本站解读
天蓬数字科技独立解读 · 非官方意见 · 仅供企业参考

办公自动化的准确率要靠机制盯。天蓬数字科技交付的定制系统里,凡是自动识别、自动分类的环节都带抽检记录和人工复核队列,客户能随时看到当期识别量和返工量,不用等业务部门投诉才发现问题。

—— 天蓬数字科技 · 企业服务研究团队