大模型进企业,最常见的开场是"先买一套试试"。买回来挂在内部系统上,用的人没几个,问起来就说"模型还在调"。问题往往不在模型本身,而在上线之前没定清楚什么叫"好用"。没有验收标准,项目就会一直处于"还在调"的状态。

先挑一个能验收的场景

内部知识问答是最容易起步的场景:员工查制度、客服查话术、销售查产品资料,输入是问题、输出是答案,效果好不好一眼能看出来。挑场景时避开两类:一类是容错率极低的(直接面向客户的自动回复,答错一次就丢单),另一类是数据量撑不起来的(知识库一共十几篇文档,不值得建)。从单部门、单业务线切入,比全公司铺开稳,试点部门最好选配合度高、问题集中的,方便把反馈收齐。

语料整理决定回答质量的上限

模型能力再强,喂进去的是过期文档、冲突口径,答出来的就是错话。上线前把知识库过一遍:删掉已废止的制度版本,统一同一事项的多种说法,扫描件要转成可检索的文字。文档要定责任人,制度更新了有人负责替换旧版,而不是新旧两份同时挂在库里。权限也要管:内部薪酬、客户信息不能对所有提问者开放,按角色设访问范围。

语料这步最枯燥,也最决定成败,多数落地项目的差距就是从这里拉开的。

用抽样测试和引用溯源验收

上线前抽一两百道真实问题,题目从历史工单和员工提问里来,高频问题和疑难问题都要覆盖,别只挑模型答得好的来测。人工标注标准答案后测回答准确率,达不到预期就回到语料上补。回答要能引用来源:给出答案时标注依据哪份文档,员工能点开核对,错了好追责。幻觉没法清零,设计上要让模型拿不准时明说"不确定",而不是编一段像模像样的回答。

先小范围试运行一两个月,记录答不上来、答错的问题类型,再决定要不要扩到全公司。员工用不用得起来是另一道坎:回答入口要放在员工本来就在用的工具里,比如企业微信、OA,多跳一步使用率就掉一截。大模型落地不是装个系统就完事,验收标准定在开头,项目才不会烂在"还在调"里。

天蓬数科 · 本站解读
天蓬数字科技独立解读 · 非官方意见 · 仅供企业参考

大模型项目烂尾,多数烂在语料没人管、验收没标准。天蓬数字科技在为企业做软件定制时,遇到 AI 知识问答类需求,会先把语料责任人、权限范围和抽样测试方案定下来,再谈模型接入,上线后拿数据说话。

—— 天蓬数字科技 · 企业服务研究团队