企业想用 AI Agent 处理内部知识,第一个拦路虎不是模型,是语料。把一堆文件直接喂进去,要么答非所问,要么把不该泄露的信息带出去。很多试点项目上线两周就弃用,根子就在语料没整理。
先盘一遍文档归属
能喂给 Agent 的,优先是公开资料、内部制度、产品手册这类低风险内容。合同、客户名单、薪酬表、身份证号这些属于敏感数据,按个人信息保护法要做分类管理,直接进通用大模型有合规风险。企业内部有保密要求的文档,应先确认授权范围再决定能不能用,权限不清就先别进库。
脱敏比想象中重要
即使文档允许内部使用,喂给第三方模型前也要去掉姓名、手机号、身份证号、银行账号等字段。个保法要求处理个人信息遵循最小必要原则,能不提供的字段就不提供。涉及生物识别、行踪轨迹等敏感个人信息的,还要单独同意,这类数据建议一律不进外部模型,宁可让 Agent 答不了相关题,也别赌泄露。
语料要有人维护
Agent 的答案质量取决于语料新鲜度。制度改了、产品下线了,旧文档还在知识库里就会误导回答,甚至给出已废止的流程。安排一名业务人员定期更新和撤下过期文件,比上线时一次性导入更重要。知识库准确率这类指标,可以粗算:抽样 100 个问题看答对几个,作为上线前的验收基线,低于预期就先补语料再开放。
语料准备做扎实,Agent 才不会一本正经胡说。天蓬数字科技在帮客户落地 AI 应用时,会先做数据分级和人员授权梳理,再把可公开内容接进系统,既释放效率又守住合规底线。
先小范围试点再铺开
语料准备好也别急着接核心业务。选一个低风险、高频的场景先跑,比如内部 FAQ 或制度查询,跑通再扩。试点期保留人工复核,把答错的案例记下来回流进语料,准确率才能滚雪球。直接把 Agent 接到合同审批、资金支付这类环节,一旦出错代价太高,不值得冒进。
另一个现实问题:员工会不会用。再好的 Agent,没人愿意问也白搭。上线前做一页操作说明,挑几个真会用到的人带头用,比群发培训邮件有用。遇到答错的,鼓励员工反馈而不是默默不用,反馈多了语料才准。工具采纳率本身也是验收指标之一,别只看技术指标。
AI Agent 落地的第一道关不是技术,是数据和授权。天蓬数字科技帮客户做 AI 应用时,先梳理数据分级和人员授权,再把可公开内容接进系统,既释放效率又守住个保法底线,避免模型一本正经泄密。