选模型之前先回答一个更基础的问题:要处理的文本能不能离开企业内网。这个问题的答案,基本决定了技术路线。

先看数据能不能出域

涉及客户个人信息、财务数据、未公开的技术文档,按《个人信息保护法》和《数据安全法》的要求,处理环节越少越安全,通常不适合直接送到公有云接口。反过来,公开资料的摘要、通用文案的润色,用外部接口成本低得多,没必要自己搭一套。

判断标准可以落到具体字段上。把要处理的数据列一张表,逐项标出敏感等级。敏感字段占比超过三成,私有化部署的必要性就成立。

三种路线的成本结构

直接调用外部接口按量付费,没有硬件投入,适合试水阶段。缺点是长期成本随用量线性上涨,且数据出域。

开源权重本地部署是一次性投入加持续运维。硬件是主要支出,能跑动 7B 到 14B 参数模型做推理的服务器,采购成本视显存配置而定,市场报价差异较大,以实际询价为准。运维要有人懂容器和推理框架,这部分隐性成本常被低估。

微调介于两者之间。通用模型在专业术语、内部规范上表现不达标时,用企业自己的语料做微调能明显改善。微调需要准备标注数据,几千条起步,这部分人力投入要提前算进去。

落地时的三个技术选择

推理框架上,vLLM、TGI 这类方案对并发支持较好,部署难度也适中。

量化能降低显存占用。4bit 量化通常能把显存需求压到原来的三分之一左右,代价是精度有轻微损失。具体影响要用企业自己的测试集验证,不能只看厂商给出的跑分。

上下文长度决定一次能喂多少材料。合同、年报这类长文档,上下文窗口不够就得切片,切片策略设计不好会丢关键信息。选型时把最长文档的字数作为硬指标,先定这个数,再挑模型。

并发量按峰值算。十个人同时用和一百个人同时用,硬件配置差好几倍。前期可以按实际使用人数的一半估算并发,留出扩展余量。

验收别只看跑分

部署完要拿真实业务数据测。准备一百条左右的内部问题,人工标出标准答案,跑一遍看准确率。低于预期时先排查提示词和切片策略,再考虑换模型或加微调。跑分高但业务问答答不准的模型很常见,这是选型时最容易交的学费。

天蓬数科 · 本站解读
天蓬数字科技独立解读 · 非官方意见 · 仅供企业参考

天蓬数字科技做私有化 AI 部署时,会先帮客户把数据按敏感等级过一遍,再决定哪些场景本地跑、哪些走外部接口,避免为不敏感的业务多买一套算力。模型选型和量化方案,我们会在部署前用客户真实数据跑一轮验证。

—— 天蓬数字科技 · 企业服务研究团队