kp-025 · 私有化部署与模型选型:成本、算力与数据安全
一句话定义
金融大模型的部署决策是在"能力、成本、数据安全、合规"四角上权衡:云端 API、私有化部署、混合模式各有适用域,本知识点给出选型框架、算力与量化常识,以及"何时根本不需要微调"的判断法。
为什么重要
部署选型是金融大模型项目最先发生且最难逆转的决策:选错形态(该私有化的走了 API,或反之)会推翻下游所有工程。金融机构的特殊约束使这道题比一般行业更硬——客户数据与内部制度往往不允许出域(数据安全与监管要求),算力预算以千万计,而业务方对效果的期待由公开模型树立。掌握本知识点,能以结构化框架参与选型评审:知道每个维度的量级、知道哪些环节省钱的杠杆最大(量化、RAG 优先、提示优化先于微调)、知道合规要求如何转化为技术方案(脱敏、审计、不出域)。
前置知识
kp-021(RAG 优先策略的语境)、kp-024(合规约束作为需求输入)。
直观类比
部署选型像选择办公方式:云端 API 是"租共享办公室"(开箱即用、按月付费,但文件要放别人家);私有化部署是"自建办公楼"(数据不出门,但装修与物业全自担);混合模式是"核心资料放自家保险柜、一般事务去共享空间"。而"是否微调"像"是否为员工定制培训体系"——多数时候,先把岗位职责说明书(提示)与资料室(RAG)弄好,比大规模培训便宜有效得多。
核心概念
- 三种形态:云端 API(最快起步、按量付费、数据出域)、私有化部署(数据不出域、算力与运维自担)、混合模式(敏感数据走私有、通用任务走云,需清晰的数据分级路由)。
- 选型五维:能力(基准测试+自有金标集实测,公开榜单不等于本任务表现)、上下文长度(金融文档长,长上下文直接影响 RAG 组装策略)、中文金融语料表现(术语、表格、财务口径的理解质量)、许可证与合规(商用授权、备案要求、供应商锁定)、生态(推理框架、工具调用支持、社区与维护)。
- 算力常识:推理显存 ≈ 参数量 × 精度字节数(FP16 约 2 字节/参数、INT8 约 1、INT4 约 0.5)加 KV 缓存开销;70B 级模型 FP16 推理需百 GB 级显存(多卡),INT4 量化后可压入单张高端卡——量化的代价是小幅精度损失,需用金标集验证。
- 量化(quantization):把权重从 FP16 压到 INT8/INT4,换显存与速度;生产部署的主流选择,前提是过评测回归。
- 微调策略:全参微调(贵,一般不必要)→ LoRA(低秩适配,只训练极少量新增参数)→ QLoRA(LoRA+量化基座,消费级算力可做实验);先问要不要,再问怎么做。
- "何时不需要微调"判断法:知识型缺口 → RAG 解决;格式与行为缺口 → 提示工程解决;只有当"任务的语言风格/领域模式系统性偏离"且提示+RAG 均达不了标时,才启动微调——微调引入的维护成本(基座升级需重训)常被低估。
- 数据安全工程:数据分级与路由(什么级别的数据允许去哪)、脱敏与匿名化(进入模型输入前)、提示词与输出的审计日志、供应商数据处理协议(云端形态)。
原理与机制
为什么"RAG 优先"是金融场景的默认序:金融大模型需求的主要矛盾是知识时效与可溯源,而 RAG 恰好在这两点上是确定性方案(换文档即更新、引用即溯源),微调在这两点上反而有先天缺陷(知识冻结在训练时点、无法逐句溯源);且 RAG 的边际成本(加文档)远低于微调(重训)。为什么量化能省一半以上显存:显存占用与参数存储字节数线性相关,FP16→INT4 字节数降为 1/4;大模型权重分布对低位宽的鲁棒性较好,使得精度损失可控——但"可控"必须由评测证明,不能默认。为什么选型要看"自有金标集"而非榜单:榜单反映通用能力分布,金融任务的成功率由领域术语、口径与格式遵循决定,只有自己的评测集(kp-022 的评测纪律)能预测生产表现;榜单适合初筛,不适合决策。
公式或模型
图示
需求四角: 能力 ←→ 成本
↕
数据安全 ←→ 合规
决策序(金融默认):
① 先提示工程(最便宜) → ② 再 RAG(知识/溯源)
→ ③ 仍不达标才微调(LoRA 起步) → ④ 形态选择:
敏感数据强制不出域 → 私有化(量化压缩算力)
无敏感约束 → 云端 API 起步
混合 → 分级路由 + 脱敏 + 审计
实例或案例
一家券商的选型复盘(教学化描述):项目目标为内部投研助手。初版方案直接采购某旗舰模型私有化全参微调,预算评估后调整路径:第一步用云端 API+脱敏数据验证任务可行性(提示工程+RAG,两周出金标基线);第二步确定 80% 任务在"通用模型+RAG"下达标;仅研报风格改写类任务不达标,用 LoRA 在开源基座上微调(单机多卡即可);最终形态为混合模式——脱敏后的通用问答走 API,涉密投研数据走私有化部署的量化模型,两端共用同一套评测集。复盘结论:直接全参微调私有化的原始方案预算约为最终方案的四倍,而达标任务比例并无优势——"决策序走对,预算省一个量级"。
常见误区
- 误区一:金融数据敏感,所以必须微调专属模型。 敏感性决定的是部署形态(不出域),不是训练方式;RAG+提示在私有化部署上同样可行,微调与私有化是两个正交决策。
- 误区二:参数越大效果越好。 超过任务阈值后,更大参数主要转化为更高成本与延迟;选型看自有金标集上的达标线与单位成本,不看模型自豪感。
- 误区三:量化是免费午餐。 量化降低精度与某些边界能力(长尾指令遵循、复杂推理),必须过金标回归;"压了就能用"与"压了不能用"都需评测证据。
自测题
- 三种部署形态与选型五维各是什么?
答案要点:云端 API/私有化/混合;能力、上下文长度、中文金融表现、许可证合规、生态。
- 推导 FP16→INT4 的显存节省比例及其验证要求。
答案要点:每参数字节 2→0.5,权重显存约降 75%(不含 KV 缓存);必须过金标回归验证精度损失可控。
- 给出"何时需要微调"的判断序。
答案要点:知识缺口→RAG;行为格式缺口→提示;两者皆不达标且属语言风格/领域模式偏离→LoRA 起步微调。
与其他知识点的关系
kp-021 的 RAG 优先策略是决策序的核心;kp-024 的红线与留痕要求转化为部署侧的审计设计;kp-026 把部署方案纳入模型风险管理的文档与验证范围;kp-022 的评测集是本知识点所有决策的证据来源。
延伸阅读
- Hu et al.(2021):"LoRA"——参数高效微调的奠基论文。
- Dettmers et al.(2023):"QLoRA"——量化基座微调的代表工作。