AI 问答库
一句话回答
取决于微调方式,差三个数量级。调语气和输出格式的轻量微调(LoRA 类),几百到几千条高质量样本就够;要让模型稳定掌握一整套行业表达,通常要上万条;继续预训练注入领域知识则按亿级 token 计,多数企业不该做。共同前提是样本必须人工确认过——把历史工单原样倒进去只会把过去的错误一起学走。
下表是常见开源微调实践的经验区间,按「中文业务文本、单一任务类型」口径给出,用于做方案初筛而不是精确规划。真实所需量跟任务难度、基座模型能力和样本多样性强相关——同样一千条数据,用来统一工单分类的输出格式可能绰绰有余,用来教模型写合规的法律意见书则远远不够。
| 方式 | 数据量级 | 适合解决什么 | 主要风险 |
|---|---|---|---|
| 提示词 + 少样本示例(严格说不算微调) | 5–50 条 | 先验证需求是否真实存在,当天就能试 | 提示词膨胀后每次调用都在付这部分成本,长了容易漂 |
| 参数高效微调(LoRA 等) | 数百到数千条 | 固定输出结构、统一术语与语气 | 样本太少或太同质会过拟合;对补充新知识基本无效 |
| 全参数监督微调 | 上万条起 | 整体迁移到一套差异较大的行业表达体系 | 算力与数据成本高;容易损伤通用能力,需回归测试 |
| 继续预训练(领域增量预训练) | 亿级 token 起 | 语料与通用语料差异极大的领域,如特定工业或专业文献 | 成本按训练集群计,多数企业投入产出不成立 |
| 偏好对齐(DPO 类) | 数千对偏好样本 | 两个答案都对但一个更好时的取舍 | 标注标准不统一就完全白做,一致性比数量更关键 |
大多数企业的第一批微调数据来自三个地方:历史工单与客服对话、内部审核过的标准文档、以及业务专家现场标注的样本。前两类量大但脏,后一类干净但慢。可行的做法是混合:先从历史记录里筛出一批被判定为「处理正确」的案例作为初稿,再让业务专家逐条改写成标准答案。判断一条样本是否可用有三个标准——输入是真实业务里会出现的形态而不是理想化的提问;输出是你希望模型每次都这么答的样子而不是「差不多就行」;同类问题的答法在整个数据集里保持一致。第三条最容易被忽略,也是最致命的:同一类问题在数据集里有三种不同答法,模型学到的就是随机三选一。
一,问题是不是真的需要微调。绝大多数「模型不懂我们业务」的抱怨,拆开之后是检索没做好,换成 RAG 当天就能改善,微调解决不了。二,有没有独立评测集。评测集必须和训练集完全分开,且由业务方而非训练者构造,否则你只能证明模型背下了训练数据。三,有没有回归测试。领域微调会挤压通用能力,训完要跑一遍通用任务确认没有明显退化。四,有没有回滚方案。微调后的模型上线要保留旧版本可切换,效果不如预期时能立刻退回。这四件事做齐了,即使第一次微调效果一般,也能知道下一步该往哪调;缺了任何一件,结果好坏都无法归因。
适用边界
同义问法