1 min read

垂类模型微调技术复盘:SFT+RAG

我们在垂类深度推理场景中的技术路线是:选好基座 → SFT垂类知识学习→ RAG补知识,全程未引入CPT和RL。

核心判断是:当模型参数量受限、垂域知识量较大时,仅靠微调让模型内化知识存在瓶颈。RAG将"闭卷考试"变为"开卷",收益远高于继续堆训练手段。

从工程效率角度,这条路线的优势在于:(1) 训练成本低,省掉了预训练开销和RL的高算力消耗;(2) 迭代效率高,检索策略的优化比重新训练一轮模型快得多;(3) 可维护性好,知识库可以独立更新,减少反复微调。

Prompt 的业务覆盖广度会决定系统召回的上限,SFT 与 RAG 在垂类识别任务中承担着截然不同的职责。SFT 是在既定推理范式内打磨模型识别精度,核心收益是提升准确率;在业务采用高置信度截断输出的场景下,SFT 能够把一部分原本低置信的正样本推到高置信区间,带来观测层面的召回提升,但如果放开全部置信度做全量评估,它本质依旧是优化判别的准确程度,并不会凭空拓展识别案例的覆盖范围。而 RAG 走的是另一条路径,它通过判例库做上下文定制补充,在同商品、同金额段、同履约模式的业务约束下,直接扩充模型可覆盖的 case,原生目标为拉高召回率,但引入外部检索上下文也会带来噪声风险,往往需要配套过滤策略来保障准确率。简单概括:SFT 主攻准确率,可间接带来召回提升;RAG 主攻召回,却要为准确率做额外约束。这也对应我们线上落地策略:优先依靠 SFT 把准确率提高,待判别逻辑固化之后,再引入 RAG 来补全召回缺口。

实践中检索召回质量是核心变量。我们采用向量检索方案,在结构化领域知识的召回精准度上表现稳定,优于传统向量检索。

结论:对于参数量受限的垂域深度推理场景,SFT+RAG是当前性价比最高的技术组合,在RL上继续投入不是最高优先级。