我们在垂类深度推理场景中的技术路线是:选好基座 → SFT垂类知识学习→ RAG补知识,全程未引入CPT和RL。
核心判断是:当模型参数量受限、垂域知识量较大时,仅靠微调让模型内化知识存在瓶颈。RAG将"闭卷考试"变为"开卷",收益远高于继续堆训练手段。
从工程效率角度,这条路线的优势在于:(1) 训练成本低,省掉了预训练开销和RL的高算力消耗;(2) 迭代效率高,检索策略的优化比重新训练一轮模型快得多;(3) 可维护性好,知识库可以独立更新,减少反复微调。
实践中检索召回质量是核心变量。我们采用向量检索方案,在结构化领域知识的召回精准度上表现稳定,优于传统向量检索。
结论:对于参数量受限的垂域深度推理场景,SFT+RAG是当前性价比最高的技术组合,在RL上继续投入不是最高优先级。