「RAG」相比直接微调 LLM,RAG 解决了什么问题?微调和 RAG 各自的优劣势是什么?
0 前言
本文内容整理自公众号「小林面试笔记」的文章 3. 相比直接微调 LLM,RAG 解决了什么问题?微调和 RAG 各自的优劣势是什么?,用于记录与总结 RAG 相关的核心面试知识点。
「相比直接微调 LLM,RAG 解决了什么问题?微调和 RAG 各自的优劣势是什么?」,可以这样作答:
微调和 RAG 解决的不是同一层面的问题,不是谁替代谁的关系。微调是改模型参数——拿自己的数据让模型继续训练,把知识直接"烧"进参数里,适合定制输出格式、行业语气、培养深度专业能力;RAG 是不改参数——把知识放在外部知识库,推理时实时检索相关片段注入 prompt,让模型照着资料回答,适合知识频繁更新、需要答案可溯源的场景。
判断标准很清晰:知识库类问答首选 RAG,成本低、加完文档就生效、回答可溯源;要模型学会特定的输出格式或行业语气,微调更合适。两者并不冲突,还能组合使用:先微调让模型学会"怎么说",再用 RAG 提供"说什么"的具体内容。
1 同一问题的两种解法:改参数 vs 不改参数
聊微调与 RAG 之前,先回到一个根本前提:LLM 的「知识」到底是什么。
大模型的知识是训练时从海量文本里学来的,最终以权重参数的形式固化在模型里。你可以把它理解成把知识烧进了 ROM——训练完成的那一刻,这些知识就被"刻死"了,不会自己更新。想知道训练截止日期之后的事?抱歉,参数里没有。
理解了这一点,微调和 RAG 的本质就浮出水面了:这两个方案其实在解决同一个问题——怎么把模型训练时没学到的知识给它补上。只不过思路截然相反:一个直接改参数,让模型把新知识"记"进去;一个不动参数,留到推理时现查现用。

这也是这道面试题最核心的答法:先别急着对比优劣,先讲清两者根本不在同一层面。
2 微调(Fine-tuning):把知识直接烧进模型
微调是直接改模型参数的方案:拿着自己的业务数据,让模型继续训练一段时间,把新知识"记住"。思路很直白——既然参数里没有,那就把参数改一改,改到有为止。
2.1 微调的优势
- 效果彻底:知识从模型内部改变,不是外部拼接,整个模型的行为都会被重塑;
- 深度定制:专业词汇、输出格式、回答风格都能按需塑造,让模型"像你这个行业里的人";
- 延迟低:推理时不需要额外的检索步骤,问完直接答,响应速度最快。
2.2 微调的代价
优点很诱人,但代价同样实在:
- 成本高:要准备标注数据、租 GPU、跑训练,人力财力都是实打实的投入;
- 知识更新难:业务数据每周都在变,可每次微调都要几小时甚至几天的训练,总不能每周都来一遍;
- 答案不可溯源:回答来自参数,你永远不知道它是基于哪条知识算出来的,出了问题也没法定位。
这里还有个常见的认知误区:很多人以为微调之后模型就"懂"了你的业务知识,其实它只是记住了训练数据里的模式——它到底记住了什么、记错了什么,你根本无从得知。

3 RAG:不改参数,推理时现查知识
RAG 走的是完全相反的路:模型参数一动不动,把知识放在外部,用到的时候再查。前两篇我们详细拆解过它的流程——文档入库 → 提问时检索相关片段 → 拼进 prompt → 模型照着资料回答。
3.1 RAG 的优势
- 更新即时生效:知识库更新只需往向量库里加文档,加完就能用,不需要重新训练;
- 答案可溯源:回答可以附上来源 chunk,出错能立刻定位是哪条知识有问题;
- 成本低:小团队用 OpenAI Embedding + Chroma 就能把整套系统跑起来。
3.2 RAG 的不足
- 检索延迟:整体响应比纯 LLM 多出几百毫秒到一秒,对实时性要求极高的场景要注意;
- 检索质量卡住上限:生成层只是在复述和整理检索到的内容,检索不到的知识,LLM 再强也"变"不出来。所以 RAG 系统调优的主战场永远是检索这一层,而不是换更贵的模型——很多人一上来就想着升级模型,往往是南辕北辙;
- 复杂推理提升有限:RAG 提供的是"参考资料",如果希望模型对某个领域有更深的推理能力,还是得靠微调。

4 组合使用:微调解决「怎么说」,RAG 解决「说什么」
两个方案各有短板,而短板恰好互补——所以实践中真正的主流用法是组合出拳:
先对基础模型做一轮微调,让它学会输出格式、语气风格、行业术语;再用 RAG 来提供具体的知识内容——微调解决「怎么说」,RAG 解决「说什么」,各司其职。
把两者放在同一张表里看,各自的定位就非常清楚了:
| 维度 | 微调(Fine-tuning) | RAG |
|---|---|---|
| 知识更新 | 要重新训练,成本高、周期长 | 更新知识库即可,实时生效 |
| 推理延迟 | 低,没有额外检索步骤 | 较高,多一次检索耗时 |
| 实现成本 | 高,需要 GPU 和标注数据 | 低,向量库 + Embedding 即可 |
| 答案可溯源 | 不支持,答案来自模型参数 | 支持,可追溯到具体 chunk |
| 适合场景 | 定制输出风格、培养深度专业能力 | 私有知识问答、数据动态更新 |
| 知识上限 | 受限于训练数据的质量与规模 | 受限于检索质量与 context 长度 |

5 面试总结
这道题最忌讳的就是**「二选一」思维**——微调和 RAG 不是竞争关系,而是两条不同层面的路径。答题按三步走:
- 先说本质:微调是改模型参数,RAG 是不改参数、推理时注入知识,两者不在同一层面,不是替代关系;
- 再各说优劣:微调擅长定制输出风格、培养深度专业能力,但成本高、更新慢、不可溯源;RAG 擅长知识频繁更新、答案可溯源的场景,但多了检索延迟,且检索质量卡住效果上限;
- 最后提组合:微调解决「怎么说」,RAG 解决「说什么」,两者可以配合使用。
如果被追问"知识库问答为什么首选 RAG",标准回答是:成本低、更新即生效、答案可溯源,企业私有知识问答的三个硬需求它全占了;如果被追问"RAG 有什么缺点",别忘了检索延迟、检索质量上限、复杂推理提升有限这三点。
参考
本文图片均来源于公众号「小林面试笔记」,版权归原作者所有。