RAG 是 Retrieval-Augmented Generation 的缩写,中文叫检索增强生成,是当下大语言模型(LLM)落地最主流的一种架构方案。它不是一个新模型,而是一种"让 AI 先查资料再开口"的干活方式。
一句话讲清
RAG = 先去外部知识库搜相关资料 → 把资料塞进提示词 → 再让大模型基于资料生成答案。
类比就是:普通大模型是"闭卷考试",RAG 是"开卷考试"。
为什么需要它(解决大模型的三个老毛病)
知识过期:大模型训练完就"冻结"了,不知道 2024、2025 年之后的新事,RAG 可以实时查最新文档。
幻觉胡说:问到训练集没有的内容,模型会编得有模有样;RAG 强制它"只看检索到的材料答",编造成本变高。
不懂私企数据:公司内部的制度、合同、工单,模型没训练过;RAG 把这些存进私有知识库,模型不用重训就能用。
标准工作流程(四步)
建库(离线):把 PDF、网页、企业文档切小块 → 用 Embedding 模型转成向量 → 存进向量数据库(如 Milvus、Qdrant、FAISS)。
检索(在线):用户提问时,把问题也转成向量 → 在库里找语义最相近的 Top-K 片段。
增强:把检索到的原文片段 + 用户问题,拼成一段带"参考资料"的 Prompt。
生成:大模型拿着"问题+资料"输出答案,好的 RAG 还会附上引用出处。
它为什么最近这么火
2020 年 Meta AI 在 NeurIPS 提出概念,2023 年后随 ChatGPT 普及直接成为企业级 AI 应用标配——据行业调研约 7 成企业 GenAI 项目用 RAG 做底座。
比"微调模型"便宜太多:知识更新只要改知识库,不用重训模型(重训一次可能几百万)。
客服、法律、医疗、金融研报、内部 Wiki 问答……凡是"答案必须靠谱、可溯源"的场景,基本都走 RAG。
一句提醒
RAG 不是银弹——检索质量拉胯,答案照样拉胯(垃圾进垃圾出);知识库没更新、切片切得烂、向量库召回不准,都会让效果翻车。