什么是 RAG?

RAG(Retrieval-Augmented Generation,检索增强生成) 是一种让大语言模型(LLM)在生成答案之前,先从外部知识库中检索相关信息的架构。简单来说:先查资料,再回答问题

传统 LLM 就像一个博学但记忆力停在训练截止日的教授——它知道很多,但不知道最新的新闻、你公司的内部文档、或者上周更新的产品手册。RAG 给这个教授配了一个图书管理员,每次回答前先去翻书。

RAG 是怎么工作的?

RAG 的核心流程分四步:

  1. 用户提问 — 用户输入问题,比如"公司Q3的营收目标是多少?"
  2. 检索(Retrieval) — 系统把问题转成向量,在向量数据库里找到最相关的文档片段
  3. 增强(Augmentation) — 把检索到的内容作为"参考资料"拼到 prompt 里
  4. 生成(Generation) — LLM 基于参考资料生成答案,并可以标注来源
用户问题 → Embedding → 向量检索 → Top-K文档 → Prompt拼装 → LLM生成 → 带来源的答案

为什么 RAG 这么重要?

1. 大幅减少幻觉(Hallucination)

2025 年的 HaluBench 2.0 基准测试显示,普通多跳 RAG 系统仍有 67% 的幻觉率。但结合 Agentic RAG(自主式 RAG)后,微软的方案将幻觉率降低了 89%。这不是小改进,是质的飞跃。

2. 让 LLM 拥有"实时知识"

GPT-4 的训练截止日期是 2023 年。没有 RAG,它不知道 2024-2025 年发生了什么。有了 RAG,你可以喂给它最新数据。

3. 企业级可控性

RAG 让企业可以精确控制 LLM 参考哪些文档,而不是让模型"自由发挥"。这在金融、医疗、法律等合规性要求极高的领域至关重要。

4. 可解释性

因为 RAG 能标注信息来源,用户可以追溯答案出自哪里——这在欧盟 AI 法案生效后更加重要。

2025 年 RAG 的最新发展

Agentic RAG(自主式 RAG)

传统 RAG 是"查一次就回答",Agentic RAG 则是让 AI 自主决定:要不要查、查几次、查什么、查到的东西够不够。Google 和微软都在 2025 年将 Agentic RAG 深度整合进了企业搜索产品。

GraphRAG

不是所有知识都能用向量相似度表达。GraphRAG 结合知识图谱,能处理实体之间的关系推理——比如"这家公司和那家公司之间有哪些关联交易?"

多模态 RAG

不只是文本。2025 年的 Visual RAG 能从工程图纸、产品目录图片、维修视频中检索信息,对话式回答关于产品规格的复杂问题。

上下文窗口再大也替代不了 RAG

2026 年智能系统峰会上有研究员声称"模型上下文窗口已经能装下整个文档库,RAG 过时了"。但企业架构师们的实际数据表明:上下文越大,模型在细节上的召回率越低。RAG + 精准检索仍然是正确路径。

RAG 的现实挑战

挑战 影响
向量数据库中毒(Context Poisoning) 攻击者植入恶意文档,污染检索结果
多跳推理幻觉 跨多个文档的查询准确率下降严重
合规与溯源 EU AI Act 要求能追溯每一段回答的数据来源
检索质量瓶颈 Garbage in, garbage out — 检索不到好文档,GPT 也救不了

RAG vs 微调(Fine-tuning):该用哪个?

场景 选 RAG 选微调
需要最新数据
需要特定领域风格
需要可溯源
数据频繁更新
预算有限

最佳实践:两者结合。用微调让模型学会领域术语和风格,用 RAG 注入实时数据。

结语

RAG 不是银弹,但在可预见的未来,它仍然是让 LLM 变得可靠、可控、可解释的最实用架构。2025 年的趋势很明确:RAG 正在从"一个检索插件"演变成 AI 应用的核心骨架

无论你是想搭建企业知识库问答系统、客户服务机器人,还是合规审计助手,理解 RAG 的原理和边界都是第一步。


参考资料:AWS RAG 文档、Wikipedia、TREC 2025 RAG Track、HaluBench 2.0 等