文章目录+
01 / 人工智能
先找,再写
它解决的不是模型变得全知,而是让答案在当下多一份可追溯材料。
RAG demo 最常见的一幕,是模型引用一段公司政策,大家点头;真正麻烦的版本,是它引用了去年那份政策,而且讲得完全没有破绽。
如果同一份政策有三个版本,检索器找到旧版,模型写得越流畅反而越危险。切段太细会失去例外条款,切得太粗又会把无关内容一并送入,排名不对时更会漏掉真正答案。
02 / 人工智能
文件先被切碎才容易寻找
PDF、网页和手册通常会被抽取文字、分段、转成向量,再放入索引。切得太大,一段内混入太多主题;切得太小,条款的前提和例外被拆散。
RAG 的第一个隐藏决策不是选哪个模型,而是「一段资料的边界在哪里」。
文件库不是仓鼠笼,丢得越多不代表找得越准。标题、版本、权限和切段,一样会影响结果。
所以一次成功回答,不代表系统可靠。要测的是:问题换写法时还找不找得到、文件改版后会否淘汰旧内容、没有权限的员工会否看见不应看的段落。
03 / 人工智能
搜寻的是相似,不一定是真正需要
向量检索擅长找语义接近片段,但问题中的名字、日期、否定词和精确编号可能需要关键字或结构化查询。最像的段落不一定含答案;含答案的段落也可能用完全不同字眼。
成熟系统常混合检索、重排并保留 metadata,而不是只取头三个相似结果。
我会把『揾不到』当成一种成功的安全状态,而不是逼系统一定要答。
引用只表示系统找过某段资料,不代表答案每一个推论都由它支持。要把主张和原文逐项连起来,必要时展示页码、段落或版本。
04 / 人工智能
错误可能在模型开口前已发生
如果检索器找错版本,模型可以非常忠实地根据错资料回答。这种失败尤其危险,因为答案有引用、看似「有根据」。
评估 RAG 要把 retrieval recall 和 answer faithfulness 分开:先问正确证据有没有被找回,再问答案有没有超出证据。
05 / 人工智能
更新容易,不代表治理容易
外部索引可随文件更新,确实比重新训练模型灵活。但重复文件、权限、删除、有效日期和版本冲突都会进入检索层。
若离职员工仍可透过语义搜寻找到旧机密,答案准确也不代表系统正确。权限必须在检索前生效。
06 / 人工智能
最好的 RAG 有勇气不回答
当没有足够片段、来源互相冲突或问题超出文件范围,系统应显示不足并要求澄清。RAG 的价值不是令 AI 永远有答案,而是把「答案可以从哪里来」收窄到一个可检查的范围。
评估不能只问答案像不像
RAG 应至少拆成四个测试:正确文件能否被取回、排序是否把它放到模型看得见的位置、答案是否忠于片段、引用是否真的覆盖该句主张。最终答案看似正确,可能只是模型靠内部知识猜中,检索其实完全失效。
若只评答案,系统会在资料更新那天突然暴露问题。
表格、扫描 PDF 和广东话会改变结果
很多企业文件不是干净段落,而是表格、页眉、扫描图、双栏排版及中英混合。文字抽取一旦把栏位次序打乱,之后 embedding 再精准也只会找到破碎证据。
香港语境还有书面中文、粤语口语、英文缩写和不同公司名写法。真正的 RAG 工程常有大量工作发生在模型之前:OCR、清洗、别名、版本和 chunk 边界。
07 / 人工智能
RAG 的秘密武器不是向量数学,而是资料管理。
如果同一份政策有三个版本,检索器找到旧版,模型写得越流畅反而越危险。切段太细会失去例外条款,切得太粗又会把无关内容一并送入,排名不对时更会漏掉真正答案。
所以一次成功回答,不代表系统可靠。要测的是:问题换写法时还找不找得到、文件改版后会否淘汰旧内容、没有权限的员工会否看见不应看的段落。
08 / 人工智能
RAG 不是『有引用就一定正确』
引用只表示系统找过某段资料,不代表答案每一个推论都由它支持。要把主张和原文逐项连起来,必要时展示页码、段落或版本。
对前线同事来说,『我不知道』比一段来自旧政策的漂亮答案更有价值;检索系统要容许空手而回。
09 / 人工智能
读者最常问
RAG 同微调有甚么分别?
RAG 改变回答时看到的资料;微调改变模型的行为模式。会更新的知识通常先考虑 RAG。
一定要用向量资料库?
不一定;关键是能否按问题稳定找出相关、最新又有权限的证据。
怎样知道 RAG 有效?
建立一组真实问题,量度找不找到正确段落、引用是否支持答案,以及权限和版本是否守得住。
资料注脚
资料注脚
来源用来支持机制与限制;模型、产品及价格会更新,阅读时应以官方页面的版本和日期为准。