文章目录+
01 / 人工智能
先找,再写
它解决的不是模型变得全知,而是让答案在当下多一份可追溯材料。
02 / 人工智能
文件先被切碎才容易寻找
PDF、网页和手册通常会被抽取文字、分段、转成向量,再放入索引。切得太大,一段内混入太多主题;切得太小,条款的前提和例外被拆散。
RAG 的第一个隐藏决策不是选哪个模型,而是「一段资料的边界在哪里」。
03 / 人工智能
搜寻的是相似,不一定是真正需要
向量检索擅长找语义接近片段,但问题中的名字、日期、否定词和精确编号可能需要关键字或结构化查询。最像的段落不一定含答案;含答案的段落也可能用完全不同字眼。
成熟系统常混合检索、重排并保留 metadata,而不是只取头三个相似结果。
04 / 人工智能
错误可能在模型开口前已发生
如果检索器找错版本,模型可以非常忠实地根据错资料回答。这种失败尤其危险,因为答案有引用、看似「有根据」。
评估 RAG 要把 retrieval recall 和 answer faithfulness 分开:先问正确证据有没有被找回,再问答案有没有超出证据。
05 / 人工智能
更新容易,不代表治理容易
外部索引可随文件更新,确实比重新训练模型灵活。但重复文件、权限、删除、有效日期和版本冲突都会进入检索层。
若离职员工仍可透过语义搜寻找到旧机密,答案准确也不代表系统正确。权限必须在检索前生效。
06 / 人工智能
最好的 RAG 有勇气不回答
当没有足够片段、来源互相冲突或问题超出文件范围,系统应显示不足并要求澄清。RAG 的价值不是令 AI 永远有答案,而是把「答案可以从哪里来」收窄到一个可检查的范围。
07 / 人工智能
评估不能只问答案像不像
RAG 应至少拆成四个测试:正确文件能否被取回、排序是否把它放到模型看得见的位置、答案是否忠于片段、引用是否真的覆盖该句主张。最终答案看似正确,可能只是模型靠内部知识猜中,检索其实完全失效。
若只评答案,系统会在资料更新那天突然暴露问题。
08 / 人工智能
表格、扫描 PDF 和广东话会改变结果
很多企业文件不是干净段落,而是表格、页眉、扫描图、双栏排版及中英混合。文字抽取一旦把栏位次序打乱,之后 embedding 再精准也只会找到破碎证据。
香港语境还有书面中文、粤语口语、英文缩写和不同公司名写法。真正的 RAG 工程常有大量工作发生在模型之前:OCR、清洗、别名、版本和 chunk 边界。
资料注脚
资料注脚
资料用来支持机制与限制;模型、产品及价格会更新,阅读时应以来源的版本及日期为准。