Skip to main content

Locke Lee

返回文章庫

人工智能/深層解釋

RAG 是甚麼?AI 如何從你的文件找答案?

RAG 不是把整個文件庫塞給 AI,而是每次回答前先挑選一小撮外部證據。檢索錯誤、文件版本、權限和切段方式,往往比模型本身更早決定答案質素。

01 / 人工智能

先找,再寫

Retrieval-Augmented Generation 把兩個動作接起來:檢索器從外部文件找出相關片段,生成模型再根據片段回答。原始研究把模型參數視為內部記憶,把可搜尋索引視為外部、可更新的記憶。

它解決的不是模型變得全知,而是讓答案在當下多一份可追溯材料。

02 / 人工智能

文件先被切碎才容易尋找

PDF、網頁和手冊通常會被抽取文字、分段、轉成向量,再放入索引。切得太大,一段內混入太多主題;切得太小,條款的前提和例外被拆散。

RAG 的第一個隱藏決策不是選哪個模型,而是「一段資料的邊界在哪裏」。

03 / 人工智能

搜尋的是相似,不一定是真正需要

向量檢索擅長找語義接近片段,但問題中的名字、日期、否定詞和精確編號可能需要關鍵字或結構化查詢。最像的段落不一定含答案;含答案的段落也可能用完全不同字眼。

成熟系統常混合檢索、重排並保留 metadata,而不是只取頭三個相似結果。

04 / 人工智能

錯誤可能在模型開口前已發生

如果檢索器找錯版本,模型可以非常忠實地根據錯資料回答。這種失敗尤其危險,因為答案有引用、看似「有根據」。

評估 RAG 要把 retrieval recall 和 answer faithfulness 分開:先問正確證據有沒有被找回,再問答案有沒有超出證據。

05 / 人工智能

更新容易,不代表治理容易

外部索引可隨文件更新,確實比重新訓練模型靈活。但重複文件、權限、刪除、有效日期和版本衝突都會進入檢索層。

若離職員工仍可透過語義搜尋找到舊機密,答案準確也不代表系統正確。權限必須在檢索前生效。

06 / 人工智能

最好的 RAG 有勇氣不回答

當沒有足夠片段、來源互相衝突或問題超出文件範圍,系統應顯示不足並要求澄清。RAG 的價值不是令 AI 永遠有答案,而是把「答案可以從哪裏來」收窄到一個可檢查的範圍。

07 / 人工智能

評估不能只問答案像不像

RAG 應至少拆成四個測試:正確文件能否被取回、排序是否把它放到模型看得見的位置、答案是否忠於片段、引用是否真的覆蓋該句主張。最終答案看似正確,可能只是模型靠內部知識猜中,檢索其實完全失效。

若只評答案,系統會在資料更新那天突然暴露問題。

08 / 人工智能

表格、掃描 PDF 和廣東話會改變結果

很多企業文件不是乾淨段落,而是表格、頁眉、掃描圖、雙欄排版及中英混合。文字抽取一旦把欄位次序打亂,之後 embedding 再精準也只會找到破碎證據。

香港語境還有書面中文、粵語口語、英文縮寫和不同公司名寫法。真正的 RAG 工程常有大量工作發生在模型之前:OCR、清洗、別名、版本和 chunk 邊界。

資料註腳

資料註腳

  1. arxiv.org/abs/2005.11401
  2. arxiv.org/abs/2312.10997

資料用來支持機制與限制;模型、產品及價格會更新,閱讀時應以來源的版本及日期為準。

讀到最後,沒有推銷。

這裏只保留一個更準確的理解,不把好奇心變成銷售漏斗。

WhatsApp 聯絡 Locke Lee