文章目錄+
01 / 人工智能
先找,再寫
它解決的不是模型變得全知,而是讓答案在當下多一份可追溯材料。
02 / 人工智能
文件先被切碎才容易尋找
PDF、網頁和手冊通常會被抽取文字、分段、轉成向量,再放入索引。切得太大,一段內混入太多主題;切得太小,條款的前提和例外被拆散。
RAG 的第一個隱藏決策不是選哪個模型,而是「一段資料的邊界在哪裏」。
03 / 人工智能
搜尋的是相似,不一定是真正需要
向量檢索擅長找語義接近片段,但問題中的名字、日期、否定詞和精確編號可能需要關鍵字或結構化查詢。最像的段落不一定含答案;含答案的段落也可能用完全不同字眼。
成熟系統常混合檢索、重排並保留 metadata,而不是只取頭三個相似結果。
04 / 人工智能
錯誤可能在模型開口前已發生
如果檢索器找錯版本,模型可以非常忠實地根據錯資料回答。這種失敗尤其危險,因為答案有引用、看似「有根據」。
評估 RAG 要把 retrieval recall 和 answer faithfulness 分開:先問正確證據有沒有被找回,再問答案有沒有超出證據。
05 / 人工智能
更新容易,不代表治理容易
外部索引可隨文件更新,確實比重新訓練模型靈活。但重複文件、權限、刪除、有效日期和版本衝突都會進入檢索層。
若離職員工仍可透過語義搜尋找到舊機密,答案準確也不代表系統正確。權限必須在檢索前生效。
06 / 人工智能
最好的 RAG 有勇氣不回答
當沒有足夠片段、來源互相衝突或問題超出文件範圍,系統應顯示不足並要求澄清。RAG 的價值不是令 AI 永遠有答案,而是把「答案可以從哪裏來」收窄到一個可檢查的範圍。
07 / 人工智能
評估不能只問答案像不像
RAG 應至少拆成四個測試:正確文件能否被取回、排序是否把它放到模型看得見的位置、答案是否忠於片段、引用是否真的覆蓋該句主張。最終答案看似正確,可能只是模型靠內部知識猜中,檢索其實完全失效。
若只評答案,系統會在資料更新那天突然暴露問題。
08 / 人工智能
表格、掃描 PDF 和廣東話會改變結果
很多企業文件不是乾淨段落,而是表格、頁眉、掃描圖、雙欄排版及中英混合。文字抽取一旦把欄位次序打亂,之後 embedding 再精準也只會找到破碎證據。
香港語境還有書面中文、粵語口語、英文縮寫和不同公司名寫法。真正的 RAG 工程常有大量工作發生在模型之前:OCR、清洗、別名、版本和 chunk 邊界。
資料註腳
資料註腳
資料用來支持機制與限制;模型、產品及價格會更新,閱讀時應以來源的版本及日期為準。