文章目錄+
01 / 人工智能
它更像工作枱,不是長期記憶
模型本身不會因一段對話就永久更新參數。
長對話最古怪的時刻,是模型仍然引用到你三小時前講過的字,卻忘了你二十分鐘前已經推翻那個決定。看得見,不代表排得好。
對話拖得太長時,早期的假設、後來的修正、臨時的例外會黐在一起。模型可能仍然『看見』那句話,卻把較新的、較醒目的內容當成主線。這跟人開會一樣:記錄滿晒,決策未必清楚。
02 / 人工智能
失憶有兩種,外表卻一樣
第一種是資料真的被擠出窗口;第二種是資料仍在,模型卻沒有有效使用。研究「Lost in the Middle」發現,多個長 context 模型對開頭和結尾資料表現較好,關鍵證據放在中間時準確度明顯下降。
看得到與找得到,是兩個能力。
這種情況在改網站、改 code、改合約時特別煩:你以為它在跟進,實際上它抓住了舊版本。
因此好的長任務會定期重寫摘要、標示已確認/待確認、把原始文件與工作筆記分開,必要時重新檢索,而不是把所有歷史一股腦塞進去。
03 / 人工智能
長窗口會製造一種虛假安全感
把整份合約、所有電郵和幾十次對話一次塞入,感覺像把完整檔案交給專家。但無關內容會競爭注意力,重複版本會互相衝突,舊指示亦可能壓過新目標。
容量增加後,資訊工程問題沒有消失,只是從「放不下」變成「找不準」。
我通常會在第二次重複糾正之後重開一個乾淨對話。係,感覺像放棄;其實是幫未來的自己慳時間。
窗口有上限;超出時內容可能被截走、壓縮或用較粗略的摘要代替。即使未超出,位置、格式和重複程度亦會影響模型取用。
04 / 人工智能
摘要既救命,也會慢慢變形
系統常把舊對話壓成摘要以騰出空間。摘要保留它當時認為重要的東西,刪掉語氣、例外和細節;下一輪再摘要一次,誤差便像影印件一樣累積。
使用者覺得 AI 改口,可能不是它忘了全部,而是關鍵限制在壓縮時被當成背景。
05 / 人工智能
真正的記憶通常在模型外面
持續型產品會把偏好、任務狀態或文件存入資料庫,需要時再檢索回窗口。這是外部記憶,不是模型突然有了人生回憶。
設計得好,它會保存來源、時間和可刪除性;設計得差,它會把舊猜測當成永久事實。
06 / 人工智能
讓長對話更可靠的做法
把當前目標、不可違反的限制和所需輸出放在靠近問題的位置;長文件先分段檢索;每隔一段由人確認狀態摘要;重要決定另存成結構化清單。不要只問「窗口有多大」,要問「資料怎樣進入、被選中、被壓縮和被更新」。
窗口預算還包括你看不見的東西
使用者輸入並不是窗口的全部。系統指示、角色訊息、工具定義、工具回傳、檢索片段和預留輸出都會佔空間。
一個標示可處理長文件的產品,真正留給文件的容量可能較少;如果工具 schema 很大,每一輪甚至先為「可能用到的能力」付出 context。這也是長對話愈來愈慢或突然遺漏細節的原因之一。
記得一句話,也可能忘記它的地位
模型可能重述某個數字,卻忘記它只是草稿;可能記得一條規則,卻遺失後面的例外。長 context 的難題不只 retrieval,還包括關係:哪個版本取代哪個、誰說過、何時有效、結論還是假設。
把這些關係寫成結構化狀態,比單純增加窗口更接近真正的記憶。
07 / 人工智能
真正的瓶頸,常常不是容量,而是注意力和秩序。
對話拖得太長時,早期的假設、後來的修正、臨時的例外會黐在一起。模型可能仍然『看見』那句話,卻把較新的、較醒目的內容當成主線。這跟人開會一樣:記錄滿晒,決策未必清楚。
因此好的長任務會定期重寫摘要、標示已確認/待確認、把原始文件與工作筆記分開,必要時重新檢索,而不是把所有歷史一股腦塞進去。
08 / 人工智能
長上下文不等於無限記憶
窗口有上限;超出時內容可能被截走、壓縮或用較粗略的摘要代替。即使未超出,位置、格式和重複程度亦會影響模型取用。
最實用的做法不是迷信一個很大的數字,而是測試你自己的文件:把關鍵條款放在不同位置,看看系統是否真的找得到。
09 / 人工智能
讀者最常問
把文件切得越細越好?
唔一定。切太細會拆散定義同例外;要按問題和段落意思切,並保留標題、頁碼等線索。
摘要可以取代原文?
只適合做導航,不能自動取代關鍵合約、政策或數字;重要內容仍要回到原文核對。
長對話幾時應該重開?
當目標、假設或角色已經改變,或者你開始不停糾正同一件事時,重開一個乾淨工作區通常更快。
資料註腳
資料註腳
來源用來支持機制與限制;模型、產品及價格會更新,閱讀時應以官方頁面的版本和日期為準。