Skip to main content

Locke Lee

返回文章庫

人工智能/深層解釋

大型語言模型(LLM)是甚麼?為何它能夠寫文章?

大型語言模型不是先想好整篇文章才打字,而是根據前文一次預測一個 token。它因此能寫出新的表達,也可能把早期的小錯誤一路寫成完整故事。

01 / 人工智能

文章並不是一次生成

LLM 看見前面的 token 後,為下一個 token 計算一組機率,選出一個,再把新 token 放回輸入,重複下去。完整段落是很多次微小預測的連鎖結果。

它像一位永遠只准看已寫文字的即興樂手:下一個音合理,不代表整首歌早已存在腦內。

02 / 人工智能

大型主要大在參數與資料

模型內有大量可調數值,訓練時透過預測錯誤不斷微調。參數不是一格格百科條目,而是分散地承載語法、關聯、風格及概念模式。

某個事實未必收藏在一個地址;它可能由許多權重共同令某段文字變得較可能。

03 / 人工智能

Attention 是臨時佈置的關係網

Transformer 的關鍵不是永遠記住每句話,而是在目前輸入中計算哪些位置值得互相注意。同一個「bank」在河流和貸款句子內會建立不同關係。

這張關係網每次都重算,所以模型能按上下文改變用法,但計算成本亦會隨輸入長度增加。

04 / 人工智能

寫得像,是因為世界留在語言裏

大量人類知識以語言規律留下痕跡。食譜有步驟、新聞有因果、論文有論證、電郵有禮貌結構。

模型學會這些形狀後,可以生成以前未見的組合。令人意外的並非「猜字」突然變成魔法,而是足夠規模的語言預測,會迫使模型捕捉深層結構。

05 / 人工智能

但下一步正確不保證全局正確

一句句看都合理的文章,論點仍可能在第五段偷換概念。局部流暢會累積成全局自信,而早期一個錯誤亦會成為之後預測的新上下文,越寫越完整。

長答案因此不是短答案的放大版;它是更多次沒有外部驗證的下注。

06 / 人工智能

最實用的閱讀方式

把 LLM 文章視為高質素草稿生成,而不是來源本身。檢查名詞、數字、引用和因果跳躍;要求它指出不確定處;涉及最新或高風險資訊時,把可查證材料放回流程。

理解它如何寫,目的不是貶低它,而是把驚人能力放在正確位置。

資料註腳

資料註腳

  1. developers.google.com/machine-learning/crash-course/llm
  2. arxiv.org/abs/1706.03762

資料用來支持機制與限制;模型、產品及價格會更新,閱讀時應以來源的版本及日期為準。

讀到最後,沒有推銷。

這裏只保留一個更準確的理解,不把好奇心變成銷售漏斗。

WhatsApp 聯絡 Locke Lee