返回文章庫

人工智能/深層解釋

大型語言模型(LLM)是甚麼?為何它能夠寫文章?

LLM 不是先想好整篇文章才打字,而是根據前文一次預測一個 token;這正是它能寫新句子、亦會把小錯一路寫大的原因。

01 / 人工智能

文章並不是一次生成

LLM 讀過大量文字後學到語言之間的機率關係。它每次根據已出現的內容預測下一個 token,重複很多次,就變成一段看似有完整意圖的文章。

它像一位永遠只准看已寫文字的即興樂手:下一個音合理,不代表整首歌早已存在腦內。

LLM 寫文最令人誤會的一點,是它寫得太順。順到你忘了每一步都只是接下一個 token,沒有一個小編坐在背後替它查資料。

每一個新 token 都會成為下一步的地面。開頭若把一家公司年份寫錯,後面模型可能繼續補出職位、產品和故事,因為在當前上下文中,那條路已經最順。

02 / 人工智能

大型主要大在參數與資料

模型內有大量可調數值,訓練時透過預測錯誤不斷微調。參數不是一格格百科條目,而是分散地承載語法、關聯、風格及概念模式。

某個事實未必收藏在一個地址;它可能由許多權重共同令某段文字變得較可能。

一個開頭寫錯的公司年份,可以一路長成完整但不存在的品牌故事——句子之間很有默契,事實之間沒有。

這也是為甚麼一個好 prompt 不只是叫它『寫得專業』,而是提供受眾、證據、限制、例子和檢查點;你是在鋪路,唔係在念咒。

03 / 人工智能

Attention 是臨時佈置的關係網

Transformer 的關鍵不是永遠記住每句話,而是在目前輸入中計算哪些位置值得互相注意。同一個「bank」在河流和貸款句子內會建立不同關係。

這張關係網每次都重算,所以模型能按上下文改變用法,但計算成本亦會隨輸入長度增加。

所以好的寫作流程要有人把手伸進去,唔係只在最後按 spell-check。

模型可以模仿語氣、結構和常見論證,但不會因為自己真的去過那間店、開過那間公司或承受過那個決定而知道其分量。

04 / 人工智能

寫得像,是因為世界留在語言裏

大量人類知識以語言規律留下痕跡。食譜有步驟、新聞有因果、論文有論證、電郵有禮貌結構。

模型學會這些形狀後,可以生成以前未見的組合。令人意外的並非「猜字」突然變成魔法,而是足夠規模的語言預測,會迫使模型捕捉深層結構。

05 / 人工智能

但下一步正確不保證全局正確

一句句看都合理的文章,論點仍可能在第五段偷換概念。局部流暢會累積成全局自信,而早期一個錯誤亦會成為之後預測的新上下文,越寫越完整。

長答案因此不是短答案的放大版;它是更多次沒有外部驗證的下注。

06 / 人工智能

最實用的閱讀方式

把 LLM 文章視為高質素草稿生成,而不是來源本身。檢查名詞、數字、引用和因果跳躍;要求它指出不確定處;涉及最新或高風險資訊時,把可查證材料放回流程。

理解它如何寫,目的不是貶低它,而是把驚人能力放在正確位置。

07 / 人工智能

『逐字預測』聽落好簡單,實際上是一個會累積路線的決定系統。

每一個新 token 都會成為下一步的地面。開頭若把一家公司年份寫錯,後面模型可能繼續補出職位、產品和故事,因為在當前上下文中,那條路已經最順。

這也是為甚麼一個好 prompt 不只是叫它『寫得專業』,而是提供受眾、證據、限制、例子和檢查點;你是在鋪路,唔係在念咒。

08 / 人工智能

會寫作,不代表有作者經驗

模型可以模仿語氣、結構和常見論證,但不會因為自己真的去過那間店、開過那間公司或承受過那個決定而知道其分量。

人手編輯的價值不只係改文法,還包括刪掉空泛句、補上實際背景,以及指出一個漂亮句子其實沒有證據。

09 / 人工智能

讀者最常問

LLM 係咪搜尋引擎?
唔係。它可以配合搜尋工具,但模型本身主要生成文字,不保證每句都對應最新外部事實。

點解同一個 prompt 有時答案不同?
取樣設定、上下文、模型版本和工具結果都可能改變下一個 token 的分布。

如何叫模型寫得少啲 AI 味?
給具體讀者、例子、節奏和反饋,並由人刪走重複和空話;一句『自然啲』通常唔夠。

資料註腳

資料註腳

  1. platform.openai.com/docs/guides/text
  2. learn.chatgpt.com/docs/glossary

來源用來支持機制與限制;模型、產品及價格會更新,閱讀時應以官方頁面的版本和日期為準。

讀到最後,沒有推銷。

這裏只保留一個更準確的理解,不把好奇心變成銷售漏斗。

WhatsApp 聯絡 Locke Lee