跳到主要内容

Locke Lee

返回文章库

人工智能/深层解释

大型语言模型(LLM)是甚么?为何它能够写文章?

大型语言模型不是先想好整篇文章才打字,而是根据前文一次预测一个 token。它因此能写出新的表达,也可能把早期的小错误一路写成完整故事。

01 / 人工智能

文章并不是一次生成

LLM 看见前面的 token 后,为下一个 token 计算一组机率,选出一个,再把新 token 放回输入,重复下去。完整段落是很多次微小预测的连锁结果。

它像一位永远只准看已写文字的即兴乐手:下一个音合理,不代表整首歌早已存在脑内。

02 / 人工智能

大型主要大在参数与资料

模型内有大量可调数值,训练时透过预测错误不断微调。参数不是一格格百科条目,而是分散地承载语法、关联、风格及概念模式。

某个事实未必收藏在一个地址;它可能由许多权重共同令某段文字变得较可能。

03 / 人工智能

Attention 是临时布置的关系网

Transformer 的关键不是永远记住每句话,而是在目前输入中计算哪些位置值得互相注意。同一个「bank」在河流和贷款句子内会建立不同关系。

这张关系网每次都重算,所以模型能按上下文改变用法,但计算成本亦会随输入长度增加。

04 / 人工智能

写得像,是因为世界留在语言里

大量人类知识以语言规律留下痕迹。食谱有步骤、新闻有因果、论文有论证、电邮有礼貌结构。

模型学会这些形状后,可以生成以前未见的组合。令人意外的并非「猜字」突然变成魔法,而是足够规模的语言预测,会迫使模型捕捉深层结构。

05 / 人工智能

但下一步正确不保证全局正确

一句句看都合理的文章,论点仍可能在第五段偷换概念。局部流畅会累积成全局自信,而早期一个错误亦会成为之后预测的新上下文,越写越完整。

长答案因此不是短答案的放大版;它是更多次没有外部验证的下注。

06 / 人工智能

最实用的阅读方式

把 LLM 文章视为高质素草稿生成,而不是来源本身。检查名词、数字、引用和因果跳跃;要求它指出不确定处;涉及最新或高风险资讯时,把可查证材料放回流程。

理解它如何写,目的不是贬低它,而是把惊人能力放在正确位置。

资料注脚

资料注脚

  1. developers.google.com/machine-learning/crash-course/llm
  2. arxiv.org/abs/1706.03762

资料用来支持机制与限制;模型、产品及价格会更新,阅读时应以来源的版本及日期为准。

读到最后,没有推销。

这里只保留一个更准确的理解,不把好奇心变成销售漏斗。

WhatsApp 联系 Locke Lee