返回文章库

人工智能/深层解释

AI 训练、微调与推理有甚么分别?

预训练建立通用能力,微调改变任务行为,推理则是今天每一次输入真正发生的成本;三层不要混为一谈。

01 / 人工智能

先用工场、裁缝和厨房理解

可以用工场、裁缝和厨房理解:训练造出通用布料,微调把它裁成特定制服,推理就是每天按客人落单即场出餐。三者用同一个『AI』字眼,工作和风险却完全不同。

推理则像每天有人落单后即场出餐:模型权重通常不再改,只根据当次输入产生结果。三者都用计算,但目的不一样。

有人问『可不可以将我哋十年文件喂入去,等它永远记住?』这句问题很自然,但技术上其实把三件事捞埋了一起。

微调可能是一笔明显的项目费,但推理是每个员工、每个查询、每份附件都会重复发生的细水长流。模型选择、输入长度、输出长度、快取和工具呼叫,才会真正改变月度帐单。

02 / 人工智能

训练不是把文件存进资料库

训练透过大量例子调整参数,令某些输出机率提高。知识被分散压进权重,难以逐条找出、更新或删除。

今天政策改了一句,重新训练并不是最自然的更新方法;这也是外部检索和工具仍然重要的原因。

一个新价目表下星期会变,冇理由为了它重新训练一个模型;把会变的东西放在会更新的地方,反而比较老实。

另一方面,微调不是把公司知识像 USB 咁插入模型。它较擅长教格式、语气和判断习惯;需要不断更新的政策或价目,外部检索通常更合理。

03 / 人工智能

微调主要教行为,不是可靠地灌知识

Google 的教材指出,微调可用数百至数千个特定例子令基础模型适应任务。它很适合格式、语气、分类习惯和专门模式,却不是频繁更新公司手册的理想替代品。

把十份 PDF 拿去微调,不等于建立可引用、可删除的知识库。

讲到底,AI 项目最贵的部分往往不是第一次 demo,而是之后每一天都要跑的那一段。

你在对话中交代一次规则,只会影响这次上下文;下一个工作区未必知道。若想持续保存行为,要靠固定指令、检索、微调或应用层状态,并清楚知道各自的更新方式。

04 / 人工智能

推理成本才是每天重复发生的成本

预训练可能是一次巨额投资,推理却随每次请求累积。模型大小、输入长度、输出长度、是否即时、是否使用工具,都会影响延迟和费用。

产品成功后,最昂贵的阶段不一定是最戏剧性的训练,而可能是数百万次普通回答。

05 / 人工智能

Prompt 不会永久改变模型

在对话中告诉模型「以后都这样写」,只会在该 context 内影响推理,除非产品把偏好另存并再次提供。微调才会改变权重,但亦不能保证每次遵守。

系统指示、检索、工具、微调和后处理,是不同控制杆,不能用一个名词混在一起。

06 / 人工智能

先问你想改变哪一层

需要最新事实,更新资料源或 RAG;需要固定计算,写工具;需要一致风格或特殊任务行为,再考虑微调;需要回应一个当下问题,就是推理。最大的浪费通常不是模型选错,而是用最昂贵、最难逆转的阶段,解决本来可以在外层快速修正的问题。

三个阶段有不同的资料风险

预训练资料影响模型的广泛能力与偏误;微调资料更直接塑造特定行为;推理资料则可能包含当下的私人内容。三者的保留、授权和删除要求不相同。

把「资料会否用来训练」问成单一问题,往往不足够;还要问请求会否被记录、用作评估、进入快取或传送到其他工具。

微调之后仍需要外层系统

即使微调成功,权限检查、最新资料、格式验证、安全规则和交易确认仍不应只靠模型记住。权重提供倾向,程式提供保证。

最成熟的架构会把可测试的规则留在程式,把会改的事实留在资料源,把需要语言弹性的部分交给模型。这种分工看似没有「一个模型包办一切」震撼,却更接近可维护产品。

07 / 人工智能

企业最常把一次性工程同每日营运成本混在同一张表。

微调可能是一笔明显的项目费,但推理是每个员工、每个查询、每份附件都会重复发生的细水长流。模型选择、输入长度、输出长度、快取和工具呼叫,才会真正改变月度帐单。

另一方面,微调不是把公司知识像 USB 咁插入模型。它较擅长教格式、语气和判断习惯;需要不断更新的政策或价目,外部检索通常更合理。

08 / 人工智能

Prompt 不会永久改变模型

你在对话中交代一次规则,只会影响这次上下文;下一个工作区未必知道。若想持续保存行为,要靠固定指令、检索、微调或应用层状态,并清楚知道各自的更新方式。

别急住微调。先量度目前失误是知识问题、格式问题,还是流程根本没有验证;搞错层级,会用最贵的工具修最便宜的 bug。

09 / 人工智能

读者最常问

微调会令模型知道最新资料?
通常不会自动保持最新;资料变动快时,用检索或资料库更新较合适。

推理成本只看字数?
不只。上下文、快取、工具、推理深度和输出长度都会影响实际用量。

何时先值得微调?
当任务格式稳定、例子质素高、重复量大,而且你已经有评测集证明现有方法不足时。

资料注脚

资料注脚

  1. platform.openai.com/docs/guides/fine-tuning
  2. platform.openai.com/docs/guides/text

来源用来支持机制与限制;模型、产品及价格会更新,阅读时应以官方页面的版本和日期为准。

读到最后,没有推销。

这里只保留一个更准确的理解,不把好奇心变成销售漏斗。

WhatsApp 联系 Locke Lee