返回人工智能文章

人工智能/深度比较

ChatGPT-5.6 Luna、Terra 还是 Sol?我用了几个月后的选择

Reddit 图表里 Sol 分数最高,Luna 显示成本最低,Terra 位于中间。我用了几个月后,不会再用同一个模型处理所有工作。

01 / 人工智能

GPT-5.6 Luna、Terra 还是 Sol:到底有什么区别?

我自己日常会先用 Luna Max。工作范围清楚但比较大,就试 Terra。至于 Sol,我会留给真正困难、容易出问题,或者做错以后要花很多时间补救的任务。

刚开始试 GPT-5.6 时,我也以为 Sol 会自然成为默认答案。它确实有一些工作做得更好;问题是额度掉得很快,遇到写得不清楚的 Brief 也一样会要求你再改。用了几个月以后,我的答案反而简单了:平时先开 Luna Max。

三个模型并不是完全一样。价格、推理力度、速度和完成一项任务要走多少步骤都不同。Reddit 的比较图有意思的地方,就是把这些差别放回数字里。还有一点:Luna low 和 Luna max 的实际体验可以差很远,只说模型名称其实还没说完。

Tsinkala 拍摄的软件开发者同时使用两台笔记本电脑。选择模型是工作决定,不是单纯追排行榜。
Tsinkala 拍摄的软件开发者同时使用两台笔记本电脑。选择模型是工作决定,不是单纯追排行榜。 摄影/作者: Tsinkala;授权: CC BY-SA 4.0。 来源页。 原图。
模型大概适合什么我会怎么开始
GPT-5.6 Luna便宜、重复性高、容易检查的工作起草、资料提取、小型代码修改和例行修正。
GPT-5.6 Terra已经有计划,但范围比较大的实施工作需要查看几个文件、执行较长流程,但方向已经确定。
GPT-5.6 Sol含糊、难以调试、出错代价高的工作架构判断、深度研究,以及不想漏掉关键步骤的任务。

大致就是这样。下面再把图表的数字、Terra 的位置,以及我为什么最后仍然用 Luna Max 做默认选择讲清楚。

02 / 人工智能

先看 Reddit 的成本图

Reddit 讨论帖中的成本、输出量和步骤比较图。这是社区整理的比较,不是 OpenAI 官方价目表,也不是适用于所有人的统一基准测试。
Reddit 讨论帖中的成本、输出量和步骤比较图。这是社区整理的比较,不是 OpenAI 官方价目表,也不是适用于所有人的统一基准测试。 摄影/作者: Reddit post author;授权: Reddit-hosted community chart; confirm reuse permission before publication。 来源页。 原图。

这张比较图来自 Reddit 上一篇讨论 GPT-5.6 的帖子,比较首轮成功率、平均任务成本、输出量和步骤。首轮成功率只是那次测试中第一轮通过的比例,不代表 Sol 一定懂你的代码库,也不代表 Luna 一定会把下一封邮件写乱。

我把图里的 15 行完整打出来。放大截图看表格,说实话有点麻烦;之后想搜索某一行也不方便。数字可以直接看,限制也要一起看:这是一次社区比较,不是 OpenAI 官方价目表,更不是适用于所有工作的排名。

模型/力度首轮成功率平均成本输出量步骤
GPT-5.6 Sol max73% ± 3%$8.3960k61
GPT-5.6 Sol xhigh71% ± 1%$4.7041k44
GPT-5.6 Terra max70% ± 3%$3.9672k76
GPT-5.6 Sol high69% ± 1%$3.4728k37
GPT-5.6 Luna max67% ± 4%$0.6173k102
GPT-5.6 Sol medium61% ± 2%$1.8618k31
GPT-5.6 Terra xhigh60% ± 2%$1.7040k43
GPT-5.6 Luna xhigh57% ± 2%$0.3145k71
GPT-5.6 Terra high54% ± 4%$0.9122k34
GPT-5.6 Sol low45% ± 2%$1.0711k23
GPT-5.6 Luna high44% ± 3%$0.1626k49
GPT-5.6 Terra medium35% ± 3%$0.4712k25
GPT-5.6 Terra low24% ± 1%$0.348.6k21
GPT-5.6 Luna medium11% ± 1%$0.048.2k24
GPT-5.6 Luna low2% ± 1%$0.013.1k12

第一眼最抢眼的是 Luna max:67%,平均 $0.61。Sol max 是 73%,平均 $8.39。也就是说 Sol 多了 6 个百分点,但图表显示的成本大约是 14 倍。任务很容易检查时,这个差价很难忽略;如果是正式系统,少一次严重错误可能已经值回来了。

第二眼会看到另一面:Luna max 走 102 步,Sol max 走 61 步。便宜不代表快,分数高也不代表短。Luna 有时要绕一点路才能到终点——可以接受,但不是免费的散步。

03 / 人工智能

三个模型分别适合什么工作?

GPT-5.6 官方页面列出的 API 价格是:Sol 每一百万个输入 Token $5、输出 $30;Terra 是 $2.50 和 $15;Luna 是 $1 和 $6。如果你直接使用 API,这些数字比较实在。使用工作界面时,感受到的通常是额度、等待时间和五小时窗口还剩多少空间。

我的理解是:Luna 适合剩余错误有人帮你发现;Terra 适合方向已经确定、但工作不小;Sol 则留给真正需要判断的地方。不是越贵,就越应该每天开着。

Martin Vorel 拍摄的程序代码。推理步骤更多可能有帮助,但每一步也可能带来成本。
Martin Vorel 拍摄的程序代码。推理步骤更多可能有帮助,但每一步也可能带来成本。 摄影/作者: Martin Vorel;授权: CC BY-SA 4.0。 来源页。 原图。
你面前的工作可以先试什么情况升级
短改动、提取资料、小型修正Luna high/xhigh经常漏要求,或者检查已经不再简单。
有计划、需要跨几个文件Terra high/xhigh计划本身有问题、范围变大,或者开始需要取舍。
架构、深度调试、研究Sol high/xhigh出错代价高过额外额度。
关键问题Sol max只有避免的失败确实值得这条高级路线。

还有一个很容易漏掉的地方:大家说“我测试过 Luna”,不一定真的用的是同一个设置。Luna low 和 Luna max 已经是两回事,Terra 和 Sol 也一样。比较时要把力度写清楚,否则就像拿汽车一档的速度和高速公路相比,然后说结果很奇怪。

04 / 人工智能

图表里的成本不等于你的账号限额

这个区别很重要。图表写 $0.61,不代表你的账号会扣 61 美分;Sol max 写 $8.39,也不代表你会收到一张 API 式的逐项账单。不同产品可能计算消息、推理用量、滚动时间窗、方案路由,或者几项一起算。

但实际影响一样会感觉到。重型 Sol 任务用得快,剩下的工作空间就少;之后想再试另一件事,也要先想一想。这是我最后没有把 Sol 当成日常默认选择的主要原因之一。

Jeremyida002 拍摄的秒表。速度、等待时间和额度消耗,其实是三只不同的钟。
Jeremyida002 拍摄的秒表。速度、等待时间和额度消耗,其实是三只不同的钟。 摄影/作者: Jeremyida002;授权: CC BY-SA 4.0。 来源页。 原图。
数字它说明什么它没有说明什么
API Token 价格你自己控制请求时的公开单价你的 ChatGPT/Codex 账号会扣多少。
平均任务成本那次测试中的相对成本你的下一项任务一定是这个价格。
输出量模型生成了多少内容内容一定好。
步骤流程走了多少回合/动作你最后要修改多少次。
五小时上限你在那段时间还剩多少工作空间基准分数。

我会把它看成三只钟:钱、模型工作量、你还能继续工作的时间。三只钟不一定一起走,所以图表里最便宜的一格,实际用起来未必最快;最贵的一格,也不会自动让你一稿完成。

05 / 人工智能

为什么 Luna Max 这么多人选?

图表里的 Luna max 是 67% 首轮成功率、$0.61、73k 输出量和 102 步。这个组合不算漂亮,却很实用。它比 Sol max 走更多步骤,成本却低很多。

附近几行更有意思:Luna xhigh 是 57%/$0.31,Luna max 是 67%/$0.61。多花三毛钱,这次测试多了十个百分点。Terra max 是 70%/$3.96,Sol high 是 69%/$3.47。不是每多花一块钱,都能换到一样多的质量。

比较图表显示什么我会再问什么
Luna max/Sol max差 6 点;显示成本差约 14 倍Luna 剩下的错误,自己容易发现吗?
Luna xhigh/Luna max多 $0.30,成功率高 10 点小任务是不是开始卡住了?
Terra max/Sol highTerra 高 1 点,但贵 $0.49我需要 Terra 的执行,还是 Sol 的判断?

所以 Luna Max 有时会绕路。能不能接受?如果是起草、整理表格或可以测试的代码改动,我大多可以接受;如果是修改正式资料,仍然要加人工确认,不会因为便宜就放弃流程。

06 / 人工智能

我用了几个月 Luna Max,实际感觉怎么样?

这部分是我真正做工作后的感觉,不是实验室报告。Luna Max 并不是每次第一轮就明白我想要什么。有时要重新说明语气,有时要指出哪一段偏了,有时就直接说:“不对,我不是要这个。”两三轮修改,对比较复杂的工作很正常。

最意外的是 Sol 并没有完全消除这种来回。某些难题它的第一稿确实更强,但我仍然需要带着它走;额度却掉得快很多。如果最后还要我判断、改句子、补限制,贵模型未必帮我省下时间。

Daudi mukiibi 拍摄的软件开发者工作照。真正有用的问题是:要修改多少轮才能得到可用结果?
Daudi mukiibi 拍摄的软件开发者工作照。真正有用的问题是:要修改多少轮才能得到可用结果? 摄影/作者: Daudi mukiibi;授权: CC BY-SA 4.0。 来源页。 原图。
我看到的情况我的答案
Luna Max 能做到可用吗?通常可以,前提是我给出清楚边界和例子。
第一轮能跟上所有细节吗?不能。要求高时,准备修改两三轮更实际。
Sol 一定更省时间吗?在我的工作流里不一定。
为什么仍然用 Luna 默认?能留下空间重试,也能做其他工作。

我说“可用程度”,意思是我可以继续做下去,不用每句话都照顾模型,同时还剩足够额度完成今天其他事情。Luna Max 对我来说赢在这里。有人在做困难代码库,选择 Sol 完全合理;工作不同,账本自然也不同。

07 / 人工智能

Sol 什么时候才值得用?

Reddit 帖子提到的路由顺序挺合理:先试轻量 Luna,开始卡住就上 Luna Max,再按工作难度考虑 Sol high、xhigh、max。我不会因为 Prompt 听起来很重要,就直接开 Sol Max。要求写得含糊,贵模型一样可以很有耐心地做错事。

Sol high 是我觉得比较实际的高级位置:69%/$3.47/37 步;Sol xhigh 71%/$4.70/44 步;Sol max 73%/$8.39/61 步。至少有一层层的选择,不需要每次跳到最高档。

Matthew 拍摄的 Wikimedia 代码审查会议。无论模型多强,第二双眼睛仍然是流程的一部分。
Matthew 拍摄的 Wikimedia 代码审查会议。无论模型多强,第二双眼睛仍然是流程的一部分。 摄影/作者: Matthew (Wikimedia Foundation);授权: CC BY-SA 3.0。 来源页。 原图。
Sol 设置图表数字我会用在
Sol high69%/$3.47/37 步困难,但仍然需要控制成本的工作。
Sol xhigh71%/$4.70/44 步轻量路线已经顶不住的任务。
Sol max73%/$8.39/61 步真正困难、真的不想漏掉的边缘情况。

前提是给它一份像样的 Brief:相关文件、不能改变的限制、验收方法和测试。否则就像花钱请专家,却让专家自己猜要做什么。专家也会猜错,而且有时猜得很有说服力。

08 / 人工智能

Terra 是不是最中间、最稳妥?

Terra max 是 70%/$3.96/72k/76 步;Terra xhigh 是 60%/$1.70/40k/43 步。按这张图比较,Terra max 比 Sol high 贵,步骤也更多,但首轮成功率只高一点,所以原帖作者把 Sol high 放在更划算的中间位置。

但评论里有人说 Terra xhigh 比 Sol 快,有人用 Terra 做实施、Sol 做规划,也有人觉得 Sol 太喜欢想复杂,Luna xhigh 做默认反而顺。这些意见可以同时成立,因为大家根本没有在做同一件事。

如果你已经有…Terra 可能合适记得检查
清楚计划和文件范围可以做更宽的实施,不必马上开 Sol max。让它记录修改并运行测试。
想要比 Luna 多一点伸展Terra xhigh 值得自己试一轮。别的代码库上的速度,未必能复制。
架构还没确定先用 Terra 整理选项,再考虑用 Sol 做困难判断。快速做错,仍然是做错。

所以我会把 Terra 当成实际的中间选择,而不是“两边都不够好”的那一格。方向已经确定、工作范围却比较大时,它有用;方向还没有确定,就先花钱买判断。

09 / 人工智能

我现在会怎么选模型?

  1. 小而清楚Luna high 或 xhigh。几秒就能看出有没有错,不需要一开始就用重型路线。
  2. 普通日常工作Luna Max。这是我实际使用下来最平衡的位置。
  3. 有计划的多文件工作Terra high 或 xhigh。方向已经确定,希望有更大的执行范围。
  4. 架构含糊或风险高Sol high。难的是判断,不是打字速度。
  5. 便宜路线已经失败Sol xhigh 或 max。到了这一步,额外用量更容易解释。
情况我会先选原因
短、容易检查的任务Luna high/xhigh改错便宜。
日常工作Luna Max我自己用下来最平衡。
有计划的实施Terra high/xhigh多一点执行范围,不用马上付 Sol max。
架构或难调试Sol high额外判断值得花钱。
失败代价很高Sol xhigh/max避免一个大错误可能比额度更值钱。

这是我现在的顺序,不是永远的规则。你试五件真实工作后,可能会把 Terra 放前面,也可能大部分时间停在 Luna xhigh。至少有一条可以调整的规则,比靠一张漂亮截图争喜好实际。

10 / 人工智能

要修改两三次,Luna 还划算吗?

如果 Luna 第一轮给了一个可用草稿,我只需要调整读者、语气或一个测试,两三轮不算大问题。每一轮都看得懂,任务仍然便宜,这就是 Luna 发挥的地方。

但如果每次都要从头跑,同一个错误改完又回来,或者结果会改到客户资料、正式系统和金钱,我会早点升级。模型便宜了,不代表你应该花半天帮它收拾残局;账单只是从账号搬到了日历。

Luna 仍然值得先试我会升级
修改小而清楚。同一个错误改两次还回来。
有测试、清单或人工快速复核。会碰到法律、金钱、安全或正式数据。
要求稳定,有例子。条件一直变化,连目标都还没确定。
同一个窗口里还要完成很多工作。事情少见但关键,重做一次很贵。

我会计算“完成一项工作真正用了多少”,而不是只算第一稿。把复核、重试、等待和重新解释也算进去。你的数字可能和 Reddit 图表一样,也可能不一样;都没关系,因为那才是你的工作成本。

11 / 人工智能

为什么 Reddit 评论会这么分歧?

有人说 Sol 可以一轮完成困难项目,几次 Luna 都做不到;有人说 Sol 太喜欢思考,把简单工作弄复杂;有人觉得 Terra xhigh 更快;也有人用 Sol 做规划、Terra 做实施。这些经验不一定互相推翻,可能只是大家的工作痛点不同。

写文章的人重视语气、细节和有没有跟上要求;开发者重视测试,也担心改动影响到几层文件以外的东西;研究工作可能最看重来源。模型名称相同,真正要解决的问题却不同。

会影响结果的地方为什么
工作类型写作、调试、研究和实施,需要的能力不同。
提示写法验收方法清楚,模型才知道做到哪里算完成。
产品界面Chat、Codex、Work 和 API 的工具与限制可能不同。
推理力度low、medium、high、xhigh、max 不是同一种测试。
复核的人抓错快的人,更容易安全地使用便宜模型。
资料日期价格和路由会变,旧截图却不会自动更新。

图片可以保留,因为它把一次取舍画得很清楚;产品细节还是要再看官方页面,最好自己跑几项工作。不要要求一张截图解释一个会变化的产品——它没有这么长的寿命。

12 / 人工智能

最后我的选择:Luna Max

如果你问我现在会怎么开始:普通工作先用 Luna Max,给清楚要求、例子和验收方法。需要修改两三轮,不代表它马上出局,先看每一轮是不是便宜、看得懂,而且有没有向前走。

工作范围宽但方向确定,就试 Terra。工作含糊、难调试、漏一步会很贵,再用 Sol。Sol 当然有用;我只是觉得没有必要每天开跑车买菜,用它处理所有最普通的事情。

问题我的答案
日常最平衡?GPT-5.6 Luna Max,基于我自己用了几个月的工作。
Terra 放在哪里?有计划、范围较宽的实施。
Sol 什么时候值得?判断、深度或失败代价值得额外额度时。
Reddit 图表已经判定胜负?没有。它给出起点,真正的工作才完成比较。
Luna 修改两三轮就不划算?不一定;如果每轮容易检查,总成本仍可能更低。

如果你想自己测一次

选一周内五项真实工作,尽量固定文件和提示,记录首轮结果、修改次数、等待时间、额度,以及最后敢不敢直接交付。这份小记录,比争论哪个模型最强实际得多。

选择便宜模型没有什么丢脸,选择贵模型也没有功德。额外推理真的买到了你需要的东西,就付钱;如果只是让对话变长,换回轻一点的路线,也没什么不好。

资料来源

来源、日期和图片授权

  1. OpenAI:GPT-5.6
  2. Reddit r/codex:GPT-5.6 Sol、Luna 和 Terra——按成本与速度选择模型

图片来源与授权备注

  • photo-two-laptops.jpg——Tsinkala 拍摄的软件开发者同时使用两台笔记本电脑。选择模型是工作决定,不是单纯追排行榜。 摄影/作者:Tsinkala;授权:CC BY-SA 4.0。图片直链。
  • reddit-gpt56-cost-speed-chart.png——Reddit 讨论帖中的成本、输出量和步骤比较图。这是社区整理的比较,不是 OpenAI 官方价目表,也不是适用于所有人的统一基准测试。 发布来源:Reddit post author;Reddit-hosted community chart; confirm reuse permission before publication。图片直链。
  • photo-programming-code.jpg——Martin Vorel 拍摄的程序代码。推理步骤更多可能有帮助,但每一步也可能带来成本。 摄影/作者:Martin Vorel;授权:CC BY-SA 4.0。图片直链。
  • photo-stopwatch.jpg——Jeremyida002 拍摄的秒表。速度、等待时间和额度消耗,其实是三只不同的钟。 摄影/作者:Jeremyida002;授权:CC BY-SA 4.0。图片直链。
  • photo-software-developer-africa.jpg——Daudi mukiibi 拍摄的软件开发者工作照。真正有用的问题是:要修改多少轮才能得到可用结果? 摄影/作者:Daudi mukiibi;授权:CC BY-SA 4.0。图片直链。
  • photo-code-review-meeting.jpg——Matthew 拍摄的 Wikimedia 代码审查会议。无论模型多强,第二双眼睛仍然是流程的一部分。 摄影/作者:Matthew (Wikimedia Foundation);授权:CC BY-SA 3.0。图片直链。

研究资料截至 2026-09-28 UTC。OpenAI 页面提供官方模型定位、价格背景和公开基准测试框架;Reddit 图片与评论属于社区资料,不是严格控制的测试,也不是适用于所有人的答案。作者的 Luna Max 使用感受属于个人测试,不代表每个账号都会一样。发布前请再次核对最新权限、价格和图片使用条款。

我的默认选择是 Luna Max。

它同样需要修改;在我的工作流里,Sol 也要修改,而且消耗五小时上限更快。

WhatsApp 联系 Locke Lee