本文内容+
01 / 人工智能
GPT-5.6 Luna、Terra 还是 Sol:到底有什么区别?
刚开始试 GPT-5.6 时,我也以为 Sol 会自然成为默认答案。它确实有一些工作做得更好;问题是额度掉得很快,遇到写得不清楚的 Brief 也一样会要求你再改。用了几个月以后,我的答案反而简单了:平时先开 Luna Max。
三个模型并不是完全一样。价格、推理力度、速度和完成一项任务要走多少步骤都不同。Reddit 的比较图有意思的地方,就是把这些差别放回数字里。还有一点:Luna low 和 Luna max 的实际体验可以差很远,只说模型名称其实还没说完。

| 模型 | 大概适合什么 | 我会怎么开始 |
|---|---|---|
| GPT-5.6 Luna | 便宜、重复性高、容易检查的工作 | 起草、资料提取、小型代码修改和例行修正。 |
| GPT-5.6 Terra | 已经有计划,但范围比较大的实施工作 | 需要查看几个文件、执行较长流程,但方向已经确定。 |
| GPT-5.6 Sol | 含糊、难以调试、出错代价高的工作 | 架构判断、深度研究,以及不想漏掉关键步骤的任务。 |
大致就是这样。下面再把图表的数字、Terra 的位置,以及我为什么最后仍然用 Luna Max 做默认选择讲清楚。
02 / 人工智能
先看 Reddit 的成本图

这张比较图来自 Reddit 上一篇讨论 GPT-5.6 的帖子,比较首轮成功率、平均任务成本、输出量和步骤。首轮成功率只是那次测试中第一轮通过的比例,不代表 Sol 一定懂你的代码库,也不代表 Luna 一定会把下一封邮件写乱。
我把图里的 15 行完整打出来。放大截图看表格,说实话有点麻烦;之后想搜索某一行也不方便。数字可以直接看,限制也要一起看:这是一次社区比较,不是 OpenAI 官方价目表,更不是适用于所有工作的排名。
| 模型/力度 | 首轮成功率 | 平均成本 | 输出量 | 步骤 |
|---|---|---|---|---|
| GPT-5.6 Sol max | 73% ± 3% | $8.39 | 60k | 61 |
| GPT-5.6 Sol xhigh | 71% ± 1% | $4.70 | 41k | 44 |
| GPT-5.6 Terra max | 70% ± 3% | $3.96 | 72k | 76 |
| GPT-5.6 Sol high | 69% ± 1% | $3.47 | 28k | 37 |
| GPT-5.6 Luna max | 67% ± 4% | $0.61 | 73k | 102 |
| GPT-5.6 Sol medium | 61% ± 2% | $1.86 | 18k | 31 |
| GPT-5.6 Terra xhigh | 60% ± 2% | $1.70 | 40k | 43 |
| GPT-5.6 Luna xhigh | 57% ± 2% | $0.31 | 45k | 71 |
| GPT-5.6 Terra high | 54% ± 4% | $0.91 | 22k | 34 |
| GPT-5.6 Sol low | 45% ± 2% | $1.07 | 11k | 23 |
| GPT-5.6 Luna high | 44% ± 3% | $0.16 | 26k | 49 |
| GPT-5.6 Terra medium | 35% ± 3% | $0.47 | 12k | 25 |
| GPT-5.6 Terra low | 24% ± 1% | $0.34 | 8.6k | 21 |
| GPT-5.6 Luna medium | 11% ± 1% | $0.04 | 8.2k | 24 |
| GPT-5.6 Luna low | 2% ± 1% | $0.01 | 3.1k | 12 |
第一眼最抢眼的是 Luna max:67%,平均 $0.61。Sol max 是 73%,平均 $8.39。也就是说 Sol 多了 6 个百分点,但图表显示的成本大约是 14 倍。任务很容易检查时,这个差价很难忽略;如果是正式系统,少一次严重错误可能已经值回来了。
第二眼会看到另一面:Luna max 走 102 步,Sol max 走 61 步。便宜不代表快,分数高也不代表短。Luna 有时要绕一点路才能到终点——可以接受,但不是免费的散步。
03 / 人工智能
三个模型分别适合什么工作?
GPT-5.6 官方页面列出的 API 价格是:Sol 每一百万个输入 Token $5、输出 $30;Terra 是 $2.50 和 $15;Luna 是 $1 和 $6。如果你直接使用 API,这些数字比较实在。使用工作界面时,感受到的通常是额度、等待时间和五小时窗口还剩多少空间。
我的理解是:Luna 适合剩余错误有人帮你发现;Terra 适合方向已经确定、但工作不小;Sol 则留给真正需要判断的地方。不是越贵,就越应该每天开着。

| 你面前的工作 | 可以先试 | 什么情况升级 |
|---|---|---|
| 短改动、提取资料、小型修正 | Luna high/xhigh | 经常漏要求,或者检查已经不再简单。 |
| 有计划、需要跨几个文件 | Terra high/xhigh | 计划本身有问题、范围变大,或者开始需要取舍。 |
| 架构、深度调试、研究 | Sol high/xhigh | 出错代价高过额外额度。 |
| 关键问题 | Sol max | 只有避免的失败确实值得这条高级路线。 |
还有一个很容易漏掉的地方:大家说“我测试过 Luna”,不一定真的用的是同一个设置。Luna low 和 Luna max 已经是两回事,Terra 和 Sol 也一样。比较时要把力度写清楚,否则就像拿汽车一档的速度和高速公路相比,然后说结果很奇怪。
04 / 人工智能
图表里的成本不等于你的账号限额
这个区别很重要。图表写 $0.61,不代表你的账号会扣 61 美分;Sol max 写 $8.39,也不代表你会收到一张 API 式的逐项账单。不同产品可能计算消息、推理用量、滚动时间窗、方案路由,或者几项一起算。
但实际影响一样会感觉到。重型 Sol 任务用得快,剩下的工作空间就少;之后想再试另一件事,也要先想一想。这是我最后没有把 Sol 当成日常默认选择的主要原因之一。

| 数字 | 它说明什么 | 它没有说明什么 |
|---|---|---|
| API Token 价格 | 你自己控制请求时的公开单价 | 你的 ChatGPT/Codex 账号会扣多少。 |
| 平均任务成本 | 那次测试中的相对成本 | 你的下一项任务一定是这个价格。 |
| 输出量 | 模型生成了多少内容 | 内容一定好。 |
| 步骤 | 流程走了多少回合/动作 | 你最后要修改多少次。 |
| 五小时上限 | 你在那段时间还剩多少工作空间 | 基准分数。 |
我会把它看成三只钟:钱、模型工作量、你还能继续工作的时间。三只钟不一定一起走,所以图表里最便宜的一格,实际用起来未必最快;最贵的一格,也不会自动让你一稿完成。
05 / 人工智能
为什么 Luna Max 这么多人选?
图表里的 Luna max 是 67% 首轮成功率、$0.61、73k 输出量和 102 步。这个组合不算漂亮,却很实用。它比 Sol max 走更多步骤,成本却低很多。
附近几行更有意思:Luna xhigh 是 57%/$0.31,Luna max 是 67%/$0.61。多花三毛钱,这次测试多了十个百分点。Terra max 是 70%/$3.96,Sol high 是 69%/$3.47。不是每多花一块钱,都能换到一样多的质量。
| 比较 | 图表显示什么 | 我会再问什么 |
|---|---|---|
| Luna max/Sol max | 差 6 点;显示成本差约 14 倍 | Luna 剩下的错误,自己容易发现吗? |
| Luna xhigh/Luna max | 多 $0.30,成功率高 10 点 | 小任务是不是开始卡住了? |
| Terra max/Sol high | Terra 高 1 点,但贵 $0.49 | 我需要 Terra 的执行,还是 Sol 的判断? |
所以 Luna Max 有时会绕路。能不能接受?如果是起草、整理表格或可以测试的代码改动,我大多可以接受;如果是修改正式资料,仍然要加人工确认,不会因为便宜就放弃流程。
06 / 人工智能
我用了几个月 Luna Max,实际感觉怎么样?
这部分是我真正做工作后的感觉,不是实验室报告。Luna Max 并不是每次第一轮就明白我想要什么。有时要重新说明语气,有时要指出哪一段偏了,有时就直接说:“不对,我不是要这个。”两三轮修改,对比较复杂的工作很正常。
最意外的是 Sol 并没有完全消除这种来回。某些难题它的第一稿确实更强,但我仍然需要带着它走;额度却掉得快很多。如果最后还要我判断、改句子、补限制,贵模型未必帮我省下时间。

| 我看到的情况 | 我的答案 |
|---|---|
| Luna Max 能做到可用吗? | 通常可以,前提是我给出清楚边界和例子。 |
| 第一轮能跟上所有细节吗? | 不能。要求高时,准备修改两三轮更实际。 |
| Sol 一定更省时间吗? | 在我的工作流里不一定。 |
| 为什么仍然用 Luna 默认? | 能留下空间重试,也能做其他工作。 |
我说“可用程度”,意思是我可以继续做下去,不用每句话都照顾模型,同时还剩足够额度完成今天其他事情。Luna Max 对我来说赢在这里。有人在做困难代码库,选择 Sol 完全合理;工作不同,账本自然也不同。
07 / 人工智能
Sol 什么时候才值得用?
Reddit 帖子提到的路由顺序挺合理:先试轻量 Luna,开始卡住就上 Luna Max,再按工作难度考虑 Sol high、xhigh、max。我不会因为 Prompt 听起来很重要,就直接开 Sol Max。要求写得含糊,贵模型一样可以很有耐心地做错事。
Sol high 是我觉得比较实际的高级位置:69%/$3.47/37 步;Sol xhigh 71%/$4.70/44 步;Sol max 73%/$8.39/61 步。至少有一层层的选择,不需要每次跳到最高档。

| Sol 设置 | 图表数字 | 我会用在 |
|---|---|---|
| Sol high | 69%/$3.47/37 步 | 困难,但仍然需要控制成本的工作。 |
| Sol xhigh | 71%/$4.70/44 步 | 轻量路线已经顶不住的任务。 |
| Sol max | 73%/$8.39/61 步 | 真正困难、真的不想漏掉的边缘情况。 |
前提是给它一份像样的 Brief:相关文件、不能改变的限制、验收方法和测试。否则就像花钱请专家,却让专家自己猜要做什么。专家也会猜错,而且有时猜得很有说服力。
08 / 人工智能
Terra 是不是最中间、最稳妥?
Terra max 是 70%/$3.96/72k/76 步;Terra xhigh 是 60%/$1.70/40k/43 步。按这张图比较,Terra max 比 Sol high 贵,步骤也更多,但首轮成功率只高一点,所以原帖作者把 Sol high 放在更划算的中间位置。
但评论里有人说 Terra xhigh 比 Sol 快,有人用 Terra 做实施、Sol 做规划,也有人觉得 Sol 太喜欢想复杂,Luna xhigh 做默认反而顺。这些意见可以同时成立,因为大家根本没有在做同一件事。
| 如果你已经有… | Terra 可能合适 | 记得检查 |
|---|---|---|
| 清楚计划和文件范围 | 可以做更宽的实施,不必马上开 Sol max。 | 让它记录修改并运行测试。 |
| 想要比 Luna 多一点伸展 | Terra xhigh 值得自己试一轮。 | 别的代码库上的速度,未必能复制。 |
| 架构还没确定 | 先用 Terra 整理选项,再考虑用 Sol 做困难判断。 | 快速做错,仍然是做错。 |
所以我会把 Terra 当成实际的中间选择,而不是“两边都不够好”的那一格。方向已经确定、工作范围却比较大时,它有用;方向还没有确定,就先花钱买判断。
09 / 人工智能
我现在会怎么选模型?
- 小而清楚Luna high 或 xhigh。几秒就能看出有没有错,不需要一开始就用重型路线。
- 普通日常工作Luna Max。这是我实际使用下来最平衡的位置。
- 有计划的多文件工作Terra high 或 xhigh。方向已经确定,希望有更大的执行范围。
- 架构含糊或风险高Sol high。难的是判断,不是打字速度。
- 便宜路线已经失败Sol xhigh 或 max。到了这一步,额外用量更容易解释。
| 情况 | 我会先选 | 原因 |
|---|---|---|
| 短、容易检查的任务 | Luna high/xhigh | 改错便宜。 |
| 日常工作 | Luna Max | 我自己用下来最平衡。 |
| 有计划的实施 | Terra high/xhigh | 多一点执行范围,不用马上付 Sol max。 |
| 架构或难调试 | Sol high | 额外判断值得花钱。 |
| 失败代价很高 | Sol xhigh/max | 避免一个大错误可能比额度更值钱。 |
这是我现在的顺序,不是永远的规则。你试五件真实工作后,可能会把 Terra 放前面,也可能大部分时间停在 Luna xhigh。至少有一条可以调整的规则,比靠一张漂亮截图争喜好实际。
10 / 人工智能
要修改两三次,Luna 还划算吗?
如果 Luna 第一轮给了一个可用草稿,我只需要调整读者、语气或一个测试,两三轮不算大问题。每一轮都看得懂,任务仍然便宜,这就是 Luna 发挥的地方。
但如果每次都要从头跑,同一个错误改完又回来,或者结果会改到客户资料、正式系统和金钱,我会早点升级。模型便宜了,不代表你应该花半天帮它收拾残局;账单只是从账号搬到了日历。
| Luna 仍然值得先试 | 我会升级 |
|---|---|
| 修改小而清楚。 | 同一个错误改两次还回来。 |
| 有测试、清单或人工快速复核。 | 会碰到法律、金钱、安全或正式数据。 |
| 要求稳定,有例子。 | 条件一直变化,连目标都还没确定。 |
| 同一个窗口里还要完成很多工作。 | 事情少见但关键,重做一次很贵。 |
我会计算“完成一项工作真正用了多少”,而不是只算第一稿。把复核、重试、等待和重新解释也算进去。你的数字可能和 Reddit 图表一样,也可能不一样;都没关系,因为那才是你的工作成本。
11 / 人工智能
为什么 Reddit 评论会这么分歧?
有人说 Sol 可以一轮完成困难项目,几次 Luna 都做不到;有人说 Sol 太喜欢思考,把简单工作弄复杂;有人觉得 Terra xhigh 更快;也有人用 Sol 做规划、Terra 做实施。这些经验不一定互相推翻,可能只是大家的工作痛点不同。
写文章的人重视语气、细节和有没有跟上要求;开发者重视测试,也担心改动影响到几层文件以外的东西;研究工作可能最看重来源。模型名称相同,真正要解决的问题却不同。
| 会影响结果的地方 | 为什么 |
|---|---|
| 工作类型 | 写作、调试、研究和实施,需要的能力不同。 |
| 提示写法 | 验收方法清楚,模型才知道做到哪里算完成。 |
| 产品界面 | Chat、Codex、Work 和 API 的工具与限制可能不同。 |
| 推理力度 | low、medium、high、xhigh、max 不是同一种测试。 |
| 复核的人 | 抓错快的人,更容易安全地使用便宜模型。 |
| 资料日期 | 价格和路由会变,旧截图却不会自动更新。 |
图片可以保留,因为它把一次取舍画得很清楚;产品细节还是要再看官方页面,最好自己跑几项工作。不要要求一张截图解释一个会变化的产品——它没有这么长的寿命。
12 / 人工智能
最后我的选择:Luna Max
如果你问我现在会怎么开始:普通工作先用 Luna Max,给清楚要求、例子和验收方法。需要修改两三轮,不代表它马上出局,先看每一轮是不是便宜、看得懂,而且有没有向前走。
工作范围宽但方向确定,就试 Terra。工作含糊、难调试、漏一步会很贵,再用 Sol。Sol 当然有用;我只是觉得没有必要每天开跑车买菜,用它处理所有最普通的事情。
| 问题 | 我的答案 |
|---|---|
| 日常最平衡? | GPT-5.6 Luna Max,基于我自己用了几个月的工作。 |
| Terra 放在哪里? | 有计划、范围较宽的实施。 |
| Sol 什么时候值得? | 判断、深度或失败代价值得额外额度时。 |
| Reddit 图表已经判定胜负? | 没有。它给出起点,真正的工作才完成比较。 |
| Luna 修改两三轮就不划算? | 不一定;如果每轮容易检查,总成本仍可能更低。 |
如果你想自己测一次
选一周内五项真实工作,尽量固定文件和提示,记录首轮结果、修改次数、等待时间、额度,以及最后敢不敢直接交付。这份小记录,比争论哪个模型最强实际得多。
选择便宜模型没有什么丢脸,选择贵模型也没有功德。额外推理真的买到了你需要的东西,就付钱;如果只是让对话变长,换回轻一点的路线,也没什么不好。
资料来源
来源、日期和图片授权
图片来源与授权备注
- photo-two-laptops.jpg——Tsinkala 拍摄的软件开发者同时使用两台笔记本电脑。选择模型是工作决定,不是单纯追排行榜。 摄影/作者:Tsinkala;授权:CC BY-SA 4.0。图片直链。
- reddit-gpt56-cost-speed-chart.png——Reddit 讨论帖中的成本、输出量和步骤比较图。这是社区整理的比较,不是 OpenAI 官方价目表,也不是适用于所有人的统一基准测试。 发布来源:Reddit post author;Reddit-hosted community chart; confirm reuse permission before publication。图片直链。
- photo-programming-code.jpg——Martin Vorel 拍摄的程序代码。推理步骤更多可能有帮助,但每一步也可能带来成本。 摄影/作者:Martin Vorel;授权:CC BY-SA 4.0。图片直链。
- photo-stopwatch.jpg——Jeremyida002 拍摄的秒表。速度、等待时间和额度消耗,其实是三只不同的钟。 摄影/作者:Jeremyida002;授权:CC BY-SA 4.0。图片直链。
- photo-software-developer-africa.jpg——Daudi mukiibi 拍摄的软件开发者工作照。真正有用的问题是:要修改多少轮才能得到可用结果? 摄影/作者:Daudi mukiibi;授权:CC BY-SA 4.0。图片直链。
- photo-code-review-meeting.jpg——Matthew 拍摄的 Wikimedia 代码审查会议。无论模型多强,第二双眼睛仍然是流程的一部分。 摄影/作者:Matthew (Wikimedia Foundation);授权:CC BY-SA 3.0。图片直链。
研究资料截至 2026-09-28 UTC。OpenAI 页面提供官方模型定位、价格背景和公开基准测试框架;Reddit 图片与评论属于社区资料,不是严格控制的测试,也不是适用于所有人的答案。作者的 Luna Max 使用感受属于个人测试,不代表每个账号都会一样。发布前请再次核对最新权限、价格和图片使用条款。