返回人工智能文章

人工智能 / 深度教学

OpenAI 发布 ChatGPT-6:这次更新了什么?

OpenAI 发布了一项重大更新,叫作 ChatGPT-6。下面会讲清楚它相比 GPT-5.6 改变了什么、基准数据说明什么,以及我亲自测试 Luna Max 的结果。

01 / 人工智能

OpenAI 发布 ChatGPT-6:这次是一次重大更新

截至 2026 年 9 月 24 日,“ChatGPT-6”更像是大家方便搜索的叫法。OpenAI 正式区分 GPT-6 Astra、Sol 和 Luna:Astra 处理最复杂的工作,Sol 平衡能力与成本,Luna 主打效率和规模。你实际使用的产品界面仍然很重要。

大家搜索的是 ChatGPT-6,但 OpenAI 的正式命名更细:GPT-6 Astra、GPT-6 Sol、GPT-6 Luna;ChatGPT Work 和 API 又会展示家族的不同部分。这不只是名称问题。一个人使用的是可以持续完成多步工作的工作界面,另一个人使用的是普通聊天,两张截图看着相似,背后的工具、系统提示和权限却可能完全不同。

2026 年 9 月这次更新,重点不是“旧聊天机器人把回答写得更长”。OpenAI 把方向推向持续工作:规划、浏览网页、写代码、处理文档、表格和电脑操作。Astra 是旗舰,Sol 是中间路线,Luna 是更注重成本的工作模型。先看任务,不要只看皇冠。

Helpameout 拍摄的服务器机柜;模型更新最终都运行在真实硬件上,不是悬浮在一片抽象的云里。
Helpameout 拍摄的服务器机柜;模型更新最终都运行在真实硬件上,不是悬浮在一片抽象的云里。 摄影/作者: Helpameout;授权: CC BY-SA 3.0。 来源页。 原图。
模型官方定位可以先试什么不要直接理解成…
GPT-6 Astra处理复杂推理和代码工作的最高能力模型长篇研究、技术工作、多步代理任务和需要反复修订的工作基准分数高,就代表每次回答都正确。
GPT-6 Sol平衡智能与成本复杂编码、研究和需要多个步骤连接起来的工作所有工作都一定胜过 GPT-5.6 Sol。
GPT-6 Luna高效、聚焦,适合高量任务提取、分类、例行草稿、标签和低成本测试便宜就等于写作和理解完全一样好。

所以真正有用的问题不是“ChatGPT-6 好不好”,而是“哪个 GPT-6、在哪个产品、用什么推理力度、做什么工作?”听起来不够漂亮,却实用得多。

另外,API 里的 gpt-6-luna 是模型编号,不是消费者月费方案名称。可用权限、额度、工具、记忆功能和推出速度,可能随产品、账号和分阶段发布而变化。模型页面和你看到的选择器不一样时,不要强行把它们讲成同一个东西。

02 / 人工智能

GPT-6 和 GPT-5.6 基准图:数据到底说明什么?

在最高推理力度下,GPT-6 Sol 在几项代理工作和代码测试中高于 GPT-5.6 Sol,但在 DeepSWE 和 OSWorld 上落后。图中五行比较里,GPT-6 Luna 则是上升或打平。
一张网上基准比较图,把最高推理力度下的 GPT-6 Sol、Luna 与 GPT-5.6 Sol、Luna 放在一起;数字来自 OpenAI 公开的发布数据,不是独立测试。
一张网上基准比较图,把最高推理力度下的 GPT-6 Sol、Luna 与 GPT-5.6 Sol、Luna 放在一起;数字来自 OpenAI 公开的发布数据,不是独立测试。 摄影/作者: MetricNexus;授权: online chart; confirm reuse terms before publication。 来源页。 原图。

这张图值得多看一会儿,因为它没有把发布日彩纸全部撒出来。GPT-6 Sol 在 AutomationBench 得分 32.0%,GPT-5.6 Sol 是 28.8%;Agents’ Last Exam 是 56.4% 对 52.8%;FrontierCode 也从 47.5% 上升到 49.3%。如果你的工作接近这些测试,差距有实际意义。

但另一边是比较尴尬的结果。在 DeepSWE v1.1 中,GPT-6 Sol 为 68.8%,低于 GPT-5.6 Sol 的 72.7%;OSWorld 2.0 offline 则是 64.4% 对 66.2%。GPT-6 Luna 在 DeepSWE 中是 66.6% 对 62.2%,OSWorld 则同为 52.7%。新一代不是每一级台阶都向上。

公开比较(最高推理力度)GPT-5.6 SolGPT-6 SolGPT-5.6 LunaGPT-6 Luna
AutomationBench28.8%32.0%17.0%20.7%
Agents’ Last Exam52.8%56.4%50.4%50.9%
FrontierCode47.5%49.3%39.8%42.4%
DeepSWE v1.172.7%68.8%62.2%66.6%
OSWorld 2.0 offline66.2%64.4%52.7%52.7%
如何阅读这张图

图片由 MetricNexus 发布,数字根据 OpenAI 公开的发布数据整理;它不是中立实验室独立复现的结果。最高推理力度也只是一个设置,不是模型永远的性格。中等设置的模型,在某个任务上可以胜过另一个模型的最高设置,换一个任务也可能输得很远。

基准测试是地图,不是判决书。如果你写客户中文、拆解混乱的表格,或者需要助手记住一份长 Brief,最重要的是测试它是否像你的实际失误方式。代码成绩高,不代表一定能保住你的语气;电脑操作成绩高,也不代表一定理解一封香港客户邮件的弦外之音。

03 / 人工智能

OpenAI 发布三款 GPT-6 模型:Astra、Sol 和 Luna

GPT-6 家族是有意分层的:Astra 用较高成本追求前沿能力;Sol 提供广泛而实用的中间选择;Luna 把低单价和高吞吐量放在最前面。

OpenAI 开发者页面列出三个 API 模型编号:gpt-6-astra、gpt-6-sol、gpt-6-luna。三个模型都支持文字和图片输入、文字输出、多语言能力以及超大上下文,但功能列表相似,不等于同一个 Prompt 会得到相同反应。

官方发布对比中,标准 API 价格大约是:Astra 每百万输入/输出 Token 为 $10/$50;GPT-6 Sol 为 $2/$10;GPT-6 Luna 为 $0.10/$0.50。对比的 GPT-5.6 Sol 是 $4/$20,GPT-5.6 Luna 是 $0.20/$1.20。这是 API Token 价格,不是 ChatGPT 月费,而且推理用量也会计入工作成本。

选择你实际在购买什么先问自己一句
Astra最高能力、更深的多步推理和代理式工作漏掉一个步骤的代价,是否高过使用贵模型的成本?
Sol不使用 Astra 的价格,仍保留较宽的能力范围这件事是否需要判断、工具和几个连续步骤?
Luna低单价和大量处理能力剩余错误能否由人工或规则低成本发现?
Crew 拍摄的程序员工作照片。代码协助是便宜模型很容易显得厉害的地方,但漏掉一条小限制,到了生产环境就不好玩了。
Crew 拍摄的程序员工作照片。代码协助是便宜模型很容易显得厉害的地方,但漏掉一条小限制,到了生产环境就不好玩了。 摄影/作者: Crew;授权: CC0 1.0 (as recorded by Wikimedia Commons)。 来源页。 原图。

一个模型可以是“最划算的”,却不是“写得最好的”。这句话听起来很明显,但模型讨论经常把质量当成一条梯子。真实价值更像是:可接受结果 × 处理量 ÷ 修正成本。Luna 做标签、提取字段和第一轮分类时可能赢得很漂亮;但如果一段客户文案让你来回重写三次,账就不一样了。

最高推理力度也不是免费魔法。它可能让难题做得更好,却会增加时间和成本;如果 Brief 本身不清楚,模型可能只是花更久自信地误解。停顿更长,不等于想得更深。

04 / 人工智能

ChatGPT-6 比 GPT-5.6 改变了什么?

最明显的方向是从“回答”转向“做事”:电脑操作、长步骤工作、规划以及专业和代码测试都有进展。但升级并不均匀,也会受产品界面影响。

GPT-5.6 Sol 本身已经面向代码、知识工作和电脑操作。GPT-6 Astra 的介绍则更强调让一个目标经过多个工具落地:填写在线表单、更新 CRM、整理日历、进行网页研究、处理文档和表格、生成图表、创建网站以及测试软件。不是说 GPT-5.6 完全做不到,而是 GPT-6 更像围绕一条较长的工作流程来设计。

OpenAI 还表示,Astra 在缺少重要信息时会提出更聚焦的问题,任务中途出现新条件时可以调整。听起来很小,但如果模型会先问“重写这份合同摘要之前,我需要知道读者是客户还是内部同事”,通常比写完一大段才发现问错人更省事。

OpenAI 公开比较GPT-6 AstraGPT-5.6 Sol说明
Agents’ Last Exam59.3%53.6%按所列设置,长篇专业任务有提升。
OSWorld 2.0 offline72.6%65.7%模拟电脑操作更强,但不等于你的桌面。
ScreenSpot-Pro92.7%76.9%这项界面定位测试有明显差距。
BenchCAD95.9%83.3%CAD 重建任务的公开分数更高。
Terminal-Bench 4.057.9%37.3%复杂终端工作流的公开分数更高。
Artificial Analysis Index v4.1.161.260.9广泛指数上的差距反而很小。

最后一行正好提醒我们,不要让一个数字解释一切。模型可以在专门的电脑操作或代码测试中跳得很高,但在广泛指数上只和前代接近。这不说明专项提升是假的,只说明提升有形状。

OpenAI 自己也给出了重要注释:这些是研究/API 环境中的最高努力测试,生产版 ChatGPT 可能因为系统提示、工具和产品设置而不同。而 Astra 对比页面的 GPT-5.6 Sol 行指向 API、Codex 或 ChatGPT Work 版本,普通 ChatGPT Chat 可能并不完全相同。比较之前,先写清楚你实际用的是哪一版。

05 / 人工智能

ChatGPT-6 新增电脑操作能力:可以帮你完成什么?

GPT-6 Astra 面向跨网站、软件和工具的工作,但电脑操作应该被视为有人监督的委派:先划边界,再检查动作,在不可逆步骤一定由真人批准。

OpenAI 所说的“模型使用电脑”,不只是读一张截图。例子包括填写表单、更新 CRM、整理日历、上网研究、处理文件和表格、创建网站以及运行软件测试。顺利时模型会规划、操作、检查并报告结果;不顺利时,它仍然可以非常高效地点击错误的按钮。

“找到了按钮”和“理解按下按钮的业务后果”是两回事。改日历通常可以撤回;发客户邮件、付款、删除账户、改数据库记录则未必。尽量让它在测试账户里工作,先要求显示计划动作,在真正产生后果的地方保留审批权。

Yamit29 拍摄的真实机器人实验室。这不是 GPT-6 演示图,只是提醒大家:软件代理与实体系统的失误方式可以完全不同。
Yamit29 拍摄的真实机器人实验室。这不是 GPT-6 演示图,只是提醒大家:软件代理与实体系统的失误方式可以完全不同。 摄影/作者: Yamit29;授权: CC BY-SA 4.0。 来源页。 原图。
工作类型可以先交给模型人工检查点
研究收集来源、比较说法、先整理发现记录。打开关键来源,确认结论确实有依据。
CRM 清理提出重复项、统一字段、准备变更列表。查看 Diff,然后批准真正写入。
日历提出时间、检查冲突、草拟邀请。确认参与人、时区、文字和最终发送。
网站测试跑流程、记录视觉问题、重现错误。检查环境、日志以及修复是否引入新风险。
真实照片不是产品截图

这里的机器人实验室照片是真实的网上照片,并不是 GPT-6 控制这台机器人的演示。实体系统有安全、时序和机械风险,不能因为一张有未来感的照片就把它当成模型能力证明。

Astra 的电脑操作提升,最适合用在工作足够长、阅读资料和交接逐渐成为瓶颈的地方。如果只是一个清楚的问题,不需要硬请一个带全套工具的助手登场。需要螺丝刀时,不要因为它带着电钻就觉得一定更专业。

06 / 人工智能

ChatGPT-6 对职场人士有什么实际用处?

GPT-6 的日常价值不是替代所有 App,而是让一项工作从阅读、计划、起草、检查到修改之间,少一些重新交代。

想象一位香港市场经理准备区域推广活动:先读客户 Brief,再做竞品研究,接着整理数字和关键词表格,最后变成双语提案和内部简报。最花时间的通常不是打第一段字,而是记得星期二邮件里的限制,以及知道某个数字究竟来自哪里。

能力更强的模型可以帮你保持这条线,但不要扔一堆材料后只说“帮我搞定”。交代 Brief、读者、已批准事实、不能说的内容和输出格式。先让它列出假设,再写成稿。这样才更像一份可以追踪的工作文件。

  1. 先收集,再写把材料、日期、目标读者和最新限制放在同一个工作上下文里,确认事实和想法分开。
  2. 先要计划让模型列出步骤和需要你决定的地方。计划错了,越早改,成本越小。
  3. 重复部分用便宜模型Luna 可以先做标签、提取字段、整理表格;遇到含糊判断,再交给 Sol 或 Astra。
  4. 让复核有具体形状要求来源、变更记录、假设清单或未解决事项;“帮我检查”不是方法。
  5. 计算完整交付时间从第一稿到可以发送,中间核对和修正都要算,不要只计算模型几秒钟答完。

对开发者来说,同一件事会变成一个要通过测试、代码审查和部署的修改。答案短,不等于工作快;如果之后花半天寻找漏掉的边界情况,账就完全不同。对分析师是从数据到结论的清晰路径;对经理可能只是不用第四次追问同一个缺失字段。

但要说清楚:GPT-6 不会自动理解你的公司。它理解的是你实际提供的上下文,加上产品给它的工具和权限。一个充满互相矛盾版本的共享硬盘,不会因为有助手搜索就突然变成知识库。

07 / 人工智能

学生应该如何使用 ChatGPT-6?

GPT-6 可以做耐心的辅导老师、出题工具和第二种解释。当它悄悄替你完成整份作业,学习工具就变成了答案外包。

学生可以用模型做三件相对健康的事:要求同一个概念用两个难度解释;要求它创造一个新例子;再让它逐题提问,不要一开始就揭答案。目标不是让页面更漂亮,而是迫使自己回忆、比较和改正。

可以这样问:“用简单中文解释下面的经济学图表,然后一次问我一个问题。如果我的回答不完整,先给提示,不要直接揭答案。最后告诉我还混淆哪些概念。”这个用法不太戏剧化,却更接近真正学习。好老师有时就是有一点烦。

RiaSrl 拍摄的电脑室。用模型学习,最后仍然要做到离开屏幕后,自己能把答案讲清楚。
RiaSrl 拍摄的电脑室。用模型学习,最后仍然要做到离开屏幕后,自己能把答案讲清楚。 摄影/作者: RiaSrl;授权: CC0 1.0。 来源页。 原图。
学生目标更好的提问自己一定要验证
真正理解要求解释、类比、反例和小测验。关掉对话后,你还能不能自己讲清楚?
写作先点评论点、证据、结构和语气,再要求改写。主张是不是自己理解,资料和作业要求是否一致?
代码要求提示、测试案例和每个改动的原因。你能否预测输出,也能否独立处理相似问题?
复习提供课程笔记,要求分散提问和错题记录。问题是否真的来自课程内容,而不是模型编造的细节?

模型对学生最麻烦的一点是:它可以错得很流畅,刚好足以教出一个误解。重要细节要用课本、老师、官方文档或原始资料做锚点;好答案应该经得起第二个来源的核对。

当然可以用 GPT-6 起草。但最后要看你能不能解释和维护这份作业。如果关闭聊天窗口,答案就立刻散掉,那份知识只是借来的,还没有学会。

08 / 人工智能

GPT-6 上下文窗口变大,是否代表记忆更强?

GPT-6 API 页面列出家族模型大约有 105 万 Token 上下文窗口,最高输出约 128,000 Token。一次可以放很多材料,不等于模型永久记住,也不代表它会平均理解每一页。

上下文窗口可以理解成模型面前的一张很大的工作桌。桌子变大后,你可以放更多文件、代码和对话;但文件之间的矛盾不会自动消失,也不保证模型会注意第 412 页那句小字。长上下文减少“再贴一次”的麻烦,却也让不整理就塞入大量材料变得更昂贵。

记忆是另一种产品行为,账号记忆和一次性放入一百万 Token 完全不是一回事。有些产品可以记住偏好,但不代表它自动能看到你没有提供的私密文件、旧对话或实时数据库。不要把“长上下文”当成“它了解我”。

概念实际含义更稳妥的做法
上下文窗口一次工作中可以提供的文字或多模态材料容量。大文件分章节,并建立决定与问题记录。
记忆产品可能跨对话保留部分用户信息的功能。检查存储内容、删除方式,以及工作区是否允许。
检索/连接器产品从文件、网站或工具获取资料的方式。确认是哪个账号、哪种权限提供了材料。
推理力度用更多时间和 Token 处理部分难题的设置。比较模型时锁定设置,不要把 max 和快速模式混在一起。

长上下文工作最好有小型索引:来源、日期、决定和未解决问题。让模型引用使用过的段落,并标出互相矛盾的版本。这样没有那么华丽,却比“上传整个公司档案库,让它理解”更容易审计。

09 / 人工智能

我亲自测试了 GPT-6 Luna Max:更划算,但 GPT-5.6 Luna Max 写得更好

按我自己的测试,GPT-6 Luna Max 是成本效益最吸引的选择;但在写作能力和理解指令方面,GPT-6 Luna Max 明显不如 GPT-5.6 Luna Max。这两个结论要分开看。

这一节我不想把它藏在一张漂亮的基准表后面。我亲自用真正关心的写作和理解任务测试了 GPT-6 Luna Max,最后得到一个不太顺耳、但比较实用的结论:GPT-6 Luna Max 最划算,GPT-5.6 Luna Max 更像是更好的写作者和阅读者。

在写作方面,GPT-5.6 Luna Max 对语气、结构以及那些“没有明说、但其实很重要”的小要求更稳定。GPT-6 Luna Max 能交出一份看起来合格的草稿,却有时会轻轻放掉真正需要守住的语气或限制。在理解方面,我觉得 GPT-5.6 Luna Max 更能保留完整指令和真正问题;GPT-6 Luna Max 更常需要我重新说明,或者再纠正一次。

这不证明 GPT-6 Luna Max 对所有人都一定更差。这只是我在自己的 Prompt、语言组合、任务种类和产品界面下的体验。不同账号、发布批次、隐藏系统指令、推理设置和工作负载,都可能改变结果。个人测试是工作流证据,不是新基准。

我的测试方向GPT-6 Luna MaxGPT-5.6 Luna Max我的实际判断
成本效益以我需要的工作量和价格来看,整体最划算。相对新 Luna 价格,成本更高。大量草稿、提取和容易人工复核的工作先用新 Luna。
写作能完成基本要求,但语气和结构限制更容易滑掉。在我测试的写作任务中更稳定,更容易一次到位。对声音敏感的文案暂时保留 GPT-5.6 Luna Max。
理解通常能抓到主题,但容易漏细节或完整要求,需要重说。更能保留整段指令和隐含限制。迁移内容流程前先使用固定测试集。
适合的角色高量草稿、资料整理、字段提取和低成本试验。细腻语气、高阅读要求、返工代价大的任务。划算和质量是两条轴。
诚实的标签

以上是作者个人报告,不是控制严格的实验室对比。写出来是因为普通用户感受到的不是一行分数,而是要改多少次、漏掉多少条指令,以及最后花了多少时间把答案救回来。

所以我现在的选择并不戏剧化:成本重要、错误又可以低成本发现的工作,我会先用 GPT-6 Luna Max;对语气敏感、理解要求高的写作,我不会因为型号升级就自动从 GPT-5.6 Luna Max 搬走。账单便宜了,如果每份草稿都要大修,最后可能更贵。

10 / 人工智能

Reddit 用户如何评价 GPT-6 Sol?

r/ChatGPT 有几个讨论串认为 GPT-6 Sol 在部分非代码问题、推理深度和执行到底的能力上,感觉不如 GPT-5.6 Sol。这些是有参考价值的用户反馈,但属于轶事,不能证明 GPT-6 Sol 客观上更差。

社区反应不是一个整齐的结论。Reddit 的 ChatGPT subreddit 有讨论直接比较 GPT-6 Sol 和 GPT-5.6 Sol,有人认为新模型处理非编码 Prompt 时明显变差;另一个讨论则收集用户对 GPT-5.6 Sol 在 GPT-6 发布后变得不太可靠的感觉。留言有时很激烈,甚至带粗口,但反复出现的问题值得看一眼。

我自己测试 Luna Max 也看到类似的形状:公开能力和使用感可能拉开。模型可以在代理工作分数上升、成本下降,却仍然让重视语气、克制和完整跟随 Brief 的写作者觉得更差。因为“好”本来就有几个切面。

University of Salford Press Office 拍摄的学生电脑室照片;技术会变,但学习仍然需要人真正投入。
University of Salford Press Office 拍摄的学生电脑室照片;技术会变,但学习仍然需要人真正投入。 摄影/作者: University of Salford Press Office;授权: CC BY 2.0。 来源页。 原图。
为什么 Reddit 用户会得出不同答案可能变化的地方
任务不同代码、研究、翻译和创意写作,压力点完全不同。
设置不同max、high、medium 或自动模式,会影响时间、深度和成本。
产品不同Chat、ChatGPT Work、Codex 和 API 可能使用不同工具、提示或路由。
发布不同步更新、流量分配和账号实验,不一定同一天到达所有人。
容忍度不同有人觉得短答案有效率,有人觉得它太浅。

所以可以把 Reddit 当成“值得自己测试”的提醒,不要当成宣布冠军的许可。用同一份材料、同一个 Prompt、锁定同一个推理设置,再按你真正关心的项目评分。否则你可能只是在比较两个星期二的心情。

11 / 人工智能

基准图看不到的 GPT-6 问题

GPT-6 的代理和网络安全能力越强,权限边界、监控和人工审批就越有价值。基准测试可以显示任务是否完成,却不会自动显示公司的数据规则和恢复方案是否准备好。

OpenAI 对 GPT-6 Astra 的资料和安全说明,将更强的电脑操作、代码和网络安全能力与分阶段发布、安全工作一起讨论。实际教训不是“模型一定危险”,也不是“模型已经安全”,而是能力和控制要一起增长。可以执行更多动作,就要有更清晰的范围、记录、审批点以及停止或撤销的方法。

普通用户可以先守几条简单规则:没有确认账号和保留政策前,不要随便粘贴密钥;不要让模型未经复核就发送、付款、删除或发布;看起来像引用的句子不等于证据。公司还要加入最小权限、测试账号、事件记录和恢复路径。最无聊的部分,通常正是最有用的部分。

风险可能的表现可执行的控制
自信错误流畅答案把假设说成事实。重要主张要求来源、假设和第二次核对。
权限过宽助手看到的文件或工具超过任务所需。使用最小权限和独立测试账号。
不可逆操作邮件、付款或记录修改在人查看前已经发生。先显示 Diff/预览,最后一步由真人明确批准。
提示或工具注入不可信内容试图改写助手原本的指令。把检索文字当作数据,隔离工具,检查待执行动作。
私密资料敏感内容被粘贴到错误账号或工作流。先检查数据政策、保留设置和工作区边界。

模型不是整个系统。浏览器登录状态、连接器权限、供应商设置、保存的文件和人的习惯,都会参与最终结果。账号给了过多权限后出了问题,不要只怪语言模型;有时更像是怪打印机把没收好的机密文件留在纸盘里。

12 / 人工智能

如何自己测试 ChatGPT-6?

先做一个小而可重复的比较:同一份材料、同一个 Prompt、同一个推理设置、同一张评分表,再由真人记录需要改多少。
  1. 选五件真实工作用你平时会做的:双语改写、长文档摘要、表格解释、代码修改和研究比较。不要使用过于玩具化的 Prompt。
  2. 固定输入保存实际文件、来源、日期和 Prompt 版本。中途改动,就记录原因。
  3. 比较同类尽量使用相同推理力度,并写明自己用的是 Chat、Work、Codex 还是 API。
  4. 把质量和返工分开评分分别评价准确性、遵循指令、语气、完整度、速度和人工修改数量。
  5. 计算完成一件任务的成本Token 单价不够,还要算推理用量、重试、复核时间和错误结果的代价。
  6. 设定停止线如果模型反复漏掉不能漏的限制,就停止迁移。便宜模型制造出新工作,就不算划算。

我的结论是两条线并行:GPT-6 Luna Max 在成本效益上很吸引,但在我测试的写作和理解任务中,GPT-5.6 Luna Max 仍然更好。Sol 的公开图表也有类似形状:有几行进步,也有几行退步。升级是真的,但不是一支只会向上的箭头。

如果要用一句话解释“ChatGPT-6 是什么”,我会说:它是一个把代理能力推向长流程、同时试图降低实用工作成本的模型家族;Astra 推高能力上限,Sol 做中间平衡,Luna 把经济性放在前面。没必要急着为数字欢呼,先用真实工作测试。

几个快速答案

ChatGPT-6 是一个模型吗?不是。实际使用时,大家用这个词指一整个家族和几种产品界面;你最终收到哪个模型,才是关键。

GPT-6 一定比 GPT-5.6 好吗? 不一定。公开图表本身就有上有下,而我的写作和理解测试偏向 GPT-5.6 Luna Max。

Luna 是不是小号 Astra? 它定位为高效模型,不是保证用半价获得完全相同的能力。应该根据质量和复核成本选择。

基准图能不能完全相信? 可以把它当作有设置、有来源的公司公开证据,但它不是独立复现,也不是你的工作结果。

第一步做什么? 选五件真实工作,用同一份材料比较两代模型,再计算修改时间。这张小表格往往比发布日争论更有用。

资料来源

来源、日期和图片授权

  1. OpenAI:GPT-6 Astra——新一代智能
  2. OpenAI:GPT-6 Sol 与 GPT-6 Luna
  3. OpenAI Developers:API 模型页面
  4. OpenAI:ChatGPT Work
  5. OpenAI:GPT-5.6
  6. OpenAI Help:ChatGPT 更新说明
  7. OpenAI Deployment Safety:GPT-6 Astra
  8. MetricNexus:GPT-6 Sol、Luna 基准、价格与成本比较
  9. Reddit r/ChatGPT:GPT-6 Sol 用户讨论
  10. Reddit r/ChatGPT:5.6 与 6 Sol/Luna 讨论
  11. Reddit r/ChatGPT:GPT-6 发布后 GPT-5.6 Sol 用户讨论

图片来源与授权备注

  • benchmark-gpt6-vs-gpt56.webp——一张网上基准比较图,把最高推理力度下的 GPT-6 Sol、Luna 与 GPT-5.6 Sol、Luna 放在一起;数字来自 OpenAI 公开的发布数据,不是独立测试。 发布/整理来源:MetricNexus;online chart; confirm reuse terms before publication。图片直链。
  • photo-server-racks.jpg——Helpameout 拍摄的服务器机柜;模型更新最终都运行在真实硬件上,不是悬浮在一片抽象的云里。 摄影/作者:Helpameout;授权:CC BY-SA 3.0。图片直链。
  • photo-robotics-lab.jpg——Yamit29 拍摄的真实机器人实验室。这不是 GPT-6 演示图,只是提醒大家:软件代理与实体系统的失误方式可以完全不同。 摄影/作者:Yamit29;授权:CC BY-SA 4.0。图片直链。
  • photo-computer-lab.jpg——RiaSrl 拍摄的电脑室。用模型学习,最后仍然要做到离开屏幕后,自己能把答案讲清楚。 摄影/作者:RiaSrl;授权:CC0 1.0。图片直链。
  • photo-students-computer-lab.jpg——University of Salford Press Office 拍摄的学生电脑室照片;技术会变,但学习仍然需要人真正投入。 摄影/作者:University of Salford Press Office;授权:CC BY 2.0。图片直链。
  • photo-programmer.jpg——Crew 拍摄的程序员工作照片。代码协助是便宜模型很容易显得厉害的地方,但漏掉一条小限制,到了生产环境就不好玩了。 摄影/作者:Crew;授权:CC0 1.0 (as recorded by Wikimedia Commons)。图片直链。

研究资料截至 2026-09-24 UTC。本文将 OpenAI 官方说法、公司公开基准数据、作者个人测试和 Reddit 社区讨论分开处理。Reddit 帖子属于轶事,不是控制严格的评测。产品名称、可用权限、设置、价格和路由可能变化;在作出产品或工作流决定前,请再次核对最新资料。

测试真实工作,不要只测试数字。

GPT-6 是一组取舍。最有用的模型,是能以你接受的成本完成真实任务,也经得起人工复核。

WhatsApp 联系 Locke Lee