本文内容+
01 / 人工智能
OpenAI 发布 ChatGPT-6:这次是一次重大更新
大家搜索的是 ChatGPT-6,但 OpenAI 的正式命名更细:GPT-6 Astra、GPT-6 Sol、GPT-6 Luna;ChatGPT Work 和 API 又会展示家族的不同部分。这不只是名称问题。一个人使用的是可以持续完成多步工作的工作界面,另一个人使用的是普通聊天,两张截图看着相似,背后的工具、系统提示和权限却可能完全不同。
2026 年 9 月这次更新,重点不是“旧聊天机器人把回答写得更长”。OpenAI 把方向推向持续工作:规划、浏览网页、写代码、处理文档、表格和电脑操作。Astra 是旗舰,Sol 是中间路线,Luna 是更注重成本的工作模型。先看任务,不要只看皇冠。

| 模型 | 官方定位 | 可以先试什么 | 不要直接理解成… |
|---|---|---|---|
| GPT-6 Astra | 处理复杂推理和代码工作的最高能力模型 | 长篇研究、技术工作、多步代理任务和需要反复修订的工作 | 基准分数高,就代表每次回答都正确。 |
| GPT-6 Sol | 平衡智能与成本 | 复杂编码、研究和需要多个步骤连接起来的工作 | 所有工作都一定胜过 GPT-5.6 Sol。 |
| GPT-6 Luna | 高效、聚焦,适合高量任务 | 提取、分类、例行草稿、标签和低成本测试 | 便宜就等于写作和理解完全一样好。 |
所以真正有用的问题不是“ChatGPT-6 好不好”,而是“哪个 GPT-6、在哪个产品、用什么推理力度、做什么工作?”听起来不够漂亮,却实用得多。
另外,API 里的 gpt-6-luna 是模型编号,不是消费者月费方案名称。可用权限、额度、工具、记忆功能和推出速度,可能随产品、账号和分阶段发布而变化。模型页面和你看到的选择器不一样时,不要强行把它们讲成同一个东西。
02 / 人工智能
GPT-6 和 GPT-5.6 基准图:数据到底说明什么?

这张图值得多看一会儿,因为它没有把发布日彩纸全部撒出来。GPT-6 Sol 在 AutomationBench 得分 32.0%,GPT-5.6 Sol 是 28.8%;Agents’ Last Exam 是 56.4% 对 52.8%;FrontierCode 也从 47.5% 上升到 49.3%。如果你的工作接近这些测试,差距有实际意义。
但另一边是比较尴尬的结果。在 DeepSWE v1.1 中,GPT-6 Sol 为 68.8%,低于 GPT-5.6 Sol 的 72.7%;OSWorld 2.0 offline 则是 64.4% 对 66.2%。GPT-6 Luna 在 DeepSWE 中是 66.6% 对 62.2%,OSWorld 则同为 52.7%。新一代不是每一级台阶都向上。
| 公开比较(最高推理力度) | GPT-5.6 Sol | GPT-6 Sol | GPT-5.6 Luna | GPT-6 Luna |
|---|---|---|---|---|
| AutomationBench | 28.8% | 32.0% | 17.0% | 20.7% |
| Agents’ Last Exam | 52.8% | 56.4% | 50.4% | 50.9% |
| FrontierCode | 47.5% | 49.3% | 39.8% | 42.4% |
| DeepSWE v1.1 | 72.7% | 68.8% | 62.2% | 66.6% |
| OSWorld 2.0 offline | 66.2% | 64.4% | 52.7% | 52.7% |
图片由 MetricNexus 发布,数字根据 OpenAI 公开的发布数据整理;它不是中立实验室独立复现的结果。最高推理力度也只是一个设置,不是模型永远的性格。中等设置的模型,在某个任务上可以胜过另一个模型的最高设置,换一个任务也可能输得很远。
基准测试是地图,不是判决书。如果你写客户中文、拆解混乱的表格,或者需要助手记住一份长 Brief,最重要的是测试它是否像你的实际失误方式。代码成绩高,不代表一定能保住你的语气;电脑操作成绩高,也不代表一定理解一封香港客户邮件的弦外之音。
03 / 人工智能
OpenAI 发布三款 GPT-6 模型:Astra、Sol 和 Luna
OpenAI 开发者页面列出三个 API 模型编号:gpt-6-astra、gpt-6-sol、gpt-6-luna。三个模型都支持文字和图片输入、文字输出、多语言能力以及超大上下文,但功能列表相似,不等于同一个 Prompt 会得到相同反应。
官方发布对比中,标准 API 价格大约是:Astra 每百万输入/输出 Token 为 $10/$50;GPT-6 Sol 为 $2/$10;GPT-6 Luna 为 $0.10/$0.50。对比的 GPT-5.6 Sol 是 $4/$20,GPT-5.6 Luna 是 $0.20/$1.20。这是 API Token 价格,不是 ChatGPT 月费,而且推理用量也会计入工作成本。
| 选择 | 你实际在购买什么 | 先问自己一句 |
|---|---|---|
| Astra | 最高能力、更深的多步推理和代理式工作 | 漏掉一个步骤的代价,是否高过使用贵模型的成本? |
| Sol | 不使用 Astra 的价格,仍保留较宽的能力范围 | 这件事是否需要判断、工具和几个连续步骤? |
| Luna | 低单价和大量处理能力 | 剩余错误能否由人工或规则低成本发现? |

一个模型可以是“最划算的”,却不是“写得最好的”。这句话听起来很明显,但模型讨论经常把质量当成一条梯子。真实价值更像是:可接受结果 × 处理量 ÷ 修正成本。Luna 做标签、提取字段和第一轮分类时可能赢得很漂亮;但如果一段客户文案让你来回重写三次,账就不一样了。
最高推理力度也不是免费魔法。它可能让难题做得更好,却会增加时间和成本;如果 Brief 本身不清楚,模型可能只是花更久自信地误解。停顿更长,不等于想得更深。
04 / 人工智能
ChatGPT-6 比 GPT-5.6 改变了什么?
GPT-5.6 Sol 本身已经面向代码、知识工作和电脑操作。GPT-6 Astra 的介绍则更强调让一个目标经过多个工具落地:填写在线表单、更新 CRM、整理日历、进行网页研究、处理文档和表格、生成图表、创建网站以及测试软件。不是说 GPT-5.6 完全做不到,而是 GPT-6 更像围绕一条较长的工作流程来设计。
OpenAI 还表示,Astra 在缺少重要信息时会提出更聚焦的问题,任务中途出现新条件时可以调整。听起来很小,但如果模型会先问“重写这份合同摘要之前,我需要知道读者是客户还是内部同事”,通常比写完一大段才发现问错人更省事。
| OpenAI 公开比较 | GPT-6 Astra | GPT-5.6 Sol | 说明 |
|---|---|---|---|
| Agents’ Last Exam | 59.3% | 53.6% | 按所列设置,长篇专业任务有提升。 |
| OSWorld 2.0 offline | 72.6% | 65.7% | 模拟电脑操作更强,但不等于你的桌面。 |
| ScreenSpot-Pro | 92.7% | 76.9% | 这项界面定位测试有明显差距。 |
| BenchCAD | 95.9% | 83.3% | CAD 重建任务的公开分数更高。 |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 复杂终端工作流的公开分数更高。 |
| Artificial Analysis Index v4.1.1 | 61.2 | 60.9 | 广泛指数上的差距反而很小。 |
最后一行正好提醒我们,不要让一个数字解释一切。模型可以在专门的电脑操作或代码测试中跳得很高,但在广泛指数上只和前代接近。这不说明专项提升是假的,只说明提升有形状。
OpenAI 自己也给出了重要注释:这些是研究/API 环境中的最高努力测试,生产版 ChatGPT 可能因为系统提示、工具和产品设置而不同。而 Astra 对比页面的 GPT-5.6 Sol 行指向 API、Codex 或 ChatGPT Work 版本,普通 ChatGPT Chat 可能并不完全相同。比较之前,先写清楚你实际用的是哪一版。
05 / 人工智能
ChatGPT-6 新增电脑操作能力:可以帮你完成什么?
OpenAI 所说的“模型使用电脑”,不只是读一张截图。例子包括填写表单、更新 CRM、整理日历、上网研究、处理文件和表格、创建网站以及运行软件测试。顺利时模型会规划、操作、检查并报告结果;不顺利时,它仍然可以非常高效地点击错误的按钮。
“找到了按钮”和“理解按下按钮的业务后果”是两回事。改日历通常可以撤回;发客户邮件、付款、删除账户、改数据库记录则未必。尽量让它在测试账户里工作,先要求显示计划动作,在真正产生后果的地方保留审批权。

| 工作类型 | 可以先交给模型 | 人工检查点 |
|---|---|---|
| 研究 | 收集来源、比较说法、先整理发现记录。 | 打开关键来源,确认结论确实有依据。 |
| CRM 清理 | 提出重复项、统一字段、准备变更列表。 | 查看 Diff,然后批准真正写入。 |
| 日历 | 提出时间、检查冲突、草拟邀请。 | 确认参与人、时区、文字和最终发送。 |
| 网站测试 | 跑流程、记录视觉问题、重现错误。 | 检查环境、日志以及修复是否引入新风险。 |
这里的机器人实验室照片是真实的网上照片,并不是 GPT-6 控制这台机器人的演示。实体系统有安全、时序和机械风险,不能因为一张有未来感的照片就把它当成模型能力证明。
Astra 的电脑操作提升,最适合用在工作足够长、阅读资料和交接逐渐成为瓶颈的地方。如果只是一个清楚的问题,不需要硬请一个带全套工具的助手登场。需要螺丝刀时,不要因为它带着电钻就觉得一定更专业。
06 / 人工智能
ChatGPT-6 对职场人士有什么实际用处?
想象一位香港市场经理准备区域推广活动:先读客户 Brief,再做竞品研究,接着整理数字和关键词表格,最后变成双语提案和内部简报。最花时间的通常不是打第一段字,而是记得星期二邮件里的限制,以及知道某个数字究竟来自哪里。
能力更强的模型可以帮你保持这条线,但不要扔一堆材料后只说“帮我搞定”。交代 Brief、读者、已批准事实、不能说的内容和输出格式。先让它列出假设,再写成稿。这样才更像一份可以追踪的工作文件。
- 先收集,再写把材料、日期、目标读者和最新限制放在同一个工作上下文里,确认事实和想法分开。
- 先要计划让模型列出步骤和需要你决定的地方。计划错了,越早改,成本越小。
- 重复部分用便宜模型Luna 可以先做标签、提取字段、整理表格;遇到含糊判断,再交给 Sol 或 Astra。
- 让复核有具体形状要求来源、变更记录、假设清单或未解决事项;“帮我检查”不是方法。
- 计算完整交付时间从第一稿到可以发送,中间核对和修正都要算,不要只计算模型几秒钟答完。
对开发者来说,同一件事会变成一个要通过测试、代码审查和部署的修改。答案短,不等于工作快;如果之后花半天寻找漏掉的边界情况,账就完全不同。对分析师是从数据到结论的清晰路径;对经理可能只是不用第四次追问同一个缺失字段。
但要说清楚:GPT-6 不会自动理解你的公司。它理解的是你实际提供的上下文,加上产品给它的工具和权限。一个充满互相矛盾版本的共享硬盘,不会因为有助手搜索就突然变成知识库。
07 / 人工智能
学生应该如何使用 ChatGPT-6?
学生可以用模型做三件相对健康的事:要求同一个概念用两个难度解释;要求它创造一个新例子;再让它逐题提问,不要一开始就揭答案。目标不是让页面更漂亮,而是迫使自己回忆、比较和改正。
可以这样问:“用简单中文解释下面的经济学图表,然后一次问我一个问题。如果我的回答不完整,先给提示,不要直接揭答案。最后告诉我还混淆哪些概念。”这个用法不太戏剧化,却更接近真正学习。好老师有时就是有一点烦。

| 学生目标 | 更好的提问 | 自己一定要验证 |
|---|---|---|
| 真正理解 | 要求解释、类比、反例和小测验。 | 关掉对话后,你还能不能自己讲清楚? |
| 写作 | 先点评论点、证据、结构和语气,再要求改写。 | 主张是不是自己理解,资料和作业要求是否一致? |
| 代码 | 要求提示、测试案例和每个改动的原因。 | 你能否预测输出,也能否独立处理相似问题? |
| 复习 | 提供课程笔记,要求分散提问和错题记录。 | 问题是否真的来自课程内容,而不是模型编造的细节? |
模型对学生最麻烦的一点是:它可以错得很流畅,刚好足以教出一个误解。重要细节要用课本、老师、官方文档或原始资料做锚点;好答案应该经得起第二个来源的核对。
当然可以用 GPT-6 起草。但最后要看你能不能解释和维护这份作业。如果关闭聊天窗口,答案就立刻散掉,那份知识只是借来的,还没有学会。
08 / 人工智能
GPT-6 上下文窗口变大,是否代表记忆更强?
上下文窗口可以理解成模型面前的一张很大的工作桌。桌子变大后,你可以放更多文件、代码和对话;但文件之间的矛盾不会自动消失,也不保证模型会注意第 412 页那句小字。长上下文减少“再贴一次”的麻烦,却也让不整理就塞入大量材料变得更昂贵。
记忆是另一种产品行为,账号记忆和一次性放入一百万 Token 完全不是一回事。有些产品可以记住偏好,但不代表它自动能看到你没有提供的私密文件、旧对话或实时数据库。不要把“长上下文”当成“它了解我”。
| 概念 | 实际含义 | 更稳妥的做法 |
|---|---|---|
| 上下文窗口 | 一次工作中可以提供的文字或多模态材料容量。 | 大文件分章节,并建立决定与问题记录。 |
| 记忆 | 产品可能跨对话保留部分用户信息的功能。 | 检查存储内容、删除方式,以及工作区是否允许。 |
| 检索/连接器 | 产品从文件、网站或工具获取资料的方式。 | 确认是哪个账号、哪种权限提供了材料。 |
| 推理力度 | 用更多时间和 Token 处理部分难题的设置。 | 比较模型时锁定设置,不要把 max 和快速模式混在一起。 |
长上下文工作最好有小型索引:来源、日期、决定和未解决问题。让模型引用使用过的段落,并标出互相矛盾的版本。这样没有那么华丽,却比“上传整个公司档案库,让它理解”更容易审计。
09 / 人工智能
我亲自测试了 GPT-6 Luna Max:更划算,但 GPT-5.6 Luna Max 写得更好
这一节我不想把它藏在一张漂亮的基准表后面。我亲自用真正关心的写作和理解任务测试了 GPT-6 Luna Max,最后得到一个不太顺耳、但比较实用的结论:GPT-6 Luna Max 最划算,GPT-5.6 Luna Max 更像是更好的写作者和阅读者。
在写作方面,GPT-5.6 Luna Max 对语气、结构以及那些“没有明说、但其实很重要”的小要求更稳定。GPT-6 Luna Max 能交出一份看起来合格的草稿,却有时会轻轻放掉真正需要守住的语气或限制。在理解方面,我觉得 GPT-5.6 Luna Max 更能保留完整指令和真正问题;GPT-6 Luna Max 更常需要我重新说明,或者再纠正一次。
这不证明 GPT-6 Luna Max 对所有人都一定更差。这只是我在自己的 Prompt、语言组合、任务种类和产品界面下的体验。不同账号、发布批次、隐藏系统指令、推理设置和工作负载,都可能改变结果。个人测试是工作流证据,不是新基准。
| 我的测试方向 | GPT-6 Luna Max | GPT-5.6 Luna Max | 我的实际判断 |
|---|---|---|---|
| 成本效益 | 以我需要的工作量和价格来看,整体最划算。 | 相对新 Luna 价格,成本更高。 | 大量草稿、提取和容易人工复核的工作先用新 Luna。 |
| 写作 | 能完成基本要求,但语气和结构限制更容易滑掉。 | 在我测试的写作任务中更稳定,更容易一次到位。 | 对声音敏感的文案暂时保留 GPT-5.6 Luna Max。 |
| 理解 | 通常能抓到主题,但容易漏细节或完整要求,需要重说。 | 更能保留整段指令和隐含限制。 | 迁移内容流程前先使用固定测试集。 |
| 适合的角色 | 高量草稿、资料整理、字段提取和低成本试验。 | 细腻语气、高阅读要求、返工代价大的任务。 | 划算和质量是两条轴。 |
以上是作者个人报告,不是控制严格的实验室对比。写出来是因为普通用户感受到的不是一行分数,而是要改多少次、漏掉多少条指令,以及最后花了多少时间把答案救回来。
所以我现在的选择并不戏剧化:成本重要、错误又可以低成本发现的工作,我会先用 GPT-6 Luna Max;对语气敏感、理解要求高的写作,我不会因为型号升级就自动从 GPT-5.6 Luna Max 搬走。账单便宜了,如果每份草稿都要大修,最后可能更贵。
10 / 人工智能
Reddit 用户如何评价 GPT-6 Sol?
社区反应不是一个整齐的结论。Reddit 的 ChatGPT subreddit 有讨论直接比较 GPT-6 Sol 和 GPT-5.6 Sol,有人认为新模型处理非编码 Prompt 时明显变差;另一个讨论则收集用户对 GPT-5.6 Sol 在 GPT-6 发布后变得不太可靠的感觉。留言有时很激烈,甚至带粗口,但反复出现的问题值得看一眼。
我自己测试 Luna Max 也看到类似的形状:公开能力和使用感可能拉开。模型可以在代理工作分数上升、成本下降,却仍然让重视语气、克制和完整跟随 Brief 的写作者觉得更差。因为“好”本来就有几个切面。

| 为什么 Reddit 用户会得出不同答案 | 可能变化的地方 |
|---|---|
| 任务不同 | 代码、研究、翻译和创意写作,压力点完全不同。 |
| 设置不同 | max、high、medium 或自动模式,会影响时间、深度和成本。 |
| 产品不同 | Chat、ChatGPT Work、Codex 和 API 可能使用不同工具、提示或路由。 |
| 发布不同步 | 更新、流量分配和账号实验,不一定同一天到达所有人。 |
| 容忍度不同 | 有人觉得短答案有效率,有人觉得它太浅。 |
所以可以把 Reddit 当成“值得自己测试”的提醒,不要当成宣布冠军的许可。用同一份材料、同一个 Prompt、锁定同一个推理设置,再按你真正关心的项目评分。否则你可能只是在比较两个星期二的心情。
11 / 人工智能
基准图看不到的 GPT-6 问题
OpenAI 对 GPT-6 Astra 的资料和安全说明,将更强的电脑操作、代码和网络安全能力与分阶段发布、安全工作一起讨论。实际教训不是“模型一定危险”,也不是“模型已经安全”,而是能力和控制要一起增长。可以执行更多动作,就要有更清晰的范围、记录、审批点以及停止或撤销的方法。
普通用户可以先守几条简单规则:没有确认账号和保留政策前,不要随便粘贴密钥;不要让模型未经复核就发送、付款、删除或发布;看起来像引用的句子不等于证据。公司还要加入最小权限、测试账号、事件记录和恢复路径。最无聊的部分,通常正是最有用的部分。
| 风险 | 可能的表现 | 可执行的控制 |
|---|---|---|
| 自信错误 | 流畅答案把假设说成事实。 | 重要主张要求来源、假设和第二次核对。 |
| 权限过宽 | 助手看到的文件或工具超过任务所需。 | 使用最小权限和独立测试账号。 |
| 不可逆操作 | 邮件、付款或记录修改在人查看前已经发生。 | 先显示 Diff/预览,最后一步由真人明确批准。 |
| 提示或工具注入 | 不可信内容试图改写助手原本的指令。 | 把检索文字当作数据,隔离工具,检查待执行动作。 |
| 私密资料 | 敏感内容被粘贴到错误账号或工作流。 | 先检查数据政策、保留设置和工作区边界。 |
模型不是整个系统。浏览器登录状态、连接器权限、供应商设置、保存的文件和人的习惯,都会参与最终结果。账号给了过多权限后出了问题,不要只怪语言模型;有时更像是怪打印机把没收好的机密文件留在纸盘里。
12 / 人工智能
如何自己测试 ChatGPT-6?
- 选五件真实工作用你平时会做的:双语改写、长文档摘要、表格解释、代码修改和研究比较。不要使用过于玩具化的 Prompt。
- 固定输入保存实际文件、来源、日期和 Prompt 版本。中途改动,就记录原因。
- 比较同类尽量使用相同推理力度,并写明自己用的是 Chat、Work、Codex 还是 API。
- 把质量和返工分开评分分别评价准确性、遵循指令、语气、完整度、速度和人工修改数量。
- 计算完成一件任务的成本Token 单价不够,还要算推理用量、重试、复核时间和错误结果的代价。
- 设定停止线如果模型反复漏掉不能漏的限制,就停止迁移。便宜模型制造出新工作,就不算划算。
我的结论是两条线并行:GPT-6 Luna Max 在成本效益上很吸引,但在我测试的写作和理解任务中,GPT-5.6 Luna Max 仍然更好。Sol 的公开图表也有类似形状:有几行进步,也有几行退步。升级是真的,但不是一支只会向上的箭头。
如果要用一句话解释“ChatGPT-6 是什么”,我会说:它是一个把代理能力推向长流程、同时试图降低实用工作成本的模型家族;Astra 推高能力上限,Sol 做中间平衡,Luna 把经济性放在前面。没必要急着为数字欢呼,先用真实工作测试。
几个快速答案
ChatGPT-6 是一个模型吗?不是。实际使用时,大家用这个词指一整个家族和几种产品界面;你最终收到哪个模型,才是关键。
GPT-6 一定比 GPT-5.6 好吗? 不一定。公开图表本身就有上有下,而我的写作和理解测试偏向 GPT-5.6 Luna Max。
Luna 是不是小号 Astra? 它定位为高效模型,不是保证用半价获得完全相同的能力。应该根据质量和复核成本选择。
基准图能不能完全相信? 可以把它当作有设置、有来源的公司公开证据,但它不是独立复现,也不是你的工作结果。
第一步做什么? 选五件真实工作,用同一份材料比较两代模型,再计算修改时间。这张小表格往往比发布日争论更有用。
资料来源
来源、日期和图片授权
- OpenAI:GPT-6 Astra——新一代智能
- OpenAI:GPT-6 Sol 与 GPT-6 Luna
- OpenAI Developers:API 模型页面
- OpenAI:ChatGPT Work
- OpenAI:GPT-5.6
- OpenAI Help:ChatGPT 更新说明
- OpenAI Deployment Safety:GPT-6 Astra
- MetricNexus:GPT-6 Sol、Luna 基准、价格与成本比较
- Reddit r/ChatGPT:GPT-6 Sol 用户讨论
- Reddit r/ChatGPT:5.6 与 6 Sol/Luna 讨论
- Reddit r/ChatGPT:GPT-6 发布后 GPT-5.6 Sol 用户讨论
图片来源与授权备注
- benchmark-gpt6-vs-gpt56.webp——一张网上基准比较图,把最高推理力度下的 GPT-6 Sol、Luna 与 GPT-5.6 Sol、Luna 放在一起;数字来自 OpenAI 公开的发布数据,不是独立测试。 发布/整理来源:MetricNexus;online chart; confirm reuse terms before publication。图片直链。
- photo-server-racks.jpg——Helpameout 拍摄的服务器机柜;模型更新最终都运行在真实硬件上,不是悬浮在一片抽象的云里。 摄影/作者:Helpameout;授权:CC BY-SA 3.0。图片直链。
- photo-robotics-lab.jpg——Yamit29 拍摄的真实机器人实验室。这不是 GPT-6 演示图,只是提醒大家:软件代理与实体系统的失误方式可以完全不同。 摄影/作者:Yamit29;授权:CC BY-SA 4.0。图片直链。
- photo-computer-lab.jpg——RiaSrl 拍摄的电脑室。用模型学习,最后仍然要做到离开屏幕后,自己能把答案讲清楚。 摄影/作者:RiaSrl;授权:CC0 1.0。图片直链。
- photo-students-computer-lab.jpg——University of Salford Press Office 拍摄的学生电脑室照片;技术会变,但学习仍然需要人真正投入。 摄影/作者:University of Salford Press Office;授权:CC BY 2.0。图片直链。
- photo-programmer.jpg——Crew 拍摄的程序员工作照片。代码协助是便宜模型很容易显得厉害的地方,但漏掉一条小限制,到了生产环境就不好玩了。 摄影/作者:Crew;授权:CC0 1.0 (as recorded by Wikimedia Commons)。图片直链。
研究资料截至 2026-09-24 UTC。本文将 OpenAI 官方说法、公司公开基准数据、作者个人测试和 Reddit 社区讨论分开处理。Reddit 帖子属于轶事,不是控制严格的评测。产品名称、可用权限、设置、价格和路由可能变化;在作出产品或工作流决定前,请再次核对最新资料。