返回人工智能文章

人工智能 / 深入教學

OpenAI 發布 ChatGPT-6:今次更新咗啲咩?

OpenAI 發布咗一個重大更新,叫 ChatGPT-6。以下會講清楚佢比 GPT-5.6 改咗啲咩、基準數據點睇,同埋我自己試 Luna Max 的結果。

01 / 人工智能

OpenAI 發布 ChatGPT-6:今次係一次重大更新

截至 2026 年 9 月 24 日,「ChatGPT-6」比較似大家方便搜尋的叫法。OpenAI 正式分開講 GPT-6 Astra、Sol 同 Luna:Astra 走最複雜的工作,Sol 取能力同成本之間,Luna 就主打高效率同大量使用。你實際用邊個產品介面,仍然好重要。

大家搜尋的是 ChatGPT-6,但 OpenAI 的正式名稱更加細分:GPT-6 Astra、GPT-6 Sol、GPT-6 Luna;ChatGPT Work 同 API 又會展示家族內不同部分。呢個唔係咬文嚼字。有人用緊可以做多步工作的介面,有人只係一般對話;兩張截圖望落似樣,背後的工具、系統提示同權限可以完全唔同。

2026 年 9 月呢次更新,重點唔係「舊聊天機械人寫得再長啲」。OpenAI 將方向推向持續工作:計劃、瀏覽網頁、寫程式、處理文件、試算表同操作電腦。Astra 係旗艦,Sol 係中間路線,Luna 係比較慳成本的工作馬。唔好只睇皇冠,先睇你其實要煮咩。

Helpameout 拍攝的伺服器機櫃;模型更新最後都係跑喺真實硬件上,唔係懸浮喺一片抽象雲入面。
Helpameout 拍攝的伺服器機櫃;模型更新最後都係跑喺真實硬件上,唔係懸浮喺一片抽象雲入面。 攝影/作者: Helpameout;授權: CC BY-SA 3.0。 來源頁。 原圖。
模型官方定位可以先試咩唔好直接當成…
GPT-6 Astra處理複雜推理同程式工作的最高能力模型長篇研究、技術工作、代理式流程同要多次修正的任務基準分數高,就代表每次回答都啱。
GPT-6 Sol能力同成本之間的平衡複雜寫程式、研究同需要幾個步驟接埋的工作所有工作都一定贏 GPT-5.6 Sol。
GPT-6 Luna高效率、聚焦,適合大量任務抽取資料、分類、例行草稿、標籤同低成本試驗平就等於寫作同理解完全一樣好。

所以真正有用的問題唔係「ChatGPT-6 好唔好」,而係「邊個 GPT-6、喺邊個產品、用咩推理力度、做邊件工作?」聽落唔算浪漫,但實用得多。

另外,API 入面的 gpt-6-luna 係模型編號,唔等於消費者月費方案名稱。可用權限、用量、工具、記憶功能同推出速度,都可能因產品、帳戶同地區而變。模型頁同你個選單唔一樣時,唔好硬係將兩者拼成一個故事。

02 / 人工智能

GPT-6 同 GPT-5.6 基準圖:數據實際顯示咩?

喺最高推理力度下,GPT-6 Sol 喺幾項代理式工作同程式測試高過 GPT-5.6 Sol,但 DeepSWE 同 OSWorld 就落後。圖入面的五行比較,GPT-6 Luna 則係升或者打和。
一張網上基準比較圖,將最高推理力度下的 GPT-6 Sol、Luna 同 GPT-5.6 Sol、Luna 放埋一齊;數字來自 OpenAI 公開的發佈數據,唔係獨立測試。
一張網上基準比較圖,將最高推理力度下的 GPT-6 Sol、Luna 同 GPT-5.6 Sol、Luna 放埋一齊;數字來自 OpenAI 公開的發佈數據,唔係獨立測試。 攝影/作者: MetricNexus;授權: online chart; confirm reuse terms before publication。 來源頁。 原圖。

呢張圖值得睇耐少少,因為佢冇將發佈日的彩紙全部撒晒出來。GPT-6 Sol 喺 AutomationBench 得 32.0%,GPT-5.6 Sol 係 28.8%;Agents’ Last Exam 就係 56.4% 對 52.8%;FrontierCode 亦由 47.5% 上到 49.3%。如果你做的工作似呢啲測試,差距有實際意義。

但另一邊係比較尷尬的行。DeepSWE v1.1 入面,GPT-6 Sol 係 68.8%,低過 GPT-5.6 Sol 的 72.7%;OSWorld 2.0 offline 就係 64.4% 對 66.2%。GPT-6 Luna 喺 DeepSWE 係 66.6% 對 62.2%,OSWorld 則同樣係 52.7%。新一代唔係每級樓梯都向上。

公開比較(最高推理力度)GPT-5.6 SolGPT-6 SolGPT-5.6 LunaGPT-6 Luna
AutomationBench28.8%32.0%17.0%20.7%
Agents’ Last Exam52.8%56.4%50.4%50.9%
FrontierCode47.5%49.3%39.8%42.4%
DeepSWE v1.172.7%68.8%62.2%66.6%
OSWorld 2.0 offline66.2%64.4%52.7%52.7%
點樣讀呢張圖

張圖由 MetricNexus 上載,數字係根據 OpenAI 公開的發佈數據整理;唔係中立實驗室獨立重做。最高推理力度亦只係一個設定,唔係模型永遠的性格。中等設定的模型,喺某個工作可以贏最高設定的另一個模型,下一個工作又可以輸得幾遠。

基準測試係地圖,唔係判決書。如果你寫客戶中文、拆亂七八糟的試算表,或者要助手記住一份長 Brief,最重要係測試似唔似你平日的失誤方式。寫程式分數高,唔代表一定保留到你的語氣;操作電腦分數高,亦唔代表一定明白香港客戶封電郵的弦外之音。

03 / 人工智能

OpenAI 發布三款 GPT-6 模型:Astra、Sol 同 Luna

GPT-6 家族係刻意分層:Astra 用較高成本追求前沿能力;Sol 想做廣泛而實用的中間方案;Luna 就將低單價同高吞吐量放喺最前面。

OpenAI 開發者頁面列出三個 API 模型編號:gpt-6-astra、gpt-6-sol、gpt-6-luna。三個都支援文字同圖片輸入、文字輸出、多語言能力同超大上下文,但功能清單相同,唔代表同一個 Prompt 會有同樣反應。

官方發佈比較入面,標準 API 價格大約係:Astra 每百萬輸入/輸出 Token $10/$50;GPT-6 Sol $2/$10;GPT-6 Luna $0.10/$0.50。對比的 GPT-5.6 Sol 係 $4/$20,GPT-5.6 Luna 係 $0.20/$1.20。呢啲係 API Token 價格,唔係 ChatGPT 月費,而且推理用量都係工作成本。

選擇你其實係買緊咩先問自己一句
Astra最高能力、較深的多步推理同代理式工作漏一步的代價,係咪高過用貴模型的成本?
Sol唔用 Astra 價錢,仍然保留較闊的能力範圍件工作係咪需要判斷、工具同幾個步驟接住做?
Luna低單價同大量處理能力剩低的錯誤,真人或規則係咪可以平平地捉到?
Crew 拍攝的程式設計師工作照片。程式協助係平價模型好容易令人覺得好勁的地方,但漏咗一條小限制,去到正式環境就唔好玩。
Crew 拍攝的程式設計師工作照片。程式協助係平價模型好容易令人覺得好勁的地方,但漏咗一條小限制,去到正式環境就唔好玩。 攝影/作者: Crew;授權: CC0 1.0 (as recorded by Wikimedia Commons)。 來源頁。 原圖。

一個模型可以係「最抵用」,但唔係「最好寫」。呢句聽落好 obvious,但模型討論成日將好壞當成一條樓梯。實際價值更加似:可接受的結果 × 處理量 ÷ 修正成本。Luna 做標籤、抽欄位、第一輪分類,可能贏晒條數;但一段語氣尷尬的客戶文字要來回改三次,就未必。

最高推理力度亦唔係免費魔法。佢可能令難題做得好啲,但會增加時間同成本;如果 Brief 根本講得唔清楚,模型只係用長啲時間自信地誤解。停頓耐,唔等於諗得深。

04 / 人工智能

ChatGPT-6 比 GPT-5.6 改咗啲咩?

最明顯的方向係由「回答」推向「做事」:電腦操作、長步驟工作、規劃同專業/程式測試都有進展。不過升級唔平均,亦會受產品介面影響。

GPT-5.6 Sol 本身已經主打程式、知識工作同電腦操作。GPT-6 Astra 的介紹就更加強調一個目標點樣經過幾個工具落地:填網上表格、更新 CRM、整理日曆、上網研究、處理文件同試算表、整圖表、建立網站同測試軟件。唔係話 GPT-5.6 完全做唔到,而係 GPT-6 更似係圍繞一條較長的工作流程來設計。

OpenAI 亦表示 Astra 會喺缺少重要資料時問較聚焦的問題,任務中途有新條件時可以調整。聽落好細微,但如果模型會先問「重寫呢份合約摘要之前,我要知道讀者係客戶定內部同事」,通常好過寫完一大篇先發現問錯人。

OpenAI 公開比較GPT-6 AstraGPT-5.6 Sol代表咩
Agents’ Last Exam59.3%53.6%按所列設定,長篇專業工作有提升。
OSWorld 2.0 offline72.6%65.7%模擬電腦操作較強,但唔等於你的桌面。
ScreenSpot-Pro92.7%76.9%呢項介面定位測試有明顯差距。
BenchCAD95.9%83.3%CAD 重建任務的報告分數較高。
Terminal-Bench 4.057.9%37.3%複雜終端機流程的報告分數較高。
Artificial Analysis Index v4.1.161.260.9廣泛指數的差距反而細。

最後一行係對「一個數字解釋晒」的好提醒。模型可以喺專門的電腦操作或程式測試跳得幾高,但廣泛指數只係接近前代。呢個唔代表專門提升係假,只係代表提升有形狀。

OpenAI 自己亦加咗重要注腳:以上係研究/API 環境的最高努力測試,生產版 ChatGPT 可能因系統提示、工具同產品設定而唔同。而 Astra 比較頁的 GPT-5.6 Sol 行,指的是 API、Codex 或 ChatGPT Work 版本;一般 ChatGPT Chat 可能唔完全一樣。比較前先寫低你其實用緊邊個版本。

05 / 人工智能

ChatGPT-6 新增電腦操作能力:可以幫你完成咩?

GPT-6 Astra 係為跨網站、軟件同工具工作而設,但電腦操作應該當成有人監督的委派:先劃界線,再睇動作,去到不可逆的步驟一定要真人批准。

OpenAI 講「模型可以用電腦」,唔係淨係讀一張畫面。例子包括填表、更新 CRM、整理日曆、上網研究、處理文件同試算表、整網站、跑軟件測試。順利時,模型會計劃、操作、檢查,再報告結果;唔順利時,佢仍然可以好有效率咁撳錯掣。

「搵到個按鈕」同「明白撳落去的業務後果」係兩回事。改日曆通常可以還原;發客戶電郵、付款、刪帳戶、改資料庫就未必。可以的話俾佢喺測試帳戶工作,先要求顯示預計動作,去到真正有後果的地方保留批准權。

Yamit29 拍攝的真實機械人實驗室。呢張唔係 GPT-6 示範圖,只係提醒大家:軟件代理同實體系統,出錯方式可以差好遠。
Yamit29 拍攝的真實機械人實驗室。呢張唔係 GPT-6 示範圖,只係提醒大家:軟件代理同實體系統,出錯方式可以差好遠。 攝影/作者: Yamit29;授權: CC BY-SA 4.0。 來源頁。 原圖。
工作類型可以先交俾模型做真人要睇的位
研究搵來源、比較說法、先整一份發現紀錄。打開關鍵來源,確認結論真係有證據支持。
整理 CRM提出重複資料、統一欄位、準備修改清單。睇 Diff,再批准真正寫入。
日曆提出時段、檢查衝突、草擬邀請。確認參加者、時區、內容同最後發送。
網站測試逐個流程試、記錄畫面問題、重現錯誤。檢查環境、Log 同修正會唔會帶來新風險。
真照片唔係產品截圖

呢張機械人實驗室照片係真實網上照片,唔係 GPT-6 控制呢部機械人的示範。實體系統有安全、時間同機械風險,唔可以因為一張未來感照片就當成模型能力證明。

Astra 的電腦操作提升,最適合用喺工作夠長、讀資料同交接會變成樽頸的地方。如果只係一條清楚的問題,就唔使硬係請一個帶晒工具箱的助手出場。需要螺絲批時,唔好因為佢有電鑽就覺得一定更專業。

06 / 人工智能

ChatGPT-6 對打工仔有咩實際用處?

GPT-6 的日常價值唔係取代晒所有 App,而係一件工作由讀資料、計劃、起稿、檢查到修改之間,少啲重新交代。

想像一位香港市場部經理準備區域推廣活動:先讀客戶 Brief,再做競品研究,跟住整一張數字同關鍵字的試算表,最後變成雙語提案同內部簡報。最花時間通常唔係打第一段字,而係記得星期二電郵入面嗰條限制,同埋知道某個數字究竟係邊個來源。

能力較強的模型可以幫你保持條線,但唔好扔一堆材料俾佢就叫「幫我搞掂」。交代 Brief、讀者、已批准的事實、唔可以講的內容同輸出格式。先叫佢列假設,再寫靚稿。咁樣先似一份可以追蹤的工作文件。

  1. 先收集,再寫將材料、日期、目標讀者同最新限制放喺同一個工作上下文,確認事實同想法分開。
  2. 先問計劃叫模型列步驟同需要你決定的地方。計劃錯咗就早啲改,成本細好多。
  3. 重複部分用平價模型Luna 可以先做標籤、抽欄位、整理表格;要處理含糊判斷,再交俾 Sol 或 Astra。
  4. 令覆核有具體形狀要求來源、改動記錄、假設清單或者未解決項目;「幫我檢查」唔係方法。
  5. 計完整交付時間由出第一稿到可以發出去,中間的核對同修正都要計,唔好淨係計模型幾秒答完。

對開發者來講,同一件事會變成一個要通過測試、Code Review 同部署的修改。答案短,唔等於工作快;如果之後用半日搵漏咗的 Edge Case,條數已經唔同。對分析員係由數據到結論要有清楚路徑;對經理可能只係唔使第四次追問同一個缺失欄位。

但要講清楚:GPT-6 唔會自動理解你間公司。佢理解的是你真係提供的上下文,加上產品俾佢的工具同權限。一個塞滿矛盾版本的共享硬碟,唔會因為有助手搜尋,就突然變成知識庫。

07 / 人工智能

學生應該點樣用 ChatGPT-6?

GPT-6 可以做耐心的補習老師、出題工具同第二種解釋。當佢靜靜咁代你完成整份功課,學習工具就變成答案外判。

學生可以用模型做三件比較健康的事:要求同一概念用兩個難度解釋;要求佢創造一個新例子;再叫佢逐題問,唔好一開始就揭答案。目標唔係令頁面靚啲,而係迫自己回憶、比較、改正。

可以咁問:「用簡單中文解釋以下經濟學圖表,之後一次問我一條問題。如果我答得唔完整,先俾提示,唔好直接揭答案。最後講返我仲混淆咩概念。」呢個用法冇咁戲劇化,但實在好多。好老師有時就係有少少煩。

RiaSrl 拍攝的電腦室。用模型讀書,最後仍然要做到離開個畫面之後,自己講得返個答案。
RiaSrl 拍攝的電腦室。用模型讀書,最後仍然要做到離開個畫面之後,自己講得返個答案。 攝影/作者: RiaSrl;授權: CC0 1.0。 來源頁。 原圖。
學生目的可以點問自己一定要驗證
真正理解要解釋、類比、反例同小測驗。關掉對話之後,你仲講唔講得返?
寫作先批論點、證據、結構同語氣,再叫佢重寫。主張係咪自己明白,資料同功課要求對唔對得上?
寫程式要提示、測試案例,同每個修改的原因。你估唔估到輸出,亦識唔識處理相似問題?
溫習提供課程筆記,要求分散提問同錯題紀錄。題目係咪真係考課程內容,而唔係模型自己作出來?

對學生最麻煩的是:模型可以錯得好流暢,啱啱好足以教你一個誤解。重要細節要用課本、老師、官方文件或原始資料作錨點;好答案應該捱得過第二個來源。

當然可以用 GPT-6 起草。但最後要睇你能唔能夠解釋同捍衛份功課。如果一閂個聊天畫面,答案就即刻散晒,嗰份知識只係借返來,未係學識。

08 / 人工智能

GPT-6 上下文窗口變大,代表記憶力更強嗎?

GPT-6 API 頁面列出家族模型大約有 105 萬 Token 上下文窗口,最高輸出約 128,000 Token。一次可以放好多材料,唔等於模型永久記得,更唔代表佢會平均咁理解每一頁。

上下文窗口可以當成模型面前張好大的工作枱。枱大咗,你可以放更多文件、程式碼同對話;但文件本身的矛盾唔會自動消失,亦唔保證模型會注意第 412 頁嗰句細字。長上下文減少「再貼一次」的麻煩,同時令不加整理地塞入一大堆資料變得更貴。

記憶係另一種產品功能,帳戶記憶同一次過放入一百萬 Token 完全唔係同一回事。有啲產品可以記住偏好,但唔等於自動睇到你未提供的私密檔案、舊對話或即時資料庫。唔好將「長上下文」當成「佢識你」。

概念實際意思比較穩陣的做法
上下文窗口一次工作中可以提供的文字或多模態材料容量。大文件拆章節,另做一份決定同問題紀錄。
記憶產品可能跨對話保留某些用戶資料的功能。檢查儲存咗咩、點刪除,同埋公司工作區容唔容許。
檢索/連接器產品由文件、網站或工具取資料的方法。確認係邊個帳戶、邊種權限提供材料。
推理力度用更多時間同 Token 去處理部分難題的設定。比較模型時鎖定設定,唔好將 max 同快速模式硬擺埋一齊。

長上下文工作最好有小型索引:來源、日期、決定、未解決問題。叫模型引用用過的段落,再標出互相矛盾的版本。冇咁華麗,但比「上載晒成個公司檔案庫,叫佢理解」可審核得多。

09 / 人工智能

我親自試過 GPT-6 Luna Max:最抵用,但 GPT-5.6 Luna Max 寫得好啲

以我自己的測試來講,GPT-6 Luna Max 係成本效益最吸引的選擇;但喺寫作能力同理解指示方面,GPT-6 Luna Max 明顯差過 GPT-5.6 Luna Max。呢兩個結論要分開睇。

呢一節我唔想埋喺一張漂亮基準表下面。我自己用真正會做的寫作同理解工作試過 GPT-6 Luna Max,最後得到一個唔太順耳、但實際的結論:GPT-6 Luna Max 最抵用,GPT-5.6 Luna Max 就似係更好用的寫作者同閱讀者。

寫作方面,GPT-5.6 Luna Max 對語氣、結構同埋啲「未寫明但其實好重要」的小要求穩定啲。GPT-6 Luna Max 會交到一份睇落合格的草稿,但有時會輕輕放低真正要守的語氣或者限制。理解方面,我覺得 GPT-5.6 Luna Max 較能夠留住整段指示同真正問題;GPT-6 Luna Max 就較常要我重新講一次,或者再糾正。

呢個唔代表 GPT-6 Luna Max 對所有人都一定差。呢個係我用自己的 Prompt、語言混合、任務種類同產品介面試出來的感受。唔同帳戶、推出批次、隱藏系統指示、推理設定同工作負載,都可以令結果變。個人測試係工作流程證據,唔係新基準。

我試的地方GPT-6 Luna MaxGPT-5.6 Luna Max我實際會點用
成本效益以我需要的工作量同價錢來講,整體最抵。相對新 Luna 價格,成本較高。大量草稿、抽取同可低成本覆核的工作先用新 Luna。
寫作做到基本要求,但語氣同結構限制較易滑走。我試的寫作工作入面較穩、更容易一次到位。要聲音準確的文案,暫時保留 GPT-5.6 Luna Max。
理解通常捉到主題,但細節或完整指示較易漏,要重講。較能留住整段要求同隱含限制。搬內容流程前,先用固定測試集比較。
最適合位置大量草稿、資料整理、抽欄位同低成本試驗。語氣細緻、閱讀要求高、返工代價大的工作。抵用同質素係兩條軸。
老實標籤

上面係作者個人報告,唔係控制嚴格的實驗室比較。之所以寫出來,係因為一般用家感受到的唔係一列分數,而係要改幾多次、漏咗幾多條指示、最後用咗幾多時間救返份答案。

所以我而家的選擇唔算特別戲劇化:成本重要、錯誤又可以平平地捉到的工作,我會先用 GPT-6 Luna Max;對語氣敏感、理解要求高的寫作,我唔會因為個型號升咗就自動由 GPT-5.6 Luna Max 搬走。平咗的帳單,如果每份草稿都要大修,最後可以係更貴。

10 / 人工智能

Reddit 用家點睇 GPT-6 Sol?

r/ChatGPT 有幾個討論串形容 GPT-6 Sol 喺部分非程式問題、推理深度同跟進能力上,感覺差過 GPT-5.6 Sol。呢啲係有參考價值的用家回饋,但係軼事,唔足以證明 GPT-6 Sol 客觀上較差。

社群反應唔係一個整齊的結論。Reddit 的 ChatGPT subreddit 有討論直接比較 GPT-6 Sol 同 GPT-5.6 Sol,有人話新模型處理非寫程式 Prompt 時明顯差;亦有另一條討論收集用家對 GPT-5.6 Sol 在 GPT-6 推出後變得冇咁可靠的感覺。留言有時幾激,甚至有啲粗口,但反覆出現的問題值得睇。

我自己試 Luna Max 的形狀都類似:公開能力同實際使用感可以拉開。模型可以喺代理工作分數上升、成本下降,但對一個重視語氣、節制同完整跟 Brief 的寫作者來講,仍然可能覺得差咗。因為「好」本身有幾個切面。

University of Salford Press Office 拍攝的學生電腦室照片;科技會變,但學習仍然要人真正留心。
University of Salford Press Office 拍攝的學生電腦室照片;科技會變,但學習仍然要人真正留心。 攝影/作者: University of Salford Press Office;授權: CC BY 2.0。 來源頁。 原圖。
點解 Reddit 用家會講唔同答案可能變緊的地方
工作不同寫程式、研究、翻譯同創意寫作,壓力點完全唔同。
設定不同max、high、medium 或自動模式,會影響時間、深度同成本。
產品不同Chat、ChatGPT Work、Codex 同 API 可能有不同工具、提示或路由。
推出不同步更新、流量分配同帳戶實驗,未必同一日到所有人。
接受程度不同有人覺得短答案有效率,有人就覺得太淺。

所以可以將 Reddit 當成「值得自己測試」的提示,唔好當成宣布冠軍的許可。用同一份材料、同一個 Prompt、鎖定同一個推理設定,再按你關心的項目評分。否則你可能只係比較兩個星期二的心情。

11 / 人工智能

基準圖睇唔到的 GPT-6 問題

GPT-6 的代理同網絡安全能力越強,權限邊界、監察同人工批准就越有價值。基準測試可以顯示任務做唔做到,唔會自動顯示你間公司的資料規則同復原方案準備好未。

OpenAI 對 GPT-6 Astra 的資料同安全說明,將更強的電腦操作、程式同網絡安全能力,連同分階段推出同安全工作一齊講。實際教訓唔係「模型一定危險」,亦唔係「模型已經安全晒」,而係能力同控制要一齊走。可以做更多動作,就要有更清楚的範圍、紀錄、批准點同停止/還原方法。

普通用家可以先守幾條簡單規矩:未睇清楚帳戶同保留政策前,唔好亂貼密鑰;唔好俾模型未經覆核就發出、付款、刪除或發佈;引用句式唔等於有證據。公司就要再加最小權限、測試帳戶、事件紀錄同復原路線。最悶的部分,通常正正係最有用的部分。

風險會點樣出現可以做的控制
自信錯誤流暢答案將假設講成事實。重要主張要求來源、假設,同埋第二次核對。
權限過闊助手看到的文件或工具比工作真正需要的多。用最小權限同獨立測試帳戶。
不可逆動作電郵、付款或紀錄修改喺人睇之前已經發生。先顯示 Diff/預覽,最後一步明確由真人批准。
提示或工具注入不可信內容試圖改變助手原本的指示。將取回文字當資料,隔離工具,檢查預計動作。
私密資料敏感內容貼錯帳戶或者錯誤工作流程。先睇資料政策、保留設定同工作區邊界。

模型唔係成個系統。瀏覽器登入狀態、連接器權限、供應商設定、儲存檔案同人手習慣,都會參與最後結果。帳戶畀咗太多權限之後出事,唔好只怪語言模型;有時似係怪影印機將未收好的機密文件放喺紙盤。

12 / 人工智能

點樣自己測試 ChatGPT-6?

先做一個細而可重複的比較:同一份材料、同一個 Prompt、同一個推理設定、同一張評分表,再由真人記低要改幾多。
  1. 揀五件真工作用你平日會做的:雙語改寫、長文件摘要、試算表解釋、程式修改、研究比較。唔好用太玩具的 Prompt。
  2. 固定輸入保存實際檔案、來源、日期同 Prompt 版本。中途改咗,就記低原因。
  3. 比較同類可以的話用同一推理力度,並寫明你係用 Chat、Work、Codex 定 API。
  4. 分開評質素同返工分別評準確度、跟指示、語氣、完整度、速度同人工改動數量。
  5. 計完成一件工作的成本Token 單價唔夠,仲要計推理用量、重試、覆核時間同答錯的代價。
  6. 定一條停手線如果模型反覆漏掉不能漏的限制,就停低唔好搬。平價模型製造新工作,就唔係抵。

我自己的結論係兩條線並行:GPT-6 Luna Max 喺成本效益上好吸引,但我試的寫作同理解工作,GPT-5.6 Luna Max 仍然較好。Sol 的公開圖表亦有相近形狀:幾行進步,幾行退步。升級係真的,但唔係一支只會向上的箭咀。

如果要一句講清楚「ChatGPT-6 係咩」,我會話:佢係一個要將代理能力推向長流程、同時令實用工作成本下降的模型家族;Astra 推能力上限,Sol 做中間平衡,Luna 將經濟效益放到前面。唔使急住為個數字歡呼,先拿真工作試下。

幾條快問快答

ChatGPT-6 係咪一個模型?唔係。實際上大家用呢個詞指一整個家族同幾種產品介面;你收到邊個模型,先係真正關鍵。

GPT-6 係咪一定好過 GPT-5.6? 唔係。公開圖本身已經有升有跌,而我自己的寫作同理解測試偏向 GPT-5.6 Luna Max。

Luna 係咪只係細部的 Astra? 佢係定位為高效率模型,唔係保證用半價得到完全相同的能力。要按質素同覆核成本揀。

張基準圖可唔可以完全信? 可以當成有設定、有來源的公司公開證據,但唔係獨立重做,更唔係你的工作結果。

第一步做咩最好? 揀五件真工作,用同一材料比較兩代模型,再計改稿時間。呢張細細張試算表,通常比發佈日口水戰更有用。

資料來源

來源、日期與圖片授權

  1. OpenAI:GPT-6 Astra — 新一代智能
  2. OpenAI:GPT-6 Sol 同 GPT-6 Luna
  3. OpenAI Developers:API 模型頁面
  4. OpenAI:ChatGPT Work
  5. OpenAI:GPT-5.6
  6. OpenAI Help:ChatGPT 更新記錄
  7. OpenAI Deployment Safety:GPT-6 Astra
  8. MetricNexus:GPT-6 Sol、Luna 基準、價格同成本比較
  9. Reddit r/ChatGPT:GPT-6 Sol 用家討論
  10. Reddit r/ChatGPT:5.6 同 6 Sol/Luna 討論
  11. Reddit r/ChatGPT:GPT-6 推出後 GPT-5.6 Sol 用家討論

圖片來源與授權備註

  • benchmark-gpt6-vs-gpt56.webp——一張網上基準比較圖,將最高推理力度下的 GPT-6 Sol、Luna 同 GPT-5.6 Sol、Luna 放埋一齊;數字來自 OpenAI 公開的發佈數據,唔係獨立測試。 上載/整理來源:MetricNexus;online chart; confirm reuse terms before publication。圖片直連。
  • photo-server-racks.jpg——Helpameout 拍攝的伺服器機櫃;模型更新最後都係跑喺真實硬件上,唔係懸浮喺一片抽象雲入面。 攝影/作者:Helpameout;授權:CC BY-SA 3.0。圖片直連。
  • photo-robotics-lab.jpg——Yamit29 拍攝的真實機械人實驗室。呢張唔係 GPT-6 示範圖,只係提醒大家:軟件代理同實體系統,出錯方式可以差好遠。 攝影/作者:Yamit29;授權:CC BY-SA 4.0。圖片直連。
  • photo-computer-lab.jpg——RiaSrl 拍攝的電腦室。用模型讀書,最後仍然要做到離開個畫面之後,自己講得返個答案。 攝影/作者:RiaSrl;授權:CC0 1.0。圖片直連。
  • photo-students-computer-lab.jpg——University of Salford Press Office 拍攝的學生電腦室照片;科技會變,但學習仍然要人真正留心。 攝影/作者:University of Salford Press Office;授權:CC BY 2.0。圖片直連。
  • photo-programmer.jpg——Crew 拍攝的程式設計師工作照片。程式協助係平價模型好容易令人覺得好勁的地方,但漏咗一條小限制,去到正式環境就唔好玩。 攝影/作者:Crew;授權:CC0 1.0 (as recorded by Wikimedia Commons)。圖片直連。

研究資料截至 2026-09-24 UTC。本文將 OpenAI 官方說法、公司公開基準數據、作者個人測試同 Reddit 社群討論分開處理。Reddit 貼文係軼事,唔係控制嚴格的評測。產品名稱、可用權限、設定、價格同路由可以改;真正決定方案或工作流程之前,請再核對最新資料。

試真實工作,唔好只試個數字。

GPT-6 係一組取捨。最有用的模型,係可以用你接受的成本完成真工作,亦捱得過你的覆核。

WhatsApp 聯絡 Locke Lee