返回人工智能文章

人工智能/深入比較

ChatGPT-5.6 Luna、Terra 同 Sol:我用咗幾個月之後點揀

Reddit 張圖入面 Sol 分數最高,Luna 顯示成本最低,Terra 企喺中間。我用過幾個月之後,唔會再用同一款模型做所有工作。

01 / 人工智能

GPT-5.6 Luna、Terra 同 Sol:到底有咩分別?

我自己日常會先用 Luna Max。工作範圍清楚但比較大,就試 Terra。至於 Sol,我會留俾真係難、真係容易出事,或者做錯之後要付好多時間補鑊的工作。

一開始試 GPT-5.6,我都以為 Sol 會自然成為預設答案。佢的確有啲工作做得好啲;問題係,用量跌得好快,而且遇到要求唔清楚的 Brief,佢一樣會問你再改。用咗幾個月之後,我的答案反而簡單咗:平日先開 Luna Max。

三款模型唔係完全一樣。價錢、推理力度、速度同完成一件工作的步驟都唔同。張 Reddit 比較圖最有用的地方,就係將呢啲差別放返落數字入面。仲有一點:Luna low 同 Luna max,體感可以差好遠;淨係講模型名其實未講完。

Tsinkala 拍攝的軟件開發者同時用兩部手提電腦工作。揀模型係工作決定,唔係純粹追排行榜。
Tsinkala 拍攝的軟件開發者同時用兩部手提電腦工作。揀模型係工作決定,唔係純粹追排行榜。 攝影/作者: Tsinkala;授權: CC BY-SA 4.0。 來源頁。 原圖。
模型大概適合咩我會點開始
GPT-5.6 Luna平、重複性高、容易檢查的工作起稿、資料抽取、小型程式修改、例行修正。
GPT-5.6 Terra已經有計劃,但範圍比較闊的實作要睇幾個檔案、做較長流程,但方向已經定好。
GPT-5.6 Sol含糊、難除錯、做錯代價高的工作架構判斷、深度研究,同埋唔想漏一步的任務。

簡單講就係咁。下面再拆張圖的數字、Terra 的位置,同埋點解我最後仍然揀 Luna Max 做日常預設。

02 / 人工智能

先睇 Reddit 張成本圖

Reddit 討論貼入面的成本、輸出量同步驟比較圖。呢張係社群整理,唔係 OpenAI 官方價目表,亦唔係放諸四海皆準的基準測試。
Reddit 討論貼入面的成本、輸出量同步驟比較圖。呢張係社群整理,唔係 OpenAI 官方價目表,亦唔係放諸四海皆準的基準測試。 攝影/作者: Reddit post author;授權: Reddit-hosted community chart; confirm reuse permission before publication。 來源頁。 原圖。

呢張比較圖來自 Reddit 上一篇討論 GPT-5.6 的貼文,入面比較一次成功率、平均任務成本、輸出量同步驟。一次成功率只係嗰次測試入面第一輪過關的比例,唔代表 Sol 之後一定識得你個程式庫,亦唔代表 Luna 一定會搞亂你下一封電郵。

圖中 15 行數據我逐行列出來,睇數字會方便好多。截圖適合望整體走勢,表格就適合逐行比較;而個限制都要講清楚:呢個係一次社群比較,唔係 OpenAI 官方價目表,更加唔係所有工作都適用的排名。

模型/力度一次成功率平均成本輸出量步驟
GPT-5.6 Sol max73% ± 3%$8.3960k61
GPT-5.6 Sol xhigh71% ± 1%$4.7041k44
GPT-5.6 Terra max70% ± 3%$3.9672k76
GPT-5.6 Sol high69% ± 1%$3.4728k37
GPT-5.6 Luna max67% ± 4%$0.6173k102
GPT-5.6 Sol medium61% ± 2%$1.8618k31
GPT-5.6 Terra xhigh60% ± 2%$1.7040k43
GPT-5.6 Luna xhigh57% ± 2%$0.3145k71
GPT-5.6 Terra high54% ± 4%$0.9122k34
GPT-5.6 Sol low45% ± 2%$1.0711k23
GPT-5.6 Luna high44% ± 3%$0.1626k49
GPT-5.6 Terra medium35% ± 3%$0.4712k25
GPT-5.6 Terra low24% ± 1%$0.348.6k21
GPT-5.6 Luna medium11% ± 1%$0.048.2k24
GPT-5.6 Luna low2% ± 1%$0.013.1k12

第一眼最搶的是 Luna max:67%,平均 $0.61。Sol max 係 73%,平均 $8.39。即係 Sol 多 6 點,但圖表成本大概係 14 倍。任務好容易驗的話,呢筆差價好難忽略;如果係正式系統,少一次大錯可能已經值返晒。

第二眼就會見到另一面:Luna max 行 102 步,Sol max 行 61 步。平唔代表快,分數高亦唔代表短。Luna 有時係行遠少少先返到目的地——可以接受,但唔係免費的散步。

03 / 人工智能

三款模型各自適合咩工作?

GPT-5.6 官方頁面列出的 API 價格係:Sol 每一百萬個輸入 Token $5、輸出 $30;Terra 係 $2.50 同 $15;Luna 係 $1 同 $6。如果你直接用 API,呢啲數字會比較實在。用工作介面的話,感受到的通常係配額、等候時間同五小時窗口剩返幾多位。

我自己的理解係:Luna 適合剩低的錯誤有人幫手捉;Terra 適合方向定咗、但工作唔細;Sol 就留俾真正需要判斷的地方。唔係越貴越應該日日開。

Martin Vorel 拍攝的程式碼。推理步驟多啲可能有用,但每一步都可能有成本。
Martin Vorel 拍攝的程式碼。推理步驟多啲可能有用,但每一步都可能有成本。 攝影/作者: Martin Vorel;授權: CC BY-SA 4.0。 來源頁。 原圖。
你面前件工作可以先試咩情況升級
短改動、抽資料、小型修正Luna high/xhigh成日漏要求,或者檢查開始唔再簡單。
有計劃、要跨幾個檔案Terra high/xhigh計劃本身錯、範圍變闊,或者開始要作取捨。
架構、深度除錯、研究Sol high/xhigh出錯代價高過額外用量。
關鍵問題Sol max只有避免的失敗真的值得個高級路線。

仲有一個好容易漏的位:大家講「我試過 Luna」,未必真係用同一個設定。Luna low 同 Luna max 已經係兩件事,Terra 同 Sol 都一樣。比較模型時,力度一定要寫埋,否則好似攞架車用一波同高速公路比速度,然後話結果好奇怪。

04 / 人工智能

張圖的成本,唔等於你戶口扣款

呢個分別幾重要。圖表寫 $0.61,唔代表你個帳戶會扣 61 美仙;Sol max 寫 $8.39,亦唔代表你會收到一張 API 式的逐項帳單。不同產品可能計訊息、推理用量、滾動時間窗、方案路由,或者幾樣一齊計。

不過實際影響一樣感受到。重型 Sol 任務用得快,你剩低的時間就少,之後想重試另一件工作都要諗一諗。呢個係我最後冇揀 Sol 做日常預設的主要原因之一。

Jeremyida002 拍攝的秒錶。速度、等候時間同用量上限,其實係三隻唔同的鐘。
Jeremyida002 拍攝的秒錶。速度、等候時間同用量上限,其實係三隻唔同的鐘。 攝影/作者: Jeremyida002;授權: CC BY-SA 4.0。 來源頁。 原圖。
數字佢話緊咩佢冇話你咩
API Token 價格你自己控制請求時的公開單價你個 ChatGPT/Codex 帳戶會扣幾多。
平均任務成本嗰次測試的相對成本你下一件工作一定係呢個價。
輸出量模型產生咗幾多內容內容一定好。
步驟流程行咗幾多回合/動作你最後要改幾多次。
五小時上限你段時間仲有幾多工作空間基準分數。

我會當佢係三隻鐘:錢、模型工作量、你可以繼續工作的時間。三隻唔一定一齊行,所以有時張圖最平嗰格,實際用落反而唔係最快;最貴嗰格亦唔會自動令你一稿完成。

05 / 人工智能

Luna Max 點解咁多人揀?

張圖入面 Luna max 係 67% 一次成功率、$0.61、73k 輸出量同 102 步。個組合唔算靚仔,但幾實用。佢比 Sol max 行多步,成本就低好多。

附近幾行更加有意思:Luna xhigh 係 57%/$0.31,Luna max 係 67%/$0.61。多三毫子,呢次測試多十個百分點。Terra max 70%/$3.96,Sol high 69%/$3.47。唔係每加一蚊,都換到同樣多的質素。

比較圖表睇到咩我會再問
Luna max/Sol max差 6 點;顯示成本差約 14 倍Luna 剩低的錯,自己易唔易捉?
Luna xhigh/Luna max加 $0.30,成功率高 10 點細工作係咪開始卡住?
Terra max/Sol highTerra 高 1 點,但貴 $0.49我需要 Terra 的執行,定 Sol 的判斷?

所以 Luna Max 有時會兜路。接受到嗎?如果係起稿、整表、可以測試的改動,我多數接受;如果係改正式資料,仍然要加真人確認,唔會因為平就放生個流程。

06 / 人工智能

我用 Luna Max 幾個月的實際感覺

呢段係我真正做工作後的感覺,唔係實驗室報告。Luna Max 唔係次次第一輪就明白我想要咩。有時要重講語氣,有時要指住一段講「呢度偏咗」,有時就係直接話:「唔係,我唔係要呢個。」兩三輪修改,對比較複雜的工作算正常。

最出奇的是 Sol 冇有完全消除呢種來回。某些難題佢的第一稿確實較強,但我仍然要帶住佢行;而用量就跌得快好多。如果最後都要我判斷、改句子、補限制,貴模型未必幫我慳到時間。

Daudi mukiibi 拍攝的軟件開發者工作照。真正有用的問題係:去到可用結果,要改幾多輪?
Daudi mukiibi 拍攝的軟件開發者工作照。真正有用的問題係:去到可用結果,要改幾多輪? 攝影/作者: Daudi mukiibi;授權: CC BY-SA 4.0。 來源頁。 原圖。
我見到的情況我的答案
Luna Max 做到可用嗎?通常得,前提係我俾清楚邊界同例子。
第一輪跟晒細節嗎?唔係。要求高時,預兩三輪比較實際。
Sol 一定慳時間嗎?喺我的工作流程,唔一定。
點解仍然用 Luna 做預設?留返空間重試,亦仲可以做其他工作。

我講「可工作程度」,意思係我可以繼續做落去,唔使每句都照顧住模型,同時仲有足夠用量完成今日其他事。Luna Max 對我來講就係贏喺呢度。有人做難程式庫,揀 Sol 完全合理;工作唔同,條數自然唔同。

07 / 人工智能

Sol 係幾時先值得用?

Reddit 貼文提到的路由順序幾合理:先試輕量的 Luna,開始卡住就上 Luna Max,再按工作難度考慮 Sol high、xhigh、max。我唔會因為個 Prompt 聽落好重要,就直接開 Sol Max。要求寫得含糊,貴模型一樣可以很有耐性咁做錯事。

Sol high 係我覺得比較實際的高階位:69%/$3.47/37 步;Sol xhigh 71%/$4.70/44 步;Sol max 73%/$8.39/61 步。至少有級樓梯,唔使次次跳到最頂。

Matthew 拍攝的 Wikimedia 程式碼審查會議。無論模型幾勁,第二雙眼仍然係流程一部分。
Matthew 拍攝的 Wikimedia 程式碼審查會議。無論模型幾勁,第二雙眼仍然係流程一部分。 攝影/作者: Matthew (Wikimedia Foundation);授權: CC BY-SA 3.0。 來源頁。 原圖。
Sol 設定張圖數字我會用喺
Sol high69%/$3.47/37 步難,但仍然要顧成本的工作。
Sol xhigh71%/$4.70/44 步輕量路線已經頂唔順的任務。
Sol max73%/$8.39/61 步真係難、真係唔想漏的邊緣案例。

前提係要俾佢一份像樣的 Brief:相關檔案、不能改的限制、驗收方法、測試。唔係就似花錢請專家,但只係叫佢自己估你想做咩。專家都會估錯,仲要估得幾有說服力。

08 / 人工智能

Terra 係咪最中間、最穩陣?

Terra max 係 70%/$3.96/72k/76 步;Terra xhigh 係 60%/$1.70/40k/43 步。用張圖比較,Terra max 比 Sol high 貴,步驟亦多,但一次成功率只高一點。所以原貼作者會將 Sol high 放喺較抵的中間位置。

但留言有人話 Terra xhigh 快過 Sol,有人用 Terra 做實作、Sol 做計劃,亦有人覺得 Sol 太愛諗複雜,Luna xhigh 做預設反而順。呢啲意見可以同時成立,因為大家根本唔係做同一件事。

如果你已經有…Terra 可能啱記住檢查
清楚計劃同檔案範圍可以做較闊的實作,不使即刻開 Sol max。叫佢記錄改動同跑測試。
想比 Luna 有多啲伸展Terra xhigh 值得自己試一輪。其他程式庫的速度,未必搬得過來。
架構仲未定先用 Terra 整理選項,再考慮用 Sol 做難判斷。快手砌錯,仍然係砌錯。

所以我會將 Terra 當成實際的中間選擇,而唔係「兩邊都唔夠好」嗰格。方向已經定,但工作比較大,佢就有用;方向都未定,就先花錢買判斷。

09 / 人工智能

我而家會點樣揀模型?

  1. 細、清楚Luna high 或 xhigh。幾秒就睇得出有冇錯,唔需要一開就用重型路線。
  2. 普通日常工作Luna Max。呢個係我實際用落最平衡的位置。
  3. 有計劃的多檔案工作Terra high 或 xhigh。方向定咗,想要多啲執行範圍。
  4. 架構含糊或風險高Sol high。難的是判斷,唔係打字速度。
  5. 平價路線已經失敗Sol xhigh 或 max。到呢一步,額外用量比較容易講得通。
情況我會先揀原因
短、容易驗的任務Luna high/xhigh改錯平。
日常工作Luna Max我自己用落最平衡。
有計劃的實作Terra high/xhigh多啲執行範圍,但唔使即刻付 Sol max。
架構或難除錯Sol high額外判斷值得付錢。
失手代價好高Sol xhigh/max避免一個大錯可能比配額更值錢。

呢個係我而家用的次序,唔係永遠規矩。你試五件真工作之後,可能會將 Terra 放前,亦可能大部分時間停喺 Luna xhigh。至少有一條可以改的規則,好過靠一張靚圖鬥喜好。

10 / 人工智能

要改兩三次,Luna 仲抵唔抵?

如果 Luna 第一輪俾到一個可用草稿,我只係要改讀者、語氣或者一個測試,兩三輪唔算大問題。每一輪都睇得明,任務仍然平,呢個就係 Luna 發揮的地方。

但如果每次都要由頭跑、同一個錯誤改完又返來,或者個結果會改到客戶資料、正式系統、錢,咁我會早啲升級。模型平咗,唔代表你應該用半日幫佢執手尾;張單只係由帳戶搬咗去日曆。

Luna 仍然值得試我會升級
修改細而清楚。同一個錯誤改兩次都返來。
有測試、清單或者真人快速覆核。會碰法律、金錢、安全或正式資料。
要求穩定,有例子。條件一路變,連目標都未定。
同一窗口仲要做好多工作。件事少見但關鍵,重做一次好貴。

我會計「完成一件工作真正用咗幾多」,唔係淨係計第一稿。包括覆核、重試、等候同重新解釋。你最後的數字可能同 Reddit 張圖一樣,亦可能唔一樣;都好,因為嗰個先係你的工作成本。

11 / 人工智能

點解 Reddit 留言會咁分歧?

有人話 Sol 可以一輪完成難項目,幾次 Luna 都做唔到;有人話 Sol 太愛諗,簡單工作反而搞複雜;有人覺得 Terra xhigh 快;亦有人用 Sol 做計劃、Terra 做執行。呢啲經驗未必互相推翻,可能只係大家的工作壓力點唔同。

寫文章的人重視語氣、細節同跟唔跟到要求;開發者重視測試,亦怕改咗三個檔案之外的東西;研究工作就可能最重視來源。模型名稱相同,真正要解的痛點唔同。

會影響結果的地方點解
工作類型寫作、除錯、研究、實作,要求的能力唔同。
提示寫法驗收方法清楚,模型先知道做到邊度算完成。
產品介面Chat、Codex、Work 同 API 的工具同限制可以唔一樣。
推理力度low、medium、high、xhigh、max 唔係同一個測試。
覆核的人捉錯快的人,比較容易安全咁用平價模型。
資料日期價格同路由會變,但舊截圖唔會自己更新。

張圖可以留低,因為佢將一個取捨畫得幾清楚;產品細節就要再睇官方頁面,最好自己試幾件工作。唔好要求一張截圖解釋一個會郁的產品——佢冇咁長氣。

12 / 人工智能

最後我的選擇:Luna Max

如果你問我而家會點開始:普通工作先用 Luna Max,俾清楚要求、例子同驗收方法。要改兩三輪唔代表佢即刻出局,先睇每一輪係咪便宜、睇得明、改完有冇前進。

工作闊但方向定咗,就試 Terra。工作含糊、難除錯、漏一步會好貴,先用 Sol。Sol 當然有用;我只係唔覺得需要用跑車買菜,日日都開住佢做最普通的事。

問題我的答案
日常最平衡?GPT-5.6 Luna Max,基於我自己用咗幾個月的工作。
Terra 放喺邊?有計劃、範圍較闊的實作。
Sol 何時值得?判斷、深度或失手代價值得額外用量時。
Reddit 張圖判晒勝負?唔係。佢提供起點,你的工作先完成比較。
Luna 改兩三輪就唔抵?唔一定;如果每輪容易驗,總成本仍然可以較低。

如果你想自己驗一次

揀一星期內五件真工作,盡量固定檔案同提示,記低第一輪結果、修改次數、等候時間、用量,同埋最後敢唔敢直接交付。呢份小記錄,比爭論邊個模型最勁實際得多。

揀平價模型唔失禮,揀貴模型亦冇功德。額外推理真係買到你需要的東西,就俾錢;如果只係令對話變長,轉返輕啲的路線,未嘗唔好。

資料來源

來源、日期與圖片授權

  1. OpenAI:GPT-5.6
  2. Reddit r/codex:GPT-5.6 Sol、Luna 同 Terra——按成本同速度揀模型

圖片來源與授權備註

  • photo-two-laptops.jpg——Tsinkala 拍攝的軟件開發者同時用兩部手提電腦工作。揀模型係工作決定,唔係純粹追排行榜。 攝影/作者:Tsinkala;授權:CC BY-SA 4.0。圖片直連。
  • reddit-gpt56-cost-speed-chart.png——Reddit 討論貼入面的成本、輸出量同步驟比較圖。呢張係社群整理,唔係 OpenAI 官方價目表,亦唔係放諸四海皆準的基準測試。 上載來源:Reddit post author;Reddit-hosted community chart; confirm reuse permission before publication。圖片直連。
  • photo-programming-code.jpg——Martin Vorel 拍攝的程式碼。推理步驟多啲可能有用,但每一步都可能有成本。 攝影/作者:Martin Vorel;授權:CC BY-SA 4.0。圖片直連。
  • photo-stopwatch.jpg——Jeremyida002 拍攝的秒錶。速度、等候時間同用量上限,其實係三隻唔同的鐘。 攝影/作者:Jeremyida002;授權:CC BY-SA 4.0。圖片直連。
  • photo-software-developer-africa.jpg——Daudi mukiibi 拍攝的軟件開發者工作照。真正有用的問題係:去到可用結果,要改幾多輪? 攝影/作者:Daudi mukiibi;授權:CC BY-SA 4.0。圖片直連。
  • photo-code-review-meeting.jpg——Matthew 拍攝的 Wikimedia 程式碼審查會議。無論模型幾勁,第二雙眼仍然係流程一部分。 攝影/作者:Matthew (Wikimedia Foundation);授權:CC BY-SA 3.0。圖片直連。

研究資料截至 2026-09-28 UTC。OpenAI 頁面提供官方模型定位、價格背景同公開基準測試的框架;Reddit 張圖同留言係社群資料,唔係嚴格控制的測試,更唔係所有人都適用的答案。作者自己的 Luna Max 使用感受屬於個人測試,唔代表每個帳戶都一樣。發佈前請再核對最新權限、價格同圖片使用條款。

我自己的預設係 Luna Max。

佢一樣要修改,Sol 喺我的流程都一樣要改,而且用五小時上限快好多。

WhatsApp 聯絡 Locke Lee