本文內容+
01 / 人工智能
GPT-5.6 Luna、Terra 同 Sol:到底有咩分別?
一開始試 GPT-5.6,我都以為 Sol 會自然成為預設答案。佢的確有啲工作做得好啲;問題係,用量跌得好快,而且遇到要求唔清楚的 Brief,佢一樣會問你再改。用咗幾個月之後,我的答案反而簡單咗:平日先開 Luna Max。
三款模型唔係完全一樣。價錢、推理力度、速度同完成一件工作的步驟都唔同。張 Reddit 比較圖最有用的地方,就係將呢啲差別放返落數字入面。仲有一點:Luna low 同 Luna max,體感可以差好遠;淨係講模型名其實未講完。

| 模型 | 大概適合咩 | 我會點開始 |
|---|---|---|
| GPT-5.6 Luna | 平、重複性高、容易檢查的工作 | 起稿、資料抽取、小型程式修改、例行修正。 |
| GPT-5.6 Terra | 已經有計劃,但範圍比較闊的實作 | 要睇幾個檔案、做較長流程,但方向已經定好。 |
| GPT-5.6 Sol | 含糊、難除錯、做錯代價高的工作 | 架構判斷、深度研究,同埋唔想漏一步的任務。 |
簡單講就係咁。下面再拆張圖的數字、Terra 的位置,同埋點解我最後仍然揀 Luna Max 做日常預設。
02 / 人工智能
先睇 Reddit 張成本圖

呢張比較圖來自 Reddit 上一篇討論 GPT-5.6 的貼文,入面比較一次成功率、平均任務成本、輸出量同步驟。一次成功率只係嗰次測試入面第一輪過關的比例,唔代表 Sol 之後一定識得你個程式庫,亦唔代表 Luna 一定會搞亂你下一封電郵。
圖中 15 行數據我逐行列出來,睇數字會方便好多。截圖適合望整體走勢,表格就適合逐行比較;而個限制都要講清楚:呢個係一次社群比較,唔係 OpenAI 官方價目表,更加唔係所有工作都適用的排名。
| 模型/力度 | 一次成功率 | 平均成本 | 輸出量 | 步驟 |
|---|---|---|---|---|
| GPT-5.6 Sol max | 73% ± 3% | $8.39 | 60k | 61 |
| GPT-5.6 Sol xhigh | 71% ± 1% | $4.70 | 41k | 44 |
| GPT-5.6 Terra max | 70% ± 3% | $3.96 | 72k | 76 |
| GPT-5.6 Sol high | 69% ± 1% | $3.47 | 28k | 37 |
| GPT-5.6 Luna max | 67% ± 4% | $0.61 | 73k | 102 |
| GPT-5.6 Sol medium | 61% ± 2% | $1.86 | 18k | 31 |
| GPT-5.6 Terra xhigh | 60% ± 2% | $1.70 | 40k | 43 |
| GPT-5.6 Luna xhigh | 57% ± 2% | $0.31 | 45k | 71 |
| GPT-5.6 Terra high | 54% ± 4% | $0.91 | 22k | 34 |
| GPT-5.6 Sol low | 45% ± 2% | $1.07 | 11k | 23 |
| GPT-5.6 Luna high | 44% ± 3% | $0.16 | 26k | 49 |
| GPT-5.6 Terra medium | 35% ± 3% | $0.47 | 12k | 25 |
| GPT-5.6 Terra low | 24% ± 1% | $0.34 | 8.6k | 21 |
| GPT-5.6 Luna medium | 11% ± 1% | $0.04 | 8.2k | 24 |
| GPT-5.6 Luna low | 2% ± 1% | $0.01 | 3.1k | 12 |
第一眼最搶的是 Luna max:67%,平均 $0.61。Sol max 係 73%,平均 $8.39。即係 Sol 多 6 點,但圖表成本大概係 14 倍。任務好容易驗的話,呢筆差價好難忽略;如果係正式系統,少一次大錯可能已經值返晒。
第二眼就會見到另一面:Luna max 行 102 步,Sol max 行 61 步。平唔代表快,分數高亦唔代表短。Luna 有時係行遠少少先返到目的地——可以接受,但唔係免費的散步。
03 / 人工智能
三款模型各自適合咩工作?
GPT-5.6 官方頁面列出的 API 價格係:Sol 每一百萬個輸入 Token $5、輸出 $30;Terra 係 $2.50 同 $15;Luna 係 $1 同 $6。如果你直接用 API,呢啲數字會比較實在。用工作介面的話,感受到的通常係配額、等候時間同五小時窗口剩返幾多位。
我自己的理解係:Luna 適合剩低的錯誤有人幫手捉;Terra 適合方向定咗、但工作唔細;Sol 就留俾真正需要判斷的地方。唔係越貴越應該日日開。

| 你面前件工作 | 可以先試 | 咩情況升級 |
|---|---|---|
| 短改動、抽資料、小型修正 | Luna high/xhigh | 成日漏要求,或者檢查開始唔再簡單。 |
| 有計劃、要跨幾個檔案 | Terra high/xhigh | 計劃本身錯、範圍變闊,或者開始要作取捨。 |
| 架構、深度除錯、研究 | Sol high/xhigh | 出錯代價高過額外用量。 |
| 關鍵問題 | Sol max | 只有避免的失敗真的值得個高級路線。 |
仲有一個好容易漏的位:大家講「我試過 Luna」,未必真係用同一個設定。Luna low 同 Luna max 已經係兩件事,Terra 同 Sol 都一樣。比較模型時,力度一定要寫埋,否則好似攞架車用一波同高速公路比速度,然後話結果好奇怪。
04 / 人工智能
張圖的成本,唔等於你戶口扣款
呢個分別幾重要。圖表寫 $0.61,唔代表你個帳戶會扣 61 美仙;Sol max 寫 $8.39,亦唔代表你會收到一張 API 式的逐項帳單。不同產品可能計訊息、推理用量、滾動時間窗、方案路由,或者幾樣一齊計。
不過實際影響一樣感受到。重型 Sol 任務用得快,你剩低的時間就少,之後想重試另一件工作都要諗一諗。呢個係我最後冇揀 Sol 做日常預設的主要原因之一。

| 數字 | 佢話緊咩 | 佢冇話你咩 |
|---|---|---|
| API Token 價格 | 你自己控制請求時的公開單價 | 你個 ChatGPT/Codex 帳戶會扣幾多。 |
| 平均任務成本 | 嗰次測試的相對成本 | 你下一件工作一定係呢個價。 |
| 輸出量 | 模型產生咗幾多內容 | 內容一定好。 |
| 步驟 | 流程行咗幾多回合/動作 | 你最後要改幾多次。 |
| 五小時上限 | 你段時間仲有幾多工作空間 | 基準分數。 |
我會當佢係三隻鐘:錢、模型工作量、你可以繼續工作的時間。三隻唔一定一齊行,所以有時張圖最平嗰格,實際用落反而唔係最快;最貴嗰格亦唔會自動令你一稿完成。
05 / 人工智能
Luna Max 點解咁多人揀?
張圖入面 Luna max 係 67% 一次成功率、$0.61、73k 輸出量同 102 步。個組合唔算靚仔,但幾實用。佢比 Sol max 行多步,成本就低好多。
附近幾行更加有意思:Luna xhigh 係 57%/$0.31,Luna max 係 67%/$0.61。多三毫子,呢次測試多十個百分點。Terra max 70%/$3.96,Sol high 69%/$3.47。唔係每加一蚊,都換到同樣多的質素。
| 比較 | 圖表睇到咩 | 我會再問 |
|---|---|---|
| Luna max/Sol max | 差 6 點;顯示成本差約 14 倍 | Luna 剩低的錯,自己易唔易捉? |
| Luna xhigh/Luna max | 加 $0.30,成功率高 10 點 | 細工作係咪開始卡住? |
| Terra max/Sol high | Terra 高 1 點,但貴 $0.49 | 我需要 Terra 的執行,定 Sol 的判斷? |
所以 Luna Max 有時會兜路。接受到嗎?如果係起稿、整表、可以測試的改動,我多數接受;如果係改正式資料,仍然要加真人確認,唔會因為平就放生個流程。
06 / 人工智能
我用 Luna Max 幾個月的實際感覺
呢段係我真正做工作後的感覺,唔係實驗室報告。Luna Max 唔係次次第一輪就明白我想要咩。有時要重講語氣,有時要指住一段講「呢度偏咗」,有時就係直接話:「唔係,我唔係要呢個。」兩三輪修改,對比較複雜的工作算正常。
最出奇的是 Sol 冇有完全消除呢種來回。某些難題佢的第一稿確實較強,但我仍然要帶住佢行;而用量就跌得快好多。如果最後都要我判斷、改句子、補限制,貴模型未必幫我慳到時間。

| 我見到的情況 | 我的答案 |
|---|---|
| Luna Max 做到可用嗎? | 通常得,前提係我俾清楚邊界同例子。 |
| 第一輪跟晒細節嗎? | 唔係。要求高時,預兩三輪比較實際。 |
| Sol 一定慳時間嗎? | 喺我的工作流程,唔一定。 |
| 點解仍然用 Luna 做預設? | 留返空間重試,亦仲可以做其他工作。 |
我講「可工作程度」,意思係我可以繼續做落去,唔使每句都照顧住模型,同時仲有足夠用量完成今日其他事。Luna Max 對我來講就係贏喺呢度。有人做難程式庫,揀 Sol 完全合理;工作唔同,條數自然唔同。
07 / 人工智能
Sol 係幾時先值得用?
Reddit 貼文提到的路由順序幾合理:先試輕量的 Luna,開始卡住就上 Luna Max,再按工作難度考慮 Sol high、xhigh、max。我唔會因為個 Prompt 聽落好重要,就直接開 Sol Max。要求寫得含糊,貴模型一樣可以很有耐性咁做錯事。
Sol high 係我覺得比較實際的高階位:69%/$3.47/37 步;Sol xhigh 71%/$4.70/44 步;Sol max 73%/$8.39/61 步。至少有級樓梯,唔使次次跳到最頂。

| Sol 設定 | 張圖數字 | 我會用喺 |
|---|---|---|
| Sol high | 69%/$3.47/37 步 | 難,但仍然要顧成本的工作。 |
| Sol xhigh | 71%/$4.70/44 步 | 輕量路線已經頂唔順的任務。 |
| Sol max | 73%/$8.39/61 步 | 真係難、真係唔想漏的邊緣案例。 |
前提係要俾佢一份像樣的 Brief:相關檔案、不能改的限制、驗收方法、測試。唔係就似花錢請專家,但只係叫佢自己估你想做咩。專家都會估錯,仲要估得幾有說服力。
08 / 人工智能
Terra 係咪最中間、最穩陣?
Terra max 係 70%/$3.96/72k/76 步;Terra xhigh 係 60%/$1.70/40k/43 步。用張圖比較,Terra max 比 Sol high 貴,步驟亦多,但一次成功率只高一點。所以原貼作者會將 Sol high 放喺較抵的中間位置。
但留言有人話 Terra xhigh 快過 Sol,有人用 Terra 做實作、Sol 做計劃,亦有人覺得 Sol 太愛諗複雜,Luna xhigh 做預設反而順。呢啲意見可以同時成立,因為大家根本唔係做同一件事。
| 如果你已經有… | Terra 可能啱 | 記住檢查 |
|---|---|---|
| 清楚計劃同檔案範圍 | 可以做較闊的實作,不使即刻開 Sol max。 | 叫佢記錄改動同跑測試。 |
| 想比 Luna 有多啲伸展 | Terra xhigh 值得自己試一輪。 | 其他程式庫的速度,未必搬得過來。 |
| 架構仲未定 | 先用 Terra 整理選項,再考慮用 Sol 做難判斷。 | 快手砌錯,仍然係砌錯。 |
所以我會將 Terra 當成實際的中間選擇,而唔係「兩邊都唔夠好」嗰格。方向已經定,但工作比較大,佢就有用;方向都未定,就先花錢買判斷。
09 / 人工智能
我而家會點樣揀模型?
- 細、清楚Luna high 或 xhigh。幾秒就睇得出有冇錯,唔需要一開就用重型路線。
- 普通日常工作Luna Max。呢個係我實際用落最平衡的位置。
- 有計劃的多檔案工作Terra high 或 xhigh。方向定咗,想要多啲執行範圍。
- 架構含糊或風險高Sol high。難的是判斷,唔係打字速度。
- 平價路線已經失敗Sol xhigh 或 max。到呢一步,額外用量比較容易講得通。
| 情況 | 我會先揀 | 原因 |
|---|---|---|
| 短、容易驗的任務 | Luna high/xhigh | 改錯平。 |
| 日常工作 | Luna Max | 我自己用落最平衡。 |
| 有計劃的實作 | Terra high/xhigh | 多啲執行範圍,但唔使即刻付 Sol max。 |
| 架構或難除錯 | Sol high | 額外判斷值得付錢。 |
| 失手代價好高 | Sol xhigh/max | 避免一個大錯可能比配額更值錢。 |
呢個係我而家用的次序,唔係永遠規矩。你試五件真工作之後,可能會將 Terra 放前,亦可能大部分時間停喺 Luna xhigh。至少有一條可以改的規則,好過靠一張靚圖鬥喜好。
10 / 人工智能
要改兩三次,Luna 仲抵唔抵?
如果 Luna 第一輪俾到一個可用草稿,我只係要改讀者、語氣或者一個測試,兩三輪唔算大問題。每一輪都睇得明,任務仍然平,呢個就係 Luna 發揮的地方。
但如果每次都要由頭跑、同一個錯誤改完又返來,或者個結果會改到客戶資料、正式系統、錢,咁我會早啲升級。模型平咗,唔代表你應該用半日幫佢執手尾;張單只係由帳戶搬咗去日曆。
| Luna 仍然值得試 | 我會升級 |
|---|---|
| 修改細而清楚。 | 同一個錯誤改兩次都返來。 |
| 有測試、清單或者真人快速覆核。 | 會碰法律、金錢、安全或正式資料。 |
| 要求穩定,有例子。 | 條件一路變,連目標都未定。 |
| 同一窗口仲要做好多工作。 | 件事少見但關鍵,重做一次好貴。 |
我會計「完成一件工作真正用咗幾多」,唔係淨係計第一稿。包括覆核、重試、等候同重新解釋。你最後的數字可能同 Reddit 張圖一樣,亦可能唔一樣;都好,因為嗰個先係你的工作成本。
11 / 人工智能
點解 Reddit 留言會咁分歧?
有人話 Sol 可以一輪完成難項目,幾次 Luna 都做唔到;有人話 Sol 太愛諗,簡單工作反而搞複雜;有人覺得 Terra xhigh 快;亦有人用 Sol 做計劃、Terra 做執行。呢啲經驗未必互相推翻,可能只係大家的工作壓力點唔同。
寫文章的人重視語氣、細節同跟唔跟到要求;開發者重視測試,亦怕改咗三個檔案之外的東西;研究工作就可能最重視來源。模型名稱相同,真正要解的痛點唔同。
| 會影響結果的地方 | 點解 |
|---|---|
| 工作類型 | 寫作、除錯、研究、實作,要求的能力唔同。 |
| 提示寫法 | 驗收方法清楚,模型先知道做到邊度算完成。 |
| 產品介面 | Chat、Codex、Work 同 API 的工具同限制可以唔一樣。 |
| 推理力度 | low、medium、high、xhigh、max 唔係同一個測試。 |
| 覆核的人 | 捉錯快的人,比較容易安全咁用平價模型。 |
| 資料日期 | 價格同路由會變,但舊截圖唔會自己更新。 |
張圖可以留低,因為佢將一個取捨畫得幾清楚;產品細節就要再睇官方頁面,最好自己試幾件工作。唔好要求一張截圖解釋一個會郁的產品——佢冇咁長氣。
12 / 人工智能
最後我的選擇:Luna Max
如果你問我而家會點開始:普通工作先用 Luna Max,俾清楚要求、例子同驗收方法。要改兩三輪唔代表佢即刻出局,先睇每一輪係咪便宜、睇得明、改完有冇前進。
工作闊但方向定咗,就試 Terra。工作含糊、難除錯、漏一步會好貴,先用 Sol。Sol 當然有用;我只係唔覺得需要用跑車買菜,日日都開住佢做最普通的事。
| 問題 | 我的答案 |
|---|---|
| 日常最平衡? | GPT-5.6 Luna Max,基於我自己用咗幾個月的工作。 |
| Terra 放喺邊? | 有計劃、範圍較闊的實作。 |
| Sol 何時值得? | 判斷、深度或失手代價值得額外用量時。 |
| Reddit 張圖判晒勝負? | 唔係。佢提供起點,你的工作先完成比較。 |
| Luna 改兩三輪就唔抵? | 唔一定;如果每輪容易驗,總成本仍然可以較低。 |
如果你想自己驗一次
揀一星期內五件真工作,盡量固定檔案同提示,記低第一輪結果、修改次數、等候時間、用量,同埋最後敢唔敢直接交付。呢份小記錄,比爭論邊個模型最勁實際得多。
揀平價模型唔失禮,揀貴模型亦冇功德。額外推理真係買到你需要的東西,就俾錢;如果只係令對話變長,轉返輕啲的路線,未嘗唔好。
資料來源
來源、日期與圖片授權
圖片來源與授權備註
- photo-two-laptops.jpg——Tsinkala 拍攝的軟件開發者同時用兩部手提電腦工作。揀模型係工作決定,唔係純粹追排行榜。 攝影/作者:Tsinkala;授權:CC BY-SA 4.0。圖片直連。
- reddit-gpt56-cost-speed-chart.png——Reddit 討論貼入面的成本、輸出量同步驟比較圖。呢張係社群整理,唔係 OpenAI 官方價目表,亦唔係放諸四海皆準的基準測試。 上載來源:Reddit post author;Reddit-hosted community chart; confirm reuse permission before publication。圖片直連。
- photo-programming-code.jpg——Martin Vorel 拍攝的程式碼。推理步驟多啲可能有用,但每一步都可能有成本。 攝影/作者:Martin Vorel;授權:CC BY-SA 4.0。圖片直連。
- photo-stopwatch.jpg——Jeremyida002 拍攝的秒錶。速度、等候時間同用量上限,其實係三隻唔同的鐘。 攝影/作者:Jeremyida002;授權:CC BY-SA 4.0。圖片直連。
- photo-software-developer-africa.jpg——Daudi mukiibi 拍攝的軟件開發者工作照。真正有用的問題係:去到可用結果,要改幾多輪? 攝影/作者:Daudi mukiibi;授權:CC BY-SA 4.0。圖片直連。
- photo-code-review-meeting.jpg——Matthew 拍攝的 Wikimedia 程式碼審查會議。無論模型幾勁,第二雙眼仍然係流程一部分。 攝影/作者:Matthew (Wikimedia Foundation);授權:CC BY-SA 3.0。圖片直連。
研究資料截至 2026-09-28 UTC。OpenAI 頁面提供官方模型定位、價格背景同公開基準測試的框架;Reddit 張圖同留言係社群資料,唔係嚴格控制的測試,更唔係所有人都適用的答案。作者自己的 Luna Max 使用感受屬於個人測試,唔代表每個帳戶都一樣。發佈前請再核對最新權限、價格同圖片使用條款。