安安~我是ChiYu~
9 月 22 日,OpenAI 把 GPT-6 Sol 和 Luna 補進模型選單。Sol 的 API 價格直接砍半,Luna 更便宜。看到「GPT-6」加上降價,很容易想把原本的 GPT-5.6 全換掉。
可是 Artificial Analysis 的評分 一攤開,GPT-6 Luna 的 Coding Agent Index 是 41 分,GPT-5.6 Luna 反而有 43 分。新款比較便宜,程式開發代理的分數卻少了 2 分。這個落差不算巨大,但已經足夠讓「全部升級」這件事先踩一下煞車。
我會怎麼挑?先把 Astra、Sol、Luna 的用途分開,再看同一套評測裡到底進步了多少、退步了多少,也找幾個真的拿模型做過事的人怎麼說。我還沒親自跑完三款模型的對照測試,下面的使用心得都會標明是誰做的、做了什麼。
本文查閱日期是 2026 年 9 月 23 日。GPT-6 Astra 在 9 月上旬推出;Sol 和 Luna 於 9 月 22 日開放 API 。價格、供應狀態和評分之後都可能變動。
Astra、Sol、Luna,先別當成同一款模型的快慢設定
OpenAI 的 模型目錄 把 Astra 放在最難的端到端任務,Sol 放在能力與成本之間,Luna 則是大量、範圍明確而且要控成本的工作。它們是三款模型,不是同一款模型按下不同速度的按鈕。
Astra 的 API 標準價格是每 100 萬 tokens 輸入 US$10、輸出 US$50;Sol 是 US$2/US$10;Luna 是 US$0.10/US$0.50。三款都支援文字與圖片輸入、文字輸出,官方列出的 context window 約 105 萬 tokens。視窗大,讀資料時比較有餘裕;遇到一個百萬 tokens 的專案,仍然得看模型能不能真的找對資訊。
上面的價格適用於短於 272K 輸入 tokens 的標準 API 請求。長輸入、快取或 Batch 的帳要另外算,ChatGPT 訂閱與 Codex 額度也不是這張價目表。 OpenAI API 更新紀錄
還有一個容易找錯名字的地方:目前沒有「GPT-6 Terra」。原本使用 GPT-5.6 Terra 的人,要回到手上的工作和預算,重新比較 Sol 與 Luna。
分數放在一起,GPT-6 的進步沒有那麼整齊
網路上的模型分數很多,我選 Artificial Analysis
這組來看,並把推理強度固定在 max。Intelligence Index 混合多種任務;Coding Agent Index 評估程式開發代理。表格裡的「每題成本」是跑 Intelligence Index 的估算,不是 API 每次呼叫的固定費用。
模型,皆為 max | Intelligence Index | Coding Agent Index | Intelligence Index 每題估計成本 |
|---|---|---|---|
| GPT-5.6 Sol | 47 | 55 | US$1.99 |
| GPT-6 Astra | 53 | 62 | US$3.26 |
| GPT-6 Sol | 48 | 57 | US$1.06 |
| GPT-5.6 Luna | 37 | 43 | US$0.18 |
| GPT-6 Luna | 37 | 41 | US$0.07 |
分數與成本取自 Artificial Analysis 的 Astra 模型頁 、 Sol 模型頁 、 Luna 模型頁 ,以及 Astra 、 Sol/Luna 兩篇發布評測。這是 9 月 23 日查到的版本;評測更新後,分數可能重算,也別把它和 OpenAI 自家的百分比直接混比。
Astra 跟 GPT-5.6 Sol 相比,兩項指數都明顯上升,花費也上去了。Sol 的分數只小升,省下的錢更有感。Luna 的綜合分數原地踏步,程式開發分數還退了 2 分。三款都叫 GPT-6,升級理由其實完全不同。
Astra 適合難題,但也別只看它贏了幾分
Astra 的 Intelligence Index 從 GPT-5.6 Sol 的 47 走到 53,Coding Agent Index 從 55 走到 62。Artificial Analysis 指出,Terminal-Bench 4.0 和 SWE-Atlas-QnA 是程式開發分數往上的主要來源;DeepSWE 卻比較低。 Astra 第三方評測
如果工作要讀很長的規格、一路操作工具,Astra 還有另一組值得看的數字。OpenAI 的 8-needle MRCR v2 長文本取回測試,在 512K–1M tokens 這段,Astra 得 96.3%,GPT-5.6 Sol 是 73.8%。這能說明它在該測試的取回能力,不能保證你把整個 repository 丟進去,它就每次都找得對。 OpenAI Astra 發布資料
可靠性也有進步。Artificial Analysis 的 AA-Omniscience 測試裡,Astra 的幻覺率比 GPT-5.6 Sol 從 92% 降到 51%,準確率還略升。OpenAI 另用刻意誘發越權的內部案例測試,看到 Astra 比 GPT-5.6 Sol 更能守住授權範圍。後者是特別設計的情境,我不會把它翻譯成「實際使用不會越界」。 第三方評測 、 官方公告
有一說一,Astra 的價格也得跟能力一起看。這套 Intelligence Index 每題估計成本從 US$1.99 到 US$3.26。若任務只要改一小段文字,這筆錢未必花得值得;大型重構、長程 Agent 工作、出錯後很難收拾的修改,才比較能吃到它的好處。
Sol 的分數小升,帳單比較有感
GPT-6 Sol 跟 GPT-5.6 Sol 比,Intelligence Index 是 47 → 48,Coding Agent Index 是 55 → 57。只盯著分數,會覺得這次更新好像不太刺激。換成每題估計成本,卻是 US$1.99 → US$1.06。 Artificial Analysis 評測
OpenAI 比的是 GPT-5.6 調價後的促銷價:Sol 每 100 萬 tokens 的輸入/輸出價從 US$4/US$20,降到 GPT-6 Sol 的 US$2/US$10。之前我寫 GPT-5.6 模型選擇指南 時,記錄的是當時的價格;拿那張舊表和今天的新價直接相減,會算錯降幅。 OpenAI GPT-6 Sol/Luna 公告
同一份第三方評測裡,Sol 的 AutomationBench-AA 從 60% 到 62%,Terminal-Bench 4.0 從 40% 到 44%。對常讓 Agent 反覆改 code、跑工具、重新驗證的人,Sol 的吸引力是可以用較低成本多試幾輪。能不能少花時間返工,還是得拿自己的專案測。
Luna 便宜很多,複雜程式工作先別急著換
Luna 的價格更誇張。GPT-5.6 Luna 調價後的輸入/輸出價是 US$0.20/US$1.20;GPT-6 Luna 降到 US$0.10/US$0.50。輸入減半,輸出大約少 58%。Artificial Analysis 跑 Intelligence Index 的每題估計成本,也從 US$0.18 降到 US$0.07。 OpenAI 公告 、 第三方評測
但 Coding Agent Index 是 43 → 41。SWE-Atlas-QnA 與 DeepSWE 都低於 GPT-5.6 Luna。要它批次分類、萃取欄位,或處理可以自動驗證的小任務,我願意先試;要它一口氣改跨模組程式,我會先用自己的測試案例比過,再決定要不要換。
完整報告也要小心。Artificial Analysis 的 GDPval-AA v2.1 裡,Astra 比 GPT-5.6 Sol 低約 45 Elo;Sol、Luna 相較各自的 5.6 前代,分別低約 100、75 Elo。評測團隊檢查成品後,看到有些回答變短,漏了評分條件要求的內容。報告表面上寫完了,驗收清單卻少幾格,後面還是得補。 Astra 評測 、 Sol/Luna 評測
少亂答是好事,但 Sol 也更常不回答
Artificial Analysis 在 AA-Omniscience 看到 Sol 的幻覺率從 92% 降到 60%,Luna 從 93% 降到 77%。這一項我會給分。只是 Sol 的作答率也從 99% 降到 83%,準確率從 59% 降到 54%。它避開了一些錯誤答案,也避開了更多題目;如果工作要求把每個問題都處理完,少亂答不能單獨當成「品質全面變好」。 第三方評測
OpenAI 還提到 prompt caching 的改善:調整推理強度或工具設定時,前段 context 更容易沿用快取。對長對話、反覆讀同一份規格的 Agent,這有機會省下處理成本;省多少要看實際快取命中率。 官方快取說明
真的拿去做事的人,感受不太一樣
光看總分,還是很難知道模型會在哪一步卡住。我找到幾份公開的操作紀錄,有人覺得新款省錢又省時,也有人遇到它漏需求。這些案例比一句「全面進步」更能提醒我該驗收什麼。
Endor Labs 把 Astra 放進 Codex ,用同一批程式修補任務跟 GPT-5.6 Sol 比。功能測試通過率從 67.6% 到 82.1%,隱藏的安全測試通過率從 20.1% 到 34.6%。這是真正執行程式並跑測試的結果,比單看模型自評有參考價值;代價是平均每題從約 9.4 分鐘變成 16.8 分鐘。如果是難修的問題,等久一點可能值得。它測的是特定的修補任務和 Codex 環境,不能直接推成每種開發工作都快 14.5 個百分點。
另一邊, Sugra 把六個錯誤藏進一個 Python 變更 ,請模型做程式審查。Codex 裡的 GPT-5.6 Sol 找到 6 個,GPT-6 Astra 找到 2 個。他們最後把 OpenAI 的審查模型改回 Sol。這個結果很刺眼,也只有一個變更、各跑一次,而且錯誤是刻意埋的;我會把它當成「審查工作一定要另測」的理由,不會拿來否定前面 Endor Labs 在修補任務上的成績。
Sol、Luna 才剛開放,公開心得更需要看做法。 BitsMinds 用 Codex 做三個視覺作品 :同樣的題目,每款每題只做一次,也不讓模型開瀏覽器或執行程式。Astra 三題總共花 70 分 48 秒;Sol 17 分 39 秒,Luna 21 分 41 秒。便宜的兩款交件快,但六份作品都有肉眼看得到的問題,例如交流道匝道沒接上道路、火箭動畫把火箭移出畫面。這是三道偏視覺的題目,評分也不是盲測;它呈現的是「交得快,還是要看成品」,不是一張能套用到所有程式工作的排行榜。
也有比較樂觀的回報。OpenAI 開發者社群的 merefield 用三道小型程式題
測 high 推理強度:GPT-6 Luna 三題都過,GPT-5.6 Luna 有一題失敗,重跑仍失敗;他算出的 API 等值成本,GPT-6 Luna 也比較低。這跟 Artificial Analysis 的 Coding Agent Index 方向不同,並不矛盾。三道短題和完整 Agent 工作測到的東西本來就不同,樣本也太少,還不能說 Luna 的程式能力已經全面反超。
長時間工作還有另一種痛點。 Brad Groux 整理自己六天的 Astra 使用紀錄 ,提到要重複提醒測試要求、指回已給的脈絡,還有交付時漏掉原本要求的工作。他把 538 次實質互動整理出 78 段修正歷程;這是一個人的工作流程,沒有用相同任務做 GPT-5.6 對照,也不能拿互動次數直接算失敗率。不過它提醒我:遇到長任務,最後仍要對照需求清單,而不是只看完成訊息寫得多肯定。
我會先換 Sol,Astra 與 Luna 看任務再上
如果目前的 GPT-5.6 Sol 工作流程跑得穩,我會先挑幾個固定案例試 GPT-6 Sol。它的程式開發分數小升、每題成本約減半,很適合先從一般開發任務驗證。遇到大型重構、長時間工具操作,或錯一次代價很高的工作,再把 Astra 拿出來。Luna 則留給範圍清楚、可以自動驗收的大量任務。
我不會把「GPT-6」當成整批替換的理由。特別是報告與跨模組程式修改,前面那些退步分數提醒我們:省下模型費用後,還得看驗收和返工要花多少。這筆帳,只有拿自己的案例跑過才算得清楚。