Tabbit部落格

GPT-6 Sol 評測:半價、更少犯錯、也更少回答

GPT-6 Sol 深度評測:智力與上代持平但價格減半,幻覺率從 92% 降到 60% 靠的是少答題;校準過的基準數據、社群 24 小時實測聲音,以及按工作負載的切換裁決。

本文目錄
  1. 核心結論
  2. 決定這篇評測的那個數字:靠少答題換來的準確率
  3. 基準數據,以及該信幾分
  4. GPT-6 Sol 真正好的地方
  5. 1. 事實性:更少的自信錯誤
  6. 2. Token 效率:安靜的帳單削減
  7. 3. 寫作與協作風格
  8. GPT-6 Sol 會咬人的地方
  9. 1. 棄答稅
  10. 2. 一部分社群把它讀成「Terra 換皮」
  11. 3. 發布週的平台摩擦
  12. 社群到底怎麼說
  13. 裁決:按工作負載選
  14. 讓 GPT-6 Sol 在你工作已經在的地方跑起來:Tabbit

如果你的工作負載是高用量編碼、自動化或以每任務成本定預算的 agent 迴圈,GPT-6 Sol 值得切換;如果你需要最高的知識工作上限,或者一個絕不半途放棄任務的 agent,那就先別動。半價費率卡是真的:輸入每百萬 token $2、輸出 $10,是 GPT-5.6 Sol 促銷價的一半——這是 2026 年 9 月 23 日在 OpenAI 模型卡上核對過的。但這篇評測真正有趣的地方不是價格,而是模型變準的方式:Artificial Analysis 測到它的幻覺率從 92% 降到 60%,同時它嘗試回答的問題比例從 99% 降到了 83%。精確地說,新的 Sol 是一個「更少回答」的模型。

這個交換正是發布社群吵翻天的焦點。發布 4 小時後,u/k8vinn 在 r/codex 開了一個討論串,問的正是這篇評測要回答的問題:「新 Sol 便宜了這麼多,我傾向於用它替代 Astra——只要它有 5.6 Sol 那麼好,用起來就沒問題。有真實使用評測了嗎?」("Any real world usage reviews yet?")(Reddit)

r/codex 討論串 How does GPT-6 Sol fare,徵求真實使用評測
r/codex,發布 4 小時後:在任何評測者給出答案之前,評測意圖本身先出現了。社群討論串,不構成模型行為證據。

GPT-6 Sol 費率卡我們另外拆解過,GPT-6 Sol 對 Claude Opus 5.5 的比較負責二選一問題,同門的 GPT-6 Astra 評測也已發布。這一篇負責裁決:GPT-6 Sol 哪裡真的變好了,哪裡會咬人,哪些工作負載該切、該留、該走。如果你想拿它處理真實網頁而不是測試基準,文末會給一條瀏覽器層的路線。

核心結論

  • 智力持平,價格減半。 Artificial Analysis 給出 GPT-6 Sol (max) 的 Intelligence Index 為 48——與 GPT-5.6 Sol 持平——每任務 $1.06 對 $1.99;費率卡從 $4/$20 降到 $2/$10。

  • 準確率提升是一場棄答交換。 AA-Omniscience 上幻覺率從 92% 降到 60%,代價是嘗試率從 99% 降到 83%,已答題目的準確率從 59% 微降到 54%。

  • Token 效率是安靜的升級。 Sol (max) 在 AA 全套測試裡生成 77M token,低於 88M 的中位數;實務工作者報告 Codex 任務對週配額的消耗小得多。

  • 它不是知識工作升級。 Sol 在 GDPval-AA v2.1 上跌了約 100 Elo;48 的 II 也低於 GPT-6 Astra(53)和 Claude Opus 5.5(58)。

  • 本週的平台現實很重要。 Sol 進了 ChatGPT Work 和 Codex,但沒進 Chat;訂閱用戶回報 6 代模型的 Plus 配額燒得飛快;走 Chat Completions 的 API 團隊在 reasoning_effort 高於 none 時沒有 function calling。

決定這篇評測的那個數字:靠少答題換來的準確率

基準測試給 GPT-6 Sol 的開場是聳肩:Artificial Analysis 的發布評註寫道「Intelligence Index 和 Coding Agent Index 與 GPT-5.6 持平,部分評估有進展,部分退步。」兩行之後,同一段文字給出了真正改變行為的數字:在知識與幻覺基準 AA-Omniscience 上,GPT-6 Sol (max) 的幻覺率從 92% 降到 60%,而實現方式是嘗試率從 GPT-5.6 Sol (max) 的 99% 降到 83%——答錯的大約少了四分之一,但已答題目的準確率從 59% 降到 54%Artificial Analysis,2026 年 9 月 23 日核對)。

翻譯成工程語言:OpenAI 用覆蓋率換了正確性。這個模型更少舉手,而且舉手時每次回答的準確率還比上代略低——但「自信地答錯」的總量塌縮了。OpenAI 自己的事實性評測講的是同一個故事:在使用者標記過錯誤的真實對話樣本上,「GPT-6 Sol 的錯誤數量大約是上代的一半,接近 Astra 級的可靠性」(官方公告)。注意 OpenAI 附帶的邊界:這些對話是篩出來「會誘發錯誤」的,不代表典型用量;分數也沒有控制長度。

這篇評測的每個判斷都按同一個問題分揀:你的成本是被「答錯」主導,還是被「答不出」主導?如果答錯代價高——程式碼審查、合規、給下游系統餵資料的擷取——棄答交換是實打實的升級。如果覆蓋率才是本職——agent 管線裡一次拒答就意味著卡死任務和永遠做不完的頁面——同一個設計就表現為退步。記住這根軸,裁決環節它還會回來。

基準數據,以及該信幾分

以下所有獨立資料來自 2026 年 9 月 23 日的同一次 Artificial Analysis 快照,並標注 effort 檔位——因為 effort 正是發布週比較裡最常見的作弊點。價格列來自 OpenAI 模型卡與同日發布的定價指南

維度GPT-6 Sol (max)GPT-5.6 Sol (max)GPT-6 Astra (max)Claude Opus 5.5 (max w/ fallback)這意味著什麼
API 價格,輸入/輸出每百萬$2 / $10$4 / $20(促銷至 11 月 21 日)$10 / $50$4 / $20Sol 輸入價與 Opus 5.5 持平,輸出只有它一半。
AA Intelligence Index48與 Sol 持平5358你買到的是更便宜的同檔智力,不是更多智力。
AA 每任務成本(II)$1.06$1.99$3.26$5.985.6 Sol 的一半、Astra 的三分之一、Opus 5.5 max 檔的約 18%。
幻覺率,AA-Omniscience60%92%未報告未報告頭條的準確率勝利。
同基準嘗試率83%99%……以及代價:它答得更少。
GDPval-AA v2.1(知識工作)較前沿約 −100 Elo未報告未報告1846 Elo(Anthropic 報告)別僱 Sol 做專家級知識工作。
輸出速度(AA 中位)131 tok/s未報告58 tok/s未報告中游:比 Astra、Fable 5.1 快,遠慢於 Flash 級。
上下文 / 最大輸出1.05M / 128K1M / 32K1.05M / 128K1M / 128K規格來自廠商模型頁;272K 計費門檻全家通用。

在相信任何一行之前,先潑三盆冷水:

  1. 廠商分數跑在自家 harness 上。 OpenAI 發布的 AutomationBench、Agents' Last Exam(Sol max 56.4%,成本只有 Opus 5 最佳的 40%)、DeepSWE(68.8% 對 Fable 5 的 69.9%,成本低約 80%)、OSWorld 2.0 offline(60.5% ≈ Opus 5 medium 的 60.3%,成本低約 80%)全部是自報成績;公告自己的腳註承認評測跑在「可能與生產 ChatGPT 輸出略有不同」的研究環境或 API 裡,競品分數取自公開報告。方向性有用,不是福音。

  2. 指數數值會漂移。 我們一天前發布的 GPT-6 Astra 評測引用的 AA Intelligence Index 還是 Astra 61.2、5.6 Sol 60.9;同一個追蹤器現在列的是 Astra 53、Sol 48。Artificial Analysis 會對指數做版本化重定基——只在同一次快照內比較模型,永遠不要跨週比。

  3. Effort 錯位是發布週的作弊碼。 Sol 公開的成績多是 max 檔;Opus 5.5 的頭條數字常是 medium 預設檔。任何不標明雙方檔位的「Sol 贏了/輸了」都是行銷。我們的比較文做了成本對齊版的那道數學。

基準在這裡是方向針,不是尺。這個階段更有分量的是真實任務的實測——而發布後 24 小時給出了一組出奇一致的訊號。

「價格減半、效能平平」是 r/codex 發布討論串幾小時內的最高讚評論:原 PO u/Rollertoaster7 一句「Half the price of 5.6 models. Performance increase appears marginal, more emphasis on the better pricing」(半價,效能提升看起來微乎其微,重點在更好的定價)拿了 240 讚,還有使用者直接引用了 AA 的好壞參半(Reddit)。獨立評測機構 Vals AI 從自己的基準得出同一個平台期:「GPT-6 Sol……在 Vals Index 排名第 8,與 GPT 5.6 Sol 大致持平,成本是一半」(X)。

Reddit 使用者 Rollertoaster7 的留言:半價,效能提升看起來微乎其微
r/codex 發布討論串:社群的校準直覺——價格是升級,效能是功課。發布日截圖。

GPT-6 Sol 真正好的地方

1. 事實性:更少的自信錯誤

棄答機制不只是基準現象——它在真實管線裡的樣子,是一個「會反駁而不是順著說」的模型。一位 Hacker News 使用者描述了把 Sol 當成另一個模型程式碼審查的「第二意見」:"i used it for code review and it flagged twenty issues, sol checked the review and found 75% of them were hallucinations. sol was much closer to reality."(我用它做程式碼審查:那個模型標了 20 個問題,Sol 複查後發現其中 75% 是幻覺,Sol 離現實近得多。)(HN)。單一軼事證明不了比率,但它與 AA 測量和 OpenAI「錯誤減半」的說法從三個獨立方向互相印證。如果你的工作負懲罰錯誤——審查、擷取、合規——這才是比任何指數分都重要的升級。

2. Token 效率:安靜的帳單削減

推理模型收兩次錢——一次是答案,一次是思考。Sol 在 AA 套件上的生成量為 77M token,低於 88M 的中位數;訂閱使用者也注意到同樣的「瘦」:r/codex 調侃「我的 Codex token 用量 < 黑洞」;X 上一位開發者量了一個 Blender/Three.js 任務:「只花了週配額的 2-3%……它的 token 效率我得說個好——和一天從 100% 燒到 40% 的吞 token 怪獸 Astra 相比,令人愉快」(X)。疊上費率卡,這就是為什麼 OpenAI 宣稱 Sol(xhigh) 在 AutomationBench 上以 Opus 5 (max) 每任務 9% 的成本勝出至少是可信的:更少的 token、更便宜的 token,正對自動化形狀的工作。

X 使用者 Chetan Ankola 回報 GPT-6 Sol 的 3D 任務只用了週配額的 2-3%
用週配額實打實度量的 Codex 任務:實務工作者反覆引用的 token 效率差。2026 年 9 月 23 日發布。

3. 寫作與協作風格

OpenAI 說 Astra 改進的溝通風格——「更清晰、更少行話」——延續到了 Sol;而這是罕見的在一天內就被獨立盲測印證的廠商聲明:How I AI 的盲測把「清晰的寫作、可讀的 PRD 和價格」列為 Sol 仍然勝出的地方(Lenny's Newsletter)。對那些程式碼之外還要交付文件的團隊——規格、PRD、審查紀要——這是沒有任何榜單列能捕捉的日常品質改進。

GPT-6 Sol 會咬人的地方

1. 棄答稅

上面每一條優點都有鏡像。一個只嘗試 83% 問題的模型,放進無人值守的 agent 管線,就是一個會交回 17% 空位的模型——每個空位都是一次卡死、一次重試或一次人工升級。AA 還量出了每答案的代價:已答題目的準確率從 59% 降到 54%;在度量「經濟價值知識工作」的 GDPval-AA v2.1 上,Sol 較前沿同行跌了約 100 Elo。知識工作的上限根本不是這個模型的目標。如果你的管線無法容忍拒答,從第一天就預留一個兜底模型。

2. 一部分社群把它讀成「Terra 換皮」

最尖銳的負面報告匯聚在同一主題:這是重新定價,不是換代。一位 Hacker News 開發者已經回退:"Update: Sol 6 is a heaping pile of garbage... I've switched back to 5.6 Sol. What they're selling as Sol 6 is really what would have been Terra before."(更新:Sol 6 是一堆垃圾……我換回了 5.6 Sol。他們當作 Sol 6 賣的東西,其實就是以前的 Terra。)(HN)。r/codex 上同一種直覺:「用過之後,它確實更笨。感覺更像 Terra。」測量的中間地帶是:指數在平均意義上持平,但「部分評估有進展、部分退步」意味著單個工作負載完全可能踩在退步的那一半上。如果你的 prompt 組合恰好落在退步的評估上,你的體感就會和平均數矛盾——兩邊都對,並不衝突。

3. 發布週的平台摩擦

三處現實摩擦會給本週的切換降溫。第一,可用性:Sol 進了付費方案的 ChatGPT Work 和 Codex,但還沒進 Chat,Free/Go 使用者只有 GPT-6 Luna(官方公告)。第二,訂閱經濟學:一位 Plus 使用者回報「它幾分鐘就燒穿了我的 Plus 用量,而 5.6 我能悠哉用幾小時。它會在一個簡單提示上空轉幾分鐘,然後在用量限制前放棄」(HN)——API 降價了,推理 token 照樣燒配額。第三,API 面:在舊的 Chat Completions 端點上,function calling 只在 reasoning_effort: none 下可用——工具呼叫工作流請走 Responses API——並且不支援微調(模型卡)。如果你因為用量行為留在 5.6 Sol,注意它的促銷價至少持續到 2026 年 11 月 21 日,我們的 1M 上下文設定指南也仍然適用。

Hacker News 使用者 bradly 的留言:GPT-6 幾分鐘燒穿 Plus 用量,5.6 Sol 能用幾小時
訂閱側的稅:API 降價了,推理 token 照樣燒配額。Hacker News,發布日。
Hacker News 使用者 cmrdporcupine 的留言:換回 5.6 Sol,稱 Sol 6 其實是以前的 Terra
24 小時內最尖銳的裁決:回退 5.6 Sol,外加 Terra 換皮理論。措辭激烈,單一回報者。

社群到底怎麼說

24 小時的社群訊號沿著第二節的那根軸乾淨地分成兩半——而不是按技術水準或資深程度。

Reddit 留言區兩極分化:Pretty good Wayyyyyyy cheaper 與 definitely dumber feels more like Terra
同一個討論串,相反的裁決:便宜就是升級對上像 Terra,前後只差幾小時。r/codex,發布日。

陣營一:「半價就是升級。」 "Pretty good. Wayyyyyyy cheaper."(好得很,便宜太多了。)(u/Nakayamaguci13)。"Literally almost half usage and smarter by most credible benchmarks"(用量幾乎減半,多數可信基準還更聰明)(u/Final-Voice4738)。觀望的大多數把 r/codex 串頂到 159 讚:"Price cuts is what we want, now lets see if it translates to better usage, going for 6-Sol"(降價就是我們要的,接下來看它能不能轉化為更好的使用體驗,我上 6-Sol 了)(u/commandedbydemons)。

陣營二:「這是重新定價,不是繼任者。」「它確實更笨。感覺更像 Terra。」(u/ElonsBreedingFetish)。"According to AA,效能反而更差了。"(u/Oxi_Dat_Ion)。cmrdporcupine 的回退是這個陣營最重的表態,見上文。

中間派握著真正的資訊。 Hacker News 的 u/mchusma 說出了大多數團隊面對的真實比較:"I personally am preferring Opus 5.5 at medium over GPT-6 Sol Max, in very very early tests. Similar price range, more capability."(非常早期的測試裡,我個人更偏好 medium 檔的 Opus 5.5 而不是 max 檔的 GPT-6 Sol。價位相近,能力更多。)(HN)。

Reddit 留言解釋 Luna Terra Sol Astra 的命名層級,並調侃 Codex 的 token 用量小於黑洞
社群預設的家族層級——Luna < Terra < Sol < Astra——以及那條成為熱評的 token 效率笑話。
Reddit 使用者 commandedbydemons 的留言:降價就是我們要的,我上 6-Sol 了
觀望的大多數:為降價買單,稽核使用體驗。發布討論串熱評。
Hacker News 使用者 mchusma 的留言:早期測試更偏好 medium 檔 Opus 5.5 而非 max 檔 GPT-6 Sol
Effort 感知的中間立場:切換之前,先把 Opus 5.5 的預設檔和 Sol 的天花板檔放在同一張桌上比。Hacker News,發布日。

我們的編輯判斷:兩個陣營描述的是同一個設計選擇,只是站在各自的工作負載一側。答錯代價高的地方,Sol 比上代顯得更聰明;覆蓋率珍貴的地方,它顯得更笨。基準說「持平」,而兩個陣營都對——各自對上了平均值屬於自己的一半。

裁決:按工作負載選

你的工作負載最佳選擇理由注意
高用量例行自動化、預算敏感的 agent 迴圈GPT-6 SolxhighAutomationBench 上以 Opus 5 (max) 每任務 9% 的成本勝出;xhigh 檔約 $0.53/任務上下文壓在 272K 計費懸崖之下;快取窗口 30 分鐘
日常編碼與「第二意見」程式碼審查GPT-6 SolhighmaxFrontierCode 與 Fable 5.1 xhigh 持平且成本低得多;能揪出幻覺結論給棄答留兜底路徑;引用要核驗
30 分鐘以上的頑固自我除錯、長時程自主GPT-6 Astra溢價買的就是頑固——見 Astra 總覽Astra 評測每任務成本 3 倍以上;高 effort 下首字延遲拉長
專家知識工作:法律、金融、深度分析Claude Opus 5.5Sol 在 GDPval 上跌約 100 Elo;Opus 以 58 領跑 II每任務成本最高;max 檔話多
ChatGPT 端的日常聊天暫留 5.6(免費檔 Luna,Plus 用 5.6 Sol)Sol 還沒進 Chat;6 代配額燒穿是真的留守則促銷價1M 上下文設定仍然適用
跨即時瀏覽器分頁的研究與自動化Tabbit + Sol(出現在你的選擇器時)模型就貼著你的分頁和檔案跑——見下文可用性取決於帳號的模型選擇器

一句話裁決:把自動化和編碼的預算切到 GPT-6 Sol;不要切知識工作的上限和無人值守的長時程 agent。它就是你一直在向 OpenAI 購買的同一檔智力,標價減半,附帶一種新性格:寧可留下一個不回答的問題,也不願意答錯。就照這份職位說明書僱它。下單預算前再注意一行小字:每一句「便宜 50%」用來對比的 GPT-5.6 基準價,都是至少持續到 2026 年 11 月 21 日的促銷價。

讓 GPT-6 Sol 在你工作已經在的地方跑起來:Tabbit

成績單不是瀏覽器工作流。真實的工作——研究、比價、擷取、審查——散落在二十個開啟的分頁、本機檔案和網頁應用裡,裸 API 呼叫一個都看不見。手動把 Sol 接進去,意味著把頁面內容複製進提示詞、自己管理上下文視窗,每次都重搭一遍管線。

這正是 Tabbit 瀏覽器在一篇模型評測裡值得佔據一節的原因。Tabbit 是一款 agentic AI 瀏覽器,讓模型工作流直接跑在你的瀏覽上下文上:跨分頁研究、agentic 推理與深度研究任務、跨即時頁面的自動化。當 GPT-6 Sol 出現在你帳號的模型選擇器裡,這些工作流可以直接指向它,不用寫任何編排程式碼——而且可以按任務切換更便宜或更強的模型,這恰好是一台「半價、智力持平」的模型最獎勵的使用紀律。

兩條誠實的邊界:Tabbit 內的模型可用性取決於你的連動帳號和方案——圍繞 Sol 搭工作流之前先看選擇器;用戶端不改變 OpenAI 的計費,$2/$10 的費率卡怎麼都是那張。想看這個模型在實務中到底被怎麼用,可以瀏覽 GPT-6 Sol 模型頁 (简体中文)提示詞目錄 (简体中文)和社群評測證據庫 (简体中文)

準備好讓 GPT-6 Sol 跑在你自己的分頁上,而不是基準裡了嗎?

Tabbit Browser

常見問題

GPT-6 Sol 比 GPT-5.6 Sol 更強嗎?

獨立測量顯示兩者智力大致持平:Artificial Analysis 給出 GPT-6 Sol (max) 的 Intelligence Index 為 48,與 GPT-5.6 Sol 持平,但每任務成本減半($1.06 對 $1.99)。GPT-6 Sol 在 AA-Omniscience 上的幻覺率從 92% 降到 60%,但實現方式是只嘗試 83% 的問題(上代為 99%)。這個交換是否划算,取決於你的情境裡答錯和答不出哪個代價更大。

GPT-6 Sol 為什麼拒答或跳過更多問題?

Artificial Analysis 把幻覺率改善歸因於棄答:GPT-6 Sol (max) 在 AA-Omniscience 上只嘗試 83% 的問題(GPT-5.6 Sol 為 99%),答錯的少了,但已答題目的準確率也從 59% 降到 54%。在 agent 管線裡,棄答通常表現為任務卡死或升級人工,所以應該預留兜底路徑,而不是把拒答當成失敗。

GPT-6 Sol 每個任務多少錢?

在 Artificial Analysis 的 Intelligence Index 上,GPT-6 Sol max 檔每任務約 $1.06;同一張 $2/$10 費率卡上,effort 從 low 到 max 的成本階梯約為 $0.13 到 $1.06,光調 effort 就能讓成本擺動約 8 倍。完整費率、快取規則和 272K 長上下文門檻見我們的 GPT-6 Sol 定價指南。

GPT-6 Sol 和 GPT-6 Astra 怎麼選?

高用量編碼、自動化和成本敏感的 agent 迴圈選 GPT-6 Sol;長時程自主任務、需要頑固堅持的場景選 GPT-6 Astra。Sol 的 AA Intelligence Index 是 48,Astra 是 53,但 Sol 每任務成本約為 Astra 的三分之一;兩者共用 272K 長上下文計費門檻。什麼時候值得為 Astra 付溢價,見我們的 GPT-6 Astra 評測。

GPT-6 Sol 在 ChatGPT 裡能用嗎?

Chat 端還沒有。發布時 GPT-6 Sol 面向 Plus、Pro、Business、Enterprise 和 Edu 用戶在 ChatGPT Work 與 Codex 中可用,Free 和 Go 用戶在桌面端拿到的是 GPT-6 Luna。OpenAI 說 Chat 端會逐步放量,API 側模型 ID 是 gpt-6-sol。把工作流押上去之前,先在自己的方案模型選擇器裡確認。

能在 Tabbit 瀏覽器裡用 GPT-6 Sol 嗎?

Tabbit 瀏覽器支援跨分頁、本機檔案和即時網頁的多模型工作流,當你的帳號或 API 權限包含 GPT-6 Sol 時,它會出現在模型選擇器裡。可用性取決於帳號,使用用戶端也不會改變 OpenAI 的計費。下載前可以先在 GPT-6 Sol 提示詞目錄裡瀏覽任務配方。

下一步

讓 Tabbit 與你並肩工作。

跨分頁調研、自動化重複的瀏覽器工作,讓每一處上下文都觸手可及。