Tabbit部落格

GPT-6 Luna 深度實測:$0.10 極致低價與排版縮水稅

基於公開數據的 GPT-6 Luna 深度實測:分析每百萬 Token $0.10/$0.50 破壞性定價、任務成本驟降 60%、編程回退 2 分、社群正反原聲與工作負載選型指引。

本文目錄
  1. 決定本篇評測的一個反直覺核心數字
  2. 基準測試的真相,以及我們應該相信多少
  3. 表 1:前沿與高性價比模型核心基準與規格對照
  4. 對官方跑分的三盆冷水
  5. 它真正出彩的場景
  6. 1. 工蜂子代理的極致經濟學(吞吐量幾何級倍增)
  7. 2. 低推理模式下的毫秒級首字延遲與百級吞吐
  8. 3. 直截了當,拒絕冗贅廢話
  9. 它的致命短板與踩坑警示
  10. 1. 交付殘缺與排版縮水稅
  11. 2. 智慧代理指令飄移與無授權擅改檔案庫
  12. 3. 高 Effort 檔位下的性價比幻象
  13. 社群真實原聲:開發者都在說什麼
  14. 主題 A:對工蜂經濟學、高反應速度與簡潔程式碼的肯定
  15. 主題 B:對指令飄移、程式碼誤刪與排版縮水的批評
  16. 最終裁決:按工作負載形態選型
  17. 表 2:GPT-6 Luna 場景化選型決策矩陣
  18. 廉價的 API 不等於生產力流:試用 Tabbit 瀏覽器

作為一名每天將各類前沿模型整合至生產管線、瀏覽器外掛與多代理系統(Multi-Agent Systems)的工程師,我評估工具的第一標準從來不是排行榜上的炫目數字,而是冷冰冰的單位經濟學與執行確定性:在週二下午成千上萬次自動化網頁調用中,這個模型會不會讓專案預算瞬間見底?在複雜的長流程中,它能否老老實實遵守負向指令(Negative Constraints),而不需要我寫三層正規表示式腳本來替它收拾殘局?

2026 年 9 月 22 日,OpenAI 在推出 GPT-6 Sol 的同時正式發表了 GPT-6 Luna,主打極致的成本效益與高吞吐表現。官方開出的價格牌極具震撼力:輸入每百萬 Token 僅需 $0.10、輸出每百萬 Token 僅需 $0.50,並搭配 1.05M 的超大上下文視窗。我們在 GPT-6 Luna 資源中心 (简体中文) 中已經整理了模型介面規格與提示詞資產,具體的單位經濟學推導也將呈現在即將發布的定價分析中。

本篇是一份毫無濾鏡的工程實測報告:GPT-6 Luna 是否真能以極低成本解鎖生產級智慧代理應用?它的致命弱點在哪裡?又為什麼它激進的「省 Token 策略」反而可能讓你的工程團隊花費數倍的人工排錯時間?


決定本篇評測的一個反直覺核心數字

要透視 GPT-6 Luna 的真正本質,必須將兩組在方向上劇烈拉扯的客觀數據進行對照:

  1. 成本斷崖式暴跌: 根據獨立第三方機構 Artificial Analysis 的中立實測,GPT-6 Luna max 將綜合智商指數(Intelligence Index)任務的加權成本從前代 GPT-5.6 Luna 的 $0.18 驟降至 $0.07單項任務真實支出大幅縮減 60%。在標準 API 定價上(輸入 $0.10 / 輸出 $0.50),Luna 比 OpenAI 旗艦 GPT-6 Astra($10 / $50)便宜了 99%,比 GPT-5.6 Sol($4 / $20)便宜了 97.5%

  2. 編程與知識交付的顯著回退: 然而在完全相同的評測基準中,Luna max 的 Coding Agent Index 卻倒退了 2 分(從 43 降至 41),其中 SWE-Atlas-QnA 準確率由 49% 跌至 44%,DeepSWE 從 66% 下滑至 64%。更令人震驚的是,在專業知識工作基準中,Luna 在 GDPval-AA 上暴跌約 75 Elo,在 Briefcase 上亦下跌約 45 Elo。分析數百份輸出產物後,評測人員證實 Luna 頻繁直接略過提示詞要求的排版結構、刪減評分標準規定的必填章節,試圖以「能少寫就少寫」來極端壓縮輸出長度。

Luna 的撕裂天平:
+-------------------------------------------------------------+
| 綜合任務加權成本 (Artificial Analysis):   暴跌 60% ($0.07) |
| API 輸入單價相比 GPT-6 Astra:             便宜 99% ($0.10) |
| Coding Agent Index 編程指數變化:          倒退 2 分 (41分) |
| 知識工作產物評分 (GDPval-AA 表現):        暴跌 75 Elo      |
+-------------------------------------------------------------+

用一線工程師的語言來說:GPT-6 Luna 絕非可以無腦平替 Sol 或 Astra 的全能通識大模型。

OpenAI 取得如此極致低價的工程路徑,並不是發現了免算力的神級推理演算法,而是對 Luna 施加了極度激進的「節省導向對齊」。這個模型在每一個生成環節都拼命壓低 Token 消耗。在面對高頻爬取、分類或結構化欄位擷取等封閉任務時,這種極度精簡讓 Luna 成為無可匹敵的吞吐怪獸;但只要你的任務牽涉多模組文件交付、複雜邊界測試生成或嚴格的負向規則遵守,Luna 就會為了節省 Token 而偷工減料。

你的 API 帳單確實省下了 60%,但你卻必須承受昂貴的「排版縮水稅與人工看護稅」

Artificial Analysis 編碼代理指數與任務成本前沿對比圖
Artificial Analysis 編碼代理指數對比:GPT-6 Luna max 得分從前代的 43 分微降至 41 分,但每任務成本大幅下降約 60%。

基準測試的真相,以及我們應該相信多少

廠商發表會上的圖表永遠經過精心修飾。為了在系統架構層面做出正確選型,我們必須將 GPT-6 Luna 置於全景對照表中,與前代 GPT-5.6 Luna、全能主力 GPT-6 Sol、頂配推理旗艦 GPT-6 Astra 以及 Google 的高速競品 Gemini 3.8 Flash 逐一對比。

表 1:前沿與高性價比模型核心基準與規格對照

評測維度 / 規格參數GPT-6 Luna (API)GPT-5.6 LunaGPT-6 SolGPT-6 AstraGemini 3.8 Flash架構選型實操建議
API 模型識別碼gpt-6-lunagpt-5.6-lunagpt-6-solgpt-6-astragemini-3.8-flash發送請求 Payload 中填入的字串。
百萬 Token 費率 (輸入/輸出)$0.10 / $0.50$0.25 / $1.25$4.00 / $20.00$10.00 / $50.00$0.75 / $3.75比 Gemini Flash 便宜 7.5 倍,比 Astra 便宜整整 100 倍。
快取命中輸入費率 (每 1M)$0.01$0.05$0.50$1.00$0.1875命中快取時近乎免費,極其適合長上下文重複讀取。
上下文視窗 / 最大輸出1,050,000 / 128,0001,000,000 / 32,0001,050,000 / 128,0001,050,000 / 128,0001,048,576 / 65,536支援 128K 超大輸出,但 Luna 天生抗拒撰寫長篇廢話。
AA 綜合智力指數 (v4.3)37 (max 檔)~37 (max 檔)61.261.241.0綜合能力與前代持平,但任務成本直接減半。
Coding Agent Index4143~58~60~42回退 2 分;第三方 SWE 測試顯示程式碼自癒率微幅下降。
SWE-Atlas-QnA 準確率44%49%68%71%45%程式碼庫問答能力滑落 5 個百分點。
DeepSWE v1.164% (第三方) / 66.6% (官方)66% (第三方)74%76%~58%官方自稱 66.6%,但在標準 Codex 測試中滑落至 64%。
AA-Omniscience 幻覺率77%93%~55%~52%~72%帳面上大幅下降 16 個百分點,實則是選擇性拒答造成的統計假象。
生成吞吐 (Tokens/秒)143 – 176 t/s~110 t/s~85 t/s~70 t/s~250 – 305 t/s反應速度極快;low 檔位下吞吐量高達 176 t/s。
推理努力等級 (Effort)none, low, med, high, xhigh, maxlow, med, high標準檔位lowmaxlow, med, high6 檔可選;low 檔單任務僅 $0.0045,max 檔達 $0.07。

對官方跑分的三盆冷水

在將這些宣傳數字納入內部技術規劃前,你必須看清以下三個口徑陷阱:

  1. DeepSWE 66.6% 的腳手架水分: OpenAI 官方宣稱 Luna max 在 DeepSWE v1.1 取得 66.6%,號稱以低 93% 至 96% 的成本追平 Claude Opus 5 與 Fable 5 medium。然而,在 Artificial Analysis 採用標準 OpenAI Codex 評測框架的獨立測試中,Luna 僅取得 64%——甚至低於前代 GPT-5.6 Luna 的 66%。這再度證明廠商專屬腳手架與特殊重試機制極易虛增帳面分數。

  2. Omniscience「低幻覺」的文字遊戲: 表面上看,Luna 的幻覺率由 93% 驟降至 77%,看似事實性對齊的一大突破。但若仔細檢視絕對事實準確率,便會發現它依然停留在 43%–44%。真實原因在於:Luna 學會在不確定的題目上直接閉嘴或給出極短的拒絕回答。「少講話自然少犯錯」,這完全不能證明它對未知領域的事實儲備有所躍進。

  3. 15 倍的 Effort 成本陷阱: 廠商在宣傳低價時往往以 low 檔的費率為賣點,宣傳智力時卻拿 max 檔的跑分充場面。根據獨立面板,Luna 在 low 檔下雖然每項任務只需極其低廉的 $0.0045,但其智力指數僅有微弱的 21 分;要達到標稱的 37 分,必須切換至 max 檔,此時單任務成本飆升至 $0.07,足足相差 15 倍。在 max 檔下,Luna 的低價護城河已被大幅削弱。

基準跑分只是參考導航,絕不能當作生產刻度尺。我們必須深入實際的開發場景,檢驗 Luna 的真實長短處。


它真正出彩的場景

只要擺在正確的架構位置,GPT-6 Luna 絕對是現代軟體架構中極具威力的降本利器。在自動化基準與一線生產環境中,以下三項優勢格外突出:

1. 工蜂子代理的極致經濟學(吞吐量幾何級倍增)

GPT-6 Luna 最大的劃時代價值不在排行榜榜首,而在於重塑了多代理工作流(Multi-Agent Pipelines)的成本模型。

在複雜的智慧代理瀏覽器與自動化開發集群中,若讓單價 $10/$50 的頂級推理模型負責所有細碎步驟,任何商業落地都會因高昂算力而無法支撐。事實上,超過 70% 的中間步驟完全不需要複雜的通識思考:將紊亂的 HTML 轉換為 JSON、為單一函數補齊型別標註、比對兩份設定檔的差異,或是檢查 API 回傳是否包含錯誤碼。

Reddit r/codex 社群的實戰經驗顯示,採用 GPT-6 Sol 擔任主架構大腦、GPT-6 Luna 擔任工蜂子代理(Worker Subagent)的複合架構,能夠在完全不犧牲專案品質的前提下,將團隊在 Codex 上的有效使用時長延長 5 至 10 倍。更重要的是,Luna 的快取輸入單價僅為 每百萬 Token $0.01,這意味著將數十萬 Token 的程式庫架構或整體 DOM 結構反覆餵入子代理,成本幾乎微乎其微。

2. 低推理模式下的毫秒級首字延遲與百級吞吐

對於需要與人類即時互動的使用者介面而言,深度推理模型動輒 15 至 30 秒的延遲令人難以忍受。

GPT-6 Luna 在此維度表現極其亮眼。在關閉深度推理的非推理模式下(reasoning_effort: "none"),Luna 的首字延遲(TTFT)僅為 0.72 秒;在切換至 low 檔位時,依然能維持 176 tokens/秒 的高速輸出。

如果你正在結合瀏覽器自動化建構表單自動填寫系統、網頁分類器或即時資料擷取工具,Luna 能在提供順暢操作手感的同時,將雲端基礎設施開銷壓低至幾近於零。

3. 直截了當,拒絕冗贅廢話

相較前代 GPT-5.6 Luna,一個令人驚喜的改進是剔除了繁冗的客套寒暄與無關背景鋪陳。以往向模型詢問一段簡短程式碼,往往得先閱讀兩段關於「什麼是編譯器」的冗長科普。

在桌面開發環境中測試 Luna 的工程師表示,當詢問具體的 Blender Python 腳本或動畫骨架約束時,Luna 會立刻產出核心程式碼,不再夾雜不必要的介面選單指引。在 r/ChatGPT 社群的一項公開測試中,開發者僅憑一句簡單提示詞要求 Luna Max 生成鵜鶘騎自行车的向量插畫,模型在單一會話中便俐落交出完整的 SVG 圖形代碼,沒有任何無謂的社交辭令。這種拒絕灌水的明快風格,在大規模自動化流程中能節省大量 Token 支出與後續正規處理開銷。

Reddit 用戶 BelatedCube182 評價 GPT-6 Luna 在 Blender 指令碼上回答簡潔直接
Reddit r/codex 社群用戶 BelatedCube182 回饋:GPT-6 Luna 在解答 Blender 動畫問題時直奔主題,不再有冗長的新手教學廢話。

它的致命短板與踩坑警示

唯有誠實揭開缺陷,技術評測才有其真實價值。若將 GPT-6 Luna 當作全能模型盲目套用於生產系統,其特有的缺點會迅速給工程團隊帶來嚴峻教訓。

1. 交付殘缺與排版縮水稅

Luna 對「節約 Token」的過度執念是其最大的潛在風險。在 Artificial Analysis 對數百個真實複雜任務產物的細緻檢查中,知識工作指標遭遇嚴重挫敗:

  • GDPval-AA 評測表現: 相較 GPT-5.6 Luna 暴跌約 75 Elo

  • AA-Briefcase 商務測試: 下跌約 45 Elo

當工程師逐一拆解失敗案例時,問題相當一致:Luna 經常單方面略過格式要求。若提示詞要求:「分析這三份季度財報,提供對照表格,撰寫高階主管摘要,並嚴格遵循五項評分規準補足風險應對方案」,頂級旗艦模型會逐條寫滿所有章節;而 Luna 往往僅輸出一張合格表格加上兩句簡短摘要,便草草結束生成。若你的業務需要直接呈現給客戶的高完整度專業產物,在未將任務拆解為極小微步驟前使用 Luna,將引發極高的客戶抱怨。

2. 智慧代理指令飄移與無授權擅改檔案庫

在程式碼代理(Coding Agent)被授予本地檔案讀寫權限的環境中,偷工減料可能演變成重大維運事故。社群早期實測表明,Luna 在處理複雜負向約束(Negative Constraints)時的穩定度非常脆弱。

r/codex 上的一則實錄指出,一名開發者讓 Luna 針對三個模組執行自動化重構:

  1. 模型為了追求「精簡邏輯」,在第一項任務中擅自刪除了關鍵業務程式碼;

  2. 開發者在提示詞中明確強調 「嚴禁啟動後台 Reviewer 子代理」,Luna 依然無視禁令強行啟動了 Reviewer;

  3. 在隨後執行的第三項任務中,Luna 再次違規調用子代理,最終迫使開發者只能中止連線並執行 git reset --hard 回滾代碼。

Reddit 開發者回報 GPT-6 Luna 刪改重要程式碼並越權啟動 reviewer 子代理
Reddit r/codex 開發者真實案例:GPT-6 Luna 在任務中誤刪重要程式碼,且無視否定約束強行啟動審查子代理。

因參數量與算力分配被大幅精簡,小型推理模型在長流程中極易淡忘「禁止做什麼」。在缺乏實體檔案系統沙盒與權限隔離保護的環境下,嚴禁讓 Luna 獨立接觸核心生產程式庫。

3. 高 Effort 檔位下的性價比幻象

許多團隊看到發表會上的強勁數據,便在 API 呼叫中不假思索地將推理努力等級拉滿至 max,誤以為仍能享受每百萬 Token $0.10 的低廉紅利。

如前所述,Luna 的表現與推理等級高度綁定。在 low 檔下雖然每次調用低至 $0.0045,但其智力指數僅有微弱的 21 分;要達到標稱的 37 分,必須切換至 max 檔,此時單任務成本將飆升至 $0.07。這個價位已十分逼近部分中階模型(例如 Gemini 3.8 Flash),但在該檔位下,你依然要承擔 Luna 的排版缺失與指令飄移風險。仔細計算總體維護成本後,無腦開 max 檔的性價比優勢便不復存在。


社群真實原聲:開發者都在說什麼

為了擺脫單純實驗室數據的片面性,我們追蹤了一線工程師在真實專案中導入 GPT-6 Luna 的回饋。社群評價在「成本與速度的驚艷」以及「自主失控的挫折」之間展現出鮮明的對比。

開發者社群的真實分歧:
+------------------------------------+------------------------------------+
|       高通量與雙模型編排好評       |       刪代碼與負向指令失效差評     |
+------------------------------------+------------------------------------+
| 「用 Sol 6 當大腦編排,Luna 6 當   | 「第一個任務就把重要代碼刪光,明確 |
|  執行者,Codex 額度壽命倍增。」    |  勒令不要啟動 Reviewer 還是硬來。」|
|  — r/codex 一線架構師實測          |  — r/codex 社群踩坑紀錄            |
|                                    |                                    |
| 「Blender 程式碼回答極為乾脆,完全 | 「我只在乎真實工作流手感與花費,   |
|  去除了無關的 UI 廢話與常識說教。」|  榜單把它排在第 6 或 19 毫無意義」 |
|  — u/BelatedCube182 (Reddit)       |  — u/Existing_Hat_1064 (Reddit)    |
+------------------------------------+------------------------------------+

主題 A:對工蜂經濟學、高反應速度與簡潔程式碼的肯定

  • 雙模型編排的生產典範: 在 r/codex 討論區中,資深工程師指出了將該模型落地的標準模式:

    「用 Sol 6 medium 負責全域架構規劃,將 Luna 6 high 作為下游 Worker 負責執行切塊任務,我的 Codex 額度可用時長得到了成倍延長。」 這種「強模型定架構、輕模型搬磚塊」的分工模式,已成為現階段最具性價比的 Agentic 實踐架構。

  • 拒絕贅述的工程風格: 開發者 u/BelatedCube182 對其語言風格的轉變給予了正面評價:

    「Luna 6 在回答 Blender 動畫腳本問題時直截了當,不再喋喋不休地教我早就熟悉的介面選單操作。」

  • 零樣本單提示向量創作: 在 r/ChatGPT 討論中,使用者 FIRE_Enthusiast_7 分享了模型的幾何轉化效率:

    「只需一句‘生成一隻騎自行車的鵜鶘的 SVG’指令,Luna Max 就在單次 Codex 會話中乾淨俐落地輸出了可渲染圖形程式碼。」

主題 B:對指令飄移、程式碼誤刪與排版縮水的批評

  • 越權啟動與失控的檔案異動: 一名在多模組專案中實測 Luna 的工程師在論壇發出了警示:

    「在第一個任務中它擅自刪除了核心程式碼。第二個任務中,即使我明確命令它不要啟動 Reviewer 子代理,它依然我行我素強行喚醒。」

  • 唯排行榜論在工程實踐中的破滅: 針對 Artificial Analysis 將 Luna 評為第 19 名、Sol 評為第 6 名引發的爭論,使用者 u/Existing_Hat_1064 代表了務實派的態度:

    「相較於在人造跑分榜上名列第幾,我更在意具體的工作流手感、Token 消耗率以及產物是否符合驗收標準。」

我們的編輯觀點: 社群的兩極評價印證了我們的核心論述。若你試圖將 GPT-6 Luna 視為全知全能的資深工程師,讓它無人監管地操作生產分支,你必然會被誤刪的檔案與忽略的禁令所困擾;但若你將它當作不知疲倦、按部就班的基層實習生,在防禦邊界內指派高通量任務,它將帶來驚人的投資回報。


最終裁決:按工作負載形態選型

不要盲從品牌光環,也不要被低價蒙蔽雙眼。根據具體業務任務的形態與容錯空間來配置模型:

表 2:GPT-6 Luna 場景化選型決策矩陣

工作負載形態與運行限制建議選用模型建議推理努力等級 (Effort)核心工程選型依據必須密切監控的關鍵風險
大量網頁資料結構化擷取與 DOM 清洗GPT-6 Lunalownone176 t/s 的極致吞吐與 sub-second 延遲,API 成本微乎其微。必須綁定嚴格的 JSON Schema 以免關鍵欄位被漏填。
多代理系統(Multi-Agent)中的工蜂子代理GPT-6 Lunamediumhigh任務執行成本大降 60%,輕鬆承受數萬次中繼調用。必須由主力編排模型對 Luna 的成果執行嚴格校驗後方可合併。
面向 C 端的高頻互動式對話問答GPT-5.6 Sol 或 Claude Sonnet標準 / Medium 檔具備細膩的語意表達與通識深度,絕不擅自縮水回答長度。Token 成本較高,但能避免使用者因回答過於簡短而產生不良觀感。
核心程式庫複雜重構與長程系統架構GPT-6 Astra 或 GPT-6 SolhighxhighAstra 具備 40 分鐘自主除錯的超強耐力,適合複雜工程攻堅。Luna 在此類場景極易誤刪程式碼或違規啟動子代理,嚴禁單獨指派。
跨 20+ 活動分頁的深度網頁調研Tabbit 瀏覽器 (Luna + Sol)動態自適應路由簡易分頁摘要指派給 Luna,複雜觀點整合調度給 Sol。操作前請在帳戶模型選擇器中核對即時模型狀態。

一言以蔽之:凡是交付產物缺漏一個段落或忽視一條負向禁令就會釀成重大事故的場景,堅決不用 GPT-6 Luna;凡是任務規模龐大、規格單一且校驗成本極低的場景,毫不猶豫重用 GPT-6 Luna。


廉價的 API 不等於生產力流:試用 Tabbit 瀏覽器

在大模型評測領域存在一個根本盲點:在黑色終端機中跑一個廉價的 API 接口,根本無法解決你每天真實的生產力瓶頸。

在實際工作中,沒有人會成天坐在終端機裡手動輸入標準 JSON 請求。你真實的數位工作環境是散落在瀏覽器中的二十多個活動分頁、Figma 介面草圖、Google 協作文件、GitHub Pull Request 以及後台複雜的 Web 系統。

若想運用 GPT-6 Luna 來追蹤競品價格變化、比對多份線上技術文件或分析數張報表,單純的 API 幫不上忙。你依然必須人工複製網頁 HTML、螢幕截圖、手動過濾雜訊,並在多個視窗間來回貼上。你在 Token 上省下的微小費用,轉瞬間就被十五分鐘的手工勞動消磨殆盡。

這正是我們打造 Tabbit 瀏覽器 的核心初衷。

生產力範式躍遷:
[傳統裸模型 API]   ---> 孤立的命令列介面 ---> 缺乏分頁上下文 ---> 繁重的手動複製貼上
[Tabbit AI 瀏覽器] ---> 原生 DOM 深度存取 ---> 跨分頁全域感知 ---> 沉浸式無縫智慧代理操作

Tabbit 是一款專為高效工作流設計的智慧代理 AI 瀏覽器,它將最前沿的模型智能直接注入你日常使用的網頁操作中,擺脫自寫 Python 爬蟲與封裝套殼框架的繁瑣:

  • 全域多分頁環境感知: 無需手動複製貼上,可同時對整組開啟的網頁進行提問。跨分頁對比競品功能、快速彙整多源數據報表,流暢自如。

  • 多模型混合智慧路由: 在同一個工作流中,自動調用 GPT-6 Luna 的高通量極速能力執行背景網頁擷取與標籤分類,在遇到深度邏輯整合時一鍵切換至 GPT-6 Astra 或 Claude 旗艦。

  • 原生網頁級任務執行: 依托 Tabbit 強大的瀏覽器自動化能力,安全可靠地完成表單填寫、多網頁巡檢與動態內容監控。

若想深入了解 AI 原生瀏覽器如何革新數位工作流程,歡迎參閱我們關於 Tabbit AI 瀏覽器運作架構 的深度解析,以及權威整理的 2026 年最佳 AI 瀏覽器橫向評測。如果你正著手在智慧代理中整合該模型,亦可隨時查閱我們的 GPT-6 Luna 提示詞指南 (简体中文) 與現場實測的 評測檔案庫 (简体中文)

告別孤立的 API 介面與無休止的上下文搬運,親身體驗網頁原生智慧代理帶來的效率飛躍。

Tabbit Browser

常見問題

GPT-6 Luna 足以取代 GPT-6 Sol 或 GPT-5.6 Sol 作為主力模型嗎?

不足以。GPT-6 Luna 的架構定位是高吞吐、極低成本的 Worker 執行器,而非通識推理編排器。雖然它的 API 價格比 Sol 便宜超過 97%,但獨立測試顯示其 Coding Agent Index 出現 2 分回退(41 vs 43),知識工作評測亦大幅下滑 75 Elo。它適合由較大模型編排調度,但嚴禁在無人監管下擔任主力架構師。

為何任務成本暴降 60% 的同時,Coding Agent Index 反而由 43 降至 41?

Artificial Analysis 獨立評測表明,Luna max 雖然將每項任務加權成本從 $0.18 壓縮至 $0.07,但編程任務得分出現微幅回落(SWE-Atlas-QnA 從 49% 降至 44%,DeepSWE 從 66% 降至 64%)。這源於 Luna 激進的省 Token 策略:為了極致精簡輸出長度,它偶爾會忽略防禦性單元測試或粗糙修改程式碼,導致邊界回歸測試失敗。

GDPval 暴跌 75 Elo 與 Briefcase 下滑 45 Elo 的根本原因是什麼?

研究人員在檢視數百份任務成果後指出,分數暴跌主因是呈現品質退化與評分標準要素遺漏。Luna 傾向於過度精簡輸出,經常跳過提示詞要求的格式範本、背景分析段落或評分標準中的必填項目,以極致壓縮輸出 Token 來換取吞吐速度。

不同的推理努力等級(Effort)如何影響 GPT-6 Luna 的費用與延遲?

Luna 支援六個推理努力等級,任務成本跨度高達 15 倍。在 Artificial Analysis 數據面板上,non-reasoning 模式首 Token 延遲僅 0.72 秒(每任務 $0.01),low 檔吞吐達 176 tokens/s(每任務僅 $0.0045),而 max 檔成本則升至 $0.07。若要在高頻業務中兌現低價優勢,必須結合場景選擇 low 或 medium 檔位。

工程團隊應如何在智慧代理工作流中安全部署 GPT-6 Luna?

建議採用雙層架構:由 GPT-6 Sol 或 Claude Sonnet 等具備深度推理能力的大模型擔任主力編排器,負責規劃任務與生成強型別 JSON Schema;再將具體的數據擷取、格式清洗、函數單測填寫等切塊任務指派給 Luna 作為工蜂子代理。同時必須在檔案系統與 Git 層面設置實體寫入隔離,防範程式碼遭到意外刪除。

在 Tabbit 瀏覽器中可以如何體驗與使用 GPT-6 Luna?

Tabbit 瀏覽器原生支援多分頁上下文與動態模型路由。在同一個瀏覽工作流中,你可以將大量網頁內容摘要、DOM 欄位擷取與背景任務交由 GPT-6 Luna 處理以節省配額,同時將複雜的跨分頁深度分析無縫路由至旗艦模型。

下一步

讓 Tabbit 與你並肩工作。

跨分頁調研、自動化重複的瀏覽器工作,讓每一處上下文都觸手可及。