Tabbit部落格

Claude Sonnet 5:有哪些變化,如何取得

以官方資料說明 Claude Sonnet 5 的定位、與 Sonnet 4.6 的變化、取得方式、限制、成本邊界與適用場景。

本文目錄
  1. 關鍵結論
  2. Claude Sonnet 5 規格速覽
  3. 它比 Sonnet 4.6 改變了什麼?
  4. 仍然未知的事情
  5. 社群正在爭論什麼
  6. 誰適合嘗試?
  7. 實際下一步:測量一個完成任務
  8. 結論
  9. 來源

如果工作需要持續呼叫工具、編碼和多步跟進,Claude Sonnet 5 值得受控試用。它適合先處理邊界清楚的代理任務和知識工作:這些任務可能需要接近 Opus 的能力,卻受到成本或可用性限制。若更看重缺陷召回、最快收斂或專用工具入口,仍應把 Sonnet 4.6 或更大的模型放在對照組。

Anthropic 於 2026 年 6 月 30 日發布 Claude Sonnet 5。當前模型 ID 是 claude-sonnet-5;本文以 Anthropic 發布說明和 Claude Platform 目錄為決策錨點,並於 2026 年 9 月 20 日核對。關鍵不只是「版本更新」:effort、工具和實際暴露模型的入口共同決定成本與結果。(AnthropicClaude Platform)

關鍵結論

  • Sonnet 5 是更強調代理工作的 Sonnet,面向計畫、工具、編碼和多步驟專業任務。

  • 目錄快照列出 claude-sonnet-5、自適應思考、100 萬 token 上下文和 12.8 萬 token 最大輸出;不是每個用戶端都保證開放這些控制項。

  • 當前 API 快照為每百萬輸入 token 2 美元、輸出 10 美元。effort、思考 token 和重試增加後,單任務成本仍會上升。

  • 公開評測有條件:Terminal-Bench 和知識工作結果接近 Opus 4.8,但 CodeRabbit 在程式碼審查中觀察到精準度與召回率的取捨。

  • 本稿沒有完成 Tabbit 中的 Sonnet 5 任務,也沒有截圖。請先查看 Claude Sonnet 5 模型資源 (简体中文) 和自己的模型選擇器。

Claude Sonnet 5 規格速覽

問題當前快照選擇邊界
模型 IDclaude-sonnet-5在 API 和評測日誌中固定精確 ID。
發布日期2026 年 6 月 30 日版本比較必須保持任務和測試環境一致。
輸入 / 輸出文字、圖片輸入;文字輸出工具和多模態行為取決於入口。
上下文 / 最大輸出100 萬 token / 12.8 萬 token目錄上限,用戶端有效限制可能更小。
思考自適應;目錄列出的預設 effort 為 high應比較 effort 檔位,而不只比較模型名。
API 價格快照每百萬輸入 2 美元 / 輸出 10 美元訂閱、雲端平台和 Tabbit 費用另算。
取得方式Anthropic 列出 Claude 方案和 Claude API檢查帳戶、地區、配額和即時選擇器。

目錄顯示的可靠知識截止時間是 2026 年 1 月。這是目錄元資料,不代表連接的工具或檢索層保持最新。若要判斷瀏覽器入口,代理瀏覽器與普通聊天視窗的差別在於能否檢查和操作即時網頁;模型能力本身不會自動取得這些權限。

它比 Sonnet 4.6 改變了什麼?

Anthropic 將升級重點放在代理任務:更長的計畫、瀏覽器和終端工具、編碼、推理與知識工作。發布說明還稱不良行為率低於 Sonnet 4.6,並預設啟用網路安全防護。這些是廠商口徑,應作為背景而不是自己的任務結論。

維度Sonnet 4.6Sonnet 5對讀者的行動
代理跟進上一代 Sonnet 基線Anthropic 稱可完成更多多步工作並檢查結果用明確停止條件和驗收命令測試。
工具呼叫能力取決於入口發布重點是瀏覽器和終端工具檢查權限並記錄每次工具呼叫。
終端工作Vellum/系統卡快照為 67.0%同一公開比較中 Terminal-Bench 2.1 為 80.4%這是公開評測,不是你的儲存庫重跑。
知識工作同一比較中的上一代基線GDPval-AA v2 為 1,618,Opus 4.8 為 1,6153 分差不能推出普遍勝負。
程式碼審查CodeRabbit 約 63% 嚴格召回、29% 精準度約 50–51% 嚴格召回、38–40% 精準度有意識選擇評論乾淨或覆蓋更廣。
安全Sonnet 4.6 基線Anthropic 稱不良行為更少,預設開啟網路安全防護安全流程仍需人工複核和專門測試。

Vellum 也提醒,Anthropic 修訂過部分 Sonnet 4.6 基線。不能把不同日期、評分器或工具配置的數字拼成一個排行榜。Claude Sonnet 5 評測資源 (简体中文)收集來源筆記,代理推理指南說明為什麼基準評測只能代表長流程的一部分。

仍然未知的事情

第一,公開評測不等於你的測試環境。Endor Labs 的 Agent Security League 報告顯示,Sonnet 5 搭配 Claude Code 在功能正確性上較強,但漏洞閉環明顯較弱。報告摘要寫 83.2% FuncPass,正文寫 82.6%,因此本文不把任何一個數字當作確定標題事實。可遷移的結論更窄:通過功能測試的補丁不等於安全補丁。

第二,effort 會改變單任務成本。CodeRabbit 發現更高 effort 沒有明顯改善嚴格缺陷召回,卻大約使審查成本翻倍。每百萬 token 的價格不是任務預算;比較時要記錄思考 token、重試、工具呼叫和人工修正。

第三,入口決定可用性。Anthropic 列出 Claude 方案和 API,但即時選擇器、地區、配額和工具集決定使用者實際能做什麼。API 能用不代表瀏覽器用戶端或第三方提供商開放相同模型。

社群正在爭論什麼

Reddit 討論暴露了發布頁無法單獨解決的選擇。Exodus_Green 閱讀公開圖表後認為,Sonnet 4.6 的 low effort 可能在代理搜尋中超過 Sonnet 5 的 medium,儘管價格略高(原評論)。這提醒我們比較 effort 檔位。

反方向的 Rent_South 用自己的邏輯流程評測,每個模型執行五次,結論是模型選擇取決於工作流(同帖)。qubedView 把成本邊界說得更具體:單任務成本才重要,Sonnet 處理單次文件抽取可能便宜得多,而 Opus 更適合困難編碼(原討論)。TheRealJesus2 建議拆分任務,讓小模型負責低或中等推理,讓大模型規劃和驗證(同討論)。

這些是個人報告,不是基準評測。9 月 20 日嘗試了 X 搜尋和 YouTube 搜尋,但瀏覽器工作階段沒有暴露穩定、可歸屬的帖子或評論正文。本文不放截圖,並繼續保持草稿。

誰適合嘗試?

如果你的工作是這樣第一步原因
重複抽取、分類或路由先用低/中 effort 試 Sonnet 5社群訊號和成本邏輯都更支持邊界清楚的任務。
有測試和驗收條件的多檔案編碼開啟工具,試運行 Sonnet 5發布定位和獨立報告都指向更好的跟進能力。
高風險安全審查保留專用或更大模型功能正確不等於漏洞閉環,仍需人工簽字。
單行修改或強低延遲聊天對照 Sonnet 4.6 或更快模型Sonnet 5 可能為小任務投入過多思考。
入口看不到 claude-sonnet-5不要承諾可用,先查帳戶和地區部落格或目錄中的模型名不是授權。

客戶端也會改變任務形狀。瀏覽器自動化不能消除模型限制、登入要求或複核責任。若團隊比較的是產品而不是模型,可另看 AI 瀏覽器比較AI 瀏覽器指南

實際下一步:測量一個完成任務

選一個可回滾且有代表性的任務,例如從小型文件集中抽取欄位,或帶有現有測試命令的多檔案修改。記錄:

  1. 精確模型 ID 和用戶端;

  2. effort、上下文大小和工具權限;

  3. 輸入、輸出和思考 token;

  4. 耗時、重試和工具呼叫;

  5. 結果是否通過獨立檢查;

  6. 是否需要人工修復或收尾。

再用 Sonnet 4.6 或目前模型執行相同測試樣本。只有 Sonnet 5 在每個完成結果上更便宜,而不是每個 token 更便宜,才值得切換。Tabbit Browser 說明介紹瀏覽器工作流,Tabbit 實踐說明如何保留人工參與。

本稿沒有在 Tabbit 中測試 Sonnet 5,因此不聲稱任何已登入帳戶目前都能看到它。如果你的選擇器出現該模型,先執行一個可回滾的小任務。入口適合時再下載:

Tabbit Browser

結論

Claude Sonnet 5 值得在代理編碼、工具工作流和重複知識工作中進行受控試用。它的跟進能力和大上下文讓它不只是 Sonnet 4.6 的小修訂,但它不是自動取代 Opus 的答案,也不是安全或低成本保證。effort、重試、入口限制和任務拆分決定最終結果。

從滿足驗收條件所需的最低 effort 開始,記錄每個完成任務的成本,只有任務證明需要時才升級。真實 Tabbit 帳戶測試和所需社群截圖完成前,本稿保持草稿。

來源

常見問題

Claude Sonnet 5 是什麼?

Claude Sonnet 5 是 Anthropic 面向編碼、工具呼叫、知識工作與 AI 代理流程的中階模型。2026 年 9 月 20 日核對的 Claude Platform 目錄列出 API ID claude-sonnet-5、自適應思考、100 萬 token 上下文與 12.8 萬 token 最大輸出。

Claude Sonnet 5 比 Sonnet 4.6 有哪些變化?

Anthropic 將 Sonnet 5 定位為更具代理能力的版本,重點是推理、工具呼叫、編碼與知識工作。獨立報告也顯示取捨:特定程式碼審查測試環境的評論更乾淨,但嚴格缺陷召回可能下降。

Claude Sonnet 5 的上下文與輸出上限是多少?

2026 年 9 月 20 日核對的 Claude Platform 模型目錄列出 100 萬 token 上下文與 12.8 萬 token 最大輸出。這是模型目錄上限,實際用戶端、方案或提供商可能暴露不同限制。

Claude Sonnet 5 的價格是多少?

目前 Claude Platform 快照列出每百萬輸入 token 2 美元、每百萬輸出 token 10 美元。API、消費者訂閱、雲端平台和第三方加價分開計算,自適應思考也會改變單任務成本。

在哪裡可以使用 Claude Sonnet 5?

Anthropic 的發布說明列出 Claude 各方案和 Claude API。實際模型選擇器、地區、配額和工具取決於入口,向團隊承諾可用前應檢查即時帳戶或提供商頁面。

切換前應如何測試 Claude Sonnet 5?

選一個有代表性的任務,記錄模型 ID、effort 檔位、工具呼叫、耗時、總 token,以及是否需要人工接管,再與 Sonnet 4.6 或目前模型比較。一次成功不能證明生產可靠性。

下一步

讓 Tabbit 與你並肩工作。

跨分頁調研、自動化重複的瀏覽器工作,讓每一處上下文都觸手可及。