如果工作需要持續呼叫工具、編碼和多步跟進,Claude Sonnet 5 值得受控試用。它適合先處理邊界清楚的代理任務和知識工作:這些任務可能需要接近 Opus 的能力,卻受到成本或可用性限制。若更看重缺陷召回、最快收斂或專用工具入口,仍應把 Sonnet 4.6 或更大的模型放在對照組。
Anthropic 於 2026 年 6 月 30 日發布 Claude Sonnet 5。當前模型 ID 是 claude-sonnet-5;本文以 Anthropic 發布說明和 Claude Platform 目錄為決策錨點,並於 2026 年 9 月 20 日核對。關鍵不只是「版本更新」:effort、工具和實際暴露模型的入口共同決定成本與結果。(Anthropic,Claude Platform)
關鍵結論
Sonnet 5 是更強調代理工作的 Sonnet,面向計畫、工具、編碼和多步驟專業任務。
目錄快照列出
claude-sonnet-5、自適應思考、100 萬 token 上下文和 12.8 萬 token 最大輸出;不是每個用戶端都保證開放這些控制項。當前 API 快照為每百萬輸入 token 2 美元、輸出 10 美元。effort、思考 token 和重試增加後,單任務成本仍會上升。
公開評測有條件:Terminal-Bench 和知識工作結果接近 Opus 4.8,但 CodeRabbit 在程式碼審查中觀察到精準度與召回率的取捨。
本稿沒有完成 Tabbit 中的 Sonnet 5 任務,也沒有截圖。請先查看 Claude Sonnet 5 模型資源 (简体中文) 和自己的模型選擇器。
Claude Sonnet 5 規格速覽
| 問題 | 當前快照 | 選擇邊界 |
|---|---|---|
| 模型 ID | claude-sonnet-5 | 在 API 和評測日誌中固定精確 ID。 |
| 發布日期 | 2026 年 6 月 30 日 | 版本比較必須保持任務和測試環境一致。 |
| 輸入 / 輸出 | 文字、圖片輸入;文字輸出 | 工具和多模態行為取決於入口。 |
| 上下文 / 最大輸出 | 100 萬 token / 12.8 萬 token | 目錄上限,用戶端有效限制可能更小。 |
| 思考 | 自適應;目錄列出的預設 effort 為 high | 應比較 effort 檔位,而不只比較模型名。 |
| API 價格快照 | 每百萬輸入 2 美元 / 輸出 10 美元 | 訂閱、雲端平台和 Tabbit 費用另算。 |
| 取得方式 | Anthropic 列出 Claude 方案和 Claude API | 檢查帳戶、地區、配額和即時選擇器。 |
目錄顯示的可靠知識截止時間是 2026 年 1 月。這是目錄元資料,不代表連接的工具或檢索層保持最新。若要判斷瀏覽器入口,代理瀏覽器與普通聊天視窗的差別在於能否檢查和操作即時網頁;模型能力本身不會自動取得這些權限。
它比 Sonnet 4.6 改變了什麼?
Anthropic 將升級重點放在代理任務:更長的計畫、瀏覽器和終端工具、編碼、推理與知識工作。發布說明還稱不良行為率低於 Sonnet 4.6,並預設啟用網路安全防護。這些是廠商口徑,應作為背景而不是自己的任務結論。
| 維度 | Sonnet 4.6 | Sonnet 5 | 對讀者的行動 |
|---|---|---|---|
| 代理跟進 | 上一代 Sonnet 基線 | Anthropic 稱可完成更多多步工作並檢查結果 | 用明確停止條件和驗收命令測試。 |
| 工具呼叫 | 能力取決於入口 | 發布重點是瀏覽器和終端工具 | 檢查權限並記錄每次工具呼叫。 |
| 終端工作 | Vellum/系統卡快照為 67.0% | 同一公開比較中 Terminal-Bench 2.1 為 80.4% | 這是公開評測,不是你的儲存庫重跑。 |
| 知識工作 | 同一比較中的上一代基線 | GDPval-AA v2 為 1,618,Opus 4.8 為 1,615 | 3 分差不能推出普遍勝負。 |
| 程式碼審查 | CodeRabbit 約 63% 嚴格召回、29% 精準度 | 約 50–51% 嚴格召回、38–40% 精準度 | 有意識選擇評論乾淨或覆蓋更廣。 |
| 安全 | Sonnet 4.6 基線 | Anthropic 稱不良行為更少,預設開啟網路安全防護 | 安全流程仍需人工複核和專門測試。 |
Vellum 也提醒,Anthropic 修訂過部分 Sonnet 4.6 基線。不能把不同日期、評分器或工具配置的數字拼成一個排行榜。Claude Sonnet 5 評測資源 (简体中文)收集來源筆記,代理推理指南說明為什麼基準評測只能代表長流程的一部分。
仍然未知的事情
第一,公開評測不等於你的測試環境。Endor Labs 的 Agent Security League 報告顯示,Sonnet 5 搭配 Claude Code 在功能正確性上較強,但漏洞閉環明顯較弱。報告摘要寫 83.2% FuncPass,正文寫 82.6%,因此本文不把任何一個數字當作確定標題事實。可遷移的結論更窄:通過功能測試的補丁不等於安全補丁。
第二,effort 會改變單任務成本。CodeRabbit 發現更高 effort 沒有明顯改善嚴格缺陷召回,卻大約使審查成本翻倍。每百萬 token 的價格不是任務預算;比較時要記錄思考 token、重試、工具呼叫和人工修正。
第三,入口決定可用性。Anthropic 列出 Claude 方案和 API,但即時選擇器、地區、配額和工具集決定使用者實際能做什麼。API 能用不代表瀏覽器用戶端或第三方提供商開放相同模型。
社群正在爭論什麼
Reddit 討論暴露了發布頁無法單獨解決的選擇。Exodus_Green 閱讀公開圖表後認為,Sonnet 4.6 的 low effort 可能在代理搜尋中超過 Sonnet 5 的 medium,儘管價格略高(原評論)。這提醒我們比較 effort 檔位。
反方向的 Rent_South 用自己的邏輯流程評測,每個模型執行五次,結論是模型選擇取決於工作流(同帖)。qubedView 把成本邊界說得更具體:單任務成本才重要,Sonnet 處理單次文件抽取可能便宜得多,而 Opus 更適合困難編碼(原討論)。TheRealJesus2 建議拆分任務,讓小模型負責低或中等推理,讓大模型規劃和驗證(同討論)。
這些是個人報告,不是基準評測。9 月 20 日嘗試了 X 搜尋和 YouTube 搜尋,但瀏覽器工作階段沒有暴露穩定、可歸屬的帖子或評論正文。本文不放截圖,並繼續保持草稿。
誰適合嘗試?
| 如果你的工作是這樣 | 第一步 | 原因 |
|---|---|---|
| 重複抽取、分類或路由 | 先用低/中 effort 試 Sonnet 5 | 社群訊號和成本邏輯都更支持邊界清楚的任務。 |
| 有測試和驗收條件的多檔案編碼 | 開啟工具,試運行 Sonnet 5 | 發布定位和獨立報告都指向更好的跟進能力。 |
| 高風險安全審查 | 保留專用或更大模型 | 功能正確不等於漏洞閉環,仍需人工簽字。 |
| 單行修改或強低延遲聊天 | 對照 Sonnet 4.6 或更快模型 | Sonnet 5 可能為小任務投入過多思考。 |
入口看不到 claude-sonnet-5 | 不要承諾可用,先查帳戶和地區 | 部落格或目錄中的模型名不是授權。 |
客戶端也會改變任務形狀。瀏覽器自動化不能消除模型限制、登入要求或複核責任。若團隊比較的是產品而不是模型,可另看 AI 瀏覽器比較 和 AI 瀏覽器指南。
實際下一步:測量一個完成任務
選一個可回滾且有代表性的任務,例如從小型文件集中抽取欄位,或帶有現有測試命令的多檔案修改。記錄:
精確模型 ID 和用戶端;
effort、上下文大小和工具權限;
輸入、輸出和思考 token;
耗時、重試和工具呼叫;
結果是否通過獨立檢查;
是否需要人工修復或收尾。
再用 Sonnet 4.6 或目前模型執行相同測試樣本。只有 Sonnet 5 在每個完成結果上更便宜,而不是每個 token 更便宜,才值得切換。Tabbit Browser 說明介紹瀏覽器工作流,Tabbit 實踐說明如何保留人工參與。
本稿沒有在 Tabbit 中測試 Sonnet 5,因此不聲稱任何已登入帳戶目前都能看到它。如果你的選擇器出現該模型,先執行一個可回滾的小任務。入口適合時再下載:
結論
Claude Sonnet 5 值得在代理編碼、工具工作流和重複知識工作中進行受控試用。它的跟進能力和大上下文讓它不只是 Sonnet 4.6 的小修訂,但它不是自動取代 Opus 的答案,也不是安全或低成本保證。effort、重試、入口限制和任務拆分決定最終結果。
從滿足驗收條件所需的最低 effort 開始,記錄每個完成任務的成本,只有任務證明需要時才升級。真實 Tabbit 帳戶測試和所需社群截圖完成前,本稿保持草稿。
來源
Anthropic:Introducing Claude Sonnet 5 — 發布日期、定位、取得、安全和價格快照。
Claude Platform 模型總覽 — 模型 ID、上下文、輸出、思考和目錄元資料。
Claude Platform 定價 — 當前 API 價格參考。
Endor Labs:Claude Sonnet 5 with Claude Code — 安全與功能基準評測及限制。
CodeRabbit:Claude Sonnet 5 review — 生產程式碼審查測試環境和精準度/召回率取捨。
Vellum:Claude Sonnet 5 Benchmarks Explained — 定日期基準比較和分詞器風險。
Reddit:Introducing Claude Sonnet 5 — effort 和工作流討論。
Reddit:Why would anyone use Claude Sonnet 5? — 單任務成本和路由討論。
常見問題
Claude Sonnet 5 是什麼?
Claude Sonnet 5 是 Anthropic 面向編碼、工具呼叫、知識工作與 AI 代理流程的中階模型。2026 年 9 月 20 日核對的 Claude Platform 目錄列出 API ID claude-sonnet-5、自適應思考、100 萬 token 上下文與 12.8 萬 token 最大輸出。
Claude Sonnet 5 比 Sonnet 4.6 有哪些變化?
Anthropic 將 Sonnet 5 定位為更具代理能力的版本,重點是推理、工具呼叫、編碼與知識工作。獨立報告也顯示取捨:特定程式碼審查測試環境的評論更乾淨,但嚴格缺陷召回可能下降。
Claude Sonnet 5 的上下文與輸出上限是多少?
2026 年 9 月 20 日核對的 Claude Platform 模型目錄列出 100 萬 token 上下文與 12.8 萬 token 最大輸出。這是模型目錄上限,實際用戶端、方案或提供商可能暴露不同限制。
Claude Sonnet 5 的價格是多少?
目前 Claude Platform 快照列出每百萬輸入 token 2 美元、每百萬輸出 token 10 美元。API、消費者訂閱、雲端平台和第三方加價分開計算,自適應思考也會改變單任務成本。
在哪裡可以使用 Claude Sonnet 5?
Anthropic 的發布說明列出 Claude 各方案和 Claude API。實際模型選擇器、地區、配額和工具取決於入口,向團隊承諾可用前應檢查即時帳戶或提供商頁面。
切換前應如何測試 Claude Sonnet 5?
選一個有代表性的任務,記錄模型 ID、effort 檔位、工具呼叫、耗時、總 token,以及是否需要人工接管,再與 Sonnet 4.6 或目前模型比較。一次成功不能證明生產可靠性。