Tabbit部落格

Claude Fable 5.1 評測:Agent 長任務強,但成本取決於工作負載

根據官方、獨立評測與社群原始頁面,分析 Claude Fable 5.1 的編碼、Agent 工作、價格、基準限制與 Tabbit 尚未驗證的存取邊界。

本文目錄
  1. 結論先說
  2. 快速規格
  3. 基準與口徑
  4. 三個具體優點
  5. 1. 長鏈路工具使用是核心場景
  6. 2. 知識工作和診斷有具體線索
  7. 3. 快取價格可能改善長會話經濟性
  8. 三個需要預算的缺點
  9. 1. 延遲和配額都是產品體驗
  10. 2. 安全策略會改變能力和分數
  11. 3. 覆蓋廣但仍不完整
  12. 社群訊號:讚賞和挫敗同時存在
  13. 按工作負載判斷
  14. Tabbit 邊界與下一步
  15. 最終判斷
  16. 來源

Claude Fable 5.1 適合長時間呼叫工具的工作,但不是所有場景的通用升級。多檔案編碼、帶驗證迴圈的研究與知識工作可以先試;短編輯、嚴格配額或低延遲聊天則應先比較更小、更快的模型。

本評測以 Anthropic 發布頁作為版本和價格錨點,並在 2026 年 9 月 20 日重新開啟核對。最值得記住的是:快取讀取降價 75% 至每百萬 token 0.25 美元,但完整任務不會因此自動便宜 75%。目前 API ID 是 claude-fable-5-1,實際能力仍取決於接入路線、effort 和安全策略。

結論先說

  • 最適合:多檔案編碼、工具呼叫、技術研究和有驗收條件的知識工作。

  • 三個優點:官方 Agent 基準強;官方合作案例包含根因分析和無人值守任務;快取讀取價格確實提供成本槓桿。

  • 三個缺點:首 token 和配額風險;安全介入會改變結果;公開證據使用不同 harness 且覆蓋不完整。

  • Tabbit 邊界:公開 Tabbit 頁面沒有登入後的 Fable 5.1 選擇器或可執行任務,因此本文不聲稱 Tabbit 已支援它。

可先看 Claude Fable 5.1 模型資源 (简体中文),再查看其 提示詞庫 (简体中文)評測庫 (简体中文)

快速規格

項目已發布快照不能證明什麼
API ID 與版本claude-fable-5-1;2026 年 9 月發布頁你的方案或瀏覽器一定暴露該模型
輸入/輸出價格每百萬 token 10/50 美元思考、重試和工具後的完整任務成本
快取讀取每百萬 token 0.25 美元,比 Fable 5 低 75%每個任務都固定節省 75%
上下文發布材料描述 1M 上下文路線每個 Provider 都開放完整上限
預設 effortClaude Code 為 High,Claude Cowork 和 Claude.ai 為 Medium所有客戶端都有相同設定
可用路線Anthropic API、AWS、Google Cloud、Microsoft Azure你的帳戶、地區、配額和工具權限
獨立快照BenchLM:84.7/100、230 個模型中第 1、68 tok/s、首 token 262.88 秒通用延遲承諾或生產複測

基準與口徑

Anthropic 發布頁列出:Terminal-Bench-Science 0.1 為 52.6%,Terminal-Bench 4.0 為 55.8%,GDPval-AA v2 為 1,853,OSWorld 2.0 partial 為 77.9%,strict 為 41.7%,Humanity's Last Exam 無工具為 60.9%、有工具為 65.0%,AutomationBench 為 31.4%,CursorBench 3.2.0 為 73.4%。對應 Fable 5 的可比值分別為 24.7%、42.0%、1,723、72.9%、36.1%、57.8%、63.8%、17.1% 和 70.5%。

這些數字不能拼成一個總榜。Anthropic 說明 Terminal-Bench-Science 的標準誤差約為正負 3.5–4.5 分,且發布表使用特定 harness;生產安全策略介入時,OSWorld 和 AutomationBench 任務可能記為零。BenchLM 的 9 月 18 日頁面是聚合快照,顯示 26 條基準、分類覆蓋不完整;Medium 獨立文章正文需要會員,本文只使用它公開可見的「兩個榜單領先但速度最慢、某項任務成本最高」概括。沒有任何一項是你的儲存庫複跑。

三個具體優點

1. 長鏈路工具使用是核心場景

52.6% 的 Terminal-Bench-Science 和 55.8% 的 Terminal-Bench 4.0 都指向需要保持上下文、呼叫工具並檢查中間結果的任務。Anthropic 的合作案例還提到 Millennium 追蹤罕見崩潰,以及 Ramp 的無人值守實驗發現標籤偽影和生產告警。這些是廠商選擇的案例,不是穩定性保證,卻比單輪聊天分數更接近 Agent 工作。

可參考 Agent 推理與深度研究什麼是 Agent 瀏覽器

2. 知識工作和診斷有具體線索

GDPval-AA v2 為 1,853;MongoDB 描述了跨服務研究後進行無人值守驗證的原型,Red Hat 稱 Claude Code 在測試集合中找到每個壞建置的根因。實際試用時應給它日誌、文件和測試命令,再設定明確驗收條件。合作案例不能取代你的事故資料。

3. 快取價格可能改善長會話經濟性

重複使用同一上下文時,每百萬 token 0.25 美元的快取讀取是實在的成本槓桿。Anthropic 估計典型成本低約 25%,高度 Agent 化成本最多低約 45%。但輸出、思考 effort、重試、工具和訂閱配額仍會決定完整任務帳單。真正應測的是每個驗收結果的成本。

三個需要預算的缺點

1. 延遲和配額都是產品體驗

BenchLM 在 9 月 18 日顯示首 token 262.88 秒、速度 68 tok/s。這只是 Provider 快照,不是 SLA,卻足以說明需要本地試用。Reddit 使用者 momkeeeeeeee 一邊稱它是自己用過最好的模型,一邊說一天消耗了約 30% 的配額;Every 影片評論中也有人說十到二十分鐘就耗盡五小時視窗。方案、提示詞和路線未知,因此只能得出「長任務可能昂貴或緩慢」的結論。

2. 安全策略會改變能力和分數

Anthropic 稱生產安全策略可減少 60% 的網路安全誤報,同時明確 Fable 可發現漏洞但不能開發 exploit。發布頁還說明安全介入的 OSWorld 和 AutomationBench 任務會記零。安全工作應限定為授權防禦分析,並保留人工審核。

3. 覆蓋廣但仍不完整

BenchLM 頁面沒有測數學、多語、多模態和指令遵循。官方表格混合 GUI、終端、編碼與知識任務,系統卡 PDF 在研究瀏覽器中無法開啟,獨立 Medium 正文也有存取限制。未知項應留在決策裡,不能把發布表寫成普遍排名。

社群訊號:讚賞和挫敗同時存在

r/ClaudeCode 的 connurp 是全端 Django 開發者,稱 Medium effort 下程式碼更好、更快,並估算相對 Fable 5 加 Opus 5 的組合每次請求低約 37%。這是個人路由計算,不是基準。r/ClaudeAI 的 momkeeeeeeee 稱它擅長整理記憶和綜合三份血檢結果,卻在測試程式碼庫時一天用掉約 30% 配額。

Every 的週測影片評論也出現同樣分歧:有人喜歡寫作,有人說不到 20 分鐘就用完五小時視窗,或編碼 token 很快耗盡。評論沒有受控樣本,但說明配額壓力明顯依賴任務。

按工作負載判斷

工作負載結論試用方式
多檔案編碼和測試值得優先試固定模型 ID,保留測試命令,記錄重試和總成本
帶來源的技術研究可以試要求引用、矛盾檢查和人工驗收
短改寫、快速聊天通常過重先比較更快、更便宜的模型
授權防禦安全工作有條件可做發現和修復分析,保留 exploit 邊界與人工簽核
嚴格訂閱配額不宜預設把機械子任務路由給其他模型,先測完整會話
瀏覽器研究Tabbit 中未驗證檢查即時選擇器,不能從公開首頁推斷支援

瀏覽器自動化2026 年最佳 AI 瀏覽器AI 瀏覽器比較 只能提供客戶端背景,不能證明 Fable 5.1 在 Tabbit 可用。

Tabbit 邊界與下一步

本次研究核對了 Tabbit Browser 公開頁面。頁面有產品和下載資訊,但沒有登入後的模型選擇器、Fable 5.1 輸出或 model ID 校驗;因此本文不聲稱完成了 Tabbit 實測。Tabbit 介紹Agent 瀏覽器指南Tabbit 使用習慣 解釋了瀏覽器層工作流。

如果帳戶顯示 Fable 5.1,先選一個可撤銷任務:帶現有測試的多檔案修改,或要求引用的小型研究包。記錄模型 ID、effort、快取讀取、輸出 token、工具呼叫、耗時、重試、配額和人工驗收結果,再和 Fable 5 及目前模型比較每個合格結果的成本。

Tabbit Browser

最終判斷

當任務夠長、工具呼叫能帶來回報、預算能承受波動時,Claude Fable 5.1 值得受控試用。官方 Agent 結果、合作案例和更低快取讀取價格都是優點,但不能抵消首 token、配額、安全介入和獨立覆蓋不足。

從能通過驗收的最低 effort 開始;短任務交給小模型,機械子任務有意路由。完成真實 Tabbit 任務並補齊社群截圖前,本文保持草稿。

來源

常見問題

Claude Fable 5.1 值得用嗎?

若任務需要長時間工具呼叫、程式設計與知識工作,可以先做受控試用。短對話、嚴格配額與低延遲場景不應直接預設使用。

Fable 5.1 比 Fable 5 便宜嗎?

Anthropic 稱快取讀取降價 75% 至每百萬 token 0.25 美元,典型成本約低 25%,高度 Agent 化任務最多約低 45%。這不是每個完整任務都會得到的固定折扣。

Claude Fable 5.1 適合程式設計嗎?

官方發布頁給出 Terminal-Bench-Science 52.6%、Terminal-Bench 4.0 55.8% 與 CursorBench 3.2.0 73.4%。這些是方向性證據,仍需在自己的儲存庫與測試命令中複核。

為什麼 Fable 5.1 會快速消耗配額?

高 effort、長上下文、輸出、重試、工具呼叫與子 Agent 都可能疊加消耗。社群報告缺少方案和 harness 資訊,應作為測量理由,而不是統一限制。

Tabbit 能用 Claude Fable 5.1 嗎?

本評測沒有驗證這點。2026 年 9 月 20 日檢查公開 Tabbit 頁面時,沒有登入後的模型選擇器或可執行的 Fable 5.1 工作區。

應如何理解基準分數?

必須連同任務、harness、日期、effort 與安全規則閱讀。Anthropic 給出的 Terminal-Bench-Science 標準誤差約為正負 3.5–4.5 分,BenchLM 則是聚合快照,不是生產環境複跑。

下一步

讓 Tabbit 與你並肩工作。

跨分頁調研、自動化重複的瀏覽器工作,讓每一處上下文都觸手可及。