TabbitBlog

Claude Fable 5.1 レビュー:エージェント作業は強いが、費用は仕事次第

公式発表、独立評価、RedditとYouTubeの原ページを基に、Claude Fable 5.1のコーディング、料金、ベンチマーク限界、Tabbitで未検証のアクセスを説明します。

この記事の内容
  1. 結論
  2. 数値の読み方
  3. 具体的な強み
  4. 具体的な弱み
  5. コミュニティの対照
  6. 用途別の判断
  7. Tabbitでの境界と次の一手
  8. 最終評価
  9. 出典

Claude Fable 5.1は、ツールを長く使う仕事に向いた候補です。しかし、すべての仕事での万能な更新ではありません。複数ファイルの実装、検証付きの調査、知識作業なら試す価値があります。短い編集、厳しい利用枠、低遅延の会話では小さく速いモデルを先に比較してください。

このレビューは、2026年9月20日に確認したAnthropicの発表ページをバージョンと料金の基準にしています。中心となる事実は、キャッシュ読み取りが75%下がり1百万トークン0.25ドルになった一方、完成した仕事が一律75%安くなるわけではないことです。API IDはclaude-fable-5-1です。

結論

  • 向く仕事:複数ファイルのコード、ツール利用、技術調査、受け入れ条件のある知識作業。

  • 強み三つ:公式のエージェント評価、根本原因と無人実行の具体例、キャッシュ費用の削減余地。

  • 弱み三つ:初回トークンと利用枠、保護機能による評価差、異なるharnessと不完全な範囲。

  • Tabbitの境界:公開ページでログイン後のモデル選択や実行環境を確認できなかったため、対応を主張しません。

モデル資料 (English)プロンプト集 (English)評価集 (English)も参照してください。

数値の読み方

AnthropicはTerminal-Bench-Science 52.6%、Terminal-Bench 4.0 55.8%、GDPval-AA v2 1,853、OSWorld partial 77.9%、strict 41.7%、Humanity's Last Exam 60.9%と65.0%、AutomationBench 31.4%、CursorBench 3.2.0 73.4%を掲載しています。BenchLMの9月18日スナップショットは84.7/100、230モデル中1位、68 tok/s、初回トークン262.88秒と表示します。

数値は同じ物差しではありません。AnthropicはTerminal-Bench-Scienceの標準誤差を約±3.5–4.5点とし、安全介入がOSWorldとAutomationBenchでゼロになる場合を説明しています。BenchLMは26行を表示する集計サイトで、数学、多言語、マルチモーダルなどは未測定です。Mediumの独立記事は会員限定のため、公開された「二つの順位表で首位だが最も遅く、一項目で最も高価」という導入だけを使います。

具体的な強み

  1. 長いツール作業。 端末評価と、Millenniumのクラッシュ追跡、Rampの無人実験は、文脈を保ち検証する仕事に近い示唆です。ベンダー選定の事例なので保証ではありません。

  2. 診断と知識作業。 GDPval-AA v2は1,853です。MongoDBとRed Hatの例は、ログ、文書、テストを与えるパイロット設計に役立ちます。

  3. 長いセッションのキャッシュ。 0.25ドル/Mは有効なレバーですが、出力、effort、再試行、ツール、サブエージェントを含む費用を測る必要があります。

具体的な弱み

  1. 遅延と利用枠。 BenchLMの初回応答はプロバイダーのスナップショットです。RedditとEveryのコメントは利用枠を早く使う経験を報告しますが、プラン、プロンプト、ルートは不明です。

  2. 安全境界。 Anthropicはサイバー誤検知60%減を述べますが、脆弱性発見とexploit作成を区別し、安全介入をゼロとして扱う評価もあります。

  3. 不完全な範囲。 公開表はGUI、端末、コード、知識を混ぜています。system card PDFは今回のブラウザで開けず、独立記事本文も確認できませんでした。

コミュニティの対照

r/ClaudeCodeのconnurpは、Medium effortでコードが良く速くなり、Fable 5とOpus 5の組み合わせより1リクエスト約37%安いと個人的に計算しています。r/ClaudeAIのmomkeeeeeeeeは記憶整理と血液検査の統合を評価する一方、コードベースの試用で一日約30%の枠を使ったと述べます。Everyのコメントにも、5時間枠を10分または20分で使い切ったという声があります。いずれも統制実験ではありません。

用途別の判断

用途判断
テスト付き複数ファイル開発有力候補。ID、テスト、総費用を記録する。
出典付き技術調査試す価値あり。引用と矛盾確認を必須にする。
短い書き換え過剰になりやすい。速いモデルを比較する。
許可済みの防御セキュリティ条件付き。人間の承認を残す。
厳しい利用枠初期値にしない。単純な作業を分ける。
ブラウザ調査Tabbitでは未検証。

ブラウザ自動化2026年のAIブラウザ比較記事はクライアントの背景であり、FableのTabbit対応証拠ではありません。

Tabbitでの境界と次の一手

調査ではTabbit Browserの公開ページを確認しましたが、ログイン後の選択画面、Fable 5.1の出力、モデルID確認はありませんでした。そのため、この記事はTabbitでの実測を主張しません。Tabbitの説明エージェントブラウザガイド利用の実践を背景として参照してください。

アカウントにモデルが表示されたら、既存テスト付きの変更など、戻せる仕事を一つ実行します。ID、effort、キャッシュ、出力、ツール、時間、再試行、枠、人的承認を記録します。

Tabbit Browser

最終評価

長いツール作業に投資でき、予算に変動を含められるなら、Fable 5.1は管理されたパイロットに値します。公式のエージェント評価、具体的な事例、安いキャッシュは強みです。しかし遅延、枠、安全介入、不完全な独立評価は残ります。実際のTabbit実行と必要なコミュニティ記録が揃うまで、この記事は草稿です。

出典

よくある質問

Claude Fable 5.1は価値がありますか?

長いツール利用、コーディング、知識作業には小さな実験を勧めます。短い会話や厳しい上限、低遅延が必要な仕事では自動的な第一選択ではありません。

Fable 5.1はFable 5より安いですか?

Anthropicはキャッシュ読み取りを75%下げて1百万トークン0.25ドル、通常の費用を約25%低下と説明しています。最終費用は出力、思考、再試行、ツールで変わります。

コーディングに向いていますか?

公式値はTerminal-Bench-Science 52.6%、Terminal-Bench 4.0 55.8%、CursorBench 3.2.0 73.4%です。自分のリポジトリで再現テストが必要です。

なぜ利用枠を早く消費しますか?

長いコンテキスト、思考、出力、再試行、ツール、サブエージェントが積み重なります。コミュニティ投稿にはプランとharnessがないため、測定の理由として扱います。

Tabbitで使えますか?

検証できませんでした。2026年9月20日の公開Tabbitページには、ログイン後の選択画面も実行可能なFable 5.1環境もありませんでした。

ベンチマークをどう読みますか?

タスク、harness、日付、effort、安全条件と一緒に読みます。AnthropicはTerminal-Bench-Scienceの標準誤差を約±3.5–4.5点と示し、BenchLMは集計スナップショットです。

次のステップへ

Tabbit と一緒に仕事をしましょう。

タブをまたいで調査し、繰り返しのブラウザ作業を自動化し、あらゆる文脈を手の届くところに。