複数ステップのツール利用、コーディング、知識作業が必要なら、Claude Sonnet 5 は小さく検証する価値があります。まずは条件を固定できるエージェント作業で試してください。Opus に近い能力が欲しくても、コストや利用経路が制約になる場合に向いています。バグの再現率、収束速度、特定ツールを優先するなら、Sonnet 4.6 や上位モデルも比較対象に残します。
Anthropic は 2026 年 6 月 30 日に Claude Sonnet 5 を発表しました。現在のモデル ID は claude-sonnet-5 です。この記事は Anthropic の発表と Claude Platform のモデルカタログを 2026 年 9 月 20 日に確認して作成しました。新しいモデル名だけでなく、effort、ツール、実際の提供経路がコストと結果を決めます。(Anthropic、Claude Platform)
要点
Sonnet 5 は計画、ツール、コーディング、複数ステップの業務を重視する Sonnet です。
カタログには
claude-sonnet-5、適応型思考、100 万 token のコンテキスト、128K の最大出力が記載されています。全クライアントが同じ設定を公開するとは限りません。API の確認時点の価格は入力 2 ドル、出力 10 ドル / 100 万 token です。effort、思考 token、再試行でタスク単価は増えます。
公開評価は条件付きです。Terminal-Bench と知識作業は Opus 4.8 に近い一方、CodeRabbit はコードレビューで精度と再現率のトレードオフを報告しています。
この草稿では Tabbit の Sonnet 5 テストもスクリーンショットも実施していません。Claude Sonnet 5 のモデル資料 (English)と実際の選択画面を確認してください。
仕様とアクセス
| 項目 | 確認したスナップショット | 判断の境界 |
|---|---|---|
| モデル ID | claude-sonnet-5 | API と評価ログに正確な ID を残す。 |
| 発表日 | 2026 年 6 月 30 日 | 同じタスク、同じ評価環境で比較する。 |
| 入力 / 出力 | テキスト・画像 / テキスト | ツールは経路に依存する。 |
| コンテキスト / 最大出力 | 100 万 / 128K token | カタログ上限であり、クライアントの制限は別。 |
| 思考 | 適応型、既定 effort は high | モデル名だけでなく effort を比較する。 |
| API 価格 | 入力 2 ドル / 出力 10 ドル / MTok | サブスク、クラウド、Tabbit は別計算。 |
| 利用経路 | Claude の各プランと API を Anthropic が記載 | アカウント、地域、クォータ、選択画面を確認する。 |
カタログの信頼できる知識のカットオフは 2026 年 1 月です。接続された検索やツールが最新である保証ではありません。エージェントブラウザはライブページを読んで操作できますが、モデル能力だけで権限が付与されるわけではありません。
Sonnet 4.6 からの変更
Anthropic は、長い計画、ブラウザ・ターミナルツール、コーディング、推論、知識作業を中心に説明しています。また Sonnet 4.6 より望ましくない行動が少なく、サイバー安全策が既定で有効だとしています。これは提供元の説明であり、個別の業務テストではありません。
| 観点 | Sonnet 4.6 | Sonnet 5 | 実務での確認 |
|---|---|---|---|
| エージェントの継続 | 前世代の基準 | より多くの複数ステップ作業を完了し、結果を確認すると説明 | 停止条件と検証コマンドを固定する。 |
| ツール利用 | 経路に依存 | 発表の中心 | 権限と呼び出しを記録する。 |
| ターミナル作業 | 公開比較で 67.0% | Terminal-Bench 2.1 で 80.4% | 自分のリポジトリでの再試験ではない。 |
| 知識作業 | 同じ比較の前世代基準 | GDPval-AA v2 で 1,618、Opus 4.8 は 1,615 | 3 点差から普遍的な勝者は決めない。 |
| コードレビュー | 約 63% の厳格再現率、精度 29% | 約 50–51%、精度 38–40% | ノイズの少なさと広い検出範囲を選ぶ。 |
| 安全 | Sonnet 4.6 の基準 | 望ましくない行動が少ないという報告 | 人手レビューと専用テストを残す。 |
Vellum は一部の Sonnet 4.6 基準が修正されたと注意しています。異なる日付、判定器、ツール条件の数字を一つのランキングに混ぜないでください。Claude Sonnet 5 のレビュー資料 (English)とエージェント推論ガイドも参照できます。
未確認のリスク
公開評価は自分のテスト環境ではありません。Endor Labs の Agent Security League では、Sonnet 5 + Claude Code は機能面に強い一方、脆弱性を閉じる結果は弱くなりました。要約は FuncPass 83.2%、本文は 82.6% と一致しないため、この記事では確定値として見出しに使いません。機能テストを通ったパッチが安全なパッチとは限らない、という狭い結論だけを採用します。
effort も単価を変えます。CodeRabbit は高い effort で厳格なバグ再現率が明確に改善せず、レビュー費用がほぼ倍になったと報告しています。token 単価だけでなく、思考 token、再試行、ツール、人の修正を記録してください。
コミュニティの声
Reddit では意見が分かれています。Exodus_Green は、公開チャートを読み、Sonnet 4.6 の low effort が Sonnet 5 の medium をエージェント検索で上回る可能性があると書きました(原文)。Rent_South は論理フローを各モデル五回試し、選択はワークフロー次第だとしました(同スレッド)。qubedView は文書抽出のような単発処理では Sonnet のタスク単価が低く、難しいコーディングでは Opus が向くと述べています(原スレッド)。TheRealJesus2 は作業を分解し、小さいモデルを低・中 effort、大きいモデルを計画と検証に使う方法を提案しました(同スレッド)。
これは個人の経験であり基準評価ではありません。X と YouTube も試しましたが、安定して帰属できる投稿やコメント本文は取得できませんでした。画像は作成せず、草稿を維持します。
誰が試すべきか
| 状況 | 最初の一手 | 理由 |
|---|---|---|
| 抽出、分類、ルーティング | low/medium effort で試す | 条件を固定した反復処理に合う。 |
| テスト付きの複数ファイル開発 | ツールを有効にして試す | 長い追従能力が主な改善点。 |
| 高リスクのセキュリティレビュー | 専用または上位モデルを残す | 機能の正しさは脆弱性修正を保証しない。 |
| 一行修正、低遅延チャット | Sonnet 4.6 や高速モデルと比較 | 小さな仕事には考えすぎる可能性がある。 |
| 選択画面に ID がない | アクセスを約束せず、アカウントと地域を確認 | カタログの名前は権利ではない。 |
ブラウザ自動化も認証、モデル制限、レビューを消しません。製品を比較する場合は AI ブラウザ比較 と AI ブラウザガイドを別に確認してください。
実際の次の一歩
小さく戻せる作業を一つ選び、正確なモデル ID、クライアント、effort、文脈、権限、token、時間、再試行、ツール呼び出し、独立検証の結果、人的介入を記録します。Sonnet 4.6 または現在のモデルで同じテストサンプルを実行してください。token 単価ではなく、完了した結果あたりのコストで判断します。
Tabbit Browser の説明はブラウザの流れを、Tabbit の実践は人をループに残す方法を説明しています。この草稿では Tabbit の Sonnet 5 実行を確認していないため、アクセス可能だとは主張しません。
結論
Claude Sonnet 5 は、エージェント型コーディング、ツールを使うワークフロー、反復的な知識作業で管理された試行に値します。Opus の自動的な代替でも、安全性や低コストの保証でもありません。effort、再試行、経路の制限、タスク分解で結果は変わります。必要な最低 effort から始め、実タスクのコストを測り、Tabbit の実アカウントテストと必要なコミュニティ画像を確認するまで草稿を保ちます。
出典
Anthropic: Introducing Claude Sonnet 5 — 発表、アクセス、安全、価格。
Claude Platform モデル一覧 — ID、文脈、出力、思考、メタデータ。
Claude Platform 料金 — API 料金の参照。
Endor Labs — 安全評価と限界。
CodeRabbit — コードレビューの評価。
Vellum — 日付付き比較と分割方式の注意。
よくある質問
Claude Sonnet 5 とは何ですか?
Claude Sonnet 5 は、Anthropic がコーディング、ツール利用、知識作業、エージェント型ワークフロー向けに提供する中間層モデルです。2026 年 9 月 20 日に確認した Claude Platform のカタログでは、API ID は claude-sonnet-5、適応型思考、100 万 token のコンテキスト、最大 128K の出力です。
Sonnet 4.6 から何が変わりましたか?
Anthropic は Sonnet 5 を、推論、ツール利用、コーディング、知識作業を強化した、よりエージェント向けのモデルとして説明しています。独立した報告では、レビューコメントがきれいになる一方、環境によって厳格なバグ再現率が下がる取引も示されています。
コンテキストと出力の上限はいくつですか?
2026 年 9 月 20 日に確認したカタログでは、コンテキストは 100 万 token、最大出力は 128K token です。これはカタログ上限であり、利用するクライアント、プラン、プロバイダーの実効上限は異なる場合があります。
Claude Sonnet 5 の料金はいくらですか?
現在の Claude Platform のスナップショットでは、入力は 100 万 token あたり 2 ドル、出力は 10 ドルです。API、サブスクリプション、クラウド、第三者の上乗せ料金は別で、適応型思考によってタスク単価も変わります。
どこで Claude Sonnet 5 を使えますか?
Anthropic の発表では Claude の各プランと Claude API が示されています。実際のモデル選択、地域、クォータ、ツールは経路ごとに異なるため、チームへ案内する前に実際のアカウントを確認してください。
切り替え前にどうテストすべきですか?
代表的なタスクを一つ選び、モデル ID、effort、ツール呼び出し、時間、token、人的介入を記録して Sonnet 4.6 や現在のモデルと比較します。一度の成功は本番の信頼性を示しません。