TabbitBlog

Grok 4.7とGrok 4.6:単価は同じで、請求は長くなる

Grok 4.7のAPI単価はGrok 4.6と同じ入力2ドル、出力6ドル、コンテキスト500Kです。xhighの知能指数タスクは出力約8.1万トークン、4.6 highは約3.6万です。

この記事の内容
  1. 要点
  2. この比較を決める数字:同じ2ドル/6ドルで、出力は約8.1万対3.6万トークン
  3. 仕様と価格の一覧
  4. ベンチマークと、どこまで信じるか
  5. Grok 4.7が実際に離す場所
  6. コーディングエージェントの中の長い実行
  7. 文書と分析。発表品質は別に見る
  8. 幻覚率は下がり、正答率は上がっていない
  9. Grok 4.6を既定のままにする場所
  10. 短い作業。余分な思考そのものが費用になる
  11. Cursorのプラン。Fastと強度を固定していないとき
  12. すでにGrok 4.6で受け入れている作業
  13. 人が実際に言ったこと
  14. どう選ぶか
  15. ルートを移す前に、同じタスクをTabbitで走らせる

タスクが長く、ツールが多く、長いトークン請求を払う価値があるとき、試すモデルはGrok 4.7です。日常の短い作業はGrok 4.6のままにしてください。APIの表示単価は変わっていません。

xAIは2026年9月21日にGrok 4.7を公開し、Grok 4.6と同じ価格と速度で提供すると書きました。9月22日に開いた2枚のモデルカードは、料金と500Kコンテキストでは一致しています。終わったタスクの費用まで同じだとは示していません。Artificial AnalysisはGrok 4.7をxhighで評価し、Intelligence Indexの1タスクあたり出力約81,000トークン、Grok 4.6のhighでは約36,000トークンと数えました。切り替えるかどうかを決めるのはこの数字です。(xAIの発表Grok 4.7のモデルカードGrok 4.6のモデルカードArtificial Analysis

同じ緊張はCursorですぐに出ました。9月21日、u/Dynamix86は、1つのUltraアカウント、extra high、Fastオフで、名前のない同一タスクについて、Grok 4.7がGrok 4.6の約2.5倍の速さでプラン割合を消費し、大半の作業は4.6へ戻すと書きました。

RedditのDynamix86がCursor Ultra上のGrok 4.7とGrok 4.6の使用量を比べた投稿
u/Dynamix86、r/cursor、2026年9月21日。同一タスク、extra high、Fastオフ、プラン使用量は約2.5倍という見積もり。

これは1アカウント、1タスクです。APIの請求書も回答品質も証明しません。「同じ価格」が最初の問いとして外れている理由にはなります。Grok 4.6の概要は前のモデル自体の話です。このページは二者の選び方だけを扱います。仕様はGrok 4.7のモデルページ (English)Grok 4.6のモデルページ (English)にもあります。

要点

  • 2枚のAPIカードは、20万コンテキスト未満で100万トークンあたり2ドル / キャッシュ0.50ドル / 出力6ドル、20万超で4ドル / 1ドル / 12ドルです。500Kの窓は一致します。

  • Grok 4.7 xhighは知能タスクあたり出力約8.1万トークン、Grok 4.6 highは約3.6万、Grok 4.6 xhighは約3.8万です。出力6ドルだけの計算では約0.49ドル対0.22–0.23ドルです。

  • Intelligence Indexの動きは+2で、xhigh対highです(46対44)。Coding Agent Indexの動きはGrok Build内の揃ったxhighで+9です(56対47)。

  • xAIの発表表は掲載行のすべてで上ですが、列はGrok 4.7 xHighとGrok 4.6 Highです。その表のDeepSWEは4.7をhigh effortと記しています。差は同じ段の実験ではありません。

  • 短く繰り返す作業はGrok 4.6のままです。長いコーディングや文書中心のタスクが4.6で十分に失敗し、追加トークンを払う価値があるときだけGrok 4.7を試します。

  • この記事のために、同一タスクのTabbit実行は完了していません。モデルページは測定された勝ちではありません。

この比較を決める数字:同じ2ドル/6ドルで、出力は約8.1万対3.6万トークン

発表の見出しは、Grok 4.7が「比較対象モデルの2倍速く、半額」だと書き、本文はGrok 4.6と同じ価格と速度で提供すると書きます。前の文は比較対象も速度の単位も名指ししません。料金カードが支えるのは後の文です。

変わったのは、新しいモデルが使うトークン数です。Artificial Analysisは、Grok 4.7 xhighがIntelligence Indexの1タスクあたり出力約81kトークン、Grok 4.6 highが36kで、125%多いと書きました。同じ記事の後段では、81kはGrok 4.6 xhighの38kの2倍超だとも書きます。両方残します。36kは同じ強度の組ではありません。38kの方が同じ強度です。

Intelligence Index 1タスクあたりの出力トークン(Artificial Analysis、2026-09-21)
Grok 4.7 xhigh     約81k
Grok 4.6 high      約36k     (トークン+125%、強度ラベルは高い)
Grok 4.6 xhigh     約38k     (同じ強度ラベルでトークンは2倍超)

共通の出力6ドル / 100万での出力分だけ
81k × $6 / 1M  ≈  $0.49
36k × $6 / 1M  ≈  $0.22
38k × $6 / 1M  ≈  $0.23

この計算は請求書ではありません。入力トークン、キャッシュヒット、ツール呼び出し、再試行、APIではなくプラン割合で課金するクライアントを無視しています。そのトークンが買ったスコアも無視しています。

Intelligence IndexはGrok 4.6 highの44からGrok 4.7 xhighの46へ動きました。エージェント型の知識作業の外では、Artificial AnalysisはGrok 4.7がGrok 4.6 highとおおむね揃い、Terminal-Bench 4.0が4.5ポイント、GDP.pdfが3.0ポイント上がり、AA-LCRが3.7ポイント、AutomationBench-AAが1.1ポイント下がったと書きました。この4行の絶対点は本文に印刷されていません。

より大きい動きはコーディングエージェント指数で、こちらは同じ強度です。Grok 4.7 xhighとGrok Buildは56、Grok 4.6 xhighとGrok Buildは47です。そのハーネス内でDeepSWE v1.1は65%から73%、Terminal-Bench 4.0は18%から33%、SWE-Atlas-QnAは58%から63%です。これらの端末数値はxAI発表表の38.0%と20.3%ではなく、統一ハーネスの+4.5ポイントでもありません。ハーネスと強度が違えば、3つのTerminal-Benchは同時に成立し得ます。

追加トークンが、やり直すはずだった長い実行を買うならGrok 4.7です。強度ラベルをまたいだ指数+2が、およそ2倍の出力に見合わないならGrok 4.6のままです。

仕様と価格の一覧

2026年9月22日に2枚のモデルカードで確認しました。カード上の「より高いコンテキスト」は、リクエストが20万トークンを超える意味です。Cursorの文書は256Kの境界を使い、この表には入りません。

項目Grok 4.7Grok 4.6行の使い方
APIモデルIDgrok-4.7grok-4.6IDを固定する。比較にlatest別名は使わない。
コンテキスト窓500,000500,000クライアントはより短く出せる。CursorのGrok 4.7ページは標準256K、長コンテキスト500Kと書く。
モダリティテキストと画像を入力、テキストを出力テキストと画像を入力、テキストを出力画像サイズ制限は共有ドキュメント側で、IDを選ぶ理由ではない。
入力 / キャッシュ / 出力、20万以下100万あたり $2 / $0.50 / $6100万あたり $2 / $0.50 / $6表示単価は同じ。
入力 / キャッシュ / 出力、20万超100万あたり $4 / $1 / $12100万あたり $4 / $1 / $12長コンテキストの倍率も一致する。
知識カットオフモデル索引に May 2026この日開いたカードには再掲なし古い記事の日付を引き継がない。
Fast発表文:出力速度2倍、価格2倍の高速版。ベンチマーク行はないこの日開いたカードには記載なし2つのFastスイッチを同じ製品と思わない。

xAIの発表表も、両Grok列に入力2ドル、出力6ドルを印刷し、横にGPT-5.6 Solの4ドル / 20ドル、Fable 5.1の10ドル / 50ドルを置きます。それは表示価格の比較です。終わったタスクの比較ではありません。Fable 5.1はxAI自身の複数行でまだ先行します。そのトレードオフはFable 5.1のレビューの話で、Grokが置き換えたという主張ではありません。

同じ日に開いたCursorのGrok 4.7文書は、中国語の cursor.com/cn/docs/models/grok-4-7 へ飛びました。ページはGrok 4.7を、Grok 4.6、Grok 4.5、Composer 2.5と共有する利用枠に入れます。オンデマンド料金は短いコンテキストのAPIカードと一致し、入力2ドル、キャッシュ0.50ドル、出力6ドルです。Fastは4ドル / 1ドル / 12ドルで、Pro以上ではFastが既定速度だとページは書きます。256Kを超える入力は、標準が2倍、Fastは標準料金の3倍で、上限500Kです。CursorのパーセントとAPIのドルは別のメーターです。両方で強度とFastを固定してから比べます。

ベンチマークと、どこまで信じるか

表は2つです。1つ目はxAIの発表表で、ページが実際に印刷した強度ラベル付きです。2つ目はArtificial Analysisで、強度が揃うものと、揃わない指数です。

xAI発表表、2026年9月21日Grok 4.7Grok 4.6GPT-5.6 SolFable 5.1
列の強度ラベルxHigh。DeepSWEはhigh effortHighMaxMax
表示価格、100万あたり入力 / 出力$2 / $6$2 / $6$4 / $20$10 / $50
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

その表では、Grok 4.7がすべての行でGrok 4.6の上です。CursorBench、AA Briefcase、Terminal-Bench、HealthBench ProfessionalではFable 5.1の上ではありません。GPT-5.6 Solに対しては7つのスコア行のうち5つで上、DeepSWEとHealthBenchでは下です。サンプル数、ハーネス、信頼区間はページにありません。図の注釈は、ベンチマークを方向性のあるベンダー結果だと書いています。

同じページのCursorBench散布図にGrok 4.6はありません。Grok 4.7は急な強度の階段です。Extra Highは46.3%、1タスク約6.01ドル、出力70,141トークン。Highは43.9%、4.69ドル。Mediumは41.6%、3.49ドル。Lowは33.1%、1.58ドルです。強度ラベルのない「Grok 4.7」は1つのスコアではありません。

Artificial Analysis、記事日付2026年9月21日Grok 4.7Grok 4.6強度の組言ってよいこと
Intelligence Index v4.34644xhigh対high+2点。同じ段の結果ではない
知能タスクあたり出力トークン約81khigh約36k、xhigh約38k混合請求の動きは指数より大きい
Coding Agent Index、Grok Build5647xhigh対xhighベンダーのコーディングエージェントで+9
DeepSWE v1.1、Grok Build73%65%xhigh対xhigh発表表の71.0 / 65.2ではない
Terminal-Bench 4.0、Grok Build33%18%xhigh対xhighxAIの38.0 / 20.3ではない
SWE-Atlas-QnA、Grok Build63%58%xhigh対xhigh端末の跳ねより小さい
AA-Briefcase Elo1,657highで1,546xhigh対high分析品質は上がり、発表品質は下がる
GDPval-AA Elo1,695highで1,605xhigh対high知識作業は向上。xAIの図ではFable 5.1が1,735
幻覚率、AA-Omniscience29%highで34%xhigh対high正答率は47%対48%のまま

Grok Buildを見るならコーディングエージェントの塊を読みます。共通ハーネスを見るなら知能指数の塊を読みます。「Grokは10%良い」に平均しないでください。Hacker Newsでは、なぜ4.7 xhighを4.6 highと比べるのか、という問いが出ました。そのスレッドの返信は、4.6にxhighがいつ来たかで一致しません。Artificial AnalysisはGrok 4.6 xhighのコーディングエージェント点数を出しているので、少なくとも1つの現行評価にそのラベルはあります。発表表はまだそれを使いません。

Grok 4.7 xhighをGrok 4.6 highと比べる理由を問うHacker Newsのコメント
AM1010101、Hacker News、2026年9月22日。発表の比較は推論強度のラベルを混ぜている。

Grok 4.7が実際に離す場所

コーディングエージェントの中の長い実行

いちばんきれいな向上は、強度が揃ったものです。Grok Buildではコーディングエージェント指数が9点上がり、各要素も上がりました。端末作業の動きが最大で、そのハーネスでは18%から33%です。失敗の形が、何時間もかかるリポジトリ作業の途中停止なら、この行がパイロットの理由になります。Grok BuildがClaude CodeやCodexに勝つとは書いていません。Artificial Analysisは、Grok 4.7とGrok Buildをネイティブハーネスの4位とし、上位はClaude Fable 5.1、GPT-6 Astra、Claude Opus 5です。

xAI自身のTerminal-Bench 4.0の20.3%から38.0%も同じ方向ですが、強度ラベルは揃っていません。18から33の独立した二度目の測定ではなく、ベンダー側の補強証拠として扱います。

文書と分析。発表品質は別に見る

AA-BriefcaseでGrok 4.7は1,657 Elo、Grok 4.6 highより111上で、Artificial Analysisの記述ではClaude Opus 5とClaude Fable 5.1の直後です。分析品質は1,994 Elo対1,690。発表品質は1,499対1,519です。分析は良くなり、デッキは少し悪くなりました。

公開のAA-Briefcase-Liteのデューデリジェンス場面では、この分裂がよりはっきりします。分析Eloは1,698から1,994、発表Eloは1,531から1,499です。例のデッキのAPI費用は、Grok 4.7 xhighが約8ドル、Grok 4.6 xhighが約4.40ドルです。同じ強度で、API費用は約1.8倍、分析は強く、発表は弱い、という組です。1つの場面であり、オフィス作業全体のベンチマークではありません。GDPval-AAはhigh対xhighで1,605から1,695 Eloへ動き、xAIのGDPval図はFable 5.1 maxを1,735に置きます。

Artificial AnalysisがXでGrok 4.7とGrok 4.6のAA-Briefcase点数と例のデッキ費用を比べた投稿
Artificial Analysis、X、2026年9月22日。分析Eloは上がり、発表Eloは下がり、xhighの例デッキは約8ドル対4.40ドル。

幻覚率は下がり、正答率は上がっていない

AA-Omniscienceの幻覚率はGrok 4.7 xhighが29%、Grok 4.6 highが34%です。正答率は47%対48%です。指数は30から32へ動きました。自信のある誤答を減らしたいなら、これは実在する変化です。正答を増やしたいなら、この組はそれを示しません。強度ラベルはまだ違います。

Grok 4.6を既定のままにする場所

短い作業。余分な思考そのものが費用になる

同じ単価で約2倍の出力を買う交換は、その出力が再試行を防ぐときだけ得です。範囲の決まった抽出、短いパッチ、状態のJSONでは、Grok 4.6の短い軌跡が機能です。知能トークンの図を見たHacker Newsの読者は、これをトークン効率の後退と呼びました。そのコメントは新しい測定を足しません。同じArtificial Analysisの図を、能力向上ではなく費用の問題として読んだものです。

Grok 4.7のトークン効率がGrok 4.6より後退したとするHacker Newsのコメント
notduckrabbit、Hacker News。知能指数のトークン図はGrok 4.6に対する後退に読める。

Artificial AnalysisがGrok 4.6 highに対する後退として名指ししたAA-LCRとAutomationBench-AAでは、4.6を離れる理由がありません。絶対点は未公表なので、下落幅は公表された差分だけです。3.7ポイントと1.1ポイントです。

Cursorのプラン。Fastと強度を固定していないとき

2ドル/6ドルの表示単価は、Cursor Ultraのパーセントを説明しません。Dynamix86の時間は単一利用者のログです。Grok 4.7は1パーセントポイントあたり34分、55分、38分。同じ日の早い時間のGrok 4.6は133分と101分。どちらもextra highでFastオフです。著者はArtificial Analysisの図を、コーディングエージェント1タスクあたり8.82ドル対3.53ドルとも読みました。そのドル額は著者の図の読みです。このページのために開いたArtificial Analysisの記事本文にはその文がないので、投稿に帰属したままにします。

同じスレッドの返信はもっと直接でした。ベンチマークを脇に置いても、費用が明らかに高すぎるので、このリリースは良く見えない、という内容です。

Grok 4.7は費用が高すぎると書いたRedditのtruecakesnakeのコメント
u/truecakesnake、r/cursor。異議は請求であり、名前のあるベンチマークではない。

Cursorの文書も、Pro以上ではFastが既定で、トークン料金は2倍だと書きます。個人テストの片側だけがFastなら、2倍の価格は設定であり、モデル変更ではありません。RedditのログはFastオフと書いています。気軽な比較の多くはそうしません。

すでにGrok 4.6で受け入れている作業

Grok 4.6のレビューノート (English)は、この単価の500Kエージェントモデルをすでに説明しています。Grok 4.7はAPIカードに新しいコンテキスト段を足さず、表示価格も下げていません。4.6がすでに仕事を終え、長い端末作業や長い文書で止まっていないなら、更新は任意です。HealthBench ProfessionalはxAI自身の表でGPT-5.6 SolとFable 5.1の後です(56.7対60.5と62.1)。臨床推論のための切り替えも、この話ではありません。

人が実際に言ったこと

初期コメントは費用派と感触派に分かれます。どちらも数時間の話です。どちらもプロンプト、リポジトリ、スコアを公開していません。

請求。 Dynamix86の約2.5倍のプラン使用量と、truecakesnakeの「費用が明らかに高すぎる」は、トークン図の隣に置きます。別のHacker Newsコメント、notduckrabbitは同じ効率差を指しました。まとめると、公開当日に高流量のルートを移さない、ということです。

感触。 同じ午後の別のr/cursorコメントはモデルを好み、価格には触れていません。

Grok 4.7はGrok 4.6ほど遅くないとするRedditのコメント
u/vandersky_。初期の速度印象で、時間ログはない。
Grok 4.7を考えすぎないOpusにたとえたRedditのコメント
u/kodka。Opusとの感触比較であり、同じタスクではない。
Devin SWE 2.0をGrok 4.7より好むRedditのコメント
u/ImmediateAttention88。DevinのSWE 2.0とFusionを好み、両方のエージェントIDEはまだ使っている。

「速い」「考えすぎない」はチャットでは正しく、81kトークンを出すxhighのコーディングエージェントでは同時に誤りになり得ます。「4.6ほど遅くない」にはトークン数が付いていません。Artificial Analysisは長いプロンプトで毎秒約188トークン、知能タスクあたりデコード約7.1分と測りました。最初のトークンまでの時間とオーバーヘッドは除きます。速い第一印象と長いエージェント軌跡は両立します。

2026年9月22日にYouTubeで「Grok 4.7 vs Grok 4.6」を検索すると、発表解説が出て、パラメータ数を推測する公開前の動画も含みました。xAIの発表ページは「新しく、より大きいベースモデル」とだけ書き、パラメータ数はありません。動画の発言は使いません。

どう選ぶか

総合優勝はありません。作業の形で選び、決定の中に強度ラベルを残します。

作業選ぶもの理由見るもの
短い抽出、分類、小さいパッチGrok 4.6指数の向上は小さく、出力軌跡はずっと短い一行の答えにxhighを払わない
利用枠の上の繰り返しCursor作業失敗していなければGrok 4.6Ultraの1ログがextra high、Fastオフでプラン使用量約2.5倍モデルを責める前にFastと強度を固定する
Grok Buildや類似エージェントの数時間コーディングGrok 4.7 xhighを試す揃ったxhighでCoding Agent Index 56対47指数だけでなく、終わったタスクを比べる
市場モデル、メモ、対象デッキGrok 4.7を試し、その後デッキを直す分析Eloは上がり、発表Eloは下がり、例は約8ドル対4.40ドルスライドに人の確認を1回入れる
20万超の長コンテキストAPI価格ではどちらでも同じ両カードとも20万超で料金が2倍Cursorの256K境界は別のメーター
Fable級のCursorBenchやTerminal-Benchが必要この対ではないxAIの表でFable 5.1 Maxは51.8%と57.9%その選択はGrokではなくFableの料金カードで見る

実用テストは、採点方法が分かっている1タスクです。同じ強度、Fastオフ、同じハーネス。完了したか、人の修正、出力トークン、APIのドルまたはプラン割合を記録します。1回の成功は成功率ではありません。

ルートを移す前に、同じタスクをTabbitで走らせる

ベンチマークの1行は、自分のタブ、文書、途中の調査でモデルがどう振る舞うかを教えません。Tabbit Browserはその確認の作業場です。モデルは、読んでいるページの横に置けます。ページを見ない別チャットに置く必要はありません。エージェントブラウザのガイドエージェント推論のガイドは、モデル点数と、終わった複数ステップの流れを分けます。AIブラウザ比較Tabbitブラウザのガイドは、モデルの外側の製品です。Tabbitが欲しいクライアントでないなら、2026年のAIブラウザまとめがより広い集合です。

Tabbitの新しいチャットで、複数モデルがTabbitとは何かに横並びで答えている画面
Tabbitは同じ質問に複数モデルを置けます。この画面は他のモデルで、Grok 4.7対Grok 4.6の実行ではありません。

両方のGrok IDはTabbitに登録されています。セレクタにGrok 4.7やGrok 4.6が出るかは、アカウントと現在の一覧によります。この記事にTabbitの記録、トークンログ、勝者はありません。両方のIDがあるなら、採点方法が分かっている1タスクを、強度とツールを揃えて走らせ、変化が軌跡の長さだけならGrok 4.6を残します。Tabbitの実践ガイドはブラウザでの働き方であり、すべてのアカウントに特定のGrokがあらかじめ入っているという主張ではありません。

APIの表示価格、Cursorの利用枠、Tabbitの利用可否は、3つの別の請求です。足し合わせないでください。

Tabbit Browser

よくある質問

Grok 4.7はGrok 4.6より優れていますか?

タスクと推論強度によります。Artificial AnalysisのCoding Agent Indexでは、Grok 4.7 xhighとGrok Buildが56、Grok 4.6 xhighが47です。Intelligence IndexはGrok 4.6 highの44からGrok 4.7 xhighの46への動きで、エージェント以外の一部タスクは後退しています。総合優勝はありません。

Grok 4.7とGrok 4.6の価格は同じですか?

2026年9月22日に開いたxAIのモデルカードでは、どちらも20万コンテキスト以下で入力100万トークン2ドル、キャッシュ入力0.50ドル、出力6ドル、20万超で4ドル、1ドル、12ドルです。Cursorは別の利用枠とFastを記載しています。表示単価が同じでも、終わったタスクの費用が同じとは限りません。

トークン単価が変わらないのに、なぜGrok 4.7の方が高くなり得ますか?

Artificial Analysisは、Intelligence Indexの1タスクあたり出力トークンをGrok 4.7 xhighで約81,000、Grok 4.6 highで約36,000、Grok 4.6 xhighで約38,000と測りました。出力100万トークン6ドルなら、出力だけでも約0.49ドル対0.22ドルまたは0.23ドルです。入力、キャッシュ、ツール、再試行は含みません。

どのGrok 4.7のベンチマーク向上が同じ推論強度ですか?

Coding Agent Indexはxhigh対xhighで56対47です。Grok Build内のDeepSWEは73%対65%、Terminal-Bench 4.0は33%対18%、SWE-Atlas-QnAは63%対58%です。xAIの発表表はGrok 4.7 xHigh対Grok 4.6 Highで、その表のDeepSWEは4.7をhigh effortと記しています。それらの行を同じ段の実験として扱わないでください。

CursorでGrok 4.6からGrok 4.7へ切り替えるべきですか?

長いコーディングや文書なら、利用枠の減りが速くなることを受け入れられる場合に試します。Cursor Ultraの利用者がextra high、Fastオフで、プラン使用量が約2.5倍と見積もり、大半の作業を4.6へ戻すと書きました。4.7の方が速い、考えすぎない、という初期感想もあります。比べる前に強度とFastを固定してください。

Tabbit BrowserでGrok 4.7とGrok 4.6を比べられますか?

どちらもTabbitのモデルページがあります。セレクタに出るかはアカウントと現在の一覧によります。この記事に同一タスクのTabbit実行は含まれないので、名前があること自体は、あるワークフローで勝った証拠ではありません。

次のステップへ

Tabbit と一緒に仕事をしましょう。

タブをまたいで調査し、繰り返しのブラウザ作業を自動化し、あらゆる文脈を手の届くところに。