TabbitBlog

Grok 4.7 レビュー:料金表は据え置き、出力トークンは約2倍

Grok 4.7 の入力は100万トークンあたり2ドル、出力は6ドルのままです。xhigh では課題あたり約8.1万の出力トークン。どの作業ならその増加に見合うかを整理します。

この記事の内容
  1. このレビューを決める一つの数字
  2. 先に結論
  3. ベンチマークと、どこまで信じてよいか
  4. 確かに強いところ
  5. 分析は良くなり、スライドは良くならなかった
  6. Grok Build のコーディングエージェントは指数より動いた
  7. 料金表は、旗艦のなかではまだ安いマス
  8. 噛みつくところ
  9. 噛みつくのはトークンの請求で、料金表ではない
  10. 難しい端末課題の多くは今も失敗する
  11. 指数の一歩は小さく、努力レベルの取り違えが起きやすい
  12. 実際に言われていたこと
  13. 請求
  14. 感触
  15. 行を信じる前に、作業の形を試す
  16. 作業の形で選ぶ

Grok 4.7 は、xAI が 2026 年 9 月 21 日に出したコーディングと知識作業向けのモデルです。発売図の一行が勝っているかより、実際に書くトークンを含めて Grok 4.6 を離れる価値があるかが問いです。

Hacker News の dumberquestions は、トークン単価だけでは効率は分からない、と一行で罠を書いています。それがこのレビューです。前世代は Grok 4.6 の記事 にあります。料金の記事と代替モデルの記事は、このサイトにはまだありません。以下に Tabbit Browser での対照実験はありません。

このレビューを決める一つの数字

2026 年 9 月 22 日に原文を開いたとき、二つの数字は逆を向いていました。

発表ページ は Grok 4.7 xHigh を入力100万トークンあたり2ドル、出力6ドルとし、Grok 4.6 High と同じマスです。API 文書grok-4.7 に 2.00 ドルと 6.00 ドルを繰り返しています。

Artificial Analysis は xhigh で、Grok 4.7 が知能指数の課題あたり約 8.1 万出力トークンと測りました。Grok 4.6 の xhigh は約 3.8 万です。同じ記事では Grok 4.6 high が約 3.6 万、GPT-6 Astra max が約 2.7 万です。料金表は動かず、書く量だけ動きました。

指数は Grok 4.6 high の 44 から Grok 4.7 xhigh の 46 へしか動いていません。Grok Build のコーディングエージェント指数は 56 対 47 と、もっと動きました。短い答えなら、頼んでいない思考に払っています。前のモデルがリポジトリの途中で止まったなら、増えたトークンが今回の中身です。

先に結論

  • 公開単価は Grok 4.6 と同じです。知能指数での xhigh のトークン数は同じではありません。

  • いちばんはっきりした伸びはエージェント側です。Grok Build のコーディングスコアは 9 点上がり、文書の分析品質も大きく上がりました。

  • 総合指数は 2 点だけで、その図では Claude Fable 5.1、GPT-6 Astra、GPT-5.6 Sol にまだ遅れます。

  • スライドの仕上がりは逆です。分析の Elo は上がり、プレゼンテーションの Elo は下がりました。

  • Cursor のプラン消化と API のドルは別のメーターです。Ultra の一人が消化の速さを見ています。それが API 単価を書き換えるわけではありません。

ベンチマークと、どこまで信じてよいか

各行は自分の harness を持っています。xAI の表の Terminal-Bench は、Grok Build の Terminal-Bench ではありません。

信号Grok 4.7比べる相手条件(2026-09-22 確認)
単価100万あたり $2 / $6Grok 4.6 と同じ。Sol Max $4 / $20。Fable Max $10 / $50xAI の発表表、xHigh 列
API モデルgrok-4.7コンテキスト 50 万。既定は high。xhigh ありdocs.x.ai の一覧
知能指数46Grok 4.6 high 44。Sol max 47。Fable 5.1 と Astra 53Artificial Analysis、xhigh
課題あたり出力約 81kGrok 4.6 xhigh 約 38k。Astra max 約 27k同じ記事。請求書ではない
コーディング指数56Grok Build の Grok 4.6 xhigh は 47。Fable と Astra は 62ネイティブ harness
AA-Briefcase Elo1,657Grok 4.6 high 1,546。Fable 5.1 1,6784.7 は xhigh、4.6 側は high
分析とスライド1,994 / 1,499 EloGrok 4.6 high 1,690 / 1,519分析は上昇、発表は低下
CursorBench 4.046.3%、約 $6.01 / 課題Fable 5.1 Max 51.8%、約 $17.28xAI の散布図、Extra High
Terminal-Bench 4.038.0%Grok 4.6 High 20.3%。Sol Max 37.3%。Fable Max 57.9%xAI の表、xHigh 列
Grok Build の Terminal-Bench33%Grok 4.6 xhigh 18%Artificial Analysis。38% と平均しない

表の上に、三つの但し書きがあります。

努力レベルが揃っていません。「4.7 が 4.6 に勝った」のいくつかは xhigh と high の比較です。81k 対 38k は、両方 xhigh なのでこちらの方がきれいです。指数の +2 はその組ではありません。

Harness が話を変えます。コーディング指数には Grok Build が含まれます。知能指数は共通 harness です。xAI の Terminal-Bench は 38.0% です。Artificial Analysis は Grok Build の中で 33%、基線 18% と書いています。The Decoder の 26% は第三のキャプションなので、ここには使いません。

ベンダーの図は相手を選びます。発表ページの CursorBench には Fable、Opus、Sol、Sonnet が見え、GPT-6 Astra は見えません。その図の課題単価の安さは、Astra への勝利ではありません。ベンチマークは方角であって、ものさしではありません。

この表の前に Tabbit の課題ログはありません。続く節は公開測定と名前のあるコメントだけです。

確かに強いところ

分析は良くなり、スライドは良くならなかった

驚きは指数の 46 ではありません。AA-Briefcase では、分析品質が Grok 4.6 high の 1,690 Elo から Grok 4.7 の 1,994 へ動き、プレゼンテーションは 1,519 から 1,499 へ動きました。Artificial Analysis は 9 月 22 日の投稿でも同じ割れ方を書いています。Lite の分析 Elo は 1,698 から 1,994、発表は 1,531 から 1,499 です。二つの文章の 4.6 基線は同じ組ではありません。どちらも、分析の文章は良くなり、デッキの仕上がりは良くなっていない、と言っています。

X 上の Artificial Analysis の投稿。Grok 4.7 の AA-Briefcase Elo 1657、分析品質の上昇と発表品質の低下を示す
2026 年 9 月 22 日、Artificial Analysis の X 投稿。図はその Elo のスナップショットです。本文の 1698 と 1531 は、記事の 1690 と 1519 と同じ組ではありません。

元の投稿

成果物が市場モデル、メモ、表計算の論証なら、この割れ方は 2 点の指数より大事です。磨いたスライドが成果物なら、この項目で Grok 4.7 を祝う理由はありません。

Grok Build のコーディングエージェントは指数より動いた

Grok Build の中で、Artificial Analysis は DeepSWE v1.1 を 73% 対 65%、Terminal-Bench 4.0 を 33% 対 18%、SWE-Atlas-QnA を 63% 対 58% としました。相手はすべて Grok 4.6 xhigh です。合成点は 56 で、彼らが描いたネイティブ harness では 4 位、Fable 5.1 と GPT-6 Astra の後ろです。

長いコーディングのループには実のある一歩です。それでもシステム点です。モデルに Grok Build が足されています。既定の high であって xhigh ではない grok-4.7 の API 呼び出しが、同じ課題を通すとは書いてありません。ループと一回の答えの違いは、エージェント推論のノート が隣の説明です。

料金表は、旗艦のなかではまだ安いマス

xAI の CursorBench では、Grok 4.7 Extra High は 46.3%、課題あたり約 6.01 ドルです。Fable 5.1 Max は 51.8%、約 17.28 ドルです。Grok 4.7 High は 43.9% で約 4.69 ドル、Low は 33.1% で約 1.58 ドルです。Fable の最上段よりずっと少ない金額で低い点を買うことも、Fable の高い点を買うこともできます。別の買い物です。高い側は Fable 5.1 のレビューGPT-6 Astra のレビュー にあります。

噛みつくところ

噛みつくのはトークンの請求で、料金表ではない

約 8.1 万の出力トークンを 100 万あたり 6 ドルで置くと、出力分はおよそ 0.49 ドルです。入力、キャッシュ、ツール、再試行の前です。約 3.8 万はおよそ 0.23 ドルです。使ったのは Artificial Analysis が印刷した出力数だけです。あなたの請求書ではありません。

Cursor Ultra の Dynamix86 は、extra high、fast mode オフで同じ課題だと言い、Grok 4.7 がプランのパーセントを Grok 4.6 の約 2.5 倍の速さで削ったと結論しています。図を課題あたり 8.82 ドル対 3.53 ドルとも読んでいます。プランの時間は本人の記録です。ドルの組は図の読み取りであり、このレビューが測り直した数字ではありません。

Dynamix86 の Reddit 投稿。extra high で Grok 4.7 が Cursor Ultra の枠を Grok 4.6 の約 2.5 倍の速さで消費したと書いている
2026 年 9 月 21 日、r/cursor の Dynamix86。extra high、fast mode オフ、一つのアカウント。ドルの数字は著者による図の読み取りです。

元のスレッド

xAI はトークン料金が 2 倍の高速版も出していて、場所は Cursor と Grok Build だけです。公開 API にはありません。米国リージョンの端点は利用量に 10% の上乗せがあります。「高速」と長いプロンプトを重ねると、見出しの 2 ドル / 6 ドルとは別の製品です。

難しい端末課題の多くは今も失敗する

公式の Terminal-Bench 4.0、xHigh は 38.0% です。同じ表の Fable 5.1 Max は 57.9%、Sol Max は 37.3% です。Grok 4.7 は Grok 4.6 High の 20.3% より上で、それでもセットの大半を外します。HealthBench Professional は 56.7% で、Fable は 62.1%、Sol は 60.5% です。Harvey の法律エージェントは 19.6% で、Sol の 2.5% よりずっと高く、絶対値はまだ低いです。

何時間も続けるよう訓練されたモデルでも、その一時間で失敗できます。「4.6 より良い」を「仕事が終わった」と読まないでください。

指数の一歩は小さく、努力レベルの取り違えが起きやすい

46 対 44 は、短い会話、翻訳、単一ファイルの修正を変えません。GPT-5.6 Sol max はその指数で既に 47 で、単価はより高いです。全体の跳躍を待っていたチームは、今回のリリースにはそれを見つけません。xhigh を high と比べてから広い勝利を宣言するのは、都合のよいラベルを読んでいるだけです。

幻覚率は 29% 対 Grok 4.6 high の 34% と改善し、正解率は 47% 対 48% の近くに留まりました。正しくない応答のなかの誤りが減ったことは、知っていることが増えたことと同じではありません。

実際に言われていたこと

コメントは請求の議論と感触の議論に分かれます。ベンチマークの決着にはなりません。

請求

Hacker News のコメント。トークン単価は効率ではなく、課題単価では Fable 5.1 Low に対して厳しい、と書いている
2026 年 9 月 22 日に開いた、Grok 4.7 スレッドの dumberquestions と user43928。

dumberquestionsuser43928

saejox は、単価は高くてもトークンを少なく使うモデルについて、Astra にはまだ遠く、高いがトークンは少ない、と短く書いています。

Hacker News の saejox のコメント。Astra は高いが、課題に使うトークンは少ないと書いている
Hacker News の saejox。課題ログは付いていません。

コメント

感触

rayiner は、コードではなく法律調査で Grok が好きだと言います。Opus 5 より要点に着くのが速いからです。文は最近の Grok の系統についてであり、採点済みの 4.7 の事件ファイルではありません。

Hacker News の rayiner のコメント。法律調査では要点に着くので Grok を好むと書いている
Hacker News の rayiner。好みであり、法律の正確さの試験ではありません。

コメント

r/cursor の公開直後のスレッドは、同じ分裂の縮小版です。vandersky_ は 4.6 ほど遅くないと書きました。kodka は、考えすぎない Opus 5 のようだと書きました。exploriosapp はまだ試していて、文章は良くなったように感じるそうです。ImmediateAttention88 は Devin の SWE 2.0 と fusion API の方が良いとし、両方を使っています。リポジトリ、努力レベル、タイマーを出した人はいません。

r/cursor の Grok 4.7 公開直後のコメント。速さへの感想と、Devin を好む声が並ぶ
2026 年 9 月 21 日の r/cursor。共通課題のない初期印象です。

スレッド

編集としての読みは数字と揃います。メーターを見ている人は不満です。コーディングの重たさが減ることを望んだ人はまだ試しています。どちらも、繰り返した課題の点数は出していません。

行を信じる前に、作業の形を試す

ベンチマークの一行は、すでに開いているページで Grok 4.7 がどう振る舞うかを見せません。Tabbit Browser はその確認のためのクライアントです。モデル選択、開いているページ、ファイルが一つの場所にあります。AI ブラウザの案内Tabbit Browser の説明 がその配置です。エージェント型の閲覧ブラウザ自動化 は隣の仕事で、問いがモデルではなくブラウザなら 2026 年の AI ブラウザ一覧 があります。

境界は単純です。このレビューは Tabbit で固定の抽出、繰り返しの比較、時間を計ったページ課題を走らせていません。選択に Grok 4.7 がなければ、下のボタンは権限を作りません。API のドル、Cursor のプラン、Tabbit のアカウントは三つの価格です。たまたま当たった一つの答えを、たとえ撮っていたとしても成功率にはできません。

作業の形で選ぶ

作業Grok 4.7 を使うか理由見るもの
4.6 が途中で捨てる長いコーディング使う。Grok Build か Cursor で、まず xhigh 未満公開データで最大の伸びはコーディングエージェントプランのパーセントと出力トークン
単一ファイルの修正や雑談使わない指数は 2 点だけで、トークン数は跳ねた4.6 に残るか、Gemini 3.8 Flash のレビュー の小さいモデルを見る
メモ、モデル、表の論証分析が成果物なら使う分析 Elo が上がったスライドが良くなるとは期待しない
Fable がすでに通す端末一式価格がすべてを上回るとき以外は使わない公式 Terminal-Bench 38% は大半が失敗Grok Build の 33% を混ぜない
短さが大事な法律調査試し、出典を確認する一人の実務家が調子を好む。Harvey は 19.6% だけ調子は正しさではない
開いたタブの中の仕事選択に出ているときだけ Tabbit で試す足りないのはクライアントであり、より高い点数ではない成功率はここでは主張しない

Grok 4.7 は、前のモデルが止まり、増えたトークンを払えるときのアップグレードです。前のモデルがすでに終えているなら、高い習慣になります。

Tabbit Browser

よくある質問

Grok 4.6 から Grok 4.7 に替える価値はありますか?

長いコーディングエージェントや分析文書が Grok 4.6 で止まり、増えた出力トークンを払えるときだけ替える価値があります。単価は入力100万トークンあたり2ドル、出力6ドルのままです。Artificial Analysis は xhigh で、知能指数の課題あたり約8.1万出力トークン、Grok 4.6 の xhigh は約3.8万と測っています。短い単一ファイルの修正にはその思考量は要りません。

単価が同じなのに、なぜ高くなったと言う人がいるのですか?

料金表と請求は別の数字です。xAI の単価は Grok 4.6 と同じです。独立測定では xhigh の出力トークンが約2倍です。Cursor Ultra の利用者が extra high、fast mode オフで、プラン消化が速いとも書いています。それは一つのアカウントの記録であり、API の請求書ではありません。

Claude Fable 5.1 や GPT-6 Astra と比べるとどうですか?

Artificial Analysis の知能指数では Grok 4.7 xhigh は 46 です。Claude Fable 5.1 と GPT-6 Astra は 53、GPT-5.6 Sol は 47 です。Grok Build と Grok 4.7 のコーディングエージェント指数は 56 で、Fable と Astra は 62 です。オフィス作業の Elo では、総合指数ほど差は開いていません。

Grok 4.7 Fast とは何で、API から使えますか?

xAI の文書は Grok 4.7 Fast を、同じモデルをより速い基盤で提供し、標準トークン料金の2倍で請求するものと説明しています。Cursor と Grok Build にあり、Grok Build の無料枠には含まれず、公開 xAI API にはありません。公開のモデル名は grok-4.7 です。

CursorBench が高ければコーディングで勝ったことになりますか?

なりません。xAI 自身の散布図では Grok 4.7 Extra High は 46.3%、課題あたり約6.01ドル、Fable 5.1 Max は 51.8%、約17.28ドルです。公式の Terminal-Bench 4.0 は 38.0% で、その端末課題の多くは今も失敗します。Grok Build の 33% は別の harness なので、38% と同じマスに混ぜません。

Tabbit Browser で Grok 4.7 を使えますか?

Tabbit の Grok 4.7 ページは、アカウントのモデル選択に出ているときに使えると書いています。このレビューは Tabbit で固定課題を走らせていないので、成功率、遅延、クライアント費用は報告しません。API 単価、Cursor のプラン、Tabbit のアカウントは別の費用です。

次のステップへ

Tabbit と一緒に仕事をしましょう。

タブをまたいで調査し、繰り返しのブラウザ作業を自動化し、あらゆる文脈を手の届くところに。