Grok 4.6で何が変わったか?性能・料金・ハーネスを分けて見る
Grok 4.6が、2026年8月12日に公開されました。xAIの発表で目を引くのは、長いエージェント作業への強化と、AA-BriefcaseでFable 5 Maxをわずかに上回った数字です。
ただし、モデルの点数だけで「一番いい」とは決められません。APIの価格、コンテキストの長さ、ツールをどう呼び、どう検証するかまで分けると、今回のリリースの実像が見えてきます。
Grok 4.6は、長い仕事を途中で手放さないための更新。
短い質問に答えるだけなら、すでに多くのモデルが十分に流暢です。差が出るのは、調べる、整理する、実装する、結果を確認するという工程が何度も続く仕事でしょう。
xAIはGrok 4.6を、コーディング、エージェント作業、知識労働向けのフロンティアモデルとして発表しました。発表文では、長い調査、コードベースをまたぐ作業、アプリや成果物を仕上げる仕事を、複数ステップにわたって維持することを強調しています。
公式発表では、Grok 4.6はxAI API、Grok Build、Cursorで利用可能とされています。OpenRouter、Vercel、Cloudflareなどのパートナー提供も案内されています。
ここでいうエージェントは、回答文を一度返して終わるチャットではなく、道具を呼び、作業状態を持ち、結果を見て次の操作を選ぶ仕組みです。モデルの能力だけでなく、道具の渡し方が結果を変えます。
AA-Briefcaseでは、Fable 5 Maxを3点上回った。
今回の見出しになったAA-Briefcaseは、単発の知識問題だけを見る試験ではありません。Artificial Analysisの説明では、データサイエンス、プロダクト管理、企業戦略などの4つの長期プロジェクト、合計91タスクで、表計算・プレゼンテーション・メモのような成果物を作らせます。
採点は、指示や証拠を満たしたかというルーブリック、分析の質、プレゼンテーションの質を組み合わせたEloです。つまり「正答率だけ」ではなく、仕事として提出できるかも見る評価です。
| 評価 | Grok 4.6 | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|
| AA Intelligence Index | 61 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 67.2% | 70.5% |
| AA-Briefcase | 1577 | 1502 | 1574 |
値は評価ごとに条件・ハーネス・提出方式が異なります。xAIは第三者モデルについて、自己申告または公開された結果のうち利用可能なものを掲載したと説明しています。
したがって「Grok 4.6がFable 5に勝った」は、この評価表のこの条件では3点高かったという意味です。Fable 5の公式ページが説明する長期のコーディングや知識労働への強みまで、同じ一文で逆転したわけではありません。
コスパは本当に強い。ただし「入力は半分」ではない。
Grok 4.6の標準的な短文脈価格は、入力が100万トークンあたり2ドル、出力が6ドルです。200kトークン以上の長文脈リクエストは、入力4ドル、キャッシュ入力1ドル、出力12ドルに切り替わります。
短文脈の入力 / 出力。500kコンテキスト。
OpenAI APIの入力 / 出力。長い入力は別条件。
Anthropic APIの入力 / 出力。キャッシュ割引あり。
公開API価格を単純比較すると、Grokの入力はGPT-5.6 Solの4割、出力は5分の1です。「入力は半分以下、出力は5分の1」という感覚は、入力については正しい方向ですが、正確には半分よりさらに安い。ただし、実際の請求額はキャッシュ、長文脈、推論トークン、ツール呼び出し、リクエスト回数で変わります。
大量の試行を回す開発者にとって、同じ予算で比較実験を増やせることは大きい。一方、少数の重要タスクなら、単価よりも失敗時のやり直し回数と人間の確認時間が支配的になる可能性があります。
「モデルの点数」から「仕事の仕組み」へ視線を戻す。
ハーネスとは、モデルの周りにある実行の仕組みです。プロンプトをどの順番で渡すか、ファイルをどう読むか、ツールをいつ呼ぶか、失敗時に再試行するか、途中の状態をどう要約するか。これらをまとめて、モデルを仕事に接続します。
何を見せるか
関連ファイルや履歴を渡しすぎると、重要な制約が埋もれます。500kを使えることと、500kを毎回詰め込むことは別です。
何を任せるか
検索、シェル、ブラウザ、テストをどう呼ぶかで、同じモデルでも到達できる仕事の範囲が変わります。
どう確かめるか
テスト、差分、スクリーンショット、出典確認を組み込めば、流暢な誤りを見つける機会が増えます。
だから「Grok 4.6とGPT-5.6 Solのどちらが上か」より、「自分の仕事で、どのモデルをどのハーネスに載せたとき失敗が少ないか」が実務の問いになります。Codexの操作感が使いやすいという評価も、モデル単体ではなく、承認、差分、サンドボックス、ツール連携を含む体験の評価です。
OpenAIやAnthropicの次の更新は、まだここで確定できる材料がありません。確かなのは、モデル性能が十分に高くなった今、評価対象が「頭の良さ」から「仕事を終える設計」へ広がっていることです。
試すなら、いきなり移行せず同じ仕事を3回走らせる。
Grok 4.6を試す最初の仕事は、公開されたベンチマークを再現することではありません。自分が一週間に何度も繰り返す、失敗しても戻せる仕事を選びます。
- 01対象を固定する。同じリポジトリ、同じ資料、同じ完了条件で、モデルだけを変える。
- 02数字を分けて記録する。成功率、所要時間、入力・出力トークン、やり直し回数、人間の確認時間を残す。
- 03ハーネスを固定する。ツール、権限、承認、テストの条件を揃え、モデル差と実行環境差を混ぜない。
- 04最後に単価を見る。1回の価格ではなく、完了した成果物1件あたりの総コストで判断する。
Grok 4.6の価格は、試行回数を増やしやすくする強い材料です。けれど、最終的に選ぶ理由は「安いから」だけではない。長い作業を保ち、確認し、戻せるか。その答えが、自分の机の上で出るまで評価は終わりません。