Daily AI Architecture Slide

Grok 4.6リリース — サプライズはどこにあるか

8月12日に一般提供が始まったGrok 4.6を、予告とのギャップ、ベンチマーク、価格、エージェント能力の15枚で読み解く。新世代ではなく、同じ1.5Tと$2/$6のまま前線に戻った急加速。

01Daily Architecture · 2026.08.13

Grok 4.6 リリース — サプライズはどこにあるか

8月12日、xAIはGrok 4.6をCursor・Grok Build・APIへ一般提供した。予告は「8月7日頃」。到着はほぼ予定どおり。驚きは日付ではなく、同じ1.5Tと$2/$6のまま前線に戻った密度にある。

総合サプライズ
68 / 100

新世代ではなく、5週間の急加速。

AA Index
61

4.5の56から+5。Sol Maxと同着。

価格
$2 / $6

入力 / 出力。4.5から据え置き。

本丸
Agents

GDPVal 1753で首位。長軌跡の自己検証。

AI Intelligence Hub · Daily Architecture Slide · 2026.08.1301 / 15
導入・サプライズ分析ロードマップ
02Agenda

本日の流れ

01
Fact
何が来たか
出荷面・スペック・提供チャネルを先に固定する。
02
Expectation
予告とのギャップ
8/7目標、1.5T、4.7予告。到着そのものは低サプライズ。
03
Measure
ベンチと価格
AA・GDPVal・SWE・エージェント系の内訳を読む。
04
Interpret
サプライズの構造
期待どおり/上回った/まだ穴、の三層に分解する。
05
Act
今日からの使い方
4.6に切る仕事、待つ仕事、4.7に残す仕事。
Lens
知能指数から実行価値へ
スコアの上振れより、長時間タスクが完走するか。
AI Intelligence Hub · Daily Architecture Slide · 2026.08.1302 / 15
本日の流れ
03Thesis

予告どおりの到着、予告を超えた中身

サプライズは「出たか」ではなく「同じ土台でどこまで詰めたか」。日付は平凡、密度は非凡。

低サプライズ

到着そのもの

Musk氏は7月末に「4.6は2週間後、4.7は4週間後」と投稿。目標日8/7に対し実出荷は8/12。5日遅れは誤差。バージョン番号もインクリメンタル。

高サプライズ

中身の密度

パラメータは4.5と同じ1.5T。価格も$2/$6据え置き。その条件でAA 61(Sol Max同着)、GDPVal・AA-Briefcase・Harvey LABで首位。

読み筋

スケール戦争を拒否

4.6は「大きくした」モデルではない。SFT/RLと長時間エージェントに全振りした中間世代。本命の2.1Tは4.7に残した。

AI Intelligence Hub · Daily Architecture Slide · 2026.08.1303 / 15
予告どおりの到着、予告を超えた中身
04Timeline

期待値タイムライン

市場は8/7前後の到着を織り込み済みだった。遅延は小さく、物語の重心は「4.7待ち」から「4.6で前線に戻った」へ移った。

07.08

Grok 4.5

AA 56。$2/$6でコスト効率の物語を先に取った。

07.24–28

2週 / 4週

Musk氏「4.6は2週間、4.7は4週間」。1.5T + 改善SFT/RL。

08.07

目標日

出荷なし。予測市場は8/14までの一般提供を高確率視。

08.11

Grok Bot

永続クラウド上の指名エージェント。4.6の受け皿が先に出た。

08.12

Grok 4.6 GA

Cursor / Build / API。初週は2倍クォータ。

+3–4週

Grok 4.7

2.1T。遅くなるがトークン効率はさらに上がる、と予告。

AI Intelligence Hub · Daily Architecture Slide · 2026.08.1304 / 15
期待値タイムライン
05Scorecard

サプライズ度スコアカード

6軸の加重ではなく、単純平均に近い総合68。驚きの大半は価格効率とエージェント、欠落はスケールと到着日。

タイムライン
32

8/7予告に対し8/12出荷。5日遅れは誤差で、到着そのものに驚きはない。

スケール
28

1.5T据え置き。2.1Tの4.7が本命という予告どおり。

知能指数
72

AA 56→61。5週間でSol Maxと同着、Fableに1差。

エージェント
84

GDPVal首位、APEX +10.4pt、自己検証が長軌跡に現れた。

価格効率
88

$2 / $6据え置きのまま前線。キャッシュ入力は$0.50。

実装体験
76

視覚・UIの一発目が強く、Cursor / Buildで即日使える。

OVERALL68

中の上。新世代ではない。

市場が「巨大化」を期待していたなら失望する。実務が「同じ値段で長時間タスクが走るか」を見ているなら、ここ数週間で最も密度の高い出荷。

AI Intelligence Hub · Daily Architecture Slide · 2026.08.1305 / 15
サプライズ度スコアカード
06Spec

スペック一望 — 変わったものと据え置いたもの

Context
500k

コンテキスト窓。長軌跡の前提。

Output
無制限

テキスト出力上限なし。

Modalities
T + I → T

画像入力可。出力はテキストのみ。

Reasoning
xhigh

low / medium / high(既定)に追加。

価格(プロンプト < 200k)

入力 $2 / キャッシュ $0.50 / 出力 $6(1Mトークン)。4.5と同水準。

価格(プロンプト ≥ 200k)

入力 $4 / キャッシュ $1 / 出力 $12。長いコンテキストは倍額。

提供面

Cursor、Grok Build(初週2倍)、API、OpenRouter、Vercel、Cloudflare。Fast版は2倍価格。

AI Intelligence Hub · Daily Architecture Slide · 2026.08.1306 / 15
スペック一望
07Training

同じ1.5Tで何を伸ばしたか

4.6は基盤を大きくしていない。4.5より長い補完学習、4.5自身が再生したSFT、広いエージェントRLで中身を詰め替えた。

01 · Foundation

より長い補完学習

  • 推論と高度な技術概念のモデル生成データ
  • 高品質なエンジニアリングデータ
  • 最適化器と学習レシピの更新
02 · SFT

4.5が軌跡を再生

  • 推論努力・エージェントハーネス横断
  • STEM / SWE / ナレッジワーク
  • 問題軌跡はモデル検査で除去
03 · RL

領域特化の長時間任務

  • 一般コーディングとナレッジワーク
  • カーネル最適化、Web、CAD
  • 長軌跡での自己テストが出現
AI Intelligence Hub · Daily Architecture Slide · 2026.08.1307 / 15
同じ1.5Tで何を伸ばしたか
08Evals

ベンチマーク — 前線復帰の内訳

総合知はSolと同着、実行価値は複数項目で首位。穴はTerminal-BenchとDeepSWE。太字は各項目の最高値。

評価Grok 4.6Grok 4.5GPT-5.6 Sol MaxFable 5 Max
AA Intelligence61566162
GDPVal-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode Ext.61.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench 3.026%15.7%34.6%34.1%
AA-Briefcase1577131315021574
Harvey LAB15.8%12.9%2.5%11.3%
AI Intelligence Hub · Daily Architecture Slide · 2026.08.1308 / 15
ベンチマーク — 前線復帰の内訳
09Agents

本丸はロングランニングエージェント

公式の第一文は知能指数ではなく「long-running agents」。数値がそれを裏書きする。

GDPVal-AA v2
1753

4.5から+227。Sol 1728、Fable 1741を逆転して首位。

APEX-Agents
+10.4pt

47.1 → 57.5。Fable 59.2に接近。

AA-Briefcase
1577

+264。知識労働の長文書でも首位。

ターン効率
53

平均ターン。Opus 5系の約103に対し半分近い。

Qualitative

長軌跡で自己検証が現れた

「次に進む前に自分の成果を確認する」挙動が、長い軌道で観測され始めた。研究・コードベース横断・プロダクト化まで居座る、というのが公式の主張。

It stays with complex tasks across many steps.xAI · Introducing Grok 4.6
AI Intelligence Hub · Daily Architecture Slide · 2026.08.1309 / 15
本丸はロングランニングエージェント
10Interactive

ビジュアルの一発目が強くなった

4.6のもう一つの焦点は「より野心的なインタラクティブ/視覚仕事」。知能戦争ではなく、最初の成果物の質。

First pass

構造と視覚言語を一発で置く

具体的なプロダクト案を渡すと、アプリの骨格とトーンを一度のパスで立てられる、とxAIは書く。4.5より「最初のドラフト」が厚い。

Loop

厚い初稿から反復する

最短経路は、薄い骨組みではなく実質のある初版を出し、ループで削ること。Build / Cursorの初週2倍クォータはこの使い方を前提にしている。

Surprise

ここが製品側の驚き

ベンチの+5点より、デザイナー/ビルダーが触った瞬間の「一発目が使える」感の方が、現場のサプライズになる。数値では測りにくい層。

AI Intelligence Hub · Daily Architecture Slide · 2026.08.1310 / 15
ビジュアルの一発目が強くなった
11Pricing

価格据え置きが最大の攻撃

知能を上げて値段を据え置くのは、値下げより攻撃的だ。4.6の最大サプライズは値札にある。

List price
$2 / $6

4.5と同じ。キャッシュ入力 $0.50。200k超は倍額。Fast版は2倍。価格表を動かす代わりに、同じ値段で前線に乗せた。

知能(AA)
61 ≈ Sol
GDPVal
首位
入力単価
$2 据置
ターン数
約半分

実コストは単価×ターン。単価が同じでも完走が短いなら、タスク単価はさらに下がる。Paretoの右側ではなく左上を取りにいっている。

AI Intelligence Hub · Daily Architecture Slide · 2026.08.1311 / 15
価格据え置きが最大の攻撃
12Landscape

競争地図 — Sol・Fableとの距離

High intel · High cost

Fable 5 Max / Opus 5

AAは62前後。総合知の頂点。ターン数が多く、知識労働の完走コストは重い。頂点を取りにいく仕事向き。

High intel · Low cost

Grok 4.6 ← いまここ

AA 61でSolと同着、GDPVal首位、$2/$6。コスト効率の前線。エージェントと実装ループの既定値になりうる。

Mid intel · Low cost

Grok 4.5(昨日まで)

同じ値段、一段下の知能。4.6が出た瞬間に「安くて速い」物語の主役を譲った。

High intel · Same tier

GPT-5.6 Sol Max

AAは同点。DeepSWEとTerminal-BenchはSolが上。コーディング純度ではまだ譲る。総合コスパでは4.6が押し返す。

AI Intelligence Hub · Daily Architecture Slide · 2026.08.1312 / 15
競争地図 — Sol・Fableとの距離
13Structure

サプライズの構造 — 期待と実測のギャップ

「出る」は織り込み済み。「同じ値段で前線に戻る」「GDPVal首位」「Harvey LABでSolを大きく上回る」は織り込まれていなかった。

Expected · 低

織り込み済み

  • 8月前半の出荷
  • 1.5Tのまま、4.7が本命
  • 価格$2/$6の継続
  • 4.5比で緩やかな上昇
Unexpected · 高

上振れ

  • 5週間でAA +5、Sol同着
  • GDPVal / Briefcase / Harvey首位
  • 長軌跡の自己検証
  • 視覚一発目の質
Missing · 中

まだ来ていない

  • 2.1Tのスケールジャンプ
  • Terminal-Benchの並走
  • DeepSWEでの逆転
  • テキスト以外の出力
AI Intelligence Hub · Daily Architecture Slide · 2026.08.1313 / 15
サプライズの構造
14Gaps

まだ埋まらない穴

前線に戻った、は「全部勝った」ではない。4.6を既定値にするなら、負け筋を先に知っておく。

Coding purity

DeepSWE 65.9 vs Sol 73

+11.9ptは大きいが、まだ届いていない。純粋なソフトウェア工学ベンチではOpenAI側が厚い。リポジトリ改修の最終品質は要A/B。

Terminal

26% vs 34%台

+10.3ptでも、シェル長時間任務はSol / Fableが一段上。エージェントの「居座り」は強くなっても、ターミナル完走率は未解決。

Unknown

幻覚率は未計測

4.5は幻覚が増えたという独立評価があった。4.6のSFT再生成がそれを戻したかは、これから出る第三者評価待ち。

Next bet

本当のスケールは4.7

2.1T、やや遅い、トークン効率はさらに上、と予告。4.6で満足して止まる話ではなく、4–5週後の再計測が本体戦。

AI Intelligence Hub · Daily Architecture Slide · 2026.08.1314 / 15
まだ埋まらない穴
15Action

実行価値を最大化する

4.6は待つモデルではなく、今週切るモデル。4.7は別口座で予約する。

今すぐ切る

実装と調査

Cursor / Buildの初週2倍を使い、プロダクト化・調査・長めのリファクタを4.6既定にする。

努力の使い分け

high / xhigh

日常はhigh。設計判断と長軌跡だけxhigh。200k超は単価が倍なので、プロンプトを先に圧縮する。

まだ分ける

深いSWE / シェル

DeepSWEとTerminalが勝つ仕事はSol側を残す。全部乗り換えない。

予約する

4.7の再計測

2.1Tが出たら同じ6軸で取り直す。4.6の勝ち筋(単価×ターン)が残るかが論点。

総合 68 / 100新世代ではない同じ値段で前線本丸は長時間エージェント4.7が本体戦
AI Intelligence Hub · Daily Architecture Slide · 2026.08.1315 / 15
実行価値を最大化する

デッキ内の料金・ベンチマークは xAI 公式発表(2026-08-12)および Artificial Analysis など第三者公表値の編集部整理です。導入判断では 公式ページと契約プランを確認してください。サプライズ度は編集部スコアであり、市場コンセンサスではありません。