이 글은 Grok 4.6으로 만들었다. 2026-08-13 · dosi.dev

RANGE CARD · GROK 4.5 → 4.6
읽은 날 2026-08-13 · 출전 4

같은 차체.
두 번째 점화.

4.6은 새 종이 아니다. xAI가 직접 쓴 문장도 “Grok 4.6 builds on Grok 4.5”다. 27일 간격의 보충 학습이고, 가격·컨텍스트·입출력 모달리티는 잠겨 있다. 바뀐 것은 긴 에이전트 궤적과 시각·인터랙티브 초안, 그리고 공식 헤드투헤드 점수다.

First burn · Grok 4.5
2026-07-16
xAI 발표 “Introducing Grok 4.5”. Artificial Analysis는 출시일을 7월 8일로 적는다.
27일between burns
Second burn · Grok 4.6
2026-08-12
“long-running agents and more ambitious interactive and visual work.”
Lock · price
$2 / $6
1M 토큰 입력/출력. 둘 다 동일. 200k 넘으면 둘 다 2배.
Lock · context
500k
공식 모델 카드와 AA 모두 동일.
Lock · I/O
텍스트+이미지
출력은 텍스트. 이미지 20MiB, jpg/png.
Moved · cache
$0.30 → $0.50
유일한 기본 요금 인상. 200k+는 $0.60 → $1.00.

01 · Mechanism

4.5가 트레이스를 다시 썼고, 그 위에서 4.6이 더 오래 돌았다.

공식 4.6 글의 훈련 서사는 교체가 아니라 연속이다. 4.5보다 긴 supplemental training run, 추론·난이도 높은 기술 자료의 합성 트레이스, 더 강한 엔지니어링 코퍼스, 바꾼 옵티마이저/레시피. 그다음 4.5가 STEM·SWE·지식노동·에이전트 설정의 SFT 트레이스를 다시 만들고, 불량 트레이스를 걸렀다. RL 범위는 지식노동·일반 코딩에 더해 커널 튜닝, 웹앱, CAD.

4.5가 판 자리

  • 코딩·에이전트·지식노동용 “smartest model”로 출시.
  • Cursor와 함께 학습했다고 밝힘. Grok Build 기본 모델.
  • 80 TPS, SWE-Bench Pro에서 Opus 4.8 max 대비 출력 토큰 약 4.2× 적음.
  • SWE Marathon pass@1 29.0%로 당시 발표 표에서 1위.

4.6이 밀어 올린 자리

  • 막연한 제품 아이디어 → 동작하는 첫 버전.
  • 긴 궤적에서 self-testing / verification이 보이기 시작.
  • 시각·인터랙티브 작업의 첫 패스가 4.5보다 강하다 — 레이아웃과 시각 언어를 한 번에.
  • xAI 권고: 코드와 일반 채팅 모두 4.6. “most intelligent and fastest model we’ve built.”

지식 컷오프는 4.6만 공식 모델 카드에 적혀 있다: 2026-02-01. 4.5 컷오프는 같은 페이지에 없다. 실시간은 둘 다 Web Search / X Search가 켜져야 한다.

02 · Official head-to-head

같은 시험지 10장. 4.6이 10–0.

아래 숫자는 전부 2026-08-12 xAI 「Introducing Grok 4.6」 표의 Grok 4.6 High / Grok 4.5 High다. 회색 막대는 그 행의 최고 경쟁 점수(Fable 5 Max 또는 GPT-5.6 Sol Max)다. 경쟁사 숫자는 xAI가 각 랩 카드·리더보드에서 가져온 것이라고 못 박았다.

레인지 카드

4.5 High 4.6 High 표의 최고 경쟁
AA Intelligencecomposite / 9 benches
56 → 61+5 · Fable 62
GDPVal-AA v2지식노동
1526 → 1753+227 · 표 1위
CursorBench v3.2IDE 에이전트
66.7 → 69.9%+3.2pp · Fable 70.5
DeepSWE v1.1에이전트 코딩
54 → 65.9%+11.9pp · GPT 73
FrontierCode v1.1Extended
56.6 → 61.3%+4.7pp · Fable 63.6
APEX-Agents에이전트
47.1 → 57.5%+10.4pp · Fable 59.2
Terminal-Bench v3.0터미널 에이전트
15.7 → 26%+10.3pp · GPT 34.6
APEX-SWE소프트웨어
53.6 → 56.4%+2.8pp · Fable 58.8
AA-Briefcase지식노동
1313 → 1577+264 · 표 1위
Harvey LABVals
12.9 → 15.8%+2.9pp · 표 1위

Terminal-Bench를 4.5 출시 글의 2.1 (83.3%)과 4.6 표의 v3.0 (26%)으로 이으면 안 된다. 시험지가 다르다. DeepSWE v1.1도 4.5 출시 글은 53%, 4.6 비교표는 4.5 High 54%로 적는다. 1pp 차이는 하니스/라운드 표기 차이로 남긴다.

03 · Spec board

잠긴 스펙, 움직인 요금, 안 적힌 것.

항목 Grok 4.5 Grok 4.6 판정
API id grok-4.5 grok-4.6 별 SKU
컨텍스트 500k 500k 동일
입력 / 출력 ($/1M, <200k) 2.00 / 6.00 2.00 / 6.00 동일
캐시 입력 ($/1M, <200k) 0.30 0.50 +67%
200k+ 입력/캐시/출력 4 / 0.60 / 12 4 / 1.00 / 12 캐시만 인상
지식 컷오프 문서에 없음 2026-02-01 4.6만 공시
입력 모달리티 텍스트 + 이미지 텍스트 + 이미지 동일
Fast variant 출시 글에 없음 가격 2배. docs 모델 표에는 id 없음 4.6만 언급
xAI 권고 출시 당시 코딩/에이전트/지식노동 “For everything else, including code, use Grok 4.6.” 기본값이 이동
출시 표면 Grok Build, Cursor, API 위 + OpenRouter, Vercel, Cloudflare. 첫 주 2× included usage 유통 확대

04 · Independent receipt

공식 표 밖의 측정. 지능은 올랐고, 첫 토큰은 무거워졌다.

Artificial Analysis 모델 카드(인덱스 v4.1.1, 2026-08-13 열람). 4.5 High와 4.6 High를 같은 사이트의 별도 페이지에서 읽었다. 한 페이지 비교표가 아니다.

AA 측정 4.5 High 4.6 High 판정
Intelligence Index 56 · #16/184 61 · #6/184 +5
출력 속도 56.9 t/s 67.6 t/s +19%
TTFT 8.68s 42.09s 약 4.8×
캐시 히트 $0.30 $0.50 docs와 일치
블렌디드 7:2:1 $1.21 / 1M $1.35 / 1M 캐시가 끌어올림
AA 표기 출시일 2026-07-08 2026-08-12 4.5는 발표일과 불일치
The number that did not market well
8.68s → 42.09s

AA 중앙값 TTFT는 2.86초. 4.6 High는 사고 변형이라 첫 토큰이 늦게 나온다. 출력 속도(67.6 t/s)와 혼동하면 안 된다. xAI가 “fastest”라고 쓴 문장은 모델 카드의 권고문이고, AA의 첫 토큰 측정과는 별개다.

이 페이지가 주장하지 않는 것

  • 파라미터 수, 학습량, 아키텍처 변경 — 비공시.
  • 4.5 지식 컷오프 — 문서에 없음.
  • fast variant의 모델 id — 발표문에 “twice the price”만 있고 docs 표에는 행이 없음.
  • 터미널 벤치 2.1 → 3.0을 성능 하락으로 읽는 해석.
  • 내가 두 모델을 직접 A/B 한 체감. 이건 출전 대조다.

05 · What to do with it

기본값은 4.6. 캐시가 크면 계산기를 열어라.

4.6을 쓰는 이유

  • 공식 10종에서 4.5를 전부 이겼다. 점프가 큰 축은 DeepSWE·APEX-Agents·Terminal-Bench v3·GDPVal·Briefcase.
  • xAI가 코드/채팅 기본값으로 지정했다.
  • 긴 에이전트, 앱 초안, 시각 언어가 출시 명분이다.

4.5가 남는 자리

  • 캐시 히트가 많은 반복 워크로드. 같은 입력이면 4.5가 33% 싸다 ($0.30 vs $0.50).
  • 첫 토큰이 중요한 대화형 UI. AA 기준 4.6 High TTFT가 훨씬 길다.
  • 이미 4.5에 고정한 평가 세트. 하니스가 바뀌면 점수도 바뀐다.