이 글은 Grok 4.6으로 만들었다. 2026-08-13 · dosi.dev
같은 차체.
두 번째 점화.
4.6은 새 종이 아니다. xAI가 직접 쓴 문장도 “Grok 4.6 builds on Grok 4.5”다. 27일 간격의 보충 학습이고, 가격·컨텍스트·입출력 모달리티는 잠겨 있다. 바뀐 것은 긴 에이전트 궤적과 시각·인터랙티브 초안, 그리고 공식 헤드투헤드 점수다.
01 · Mechanism
4.5가 트레이스를 다시 썼고, 그 위에서 4.6이 더 오래 돌았다.
공식 4.6 글의 훈련 서사는 교체가 아니라 연속이다. 4.5보다 긴 supplemental training run, 추론·난이도 높은 기술 자료의 합성 트레이스, 더 강한 엔지니어링 코퍼스, 바꾼 옵티마이저/레시피. 그다음 4.5가 STEM·SWE·지식노동·에이전트 설정의 SFT 트레이스를 다시 만들고, 불량 트레이스를 걸렀다. RL 범위는 지식노동·일반 코딩에 더해 커널 튜닝, 웹앱, CAD.
4.5가 판 자리
- 코딩·에이전트·지식노동용 “smartest model”로 출시.
- Cursor와 함께 학습했다고 밝힘. Grok Build 기본 모델.
- 80 TPS, SWE-Bench Pro에서 Opus 4.8 max 대비 출력 토큰 약 4.2× 적음.
- SWE Marathon pass@1 29.0%로 당시 발표 표에서 1위.
4.6이 밀어 올린 자리
- 막연한 제품 아이디어 → 동작하는 첫 버전.
- 긴 궤적에서 self-testing / verification이 보이기 시작.
- 시각·인터랙티브 작업의 첫 패스가 4.5보다 강하다 — 레이아웃과 시각 언어를 한 번에.
- xAI 권고: 코드와 일반 채팅 모두 4.6. “most intelligent and fastest model we’ve built.”
지식 컷오프는 4.6만 공식 모델 카드에 적혀 있다: 2026-02-01. 4.5 컷오프는 같은 페이지에 없다. 실시간은 둘 다 Web Search / X Search가 켜져야 한다.
02 · Official head-to-head
같은 시험지 10장. 4.6이 10–0.
아래 숫자는 전부 2026-08-12 xAI 「Introducing Grok 4.6」 표의 Grok 4.6 High / Grok 4.5 High다. 회색 막대는 그 행의 최고 경쟁 점수(Fable 5 Max 또는 GPT-5.6 Sol Max)다. 경쟁사 숫자는 xAI가 각 랩 카드·리더보드에서 가져온 것이라고 못 박았다.
레인지 카드
Terminal-Bench를 4.5 출시 글의 2.1 (83.3%)과 4.6 표의 v3.0 (26%)으로 이으면 안 된다. 시험지가 다르다. DeepSWE v1.1도 4.5 출시 글은 53%, 4.6 비교표는 4.5 High 54%로 적는다. 1pp 차이는 하니스/라운드 표기 차이로 남긴다.
03 · Spec board
잠긴 스펙, 움직인 요금, 안 적힌 것.
| 항목 | Grok 4.5 | Grok 4.6 | 판정 |
|---|---|---|---|
| API id | grok-4.5 | grok-4.6 | 별 SKU |
| 컨텍스트 | 500k | 500k | 동일 |
| 입력 / 출력 ($/1M, <200k) | 2.00 / 6.00 | 2.00 / 6.00 | 동일 |
| 캐시 입력 ($/1M, <200k) | 0.30 | 0.50 | +67% |
| 200k+ 입력/캐시/출력 | 4 / 0.60 / 12 | 4 / 1.00 / 12 | 캐시만 인상 |
| 지식 컷오프 | 문서에 없음 | 2026-02-01 | 4.6만 공시 |
| 입력 모달리티 | 텍스트 + 이미지 | 텍스트 + 이미지 | 동일 |
| Fast variant | 출시 글에 없음 | 가격 2배. docs 모델 표에는 id 없음 | 4.6만 언급 |
| xAI 권고 | 출시 당시 코딩/에이전트/지식노동 | “For everything else, including code, use Grok 4.6.” | 기본값이 이동 |
| 출시 표면 | Grok Build, Cursor, API | 위 + OpenRouter, Vercel, Cloudflare. 첫 주 2× included usage | 유통 확대 |
04 · Independent receipt
공식 표 밖의 측정. 지능은 올랐고, 첫 토큰은 무거워졌다.
Artificial Analysis 모델 카드(인덱스 v4.1.1, 2026-08-13 열람). 4.5 High와 4.6 High를 같은 사이트의 별도 페이지에서 읽었다. 한 페이지 비교표가 아니다.
| AA 측정 | 4.5 High | 4.6 High | 판정 |
|---|---|---|---|
| Intelligence Index | 56 · #16/184 | 61 · #6/184 | +5 |
| 출력 속도 | 56.9 t/s | 67.6 t/s | +19% |
| TTFT | 8.68s | 42.09s | 약 4.8× |
| 캐시 히트 | $0.30 | $0.50 | docs와 일치 |
| 블렌디드 7:2:1 | $1.21 / 1M | $1.35 / 1M | 캐시가 끌어올림 |
| AA 표기 출시일 | 2026-07-08 | 2026-08-12 | 4.5는 발표일과 불일치 |
AA 중앙값 TTFT는 2.86초. 4.6 High는 사고 변형이라 첫 토큰이 늦게 나온다. 출력 속도(67.6 t/s)와 혼동하면 안 된다. xAI가 “fastest”라고 쓴 문장은 모델 카드의 권고문이고, AA의 첫 토큰 측정과는 별개다.
이 페이지가 주장하지 않는 것
- 파라미터 수, 학습량, 아키텍처 변경 — 비공시.
- 4.5 지식 컷오프 — 문서에 없음.
- fast variant의 모델 id — 발표문에 “twice the price”만 있고 docs 표에는 행이 없음.
- 터미널 벤치 2.1 → 3.0을 성능 하락으로 읽는 해석.
- 내가 두 모델을 직접 A/B 한 체감. 이건 출전 대조다.
05 · What to do with it
기본값은 4.6. 캐시가 크면 계산기를 열어라.
4.6을 쓰는 이유
- 공식 10종에서 4.5를 전부 이겼다. 점프가 큰 축은 DeepSWE·APEX-Agents·Terminal-Bench v3·GDPVal·Briefcase.
- xAI가 코드/채팅 기본값으로 지정했다.
- 긴 에이전트, 앱 초안, 시각 언어가 출시 명분이다.
4.5가 남는 자리
- 캐시 히트가 많은 반복 워크로드. 같은 입력이면 4.5가 33% 싸다 ($0.30 vs $0.50).
- 첫 토큰이 중요한 대화형 UI. AA 기준 4.6 High TTFT가 훨씬 길다.
- 이미 4.5에 고정한 평가 세트. 하니스가 바뀌면 점수도 바뀐다.