Z.AI · 2026-08-26 · 원문 정리

GLM-5.3-Flash: 프런티어 지능을 플래시 가격에

GLM-5 시리즈 첫 네이티브 멀티모달 MoE. 총 320B / 활성 18B, 하이브리드(선형+희소) 어텐션과 mHC로 GLM-5.3 대비 어텐션 연산 3.0×·KV 캐시 4.4× 절감. MIT 오픈웨이트, 국산 AI 칩 서빙.

읽기 전에

이 글이 답하는 한 질문 — "왜 320B 짜리 모델이 그 1/10 가격으로 굴러가는가?"

모르면 막히는 선행 개념

권장 읽기 순서

  1. Executive Summary로 주장 전수를 3분에.
  2. 팩트체크로 어느 주장이 독립 확인됐고 어느 게 벤더 발표인지 등급.
  3. 완역 §플래시 가격에 경쟁력 있는 성능 → §극한 효율을 위한 아키텍처 순으로 가격·성능 프론티어가 어디서 나오는지 데이터로.
  4. §코딩 루프 안의 시각 지능 → §일터의 파트너 → §국산 AI 칩 서빙은 각각 제품 방향/사용 시나리오/공급망 신호.
  5. 표 두 개(베이스 모델 벤치마크, 통합 벤치마크)는 시각 자료보다 먼저 읽으면 문장이 무엇을 반복하는지 알아본다.

이 글의 멘탈 모델

"저비용 프런티어 = ① MoE + 하이브리드 어텐션으로 계산량과 메모리를 동시에 줄이고 ② 30T 멀티모달 코퍼스로 단위 계산당 지능을 올리고 ③ 국산 칩 EPD 서빙으로 같은 하드에서 3× 처리량. 세 층이 곱해질 때만 이 가격이 성립한다." — 저자의 결론 문단을 세 곱으로 압축한 것.

예상 소요

이 글을 다 읽고 나면 답할 수 있어야 하는 것

  1. GLM-5.3-Flash가 GLM-5.3 대비 어텐션 연산과 KV 캐시를 각각 몇 배 줄였고, 그것이 어떤 두 메커니즘의 결과인지 한 문장.
  2. Artificial Analysis Intelligence Index v4.1.1에서의 정확한 스코어와 "$0.045 per task (discounted)"가 정확히 어떤 가격 조건에서 나온 수치인지.
  3. ox-alpha 스텔스 프리뷰가 OpenCode·OpenRouter에서 어떤 사용 규모를 만들었고, 저자가 이를 무엇의 근거로 인용하는지.

Executive Summary

한 문단 요지

Z.ai가 2026-08-26 공개한 GLM-5.3-Flash는 GLM-5 시리즈의 첫 네이티브 멀티모달 모델이자 총 320B/활성 18B의 MoE. 하이브리드(선형+희소) 어텐션과 Manifold-Constrained Hyper-Connections(mHC), 30T 멀티모달 사전학습 코퍼스로 같은 총 파라미터 대비 절반의 활성·절반의 레이어로 GLM-5.2를 크게 상회하고 Claude Opus 4.8에 근접. Artificial Analysis Intelligence Index v4.1.1에서 57, 태스크당 $0.045(할인가)로 파레토 프론티어 갱신. MIT 라이선스로 HuggingFace에 웨이트 공개, 발표 전 OpenRouter/OpenCode에서 ox-alpha로 익명 서빙되며 한 주간 최다 사용 모델이 됐다고 주장. 서빙은 국산 AI 칩 클러스터 위 EPD 분리 구조로 초기 대비 3× 처리량, NVIDIA 급 단가 도달.

총 · 활성 파라미터

320B / 18B

MoE

레이어 수

45

GLM-5.3=92

컨텍스트

1M

tokens

AA Index v4.1.1

57

score

태스크당 비용 (할인)

$0.045

discounted

사전학습 코퍼스

30T

multimodal tokens

어텐션 연산 절감

3.0×

vs GLM-5.3

KV 캐시 절감

4.4×

vs GLM-5.3

서빙 개선

국산칩 클러스터, 초기 대비

라이선스

MIT

HuggingFace zai-org

저자가 하는 여덟 가지 주장

  1. 모델 정체성 — GLM-5 시리즈 네이티브 멀티모달 모델. 총 320B, 활성 18B MoE.
  2. 가격/성능 우위 — GLM-5.2를 벤치마크·실사용 워크로드 전반에서 앞서면서 가격은 1/10. 코딩·에이전트 벤치에선 Claude Opus 4.8에 근접.
  3. 아키텍처 — GLM-5에 대비해 (i) 하이브리드 선형+희소 어텐션 최초 도입, (ii) mHC로 스케일링 효율 개선, (iii) IndexPool로 인덱서 4개 키를 가중풀링으로 1개로 압축. GLM-4.5(355B, 활성 32B, 92레이어) 대비 활성·레이어 모두 거의 절반(18B, 45).
  4. 파레토 프론티어 — Artificial Analysis Intelligence Index v4.1.1에서 스코어 57, 태스크당 $0.045(할인). 종전에는 대략 10× 비용에서만 얻던 지능 수준.
  5. 스텔스 프리뷰 — 출시 전 OpenCode/OpenRouter에서 ox-alpha로 익명 서빙, 한 주간 최다 사용 모델. 트래픽 전량을 국산 AI 칩으로 처리.
  6. 시각 지능 for 코딩 — 자기시각판정·테스트타임 개선을 위한 데이터 합성 파이프라인. 프런트엔드 코딩엔 환경 피드백 기반 RL, 실사용자 흐름에 grounding된 에이전트 검증.
  7. 일터의 파트너 — 문서·표·프리젠테이션·대시보드·인터페이스 같은 heterogeneous 시각+구조 아티팩트를 텍스트로 옮기지 않고 직접 해석·자기검증.
  8. 국산 칩 서빙 — SGLang 기반 전용 추론 엔진, W8A8 양자화, INT8/FP8/BF16 하이브리드 KV 양자화, Layer Split; production-grade EPD(인코딩·프리필·디코딩) 분리 클러스터. 초기 베이스라인 대비 3× 개선, NVIDIA 급 단가.

핵심 이미지

AA Intelligence Index vs $ per task 파레토 도표 (원문 그래프)
Artificial Analysis Intelligence vs Cost per Task 파레토 — GLM-5.3-Flash가 57 스코어를 $0.045(할인)/태스크에 (원문 인용 도표)
아키텍처 다이어그램 — 하이브리드 선형/희소 어텐션, mHC, IndexPool
아키텍처 개괄 — 선형+희소 하이브리드 어텐션, mHC, IndexPool

팩트체크

정합성 한줄평. 파라미터·아키텍처·라이선스·API 가격·AA Index·ox-alpha 정체 등 핵심 정량 주장은 벤더 발표 + 독립 매체 다수(TechNode·Artificial Analysis·MarkTechPost·The Decoder·VentureBeat)에서 동일하게 확인됨. 벤치마크 절대 스코어(DeepSWE 63.4, AutomationBench 48.8, Terminal-Bench 84.3 등)는 모두 벤더 자체 실행이거나 벤더 지정 harness의 결과로, 완전 독립 재현은 아직 확인되지 않음. "국산 AI 칩 3× 개선"과 "초기 대비" 기준선의 절대치는 공개되지 않음.

Trust B+   — 벤더 자체 벤치는 다수 매체가 재보도하지만 독립 재현은 부분적. 핵심 인프라·가격·라이선스는 A급 근거.

GLM-5.3-Flash는 총 320B / 활성 18B 파라미터의 MoE.

벤더 발표와 Artificial Analysis·TechNode·MarkTechPost·다수 매체·HuggingFace 모델 카드가 동일 수치로 재보도. 독립 매체 다수 검증됨.

참조: artificialanalysis.ai — GLM-5.3-Flash, TechNode 리포트, MarkTechPost

MIT 라이선스로 HuggingFace(zai-org)에 오픈웨이트 공개.

HuggingFace의 zai-org/GLM-5.3-Flash 저장소 LICENSE 파일과 testingcatalog·MarkTechPost·다수 매체가 MIT로 확인. 다수 quant/mirror 저장소(unsloth, AtomicChat, LibertAIDAI 등)도 동시 등장.

참조: HuggingFace zai-org/GLM-5.3-Flash, MIT LICENSE, testingcatalog

AA Intelligence Index v4.1.1에서 스코어 57.

Artificial Analysis 공식 모델 페이지·X 계정이 스코어 57로 명시. 다만 Cost per Task 정확한 수치에서 원문은 $0.045(할인가), Artificial Analysis는 $0.09(정상가). 계산 기준이 다른 별개 수치 — 원문은 프로모 할인가 기준(2026-09-09 UTC 16:00까지 50% 할인).

참조: artificialanalysis.ai, @ArtificialAnlys 트윗, 24/7 Wall St 재보도

API 가격 $0.15/M input · $0.50/M output (프로모 50% 할인 시 $0.075/$0.25, 2026-09-09까지). 캐시된 input $0.026/M (~80% 할인).

Artificial Analysis, llm-stats.com, cellcog 다수 매체가 동일 수치. z.ai 공식 문서(docs.z.ai)도 같은 가격표. "태스크당 $0.045 (discounted)"는 할인 가격 기반 파레토 계산.

참조: artificialanalysis.ai 가격 분석, cellcog.ai, z.ai 공식 문서

ox-alpha는 GLM-5.3-Flash. 2026-08-20 OpenRouter에 익명 등장 → 2026-08-26 공개.

TechNode·kocpc·kingy.ai·intelligentliving·explainx 등이 공개일과 동일하게 정체 확인 보도. OpenCode 통계상 6일간 약 42T 토큰 처리 (DeepSeek Flash의 56일 기록 이후 최다). 원문의 "most popular model of the week"는 재보도로 뒷받침.

참조: TechNode, KOC, CellCog, AiCybr Blog

아키텍처: 하이브리드(선형+희소) 어텐션 + mHC + IndexPool + 45 레이어.

벤더 발표와 HuggingFace 모델 카드·GMI Cloud·MarkTechPost가 layer 구성(3 dense + 42 MoE, 11 sparse attn + 34 linear attn + 1 MTP)을 동일 세부 수치로 명시. mHC와 IndexPool은 벤더 명명 신개념 — 대체 벤더의 아키텍처 페이퍼는 아직 없음.

참조: HF 모델 카드, z.ai 공식 문서, MarkTechPost

GLM-5.3 대비 어텐션 연산 3.0×·KV 캐시 4.4× 감소 (BF16, per-head-per-layer 평균).

벤더 발표 수치. 재보도는 다수(3.01× / 4.44×로 소숫점 명시)하지만 독립 벤치마킹은 확인 안 됨. 계산 방식(head별·layer별 평균, BF16)은 원문이 명시.

참조: The Decoder, VentureBeat

🟡

Claude Opus 4.8·GPT-5.6 Terra·Gemini 3.7 Flash 등과의 정면 벤치 스코어.

원문 표의 절대 스코어는 벤더 자체 실행(Terminal-Bench 2.1, DeepSWE, NL2Repo, Toolathlon Verified, AutomationBench v1.0.6, ALE, HLE w/ tools, GDPval-AA v2, OfficeQA Pro, CharXiv Reasoning, Chartography, BabyVision, MVBench, MMVU). 각주에 파라미터·context·judge model이 상세 공개돼 재현 가능이지만 지금 시점 완전 독립 재현은 미확인. AA Index(독립)에서 57점은 확인됨.

참조: AA 독립 재현(부분), orcarouter 재확인

🟡

국산 AI 칩 클러스터 서빙 — 초기 대비 3× 개선, NVIDIA 급 단가.

벤더 발표만 있음. 재보도는 있지만 사용 칩 이름·초기 baseline 절대 수치·NVIDIA 대비 정확한 비교치는 공개되지 않아 벤치 3rd-party 재현 불가. "국산 칩에서 프런티어 모델 추론이 경제적으로 가능"이라는 방향성은 다수 매체가 지지.

참조: The Decoder, VentureBeat

HLE w/ tools 각주 — GPT-5.6-luna (medium) judge, context 300K, max gen 163,840.

벤더 각주 공개. Judge 모델의 존재는 벤더 지정이라 편향 가능(HLE w/ tools는 자체 실행). 완전 독립 재현 미확인.

참조: z.ai 공식 문서

AutomationBench v1.0.6 — Zapier repo PR #13(null-type 처리 수정) 반영.

외부 저장소 URL 실제 존재 확인. Zapier/AutomationBench PR #13 페이지로 이동 가능.

참조: github.com/zapier/AutomationBench/pull/13

1M 컨텍스트, 최대 output 131,072 토큰.

z.ai 공식 문서, OpenRouter 스펙, 다수 매체 모두 1,048,576 컨텍스트 · 131,072 max completion으로 일치.

참조: z.ai 공식 문서, explainx.ai OpenRouter 스펙

⚠️

HuggingFace 저장소 URL 대소문자 (원문의 GLM-5.3-Flash vs docs의 glm-5.3-flash).

원문 본문 링크 텍스트는 huggingface.co/zai-org/GLM-5.3-Flash (대문자 Flash). z.ai 공식 문서 head 메타는 소문자 glm-5.3-flash. HuggingFace URL은 case-preserving이지만 대개 case-insensitive 리다이렉트. 실제 canonical repo는 대문자 형태로 접근 가능함을 확인.

참조: GLM-5.3-Flash (대문자), glm-5.3-flash (소문자, 리다이렉트)


원본 (완역)

Z.ai는 GLM-5.3-Flash를 소개합니다 — GLM-5 시리즈 최초의 네이티브 멀티모달 모델입니다. 총 320B 파라미터, 활성 18B 파라미터로, 벤치마크와 실제 워크로드 전반에서 GLM-5.2를 넘어서면서도 가격은 1/10에 그치고, 코딩·에이전트 벤치마크에선 Claude Opus 4.8에 근접합니다.

GLM-5.3-Flash는 GLM-5 대비 여러 아키텍처 개선을 반영합니다. 최초로 희소·선형 어텐션을 결합한 하이브리드 아키텍처를 도입해, 긴 컨텍스트 서빙 비용을 크게 줄이면서도 정밀한 장기 컨텍스트 능력은 유지합니다. 또한 Manifold-Constrained Hyper-Connections (mHC)를 채택해 스케일링 효율을 더 끌어올렸습니다. 최신 30T 토큰 멀티모달 사전학습 코퍼스와 함께, 이 변경들이 GLM-5.3-Flash로 하여금 더 적은 연산으로 더 많은 지능을 만들게 합니다.

공개 전에 저희는 GLM-5.3-Flash를 ox-alpha라는 이름으로 OpenCode와 OpenRouter에 익명으로 올려 사용자 피드백을 모았습니다. 곧바로 그 주의 최다 사용 모델이 되었고 — 이 모든 트래픽은 국산(중국) AI 칩 위에서 서빙됐습니다.

ox-alpha 관련 커뮤니티 반응 / 스텔스 지표 (원문 이미지)

플래시 가격에 경쟁력 있는 성능

GLM-5.3-Flash는 Artificial Analysis Intelligence Index v4.1.1의 파레토 프론티어를 밀어냅니다 — 57점태스크당 $0.045(할인가)에. 종전에는 대략 10× 비용에서만 얻을 수 있던 지능 수준입니다. 광범위한 워크로드에 대해 강력한 기본값이 됩니다.

AA Intelligence Index vs Cost per Task 파레토 도표

6가지 코딩·에이전트 벤치마크 전반에서 GLM-5.3-Flash는 GLM-5.2를 일관되게 앞섭니다 — DeepSWE v1.1에서 63.4 vs 46.2, AutomationBench에서 48.8 vs 26.2처럼 큰 폭으로. 전반적으로 Claude Opus 4.8에 근접합니다.

6개 코딩·에이전트 벤치마크 결과

사내 코딩 평가에서도 같은 결과입니다. Z.ai Code Bench v1.0(Claude Code 2.1.207에서 실행)에서 GLM-5.3-Flash는 모든 effort 레벨에서 GLM-5.2를 명확히 앞서고, max effort에선 Claude Opus 4.8과 거의 대등(29.0 vs 29.5)합니다.

Z.ai Code Bench v1.0 결과 (effort 레벨별)

극한 효율을 위한 아키텍처

아키텍처 다이어그램 — 하이브리드 선형/희소 어텐션, mHC, IndexPool

GLM-4.5 시리즈와 비교하면, GLM-5.3-Flash는 초저비용 추론을 위해 특별히 설계된 모델입니다. 총 파라미터 수는 비슷하지만(320B vs 355B), 활성 파라미터 수(18B vs 32B)와 레이어 수(45 vs 92)를 거의 절반으로 줄였습니다.

긴 컨텍스트 시나리오에서 어텐션 비용을 최소화하기 위해 선형과 희소 어텐션을 결합한 하이브리드 아키텍처를 씁니다. 선형 어텐션은 상태 모델링으로 국소 의존을 잡고, 희소 어텐션은 가벼운 인덱서로 관련 전역 컨텍스트를 검색합니다. 인덱서의 지연·메모리 오버헤드를 1M 토큰 컨텍스트에서 더 줄이기 위해 IndexPool을 도입했습니다 — 4개의 인덱서 키 벡터를 가중풀링으로 하나로 압축합니다.

아키텍처의 효율을 보이기 위해, GLM-5.3-Flash를 GLM-5.3과 두 개의 최근 오픈 모델 DeepSeek-V4-Flash·Kimi-K3에 대해 토큰당 연산과 KV 캐시 크기로 비교합니다. 스케일이 다른 모델을 공정하게 비교하기 위해 어텐션 연산은 head·layer당 평균, KV 캐시는 layer당 평균(BF16)으로 계산합니다. GLM-5.3 대비 GLM-5.3-Flash는 어텐션 연산과 KV 캐시 크기를 각각 3.0×·4.4× 줄입니다. 어텐션 연산은 비교한 모든 모델 중 가장 낮습니다. KV 캐시 크기는 Kimi-K3와 DeepSeek-V4-Flash보다 약간 크게 남아 있어 개선의 여지가 있습니다.

아키텍처 개선과 최적화된 사전학습 코퍼스가 결합돼, GLM-5.3-Flash가 더 적은 연산으로 더 많은 지능을 만들 수 있게 합니다. 아래 표는 GLM-5.3-Flash 베이스 모델의 평가 결과입니다 — 이전 자사 베이스 모델들과 DeepSeek-V4-Flash-Base와 비교합니다. GLM-5.3-Flash-Base는 GLM-4.5-Base를 전반적으로 앞서고, 대부분의 벤치에서 GLM-5-Base와 경쟁력을 유지합니다.

Benchmark GLM-4.5-Base GLM-5-Base DeepSeek-V4-Flash-Base GLM-5.3-Flash-Base
Activated Params32B40B13B18B
Total Params355B744B284B320B
MMLU86.188.388.588.1
BBH86.287.484.986.6
HellaSwag87.188.185.387.1
LiveCodeBench-Base28.134.429.937.6
SimpleQA303631.233.5

(DeepSeek-V4-Flash-Base 결과는 구현 차이를 통제하기 위해 저희 내부 평가 프레임워크로 평가한 것입니다.)

코딩 루프 안의 시각 지능

시각 코딩(visual coding)은 단순히 이미지를 처리하는 문제가 아닙니다. 코딩이 도달할 수 있는 경계를 확장합니다. 프런트엔드 개발·게임 개발·3D 시뮬레이션 같은 태스크에서는 최종 산출이 코드만이 아니라 인터페이스·상호작용, 사용자가 경험하는 세계입니다. 많은 실패는 렌더링·상호작용·플레이테스트를 거쳐야만 드러납니다. CUA(Computer Use Agent)는 코딩을 프로그래머블 시스템 너머의 가시적·상호작용 환경으로 더욱 확장합니다. 따라서 시각은 모델에 네이티브로 통합돼야 하며, 그래서 모델이 언제 관찰할지를 스스로 결정하고 시각 피드백으로 다음 행동을 이끕니다.

저희는 시각 코딩용 데이터 합성 파이프라인을 개발합니다 — 초점은 자기 시각 판정테스트 타임 개선. 이 파이프라인이 만드는 궤적은 모델이 환경과 상호작용하고, 자기 산출을 검사하고, 반복적으로 개선하도록 요구합니다. 프런트엔드 코딩에서는 환경 피드백 기반 강화학습도 탐색했고, 실사용자 흐름에 grounding된 에이전트 검증으로 GUI 판단력을 더 강화했습니다. 이는 검증을 기능적 정확성 너머 렌더된·상호작용 가능한 제품까지 확장합니다.

Code lets the model build and change the world. Vision lets it enter the world people see and use.
(코드는 모델이 세계를 만들고 바꾸게 합니다. 시각은 사람들이 보고 쓰는 세계로 모델이 들어가게 합니다.)

레이아웃 문제가 있는 초기 버전 스크린샷
레이아웃 문제가 있는 초기 버전
시각 자기 검증 후 개선된 버전 스크린샷
시각 자기 검증 이후
시각 자기 검증 사이클 — 렌더된 결과를 모델 스스로 판정하고 다시 코드로 개선.

코딩을 넘어 — 일터의 파트너로

코딩 능력은 지능형 지식 노동의 중요한 기반을 제공합니다. 그리고 시각 지능은 이 능력을 더 넓은 전문 태스크로 확장합니다. 상당 부분의 전문 활동은 이질적인 시각·구조 정보를 해석하는 일입니다 — 문서, 스프레드시트, 프리젠테이션, 대시보드, 인터페이스, 회의 아티팩트 같은.

시각 지능은 모델의 능력을 코드 중심 환경 너머로 확장합니다. 텍스트·시각·구조 컨텍스트에 대해 공동으로 추론하게 함으로써 — 사용자가 자기 작업 환경을 텍스트 지시로 명시 번역하도록 요구하지 않고, 모델이 태스크와 결합된 아티팩트를 직접 해석하고 관련 정보를 식별합니다. 자기 산출을 시각 컨텍스트와 의도한 결과에 비추어 스스로 평가할 수도 있어서, 더 효과적인 자기 검증과 개선이 가능합니다 — 프리젠테이션 품질과 미학에 대한 판단도 강해집니다.

이 능력들은 다음의 전문 워크플로우 예시에서 특히 잘 드러납니다.

PDF 예시 (원문에서는 임베드 뷰어):

국산 AI 칩 위에서의 대규모 서빙

지난 한 주간 저희는 GLM-5.3-Flash를 국산(중국) AI 칩의 대규모 클러스터 위에서 서빙했습니다 — 고대역폭 인터커넥트와, 그 하드웨어에 최적화된 서빙 스택으로 뒷받침되면서.

개별 칩의 상대적으로 제한된 연산·메모리 용량을 극복하기 위해, 저희는 SGLang 위에 이 아키텍처를 위한 전용 추론 엔진을 만들었습니다. 특히 이 작업은 GLM-5.3 기반 인프라 에이전트가 가속했습니다 — 엔지니어의 커널 개발·최적화, 성능 병목 진단, 서빙 스택 개선을 도왔죠. 모델을 서빙하는 시스템을 같은 모델이 스스로 최적화하는 피드백 루프가 만들어진 겁니다.

이 칩들은 특히 최대 100만 토큰의 컨텍스트를 지원할 때 메모리 용량과 대역폭에 의해 주로 제약됩니다. 그래서 하드웨어 아키텍처에 맞춘 공격적인 메모리 최적화가 필요합니다 — compute-for-bandwidth, communication-for-bandwidth 기법 포함. 저희 스택은 다음을 결합합니다: 선형 어텐션과 LM head에 대한 노드 내 텐서 병렬화, ReplaySSM, W8A8 양자화, INT8/FP8/BF16 하이브리드 캐시 양자화, Layer Split.

클러스터 스케일에서 저희의 production-grade Encode–Prefill–Decode (EPD) 분리 아키텍처는 멀티모달 인코딩·프롬프트 프리필·토큰별 디코딩을 독립 스케줄·스케일링 가능한 워커 풀로 분리해, 효율적이고 신뢰성 있는 서빙을 가능케 합니다.

같은 하드웨어에서 초기 베이스라인 대비 종단간 서빙 성능이 개선됐고, 하드웨어 효율과 토큰당 원가가 주류 NVIDIA GPU에 필적하는 수준에 도달했습니다. 이는 국산 칩이 프런티어 모델 추론을 대규모로도 효율적·경제적으로 지원할 수 있음을 보여줍니다.

결론

GLM-5.3-Flash는 프런티어 지능이 프런티어 원가로 오지 않아도 된다는 걸 보여줍니다. 이는 어떤 한 가지 트릭의 결과가 아니라 세 층이 함께 작동한 결과입니다: (1) 더 적은 연산에서 더 강한 능력을 내는 아키텍처, (2) 더 풍부한 멀티모달 사전학습 코퍼스, (3) 추론 하드웨어와 co-design된 인프라. 이제 이 조리법을 더 큰 모델로 스케일업하고 있습니다 — GLM-5.3-Flash가 원가·성능 프론티어를 밀어 올렸고, 그것을 만들며 배운 교훈이 벌써 다음 프런티어 모델을 형성하고 있습니다.

GLM-5.3-Flash 시작하기

GLM-5.3-Flash를 모든 GLM Coding Plan 사용자에게 롤아웃했습니다. GLM-5.3-Flash는 GLM-5.3의 3배 할당량을 줍니다. GLM-5.3-Flash를 사용하려면 z.ai/subscribe로 오세요.

GLM-5.3-Flash의 멀티모달 능력은 ZCode에서 잠금 해제됩니다 — Browser UseComputer Use가 함께: 에이전트가 웹 페이지를 클릭·시각적 검증하고, 데스크톱 앱을 조작합니다.

GLM-5.3-Flash의 모델 웨이트는 HuggingFace에 공개돼 있습니다. 로컬 배포에는 SGLang, vLLM, TokenSpeed 추론 프레임워크를 지원하며 나머지도 곧 준비됩니다.

통합 벤치마크 — GLM-5.3-Flash vs GLM-5.2 · DeepSeek-V4-Vision-Exp · Opus 4.8 · GPT-5.6 Terra · Gemini 3.7 Flash
Benchmark GLM-5.3-Flash GLM-5.2 DeepSeek-V4-Vision-Exp Opus 4.8 GPT-5.6 Terra Gemini 3.7 Flash
Terminal Bench 2.184.38183.98587.485.8
DeepSWE (v1.1)63.446.259.35869.665.3
NL2Repo56.348.957.769.7nullnull
Toolathlon Verified78.459.975.976.274.9null
AutomationBench (v1.0.6)48.826.238.84137.252.3
Agents' Last Exam26.320.427.32728null
HLE w/ Tools55.354.755.157.9nullnull
GDPval-AA v2177315041675158215711527
OfficeQA Pro62.4null57.948.9nullnull
CharXiv Reasoning (w/ Tools)89.4null80.489.98888.7
Chartography (w/ Tools)78null64.3756865
BabyVision53.4null35.146.861.670.9
MVbench77.8null69.467.17582.2
MMVU80.5null72.767.475.882.3

각주


원본 링크·인용

본문 링크는 이미 완역 블록의 원위치에 <a class="link-preview">로 보존됨. 아래는 보조 목록.


기타

용어

고지

Source: z.ai/blog/glm-5.3-flash · Z.ai (zai-org) · 2026-08-26

Capture: 2026-08-28 · aside/curl 조합, JS 번들 직접 파싱 · 이미지 8건 로컬화 · 링크 6건 보존