LINK / SUMMARY / 번역

소형 모델의
시대가 왔다

최고 지능보다 먼저 뒤집힌 것은, 반복 업무를 가능하게 하는 호출당 비용과 속도다.

AUTHOR

Calvin French-Owen

PUBLISHED

MEDIUM

calv.info · 개인 사이트

01 · ORIENTATION

읽기 전에

이 글은 “작은 모델도 꽤 똑똑하다”보다 더 구체적인 변화를 짚는다. 반복 호출이 많은 업무에서는 최고 성능보다 호출당 비용과 응답 속도가 제품의 가능 범위를 먼저 바꾼다는 주장이다.

핵심 렌즈

지능의 서열이 아니라 단위 경제로 읽는다. 같은 품질을 더 싸게 만드는 변화가 소비자 앱과 조직 업무의 호출 빈도를 얼마나 늘릴 수 있는지가 중심이다.

확인된 경계

Luna의 낮은 현재 단가와 100 t/s를 넘는 독립 속도 측정, Charm·Revoy의 투자 유치는 확인됐다. 개인 실행 비용과 ‘업무의 95%’는 공개 로그가 없는 일화다.

주의할 점

“토큰 비용이 소비자 AI의 부재를 설명한다”는 문장은 가설에 가깝다. 2026년 시장 지표는 소비자 AI 사용과 매출이 이미 빠르게 커졌음을 보여준다.

읽는 순서

요약에서 논지를 잡고, 팩트체크에서 사실·일화·전망을 분리한 뒤, 원문 구조를 보존한 한국어 번역으로 저자의 논증 흐름을 확인하면 된다.

02 · EXECUTIVE SUMMARY

Executive Summary

한 문장

소형 모델의 돌파구는 최고 지능을 대체하는 데 있지 않고, 매번 돈이 드는 AI 호출을 반복 가능한 수준으로 싸고 빠르게 만들어 새로운 소비자 제품과 조직 자동화의 문턱을 낮추는 데 있다.

  1. 01

    비용 곡선이 먼저 움직였다

    Calvin French-Owen은 GPT-5.6 Luna로 수천 개 이메일을 훑는 연구가 수십 센트에 끝났다고 말한다. 공개 가격은 크게 내려갔지만, 이 특정 실행 비용은 토큰 로그가 없어 일화로 남는다.

  2. 02

    소비자 앱의 한계비용이 달라진다

    전통 소프트웨어와 달리 생성형 AI 앱은 요청마다 추론비가 생긴다. 저자의 개인화 뉴스 실험은 약 1달러에서 약 0.10달러로 내려갔고, 그는 이 차이가 월 구독료와 제품 가치의 방정식을 바꾼다고 본다.

  3. 03

    기업 업무의 대부분은 ‘충분히 좋은 응답’이다

    저자는 Peter Reinhardt와의 대화를 통해, 천재적 돌파보다 연락·독촉·진행 관리 같은 고빈도 업무가 훨씬 많다고 주장한다. 그래서 프런티어 모델과 소형 모델은 대체재보다 서로 다른 수요층을 가진다.

  4. 04

    경제성만으로 배치는 끝나지 않는다

    업무용 에이전트에는 역할과 권한, 프롬프트 인젝션 방어, 동작 확인, 작업 하네스가 필요하다. 비용 하락은 가능성을 열지만 안전한 조직 배치는 별도의 시스템 문제다.

03 · CLAIM-LEVEL FACT-CHECK

주장별 팩트체크

GRADEB

가격·속도와 투자 유치는 대체로 확인된다. 개인 실험의 정확한 비용, 업무의 95% 비중, 미래 수요는 공개 데이터가 없는 일화 또는 전망이다. 모든 외부 근거는 2026년 8월 28일에 확인했다.

부분 확인

Luna는 약 100 t/s로 빠르고 유능하다

Artificial Analysis의 현재 측정은 max 변형을 약 168 t/s, 릴리스 비교는 129 t/s로 표시해 속도 방향을 지지한다. “유능하다”는 작업별 정성 평가다.

Artificial Analysis 현재 모델 페이지

재현 불가

수천 개 이메일 연구가 수십 센트다

현재 API 가격은 입력 $0.20/M, 출력 $1.20/M으로 충분히 낮다. 그러나 입력·출력 토큰, 캐시, 도구 호출 로그가 없어 저자의 특정 실행 비용은 확인할 수 없다.

OpenAI 가격 발표 · 2026-07-30

시점 한정

GLM 5.3은 파레토 전선의 선택지다

원문에 삽입된 2026-08-26 차트에서 GLM-5.3-Flash는 파레토 선상에 있다. 다만 모델·가격·평가판이 바뀌는 동적 벤치마크라 영구적 순위가 아니다.

과도한 인과

소비자 AI가 적은 이유는 토큰 비용이다

요청마다 추론비가 생기는 구조는 맞지만 단일 원인이라는 증거는 없다. Sensor Tower는 2026년 상반기 GenAI 앱 사용 360억 시간, AI 앱 인앱 매출 40억 달러 초과를 전망한다. 시장이 이미 큰 폭으로 성장한다는 반증 맥락이다.

Sensor Tower State of AI 2026

개인 평가

개인화 뉴스 비용이 약 $1에서 $0.10으로 줄었다

모델 설정·검색 횟수·품질 기준이 공개되지 않았다. 현재 가격 하락은 방향을 설명하지만 이 10배 차이를 독립적으로 재현하지는 못한다.

확인

Charm은 $100M Series B, Revoy는 $27M Series A를 유치했다

Charm 공식 글은 Peter Reinhardt 명의로 1억 달러 Series B를 발표한다. Peter의 LinkedIn 원문은 Revoy의 2,700만 달러 Series A를 발표한다.

Charm 공식 발표 Peter Reinhardt 발표

일화

Peter 업무의 약 95%가 ‘토큰 분사’형이다

저자가 사적 대화를 전한 수치다. 시간 기록이나 표본이 없어 확인하거나 다른 조직으로 일반화할 수 없다.

전망

프런티어와 소형 모델 수요가 함께 급증한다

가격·성능 변화는 개연성을 높이지만 미래 수요의 크기와 시점을 입증하지 않는다. 사실이 아니라 저자의 시장 전망으로 읽어야 한다.

확인

프롬프트 인젝션 방어와 권한 설계가 필요하다

OpenAI의 현재 안내는 이를 업계 전반의 진화하는 보안 문제로 규정하고, 최소 접근·구체적 지시·중요 동작 확인·다층 방어를 권한다.

OpenAI · Understanding prompt injections

등급 기준: B — 외부 검증 가능한 중심 사실은 대체로 맞지만, 글의 시장 인과와 수치화된 경험을 일반화하려면 추가 자료가 필요하다.

04 · COMPLETE KOREAN TRANSLATION

원본 (완역)

문단·목록·인용·구분선·이미지·주석 순서를 원문 37개 유닛에 맞췄다. 밑줄 링크의 툴팁은 저자가 링크한 대상의 맥락을 세 줄로 요약한다.

소형 모델의 시대가 왔다

지난 몇 주 동안 나는 gpt-5.6-luna를 이것저것 시험해 봤다. 이 모델은 놀라울 정도로 유능하고 빠르며 영리하다. 나는 이 모델이 약 100 tps를 내면서 내 코드베이스와 이메일, 지식 베이스를 거침없이 누비는 모습을 자주 본다.

물론 Luna에서 가장 큰 요인은 비용이다. 꽤 복잡한 조사 작업 몇 개를 돌려 봤는데, 큰 금액을 쓰기가 오히려 어려웠다. 수천 개 이메일을 검색하게 해도 API 비용은 결국 수십 센트 수준이었다.

Artificial Analysis의 AI 모델 지능 지수와 작업당 비용 비교 차트. GPT-5.6 Luna와 GLM-5.3-Flash가 낮은 비용의 파레토 전선에 표시되어 있다.
자료: artificialanalysis.ai

GLM 5.3까지 나오면서 이제 파레토 전선에도 새로운 선택지가 생겼다.

코딩 작업을 할 때 나는 거의 언제나 가장 비싸고 성능이 좋은 모델(Fable 5, 5.6 Sol)을 고른다. 그래서 작고 빠른 모델이 이룬 발전을 놓치기 쉬웠다.


내가 대화한 몇몇 투자자는 이런 말을 했다. “소비자 AI 회사가 더 많이 보이지 않는 게 이상해요. 왜 그럴까요?”

답은 단순하다. 토큰 비용이다.

AI 이전 시대에 대형 소비자 앱이 따르던 공식은 대략 이랬다.

  • 운영비가 꽤 저렴하면서도 매력적인 웹사이트를 만든다.
  • 대개 입소문을 통해 많은 사용자를 끌어모은다.
  • 투자를 받고, 더 많은 사용자에게 확장한다.
  • 광고 마켓플레이스를 만든다.

대부분의 대형 소비자 기업(Google, Facebook, Snapchat 등)은 대체로 이 설명에 들어맞는다.1

하지만 제품에 AI를 추가하고 싶다면 어떨까? 이제는 요청할 때마다 실제 추론 비용이 든다. 갑자기 필요한 자본 규모가 크게 늘어난다.

내가 즐겨 쓰는 개인 평가 하나는 나에게 맞춘 일일 뉴스 사이트를 만드는 것이다.

인터넷에서 @calvinfo를 조사하라. 이 사람이 좋아할 만한 뉴스를 파악하라. 오늘의 주요 기사를 이 사람에게 맞춰 담은 마이크로사이트를 만들어라. Hacker News, Reddit, Twitter 등을 검색하라.

이전 세대 모델(Sonnet급)로는 쓸 만한 결과에 도달하려면 약 1달러가 들었다. 소비자 앱에 월 30달러를 받는 것은 감당하기 어렵다. 물론 최적화할 부분은 많지만, WSJ나 The Economist만큼 받으려 한다면 그에 준하는 가치를 제공해야 한다.

그런데 Luna를 써 보니 결과가 제법 괜찮았고 평균 비용은 약 0.10달러였다. 이제 이야기가 달라진다.


내가 보기에 이 변화가 더욱 흥미로워지는 곳은 비즈니스 세계다.

나의 Segment 공동창업자 Peter와 나는 최근 하이킹을 하며 서로의 생각을 비교했다. Peter는 여러 스타트업을 거치며 두 종류의 일을 봤다.

  • “IQ 180” 업무. 미친 과학자 같은 천재가 누구도 생각하지 못한 기상천외한 해법을 내놓는 일.
  • “토큰 분사기” 업무. 극도로 빠르게 반응하며 수십 개 전선에서 일을 조금씩 앞으로 밀어붙이는 일.

Peter는 여러 회사를 운영한다. Segment 이후 Charm Industrial에서 1억 달러 이상을 조달했고, 아주 최근에는 Revoy의 Series A도 마쳤다. 그는 믿기 어려울 만큼 체계적이며 시간을 효율적으로 쓴다.

그런데도 Peter는 자신이 하는 일의 약 95%가 두 번째 범주에 들어간다고 했다. 통화에 참여하고, 사람들을 슬쩍 재촉하고, 기본적인 실무를 막힘없이 처리하는 일이다.

분명히 해 두자. Peter는 깊은 문제를 해결하는 IQ 180급 기술 인재가 없었다면 지금 그의 회사들은 꼼짝도 못 했을 것이라고 말한다. 다만 자신의 업무 대부분이 두 번째 범주에 속한다는 뜻이다.2

나는 “프런티어급” 모델의 수요가 계속 누적될 것이라고 생각한다. 특히 새로운 돌파나 발견이 필요한 분야, 이를테면 공학, 기초과학, 모델 훈련에서 그렇다.

하지만 “빠르고, 싸고, 충분히 좋은” 모델에 대한 수요도 이제 막 급증하기 시작할 것이라고 생각한다.

매일 만나는 사람들을 떠올려 보라. 동료, 공급업체, 고객 말이다. 열 번 중 아홉 번은 반응이 아주 빠르고 일을 알아서 처리해 주는 사람을 원한다. 오늘날 회사가 쓰는 “인간 토큰” 대부분은 이런 방식으로 소비된다. 채용은 빠르고, 싸고, 충분히 좋은 유형에 크게 치우친다.

빠르고, 싸고, 충분히 좋은 모델을 비즈니스의 현실로 만들기까지는 할 일이 많다. 새로운 하네스, 프롬프트 인젝션 안전장치, 역할과 권한이 필요하다. 그래도 우리는 결국 해법을 찾아낼 것이라고 확신한다.

당신도 소형 모델을 유용하게 만드는 실험을 하고 있다면 내게 연락해 주기 바란다.

주석

  1. Amazon과 Netflix는 눈에 띄는 예외다.
  2. Peter는 여기서도 겸손하게 말한 것이다. 그는 아주 예리하다.

05 · SOURCES

근거와 출처

  1. 원문
    Small Models Have Arrived

    Calvin French-Owen · calv.info · 2026-08-26

  2. 1차
    Advancing the price-performance frontier with GPT-5.6

    OpenAI · 가격과 제공 범위 · 2026-07-30

  3. 독립
    GPT-5.6 Luna — Intelligence, Performance & Price

    Artificial Analysis · 동적 벤치마크 · 2026-08-28 확인

  4. 시장
    State of AI 2026

    Sensor Tower · 소비자 AI 사용·매출 · 2026-06-16

  5. 1차
    Accelerating Carbon Removal with our $100m Series B

    Charm Industrial · Peter Reinhardt · 2023-06-06

  6. 1차
    Announcing Revoy’s $27M Series A

    Peter Reinhardt · LinkedIn · 2026-08-28 확인

  7. 보안
    Understanding prompt injections

    OpenAI · 현재 보안 안내 · 2026-08-28 확인

06 · NOTES

기타

원문 보존

Aside REPL로 본문 37개 유닛, 저자 링크 발생 10회, 이미지 1개를 획득했다. 목록·인용·구분선·주석의 순서와 각 링크의 발생 위치를 번역에 대응시켰다.

시점

원문은 2026년 8월 26일 게시됐다. 가격·벤치마크·시장·보안 자료는 2026년 8월 28일 기준으로 다시 확인했다.

시각 체계

원문은 크림색 바탕과 붉은 링크의 밝은 화면이다. 이 페이지는 OpenAI 레퍼런스에 맞춰 순백·검정, 단일 산세리프, 직각 구조로 재해석했다.

번역 원칙

문장을 자연스러운 한국어로 옮기되 모델명, 금액, 비율, 고유명사와 저자의 확신·단서 표현을 유지했다. 검증 결과는 번역을 고치지 않고 별도 섹션에 분리했다.