LINK LEARN · YouTube 영상 에세이 (전사 기반)

1986년 항공기 정비 표준이 AI 슬롭을 고치는가 — ASD-STE100 직접 테스트

"delve 금지" 블랙리스트는 두더지잡기다. 검사 가능한 작문 시스템(ASD-STE100 Simplified Technical English)을 모델에 주면 슬롭이 절반~74% 줄어든다는 것을 6과제 × 4조건 × 2모델 실험으로 보인 영상의 학습 문서.


학습 가이드

이 영상을 읽기 전에

핵심 질문: "delve 금지" 같은 단어 블랙리스트가 아니라, 1986년 항공기 정비 표준(ASD-STE100) 같은 검사 가능한 글쓰기 시스템을 모델에 주면 AI 슬롭이 실제로 얼마나 줄어드는가 — 그리고 그것을 숫자로 증명할 수 있는가?

선행 개념

멘탈 모델: 슬롭 = 좋은 자세를 취한 모호함(ambiguity with good posture). 블랙리스트(단어 금지)는 두더지잡기라 모델이 우회하지만, 시스템(STE·오웰 룰셋)은 출력이 통과해야 할 테스트가 된다 — "작성자를 구속하면 독자가 자유로워진다."

권장 읽기 순서

  • 요약만 볼 사람 (~5분): 핵심 요약 → "The test" 섹션의 숫자(Claude 기준 baseline 4.36 → STE 1.12, −74%; 금지어 리스트는 −3%) → "The verdict"만 확인.
  • 완독할 사람 (~15–20분): 본문 순서대로 — 슬롭 6습관 정의 → STE가 무엇인가 → 규칙별 1:1 매핑(슬롭 습관이 어느 규칙에 죽는가) → 인간 대상 근거(1996 정비사 연구, 2007 Microsoft 연구, 반례 포함) → 2모델 실험 → 사용법(strict/flavored 두 모드)과 한계.

점검 질문

  1. 금지어 리스트가 Claude에서 슬롭을 3%밖에 못 줄인 이유는 무엇이고, GPT-5.5에서는 왜 −40%로 꽤 통했는가? 이 차이가 "블랙리스트 vs 시스템" 논지를 약화시키는가, 좁혀서 강화하는가?
  2. STE가 고치는 것은 슬롭의 형식(form)뿐이라는 한계 — "속이 빈 문단을 깨끗하고 자신감 있는 빈 문단으로 만들 수 있다" — 는 구체적으로 무슨 뜻인가?
  3. 내 작업물 중 STE(또는 10줄 오웰 설정)를 적용해야 할 곳(문서·에러 메시지·PR 설명)과 절대 적용하면 안 되는 곳(보이스가 필요한 글)을 각각 하나씩 꼽는다면?

Executive Summary

1986년 항공기 정비 표준(ASD-STE100)이 AI 슬롭을 고치는가 — 직접 테스트

TL;DR — "AI 냄새 나는 글"을 고치겠다고 delve·em dash를 하나씩 금지하는 것은 whack-a-mole이다. 이 영상의 저자는 슬롭을 6가지 기계적 습관으로 정의한 뒤, 항공 정비 매뉴얼 오독으로 사람이 죽지 않도록 1986년에 만들어진 국제 표준 ASD-STE100(Simplified Technical English)의 규칙이 그 6가지를 정확히 하나씩 격추한다는 것을 보이고, 개발자 작문 과제 6종 × 4조건 실험으로 검증했다. 결과: Claude에서 STE는 슬롭 지표를 74% 감소시켰고(금지어 리스트는 겨우 3%), GPT-5.5에서도 50% 감소로 핵심 발견이 유지됐다. 결론은 "모델에게 검사 가능한 작문 시스템을 주면 슬롭이 절반 이상 준다 — 블랙리스트는 가장 신뢰도 낮은 버전의 같은 아이디어"다. 단, STE는 형식만 고칠 뿐 내용의 공허함은 못 고치고, voice가 필요한 글에는 쓰면 안 된다.

발단 — 바이럴 스레드에서 실험까지

슬롭의 6가지 기계적 습관 (저자의 정의)

"AI 같다"는 느낌이지 정의가 아니다 — 느낌은 못 고친다. 저자가 기계적으로 수렴시킨 6가지:

  1. 동의어 회전 — 같은 대상을 한 문단에서 user/customer/client로 3번 다르게 부름
  2. 헤징 — "it's important to note that this may potentially help to improve" — 동사 5개, 실제 일은 0
  3. 명사화(nominalization) — "perform an analysis of" 대신 "analyze"; 문장을 길고 약하게 만듦
  4. 마케팅 형용사 — seamless, robust, powerful, cutting-edge; 품질을 보여주는 대신 주장
  5. 런온 문장 — em dash·세미콜론으로 4개 아이디어를 한 문장에 꿰맴
  6. 구동사(phrasal verbs) — spin up, reach out, dive into 같은 물렁한 표현

이 목록의 의미: 전부 이름 붙일 수 있는 구체적 동작이고, 이름 붙일 수 있으면 금지할 수 있다.

ASD-STE100이란

슬롭 습관별 격추 규칙 매핑

슬롭 습관격추하는 STE 장치
1. 동의어 회전규칙 1.11 (사물 하나에 이름 하나) + 1단어 1의미 사전
2. 헤징 스택규칙 3.4 (복잡한 동사 구문 금지)
3. 명사화규칙 3.7 (행동은 동사로 — "perform an analysis"는 불법, "analyze"가 법)
4. 마케팅 형용사사전에 부재 — "seamless"는 승인 단어가 아니라 말할 수 없음
5. 런온 문장규칙 5.1 (지시문 최대 20단어) · 6.3 (서술문 최대 25단어) + 세미콜론 전면 금지
6. 구동사규칙 9.3 — 패널을 "remove"하지 "take off"하지 않는다
STE는 AI를 위해 설계된 게 아니다. 40년 전 스트레스 받는 인간 독자의 모호함을 제거하려고 설계됐다. AI 슬롭은 자세만 좋은 모호함(ambiguity with good posture)일 뿐 — 항공우주 업계는 다른 환자를 위해 40년간 치료법을 만들어 놓았던 것이다.

Before / After 실례

인간 대상 증거 (효과와 한계 모두)

저자의 실험 — AI 출력에 처음으로 적용

기존 증거는 전부 항공 매뉴얼·인간 작성자 대상 — 바이럴 주장은 유추에 의한 추측이었다. 그래서 직접 실험: 개발자의 실제 작문 과제 6종(README·PR 설명·API 문서·에러 메시지·시작 가이드·deprecation 공지) × 4조건(baseline / 금지어 리스트 / Orwell 6원칙 / STE 스킬), 자작 linter로 문장당 단어수·세미콜론·수동태·구동사·마케팅 형용사를 계수 — 점수 = 100단어당 위반 수(낮을수록 깨끗).

조건Claude 점수변화GPT-5.5
Baseline4.36
금지어 리스트4.21−3%−40% (실제로 작동)
Orwell 6원칙2.48−43%≈ STE와 동률
ASD-STE1001.12−74%−50%

실사용법과 핵심 결론

이 요약의 한계 표시 — 본 문서는 YouTube 자동자막 전사만으로 작성됐다(원본 영상 URL·링크·자료 미확보; 인명 표기 일부는 ASR 교정 추정). 실험 수치(4.36/4.21/2.48/1.12, −74%, −50% 등)는 영상 저자의 자체 실험이며 외부 검증·재현이 없다. 1996/2007 연구 서지 표기도 전사 기반 추정으로 팩트체커 검증 대상이다.

팩트체크

주장별 검증

ASD-STE100은 1986년 첫 발행(AECMA Simplified English), 유럽 항공우주 산업이 비원어민 정비사의 오독 방지를 위해 만든 통제 영어 표준이다 ASD-STE100 공식 About

공식 기록상 프로젝트는 1979년 시작, 1986년 AECMA 문서(PSC-85-16598)로 첫 발행됐고, 목적은 비원어민 정비사의 정비 매뉴얼 이해였다. 영상의 기원 서사와 일치한다.

현행판은 Issue 9 (2025년 1월), 공식 사이트에서 무료 다운로드 가능하다 ASD Europe 공식 발표

Issue 9는 2025년 1월 15일 발행됐고 이 판부터 '사양(specification)'에서 '국제 표준(standard)'으로 격상됐다. 무료 배포는 Issue 6(2013)부터로, 공식 다운로드 페이지(asd-ste100.org)에서 양식 작성 후 받을 수 있다.

규칙 53개 + 약 900개 승인 단어 사전, 단어당 의미 1개·품사 역할 1개 구조다 Wikipedia: STE

현행판은 작성 규칙(Part 1) 53개와 약 900개 승인 단어 사전(Part 2)으로 구성되며, 각 단어에 하나의 의미·하나의 문법적 역할만 허용한다는 원칙도 공식 자료와 일치한다.

🟡 개별 규칙 번호 매핑(1.11 한 사물 한 이름, 5.1 지시문 20단어, 6.3 서술문 25단어, 9.3 구동사 금지 등)과 문서 434페이지 공식 다운로드 페이지

지시문 20단어·서술문 25단어 길이 상한은 STE의 널리 알려진 특징이라 방향은 맞다. 다만 개별 규칙 번호(1.11/3.4/3.7/5.1/6.3/9.3)와 총 434페이지라는 수치는 예산 내 검색 결과로는 원문 대조를 못 해 확인 불가 — 원문 PDF 대조가 필요하다.

⚠️ "요청자의 64%가 항공우주·방산 외부"라는 수치 STE 공식 FAQ

다운로드 시 통계용 양식을 받는 것은 사실이므로 이런 통계가 존재할 개연성은 있으나, 64%라는 구체 수치는 검색 범위에서 확인되지 않았다. 불확실로 분류한다.

🟡 Chervak, Drury & Ouellette (1996): 항공 정비사 175명에게 실제 workcard로 시험, 이해도 76%→86%, 비원어민은 69→87 원 논문 (ResearchGate)

연구는 실재하며 175명의 현직 정비사(AMT)·실제 workcard 사용·"어려운 카드와 비원어민에게서 개선이 가장 컸다"는 핵심 결론까지 영상과 일치한다. 다만 1차 출처는 결과를 "이해 오류율 18%→14%"(이해도 환산 약 82%→86%)로 보고해, 영상의 76%→86%·69→87 수치와 정확히 일치하는지는 확인 불가 — 방향은 맞고 숫자는 재검 필요.

🟡 Microsoft Research 2007: 통제 언어 문장을 중국어·프랑스어·네덜란드어·아랍어로 기계번역, 전 언어에서 통제판이 우세(우연 확률 1/1000 미만), 520문장 규모 Aikawa et al. 2007 (ACL Anthology)

연구는 실재한다: Aikawa 외(2007), MT Summit XI, 통제 언어 준수/위반 두 데이터셋을 네덜란드어·중국어·아랍어·프랑스어 4개 언어로 통계적 MT 번역 — 언어 목록까지 영상과 일치. 다만 '520문장'·'전 언어 우세'·유의확률 수치는 검색 요약에서 확인되지 않아 부분 확인에 그친다. "효과는 실재하나 작다(4점 척도의 소수점 단위)"는 영상의 자기 한정은 정직한 편.

🟡 Boeing은 1990년경부터 350개 규칙 파서 기반 Simplified English Checker를 운용해 왔다 Boeing 공식 페이지

체커가 1990년부터 사용돼 온 것은 사실. 다만 규칙 수는 확인된 출처(Franz Inc. 사례 페이지)가 "400개 이상의 영어 구문 규칙"이라고 밝혀 영상의 '350개'와 다르다. "어떤 소프트웨어도 STE 완전 준수를 보증할 수 없고 최종 판단은 사람"이라는 영상 속 인용은 Boeing 공식 입장과 정확히 일치한다.

⚠️ 바이럴 서사: 'Joe Gristle' 계정의 질문 포스트가 200만 뷰, 작가 'Vox'의 오웰 6원칙 답변, 'chief agent officer' Mike Husteller의 ASD-STE100 인용 트윗 확인 실패 (공식 사이트만 제시)

해당 포스트·인용트윗·조회수는 검색으로 확인하지 못했다. 전사 자체가 ASR이라 인명 철자도 불확실(전사 보정 맵에도 '철자 불확실'로 명기됨). 실화일 수 있으나 현 시점에서는 검증 불가.

⚠️ Airbus 연구: 과단순화는 오히려 읽기를 느리게 할 수 있다 관련 학술 문헌 (Springer)

"단순화가 항상 이해를 개선하지는 않는다"는 학술 논의 자체는 존재하나, 영상이 말한 특정 'Airbus 연구'는 예산 내에서 특정하지 못했다. 검증 불가로 남긴다.

⚠️ 자체 실험 수치: Claude 기준 baseline 4.36 / 금지어 목록 4.21(−3%) / 오웰 2.48(−43%) / STE 1.12(−74%), GPT-5.5에서 STE −50%·금지어 −40%, 에러 메시지 41% 단어 절감 등 검증불가 (자체 실험)

⚠️ 검증불가(자체 실험). 제작자 본인의 린터·프롬프트·샘플로 산출한 자기보고 수치라 외부에서 참·거짓을 판정할 수 없다. 거짓으로 분류하지 않되, 린터가 표준 전체가 아닌 '기계적 규칙 부분집합'만 잰다는 한계는 제작자 스스로도 명시했다.

종합

B 표준의 골격 사실(1986년 기원·Issue 9 2025년 1월·무료·53규칙·약 900단어)과 인용 연구 2건(Chervak 1996, Microsoft/Aikawa 2007)의 실재·설계·결론 방향은 모두 확인됐다. 다만 세부 수치에서 어긋남이 반복된다 — 1996년 이해도(영상 76→86 vs 출처 오류율 18→14%), Boeing 체커 규칙 수(350 vs 400+) — 그리고 64% 비항공 수치·바이럴 포스트 서사·Airbus 연구는 미확인, 핵심 실험 수치 전부가 자체보고다. 정합성 한줄평: 뼈대는 정직하고 자기 한계 고지도 충실하나, 기억으로 옮긴 듯한 숫자들의 오차와 검증 불가한 실험이 결론의 '74%'를 신앙이 아닌 참고치로 읽게 만든다.


원본 (완역)

1986년 항공기 정비 표준(ASD-STE100)이 AI 슬롭을 고치는가 — 직접 테스트

원본은 YouTube 영상이며 URL 미제공 — 자동 자막 전사만으로 완역함(부분 추출). ASR 오인식은 문맥으로 교정했고, 불확실한 표기는 (표기 불확실)로 표시.

들어가며 (Intro)

434페이지짜리 문서였다. 나는 그걸 파헤쳐서 규칙들을 끄집어냈고, 내 모델에게 먹였고, 지금까지 아무도 실제로 해보지 않았던 테스트를 돌렸다. 자, 여기 그 결과가 있다. 하지만 먼저, 이야기부터.

이 이야기의 시작 (How this started)

이 이야기가 곧 이 영상이 존재하는 이유이기도 하니까. 며칠 전, 어떤 포스트가 바이럴을 탔다. Joe Gristle(표기 불확실)이라는 계정이 아주 평범한 말로 이렇게 물었다.

"How do I make AI write technical documentation that doesn't sound like AI?"
(AI가 쓴 티가 안 나는 기술 문서를 AI로 어떻게 쓰게 하죠?)

이 질문이 200만 뷰를 넘겼다. 그러자 Vox(표기 불확실)라는 작가가 이를 받아서 더 날카로운 지적을 했다. 그는 이렇게 말했다.

"Stop telling Claude, no em dashes. Stop banning the word delve."
(Claude한테 "em dash 쓰지 마"라고 그만 말해라. "delve"라는 단어를 금지하는 것도 그만둬라.)

이건 두더지 잡기(whack-a-mole)이고, 그 게임에서 당신은 진다. 왜냐하면 모델은 애초에 그 단어들을 일부러 고른 게 아니기 때문이다. 당신이 모델에게 글쓰기 시스템(writing system)을 준 적이 없는 것이다. 그래서 모델은 인터넷의 평균값으로 기본 설정되고, 인터넷의 평균값이 바로 슬롭(slop)이다. 그가 내놓은 해법은 1946년에 나온 조지 오웰의 명료한 글쓰기 6원칙이었다. 그런데 그다음, 자기소개(bio)에 "chief agent officer"라고 적어둔 Mike Husteller(표기 불확실)라는 사람이 더 나은 답을 인용 트윗으로 달았다. 모델에게 그냥 항상 ASD-STE100 Simplified Technical English를 쓰라고 지시하라는 것. 실제로 출판된 국제 표준이다. 항공기 정비사가 수리 매뉴얼을 잘못 읽는 일이 없도록 만들어진 53개의 규칙과 900단어 사전 — 잘못 읽힌 수리 매뉴얼은 사람을 죽이기 때문이다. 그리고 그 순간 나는 토끼굴로 굴러떨어졌다. 이 전체를 판가름하는 성질이 딱 하나 있으니, 끝까지 이걸 염두에 두시라. 중요한 규칙들은 기계로 검사 가능(machine checkable)하다. 멍청한 스크립트 하나가 검증할 수 있고, 어떤 취향(taste)도 필요 없다.

슬롭이란 무엇인가 (What slop is)

고치기 전에, 병에 대해 정확해져야 한다. "AI 같은 느낌"은 감정이지 정의가 아니다. 그리고 감정은 고칠 수 없다. 그래서 내가 제일 먼저 한 일은 슬롭을 기계적으로 못 박아 보는 것이었다. 그리고 내가 계속 마주친 모든 것은 여섯 가지 습관으로 수렴한다. 당신도 전부 이미 아는 것들이다.

자, 이 목록이 왜 중요한가. 이 여섯 개 하나하나가 전부 구체적이고 이름 붙일 수 있는 동작이다. 그리고 이름 붙일 수 있는 것은, 금지할 수도 있다. 이 목록을 붙잡고 있어라. 곧 규칙 하나하나에 대조해 볼 것이다.

STE란 무엇인가 (What STE is)

그래서 이 항공기 표준이란 뭔가? 나는 당연히 1970년대 후반에 살아보지 않았다. 그러니 이건 내 조사가 들려주는 대로의 이야기다. 그 시절 유럽 항공우주 산업에는 치명적인 문제가 있었다. 정비 매뉴얼은 영어로 쓰였는데, 전 세계에서 그걸 읽는 정비사 대부분은 영어 원어민이 아니었다. 그리고 항공기에서 지시문 하나를 잘못 읽으면 장례식이 된다. 그래서 업계는 영어의 계약 버전을 만들었다. 스타일 가이드가 아니라 명세(specification)다. 첫 발행은 1986년. 현행 버전인 issue 9는 2025년 1월에 나왔고, 공식 사이트에서 무료로 내려받을 수 있다. 전체 문서는 434페이지다. 솔직히 말하면, 나는 앉아서 한 페이지 한 페이지를 다 읽지는 않았다. 파고들어서 중요한 부분들만 캐냈다(mined out). 규칙, 사전, 그리고 그 뒤에 깔린 논리. 시간이 꽤 걸렸지만, 당신은 이 문서를 열어볼 필요가 영영 없을 것이다. 문서는 두 부분으로 되어 있다. 1부는 절차(procedures). 2부가 나를 진짜로 놀라게 한 부분이다. 약 900개의 승인 단어(approved words) 사전인데, 모든 단어가 정확히 하나의 의미와 하나의 문법적 역할만 부여받는다. STE에서 "fall"은 오직 중력에 의해 아래로 움직인다는 뜻이다. 감소한다(decrease)는 뜻으로 쓰는 것은 허용되지 않는다. 영어가 하나의 아이디어에 다섯 개의 단어를 주는 곳에서, STE는 하나만 남기고 목록을 죽인다. 당신에게 주어지는 건 "start"다. begin, commence, initiate, originate는 못 쓴다. 방금 무슨 일이 일어났는지 보라. 동의어 돌려쓰기 — 슬롭 습관 1번 — 이 설계 단계에서 이미 죽었다. 그리고 이 물건이 제 우리를 탈출했음을 말해주는 숫자를 하나 더 찾았다. 오늘날 이 표준을 요청하는 사람의 64%가 항공우주·방위 산업 바깥에 있다.

규칙 대 규칙 (Rule by rule)

이제 슬롭 목록이 규칙 하나하나에 의해 처형되는 걸 보라. 이 매핑이 조사 중 나를 벌떡 일으켜 앉힌 부분이다.

그리고 여기 결정타가 있다. STE는 애초에 AI를 위해 설계된 것이 아니다. 40년 전, 스트레스 상태의 인간 독자를 위해 모호함(ambiguity)을 제거하려고 설계됐다. AI 슬롭이란 그저 자세만 좋은 모호함이다. 항공우주 산업은 40년에 걸쳐 치료제를 만들어냈다 — 단지 다른 환자를 위해서였을 뿐.

적용 전후 (Before and after)

장난감 예제 말고, 진짜를 읽어드리겠다. 같은 모델, 같은 작업. 캐싱 라이브러리 README의 도입부를 써라. 먼저 글쓰기 시스템 없이 기본값으로 뽑은 것.

"Traditionally, caches miss constantly in LLM workloads because users rarely phrase the same question identically."
(전통적으로, LLM 워크로드에서 캐시는 끊임없이 미스가 난다. 사용자가 같은 질문을 똑같이 표현하는 일이 드물기 때문이다.)

이건 em dash가 날아드는, 한 호흡짜리 긴 문장이고, 끝은 이렇게 닫힌다.

"designed to slot into your existing stack with minimal friction and no lock-in."
(최소한의 마찰과 락인 없이 기존 스택에 끼워 넣을 수 있도록 설계되었다.)

트렌치코트를 입은 마케팅 문구 네 개. 이제 같은 모델에 표준을 로드한 버전.

"A normal cache matches requests by exact text. A small change in wording then causes a cache miss. FluxCache compares the meaning of a new prompt with the prompts already in the cache."
(보통의 캐시는 요청을 정확한 텍스트로 매칭한다. 그래서 표현이 조금만 달라져도 캐시 미스가 난다. FluxCache는 새 프롬프트의 의미를 캐시에 이미 있는 프롬프트들과 비교한다.)

(FluxCache는 표기 불확실.) 짧은 문장, 능동태, 문장당 아이디어 하나, 해독할 것이 전혀 없다. 그리고 내가 가장 좋아한 결과는 에러 메시지였다. 기본 버전은 헤징하고 패딩한다.

"You have exceeded the limit. This ensures fair access for all users."
(한도를 초과하셨습니다. 이는 모든 사용자의 공정한 접근을 보장하기 위함입니다.)

STE 버전은 같은 내용을 41% 더 적은 단어로 말했고, 내 검사기에서 완벽한 0점을 받았다. 그것이 삭제한 모든 것은 슬롭이었다. 그것이 삭제한 것 중 정보는 하나도 없었다. 잘라낸 것과 잃은 것 사이의 간격 — 그게 이 게임의 전부다.

인간 대상 증거 (The human evidence)

자, 통제 영어(controlled English)가 인간 독자에게 실제로 효과가 있는가, 아니면 그냥 내가 우연히 좋아하는 미학인가? 나는 연구들을 파헤쳤고, 진짜 증거가 있다. 증거를 약화시키는 부분까지 포함해서 있는 그대로 전달하겠다. 내가 찾은 가장 강력한 연구는 1996년 Chervak, Drury & Ouellette(표기 불확실)의 것이다. 이들은 항공기 정비 기술자 175명에게 실제 정비 작업카드(workcards)를 주었다. 일부는 일반 영어로, 일부는 단순화 영어로. 이해도가 76%에서 86%로 올랐다. 그리고 비원어민 — 이 표준이 바로 그들을 위해 만들어진 사람들 — 의 경우 69에서 87로 올랐다. 이 말을 잘 들어보라. 제약이 고전하던 독자들을 원어민 수준까지 끌어올린 것이다. Microsoft Research는 2007년에 더 큰 연구를 돌렸다. 520개 문장을 중국어, 프랑스어, 네덜란드어, 아랍어로 번역했다. 통제 버전이 모든 언어에서 일반 버전을 이겼고, 그것이 운일 확률은 1000분의 1 미만이다. 그리고 그들의 데이터에서 단일 규칙으로 가장 효과적이었던 것은 화려하고 격식 차린 표현을 잘라내는 것 — 거의 문자 그대로 안티슬롭(anti-slop)의 정의다. 이제 정직해질 차례. 그 번역 개선 효과는 실재했지만 작았다. 4점 척도에서 0.1점대(tenths of a point, 표기 불확실) 수준. Airbus 연구(추정)는 과도한 단순화가 오히려 역효과를 내서 독자를 느리게 만들 수 있다는 것도 발견했다. 짧다고 항상 명확한 건 아니다. 그리고 여기 있는 모든 연구는 이해(understanding)를 측정한 것이지 기억(memory)이 아니다. STE 텍스트가 더 잘 기억된다는 걸 보인 사람은 아무도 없다. 더 잘 이해된다는 것만 보였다. 그러니 명료함을 위해 써라. 마법까지 기대하지는 마라.

실험 (The test)

그런데 방금 말한 모든 것에는 구멍이 있다. 저 증거 전부는 항공기 매뉴얼과 인간 필자에 관한 것이다. 이 표준을 AI 출력물에 테스트해 본 사람은 아무도 없었다. 그 바이럴 주장은 유추에 의한 추측이었다. 그래서 내가 직접 돌렸다. 셋업을 평이하게 설명하면: 개발자가 실제로 하는 여섯 가지 글쓰기 작업 — README, 풀 리퀘스트 설명, API 문서, 에러 메시지, 시작 가이드(getting-started guide), 그리고 지원 중단 공지(deprecation notice). 각각을 네 가지 방식으로 생성했다. 아무것도 없는 베이스라인, 지금 다들 쓰고 있는 금지 단어 목록(banned-words list), 오웰의 6원칙, 그리고 내 STE 스킬. 그다음 린터(linter)를 하나 짰다. 기계적인 것들을 세는 작은 스크립트다. 문장당 단어 수, 세미콜론, 수동태, 구동사, 마케팅 형용사. 점수는 100단어당 위반 수이고, 낮을수록 깨끗하다.

Claude에서의 결과: 베이스라인 4.36. 금지 단어 목록 4.21 — 3% 개선이다. 3. 오웰의 규칙 2.48, 43% 감소. ASD Simplified Technical English 1.12, 74% 감소. 베이스라인 슬롭의 3분의 1 이하다. 그리고 그 데이터에 이 실험 전체에서 가장 뼈아픈 숫자가 묻혀 있다. 금지 단어 목록은 em dash를 실제로 죽였다. 6개에서 1개로 — 당신이 시킨 게 바로 그거니까. 그런데 전체 슬롭은 거의 움직이지 않았다. em dash를 금지했더니, em dash 없는 슬롭 문단을 얻은 것이다. 그 데이터 포인트 하나에 이 실수 전체가 들어 있다.

하지만 모델 하나의 결과는 결과가 아니다. 그래서 전체를 GPT-5.5에서 다시 돌렸다. 여기가 정직한 부분이다. STE는 여전히 슬롭을 절반으로 잘랐다. 마이너스 50%. 그러니 핵심 발견은 유지된다. 그런데 GPT에서는 금지 목록이 실제로 먹혔다. 마이너스 40%. 그리고 오웰이 거기서는 STE와 동률이었다. 그러니까 그 잔인한 3%라는 숫자는 Claude의 별난 버릇(Claude quirk)이었지 자연법칙이 아니었다. 두 모델은 슬롭을 흘리는 방식조차 다르다. Claude의 슬롭은 화려하다: em dash, seamless, 긴 만연체. 반면 GPT의 슬롭은 조용하다: 그저 너무 길고 너무 수동태인 깔끔한 문장들. 같은 병, 다른 증상. 두 모델 모두에서 살아남는 발견은 더 좁고 더 진실하다. 모델에게 진짜 글쓰기 시스템을 주면, 슬롭이 절반 이상 떨어진다. 매번, 내가 시도한 모든 모델에서. STE는 최고이거나 최고 동률이었다. 단어를 하나씩 금지하는 것은 옳은 아이디어의 가장 신뢰할 수 없는 버전일 뿐이다.

중요한 주의 사항 하나. 내 린터는 표준 전체가 아니다. STE를 유지관리하는 사람들은 어떤 소프트웨어도 완전한 준수(full compliance)를 인증할 수 없다고 분명히 말한다. 일부 규칙은 문장이 말이 되는지 인간이 판단해야 한다. 그리고 그들이 실제로 옳다. 하지만 그 판단 규칙들은 슬롭 규칙이 아니다. 슬롭은 기계적인 부분이다. 그리고 기계적인 부분은 스크립트로 100% 검사 가능하다. 이 아이디어는 새것도 아니다. 내가 찾은 바로는, Boeing은 대략 1990년부터 350개 규칙 파서를 갖춘 simplified English 검사기를 출하해 왔다. 기계 검사 글쓰기는 이미 해결된, 지루한, 실전 검증된 분야다. 우리는 그걸 새 문제에 겨눴을 뿐이다.

실제 사용법 (How I use it)

그럼 나는 이걸 실제로 어떻게 쓰나? 434페이지를 모델에 붙여넣는 방식은 아니다. 이 표준은 저작권이 있고, 사전 900단어는 아무 소득 없이 컨텍스트만 태울 것이다. 증류(distill)하는 것이다. 나는 두 가지 모드를 가진 작은 스킬 파일을 만들었다. Strict 모드는 절차와 에러 메시지용이다. 잘못 읽는 것에 비용이 따르는 모든 곳. 여기엔 전체 규칙과 하드 길이 제한이 들어간다. STE-flavored 모드는 일반 산문용이다. 문장 규율, 문단 규율, 구동사 금지 습관은 유지하되 사전 봉쇄(dictionary lockdown)는 버린다. 블로그 글에 필요한 건 표현의 폭이지 인격 이식이 아니니까. 그리고 어떤 똑똑한 사람들은 그것조차 과하다고 생각한다. 한 엔지니어는 스레드에 이렇게 답했다.

"ASD-STE100 is a bit too much. I wrote a tiny Orwell rule set instead. 90% of the benefit."
(ASD-STE100은 좀 과하다. 나는 대신 아주 작은 오웰 규칙 세트를 썼다. 이득의 90%는 나온다.)

그리고 그 말은 틀리지 않았다. 그게 진짜 교훈이다. 표준은 선택지 중 하나다. 짧고 검사 가능한 규칙 세트 — 그게 제품이다. 그리고 이 제품이 사실 caveman([추정]: 이 채널/커뮤니티의 간결 통신 룰셋)이다. 이미 두어 달 전에 구현되었고 사람들이 채택해서 쓰고 있다. 하지만 이 주의 사항은 새겨두라: STE는 슬롭의 형식(form)을 고치지, 실질(substance)을 고치지 않는다. 린터는 공허한 문단을 깨끗하고, 자신감 있고, 구두점 잘 찍힌 공허한 문단으로 바꿀 수 있다. 그것을 참으로 만들 수는 없다. 슬롭은 한 벌의 코트를 걸친 두 개의 문제다: 나쁜 글쓰기, 그리고 할 말이 없음. 이건 첫 번째만 고친다.

평결 (The verdict)

그래서 평결. 1986년 항공기 정비 표준이 AI 슬롭의 형식을 치료하는가? 그렇다. 내가 테스트한 그 무엇보다 잘하며, 그 이유는 우연이 아니다. 슬롭은 모호함이고, STE는 모호함을 정조준한 40년의 엔지니어링이다. 하지만 이것이 당신의 글을 좋게 만들어주지는 않는다. 슬롭이 아니게(unsloppy) 만들어줄 뿐이다. 그리고 목소리(voice)가 필요한 것에는 절대 가까이 가져가지 마라. 마케팅 카피를 STE에 돌리는 것은 시에 토크 렌치 규격을 들이대는 짓이다. 보이지 않는 명료함이 일의 전부인 곳에만 써라. 문서, 풀 리퀘스트, 에러 메시지, 에이전트 출력 — 그리고 그 외에는 어디에도 쓰지 마라. 그리고 솔직히, 표준 자체가 교훈도 아니다. 교훈은 그 스레드가 지적했고 내 숫자가 뒷받침하는 것이다. delve를 하나씩, 영원히 금지하는 것으로는 AI 글쓰기를 고치지 못한다. 블랙리스트 대신 모델이 스스로를 대조해 검사할 수 있는 시스템을 주는 것으로 고친다. 모델은 블랙리스트를 언제나 우회(route around)할 것이다. 오웰은 시스템이다. STE는 더 엄격하고 역시 테스트 가능한 시스템이다. 10줄짜리 오웰 설정(10-line Orwell config)은 더 작은 시스템이다. 하나를 골라라, 출력물이 통과해야 하는 테스트로 만들어라, 그리고 두더지 잡기를 그만둬라. 필자를 제약하면 독자가 자유로워진다. 항공우주 산업은 우리 대부분이 태어나기 전에 그걸 알아냈다. 스킬, 린터, 그리고 이 영상의 모든 숫자는 아래에 링크되어 있다. 이건 이 채널의 첫 번째 영상이기도 하다. 이런 종류의 테스트를 더 보고 싶다면, 뭘 해야 할지 아실 것이다. 다음 영상에서 만나자.



기타

용어·고지

고지: 본 문서는 부분 추출이다 — 원본 영상 URL이 제공되지 않아 유저가 붙여넣은 YouTube 자동자막(ASR) 전사만으로 작성했다. 채널명·화자·영상 속 화면 자료·설명란 링크는 미확보. ASR 오인식(예: "slope"→slop, "Cloudy"→Claude, "Orville"→Orwell, "Boing"→Boeing)은 문맥으로 교정했고 불확실한 고유명사는 (표기 불확실)로 남겼다. 영상 저자의 실험 수치는 자체 보고이며 외부 재현이 없다.