'인간같이' 글을 쓰는 인공지능을 만들어 내는 법
그냥 사람이 처음부터 쓰면 되는 거 아닌가요?
비즈니스AI 말투를 지우는 도구가 한꺼번에 나오고 있어요
최근 눈에 걸린 자료 네 개가 전부 같은 방향을 가리키고 있었어요.
허깅페이스에는 “사람처럼 쓰는 AI”를 내건 Hemmingway-1이라는 모델이 올라왔어요. 깃허브에서는 AI가 쓴 한글에서 티를 지워 준다는 Claude 스킬 im-not-ai가 9월 22일 기준 별 5,600개를 넘겼어요. 프런트엔드 쪽에서는 AI 코딩 도구가 뽑아내는 뻔한 화면을 막겠다는 Taste Skill이 쓰이고 있고요. 페이스북에서는 항공기 정비 문서를 위해 만든 영어 규격을 한국어 보고서용 프롬프트로 고쳐 쓴다는 글이 돌았어요.
손대는 자리는 제각각이에요. 모델을 다시 훈련하기도 하고, 다 쓴 글을 고치기도 하고, 쓰기 전에 규칙을 걸기도 해요. 바라는 결과는 비슷해요. AI가 쓴 게 티 나지 않는 글이요.
그런데 이 목록을 보고 있으면 질문 하나가 먼저 올라와요. 사람이 쓴 것 같은 글이 필요하면, 그냥 사람이 처음부터 쓰면 되는 거 아닌가요? 오늘은 이 도구들이 “사람 같다”를 각각 무엇으로 정의했는지 뜯어보면서 그 질문에 답해 볼게요.
세 군데에서 동시에 손을 대고 있어요
모델을 다시 가르친 Hemmingway-1
Hemmingway-1은 Qwen3.8-27B를 바탕으로 추가 훈련한1 270억 파라미터2 모델이에요. 가중치를 공개했고 Apache-2.0 라이선스라 상업적으로도 쓸 수 있어요.
이 모델이 겨냥한 문제는 꽤 구체적이에요. 개발사는 집주인에게 보일러 고장을 알리는 문자를 부탁하는 장면을 예로 들어요. 보통의 모델은 문자 후보 세 개에 인사말과 후보별 해설까지 붙여 주는데, Hemmingway-1은 문자만 준다는 거예요. 개발사가 따로 잰 수치로는 Fable 5, GLM-5.3, Kimi K3가 열 번 중 아홉 번 넘게 실제로 보낼 문장을 설명과 선택지 속에 묻었다고 해요.
“사람 같다”는 주장도 숫자로 내놨어요. 실제 요청 80개에 대해 다른 모델의 답과 둘씩 짝지어, 누가 썼는지 가린 채 비교했어요. 사람이 쓴 글로 판정된 비율에서 다음 모델보다 26포인트 앞섰다고 해요. 쓰기 곤란한 부탁 글에서는 GPT-6 Astra가 9%, Hemmingway-1이 72%였고요.
다만 조건을 같이 읽어야 해요. 이 평가 셋은 개발사가 직접 만들고 돌렸고, 판정도 사람이 아니라 다른 AI 모델이 했어요. 개발사도 이 점을 먼저 밝혀 뒀어요. 영어 중심 모델이라는 점, 틀려도 확신에 찬 말투로 말할 수 있으니 의료·법률·금융 판단에는 쓰지 말라는 경고도 붙어 있어요.
다 쓴 글을 고치는 im-not-ai
im-not-ai는 한국어에 초점을 맞춘 윤문 도구예요. Claude Code 같은 코딩 에이전트에 스킬3로 설치해서 써요. AI가 쓴 한글에 남는 티를 10개 대분류, 70개 세부 패턴으로 나누고 심각도를 매겨 찾아낸 뒤 고쳐요. “~를 통해”, “~에 있어서” 같은 번역투4, “결론적으로”나 “시사하는 바가 크다” 같은 관용구, 기계적인 “첫째·둘째·셋째” 나열이 대표적인 대상이에요.
눈여겨볼 건 스스로 정한 금지선이에요. 사실·주장·수치·고유명사·직접 인용은 건드리지 않아요. 원문 대비 변경률이 30%를 넘으면 경고하고, 50%를 넘으면 작업을 멈춰요. “A가 아니라 B” 같은 대구를 모조리 깨서 글쓴이의 목소리까지 지워 버리면 그것도 실패로 처리해요. 말투만 고치고 내용에는 손대지 않겠다는 설계예요.
쓰기 전에 규칙을 거는 ASD-STE100과 Taste Skill
ASD-STE100은 1986년에 처음 나온 통제 언어5 규격이에요. 유럽 항공우주 업계가 항공사들의 요청을 받아 만들었어요. 영어가 모국어가 아닌 정비사가 매뉴얼을 잘못 읽으면 사람이 다칠 수 있으니, 언어 자체를 좁힌 거예요. 현재판은 2025년 1월에 나온 9판이고, 이 판부터 명세가 아닌 국제 표준으로 이름을 바꿨어요. 작성 규칙 53개와 승인 단어 약 900개로 되어 있고, 단어마다 뜻과 품사를 하나씩만 허용해요. 명사를 네 개 이상 잇지 않고, 쓸 수 있는 동사 형태도 몇 가지로 제한해요.
저도 이 규격을 가져다 쓰고 있어요. Notion 한국어 사용자를 위해 만든 INLEVEL9 Skills에서 문서 작성 규칙을 짤 때 ASD-STE100의 접근을 참고했어요. Notion을 오래 쓰면서, 글을 쓰기 전에 어휘와 문장과 문서 구조의 규칙을 먼저 정해 두는 편이 효과적이라는 걸 겪었거든요. 직접 쓸 때도, Notion AI에 작성을 맡길 때도 기준이 분명하면 결과가 더 일관되고 검토하기 쉬웠어요.
그래서 한 블록에는 한 내용만 담고, 같은 개념에는 같은 말을 쓰고, 확정된 결정과 제안과 아직 정하지 않은 사항을 구분하게 했어요. 확인된 사실과 작성자의 해석이 섞이지 않았는지도 마지막에 점검하게 했고요. 담당자, 기한, 완료 상태처럼 자료에 없는 값은 추측해서 채우지 말고 미정으로 두라는 규칙도 넣었어요.
Taste Skill은 같은 발상을 화면 디자인에 적용해요. AI 코딩 에이전트가 템플릿 같은 화면을 만들지 않도록 규칙과 금지 목록을 스킬 파일로 묶었고, 결과물을 내보내기 전에 점검표를 통과하게 해요. 스스로를 “안티 슬롭”6 프레임워크라고 불러요.
”사람 같다”를 재는 자가 흔들려요
네 도구가 사람다움을 어떻게 재는지 보면 공통점이 있어요. 사람다움을 직접 재지 못하니까, AI 티가 없는 상태로 거꾸로 정의해요.
Hemmingway-1의 “사람 같다”는 판정 모델이 사람 글로 착각한 비율이에요. im-not-ai의 기준은 AI 글에 자주 나오는 패턴 목록이고요. 이 방식의 약점은 im-not-ai가 외부 검증을 받으면서 드러났어요.
데이터 품질 기업 Pebblous가 8월에 im-not-ai의 공개 코드를 뜯어봤는데, ChatGPT가 나오기 전인 2020년에 사람이 쓴 에세이가 최고 위험 등급으로 판정됐어요. 원인은 글쓴이의 쉼표 습관이었어요. 연결어미 뒤에 쉼표를 찍는 비율이 83.3%였고, 이 한 가지 지표가 판정 전체를 끌고 갔어요. 개발팀이 사람 글 532편으로 다시 재 보니 285편, 53.6%가 AI 고위험으로 찍혔어요.
개발팀의 대응은 빨랐어요. 한 계열 지표의 영향에 상한을 두고, 서로 다른 두 계열이 동시에 걸려야 고위험으로 보게 바꾸고, 칼럼과 보고서 장르의 기준선을 따로 만들었어요. 그 뒤 같은 532편에서는 고위험 판정이 0편이 됐어요. 기준선을 만든 글로 다시 잰 결과라 새 글에서도 통하는지는 아직 모른다는 한계도 README에 적어 뒀고요. 반례를 공개하고 고친 과정은 오히려 이 프로젝트를 믿게 만드는 대목이에요.
그래도 이 사건이 보여 준 사실은 남아요. AI의 티로 분류된 습관의 상당수는 원래 사람의 습관이에요. 제213호에서 다뤘듯 챗봇 말투는 사람들이 격식을 차려 쓴 회사 보고서와 논문에서 배운 거예요. 그리고 지문은 계속 이사해요. 한때 AI 글의 상징이던 단어는 최신 모델에서 거의 사라졌고, 다른 표현이 그 자리를 채웠어요. 오늘의 티 목록은 특정 시기 모델들의 버릇 목록에 가까워요.
여기서 걱정이 하나 생겨요. 같은 스킬을 수천 명이 설치하면, 금지 목록을 피해 간 문장들이 서로 닮아 갈 수 있어요. 뻔한 화면을 막으려는 규칙이 널리 퍼지면, 그 규칙을 따른 화면이 다음 세대의 뻔함이 될 수도 있고요. 금지 목록으로 정의한 사람다움은 계속 쫓아가야 하는 과녁이에요.
원한 건 ‘사람’보다 덜 수고로운 글이었어요
이번에는 도구들이 실제로 고치는 대상을 볼게요. Hemmingway-1은 해설 속에 묻힌 문자를, im-not-ai는 번역투와 읽기 힘든 문장을, ASD-STE100은 잘못 읽힐 수 있는 지시를, Taste Skill은 어디서 본 듯한 화면을 고쳐요. 누가 썼는지를 따지는 도구는 없어요. 전부 읽는 사람이 치르는 수고를 줄이는 쪽이에요.
그 점에서 ASD-STE100은 결이 조금 달라요. 사람처럼 보이려고 만든 규격이 아니에요. 사람이 쓴 매뉴얼을 사람이 잘못 읽는 일을 막으려고 만들었어요. 좋은 글의 기준을 흉내 낼 글쓴이에게 두지 않고, 잘못 읽었을 때 다칠 수 있는 독자에게 뒀어요. 읽는 사람을 기준으로 규칙을 세우면, AI 티의 상당 부분은 따로 겨냥하지 않아도 같이 빠져요.
그러니 “인간같이”는 조금 부정확한 주문이에요. 사람들이 이 말로 원한 건 대개 읽는 사람이 헤매지 않는 글이었어요.
그래서, 사람이 처음부터 써야 할까요
소제목의 질문으로 돌아가 볼게요. 네 도구의 설명서를 나란히 놓고 보면, 모두 같은 자리를 비워 두고 있어요.
im-not-ai는 내용을 한 글자도 바꾸지 않겠다는 원칙을 맨 앞에 뒀어요. Hemmingway-1은 틀린 말을 확신에 차서 할 수 있다고 스스로 경고해요. 앞에서 말한 제 Notion 규칙의 미정 조항도 마찬가지예요. 자료에 값이 있는지 확인하는 사람이 있어야 작동하는 규칙이에요.
무엇을 주장할지, 무엇을 확인했는지, 어디까지 책임질지는 어떤 도구도 채워 주지 않아요. 도구들이 다루는 건 그렇게 정해진 내용을 담는 표면이에요. 그래서 질문에 대한 답은 절반만 “예”예요. 문장은 맡길 수 있어요. 주장은 사람이 처음부터 써야 해요.
순서를 거꾸로 하면 곤란해져요. 아무도 판단하지 않은 초안에서 AI 티만 지우면, 매끄럽지만 안에 아무도 없는 글이 나와요. 지금까지는 어색한 번역투나 뻔한 결론이 독자에게 “이 글은 아무도 제대로 확인하지 않았을 수 있다”는 신호 노릇을 했어요. 윤문 도구는 그 신호까지 같이 지워요. 제195호에서 다룬 탐지기 오탐은 사람 글이 AI 글로 몰리는 문제였어요. 이번에는 반대로, 사람이 확인하지 않은 글이 사람 글처럼 보이게 돼요.
오스왈드의 시선
저는 모든 일에 가장 똑똑한 모델이 필요한 건 아니라고 자주 말해요. Hemmingway-1은 그 말의 좋은 사례예요. 270억 파라미터 모델이 일상 메시지라는 좁은 과제에서는 훨씬 큰 모델들을 앞섰다고 하니까요. 개발사 자체 평가라는 조건을 감안해도, 과제를 좁게 정한 모델이 어디서 이길 수 있는지 보여 주는 방향은 맞다고 봐요.
다만 “사람 같은 글”을 목표로 삼는 설계에는 동의하기 어려워요. 그 목표는 AI 티를 기준으로 정의되고, AI 티는 모델이 바뀔 때마다 이사해요. 기준이 흔들리면 결국 탐지기와 윤문기가 서로를 쫓는 경기가 돼요. 저라면 과녁을 읽는 사람에게 두겠어요. 이 글을 누가 읽는지, 읽은 뒤 무엇을 해야 하는지, 어디서 잘못 읽을 수 있는지요. ASD-STE100이 40년 동안 판을 거듭하며 버틴 것도 기준을 거기에 뒀기 때문이라고 봐요. INLEVEL9 Skills에서 이 규격을 참고한 이유도 같았어요. 제가 바란 건 사람처럼 보이는 문서가 아니라, 더 명확한 문서와 일관된 업무였어요.
그래서 “그냥 사람이 쓰면 되지 않나”라는 질문에는 이렇게 답하고 싶어요. 사람이 처음부터 써야 하는 건 판단이에요. 판단이 있는 초안은 도구가 다듬을수록 좋아지고, 판단이 없는 초안은 다듬을수록 그 빈자리가 안 보이게 돼요.
마치며
이번에 본 도구들은 AI가 쓴 티를 지우는 데 꽤 정교해졌어요. 그만큼 글에 남은 티가 독자에게 주던 경고도 약해지고 있어요. 글을 믿을지 판단할 단서는 앞으로 문체보다, 그 글이 무엇을 주장하고 무엇을 근거로 댔는지에 더 많이 남을 거예요.
💬 구독자님은 AI가 쓴 글에서 어떤 대목을 만나면 읽기를 멈추시나요? 그게 말투였는지, 내용이었는지 댓글로 알려 주세요.
📨 AI로 보고서나 메시지 초안을 쓰는 동료가 있다면 이 글을 공유해 주세요. 무엇을 맡기고 무엇을 직접 쓸지 이야기해 볼 거리가 될 거예요.
이미 구독 중이신가요? 로그인하고 댓글 남기기
커피 한 잔 보내기
이 관점이 좋았다면, 다음 글에 커피 한 잔
오스왈드에게 커피와 함께 짧은 쪽지를 보내주세요. 응원은 다음 취재와 집필에 보탭니다.
참고자료 & 더 읽기
- Altworld/Hemmingway-1 모델 카드 (Hugging Face)
- epoko77-ai/im-not-ai: 한글 AI 티 제거기 (GitHub)
- Pebblous, 한국어 AI 휴머나이저 티어다운 (2026-08-20)
- Taste Skill: The Anti-Slop Frontend Framework
- ASD-STE100, About STE
- ASD-STE100, FAQ
- 제213호 회사 보고서가 챗봇 말투를 가르쳤다
- 제195호 미국 독립선언서를 AI가 썼다고?
- 제191호 Claude가 쓴 글엔 왜 지문이 남을까

여러분의 생각이 다음 호를 만듭니다
이번 호에서 가장 공감했거나, 다른 경험을 한 지점은 무엇인가요?