AI가 쓴 글인지 구별하는 법
작성자 Chatday Editorial Team ·
곱씹어볼 만한 숫자가 하나 있어요. 수만 개의 웹페이지를 표본으로 조사한 연구자들에 따르면, 온라인에 새로 올라오는 글의 절반 정도가 지금은 AI가 쓴 글이라고 해요. 인터넷 한구석의 특수한 이야기가 아니에요. 절반이죠. 그러니 오늘 여러분도 거의 확실히 AI가 쓴 글을 읽었을 거예요. 아마 눈치채지도 못한 채로요. 제품 리뷰, 뉴스 모음글, LinkedIn 게시물, 어쩌면 이메일에서요.
그럼 실제로 어떻게 구별할 수 있을까요? 솔직히 말하면, 내 눈과 알맞은 도구를 함께 쓰면 꽤 잘 알아챌 수 있어요. 다만 각각이 무엇을 증명할 수 있고 무엇을 증명할 수 없는지 알아야 하죠. 이 글에서는 두 가지를 모두 알려드려요. 사람이 30초 안에 알아챌 수 있는 신호들, 그리고 두 번째 의견이 필요할 때 AI 탐지기가 어떻게 작동하는지요.
지금 인터넷 절반은 기계가 쓰고 있어요
앞서 언급한 통계는 SEO 연구기업 Graphite에서 나온 거예요. 이 회사는 2020년 이후 발행된 영어 기사 수만 건을 분석해서 각각을 여러 AI 탐지기에 돌려봤어요. 그 결과, AI로 만든 기사의 비율은 2022년 말 ChatGPT가 출시된 뒤 폭발적으로 늘었고, 이후 2025년과 2026년 내내 대략 50% 선에서 안정됐다고 해요. 어느 분기에는 절반을 살짝 넘고, 어느 분기에는 살짝 못 미치는 식이죠.
블로그 스팸에만 국한된 이야기도 아니에요. 1,500만 건이 넘는 생물의학 논문 초록을 따로 분석한 결과, 2024년까지 그중 최소 13.5%가 AI로 쓰였거나 손질된 흔적을 보였어요. ChatGPT 등장 이후 급증한 특정 어휘를 근거로 삼은 분석이었죠. 학술지에서도 이런 일이 벌어진다면, 어디에서든 벌어지고 있다고 봐야 해요.
그렇다고 AI가 쓴 글이 무조건 나쁘다는 뜻은 아니에요. 상당수는 유용하고, 많은 사람이 AI를 초안 작성 동반자로 쓰고 나서 꼼꼼히 손보기도 하죠. 다만 에세이를 채점할 때, 극찬으로 가득한 제품 리뷰를 읽을 때, 혹은 뉴스 기사를 믿어도 될지 판단할 때는 “이걸 실제로 누가 썼을까?”라는 질문이 충분히 타당해요. 이제 그 답을 찾는 법을 알아볼게요.
직접 알아챌 수 있는 신호들
어떤 도구를 쓰기 전에 먼저 내 눈을 써보세요. AI 모델은 인터넷에 쌓인 엄청난 양의 글로 쓰는 법을 배운 다음, 평가자들이 좋아하는 톤, 매끄럽고 호의적이고 살짝 격식 있는 쪽으로 다듬어졌어요. 그 다듬어진 결과가 일종의 지문이 된 거죠. 다른 사람의 글을 읽을 때 무엇을 살펴봐야 할지 알려드릴게요.
| 신호 | 이렇게 나타나요 |
|---|---|
| 정형화된 표현 | ”오늘날의 디지털 환경에서는”, “주목할 점은”, “한번 살펴볼까요”, “게임 체인저” 같은 표현 |
| 의심스러울 만큼 균일한 리듬 | 모든 문단이 같은 크기, 모든 문장이 같은 중간 길이, 깔끔하게 세 개씩 묶인 목록 |
| 자신감은 넘치는데 알맹이가 없음 | 어떤 주제에나 갖다 붙일 수 있을 만큼 다듬어진 문장뿐, 실제 경험의 디테일은 없음 |
| 확인 가능한 구체적 정보 부재 | 이름, 날짜, 가격, 직접 겪은 순간이 없거나, 있어도 틀린 것으로 드러남 |
| 완벽한 문법, 개성 없음 | 오타 하나 없고, 축약형도 없고, 개성도 없어서 알맹이 없는 보도자료 같음 |
| 공식에 대한 집착 | ”단순한 X가 아니라 Y입니다”, “X부터 Y까지”, 수사적 질문으로 시작하는 도입부 |
사람이 할 수 있는 가장 강력한 확인법은 구체성 테스트예요. 진짜 작가는, 평범한 작가라도, 실제 경험의 흔적을 남겨요. 특정 가게 이름, 독특한 디테일, 뭔가를 감수한 의견 같은 것들이죠. AI는 맞는 글보다 그럴듯하게 들리는 글을 기본값으로 삼아요. 구체적인 주장 한두 개를 골라서 확인해 보세요. 어떤 식당 “리뷰”에 요리 이름이 한 번도 안 나오거나, 어떤 기사가 찾을 수 없는 연구를 인용한다면 그 의심에는 충분한 근거가 있어요. 이 실패 유형에는 이름이 따로 있는데, AI가 왜 사실을 지어내는지는 예전에 쉬운 말로 다룬 적이 있어요.
다만 누군가를 단정 짓기 전에 한 가지는 짚고 넘어갈게요. 저 표에 나온 신호들은 전부 습관일 뿐, 결정적인 증거는 아니에요. ChatGPT가 등장하기 훨씬 전부터 사람들은 정형화된 표현을 써왔거든요. 그래서 두 번째 의견이 도움이 되는 거예요.
AI 탐지기는 실제로 어떻게 작동할까요
AI 탐지기는 텍스트를 읽고 핵심 질문 하나를 던져요. 이 글이 얼마나 예측 가능한가?
언어 모델은 통계적으로 가장 그럴듯한 다음 단어를 계속해서 골라가며 글을 써요. 그러면 흔적이 남죠. AI 텍스트는 매끄럽고 예측 가능한 경향이 있어요. 놀라운 단어 선택이 거의 없고, 리듬도 균일하고 일정하죠. 사람의 글은 훨씬 지저분해요. 문장을 다시 시작하고, 엉뚱한 단어를 고르고, 길게 가다가 갑자기 짧아지기도 하죠. 탐지기는 이 예측 가능성(연구자들은 이를 “perplexity”라고 불러요)과 리듬의 변화(“burstiness”라고 부르죠)를 측정해서 확률을 내놓아요. 예를 들어 “이 텍스트는 AI가 썼을 가능성이 85%로 보인다”는 식으로요.
핵심 단어는 확률이에요. 탐지기는 실제로 누가 그 단어를 입력했는지 결코 알지 못해요. 앞 섹션에서 여러분이 했던 것과 똑같이, 근거 있는 통계적 추측을 하는 거예요. 다만 감이 아니라 수학으로요.
그래서 점수가 이렇게 움직이는 거예요.
- 긴 텍스트일수록 더 정확하게 읽혀요. 두 문장짜리 메시지는 신호 자체가 충분하지 않아요. 대부분의 탐지기는 몇백 단어 이하에서는 믿을 만하지 않아요.
- 섞인 텍스트는 탐지기를 혼란스럽게 만들어요. AI가 손질한 사람의 초안이나, 사람이 편집한 AI 초안은 회색 지대에 놓여요. 실제로 둘 다이기 때문이에요.
- 격식 있는 글은 “더 AI답게” 나와요. 스타일이 예측 가능하고 관습적일수록 사람이 썼어도 기계처럼 읽히거든요.
탐지기가 틀리는 지점
대부분의 글이 건너뛰는 부분이지만, 사실 가장 필요한 부분이에요. AI 탐지기에는 실제로 문서화된 실패 유형이 있어요.
가장 유명한 예는 OpenAI 자신에게서 나와요. 2023년 초, 이 회사는 자체 AI 텍스트 분류기를 내놓았다가 여섯 달 뒤 “정확도가 낮다”는 이유로 서비스를 중단했어요. 자체 수치로도 AI가 쓴 글의 26%만 잡아냈고, 사람이 쓴 글을 AI로 잘못 표시한 비율이 9%였어요. ChatGPT를 만든 회사조차 ChatGPT를 제대로 탐지하지 못했다면, 확실성을 장담하는 도구는 일단 의심하고 봐야 해요.
두 번째 실패 유형은 불공정하다는 점에서 더 심각해요. 학술지 Patterns에 실린 Stanford 연구는 실제 사람이 쓴 에세이를 대상으로 인기 있는 AI 탐지기 7개를 테스트했어요. 영어가 모국어인 사람의 에세이는 탐지기가 잘 맞혔어요. 하지만 영어가 모국어가 아닌 사람의 에세이는 61%나 AI가 쓴 것으로 잘못 표시됐죠. 이유는 방법 자체에 내재해 있어요. 제2언어로 글을 쓰는 사람은 더 안전하고 관습적인 표현을 쓰는 경향이 있는데, 수학적으로는 그게 “예측 가능한” 걸로 읽히거든요. 신중하고 격식 있고 정석대로 쓴 글이야말로 탐지기가 기계의 말투라고 여기는 바로 그 모습이에요.
텍스트를 확인하는 방법, 단계별로
이걸 다 합치면, 실제로 효과가 있는 루틴이 나와요. 시간은 2분 정도면 충분해요.
- 한 번 읽으면서 신호를 찾아보세요. 정형화된 표현, 균일한 리듬, 공식 같은 도입부, 개성 없음. 직감을 기록해두되, 거기서 멈추지는 마세요.
- 구체성 테스트를 해보세요. 확인 가능한 구체적 주장 한두 개를 찾아서 검색해 보세요. 지어낸 출처, 틀린 가격, 확인할 수 없는 연구야말로 가장 확실한 위험 신호예요.
- 탐지기에 돌려보세요. AI 탐지기에 텍스트를 붙여넣고 확률 점수를 받아보세요. 무료고, 10초면 되고, 가입도 필요 없어요.
- 길이를 고려하세요. 몇백 단어가 안 되면 점수를 크게 깎아서 보세요. 길고 편집되지 않은 텍스트라면 점수에 진짜 무게를 두세요.
- 누가 썼는지 생각해 보세요. 격식 있는 문체거나 영어가 모국어가 아닌 사람이라면, 그에 맞게 기준을 조정하세요. 바로 그 지점에서 오탐이 몰리니까요.
- 모든 걸 합쳐 판단하세요. 사람이 알아채는 신호 + 구체성 실패 + 높은 점수 = 거의 확실히 AI. 신호 하나만으로는 섣불리 단정하지 마세요.
언제 중요하고, 언제 솔직히 중요하지 않은지
AI가 쓴 글이라고 해서 전부 문제가 되는 건 아니에요. AI가 쓴 날씨 요약이나 제품 설명은 누구에게도 해를 끼치지 않죠. 이 질문이 중요해지는 건 다음과 같은 특정 상황들이에요.
- 교사와 교수님들. 과제가 학생 본인의 글인지 확인할 때는 위의 루틴을 활용하세요. 그리고 점수 하나만 보고 행동하기 전에 Stanford 연구 결과를 꼭 기억하세요.
- 채용 담당자들. 유난히 매끈한 자기소개서를 읽을 때는, 탐지기와 구체적인 면접 질문(“이 프로젝트에 대해 더 말해주시겠어요?”) 하나만 더하면 빠르게 판단할 수 있어요.
- 리뷰를 읽는 구매자들. 제품에 대한 구체적인 언급 하나 없는 별 다섯 개 리뷰가 전형적인 패턴이에요.
- 뉴스를 읽는 모든 사람. 기사의 사실이 확인되지 않는다면, 그 실수를 사람이 썼는지 기계가 썼는지보다 실수 자체가 더 중요해요.
그리고 반대 측면도 있어요. 제2언어로 신중하게 글을 쓰거나, 그냥 격식 있는 스타일을 가졌다면, 여러분의 정직한 글이 언젠가 잘못 표시될 수도 있어요. 내 기준선을 미리 알아두면 도움이 돼요. 내 글을 탐지기에 돌려보고 어떤 점수가 나오는지 확인해 보세요. 진짜 사람이 쓴 글인데도 계속 로봇처럼 읽힌다면, 그건 공정성 문제가 아니라 스타일 문제일 가능성이 커요. 이 문제를 다룬 AI 글을 사람처럼 자연스럽게 쓰는 법 가이드가 따로 있는데, 그 조언은 기계처럼 글을 쓰는 사람에게도 똑같이 잘 통해요. AI 텍스트 휴머나이저를 쓰면 딱딱한 초안을 한 번에 풀어낼 수도 있어요.
만들어둘 가치가 있는 2분짜리 습관
지금 여러분이 읽는 글의 절반은 기계가 만든 것이고, 그 비율은 다시 줄어들지 않을 거예요. 좋은 소식은 언어 감식 전문가가 될 필요는 없다는 거예요. 신호를 읽고, 사실 하나를 확인하고, 통계적인 부분은 탐지기에게 맡기세요. 이 세 단계를 함께 쓰면 어느 하나만 쓰는 것보다 훨씬 더 많이 잡아낼 수 있고, 이 게임에서 진짜로 저지르면 안 되는 실수, 즉 실제 사람이 쓴 글을 자신 있게 오해하는 일도 막아줘요.
다음에 어떤 글이 유난히 매끄럽게 느껴진다면, 그냥 궁금해하지 말고 확인해 보세요.