AI가 영어로 더 똑똑해 보이는 이유
작성자 Chatday Editorial Team ·
한국어나 폴란드어, 튀르키예어로 AI에게 무언가를 물어보면 답은 빠르고 매끄럽게 돌아옵니다. 똑같은 질문을 영어로 던지면 미묘한 변화가 생깁니다. 답이 조금 더 날카롭습니다. 정리도 더 잘돼 있습니다. 더 확신에 차 있습니다.
착각이 아니고, 글솜씨 탓도 아닙니다. 이 격차는 실재하고 측정도 됐으며, 이유는 아주 단순합니다. 이 모델들은 읽은 것의 대부분이 영어였습니다.
이 모델들이 읽은 인터넷은 대부분 영어입니다
언어 모델은 웹에서 모은 엄청난 양의 텍스트를 읽으며 학습합니다. 그리고 그 웹은 상당히 한쪽으로 기울어 있습니다.
이런 학습에 쓰이는 대규모 웹 아카이브를 살펴본 한 리뷰는 수십억 페이지를 담은 공개 수집물 Common Crawl의 2023년 말 버전을 분석했습니다. 영어가 전체의 약 44%를 차지했습니다. 2위인 독일어는 약 5% 수준이었습니다. 나머지 언어들이 남은 몫을 나눠 가졌습니다.
이제 현실 세계와 비교해 보세요. 언어 데이터베이스는 제2언어로 배운 사람까지 포함해 영어 사용자를 약 15억 명으로 추산합니다. 대략 여섯 명 중 한 명꼴입니다. 인류의 6분의 1이 쓰는 언어가 읽을거리의 절반 가까이를 공급하고 있는 셈입니다.
모델이 영어를 편들기로 결정한 것은 아닙니다. 그저 영어로 훨씬 많이 연습했을 뿐입니다. 모든 관용구, 어색한 표현, 특이한 예외 상황이 카탈루냐어나 베트남어보다 영어에서 수천 배 더 자주 등장하고, 결국 결과를 가르는 것은 연습량입니다.
여러분의 AI는 답하기 전에 아마 영어로 생각합니다
여기서부터가 사람들이 놀라는 대목입니다. 여러분이 모국어로 써도, 모델이 반드시 그 언어로 추론하는 것은 아닙니다.
2025년의 한 연구는 다국어 모델이 답을 만드는 동안 내부에서 실제로 무슨 일이 벌어지는지 살펴봤습니다. 연구진은 입력과 출력이 어떤 언어든 상관없이, 이 시스템들이 핵심 판단을 영어에 가장 가까운 표현 공간에서 내린다는 점을 확인했습니다. 연구진의 표현을 빌리면, 모델은 의미를 담은 단어에 대해 먼저 영어 형태에 가까운 무언가를 만들고, 그다음 목표 언어로 변환합니다.
영어책을 읽으며 자랐고 지금은 여러분의 사무실에서 일하는 뛰어난 동료를 떠올려 보세요. 그분은 여러분의 말을 완벽하게 이해합니다. 다만 중간 어딘가에서 사고는 모국어로 진행되고, 여러분에게 돌아오는 결과물은 번역 단계를 한 번 거친 것입니다.
대부분은 알아채지 못합니다. 알아채는 순간은 농담이 안 먹힐 때, 관용구가 단어 그대로 번역돼 돌아올 때, 또는 말투가 기술적으로는 맞는데 상황에는 어긋날 때입니다.
여러분의 언어가 더 비싸고 공간도 빨리 차는 이유
두 번째 이유는 좀 더 기계적인 쪽이고, 똑똑함과는 아무 상관이 없습니다.
모델은 여러분의 글을 읽기 전에 토큰이라는 작은 조각으로 자릅니다. 대략 말하면 토큰은 단어의 한 조각입니다. 이 자르는 방식이 주로 영어에 맞춰져 있어서, 영어는 효율적인 조각을 얻고 다른 언어는 훨씬 많은 조각으로 쪼개집니다.
이 주제를 다룬 연구에 따르면 같은 문장이 어떤 언어에서는 영어보다 최대 15배 많은 토큰을 차지할 수 있습니다. 라틴 문자를 쓰지 않는 언어가 가장 불리합니다.
여기서 세 가지 결과가 따라오고, 여러분은 셋 다 체감하게 됩니다.
- 한도에 더 빨리 도달합니다. AI의 작업 기억은 토큰 단위로 세기 때문에, 같은 문서라도 여러분의 언어에서 더 많이 잡아먹습니다.
- 비용이 더 들 수 있습니다. 토큰 단위로 요금을 매기는 서비스라면, 더 잘게 쪼개지는 언어에서 같은 작업이 더 비쌉니다.
- 더 느리게 느껴질 수 있습니다. 조각이 많아질수록 모델이 처리할 양도 늘어납니다.
이 중 어느 것도 벌이 아닙니다. 영어 텍스트에 맞춰 조정된 설계의 부작용이고, 조용히 여러분의 경험을 좌우합니다.
그래서 격차는 실제로 얼마나 클까요?
무시하기 어려울 만큼 크고, 매우 고르지 않습니다. MMLU-ProX라는 다국어 벤치마크는 거의 12,000개에 이르는 시험 형식의 문제를 그대로 29개 언어로 옮겼습니다. 같은 문제, 다른 언어, 같은 모델이라는 깔끔한 비교가 가능해집니다.
패턴은 일관됐습니다. 모델은 글이 많은 언어에서 좋은 성적을 냈고 온라인 자료가 적은 언어에서 성적이 떨어졌으며, 가장 강한 언어와 가장 약한 언어의 차이는 약 24퍼센트포인트까지 벌어졌습니다. 좋은 점수가 70점대인 시험에서 24점을 잃는다는 것은, 자신 있는 전문가와 불안한 학생만큼의 차이입니다.
| 내 언어의 위치 | 해당하는 언어 | 예상할 수 있는 것 |
|---|---|---|
| 매우 풍부 | 영어 | 가장 날카로운 추론, 가장 자연스러운 표현, 가장 안정적인 서식 |
| 풍부 | 한국어, 독일어, 스페인어, 프랑스어, 중국어, 일본어 | 일상 작업에서는 영어에 근접, 가끔 딱딱한 문장 |
| 중간 | 온라인 분량이 적은 여러 유럽 및 아시아 언어 | 답변은 양호, 번역투가 강해지고 지역 정보에서 실수가 늘어남 |
| 부족 | 사용자가 적은 언어와 대부분의 아프리카 언어 | 추론이 뚜렷하게 약하고 확신에 찬 오류가 늘어남, 전부 확인 필요 |
솔직한 단서 두 가지. 일상 질문은 시험보다 훨씬 쉬우니, 여러분이 체감하는 격차는 보통 수치보다 작습니다. 그리고 이 숫자들은 몇 달마다 움직이는데, 이 점이 좋은 소식으로 이어집니다.
격차는 좁혀지고 있고, 그것도 의도적으로
연구소들은 더 많은 언어로 학습시키는 일이 자선이 아니라 성능 향상이라는 사실을 알아냈습니다.
2026년의 한 논문은 이를 직접 검증했고, 학습 단계에서 언어를 추가하면 전반적으로 결과가 좋아진다는 결론을 내렸습니다. 데이터가 적은 언어는 크게 향상되고, 데이터가 많은 언어는 나빠지는 대신 수준을 유지했으며, 영어가 아닌 언어를 단 하나만 추가해도 모델의 영어 실력까지 좋아졌습니다. 저자들은 영어만으로 학습하는 방식이 대체로 최선이 아니라고 정리합니다.
그래서 모델은 세대가 바뀔 때마다 여러분의 언어에서 조금씩 더 자연스러워집니다. 그리고 아래의 방법들도 몇 달마다 다시 시도해 볼 가치가 있습니다. 내 언어에서 어떤 AI가 가장 나은지에 대한 답은 계속 바뀌니까요.
내 언어로 더 좋은 답을 얻는 네 가지 방법
1. 언어와 말투를 함께 지정하세요
모국어로 쓰고 잘 되기를 바라는 데서 그치지 마세요. 직접 말해주세요. 예를 들면 이렇게요. 한국어로, 실제 사람이 말하듯 자연스러운 일상 말투로 답해주세요.
가장 큰 몫을 하는 것은 마지막 부분입니다. 그냥 두면 모델은 번역투의 딱딱한 목소리로 흘러갑니다. 인터넷에 있는 영어 이외의 텍스트 대부분이 바로 그런 모습이기 때문입니다.
2. 내가 쓰는 방식을 보여주세요
직접 쓴 문장 두세 개를 붙여 넣고 그 목소리에 맞춰 달라고 하세요. 원하는 톤을 설명하는 것보다 훨씬 효과가 좋고, 어떤 언어에서든 AI 글의 인공적인 느낌을 없애는 가장 빠른 방법입니다.
3. 어려운 질문에서는 생각과 답변을 분리하세요
질문이 정말 까다롭다면 영어로 묻고 답은 내 언어로 달라고 해보세요. 영어 형태의 중간 단계를 생각하면, 이 방법이 도움이 될 때가 있습니다.
가끔은 그렇습니다. 항상은 아닙니다. 확인하는 데 메시지 한 번이 더 들 뿐이고, 어려움의 핵심이 추론에 있을 때는 시험해 볼 만합니다.
4. 프롬프트가 아니라 모델을 바꾸세요
거의 아무도 시도하지 않지만 대개 승부를 가르는 방법입니다. 연구소마다 학습에 쓰는 언어 구성이 달라서, 내 언어에서의 강점은 홍보 문구에서 짐작하는 것보다 훨씬 크게 갈립니다. 같은 프롬프트가 어떤 모델에서는 딱 맞아떨어지고 다른 모델에서는 뻣뻣해집니다. 이는 AI 모델마다 답이 다른 이유의 구체적인 사례이기도 합니다.
Gemini 3.1 Pro와 Claude Sonnet 5는 좋은 출발점이지만, 저희 말만 믿지는 마세요. 직접 쓴 프롬프트를 여러 모델에 넣어보고 어느 쪽이 내가 사는 곳 사람처럼 들리는지 확인해 보세요.
새 모델을 시험하는 세 가지 프롬프트
어떤 모델이 내 언어에서 쓸 만한지는 순위표가 알려주지 않습니다. 직접 30초만 시험해 보면 알 수 있습니다. 저희가 보는 항목과, 각각이 잡아내는 것은 이렇습니다.
- 관용구나 농담. 현지 사람만 쓰는 표현을 설명해 달라고 하세요. 이해하는 대신 번역하는 모델이 여기서 드러납니다.
- 지역 정보. 사는 곳에만 해당하는 실용적인 내용을 묻고, 그다음 답을 검증하세요. 확신에 찬 지어내기가 드러나는데, 이것이 가장 비싼 실패입니다.
- 내 목소리로 쓴 짧은 글. 동료에게 보내는 메시지를 평소 말투로 써달라고 하세요. 딱딱함, 어긋난 격식, 그리고 그 특유의 번역투가 여기서 드러납니다.
이 세 가지를 두세 개 모델에서 돌려보세요. 몇 분이면 마음에 드는 모델이 정해지고, 그게 가장 유명한 모델이 아닐 수도 있습니다.
이 방법들이 통하지 않는 지점
한계를 분명히 하자면, 프롬프트로는 모델이 애초에 갖지 못한 지식을 채울 수 없습니다.
내 언어의 온라인 자료가 적다면 부족한 것은 학습 데이터이고, 아무리 영리한 지시로도 메워지지 않습니다. 지역 규정, 지역별 법률 세부 사항, 작은 동네의 구체적인 사정은 어떤 언어에서든 모델이 가장 당당하게 지어내는 영역이며, 행동에 옮기기 전에 확인해야 할 부분입니다.
계약서, 진단서, 공식 서류처럼 실제 결과가 따르는 일에서는 AI의 결과물을 초안으로 다루고, 그 언어에 능통한 사람에게 읽혀 보세요. 그리고 대화가 아니라 순수한 번역이 목적이라면, 그 용도로 만들어진 번역 도구가 채팅 창보다 낫습니다. 그 작업 흐름은 AI로 무엇이든 번역하는 방법에서 다뤘습니다.
요약하면
AI는 영어라서 더 똑똑한 것이 아닙니다. 영어로 더 많이 읽었고, 더 많이 연습했으며, 그 아래의 구조도 영어에 맞춰 조정됐을 뿐입니다. 이 격차는 세대가 바뀔 때마다 줄어들고 있고, 대부분의 예상보다 빠릅니다. 언어를 더 많이 가르칠수록 모델이 모든 언어에서 좋아진다는 사실을 연구소들이 알아냈기 때문입니다.
격차가 사라질 때까지의 해법은 내 언어를 포기하는 것이 아닙니다. 원하는 바를 구체적으로 말하고, 모델에게 내 목소리를 보여주고, 처음 써본 AI가 내 언어를 가장 잘한다는 생각을 내려놓는 것입니다.