Почему ИИ звучит умнее на английском
Автор Chatday Editorial Team ·
Вы спрашиваете ИИ о чём-то по-русски, по-польски или по-турецки, и ответ приходит быстро и складно. Задаёте ровно тот же вопрос по-английски, и происходит нечто едва уловимое. Ответ выходит чуть острее. Лучше выстроен. Увереннее.
Вам не кажется, и дело не в том, как вы пишете. Разрыв реален, он измерен, и причина проста: почти всё, что эти модели читали, было на английском.
Интернет, который прочитали эти модели, в основном английский
Языковые модели учатся, читая огромные объёмы текста, собранного из сети. И эта сеть сильно перекошена.
Обзор крупных веб-архивов, которые используют для такого обучения, разобрал копию Common Crawl конца 2023 года, публичный сбор миллиардов страниц. На английский приходилось около 44% содержимого. Второй в списке немецкий занимал примерно 5%. Всё остальное делило остаток.
Теперь сравните это с реальным миром. Языковые базы оценивают число говорящих по-английски примерно в 1,5 миллиарда, считая всех, кто выучил его вторым языком, то есть приблизительно каждого шестого человека. Получается, язык, которым пользуется шестая часть человечества, даёт почти половину материала для чтения.
Модель не решает отдавать предпочтение английскому. Она просто гораздо больше на нём тренируется. Каждая идиома, каждая корявая формулировка, каждый редкий случай встречаются на английском в тысячи раз чаще, чем на каталанском или вьетнамском, а решает именно практика.
Ваш ИИ, скорее всего, думает по-английски, прежде чем ответить
Вот часть, которая удивляет. Когда вы пишете на своём языке, модель совсем не обязательно на нём рассуждает.
Исследование 2025 года изучило, что на самом деле происходит внутри многоязычных моделей во время ответа. Учёные обнаружили, что эти системы принимают ключевые решения в пространстве представлений, ближайшем к английскому, независимо от того, какой язык на входе и на выходе. По их словам, модель сперва порождает нечто английское по форме для слов, несущих смысл, и лишь потом переводит это на нужный язык.
Представьте блестящую коллегу, которая выросла на английских книгах, а теперь работает в вашем офисе. Она прекрасно вас понимает. Но где-то посередине мышление идёт на её первом языке, и то, что возвращается к вам, прошло через шаг перевода.
Чаще всего вы этого не замечаете. Замечаете, когда шутка не срабатывает, когда идиома приходит переведённой дословно или когда тон формально верный, а по-человечески неуместный.
Почему ваш язык может стоить дороже и быстрее упираться в предел
Есть и вторая, более механическая причина, и к уму она отношения не имеет.
Прежде чем прочитать ваш текст, модель режет его на маленькие кусочки, которые называются токенами. Грубо говоря, токен это часть слова. Такая нарезка настроена прежде всего на английский, поэтому английский получает экономные кусочки, а другие языки дробятся на гораздо большее их число.
Исследования показали, что одно и то же предложение может занимать в некоторых языках до 15 раз больше токенов, чем на английском. Тяжелее всего приходится языкам без латинского алфавита.
Отсюда следуют три вещи, и вы чувствуете каждую:
- Вы упираетесь в лимит раньше. Рабочая память ИИ считается в токенах, поэтому один и тот же документ съедает её на вашем языке больше.
- Это может стоить дороже. Там, где сервис берёт плату за токены, та же задача обходится дороже на языке, который дробится сильнее.
- Это может ощущаться медленнее. Больше кусочков означает больше работы для модели.
Ничего из этого не наказание. Это побочный эффект устройства, настроенного на английские тексты, и он незаметно формирует ваш опыт.
Насколько велик разрыв на самом деле?
Достаточно велик, чтобы иметь значение, и очень неравномерен. Многоязычный тест MMLU-ProX перевёл один и тот же набор из почти 12 000 экзаменационных вопросов на 29 языков, что даёт чистое сравнение: те же вопросы, другой язык, та же модель.
Картина оказалась устойчивой. Модели хорошо справлялись с языками, на которых много пишут, и проседали там, где материала в сети мало, а разница доходила примерно до 24 процентных пунктов между сильнейшим и слабейшим. В тесте, где хороший результат около 70, потеря 24 пунктов это разница между уверенным специалистом и неуверенным школьником.
| Где находится ваш язык | О ком речь | Чего ждать |
|---|---|---|
| Очень широко представлен | Английский | Самые точные рассуждения, лучшие идиомы, самое надёжное форматирование |
| Широко представлен | Русский, немецкий, испанский, французский, китайский, японский | Близко к английскому в повседневных задачах, изредка скованная фраза |
| Средне представлен | Многие европейские и азиатские языки с меньшим присутствием в сети | Хорошие ответы, более переводной тон, больше промахов в местных деталях |
| Слабо представлен | Малые языки и большинство африканских языков | Заметно более слабые рассуждения, больше уверенных ошибок, проверяйте всё |
Две честные оговорки. Ваши повседневные вопросы намного легче экзамена, поэтому ощущаемый разрыв обычно меньше, чем на бумаге. И эти цифры меняются каждые несколько месяцев, что подводит нас к хорошей новости.
Разрыв сокращается, и это делается намеренно
Лаборатории поняли: обучение на большем числе языков не благотворительность, а улучшение.
Статья 2026 года проверила это напрямую и показала, что добавление языков во время обучения улучшает результаты по всем направлениям. Языки с малым объёмом данных выигрывают много, языки с большим держат уровень вместо того, чтобы просесть, и даже один добавленный неанглийский язык улучшил английский самой модели. Авторы называют обучение только на английском в целом неоптимальным.
Именно поэтому каждое новое поколение моделей звучит на вашем языке чуть естественнее предыдущего. И поэтому советы ниже стоит повторять раз в несколько месяцев: ответ на вопрос, какой ИИ лучше на вашем языке, постоянно меняется.
Четыре способа получать лучшие ответы на своём языке
1. Назовите язык и заодно регистр
Не пишите просто на своём языке в надежде, что выйдет хорошо. Скажите это прямо. Например: отвечай по-русски, в естественном разговорном регистре, так, как говорил бы живой человек.
Последняя часть весит больше всего. Без указаний модели сползают к официальному голосу с привкусом перевода, потому что именно так выглядит большая часть неанглийских текстов в интернете.
2. Покажите, как пишете вы
Вставьте два или три собственных предложения и попросите попасть в этот голос. Это работает намного лучше, чем описывать желаемый тон, и быстрее всего убирает искусственность из текста ИИ на любом языке.
3. В сложных вопросах разделите размышление и ответ
Если вопрос действительно трудный, попробуйте задать его по-английски, а ответ попросить на своём языке. С учётом того самого промежуточного шага английской формы это иногда помогает.
Иногда. Не всегда. Проверка стоит вам одного лишнего сообщения, и там, где трудность именно в рассуждении, попробовать стоит.
4. Меняйте модель, а не запрос
Этого почти никто не пробует, и обычно выигрывает как раз это. Разные лаборатории обучают на разных языковых смесях, поэтому их сильные стороны в вашем языке расходятся сильнее, чем следует из маркетинга. Один и тот же запрос может лечь идеально в одной модели и выйти деревянным в другой, и это частный случай более широкой причины, по которой модели ИИ дают разные ответы.
Gemini 3.1 Pro и Claude Sonnet 5 хорошие отправные точки, но не верьте нам на слово. Прогоните собственный запрос через несколько моделей и посмотрите, какая звучит как человек из ваших краёв.
Тест из трёх запросов для любой новой модели
Когда хочется понять, годится ли модель для вашего языка, рейтинги не помогут. Тридцать секунд собственной проверки помогут. Вот на что мы смотрим и что ловит каждый пункт:
- Идиома или шутка. Попросите объяснить поговорку, которую используют только местные. Это выводит на чистую воду модели, которые переводят, а не понимают.
- Местная деталь. Спросите что-то практическое и специфичное для места, где вы живёте, а затем проверьте ответ. Это ловит уверенные выдумки, самую дорогую из ошибок.
- Короткий текст вашим голосом. Сообщение коллеге в вашем обычном регистре. Это ловит скованность, неверную степень официальности и безошибочно узнаваемый привкус перевода.
Прогоните эти три задания в двух или трёх моделях. Фаворит появится за пару минут, и это может оказаться не самая известная модель.
Где всё это не поможет
Честно о границах: никакая формулировка запроса не добавит знаний, которых у модели никогда не было.
Если ваш язык слабо представлен в сети, пробел заложен в обучении, и никакая хитрая инструкция его не закроет. Местные правила, региональные юридические тонкости и особенности небольших городов это как раз те области, где модели выдумывают увереннее всего, на любом языке, и где стоит проверять до того, как действовать.
Во всём, что имеет реальные последствия, в договоре, медицинском заключении, официальном бланке, относитесь к выдаче ИИ как к черновику и дайте прочитать человеку, который владеет языком. А когда задача это именно перевод, а не разговор, специальный инструмент перевода обойдёт окно чата. Этот порядок работы мы разобрали в материале как перевести что угодно с помощью ИИ.
Коротко
ИИ не умнее на английском. Он просто начитаннее на английском, натренированнее на нём, и механика под капотом настраивалась именно под него. Этот разрыв сокращается с каждым поколением, быстрее, чем думают, потому что лаборатории обнаружили: чем большему числу языков учат модель, тем лучше она во всех.
Пока он не закрылся, решение не в том, чтобы отказаться от своего языка. Решение в том, чтобы точно формулировать, чего вы хотите, показывать модели свой голос и перестать считать, что первый попробованный вами ИИ лучше всех говорит на вашем языке.