为什么 AI 用英语回答显得更聪明
作者 Chatday Editorial Team ·
用西班牙语、波兰语或土耳其语向 AI 提问,它回答得又快又流利。但如果用英语问完全相同的问题,一些微妙的变化就会发生:回答会更精准、更有条理,也更自信。
这不是你的错觉,也不是你的表达有问题。这种差距是真实存在且经过测量的,原因其实很简单:这些模型阅读的大部分资料都是英语。
这些模型阅读的互联网内容主要是英语
语言模型通过阅读从网络上抓取的海量文本来学习。而它们所阅读的网络内容严重失衡。
一项针对用于训练的大型网络存档的审查,查看了 Common Crawl(一个包含数十亿网页的公共爬虫)在 2023 年底的快照。其中英语内容约占 44%。排名第二的德语仅占约 5%。剩下的份额由其他所有语言瓜分。
现在将其与现实世界对比一下。语言数据库显示,算上所有将英语作为第二语言的人,英语使用者大约有 15 亿,相当于全球每六个人中就有一个。也就是说,全球六分之一人口使用的语言,提供了近一半的阅读材料。
模型并没有刻意偏袒英语,它只是在英语上得到了多得多的练习。每一个习语、每一种别扭的表达、每一个奇怪的边缘情况,在英语中出现的频率都比在加泰罗尼亚语或越南语中高出数千倍,而练习量才是决定性的。
你的 AI 在回答前,可能正在用英语思考
接下来这部分可能会让你感到惊讶。当你用母语输入时,模型并不一定用母语进行推理。
2025 年的一项研究探测了多语言模型在回答时内部究竟发生了什么。研究人员发现,无论输入或输出的是什么语言,这些系统都在一个最接近英语的表征空间中做出关键决策。用他们的话说,模型首先为有意义的词汇生成一种类似英语的结构,然后再将其转换为目标语言。
想象一下你的一位聪明同事,他从小阅读英语读物,现在在你的办公室工作。他能完全听懂你的意思。但在中间某个环节,他的思考是用第一语言进行的,而你得到的回答已经经过了一道翻译工序。
大多数时候你根本察觉不到。只有当笑话变得索然无味、习语被逐字死译,或者语气在语法上正确但在社交语境中显得突兀时,你才会发现端倪。
为什么用你的语言可能花费更多,且更快耗尽空间
还有第二个更偏向机械层面的原因,这与智能毫无关系。
在模型读取你的文本之前,它会将其切分成称为 token 的小片段。粗略地说,一个 token 就是词的一个片段。这种切分机制主要是针对英语调优的,因此英语能被高效切分,而其他语言则会被切分成多得多的片段。
相关研究发现,同一句话在某些语言中消耗的 token 数量最多可达英语的 15 倍。不使用拉丁字母的语言往往情况最糟。
这会导致三个后果,你都能切身感受到:
- 更快触及上限。 AI 的工作内存按 token 计算,因此同一份文档用你的语言会占用更多内存。
- 花费可能更高。 在按 token 收费的服务中,同一种任务在切分片段更多的语言中花费更高。
- 感觉响应更慢。 片段越多,模型需要处理的内容就越多。
这并非刻意惩罚。这只是针对英语文本调优的设计所带来的副作用,但它在潜移默化中塑造了你的使用体验。
那么,这种差距到底有多大?
大到不容忽视,且极不均衡。一项名为 MMLU-ProX 的多语言基准测试将同一组近 12,000 道考试风格的题目翻译成 29 种语言,从而进行了一次干净的对比:相同的问题、不同的语言、相同的模型。
结果呈现出一致的规律。模型在广泛使用的语言中表现良好,而在网络资料较少的语言中表现下滑,最强和最弱语言之间的差距高达约 24 个百分点。在一项及格线为 70 多分的测试中,丢掉 24 分就是自信满满的专家和基础薄弱的学生之间的区别。
| 你的语言所处的梯队 | 大致包含哪些语言 | 预期表现 |
|---|---|---|
| 资源极丰富 | 英语 | 推理最敏锐,习语最地道,格式最可靠 |
| 资源丰富 | 西班牙语、德语、法语、葡萄牙语、中文、日语 | 大多数日常任务接近英语水平,偶尔表达生硬 |
| 资源中等 | 许多网络足迹较小的欧洲和亚洲语言 | 回答不错,但翻译腔较重,本地细节容易出错 |
| 资源匮乏 | 小众语言和大多数非洲语言 | 推理能力明显较弱,更容易“一本正经地胡说八道”,需仔细核对 |
这里需要补充两点客观事实。首先,你日常提出的问题比考试题简单得多,所以你实际感受到的差距通常比纸面数据要小。其次,这些数据每隔几个月就会发生变化,这就引出了好消息。
差距正在被刻意缩小
各大实验室已经意识到,用更多语言进行训练不是做慈善,而是一种升级。
2026 年的一篇相关论文直接对此进行了测试,发现在训练期间增加语言可以全面提升结果。低资源语言获益匪浅,高资源语言保持稳定而非退化,甚至仅仅增加一种非英语语言也能提升模型的英语水平。作者认为,仅使用英语进行训练在很大程度上是次优的。
这就是为什么每一代模型在用你的语言交流时,都比上一代感觉更自然。这也是为什么下面这些实用建议值得每隔几个月就重新实践一次。“哪种 AI 用我的语言表现最好”的答案一直在变。
用母语获得更好回答的 4 个方法
1. 明确指定语言和语域
不要只是用母语输入然后听天由命。直接说出来。比如:用葡萄牙语回答,使用自然日常的语域,就像普通人平时说话那样。
最后半句最重要。如果不加限制,模型会倾向于使用正式、带有翻译腔的语气,因为互联网上大多数非英语文本就是这副模样。
2. 向它展示你的写作风格
粘贴两三句你自己写的话,让它模仿这种语气。这比描述你想要的语气有效得多,也是消除任何语言中 AI 文本机器味的最快方法。
3. 面对难题,将思考与回答分开
如果问题确实很难,尝试用英语提问,并要求用你的语言回答。鉴于我们了解的“类似英语的中间步骤”,这有时会有所帮助。
只是有时,并非总是如此。这只会多耗费你一条消息去测试,而对于任何难点在于推理的问题,这都值得试一试。
4. 换模型,而不是换提示词
这是大多数人从未尝试过的方法,但它通常最有效。不同实验室使用不同的语言组合进行训练,因此它们在您的语言中的优势差异比其营销宣传的要大得多。同一个提示词在一个模型中可能表现完美,在另一个模型中却显得生硬,这正是 AI 模型给出不同答案 这一更广泛原因的具体体现。
Gemini 3.1 Pro 和 Claude Sonnet 5 是不错的起点,但不要只听我们的一面之词。用你自己的提示词多试几个,看看哪个听起来像地道的本地人。
测试任何新模型的“三问法”
当你想知道一个模型用你的语言表现好不好时,基准测试给不了你答案,但你自己花 30 秒测试一下就能知道。以下是我们会考察的三个维度,以及为什么每个维度都能抓出不同的问题:
- 习语或笑话。 让它解释一句只有本地人才用的俗语。这能抓出那些只是在翻译而没有真正理解的模型。
- 本地细节。 问一个与你居住地相关的实用且具体的问题,然后核实答案。这能抓出“一本正经地胡说八道”的现象,这是代价最高的失败模式。
- 用你的语气写一段短文。 用你平时的语气给同事写条消息。这能抓出生硬的表达、不当的正式程度以及那种明显的翻译腔。
在两三个模型中运行这三个测试。几分钟内你就会找到心头好,而且它未必是最出名的那一个。
这些方法无济于事的地方
必须明确其局限性:提示词无法为模型添加它原本就不具备的知识。
如果你的语言在网络上的存在感很弱,那么差距就存在于训练数据中,任何巧妙的指令都无法弥补。地方法规、区域法律细节和小镇特有的情况,是模型在任何语言中最容易“自信编造”的地方,也是你在采取行动前必须核实的地方。
对于任何有实际风险的事务,如合同、医疗信件、官方表格,请将 AI 的输出视为初稿,并找一位精通该语言的人类来审阅。当任务是纯粹的翻译而非对话时,专用的 翻译工具 会比聊天窗口更好用。我们在 如何用 AI 翻译任何内容 中详细介绍过该工作流。
总结
AI 并不是用英语时更聪明。它只是阅读了更多的英语资料,进行了更多的英语练习,而且底层机制也是为英语调优的。这种差距正在随着每一代模型的迭代而缩小,速度比大多数人意识到的还要快,因为实验室发现,教模型学习更多语言会让它在所有语言上都表现得更好。
在差距完全消除之前,解决办法不是放弃你的母语。而是明确表达你的需求,向模型展示你的声音,并停止想当然地认为你试过的第一个 AI 就是最懂你母语的那一个。