為什麼 AI 用英文回答比較聰明?
作者 Chatday Editorial Team ·
你用中文、波蘭文或土耳其文問 AI 一件事,答案很快就來了,讀起來也順。同樣的問題改用英文再問一次,某種細微的差別就出現了。回答稍微銳利一點。組織得更好。語氣也更篤定。
這不是你的錯覺,也跟你的文筆無關。差距真的存在,而且已經被量測過,原因很單純:這些模型讀過的東西幾乎都是英文。
這些模型讀過的網路,大多是英文
語言模型的學習方式,就是讀取從網路上蒐集來的龐大文字。而那個網路,本身就嚴重失衡。
一份檢視大型網路資料庫的回顧研究,分析了 Common Crawl 在 2023 年底的版本,那是一份收錄數十億頁面的公開資料。其中英文約占 44%。排第二的德文大約 5%。剩下的由所有其他語言瓜分。
現在拿它跟真實世界比一比。語言資料庫估計,把第二語言使用者也算進去,全球講英文的人大約 15 億,差不多每六個人就有一個。換句話說,一個六分之一人類在使用的語言,提供了將近一半的閱讀材料。
模型並沒有決定要偏袒英文,它只是用英文練習得多太多了。每一句慣用語、每一種彆扭的說法、每一個奇怪的例外,在英文裡出現的次數都比加泰隆尼亞文或越南文多上幾千倍,而練習量正是關鍵。
你的 AI 很可能是先用英文思考,才回答你
接下來這段最讓人意外。當你用自己的語言書寫時,模型不見得就用那個語言在推理。
2025 年的一項研究,探查了多語模型在回答過程中內部到底發生什麼事。研究者發現,不論輸入和輸出是哪一種語言,這些系統都在最接近英文的表徵空間裡做出關鍵判斷。用他們的說法,模型會先針對帶有意義的詞產生一個英文形狀的東西,接著才轉換成目標語言。
想像一位很優秀的同事,從小讀英文書長大,現在在你的辦公室工作。他完全聽得懂你說什麼。但在中間某個環節,思考是用他的第一語言進行的,而回到你手上的內容,已經經過一道翻譯手續。
大多數時候你不會察覺。你會察覺的時刻,是笑話冷掉的時候、慣用語被逐字翻出來的時候,或是語氣在字面上正確、放在人情世故裡卻不對勁的時候。
為什麼你的語言可能比較貴,空間也用得比較快
還有第二個原因,比較偏機械層面,跟聰不聰明無關。
模型在讀你的文字之前,會先把它切成叫做 token 的小塊。粗略地說,一個 token 就是一個字的碎片。這套切法主要是照著英文調校的,所以英文拿到的是效率好的碎片,其他語言則被切成多出許多的塊數。
相關研究發現,同一個句子在某些語言裡,可能會用掉比英文多達 15 倍的 token。不使用拉丁字母的語言吃虧最多。
由此帶來三個結果,而且你三個都感受得到:
- 你更快碰到上限。 AI 的工作記憶是用 token 計算的,所以同一份文件在你的語言裡會吃掉更多空間。
- 可能比較貴。 如果服務是按 token 計費,同樣一件事在切得比較碎的語言裡就會比較貴。
- 可能感覺比較慢。 碎片愈多,模型要處理的量也愈多。
這些都不是懲罰。它是一套照著英文文本調校的設計所帶來的副作用,安安靜靜地影響著你的使用體驗。
那差距到底有多大?
大到值得在意,而且非常不平均。一項叫做 MMLU-ProX 的多語測驗,把同一組將近 12,000 題的考試題目搬到 29 種語言,形成一個乾淨的比較:同樣的題目、不同的語言、同一個模型。
結果很一致。模型在文字量大的語言表現良好,在網路材料少的語言則明顯下滑,最強與最弱之間的差距最高來到約 24 個百分點。在一場好成績大約落在 70 分的測驗裡,掉 24 分等於是從一位有把握的專家,變成一個底子不穩的學生。
| 你的語言落在哪一層 | 大致包含 | 可以預期的狀況 |
|---|---|---|
| 資料非常豐富 | 英文 | 推理最銳利、慣用語最自然、格式最穩定 |
| 資料豐富 | 中文、德文、西班牙文、法文、日文、葡萄牙文 | 日常使用接近英文,偶爾出現生硬的句子 |
| 資料中等 | 許多網路內容較少的歐洲與亞洲語言 | 答案不錯,翻譯腔較重,在地細節比較容易出錯 |
| 資料稀少 | 使用人數少的語言,以及多數非洲語言 | 推理明顯較弱,講得很篤定的錯誤變多,每一項都要查證 |
兩個誠實的但書。你日常問的問題比考試簡單太多,所以實際感受到的差距通常比數字小。而且這些數字每隔幾個月就會變動,這也帶出了好消息。
差距正在縮小,而且是刻意為之
各家實驗室已經想通了:用更多語言訓練不是做公益,而是實打實的升級。
2026 年的一篇論文直接做了驗證,結論是在訓練階段加入更多語言,各方面表現都會變好。資料少的語言進步很多,資料多的語言維持水準而不是退步,而且就算只多加一種非英文的語言,模型的英文能力也跟著提升。作者們認為,只用英文訓練整體而言並不是最佳做法。
這就是為什麼每一代模型講你的語言,都比上一代自然一點。也因此,下面這些做法值得每隔幾個月重做一次:哪一個 AI 最擅長你的語言,答案一直在變。
四個方法,讓你用自己的語言拿到更好的答案
1. 把語言和語氣都講明白
不要只是用自己的語言寫,然後祈禱結果不錯。直接說出來。例如:請用繁體中文回答,用自然的日常語氣,像真人講話那樣。
最後那一段最關鍵。放著不管的話,模型會滑向一種帶著翻譯腔的正式語氣,因為網路上非英文的文字,大多就是長那個樣子。
2. 讓它看看你怎麼寫
貼上兩三句你自己寫的句子,請它抓住那個口吻。這比描述你想要的語氣有效得多,也是各種語言裡消除 AI 文字那股人工味最快的辦法。
3. 遇到難題,把思考和回答拆開
如果問題真的很難,可以試試用英文提問,再要求它用你的語言作答。考量到那個英文形狀的中間步驟,這麼做有時候有用。
有時候。不是每次。要弄清楚只需要多花一則訊息,而只要困難的部分在於推理,這個測試就值得做。
4. 換模型,不是換提示
這一招幾乎沒有人試,卻常常是最有效的。不同實驗室訓練時用的語言配方不一樣,所以它們在你語言上的強弱差異,比行銷文案暗示的還要大。同一段提示在某個模型上恰到好處,換一個就變得死板,這正是AI 模型給出不同答案這件事的具體案例。
Gemini 3.1 Pro 和 Claude Sonnet 5 都是不錯的起點,但不用聽我們的。把你自己的提示丟給幾個模型跑跑看,看哪一個聽起來像你住的地方的人在講話。
測試任何新模型的三道提示
想知道一個模型在你的語言裡行不行,排行榜幫不上忙,自己花三十秒測一下就知道。以下是我們會看的三件事,各自能抓出不同的問題:
- 一句慣用語或一個笑話。 請它解釋一句只有在地人會用的說法。這能揪出那些在翻譯而不是在理解的模型。
- 一個在地細節。 問一件跟你居住地有關、實際會用到的事,然後去查證答案。這能揪出講得斬釘截鐵的瞎編,而這是代價最高的失誤。
- 一段用你口吻寫的短文。 用你平常的語氣寫一則給同事的訊息。這能揪出生硬、用錯敬語程度,以及那股一眼認得出來的翻譯味。
把這三題丟進兩三個模型跑一遍。幾分鐘內你就會有偏好的答案,而且未必是名氣最大的那一個。
哪些情況怎麼做都沒用
把限制講清楚:再怎麼會寫提示,也補不上模型從來沒學過的知識。
如果你的語言在網路上分量很輕,缺口就在訓練資料裡,任何巧妙的指令都填不滿。在地法規、各地區的法律細節、小地方才有的狀況,正是模型在任何語言中最敢瞎掰的地方,也是你動手之前應該先查證的地方。
只要牽涉到真實後果,像是合約、醫療文件、官方表格,就把 AI 產出當成初稿,找一位精通該語言的人讀過。而如果任務是單純的翻譯而不是對話,專門為此打造的翻譯工具會勝過聊天視窗。這套流程我們在如何用 AI 翻譯任何東西裡示範過。
簡單說
AI 並不是在英文裡比較聰明。它只是在英文裡讀得比較多、練得比較多,底層的機制也是照著英文調校的。這個差距正在一代一代縮小,速度比多數人以為的還快,因為實驗室發現:教模型更多語言,會讓它在所有語言上都變好。
在差距補上之前,解法不是放棄自己的語言。解法是把想要的東西講清楚,把你的口吻示範給模型看,然後別再假設你最早試過的那個 AI,就是最會講你語言的那一個。