比較模型 比較圖像模型 AI 工具 模型 AI 圖像模型 AI 資訊 搜尋 免費試用
科普文章 7 分鐘閱讀

為什麼 AI 用英文回答比較聰明?

作者 Chatday Editorial Team ·

aiexplainerlanguagesmultilingualhow-it-works
為什麼 AI 用英文回答比較聰明?

你用中文、波蘭文或土耳其文問 AI 一件事,答案很快就來了,讀起來也順。同樣的問題改用英文再問一次,某種細微的差別就出現了。回答稍微銳利一點。組織得更好。語氣也更篤定。

這不是你的錯覺,也跟你的文筆無關。差距真的存在,而且已經被量測過,原因很單純:這些模型讀過的東西幾乎都是英文。

這些模型讀過的網路,大多是英文

語言模型的學習方式,就是讀取從網路上蒐集來的龐大文字。而那個網路,本身就嚴重失衡。

一份檢視大型網路資料庫的回顧研究,分析了 Common Crawl 在 2023 年底的版本,那是一份收錄數十億頁面的公開資料。其中英文約占 44%。排第二的德文大約 5%。剩下的由所有其他語言瓜分。

現在拿它跟真實世界比一比。語言資料庫估計,把第二語言使用者也算進去,全球講英文的人大約 15 億,差不多每六個人就有一個。換句話說,一個六分之一人類在使用的語言,提供了將近一半的閱讀材料。

模型並沒有決定要偏袒英文,它只是用英文練習得多太多了。每一句慣用語、每一種彆扭的說法、每一個奇怪的例外,在英文裡出現的次數都比加泰隆尼亞文或越南文多上幾千倍,而練習量正是關鍵。

你的 AI 很可能是先用英文思考,才回答你

接下來這段最讓人意外。當你用自己的語言書寫時,模型不見得就用那個語言在推理。

2025 年的一項研究,探查了多語模型在回答過程中內部到底發生什麼事。研究者發現,不論輸入和輸出是哪一種語言,這些系統都在最接近英文的表徵空間裡做出關鍵判斷。用他們的說法,模型會先針對帶有意義的詞產生一個英文形狀的東西,接著才轉換成目標語言。

想像一位很優秀的同事,從小讀英文書長大,現在在你的辦公室工作。他完全聽得懂你說什麼。但在中間某個環節,思考是用他的第一語言進行的,而回到你手上的內容,已經經過一道翻譯手續。

大多數時候你不會察覺。你會察覺的時刻,是笑話冷掉的時候、慣用語被逐字翻出來的時候,或是語氣在字面上正確、放在人情世故裡卻不對勁的時候。

為什麼你的語言可能比較貴,空間也用得比較快

還有第二個原因,比較偏機械層面,跟聰不聰明無關。

模型在讀你的文字之前,會先把它切成叫做 token 的小塊。粗略地說,一個 token 就是一個字的碎片。這套切法主要是照著英文調校的,所以英文拿到的是效率好的碎片,其他語言則被切成多出許多的塊數。

相關研究發現,同一個句子在某些語言裡,可能會用掉比英文多達 15 倍的 token。不使用拉丁字母的語言吃虧最多。

由此帶來三個結果,而且你三個都感受得到:

  • 你更快碰到上限。 AI 的工作記憶是用 token 計算的,所以同一份文件在你的語言裡會吃掉更多空間。
  • 可能比較貴。 如果服務是按 token 計費,同樣一件事在切得比較碎的語言裡就會比較貴。
  • 可能感覺比較慢。 碎片愈多,模型要處理的量也愈多。

這些都不是懲罰。它是一套照著英文文本調校的設計所帶來的副作用,安安靜靜地影響著你的使用體驗。

那差距到底有多大?

大到值得在意,而且非常不平均。一項叫做 MMLU-ProX 的多語測驗,把同一組將近 12,000 題的考試題目搬到 29 種語言,形成一個乾淨的比較:同樣的題目、不同的語言、同一個模型。

結果很一致。模型在文字量大的語言表現良好,在網路材料少的語言則明顯下滑,最強與最弱之間的差距最高來到約 24 個百分點。在一場好成績大約落在 70 分的測驗裡,掉 24 分等於是從一位有把握的專家,變成一個底子不穩的學生。

你的語言落在哪一層大致包含可以預期的狀況
資料非常豐富英文推理最銳利、慣用語最自然、格式最穩定
資料豐富中文、德文、西班牙文、法文、日文、葡萄牙文日常使用接近英文,偶爾出現生硬的句子
資料中等許多網路內容較少的歐洲與亞洲語言答案不錯,翻譯腔較重,在地細節比較容易出錯
資料稀少使用人數少的語言,以及多數非洲語言推理明顯較弱,講得很篤定的錯誤變多,每一項都要查證

兩個誠實的但書。你日常問的問題比考試簡單太多,所以實際感受到的差距通常比數字小。而且這些數字每隔幾個月就會變動,這也帶出了好消息。

差距正在縮小,而且是刻意為之

各家實驗室已經想通了:用更多語言訓練不是做公益,而是實打實的升級。

2026 年的一篇論文直接做了驗證,結論是在訓練階段加入更多語言,各方面表現都會變好。資料少的語言進步很多,資料多的語言維持水準而不是退步,而且就算只多加一種非英文的語言,模型的英文能力也跟著提升。作者們認為,只用英文訓練整體而言並不是最佳做法。

這就是為什麼每一代模型講你的語言,都比上一代自然一點。也因此,下面這些做法值得每隔幾個月重做一次:哪一個 AI 最擅長你的語言,答案一直在變。

四個方法,讓你用自己的語言拿到更好的答案

1. 把語言和語氣都講明白

不要只是用自己的語言寫,然後祈禱結果不錯。直接說出來。例如:請用繁體中文回答,用自然的日常語氣,像真人講話那樣。

最後那一段最關鍵。放著不管的話,模型會滑向一種帶著翻譯腔的正式語氣,因為網路上非英文的文字,大多就是長那個樣子。

2. 讓它看看你怎麼寫

貼上兩三句你自己寫的句子,請它抓住那個口吻。這比描述你想要的語氣有效得多,也是各種語言裡消除 AI 文字那股人工味最快的辦法。

3. 遇到難題,把思考和回答拆開

如果問題真的很難,可以試試用英文提問,再要求它用你的語言作答。考量到那個英文形狀的中間步驟,這麼做有時候有用。

有時候。不是每次。要弄清楚只需要多花一則訊息,而只要困難的部分在於推理,這個測試就值得做。

4. 換模型,不是換提示

這一招幾乎沒有人試,卻常常是最有效的。不同實驗室訓練時用的語言配方不一樣,所以它們在你語言上的強弱差異,比行銷文案暗示的還要大。同一段提示在某個模型上恰到好處,換一個就變得死板,這正是AI 模型給出不同答案這件事的具體案例。

Gemini 3.1 ProClaude Sonnet 5 都是不錯的起點,但不用聽我們的。把你自己的提示丟給幾個模型跑跑看,看哪一個聽起來像你住的地方的人在講話。

測試任何新模型的三道提示

想知道一個模型在你的語言裡行不行,排行榜幫不上忙,自己花三十秒測一下就知道。以下是我們會看的三件事,各自能抓出不同的問題:

  1. 一句慣用語或一個笑話。 請它解釋一句只有在地人會用的說法。這能揪出那些在翻譯而不是在理解的模型。
  2. 一個在地細節。 問一件跟你居住地有關、實際會用到的事,然後去查證答案。這能揪出講得斬釘截鐵的瞎編,而這是代價最高的失誤。
  3. 一段用你口吻寫的短文。 用你平常的語氣寫一則給同事的訊息。這能揪出生硬、用錯敬語程度,以及那股一眼認得出來的翻譯味。

把這三題丟進兩三個模型跑一遍。幾分鐘內你就會有偏好的答案,而且未必是名氣最大的那一個。

哪些情況怎麼做都沒用

把限制講清楚:再怎麼會寫提示,也補不上模型從來沒學過的知識。

如果你的語言在網路上分量很輕,缺口就在訓練資料裡,任何巧妙的指令都填不滿。在地法規、各地區的法律細節、小地方才有的狀況,正是模型在任何語言中最敢瞎掰的地方,也是你動手之前應該先查證的地方。

只要牽涉到真實後果,像是合約、醫療文件、官方表格,就把 AI 產出當成初稿,找一位精通該語言的人讀過。而如果任務是單純的翻譯而不是對話,專門為此打造的翻譯工具會勝過聊天視窗。這套流程我們在如何用 AI 翻譯任何東西裡示範過。

日常用途沒必要。現在的模型處理使用人數多的語言已經不錯,而用自己的語言書寫能保住你真正想表達的細微語意。不過遇到真正困難的推理題,值得兩種都試,並要求它用你的語言作答。
因為它大部分訓練都在英文裡完成,所以一遇到吃力的內容就會滑回去,碰到專業術語時特別明顯。在每一則訊息裡都明確要求只用你的語言回答,通常就能解決。
這要看語言,而且每次改版都會變,所以沒有人能給你一個永久的答案。把同一段提示丟給兩三個模型,留下聽起來最像你所在地區的人講話的那一個。
如果服務按 token 計費,是的。研究發現同一個句子在某些語言裡可能用掉比英文多達 15 倍的 token,而非拉丁字母的文字受影響最大。
用在草稿、筆記和日常訊息上,通常沒問題。碰到合約、醫療或官方文件,就把它當成第一輪處理,在簽署或寄出之前找語言能力好的人再看一次。

簡單說

AI 並不是在英文裡比較聰明。它只是在英文裡讀得比較多、練得比較多,底層的機制也是照著英文調校的。這個差距正在一代一代縮小,速度比多數人以為的還快,因為實驗室發現:教模型更多語言,會讓它在所有語言上都變好。

在差距補上之前,解法不是放棄自己的語言。解法是把想要的東西講清楚,把你的口吻示範給模型看,然後別再假設你最早試過的那個 AI,就是最會講你語言的那一個。