為什麼 AI 數不出 strawberry 裡的 R
作者 Chatday Editorial Team ·
叫聊天機器人幫你規劃婚禮,它辦得漂亮極了。可是問它「strawberry 裡有幾個 R?」,它很有可能說兩個。真正的答案是三個。這是現代 AI 最奇怪的地方之一:同一個能跟你解釋量子物理的工具,卻在一件六歲小孩用鉛筆就能完成的事情上絆倒。
這不是程式錯誤,AI 也不笨。這是這些系統一開始怎麼「讀」所帶來的副作用。而一旦你懂了這點,AI 許多細小又古怪的失誤,忽然就全說得通了。
那個有名的「strawberry」失誤,說清楚
「strawberry 裡有幾個 R?」成了網路上最愛拿來讓 AI 出糗的招數。有好一陣子,幾乎每個聊天機器人都答錯,說「兩個」,還帶著一種從沒錯過的人才有的開朗自信。
你自己拼拼看:s-t-r-a-w-b-e-r-r-y。開頭附近有一個 R,結尾附近有連著的兩個 R。總共三個。對人來說很簡單,因為我們看的是真正的字母。AI 沒辦法這樣做,而要明白為什麼,就得看看它是怎麼讀的。
AI 是一塊一塊地讀,不是一個字母一個字母
這是幾乎沒人知道的部分。在 AI 模型讀你的訊息之前,文字會被切成一塊塊、叫做詞元的東西。詞元通常是一個常見的字,或它的一小段。「strawberry」這個字常被切成像「st」「raw」「berry」這樣的東西。
現在照著模型的方式數 R。「st」這塊一個也沒有。「raw」有一個。「berry」有兩個,但模型把它看成一整團,而不是 b-e-r-r-y。於是字母都被埋進了那些塊裡,模型只能大概記住每一塊怎麼拼,而不是當場讀出來。
一位研究者說得非常好:這就像想數繩子裡有幾股,卻不先把繩子解開。模型看到的是絞在一起的繩子(詞元),不是一股股分開的線(字母)。
為什麼同樣的特性會弄壞簡單的算術
這也是為什麼 AI 能一路順順地寫完一篇哲學論文,卻在四位數的乘法上絆倒。數字同樣會被切成塊,而且切得還不一致。12345 這個數字可能變成「123」和「45」,所以模型永遠沒辦法像你在紙上那樣把每一位數好好對齊。
再加上,AI 並不是在算。它是根據讀過的一切,預測「接下來最有可能說什麼」。用在語言上效果極好,因為「差不多對」就夠了;用在算術上就很糟,因為答案不是精確就是錯。模型是為機率打造的,數學要的卻是精準。這兩件事並不總是合得來。這跟 AI 會一臉自信地亂編的原因是親戚:一個流暢又像模像樣的答案,跟一個正確的答案不是同一回事。
那為什麼現在有些模型會答對了?
轉折來了。今天你去問大多數聊天機器人 strawberry,它們會說三個。這個問題太有名了,正確答案現在已經被刻進了它們學過的資料裡。模型不是突然長出了看字母的眼睛。它們是把哏背了下來。
換個字,面具就掉了。在 2025 年一項很仔細的測試裡,研究者問「blueberry 裡有幾個 B」。一個很受歡迎的聊天機器人大約每十次錯四次,明明是兩個卻自信地說是三個,還在算式旁邊打上小勾勾。另一個模型則耐著性子一個字母一個字母走,每一次都答對。同一件事,結果卻天差地遠,這告訴你:與其說這是 AI 的鐵律,不如說是某個模型願不願意慢下來、去核對的問題。
這才是這個故事誠實的版本。切塊的問題是真的,但不是全部。就連會把推理過程秀出來的 AI 也可能數錯,因為它是順著步驟在比對模式,而不是真的看見每一個字母。比較新的「會思考」模型在這件事上比那些快模型強得多,是快 AI 對上聰明 AI的好例子。不過,比較強不等於保證。
AI 很強的地方,還有該再檢查的地方
你不用把底下的管線全部背下來。你只需要一種直覺:知道 AI 在哪裡穩如泰山,在哪裡最好叫它把過程秀出來。
| 任務 | AI 表現如何 | 該怎麼做 |
|---|---|---|
| 寫作、摘要、發想點子 | 出色 | 相信它,之後再掃一眼 |
| 用白話解釋一個概念 | 出色 | 相信它 |
| 數字母或字元 | 不穩 | 叫它拼出來 |
| 又長或要求精確的計算 | 不穩 | 請它一步一步來,或用計算機 |
| 長文件裡的精確細節 | 時好時壞 | 叫它引用原文那一行 |
規律很簡單。任務是語言,就讓它自由發揮。任務要求精確,就讓它慢下來,或換一個謹慎的模型。
怎麼真正拿到正確答案
三個動作,幾乎能修好每一個數數或算術的失誤:
- 叫它把過程秀出來。「一個字母一個字母走」或「一步一步解」會逼模型把一切攤在它看得見的地方,而不是脫口說出一個答案。
- 問兩次,或問兩個模型。 如果精確很重要,別相信第一個快答。換一個模型給的第二意見,能抓出多得驚人的這類錯誤。
- 為任務挑對模型。 那些又快又愛講話的模型是為速度打造的。任何細膩又要求精確的事,值得多花那幾秒,交給比較慢、會思考的模型。
最後一點在你沒被綁在單一 AI 上時最容易做到。你可以把幾個頂尖模型擺在同一個問題前面,看看誰真的答對。
小結
AI 數不對字母,並不代表它其實很笨。這是一扇窗,讓你看見這些工具真正怎麼運作:一塊一塊地讀,用預測代替計算,對語言很在行,對「照字面」的事很笨拙。懂了這點,你就不再驚訝,開始掌舵。叫它慢下來、把過程秀出來,等到答案真的非對不可時,再找第二個模型一起看。
培養這種直覺,最好的辦法就是自己動手玩。叫一個模型數 R,再叫它先把單字拼出來,看著答案改變。