为什么 AI 数不对 strawberry 里有几个 R
作者 Chatday Editorial Team ·
让聊天机器人帮你策划婚礼,它能安排得明明白白。但问它“strawberry”里有几个字母 R,它大概率会告诉你两个。正确答案其实是三个。这是现代 AI 最诡异的现象之一:同一个能给你解释量子物理的工具,却在一个六岁小孩拿铅笔就能算对的问题上栽了跟头。
这不是 bug,AI 也不傻。这其实是这些系统底层阅读方式带来的副作用。一旦弄懂了这一点,AI 很多奇怪的小失误就瞬间说得通了。
著名的“strawberry”翻车事件原理解析
“strawberry 里有几个 R?”成了网友们最爱用来刁难 AI 的问题。在很长一段时间里,几乎所有聊天机器人都答错了,而且它们会极其自信地回答“两个”,那种笃定的语气,就像是一个这辈子从没犯过错的人。
你自己拼一下:s-t-r-a-w-b-e-r-r-y。开头附近有一个 R,结尾附近有两个 R。一共三个。对人类来说这很简单,因为我们看的是实实在在的字母。但 AI 做不到这一点,想知道为什么,就得看看它是怎么“阅读”的。
AI 是按块读取,而不是按字母读取
这里有个几乎没人知道的细节。在 AI 模型读取你的消息之前,文本会被切分成一个个叫做 token 的小块。一个 token 通常是一个常用词或者词的一部分。比如“strawberry”这个词,通常会被切分成“st”、“raw”和“berry”这样的块。
现在用模型的方式来数一数 R。块“st”里没有。“raw”里有一个。“berry”里有两个 R,但模型把它看作一个完整的块,而不是 b-e-r-r-y。这样一来,字母就被埋在了这些块里面,模型只能靠记忆去回想每个块大概是怎么拼的,而不是直接看着字母数。
一位研究员的比喻非常贴切:这就像是不把绳子拆开,就想去数里面有几股线。模型看到的是编好的绳子(token),而不是一根根的线(字母)。
为什么同样的毛病会让简单数学也翻车
这也是为什么 AI 能轻松搞定哲学论文,却在四位数乘法上绊倒。数字同样会被切分成块,而且切分方式还不固定。比如数字 12345 可能会被切成“123”和“45”,所以模型根本不会像你在纸上列竖式那样把数字对齐。
更关键的是,AI 并不是在计算。它是基于读过的所有内容,预测下一个最可能出现的词。这套逻辑在语言处理上非常完美,因为“差不多”就行;但在算术上就糟了,因为答案要么精确,要么就是错的。模型是为概率而生的,而数学需要的是精确。这两者并不总是合拍。这和 AI 会 一本正经地胡说八道 是同一个道理:一个流畅、看似合理的答案,并不等于正确答案。
那为什么现在有些模型能答对了?
反转来了。现在去问大多数聊天机器人 strawberry 的问题,它们都会回答三个。这个问题太火了,以至于正确答案已经被硬塞进了它们的训练数据里。模型并没有突然长出“字母视觉”,它们只是把标准答案背下来了。
换个词,它就露馅了。在 2025 年一项严谨的测试中,研究人员问“blueberry”里有几个 B。某款热门聊天机器人十次里大概有四次答错,明明只有两个 B,它却自信满满地说是三个,旁边还像模像样地打着勾。而另一个模型通过耐心地逐个字母核对,每次都能答对。同样的任务,结果天差地别。这说明这并非 AI 不可打破的铁律,而更多取决于特定模型是否愿意慢下来仔细检查。
这才是事情的真相。分块问题确实存在,但这并不是全部。即使是会 展示推理过程 的 AI 也会数错,因为它只是在按模式匹配走流程,而不是真正感知每一个字母。较新的“思考”模型在这方面比快速模型强得多,这正是 快速 AI 与聪明 AI 较量的一个绝佳例子。不过,更强不代表万无一失。
AI 擅长什么,哪些地方需要复核
你不需要死记硬背底层原理。只需要摸清 AI 在哪些方面非常靠谱,在哪些方面需要让它展示推导过程。
| 任务 | AI 的表现 | 应对策略 |
|---|---|---|
| 写作、总结、头脑风暴 | 极佳 | 放心用,稍作浏览即可 |
| 用大白话解释概念 | 极佳 | 放心用 |
| 数字母或字符 | 不太稳 | 让它拼出来 |
| 长算式或精确计算 | 不太稳 | 要求分步解答,或用计算器 |
| 长文档中的精确细节 | 参差不齐 | 让它引用原文 |
规律很简单。如果是语言类任务,就让它自由发挥。如果需要精确,就让它慢下来,或者换一个更严谨的模型。
如何真正得到正确答案
只要三招,就能解决几乎所有数数或数学翻车问题:
- 让它展示过程。 告诉它“逐个字母来”或“一步步解答”,这能促使模型把内容列出来以便自己查看,而不是脱口而出一个猜测。
- 多问一次,或问两个模型。 如果准确性很重要,别轻信它脱口而出的第一个答案。换个模型听听第二种意见,能抓出很多意想不到的错误。
- 用对模型。 快速对话模型是为速度而生的。对于任何繁琐且需要精确的任务,多花几秒钟用一个慢一点的思考模型绝对值得。
如果你没有被绑定在单一 AI 上,最后一点会更容易做到。你可以把几个顶尖模型拉到同一个问题前,看看谁才能真正答对。
总结
AI 数错字母并不代表它其实很笨。这反而是一扇窗口,让我们看到这些工具究竟是如何工作的:按块读取、靠预测而非计算、在语言上才华横溢却在字面细节上笨手笨脚。一旦明白了这一点,你就不会再感到惊讶,而是开始掌控它。让它慢下来,让它展示过程,当答案必须绝对正确时,再找个备用模型来把关。
培养这种直觉最好的办法就是自己去试探。让模型数一数 R 的个数,然后再让它先把单词拼出来,看看答案会发生什么变化。