如何判断一段文字是不是 AI 写的
作者 Chatday Editorial Team ·
有一个数字值得你停下来想一想:研究人员抽样分析了数万个网页后发现,现在网上新发布的文章里,大约一半都是 AI 写的。这可不是互联网某个边缘角落的现象,而是实打实的一半。也就是说,你今天大概率已经读过 AI 写的文字了,只是没意识到,可能是一篇产品测评、一条新闻摘要、一篇领英帖子,也可能是一封邮件。
那到底该怎么分辨呢?说实话,只要方法对,加上合适的工具,你完全可以练出一双「火眼金睛」,前提是你得清楚每种方法能证明什么、不能证明什么。这篇文章会把两套办法都教给你:三十秒内人眼就能看出的破绽,以及需要第二意见时 AI 检测器的工作原理。
半个互联网现在都是机器写的
开头那个数据来自 Graphite,一家 SEO 研究机构,他们分析了 2020 年以来发布的数万篇英文文章,把每一篇都放进多个 AI 检测器里跑了一遍。他们的发现是:AI 生成文章的占比在 ChatGPT 于 2022 年底上线后暴涨,随后在 2025 年到 2026 年间稳定在大约 50% 上下,有的季度略高于一半,有的略低。
而且这不只是博客垃圾内容的问题。另一项针对超过 1500 万篇生物医学论文摘要的分析发现,到 2024 年,至少 13.5% 的摘要显示出被 AI 撰写或润色过的痕迹,判断依据是 ChatGPT 出现后突然激增的特定用词。既然连科学期刊都是这样,那这事儿基本就是无处不在了。
这不代表 AI 写的文字就一定不好。很多 AI 文本确实有用,很多人也把 AI 当作写作搭档,先起草再大改。但当你在批改一篇论文、读一条好评如潮的产品测评,或是判断一篇新闻是否可信时,「这到底是谁写的」就是一个值得问的问题。下面就来说说怎么找答案。
你自己就能看出的破绽
在动用任何工具之前,先用你的眼睛。AI 模型是从海量的互联网文本里学会写作的,之后又被打磨成一种评分者喜欢的语气:流畅、讨好、略带正式。这种「打磨感」反而成了它的指纹。以下是你在读别人的文字时可以留意的几点。
| 破绽 | 具体表现 |
|---|---|
| 套话连篇 | 「在当今的数字时代」「值得注意的是」「让我们深入探讨一下」「颠覆性变革」 |
| 节奏过于整齐 | 每段字数差不多,每句话长度都中等,列表永远是干净的三点式 |
| 说得自信,内容却空洞 | 一堆打磨得很漂亮的句子,套到任何主题上都成立,就是没有真实细节 |
| 没有可核实的具体信息 | 没有名字、日期、价格或亲身经历,或者写出来的这些细节一查就是错的 |
| 语法完美,却没有个人味儿 | 零错字、零口语化表达、零个性,读起来像一份关于什么都没发生的新闻通稿 |
| 套路上瘾 | 「这不仅是 X,更是 Y」「从 X 到 Y」,开头永远是一个设问句 |
人工判断里最靠谱的一招是细节核实法。真正的写作者,哪怕水平一般,也会留下真实经历的痕迹:一家具体的店、一个古怪的细节、一句需要承担代价才能说出口的看法。AI 默认写的是「听起来对」的文字,而不是「确实对」的文字。挑一两个具体的说法查一查。如果一篇餐厅”测评”从头到尾没提到任何一道菜,或者一篇文章引用了一项你根本查不到的研究,那你的怀疑就是有依据的。这种失误模式还有个专门的名字,我们之前也用通俗的语言讲过为什么 AI 会编造事实。
在你开始到处指责别人之前,有一点要提醒:表格里列的每一条都只是一种习惯,不是铁证。人类写套话的历史比 ChatGPT 早得多。这也正是为什么多一个参考意见会有帮助。
AI 检测器到底是怎么工作的
AI 检测器读一段文字时,核心只问一个问题:这段文字有多”可预测”?
语言模型写作的方式,是一次又一次地选出统计上最可能出现的下一个词。这会留下痕迹。AI 写的文字往往流畅且可预测,用词很少出人意料,节奏也很平稳。人写的文字则要乱得多:我们会把句子写到一半推翻重来,选一些不寻常的词,一会儿写得很长,一会儿又突然很短。检测器衡量的就是这种可预测性(研究人员称之为「困惑度」)以及节奏上的变化(他们称之为「突发性」),最后给出一个概率:这段文字有 85% 的可能性是 AI 生成的。
关键词是「概率」。检测器其实并不知道到底是谁打出了这些字,它只是在做一次有依据的统计猜测,原理跟你上一节做的判断差不多,只不过它用的是数学,你用的是直觉。
这也解释了为什么分数会这样表现:
- 文本越长,判断越准。 一条两句话的短消息根本没有足够的信号量。大多数检测器在几百字以下都不太可靠。
- 人机混合文本会让它犯迷糊。 人写的初稿被 AI 润色过,或者 AI 写的初稿被人改过,都会落在灰色地带,因为它确实是两者的混合体。
- 正式的写作风格会被判定为”更像 AI”。 风格越可预测、越规范,读起来就越像机器写的,即便实际上是一个人写的。
检测器会在哪些地方判断失误
这部分是大多数文章都不会讲的,但恰恰是你最需要知道的。AI 检测器有真实存在、有据可查的失误模式。
最著名的例子来自 OpenAI 自己。2023 年初,这家公司推出了自己的 AI 文本分类器,结果六个月后就因为「准确率太低」而将它下架。按官方给出的数字,它只能抓出 26% 的 AI 写文本,还会把 9% 的人写文本误判为 AI。如果连做出 ChatGPT 的公司都无法可靠地检测出 ChatGPT,那对任何号称能给出确定答案的工具,都该多留一分怀疑。
第二种失误模式更糟,因为它不公平。斯坦福大学的一项研究发表在期刊 Patterns 上,测试了七款常用的 AI 检测器,样本是真人写的论文。对母语是英语的写作者,检测器表现还不错。但对非母语英语写作者,检测器把他们的文章误判为 AI 生成的比例达到了61%。原因就藏在方法本身里:用第二语言写作的人往往会用更保守、更规范的措辞,这种写法在数学模型眼里就显得「可预测」。而谨慎、正式、循规蹈矩的写作,恰恰正是检测器认为「像机器」的样子。
如何一步步检查一段文字
把上面这些串起来,就是一套真正好用的流程,全程大概两分钟。
- 先通读一遍找破绽。 套话、过于均匀的节奏、套路开头、毫无个性。记下你的第一直觉,但别就此止步。
- 做细节核实。 找出一两个具体、可查证的说法,去搜一搜。编造的信息来源、错误的价格、查无此研究的”研究”,都是最强烈的红色信号。
- 跑一遍检测器。 把文字粘贴进 AI 检测器,得到一个概率分数。免费、十秒钟出结果,不用注册就能试用。
- 权衡文本长度。 如果只有几百字以内,分数的参考价值要大打折扣;如果是长篇未经修改的文本,分数就值得重视。
- 想想是谁写的。 是正式文体,还是非母语写作者写的?相应地调整你的判断门槛,因为误判恰恰最容易集中在这类文本上。
- 把所有线索综合起来。 人工破绽 + 细节核实不过关 + 高分数 = 大概率是 AI 写的。只有一个信号成立时,指控的话就先咽回去。
什么时候该在意,什么时候真的不用在意
不是所有 AI 写的文字都是问题。一段天气播报或产品描述由 AI 写成,不会伤害到任何人。真正值得在意的是这些具体场景:
- 老师和教授在判断作业是不是学生自己写的时候。用上面的流程,并且记住斯坦福的那个发现,别只凭一个分数就下结论。
- 招聘经理在读一份打磨得过于完美的求职信时。检测器加上一个具体的面试问题(比如”多讲讲这个项目的细节”),很快就能验证清楚。
- 消费者在读评价时。五星好评却完全没提到产品的具体细节,正是最典型的套路。
- 任何读新闻的人。 如果一篇文章的事实经不起查证,那这个错误到底是人写的还是机器写的,其实没那么重要,错误本身才是问题。
还有反过来的一面。如果你习惯用第二语言认真写作,或者本身文风就比较正式,那么你自己写的、绝对真实的东西,某天也可能被误判。了解自己的「基准分」会有帮助:把自己的文字放进检测器跑一遍,看它给出什么分数。如果你确实是人写的文字总是被判定为「很像机器」,那更多是文风问题,而不是公平问题,我们专门写过一篇完整的指南,讲如何让 AI 写的文字读起来更像人,这些建议对写得像机器的人类同样有效。AI 人性化工具也能一键把生硬的初稿改得更自然。
值得养成的两分钟习惯
你读到的内容现在有一半是机器写的,而这个比例不会再降回去了。好消息是,你不需要变成文本鉴定专家。读出破绽,核实一个事实,剩下统计层面的活儿交给检测器去做。这三步合在一起,抓出的问题远比单靠任何一种方法多,也能帮你避开这场博弈里唯一真正的失误:自信满满地误判了一个真实的人写的文字。
下次一段文字读起来让你觉得「太顺滑了点」,别只是心里嘀咕。去查一查。