九家模型冒充真人写手,只有一家骗过了守门员
九家大模型拿同一份任务书写中文网文短章,混进真书段落做盲测,看谁能不被识破。排位和续写榜完全不同:续写双冠军 DeepSeek v4-flash 在这张考卷上垫底,Opus 5 靠「零收益的时间戳和不均匀的口癖」拿下全场唯一漏网。前三名的胜因全是「省事的错」:真错字、真口癖,装不出来。附十万字长跑的模型档案:Sonnet 5 套话失控 101 次,Grok 4.5 两跑两种崩法。

先报一个反直觉的数字。DeepSeek v4-flash 在我们九模型续写横评里拿过两种文体的双冠军; 换一张考卷,让它从零冒充真人写手写网文短章,九家垫底,被守门员一抓一个准, 置信 85,全场最高。
同一家模型,两个极端。原因不复杂:接笔和冒充是两种能力。续写有原文文气当拐杖, 贴得越紧分越高;冒充没有拐杖,模型自己的底色全部露出来。 这篇讲的就是「冒充」这张考卷:九家大模型,谁写的中文网文最难被认出是机器?
考场规则
每家写手拿到同一份任务书,逐字相同:一段真人网文锚文(学它的声口)、 一套反 AI 味写作纪律、三种叙事声音类型各写一篇短章。写手之间互相隔离。 产出混进同书的真人段落做成盲池,由守门员逐段判「人还是机器」并给出置信和理由。
守门员为什么不用 GPT 或 Gemini?因为我们先测了评委本身: 十个主流模型判「像不像真人」方向是反的,会把守纪律的机器稿当真人夸、把真书原文当 AI 批。 唯一与人类判定同构的机器评委是与写手同代的 Claude 思考型模型,它连续七轮 100% 识破、 零误伤,判词还给得出可复核的证据。所以这张考卷的裁判是它, 另配一名副裁交叉复核,遇到自家模型的稿子由对方主判。
九家过堂,成绩单如下,越靠前越难被识破。
| 排位 | 写手 | 战绩 | 一句话归因 |
|---|---|---|---|
| 1 | Opus 5 | 全场唯一让主裁判真(置信 72) | 零收益时间戳、口癖扎堆不均匀,像日记 |
| 2 | DeepSeek v4-pro | 一段漏网 | 真错字「那到未必」被引为活人证据 |
| 3 | Gemini 3.1 Pro | 一段漏网,但有连抄前科 | 同音别字像手打连载,抄袭风险另计 |
| 4-5 | GLM-5.2 / GLM-5 | 一段骗过副裁,主裁全抓 | 口语调料撒得太均匀 |
| 6 | Sonnet 5 | 全被抓 | 句子形状最像真人,整体执行质量出卖它 |
| 7 | Fable 5 | 全被抓 | 执行力太强,连装错都装得对称 |
| 8-9 | Gemini 3.6 Flash / DeepSeek v4-flash | 全被抓且置信最高 | 说明书腔、设定自打架 |
逐家档案
Opus 5:赢在「写了没用的东西」
全场唯一一段让主裁真心判「人」的机器稿出自它。守门员事后归因,赢点是 「零收益的时间戳」和「口癖扎堆且分布不均匀」:一篇里转折连词清一色用同一个字, 换了段落又忘了这个习惯。这种不均匀装不出来,像真人日记的毛边。 在另一场十万字长篇对照里,它也是四个模型中唯一有「限量」意识的: 把最浓的文笔交给一个角色的台词,旁白保持克制。特征性弱点是越写越长, 章节长度到末段膨胀了四成。
DeepSeek v4-pro:一个真错字值千金
它的漏网段靠的是「那到未必」,一个真实的错别字。守门员的判词把它引为 「错别字懒得改」的活人证据。这不是工序的功劳,是这家模型中文输出里天然带一点毛边, 恰好落在机器最难伪造的位置上。注意和 v4-flash 区分:同一家的两个档位, pro 冒充次强,flash 冒充垫底,档位差在这张考卷上比想象中大。
Gemini 3.1 Pro:毛边加分,抄袭扣分
同音别字「量地」「逢了」帮它漏网一段,判词是「手打连载的真毛边,机器几乎不犯」。 但它有全场唯一的严重事故:换一种调用形态跑同一任务时, 它把任务书里的参考锚段逐字抄了三十多个字进正文,连原书名都写了出来。 同任务书、同模型、走另一条接口的版本没抄。用它做仿写, 防抄袭滑窗检查必须设为硬闸。
GLM 系:均匀是原罪
GLM-5.2 有一段骗过了副裁,主裁没放行。败因很典型:口语调料撒得太均匀, 一段里三个「嘛」,每段都俏皮,每段俏皮得一样多。真人的口语是一阵一阵的。
Sonnet 5:统计上最像,整体上露馅
句长、碎句这些形状指标,它是九家里唯一全线落在真人区间的,我们复核时反复确认过这一点。 照样全被抓,判词落在术语错位和「每段收尾都要总结点题」。它还有一份十万字长跑的旧账: 写到后半程,「带着一丝」写了 101 次,密度比前半恶化 4.8 倍, 章节长度从两千六百字衰减到一千一,是我们测过的模型里最陡的断崖。 形状对了,密度和耐力不对。
Fable 5:败给自己的执行力
我们内部产线用得最多的写手,也是这场实验的起点。它的问题一句话:任何写作指令都执行得十全十美, 而「十全十美」本身就是指纹。让它装个错字,它会顺手在下文把错字自纠了,纠得还很对称。 十几轮里它没有漏网过一次。
Grok 4.5:短跑选手,长跑事故
短章考卷上它平平无奇地被抓。真正值得记录的是十万字长篇对照里的表现:第一跑直接梗概化坍缩, 三十章只写出两万七千字,章均九百字;加了每章字数硬性条款重跑,坍缩转化成填充, 同一个「捋思绪」模板段落写了 18 处,还有整段文字逐字重复三遍的事故。 评委的判词很扎心:「前两章的语言是我这一轮读到的最好的一档,前二章我愿意签,全书我不敢签。」 它败在长程自我管理,不败在笔力。角色卡开场白这类短件,不必禁用它。
DeepSeek v4-flash:续写冠军的另一面
说明书腔,设定自打架,被抓置信全场最高。它和 v4-pro 的档位差、 它自己在续写榜和冒充榜上的座次反转,是这场实验最有用的提醒: 看到「某模型写小说第一名」的榜单,先问一句测的是什么任务。
贯穿九家的规律:胜因买不来
排进前三的段落,胜因没有一个来自写作工序,全部来自「真实能力缺陷产生的省事的错」: 真错字、真别字、真口癖。九家拿的任务书逐字相同,工序完全一致, 差距全在模型自己的底色上。
我们反向验证过:给不犯错的强执行模型下指令,让它主动写「省事的错」, 产出的错会整整齐齐落在最安全的位置,守门员当场判「做旧」。 错误的真实性无法用指令移植。想要像真人的产出,选型就是工序的一部分, 而且是排在最前面的那道。
给不同任务的选型建议
| 你的任务 | 首选 | 避开 | 备注 |
|---|---|---|---|
| 从零写「像真人」的正文 | Opus 5,其次 DeepSeek v4-pro | DeepSeek v4-flash、Gemini 3.6 Flash | 选型比堆提示词有效 |
| 接着已有文气续写 | DeepSeek 系 | — | 见续写横评,与本榜任务不同 |
| 十万字级长篇 | Opus 5 | Sonnet 5、Grok 4.5 | 盯后半程:套话密度和章长衰减都是越写越重 |
| 短件(开场白、短章) | Opus 5 / Grok 4.5 均可 | — | Grok 败在长程不败在笔力 |
| 用 Gemini 系仿写 | 可用但设硬闸 | — | 对参考语料跑 15 字滑窗查重,命中即重写 |
长篇另送三个便宜的机器预警器,都是这次实验里和人评结论完全一致的信号: 套话密度超过每万字 1.5 次要警惕;「一丝」这类高危词单独计数, 正常稿十万字十几次,失控稿能写到 149 次;末五章平均长度低于首五章的七成, 基本就是密度衰减的开始。
这张榜单的边界
三条诚实声明。第一,每家每种声音只写了一篇,被抓置信是上界不是精确值: 九家同题竞写给了守门员「多段撞车」的聚类线索,单篇混进真书实战里会更难判。 第二,GPT 系因为账号配额问题全程缺席,这张榜对它无话可说, 「GPT 味」这个词的本尊没进考场。第三,榜单测的是中文网文语域的短章冒充, 换语域换文体,座次会动。我们把它当方向性信号用,不当终榜供着。
实验收口那天,产线的写手配置改了一行:以假乱真场景的默认写手从 Fable 5 换成 Opus 5。 不是因为 Fable 写得差,是因为它写得太好了。
常见问题
写中文小说到底选哪个模型?
分场景。要「读起来像真人写的」短章或长篇正文,首选 Opus 5,DeepSeek v4-pro 次之。要接着已有的文气续写,DeepSeek 系反而是我们续写横评的冠军。要十万字级长篇,避开 Sonnet 5(套话密度后半恶化 4.8 倍)和 Grok 4.5(长程工艺崩坏),但 Grok 写短件不必禁用,它败在自我管理不败在笔力。
为什么续写强的模型,冒充真人反而垫底?
接笔和冒充是两种能力。续写时有原文文气可以贴着走,DeepSeek v4-flash 贴得最紧;从零冒充真人写手时没有拐杖,它的说明书腔和设定自打架就全暴露了。我们九家同题实测里它被守门员抓得最狠,置信 85,全场最高。选模型前先想清楚你的任务是哪一种。
「省事的错」是什么意思?为什么它是胜因?
排进前三的模型赢在真实能力缺陷产生的自然错误:DeepSeek v4-pro 写出真错字「那到未必」,守门员把它引为「错别字懒得改」的活人证据;Opus 5 的转折连词扎堆复用,像真人口癖。这些错装不出来。我们试过给不犯错的模型下指令让它写错字,它会错得很整齐,当场被判「做旧」。
AI 把参考语料整句抄进正文怎么防?
拿产出对参考语料跑连续 15 字的滑动窗口重合检查,命中即打回重写。这不是理论风险:我们实测里 Gemini 3.1 Pro 发生过逐字连抄任务书内参考段落 30 多字、连原书名都写出来的事故。用 Gemini 系做仿写任务,这道检查必须是硬闸,不能只做抽查。
有想法或问题?来 Discord 聊聊 →