六个模型续写同一本玄幻小说,我们盲评出了最像原著的那个

拿一本 890 万字的传统玄幻《踏天境》,让 DeepSeek V4 Pro/Flash、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max、GLM 5.2 从同一个位置各自连续续写 20 轮,再做双盲评审排名。第一名不是最贵的那个;有一个模型 20 轮都在重写同一段开场;还有一个模型句长统计几乎完美、盲评却排第五。完整数据和方法都在这篇。

六支毛笔在同一张卷轴上临同一个字,只有朱红那支写得和原帖一样

被测的书是《踏天境》,一本 890 万字的传统玄幻,句子短,段落碎,拟声词经常单独占一行, 对话占全文 16%,比喻词密度每千字只有 1 次。我们在 55% 深度处选了一个战斗场景当续写点, 让六个模型从这里开始,各自连续往下写 20 轮——每轮写完的内容拼回上下文再写下一轮, 窗口固定 1.6 万 token,写满后从原著头部开始截断。这个设置刻意模仿真实阅读器里的情况: 你用 AI 续写越多,上下文里「AI 写的部分」占比就越高,原著被一点点挤出窗口。

参赛的六个:DeepSeek V4 Flash、DeepSeek V4 Pro、Claude Opus 4.8、Gemini 3.1 Pro、 Qwen 3.7 Max、GLM 5.2。全部用同一套提示词、同样的温度,总计 120 轮生成。 评审分两层:一层是句长分布、对话率、比喻套话密度这些可计算的结构指标; 另一层是双盲人评——产物匿名成随机字母,两套不同映射,交给两个独立评审排名, 彼此不知道对方存在。

终榜

名次模型两个盲评的评语(摘录)
1DeepSeek V4 Flash「六个系统中唯一读起来像原著续章的」——称谓式对话、拟声词独立成段、快推进,三个评审窗口几乎全部第一
2DeepSeek V4 Pro「对话的口语锋利度全场最佳」,但叙述层描写密度系统性偏高,「像一个笔更细的同题材作者」
3GLM 5.2内容层贴近(战术商议、单字传讯都对味),但全程用半角引号写对话,表层观感直接出戏
4-5Claude Opus 4.8深 V 曲线:开局文艺腔最重,中段高光,尾段出现系统性的半角标点混排——六家里波动最大
4-5Qwen 3.7 Max「恒定的精修感官流」——每个窗口都在写原著从来不写的气味与触感,恒定及格,恒定不像
6Gemini 3.1 Pro失格:20 轮全部在重写同一段开场,剧情推进为零(成因见下文,修复后恢复正常)

两套映射下,前三名和末位完全一致。四五名的相对位置两个评审都自标低置信—— 争议点是「恒定及格」和「高光加崩坏」哪个更糟,这本来就是审美权重问题,我们如实报告为并列。

统计指标闹的两个笑话

Qwen 3.7 Max 的结构统计几乎完美:平均句长 32.1(原著 32.1),对话率 18.1%(原著 16.1%), 比喻套话密度全场最低。按统计它该拿第一,盲评却给了四五名。评审的证据很具体: 它每个窗口都在写「焦糊味刺得鼻腔发酸」「清冷幽香」这类气味描写——而这本 890 万字的原著, 从头到尾没有一处写过气味。句长统计测不出「写了原著从来不写的东西」。

另一个方向的笑话是 GLM 5.2:我们的对话率检测显示它 20 轮零对话,正要给它记一笔, 细看产物才发现它全程用半角引号写对话,108 处,真实对话率 13.5%——检测正则只认全角引号。 有意思的是盲评在不知道统计结果的情况下独立抓到了同一现象,并按「表层出戏」扣了分: 中文网文全程半角引号,读者一眼就觉得不对。

这两件事让我们更确认了之前在评审可靠性实验里立的规矩:统计指标当回归闸门, 细读裁决当真值,谁也不能单独说了算。

Gemini 那个诡异的 bug:20 轮重写同一段开场

Gemini 3.1 Pro 的产物初看正常,连看 20 轮会发毛:每一轮都在写「两人扎入血色阵法, 光茧泛起涟漪」——同一个瞬间的 20 种措辞变体,剧情永远停在第一步。两个盲评审都把它标成 「逐字级复读」。

排查后发现这不是模型能力问题。我们的续写上下文里给原著段落和 AI 续写段落做了来源标注, 配套说明里有一句「AI 续写段落仅供情节衔接参考」。DeepSeek 对这句话的理解和我们一致: 文风学原著,剧情接着最新的写。Gemini 把它读成了另一个意思:这些段落只是参考资料, 不算正文——于是每轮都跳过全部已续写内容,回到原著末尾重新开始。

我们做了三组消融来钉死结论。旧说明:20 轮全部回退。把说明整个删掉、只留标注行: 8 轮里约 6 轮回退——不解释时,Gemini 的默认理解仍然是「被标注的段落大概不算正文」。 把说明改写成两句显式声明——「AI 续写段落是已发生的正文剧情,续写必须从全文最后一段继续, 不得跳过或重写;仅文风、用词、句式节奏以原著正文段落为基准」——20 轮零回退,剧情正常推进。

这个教训值得写下来:给上下文里的特殊标记写说明时,措辞的鲁棒性要按最容易误读的那个模型设计, 而且说明不能省——没有说明比错误说明只好一点点。

所有模型的两个共同短板

第一,没有一个模型学会了原著的碎段节奏。原著平均一段 35 字,经常一句一段; 六个模型的段落平均长度在 62 到 94 字之间,全都比原著长了一倍上下。 句长波动也一样:原著的句长变异系数 0.84(短句和长句剧烈交错),六个模型全部落在 0.46 到 0.59——句子长度均匀化,这是我们反复在不同实验里撞见的、最深的机器指纹。

第二,场景锚定会集体漂移。续写点在血云翻滚的禁地阵法里,20 轮之后,六个模型笔下 不约而同出现了密林、山谷、甚至「阳光透过枝叶洒下斑驳光影」。文风指令管得住用词, 管不住世界状态——这属于另一套机制(设定词条、状态追踪)的职责范围。

对读者的实际建议

如果你主要读中文网文,这次数据支持一个省钱的结论:DeepSeek V4 Flash 的文风复刻 排在第一,而它是六个模型里最便宜的档位之一。第二名 V4 Pro 的对话写得更锋利, 但描写密度偏高,适合口味偏「精修」的读者。Claude 和 Qwen 写得都不差, 只是「不差」和「像原著」是两回事——它们更适合你想要 AI 有自己笔感的场景, 比如同人重构,而不是无缝续写。

在 Foreverse 里这些模型都可以自带 key 接入,续写时逐段换着试;来源标注的措辞修复 已经进了产品,你不需要自己踩这个坑。

常见问题

为什么测「连续续写 20 轮」而不是单次生成?

单次生成时上下文全是原著,模型抄得像很正常。真实使用里,AI 写的段落会不断拼回上下文,模型开始模仿自己的输出,文风偏移是累积的。我们先做过单轮对照实验,档位从 4k 到 20 万 token,各模型差距温和;换成 20 轮连续续写后,差距放大成肉眼可辨的分层。

盲评怎么防止评审偏心?

六个模型的产物被匿名成随机字母,做了两套不同的随机映射,交给两个互相不知道对方存在的评审独立排名。两套映射下前三名和末位完全一致才采信。评审自己也要给每个名次标置信度——四五名的相对位置两个评审都标了低置信,我们就如实报告为并列区间。

句长、对话率这些统计指标能代替人读吗?

不能,这次实验里它们还闹了两个笑话:一个模型的句长和对话率统计几乎和原著完美重合,盲评却排第五,因为它每轮都在写原著从来不写的气味和触感描写——统计测不出「写了原著没有的东西」;另一个模型对话率统计是 0%,其实是它全程用半角引号写对话,正则没认出来。统计适合当回归闸门,「像不像」的裁决还得靠细读。

评测里发现的「重写开场」bug 是模型的问题吗?

不全是。我们在上下文里给原著和 AI 续写段落做了来源标注,说明文案里有一句「AI 续写段落仅供情节衔接参考」——Gemini 3.1 Pro 把这句读成了「这些段落不算正文」,于是每轮都跳过全部已续写内容、回到原著末尾重写。把说明改成「AI 续写段落是已发生的正文剧情,必须从最后一段继续」之后,同一个模型 20 轮零回退。提示词措辞的鲁棒性要按最容易误读的模型设计。

有想法或问题?来 Discord 聊聊 →

六个大模型续写同一本网文,谁最像原著?——120 轮实测 + 双盲评审 · Foreverse · 新梦