续到第十几轮觉得 AI 在重复自己?多半不是错觉

九个模型、玄幻加女频两条链、每条连续续写 20 轮,全部原文归档后逐轮复算重复率。长程写崩只有三种形态:从头复读(20 轮交 20 份同一个开场)、中途卡死(连续三轮 100% 旧文,一个新句子都没有)、尾段回卷(逐字重复率只有 0% 到 1.8%,检测器全盲,剧情却整体倒带回第 1 轮)。附赠一个冷数字:AI 评委判「像不像人写的」,已知答案正确率 12%,评委间一致率 86%,一致地错。

暖纸底色的标本柜插画:三条墨线书脊并排陈列,第一条绕成闭环,第二条中途冻结成冰,第三条末端悄悄卷回起点,柜前压着一枚放大镜和三张标本签

续到第十几轮,你开始觉得 AI 在重复自己。多数时候这不是错觉。7 月中我们跑了一场评测:九个模型, 玄幻和女频两条链(一本 890 万字的玄幻长篇,加《甄嬛传》),每条链从同一个续写点连续续写 20 轮, 每轮产物拼回上下文,复刻阅读 App 里真实发生的那个反馈循环,总计 360 轮。评完把全部原文归档, 又把每个重复率数字在归档链上重新算了一遍,开成一间对外的实录馆

看完 360 轮,结论先说:长程写崩不是一团混沌,它只有三种形态。这篇给每种看一个最扎眼的标本,完整证据在馆里。

死法一:从头复读

最不体面的死法,一眼能看穿。玄幻链上的 Gemini 3.1 Pro 交了 20 份同一个开场:两位高手扎进血色阵法、 光茧泛起涟漪、血腥气席卷而出、主角静立观望。第 1 轮这么写,第 11 轮这么写,第 20 轮还这么写, 「一头扎入其中」「苏信静立」这些短语逐字复现。剧情零推进:它每轮都把此前的 AI 续写当作不存在, 回到原著最后一句重新起笔。三轮开场并排的原文在标本一, 高亮短语的形状比任何解说都直观。

这一例的归因得说老实话:病根在我们自己的提示词。上下文里标注了哪些段落是此前的 AI 续写, 说明句写的是「仅供情节衔接参考」,这个模型把「参考」读成了「非正史」,于是跳过全部续写从头再来。 消融实验钉死了因果:旧措辞 20 轮全复读,删掉说明句约 8 轮里 6 轮,措辞改成「已发生的正文」后 0/20。 标本留着展出,因为这不是我们独享的坑:谁自己写提示词,谁就可能埋下同一句歧义。

死法二:中途卡死

第二种病要到中段才发作,机器信号最响。我们的口径是把每轮文本切成连续 12 字的滑窗, 算它与此前所有轮的逐字重合率。Grok 4.5 在玄幻链第 10、11、12 轮连续三轮测出 100%: 三整轮没有写出一个新句子,同一段剑招从黑血溅落到白烟嗤响,一字不差地交了三遍卷。 另一个样本更有画面感:Kimi K2.6 第 10 轮的 7 个段落里,3 个整段照抄自己第 5 轮的产物。

机理是自回归的固定点:上下文里自己写的段落越堆越多,「再写一遍」成了阻力最小的续写。 它也是三种死法里唯一见过自愈的:Grok 那条链第 13 轮重复率降到 68.4%,开始挤出新句子。 换代也能治,Kimi K3 在同协议复测里重复率峰值只剩 6.8%,对上代成对双盲 10:0 和 11:1。 前提是有人真去复测,而不是等厂商发布会。原文对照在标本二

死法三:尾段回卷

第三种最隐蔽。出事的是 GPT-5.6 Terra,前 17 轮它是全场文笔模仿的天花板,九家里唯一复刻了原著的波浪号拟声和用字习惯。 然后第 18 轮,剧情整体倒带:两位高手「刚刚」进阵,主角站在阵外探查——这是第 1 轮的剧情位置。 中间 16 轮的战斗、破阵、追击,像从没写过一样。

要害在检测:第 18 到 20 轮与前 5 轮的 12 字滑窗重合率只有 0% 到 1.8%。逐字检测器在这里完全失明, 因为每个句子都是新写的,重演的是剧情本身。抓住它的是细读:双盲两套映射的评审互不知情, 各自独立记下了这次回卷。这个标本教了一课:文字纹理的模仿力和长程剧情的一致性是两种独立的能力, 买它的「像」,就要自担它的「忘」。两轮开场并排在标本三; 顺带一提,同一个模型在女频链全程零事故拿 1-3 名,文体换了,病也换了。

为什么不让 AI 评委打个分了事

因为我们量过 AI 评委的成色。受控实验里给 4 个不同基座的评委喂已知答案的锚点对:一边是真实用户一眼判 AI 的文本, 一边是累计百万级真人对话的社区热门文本。正确率 12%,方向系统性反着,把 AI 判成「更像真人」。 更冷的是一致率 82% 到 86%:高度一致,一致地错。约三分之一的判决还会跟着文本摆放顺序翻转 (位置偏差在 MT-Bench 论文里也有系统记录)。 反偏提示能把一家评委从 12% 拉到 83%,对另外三家几乎无效。

凭空判「像不像人写的」和对着原著判「谁更像它」,是可靠性完全不同的两个任务。 所以榜上的位次全部是后者:九个模型续同一本书,原著摆在桌上做同题相对比较; 两套随机映射对冲位置偏差,中段分歧照抄区间。任何地方都不出现「95.3 分」这种数字——这套证据链撑不起它。 完整的评审可靠性研究在实录馆的评委节

正常长什么样

馆里还有一个对照组,给「正常」立锚:同样 20 轮,玄幻链冠军第 20 轮与第 1 轮的滑窗重合率 0%, 剧情从阵法大战走到了战后结伴赶路,评审的原话是「唯一越写越好的系统」。三个病例有多刺眼,全靠这个基线量出来。

本文引的每个片段都是节选。三轮开场并排、逐轮重复率、评审判决原文,在中文续写实录馆;选模型的结论(谁第一、多少钱、你的文体该用谁)在榜单页,那边还记着每次新模型发布后的增量对决。 我们自己的产品结论只有一条:读长篇别把命押在单一模型上,逐段换模型续写,是把三种死法全部按住的唯一通用解。

常见问题

自己续写时怎么判断撞上了哪种死法?

复读最好认:新一轮的开场和续写点原文几乎一样,剧情原地踏步。卡死看「眼熟」:整段甚至整轮读起来像刚读过,往前翻几轮能找到一字不差的原文。回卷最难:文字全是新的,要对剧情位置,问自己「这一幕是不是几轮之前已经发生过」。三种都能用同一招急救:换个模型续这一段,或者回退到跑偏前的段落重新生成。

为什么逐字检测抓不到尾段回卷?

回卷轮的句子在词汇层面全是新的。同一把尺子(12 字滑窗对此前所有轮算逐字重合),量中途卡死能测出整轮 100%,量回卷轮只有 0% 到 1.8%,比健康轮次还干净。它重复的不是文字,是剧情:同一个故事时刻被换着词再讲一遍。确诊只能靠读剧情,这也是评测里细读式双盲评审省不掉的原因。

我平时一续就是上百轮,只测 20 轮的结论对我有用吗?

有用的方向是单向的:20 轮内就崩的模型,上百轮只会更糟,因为协议复刻的就是真实阅读 App 的上下文演化,每轮产物拼回窗口、原著逐步被挤出。反过来「20 轮内没崩」不保证第 50 轮不崩,这是明写的观测边界。实际使用里你比协议多一层保险:随时可以换模型或回退重生,三种死法都吃这一招。

「从头复读」是提示词措辞引起的,对我有什么参考价值?

参考价值恰恰最大:它证明一句措辞能改写一个模型 20 轮的全部行为。「仅供参考」四个字让模型把已写的正文当成了可忽略的注释;换成「已发生的正文」,复读从 20 轮全中降到零。自己写提示词的人随时可能埋下同款歧义,遇到剧情原地踏步,先怀疑措辞,再怀疑模型。

有想法或问题?来 Discord 聊聊 →

AI 续写小说的三种死法——九模型 20 轮实录导读 · Foreverse · 新梦