让九个模型续写《甄嬛传》,玄幻冠军在宫斗文里跌到了第六
GPT-5.6 Terra、Grok 4.5、Kimi K2.6、DeepSeek V4 双档、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max、GLM 5.2,从甄嬛传同一个宫斗高潮各自连续续写 20 轮,双盲评审排名。宫斗文冠军和玄幻冠军不是同一个模型;有模型二十轮剧情停在案发当日;还有模型写着写着暴露了它记的是电视剧不是小说。

上一篇我们用一本传统玄幻测了模型的文风复刻力,评论区有个问题问得对:玄幻测出来的排名, 换成言情古言还作数吗?这次用《后宫·甄嬛传》重跑一遍——流潋紫的文风指纹和玄幻完全是 两套系统:第一人称限知视角,典雅书面语,称谓礼数严密到「臣妾」「本宫」错一个字就出戏, 对话全是绵里藏针的机锋。续写点选在陵容私藏歹物事发、玄凌震怒的宫斗高潮,九个模型 各自连续续写 20 轮,产物匿名成随机字母、两套映射、两个互不知情的评审独立排名。
女频终榜
| 名次 | 模型 | 两个盲评的评语(摘录) |
|---|---|---|
| 1-2 | DeepSeek V4 Pro | 「唯一稳定复现原著『话中有话+叙述解码』双层结构的系统」;太后审案一场是全部样本里的峰值单场 |
| 1-3 | GPT-5.6 Terra | 「全程零事故」——零格式错误、零称谓错误、零设定事故,物证链写法(针脚、香料新陈、设局钓人)最贴原著 |
| 2-3 | GLM 5.2 | 「限知观察质感最纯」,但全程半角引号的毛病从玄幻场带到了宫斗场——这是它的固有生成习惯 |
| 4-5 | Claude Opus 4.8 | 「机锋内容全场最锋利」,但后段半角标点递增、人名位分漂移——内容强、工艺劣化 |
| 4-6 | Gemini 3.1 Pro | 标注措辞修复后的新链:从玄幻场的复读失格回到正常中游;文艺腔仍是九家最重 |
| 5-7 | Kimi K2.6 | 唯一显著逆向改善的系统:开局是网文暴怒腔,越写越收敛回宫斗正轨 |
| 6-7 | DeepSeek V4 Flash | 玄幻场的冠军在这里跌到中下——白话直给的强项,在典雅语体上使不上力 |
| 8 | Qwen 3.7 Max | 两个评审一致排第八;「精修感官流」在古言语境里比在玄幻里更违和 |
| 9 | Grok 4.5 | 两个评审一致垫底:后段叙述与台词逐字复读、二十轮剧情停在案发当日下午;第一人称密度只有原著一半 |
置信度交代:两套匿名映射下,末两位完全一致、前三梯队一致,中段名次有相邻互换, 以上按区间如实报告。
玄幻冠军为什么在宫斗文里失灵
DeepSeek V4 Flash 在玄幻场拿第一靠的是白话直给、称谓短喝、拟声词独立成段——那本书的 母语就是这个。换到甄嬛传,同样的本能变成了负资产:原著的句子是「澄澄的如一汪碧玉」 这个路数,它写出来的短促白话在评审眼里「不像同一个作者」。
更有意思的是它的同门师兄。V4 Pro 在玄幻场的评语是「像一个笔更细的同题材作者」—— 描写密度偏高,是扣分项;到了古言场,「笔更细」恰好就是流潋紫的笔,同一个特质换个文体 正负翻转。两个场的冠军是同一家的两个档位,互相拿不下对方的主场。
Grok 的二十轮,停在案发当日下午
Grok 4.5 在两个文体上都出现了同一种病:写着写着进入复读循环。玄幻场是中段整窗 两段文字逐字循环三遍;甄嬛传场更彻底——后段叙述与台词逐字重复,两个评审各自独立 写下了「剧情倒带」的判词,二十轮续写的故事时间没有离开案发那个下午。 附带一个视角数据:原著每千字出现 9 次「我」(第一人称叙述的密度锚),Grok 只有 5 次, 大量段落漂成了第三人称全知视角——古言最要命的视角纪律,它没守住。
模型记的是电视剧,还是小说?
一个计划外的发现。甄嬛传小说和电视剧的专名体系不同:小说里太后住颐宁宫、皇后在凤仪宫, 剧版对应寿康宫、景仁宫。有系统续写时写出了「寿康宫」「佩儿」这类剧版专名——它的训练 记忆里,电视剧语料压过了小说原文。这个信号和文风贴近度基本同向:记得住小说专名的系统, 文风也更贴小说。给爱好者一个副产品结论:想让 AI 续写贴原著小说而不是电视剧同人, 模型的「原著记忆纯度」是个真实存在的变量。
怎么用这份数据
别找万能模型,按书选。读快节奏玄幻,V4 Flash 又便宜又是主场;读古言宫斗, V4 Pro 和 GPT-5.6 Terra 是第一梯队;GLM 5.2 是唯一两个文体都稳进前三的, 代价是你要忍它的半角引号。在 Foreverse 里这些模型都能自带 key 接入、逐段切换—— 同一本书里武戏用玄幻场冠军、文戏换古言场冠军,是真实可操作的读法。
常见问题
为什么玄幻测出的排名不能直接用在言情/古言上?
因为鉴别维度完全不同。玄幻看白话直给、拟声词、战斗推进;古言看第一人称限知视角纪律、典雅语体、称谓礼数(臣妾/本宫/娘娘用对没有)、对话机锋是不是绵里藏针。我们两组实验的冠军互不重叠:玄幻第一的模型在甄嬛传里跌到第六,古言前三里有两个在玄幻榜上并不拔尖。
「话中有话」这种东西,盲评是怎么判断的?
评审的依据是原著的双层结构:人物嘴上说体面话,叙述者「我」在心里拆解真实意图。九个系统里只有一个稳定复现了这个结构——其余的要么只写了面子话,要么让人物把心机直接说出口,变成现代吵架。这类证据比统计指标锋利得多。
评测里有模型「记忆污染」是什么意思?
甄嬛传小说和电视剧的专名体系不同:小说里太后住颐宁宫,剧版是寿康宫;小说是凤仪宫皇后,剧版对应景仁宫。有的系统续写时写出了剧版专名——说明它的训练记忆里电视剧语料压过了小说原文。这个信号与文风贴近度基本同向:记得小说的,文风也更贴小说。
这个实验对我选模型有什么实际意义?
按你读的书选模型,不要迷信任何一张总榜。我们的数据里读快节奏玄幻选 DeepSeek V4 Flash 最划算,读古言宫斗选 DeepSeek V4 Pro 或 GPT-5.6 Terra 更稳。在 Foreverse 里模型可以逐段切换,同一本书里也能按场景换着用。
有想法或问题?来 Discord 聊聊 →