AI 续写小说用哪个模型?两种文体实测,冠军不重叠
九个大模型在玄幻与宫斗古言两种文体上各连续续写 20 轮、累计 360 轮,双盲评审排名:玄幻第一 DeepSeek V4 Flash,古言第一梯队 DeepSeek V4 Pro 与 GPT-5.6 Terra,两张榜的冠军互不重叠。附完整排名表、三种长跑失效模式避坑清单、按文体选模型的实际用法。

先给短答案:没有全能冠军。我们让九个大模型在两种文体上各连续续写 20 轮、累计 360 轮, 双盲评审排名——玄幻场第一是 DeepSeek V4 Flash,宫斗古言场第一梯队是 DeepSeek V4 Pro 和 GPT-5.6 Terra。玄幻冠军换到宫斗文里跌到第六。结论只有一条:按你读的书选模型,别信任何一张总榜。
这一页是结论层,名次和数字全部来自我们已发表的实验记录:六模型玄幻横评(120 轮生成)和九模型《甄嬛传》横评。 测法一句话说完:同一段开头、同一套提示,每轮产物拼回上下文再写下一轮,连写 20 轮; 产物匿名成随机字母、做两套映射,交给两个互不知情的评审排名。想看过程和评语全文,读那两篇。
续写玄幻网文,哪个模型最像原著?
六个模型接着一本 890 万字的传统玄幻往下写,盲评第一是 DeepSeek V4 Flash:几乎每个评审窗口都排第一, 评语是「六个系统中唯一读起来像原著续章的」。而它是六个模型里最便宜的档位之一。贵的不一定像。
| 名次 | 模型 | 一句话特征 |
|---|---|---|
| 1 | DeepSeek V4 Flash | 唯一读起来像原著续章的:称谓式对话、拟声词独立成段、剧情快推进 |
| 2 | DeepSeek V4 Pro | 对话锋利度全场最佳,但描写密度系统性偏高,「像一个笔更细的同题材作者」 |
| 3 | GLM 5.2 | 内容层贴近(战术商议、单字传讯都对味),但全程半角引号,表层观感出戏 |
| 4-5 | Claude Opus 4.8 | 深 V 曲线:开局文艺腔最重、中段高光、尾段半角标点混排,六家里波动最大 |
| 4-5 | Qwen 3.7 Max | 恒定的精修感官流:每轮都写原著从不写的气味描写,恒定及格、恒定不像 |
| 6 | Gemini 3.1 Pro | 失格:20 轮全部重写同一段开场(提示词措辞被误读所致,修复后恢复正常) |
两条注记。Gemini 的垫底不是能力问题:它把上下文说明里「仅供情节衔接参考」一句读成了「这些段落不算正文」, 于是每轮跳过全部已续写内容、回到原著末尾重写;说明改写后回退清零,这个坑在 Foreverse 的续写链路里已经修掉。 另外,这张榜是六模型的;GPT-5.6 Terra、Grok 4.5、Kimi K2.6 三家也按同一协议跑过这本玄幻, 它们的玄幻链表现记在下文失效模式一节。价格参照:按DeepSeek 官方牌价,V4 Flash 每百万输入 token 收 0.14 美元。
续写宫斗古言,哪个模型最稳?
九个模型接着《后宫·甄嬛传》的宫斗高潮往下写,第一梯队两家:DeepSeek V4 Pro(名次区间 1-2), 唯一稳定复现原著「话中有话+叙述解码」双层结构的系统;GPT-5.6 Terra(1-3), 全程零格式错误、零称谓错误、零设定事故。
| 名次 | 模型 | 一句话特征 |
|---|---|---|
| 1-2 | DeepSeek V4 Pro | 唯一稳定复现「话中有话+叙述解码」双层结构;太后审案一场是全部样本的峰值 |
| 1-3 | GPT-5.6 Terra | 全程零事故;物证链写法(针脚、香料新陈、设局钓人)最贴原著 |
| 2-3 | GLM 5.2 | 限知观察质感最纯,但半角引号的毛病从玄幻场原样带到了宫斗场 |
| 4-5 | Claude Opus 4.8 | 对话机锋全场最锋利,但后段半角标点递增、人名位分漂移 |
| 4-6 | Gemini 3.1 Pro | 措辞修复后从失格回到正常中游;文艺腔仍是九家最重 |
| 5-7 | Kimi K2.6 | 唯一显著逆向改善:开局网文暴怒腔,越写越收敛回宫斗正轨 |
| 6-7 | DeepSeek V4 Flash | 玄幻场冠军在此跌到中下:白话直给的强项在典雅语体上使不上力 |
| 8 | Qwen 3.7 Max | 两个评审一致排第八:精修感官流在古言语境里比在玄幻里更违和 |
| 9 | Grok 4.5 | 两个评审一致垫底:后段逐字复读,二十轮剧情停在案发当日下午 |
两张榜对照读,翻转是系统性的。V4 Flash 在玄幻场靠白话直给、短句快节奏拿第一, 这套本能撞上流潋紫「澄澄的如一汪碧玉」式的典雅语体就成了负资产。它的同门 V4 Pro 正相反: 玄幻场因为「笔更细」被扣分,古言场里笔更细恰好就是原著的笔。同一个特质,换个文体正负号翻转。 GLM 5.2 是唯一双榜都进前三的模型,代价是半角引号顽疾,两本书都没改掉。
2026-08-13 增补:同一天两个新版本,方向相反
Grok 4.6(xAI 官方 API,发布约 24 小时内实测)对前代玄幻 12:0、女频 12:0,十二份稳定裁决全高置信,是这条管线迄今最强的代际信号——4.5 的逐字循环和第一人称失守全部修复,玄幻场已与冠军同档(对 V4 Flash 归档链原始 8:4、稳定 4:0,按红线不宣布换冠),女频场 2:10 输在「大纲体」。DeepSeek V4 Pro 正式版(0813,GA 后两小时内实测)正相反:玄幻 3:9、女频 1:11 输给自家 preview 前代,病灶是「现代文艺化」 漂移。系统级的坑在比分之外:DeepSeek 官方 API 同 ID 热切权重,上面两张表里 V4 Pro 与 V4 Flash 的名次描述的都是已经调不到的 preview 快照——锁模型 ID 锁不住权重。现在还调得到的 古言第一梯队是 K3 与 GPT-5.6 Terra,Opus 5 候补。
2026-07-31 增补:DeepSeek V4 Flash 正式版上线,续写榜要改吗?
正式版 API 上线公测当天,我们补了两张成绩单。写小说 20 轮与四档思考实测:机械复读峰值从 72.0% 降到 1.2%,但文风距离变大,high/max 仍可能把输出额度吃进隐藏思考。App Agent 面对 385 章长篇、挑场面改写:同书同话术复跑,写失败 0、几乎全走章级改写,净增≥300 字的章 13 章,墙钟更慢。 续写盲评名次本轮不重排——那是另一套协议;Flash 仍可当玄幻省钱档候选,长任务 Agent 另看工具纪律与实质改写章数。
同一天完成的 Luna/Terra 32K 矩阵也没有硬塞进旧榜。三款模型能放在一起说的价格、等待、长度服从和 Agent 边界,单独整理在DeepSeek、Luna、Terra 选型表; 想先凭阅读口味判断,三份同题第 1 轮与第 20 轮原文已经匿名排好,答案放在正文后半段。
2026-07 增补:Kimi K3、Qwen 3.8 和 Opus 5 都测过了,榜单要重排吗?
7 月中下旬三天里连发两个万亿级新模型,我们都按同一套协议补了成对双盲。当时的结论有两半: 榜单中段的名次已经过时;两张榜的第一梯队不用动。前半句站住了,后半句只保鲜了十天—— 7 月 28 日给 Kimi K3 补的 12 系统混排重赛把两张榜的第一梯队都改写了,见本节末尾。 成对对决本身的判断没变:新一代 Kimi 值得高看,新一代 Qwen 只在女频场兑现了升级。
Kimi K3(7 月 16 日发布)对前代 K2.6是碾压级换代:玄幻 10:0、女频 11:1,K2.6 的比喻堆砌和整段自我复制都没有复发。 用结构指标隔空对表,它的玄幻贴近度已经落进 DeepSeek 双档之间——上表里 K2.6 的「5-7」名次 对 K3 已经失效,但代价是约 85% 对白半角引号和关不掉的思考延迟。Qwen 3.8 Max Preview(7 月 19 日发布)对前代 3.7 Max则是半场升级:女频 11:1 一边倒,最伤的「精修感官流违和」在古言语境里确实收敛了;玄幻只有 7:5, 分窗 6:6 起步,谈不上换代。
两个后来者同场对决的结果是 3:20——K3 两种文体都赢,Qwen 3.8 升级后仍没有追平这一代第一梯队的入场线。对决周给的实操建议是 维持原榜首选、K3 值得排队;这一条在 7 月 28 日的混排重赛后升级了(见本节末尾), Qwen 3.8 等正式版再看的判断不变。另外提醒一句,续写榜单不迁移到陪聊场景:我们用 400 轮角色扮演语料单测过记忆维度, 换代和换厂都治不了裸上下文的失忆,那是另一张完全不同的成绩单。
Claude Opus 5(7 月 24 日发布)对前代 Opus 4.8也在发布当天按同协议补测了,两场的结果比 K3 那轮还要极端。女频场十二票全票横扫、三窗全 12:0,是这条管线跑过最一边倒的一场;玄幻场却 4:8 反输,三个异厂评委一致嫌它文风偏文艺实体书、 不像网文爽文,反倒判前代复刻了原著的短句节奏。前代的半角标点顽疾它确实治好了。 所以宫斗古言的第一梯队名单该把 Opus 5 加进候补,玄幻场仍然是 DeepSeek V4 Flash 的主场。
7 月 28 日的收官补测把第一梯队真的改写了。我们给 Kimi K3 跑了每书 3 条独立的 20 轮链, 与全场九个系统混排成 12 个匿名系统、两套全新映射,交给两位互不知情的评审重新全排序: 玄幻场 K3 三条链落位第 1、第 2、第 5,旧冠军 DeepSeek V4 Flash 被挤到双第 3; 女频场三条链落位第 1、第 3、第 5,最强链双评审一致第 1。它是这个系列里第一个 两种文体都进前二集团的模型。所以现在的首选名单是:玄幻场 K3 与 V4 Flash 二选一 (Flash 仍是省钱档),古言场 K3 进第一梯队、与 V4 Pro 和 GPT-5.6 Terra 同列 (Opus 5 候补)。注意这轮写手走的是我们内部 agent 通道而非 API 直调,采样参数不可控。 判词与 K2.6 三大旧病的收敛数据在更新过的玄幻横评和甄嬛传横评里。
长跑失效:定模型之前先查这三种病
累计 360 轮里观察到的失效全部落进三种形态。它们都是累积病,一次生成的 demo 看不出来, 连续多轮才发作,所以比单看名次更值得当避坑清单用。
从头复读:模型无视已续写内容,每轮回到原著末尾重来。Gemini 3.1 Pro 在玄幻场 20 轮全中, 根因是一句提示词说明被误读;措辞改写后两本书合计 28 轮零复发。
中途卡死:写着写着锁进自己的近期输出。Grok 4.5 两种文体都发病,玄幻场中段同两段文字逐字循环三遍, 宫斗场里二十轮故事时间没离开案发当日下午,两个评审各自独立写下「剧情倒带」; 它在宫斗场的第一人称密度也只有原著一半(每千字 9 次「我」对 5 次)。Kimi K2.6 是轻症版, 整段照抄自己前几轮的产物。
尾段回卷:最反直觉的一种,恰好砸在文字纹理模仿最好的模型头上。GPT-5.6 Terra 的玄幻场前中段 被两个评审判为全场最贴近原著,第 18 到 20 轮却把剧情整体倒回续写起点、重演第一章, 甚至复用了自己第 2 轮的句子。表面像与剧情连贯是两种独立能力;它在宫斗场没有回卷, 零事故跑进第一梯队。
怎么用这份榜单?
按书选、按场景换,别把一本书锁死在一个模型上。失效随轮数累积,中途换模型或重写一段就能打断循环, 这比事前挑出「完美模型」现实得多。
在 Foreverse 的阅读器里这套打法是现成的:续写逐段可换模型, 62 家预置供应商都能自带 key 接入,任何 OpenAI/Anthropic 兼容端点还可以自定义添加。 武戏用玄幻场冠军、文戏换古言场冠军,同一本书里真实可操作。注册送 5000 credits, 走官方渠道约合 260 段续写:两张榜里的 DeepSeek 双档在官方渠道直接可选, GPT-5.6 Terra、GLM 这类目录外的模型拿自己的 key 接入,试完前排再决定给谁充值。
方法论与局限
方法完整交代一遍:每条链从固定位置起笔(玄幻场取 55% 深度的战斗场景,宫斗场取陵容私藏歹物事发的高潮), 连续续写 20 轮,产物拼回固定 1.6 万 token 的上下文窗口。双盲评审的意思是产物匿名成随机字母、 做两套不同映射、交给两个互不知情的评审独立排名,两套映射一致的名次才当定论, 有分歧的按区间报告,比如古言场的 4-6、5-7。裁判用人而不用模型, 原因在另一场评审可靠性实验里写透了。
局限也摆在明处:全部实验共用一套提示框架;只测了玄幻和宫斗两种文体,且都是中文书; 模型迭代会让名次过时。榜单里的名次区间照录了评审的真实分歧,我们不做人为收窄。 本页随复测更新,以页首日期为准。
常见问题
免费模型里哪个续写能打?
两场横评都没测免费档位,名次给不出,不硬编。数据里最接近的答案是 DeepSeek V4 Flash:玄幻场盲评第一,同时是六个模型里最便宜的档位之一,官方牌价每百万输入 token 0.14 美元。Foreverse 注册送 5000 credits,官方渠道约合 260 段续写,可以先把两张榜的前排试一遍,再决定要不要给谁付费。
模型更新这么快,这份榜单还准吗?
名次绑定被测版本:2026 年 7 月测的是 DeepSeek V4 双档、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max、GLM 5.2、GPT-5.6 Terra、Grok 4.5、Kimi K2.6 这一代。Kimi K3、Qwen 3.8 Max Preview、Grok 4.6 和 DeepSeek V4 Pro 正式版(0813)都已按同协议补测成对对决,结论收在正文的增补各节。8 月新增一条要紧提醒:DeepSeek 官方 API 同 ID 热切权重,榜上 DeepSeek 的名次描述的是已经调不到的 preview 快照。版本升级后名次可能变,本页会随复测更新页首日期。比名次更耐用的是方法:按文体选模型、一本书里允许逐段换,这两条不随版本过时。
中文小说和英文小说该用不同的模型吗?
两场横评测的都是中文书(一本传统玄幻、一本宫斗古言),我们没有英文小说的排名数据,所以不给英文榜。已有数据支持一个更根本的判断:同一语言内换个文体,冠军都会掉到中游,「按文体选」比「按语言选」优先级更高。读英文书建议照搬这套方法自测:同一段开头让几个候选模型各续几段,盲着读完再翻牌。
双盲评审具体怎么防偏心?
每个模型的产物匿名成随机字母,做两套不同的随机映射,分别交给两个互相不知道对方存在的评审独立排名。两套映射下结论一致的名次才作为定论;评审自标低置信或互有分歧的位置,一律按区间如实报告。玄幻场的前三与末位、宫斗场的首末梯队,在两套映射下完全一致。
有想法或问题?来 Discord 聊聊 →