AI 续写小说用哪个模型?两种文体实测,冠军不重叠

九个大模型在玄幻与宫斗古言两种文体上各连续续写 20 轮、累计 360 轮,双盲评审排名:玄幻第一 DeepSeek V4 Flash,古言第一梯队 DeepSeek V4 Pro 与 GPT-5.6 Terra,两张榜的冠军互不重叠。附完整排名表、三种长跑失效模式避坑清单、按文体选模型的实际用法。

两座并排的领奖台:左边的奖杯是一柄水墨剑,右边的奖杯是一柄宫廷团扇,台下同一排模型名牌朝向不同的冠军

先给短答案:没有全能冠军。我们让九个大模型在两种文体上各连续续写 20 轮、累计 360 轮, 双盲评审排名——玄幻场第一是 DeepSeek V4 Flash,宫斗古言场第一梯队是 DeepSeek V4 Pro 和 GPT-5.6 Terra。玄幻冠军换到宫斗文里跌到第六。结论只有一条:按你读的书选模型,别信任何一张总榜。

这一页是结论层,名次和数字全部来自我们已发表的实验记录:六模型玄幻横评(120 轮生成)和九模型《甄嬛传》横评。 测法一句话说完:同一段开头、同一套提示,每轮产物拼回上下文再写下一轮,连写 20 轮; 产物匿名成随机字母、做两套映射,交给两个互不知情的评审排名。想看过程和评语全文,读那两篇。

续写玄幻网文,哪个模型最像原著?

六个模型接着一本 890 万字的传统玄幻往下写,盲评第一是 DeepSeek V4 Flash:几乎每个评审窗口都排第一, 评语是「六个系统中唯一读起来像原著续章的」。而它是六个模型里最便宜的档位之一。贵的不一定像。

名次模型一句话特征
1DeepSeek V4 Flash唯一读起来像原著续章的:称谓式对话、拟声词独立成段、剧情快推进
2DeepSeek V4 Pro对话锋利度全场最佳,但描写密度系统性偏高,「像一个笔更细的同题材作者」
3GLM 5.2内容层贴近(战术商议、单字传讯都对味),但全程半角引号,表层观感出戏
4-5Claude Opus 4.8深 V 曲线:开局文艺腔最重、中段高光、尾段半角标点混排,六家里波动最大
4-5Qwen 3.7 Max恒定的精修感官流:每轮都写原著从不写的气味描写,恒定及格、恒定不像
6Gemini 3.1 Pro失格:20 轮全部重写同一段开场(提示词措辞被误读所致,修复后恢复正常)

两条注记。Gemini 的垫底不是能力问题:它把上下文说明里「仅供情节衔接参考」一句读成了「这些段落不算正文」, 于是每轮跳过全部已续写内容、回到原著末尾重写;说明改写后回退清零,这个坑在 Foreverse 的续写链路里已经修掉。 另外,这张榜是六模型的;GPT-5.6 Terra、Grok 4.5、Kimi K2.6 三家也按同一协议跑过这本玄幻, 它们的玄幻链表现记在下文失效模式一节。价格参照:按DeepSeek 官方牌价,V4 Flash 每百万输入 token 收 0.14 美元。

续写宫斗古言,哪个模型最稳?

九个模型接着《后宫·甄嬛传》的宫斗高潮往下写,第一梯队两家:DeepSeek V4 Pro(名次区间 1-2), 唯一稳定复现原著「话中有话+叙述解码」双层结构的系统;GPT-5.6 Terra(1-3), 全程零格式错误、零称谓错误、零设定事故。

名次模型一句话特征
1-2DeepSeek V4 Pro唯一稳定复现「话中有话+叙述解码」双层结构;太后审案一场是全部样本的峰值
1-3GPT-5.6 Terra全程零事故;物证链写法(针脚、香料新陈、设局钓人)最贴原著
2-3GLM 5.2限知观察质感最纯,但半角引号的毛病从玄幻场原样带到了宫斗场
4-5Claude Opus 4.8对话机锋全场最锋利,但后段半角标点递增、人名位分漂移
4-6Gemini 3.1 Pro措辞修复后从失格回到正常中游;文艺腔仍是九家最重
5-7Kimi K2.6唯一显著逆向改善:开局网文暴怒腔,越写越收敛回宫斗正轨
6-7DeepSeek V4 Flash玄幻场冠军在此跌到中下:白话直给的强项在典雅语体上使不上力
8Qwen 3.7 Max两个评审一致排第八:精修感官流在古言语境里比在玄幻里更违和
9Grok 4.5两个评审一致垫底:后段逐字复读,二十轮剧情停在案发当日下午

两张榜对照读,翻转是系统性的。V4 Flash 在玄幻场靠白话直给、短句快节奏拿第一, 这套本能撞上流潋紫「澄澄的如一汪碧玉」式的典雅语体就成了负资产。它的同门 V4 Pro 正相反: 玄幻场因为「笔更细」被扣分,古言场里笔更细恰好就是原著的笔。同一个特质,换个文体正负号翻转。 GLM 5.2 是唯一双榜都进前三的模型,代价是半角引号顽疾,两本书都没改掉。

2026-07-21 增补:Kimi K3 和 Qwen 3.8 测完了,榜单要重排吗?

7 月中下旬三天里连发两个万亿级新模型,我们都按同一套协议补了成对双盲。先说结论:两张榜的第一梯队都不用动, 但榜单中段的名次已经过时——新一代 Kimi 值得高看,新一代 Qwen 只在女频场兑现了升级。

Kimi K3(7 月 16 日发布)对前代 K2.6是碾压级换代:玄幻 10:0、女频 11:1,K2.6 的比喻堆砌和整段自我复制都没有复发。 用结构指标隔空对表,它的玄幻贴近度已经落进 DeepSeek 双档之间——上表里 K2.6 的「5-7」名次 对 K3 已经失效,但代价是约 85% 对白半角引号和关不掉的思考延迟。Qwen 3.8 Max Preview(7 月 19 日发布)对前代 3.7 Max则是半场升级:女频 11:1 一边倒,最伤的「精修感官流违和」在古言语境里确实收敛了;玄幻只有 7:5, 分窗 6:6 起步,谈不上换代。

两个后来者同场对决的结果是 3:20——K3 两种文体都赢,Qwen 3.8 升级后仍没有追平这一代第一梯队的入场线。所以本页的实操建议不变: 玄幻场 DeepSeek V4 Flash、古言场 V4 Pro 与 GPT-5.6 Terra 仍是首选;预算内想试新模型,K3 值得排队, Qwen 3.8 等正式版再看。另外提醒一句,续写榜单不迁移到陪聊场景:我们用 400 轮角色扮演语料单测过记忆维度, 换代和换厂都治不了裸上下文的失忆,那是另一张完全不同的成绩单。

长跑失效:定模型之前先查这三种病

累计 360 轮里观察到的失效全部落进三种形态。它们都是累积病,一次生成的 demo 看不出来, 连续多轮才发作,所以比单看名次更值得当避坑清单用。

从头复读:模型无视已续写内容,每轮回到原著末尾重来。Gemini 3.1 Pro 在玄幻场 20 轮全中, 根因是一句提示词说明被误读;措辞改写后两本书合计 28 轮零复发。

中途卡死:写着写着锁进自己的近期输出。Grok 4.5 两种文体都发病,玄幻场中段同两段文字逐字循环三遍, 宫斗场里二十轮故事时间没离开案发当日下午,两个评审各自独立写下「剧情倒带」; 它在宫斗场的第一人称密度也只有原著一半(每千字 9 次「我」对 5 次)。Kimi K2.6 是轻症版, 整段照抄自己前几轮的产物。

尾段回卷:最反直觉的一种,恰好砸在文字纹理模仿最好的模型头上。GPT-5.6 Terra 的玄幻场前中段 被两个评审判为全场最贴近原著,第 18 到 20 轮却把剧情整体倒回续写起点、重演第一章, 甚至复用了自己第 2 轮的句子。表面像与剧情连贯是两种独立能力;它在宫斗场没有回卷, 零事故跑进第一梯队。

怎么用这份榜单?

按书选、按场景换,别把一本书锁死在一个模型上。失效随轮数累积,中途换模型或重写一段就能打断循环, 这比事前挑出「完美模型」现实得多。

Foreverse 的阅读器里这套打法是现成的:续写逐段可换模型, 62 家预置供应商都能自带 key 接入,任何 OpenAI/Anthropic 兼容端点还可以自定义添加。 武戏用玄幻场冠军、文戏换古言场冠军,同一本书里真实可操作。注册送 5000 credits, 走官方渠道约合 260 段续写:两张榜里的 DeepSeek 双档在官方渠道直接可选, GPT-5.6 Terra、GLM 这类目录外的模型拿自己的 key 接入,试完前排再决定给谁充值。

方法论与局限

方法完整交代一遍:每条链从固定位置起笔(玄幻场取 55% 深度的战斗场景,宫斗场取陵容私藏歹物事发的高潮), 连续续写 20 轮,产物拼回固定 1.6 万 token 的上下文窗口。双盲评审的意思是产物匿名成随机字母、 做两套不同映射、交给两个互不知情的评审独立排名,两套映射一致的名次才当定论, 有分歧的按区间报告,比如古言场的 4-6、5-7。裁判用人而不用模型, 原因在另一场评审可靠性实验里写透了。

局限也摆在明处:全部实验共用一套提示框架;只测了玄幻和宫斗两种文体,且都是中文书; 模型迭代会让名次过时。榜单里的名次区间照录了评审的真实分歧,我们不做人为收窄。 本页随复测更新,以页首日期为准。

常见问题

免费模型里哪个续写能打?

两场横评都没测免费档位,名次给不出,不硬编。数据里最接近的答案是 DeepSeek V4 Flash:玄幻场盲评第一,同时是六个模型里最便宜的档位之一,官方牌价每百万输入 token 0.14 美元。Foreverse 注册送 5000 credits,官方渠道约合 260 段续写,可以先把两张榜的前排试一遍,再决定要不要给谁付费。

模型更新这么快,这份榜单还准吗?

名次绑定被测版本:2026 年 7 月测的是 DeepSeek V4 双档、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max、GLM 5.2、GPT-5.6 Terra、Grok 4.5、Kimi K2.6 这一代。7 月中下旬发布的 Kimi K3 和 Qwen 3.8 Max Preview 已按同协议补测成对对决,结论收在正文的增补一节。版本升级后名次可能变,本页会随复测更新页首日期。比名次更耐用的是方法:按文体选模型、一本书里允许逐段换,这两条不随版本过时。

中文小说和英文小说该用不同的模型吗?

两场横评测的都是中文书(一本传统玄幻、一本宫斗古言),我们没有英文小说的排名数据,所以不给英文榜。已有数据支持一个更根本的判断:同一语言内换个文体,冠军都会掉到中游,「按文体选」比「按语言选」优先级更高。读英文书建议照搬这套方法自测:同一段开头让几个候选模型各续几段,盲着读完再翻牌。

双盲评审具体怎么防偏心?

每个模型的产物匿名成随机字母,做两套不同的随机映射,分别交给两个互相不知道对方存在的评审独立排名。两套映射下结论一致的名次才作为定论;评审自标低置信或互有分歧的位置,一律按区间如实报告。玄幻场的前三与末位、宫斗场的首末梯队,在两套映射下完全一致。

有想法或问题?来 Discord 聊聊 →

AI 续写小说用哪个模型?九个大模型 × 两种文体实测排名(双盲评审) · Foreverse · 新梦