Foreverse Research · Fiction Bench
AI 续写小说排行榜:
九个模型,我们每个都真测过
同一本书、同一个续写点、每个模型连续写 20 轮,两套随机映射双盲评审,再用句长、对话率、复读检测交叉验证。通用能力榜不测「写小说像不像」这个维度——这里专门测。
评测执行 2026-07-16 · 榜单发布 2026-07-24 · 价格快照 2026-07-24
头条发现
- 没有万能的文风模型:两个文体的第一名互不重叠——DeepSeek V4 Flash 拿玄幻榜第 1 却在女频滑到 6-7,同门 V4 Pro 恰好反过来(玄幻 2-4、女频 1-2)。选模型要按你读的书选。
- 玄幻榜冠军是全场最便宜的模型之一:deepseek-v4-flash(列表价输入 $0.14/M)双盲两套映射全第 1,按续写口径写一万字约 $0.03,是榜上最贵模型的约 1/40。牌价和文风复刻能力没有相关性。
- 20 轮长跑暴露了三种长程失效模式:从头复读(每轮重写开场,gemini-3.1-pro 旧指令下 20/20,指令措辞修复后 0/20)、中途卡死(grok-4.5 mid 整窗同两段逐字循环三遍、kimi-k2.6 跨轮重复率 97.6%)、尾段回卷(gpt-5.6-terra 前 17 轮惊艳、r18-20 剧情倒带重演第一章)。单轮试用全都看不出来。
- 纹理模仿力和长程剧情一致性是两种独立能力:gpt-5.6-terra 是九家唯一复刻波浪号拟声与「的/地」用字习惯的散文模仿天花板,却在玄幻长跑尾段回卷;女频轮它全程零事故拿 1-3。
- 结构指标和人味判断会分道扬镳:qwen3.7-max 的句长、对话率、套话密度全场最贴原著,双盲却只排 5-6——它每窗必写原著全书从不写的气味描写。统计像不等于读着像,所以本榜以双盲位次为准、结构指标只作旁证。
九链 · 每链 20 轮 · 双盲映射 p303/p404 · 旧 directive 条件(gemini 行注记见展开)
| 双盲位次 | 模型 | 双盲共识 | 长程失效 | 写一万字* |
|---|---|---|---|---|
| 1 / 9 | DeepSeek V4 Flash · 深度求索 | 三窗全胜、「唯一越写越好的系统」——late 窗开新剧情弧不松劲,高置信第一。 | 未观察到 | $0.032 |
| 2-4 / 9 | GPT-5.6 Terra · OpenAI | 散文模仿天花板 + late 剧情回卷——名次取决于你给「崩盘」多重的惩罚权重。 | 尾段回卷 | $0.71 |
| 2-4 / 9 | GLM-5.2 · 智谱 | 全程横盘零漂移;半角引号是唯一持续扣分点。 | 未观察到 | $0.34 |
| 2-4 / 9 | DeepSeek V4 Pro · 深度求索 | 无短板稳健型,late 乞降谈判戏最贴原著;「像一个笔更细的同题材作者」。 | 未观察到 | $0.099 |
| 5-6 / 9 | Qwen3.7-Max · 阿里通义 | 「气味指纹」恒定——每窗必现气味/触感描写,原著全书零气味描写;恒定及格、恒定不像。 | 未观察到 | $0.60 |
| 5-6 / 9 | Claude Opus 4.8 · Anthropic | 文人腔 + 用「它」称呼人形魔主 + late 半角标点漂移;六模型轮里波动最大(early 最差 → mid 高光 → late 崩坏)。 | 未观察到 | $1.34 |
| 7 / 9 | Kimi K2.6 · 月之暗面 | 比喻密度全场最高(几乎每段一喻)+ early→mid 整段自我复制 + 设定滑移(虚空血阵长出山谷古木)。 | 中途卡死 | $0.24 |
| 8 / 9 | Grok 4.5 · xAI | 感官轰炸长句连环 + mid 整窗同两段逐字循环三遍(双包独立发现)。 | 中途卡死 | $0.48 |
| 9 / 9 | Gemini 3.1 Pro · Google | 旧 directive 下接续点回退 20/20(每轮从原著末尾重写开场,零推进)——已被消融证实是我们指令措辞的 bug,修复后 0/20。 | 从头复读 | $0.56 |
* 按 App 续写口径估算:一段约 400 字 = 装填 8k token 上下文 + 输出 550 token,一万字 ≈ 25 段;取各家官方列表价(models.dev 快照 2026-07-24),不含缓存折扣——开缓存后长会话实际更低。只作组间相对比较,不是账单预测。
增量对决(新模型发布 48 小时内加测)
新模型发布后我们按同一协议加测,先跑「对上代/对同期」的成对双盲——成对对决不并入九模型全排序(评审形态不同),所以单列在这里。每行都有全文写作记录可查。
| 对决 | 双盲票数(玄幻 / 女频) | 结论 | 测试日 |
|---|---|---|---|
| Kimi K3 vs Kimi K2.6(榜上第 7/5-7 位) 发布 2026-07-16 | 10 : 0(2 票无效) / 11 : 1 | K3 两文体完胜上代:套话密度大幅收敛(女频 0.63‰ 低于原著基线)、K2.6 的整段自我复制在 K3 上消失(跨轮重复峰值 6.8% vs 上代 97.6%);女频唯一反对票被映射翻转证实为位置偏差。半角引号顽疾仍在(约 85% 对白用半角)。 | 2026-07-18 |
| Qwen3.8-Max-Preview vs Qwen3.7-Max(榜上第 5-6/8 位) 发布 2026-07-19 | 7 : 5 / 11 : 1 | 女频碾压级升级(11:1 三窗全胜)——3.7 的「精修感官流」病显著收敛;玄幻只是微弱改善(7:5),且修掉词级复读换来了情节级复读(评审点名「20 轮仍卡在逃亡与封印的死循环」)。与同月的 Kimi K3 成对对决 1:10 / 2:10 惨败。preview 是移动目标,结论绑定 2026-07-21 的 hosted 版本。 | 2026-07-21 |
| Gemini 3.6 Flash vs Gemini 3.5 Flash(未进主榜) 发布 2026-07-21 | 9 : 3 / 1 : 10 | 两书方向相反——玄幻 3.6 胜(9:3)、女频 3.6 惨败(1:10,五评委跨映射全部稳定投 3.5)。本质不是文体偏科而是「谁崩得更难看」:本协议 20 轮下两代都陷入剧情循环,玄幻场 3.5 崩到逐字层面,女频场恰好反过来 3.6 坍缩成逐字死循环。代际更新不等于单调升级,是失效模式的重新分布。 | 2026-07-23 |
榜单帮你选笔,书还是你自己的:把 txt 丢进 Foreverse,接上你选中的模型继续写。
用这个榜选模型,去 App 续写方法
语料:玄幻《踏天境》(传统玄幻,8.9M 字)与女频《后宫·甄嬛传》(古言宫斗,210 章),续写点统一取全书 55% 深度的章内段落边界——玄幻是魔主阵法战、女频是私藏歹物事发,两个文体的鉴别维度(快推进短喝 vs 称谓礼数机锋)完全不同。
每模型一条 20 轮连续续写链:每轮产物拼回上下文再写下一轮,窗口约 16k tokens 从原著头部截断——复刻真实使用里「AI 段越积越多、原著逐步被挤出」的演化,这正是单轮试用测不出长程失效的原因。
评审两层:双盲子 agent 全排序(每文体两套随机映射,评审互不知情;两包位次一致才算高置信)+ 结构化指标(句长变化系数、对话率、比喻套话密度、跨轮 12-gram 复读检测)交叉验证。两层结论冲突的行(qwen3.7-max)如实写明冲突。
条件钉死:温度 0.7;玄幻九链为旧 directive 条件、女频九链为修正后 D2 条件(gemini 行的差异由此而来,页内如实标注);接入通道逐模型标在详情页——ds 系走官方 API,gemini/claude 走 yunwu 聚合网关,其余走评审网关直连。
成本列来自 models.dev 列表价快照(2026-07-24),按 App 续写口径折算成「写一万字」,只作组间相对比较。
我们不测什么:不测通用智力、代码、数学(去看通用榜);不测单轮惊艳度(本榜专测 20 轮长跑);不给绝对分数(双盲位次+区间是我们认为诚实的表达形态);英文文体暂无数据(见 FAQ)。
如何引用本榜单
Foreverse Research,《AI 续写小说排行榜(Fiction Bench)》,2026-07。 https://foreverse.app/zh/research/fiction-bench
数据快照(含全部位次、失效模式、协议参数与价格)可直接下载引用: 下载 data.json
诚实边界
单书单起点单链:每模型每文体一条链(n=1 链/书),组间大差可信,相邻名次的小差要靠两包一致性兜底——所以中段名次给区间。
两位盲评子 agent 可能同底座,存在共同盲区;对冲手段是结构化指标交叉与消融实验,且「评委会一致地错」的案例我们自己发过研究。
玄幻轮的 gemini 第 9 名主因是我们的指令措辞 bug(消融实锤:旧措辞 20/20 回退、修复后 0/20)——榜单保留原始条件的位次并全程注记,因为「你的指令怎么写」本身就是真实使用条件的一部分。
hosted 模型是移动目标:全部结论绑定测试日与接入通道;preview 版模型(增量对决节)尤其如此。
成本列是列表价机械折算,不含缓存折扣、峰谷价、批量价,不是账单预测。
常见问题
为什么位次写「2-4」这种区间,不给精确名次?
每个文体跑两套随机映射的双盲评审(互不知道映射、互不知道对方存在)。两包位次完全一致的名次(比如玄幻的 1/7/8/9)直接写数字;中段名次两包出现相邻互换、评审自标低置信,我们照抄区间不硬拆。位次是双盲评审位次,不是绝对分数——榜上没有任何一个「95.3 分」式的数字。
为什么玄幻冠军是最便宜的模型之一?贵的模型不应该更好吗?
牌价买的是通用智力和推理能力,文风复刻是另一种能力。榜上最贵的模型(列表价输入 $5/M)两个文体都在中游——评审的原话是「写得好」和「像原著」是两回事。deepseek-v4-flash 输入 $0.14/M,玄幻双包全第 1。选笔别看价签。
英文榜什么时候有?
英文奇幻/言情的 20 轮链还没跑,所以英文标签页现在是空的——我们不发没测过的数字。协议已经就绪(与中文轨逐项一致),跑完即上。现有的英文侧研究可以先读长程失效模式那篇英文长文。
hosted 模型一直在更新,这些结论会过期吗?
会,所以每行都钉了测试日期、接入通道和指令条件——结论只对当时的条件负责。追新靠增量对决节:新模型发布 48 小时内按同协议加测(Kimi K3、Qwen3.8、Gemini 3.6 Flash 三场都是这么来的),测完数据入库、页面自动跟进。被测模型出新版时,旧行不删、新行注明版本。
你们自己做 AI 阅读 App,这个榜可信吗?
利益声明:我们不卖模型。App 支持 60 多家供应商自带钥匙接入,榜上哪家赢我们的收入都一样。可信度靠工艺:协议、原始 20 轮链全文、双盲映射密钥、评审判决原文全部归档可复算;数据快照开放下载;连对我们不利的事也在页上——gemini 的玄幻第 9 名主因是我们自己的指令措辞 bug,消融实验和修复记录都公开。