Foreverse Research · Fiction Bench

Claude Opus 4.8 写小说怎么样?

写得好,但不像。两文体它都在中游(玄幻 5-6、女频 4-5),女频评审甚至说它的对话机锋全场最锋利——可文人腔、给人形魔主用「它」这种称谓错位、late 窗递增的半角标点,都在提醒你这是另一位作者。榜上最贵的模型写不出最像的续章。

玄幻《踏天境》 · 第 5-6 名 / 9女频《甄嬛传》 · 第 4-5 名 / 9未观察到$1.34 / 10k

玄幻《踏天境》

5-6 / 9

两套映射:p303 第6 · p404 第5

文人腔 + 用「它」称呼人形魔主 + late 半角标点漂移;六模型轮里波动最大(early 最差 → mid 高光 → late 崩坏)。

女频《甄嬛传》

4-5 / 9

两套映射:p505 第4 · p606 第5

「机锋内容全包最锋利」但工艺型劣化(半角标点递增 + 人名位分漂移)。

20 轮链上实际看到了什么

六模型轮里它是波动最大的一家:early 文艺腔最重(「一抹极淡的弧度」「宛如沉睡的宇宙」)→ mid 高光(斩杀戏单场可排第 3)→ late 半角标点系统性崩坏。九模型扩容轮排 5-6,另加一条称谓错位:用「它」称呼人形魔主。

女频 4-5:「机锋内容全包最锋利」,但劣化是工艺型的——半角标点随轮数递增、人名位分写法漂移。

它和 qwen3.7-max 是一对镜像教材:qwen 是统计像气质远,它是笔力强指纹错。两个都证明「写得好」和「像原著」是两回事——文风复刻测的是后者。

长程失效模式

未观察到

无三分类学意义上的长程失效;late 窗的半角标点漂移属于工艺劣化而非剧情失效。

结构指纹

深 V 曲线:early 文艺腔最重(「一抹极淡的弧度/宛如沉睡的宇宙」)→ mid 高光(斩杀戏可排第 3)→ late 半角标点系统性崩坏。

跨文体画像:中游稳定;「写得好」与「像原著」两回事的代表。

测试条件披露(hosted 模型是移动目标)

被测模型:claude-opus-4.8(发布 2026-05-28)

评测执行:2026-07-16 · 接入通道:yunwu 聚合网关

协议:每文体一条 20 轮连续续写链 · 温度 0.7 · 双盲两套映射全排序 · 结构指标交叉

指令条件:玄幻轮=旧 directive / 女频轮=修正后 D2 directive(榜单方法论节有完整说明)

写一万字要多少钱

$1.34 列表价 输入 $5/M · 输出 $25/M(models.dev 快照 2026-07-24)

按 App 续写口径:一段约 400 字 = 8k token 装填 + 550 token 输出,一万字 ≈ 25 段,不含缓存折扣。只作组间相对比较。

Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 Claude Opus 4.8 接着写。

在 Foreverse 里用它续写

如何引用

Foreverse Research,《Claude Opus 4.8 写小说怎么样(Fiction Bench)》,2026-07。 https://foreverse.app/zh/research/fiction-bench/claude-opus-4-8

接着看

← 回到排行榜

Claude Opus 4.8 写小说怎么样 — 20 轮双盲实测(Fiction Bench) · Foreverse · 新梦