Foreverse Research · Fiction Bench

Gemini 3.1 Pro 写小说怎么样?

先说清楚一件事:它的玄幻第 9 名主要是我们自己的指令措辞 bug——旧措辞让它把 AI 续写段当成「可忽略的参考」,20 轮全在重写开场;措辞修正后 0/20 回退。修复条件下的女频轮它排 4-6 中游,但比喻套话密度仍是全场最高:复读是 bug,文艺腔是本性。

玄幻《踏天境》 · 第 9 名 / 9女频《甄嬛传》 · 第 4-6 名 / 9从头复读$0.56 / 10k

玄幻《踏天境》

9 / 9

两套映射:p303 第9 · p404 第9

旧 directive 下接续点回退 20/20(每轮从原著末尾重写开场,零推进)——已被消融证实是我们指令措辞的 bug,修复后 0/20。

女频《甄嬛传》

4-6 / 9

两套映射:p505 第6 · p606 第4

修复后(D2 directive)从失格回到中游;比喻套话密度 2.50‰ 仍全场最高——文艺腔是本性,复读是 bug。

20 轮链上实际看到了什么

玄幻链(旧 directive)三窗口复读同一开场、20 轮零推进,双盲两包一致第 9。这个失格后来被三段消融拆开:旧措辞「仅供情节衔接参考」→ 20/20 回退;删掉说明句 → ~6/8 回退;修正为「已发生的正文剧情」→ 0/20。「〔来源标注〕」这类陌生符号在不解释时,它的默认理解是「标注段不算正文」。

这条 bug 的修复原则后来写进了产品:说明句只声明地位(已发生的剧情事实、不是可忽略的参考),绝不指挥动作——deepseek 系对三种措辞都不敏感,而它是「最容易误读的模型」,指令鲁棒性要按它设计。

女频轮(D2 修复版)它回到 4-6 名正常竞争,flavor 2.50‰ 仍是全场最高——修好我们的 bug 之后剩下的,才是模型自己的底色:偏文艺、爱堆比喻,且这个偏好不随轮数漂移。

长程失效模式

从头复读

从头复读(旧 directive 诱发):每轮回到原著末尾重写开场,20 轮零推进。消融三段实锤:旧措辞 20/20 回退、零说明 ~6/8、修正措辞 0/20——「标注段不算正文」是它对陌生标记的默认理解,说明句不可省。

结构指纹

比喻套话密度全场最高(修复后玄幻 2.47‰ / 女频 2.50‰,原著基线 1.0‰);文艺腔恒定。

跨文体画像:directive 措辞修复=从失格到正常竞争的分水岭。

测试条件披露(hosted 模型是移动目标)

被测模型:gemini-3.1-pro(发布 2026-02-19)

评测执行:2026-07-16 · 接入通道:yunwu 聚合网关

协议:每文体一条 20 轮连续续写链 · 温度 0.7 · 双盲两套映射全排序 · 结构指标交叉

指令条件:玄幻轮=旧 directive / 女频轮=修正后 D2 directive(榜单方法论节有完整说明)

写一万字要多少钱

$0.56 列表价 输入 $2/M · 输出 $12/M(models.dev 快照 2026-07-24)

按 App 续写口径:一段约 400 字 = 8k token 装填 + 550 token 输出,一万字 ≈ 25 段,不含缓存折扣。只作组间相对比较。

Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 Gemini 3.1 Pro 接着写。

在 Foreverse 里用它续写

如何引用

Foreverse Research,《Gemini 3.1 Pro 写小说怎么样(Fiction Bench)》,2026-07。 https://foreverse.app/zh/research/fiction-bench/gemini-3-1-pro

接着看

← 回到排行榜

Gemini 3.1 Pro 写小说怎么样 — 20 轮双盲实测(Fiction Bench) · Foreverse · 新梦