Foreverse Research · Fiction Bench
Gemini 3.6 Flash 写小说怎么样?
两本书方向相反:玄幻 9:3 胜上代 3.5 Flash,女频 1:10 惨败(五评委跨映射全部稳定投 3.5)。本质不是文体偏科,是「谁崩得更难看」——本协议 20 轮下两代 flash 都陷入剧情循环,玄幻场 3.5 崩到逐字层面,女频场恰好反过来是 3.6 坍缩成逐字死循环。代际更新不等于单调升级,是失效模式的重新分布。
对决记分卡(成对双盲,6 评委 × 两套映射翻转)
vs Gemini 3.5 Flash · 同厂上代 · 未进主榜
玄幻《踏天境》
9 : 3(12 票)
女频《甄嬛传》
1 : 10(11 票)
测试日 2026-07-23
玄幻 9:3 里跨映射稳定的成分是 3:0 加 6 张摇摆票(中等信号);女频五评委跨映射全部稳定投 3.5(强信号)。
它和榜上的模型是什么关系
主榜的 gemini 系数据点是 gemini-3.1-pro:玄幻第 9 已被消融证实主因是我们自己的指令措辞 bug(修复后 0/20 回退),女频修复条件下 4-6 名。本场补的是 flash 档数据点:两代 flash 在修正后的 D2 指令下仍大面积循环——D2 修复的是「AI 段可跳过」的措辞误读,flash 档的循环是模型长程能力问题,提示词治不了。
四条链三条崩,且两代的崩法不同:3.6 玄幻链机械指标全绿但语义级剧情倒带(同一「发现魔主」桥段以不同措辞重演 6-7 次,r18 已把魔主轰退、r19 又回到「刚发现」);3.5 玄幻链逐字复制(两轮 100% 重复,实质剧情停在「闯阵」瞬间);3.6 女频链渐进坍缩成逐字死循环(重复率 33%→64%→73%→92%→100% 单调爬升);3.5 女频链间歇重放。评委点名与机械检测逐项吻合,无幻觉指控。
flash 档的定位是速度/价格位,不是质量位:3.6 每轮延迟约为 3.5 的一半(6.3s vs 12.5s),牌价 $1.5/$7.5 每百万 token;但两书对话率都显著低于原著(7.8% / 27.1%,原著 16.1% / 48.8%),结构指标不及 kimi-k3 与 deepseek 冠军档。
测试条件披露(hosted 模型是移动目标)
被测模型:gemini-3.6-flash(发布 2026-07-21)
评测执行:2026-07-23 · 接入通道:评审网关(OpenAI 兼容聚合通道,非 Google 官方直连)
评审形态:成对双盲判定(每书两套甲乙翻转映射对冲位置偏差),非九模型全排序
与 qwen3.8 增量轮逐项一致(同两书 · 同 55% anchor · 同 D2 directive · 20 轮链 · 温度 0.7 · max_tokens=6000);评委池 gemini-3.5-flash 因当被试由 kimi-k2.6 补位。
诚实边界
Gemini 3.6 Flash 未参与九模型同协议全排序盲评,主榜的位次列对它不适用——本页只给有票据的成对对决记录,不虚构名次。它何时进全排序取决于下一轮主榜重跑。
接入通道是评审网关聚合转发,非 Google 官方直连;3.6-flash 是发布 48 小时内的托管目标,结论绑定 2026-07-23 的网关行为。
对手 3.5 Flash 未进主榜,本场没有可参照的在榜位次;gemini 系在主榜的数据点是 3.1-pro(pro 档,不能代读 flash 档)。
评委池变更:k3/qwen3.8 轮评委含 gemini-3.5-flash,本轮它是被试、由 kimi-k2.6 补位——跨轮票数比较时注意此差异。
循环病的场景敏感性(玄幻 3.6 干净、女频 3.6 崩)无法区分「书的差异」与「起点运气」——每书 n=1 链。
写一万字要多少钱
$0.40 列表价 输入 $1.5/M · 输出 $7.5/M(models.dev 快照 2026-07-24)
按 App 续写口径:一段约 400 字 = 8k token 装填 + 550 token 输出,一万字 ≈ 25 段,不含缓存折扣。只作组间相对比较。
Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 Gemini 3.6 Flash 接着写。
在 Foreverse 里用它续写如何引用
Foreverse Research,《Gemini 3.6 Flash 写小说怎么样(Fiction Bench 增量对决)》,2026-07。 https://foreverse.app/zh/research/fiction-bench/gemini-3-6-flash