Foreverse Research · Fiction Bench
Grok 4.6 写小说怎么样?
它没进九模型全排序榜,但代际信号是本管线迄今最强的:对前代 grok-4.5 玄幻 12:0、女频 12:0,十二份跨映射稳定裁决全部高置信——4.5 双文体垫底的两大死因(mid 逐字循环、女频第一人称失守)全部修复。对现任冠军两面:玄幻对 flash 原始 8:4、稳定 4:0 方向占优(不宣布换冠);女频对 pro 0716 快照 2:10 落败,新病灶「大纲体」——每轮约 150 字被评委读成叙事干瘪。写快节奏玄幻已进第一梯队,写婉转古言差一档密度。
对决记分卡(成对双盲,6 评委 × 两套映射翻转)
vs Grok 4.5 · 同厂前代 · 榜上玄幻第 8 / 女频第 9(双文体垫底)
玄幻《踏天境》
12 : 0
女频《甄嬛传》
12 : 0
测试日 2026-08-13
分窗玄幻 12:0/12:0/12:0、女频 10:2/12:0/12:0,十二份稳定裁决 confidence 全 high;前代 mid 逐字循环(r9-11 同 271 字 ×3)与女频意象泥潭(「菖蒲」21 次/19 轮)经机械核验成立,4.6 未复发。
vs DeepSeek V4 Flash(0716 快照) · 玄幻现任冠军 · 榜上第 1(该榜位测于 preview 快照,7/31 已被同 ID 热切)
玄幻《踏天境》
8 : 4(稳定 4:0)
女频《甄嬛传》
——(未对阵)
测试日 2026-08-13
本轮位置偏差浓度系列最高:4 评委 8 票在映射翻转下自相矛盾作废,稳定成分 4:0 投 4.6、零评委稳定投冠军。叠加对手链旧 directive 条件差,不宣布换冠,登记为「与冠军同档、稳定票方向占优」。
vs DeepSeek V4 Pro(0716 快照) · 女频现任冠军 · 榜上 1-2(该快照已被同 ID 热切;GA 后继 1:11 输给它,见其对决页)
玄幻《踏天境》
——(未对阵)
女频《甄嬛传》
2 : 10(强信号)
测试日 2026-08-13
5 评委跨映射稳定投冠军、零矛盾票(glm-5.2 一家稳定投 4.6,属品味分歧);败因五家同词「大纲体」——4.6 每轮约 150 字 vs 冠军约 475 字,而 4.6 是六条在场链中唯一全程守 80-220 字篇幅规范的。
它和榜上的模型是什么关系
头条是代际修复实证:M69 榜给 grok-4.5 建档的两大死因——mid 整窗逐字循环(r9-11 完全相同的 271 字 ×3)、女频第一人称密度只剩原著一半(5.2‰ vs gold 9.0)——在 4.6 的同协议复测里全部消失:跨轮 12-gram 峰值仅 2.8%(玄幻 r14)/ 2.1%(女频 r13),「我」密度回到 11.0‰ 与冠军持平;两书剧情逐轮核读均线性推进,女频链第一次推出了案发日。两书合计 24:0 且十二份稳定裁决全 high,超过此前 opus5 单场 12:0 的纪录。
对现任冠军两面读:玄幻场与 flash 同档(原始 8:4;本场位置偏差系列最高,4 评委 8 票作废后稳定 4:0 全投 4.6),女频场距 pro 一档(2:10 强信号)。它成了「没有万能的文风模型」的第三个偏科样本——flash 玄幻王、pro 女频王、4.6 玄幻强女频弱。半角引号伪影双书为零(K3/glm/opus-4.8 顽疾家族在 grok 系未出现),低对话率(玄幻 8.9% vs gold 16.1%)是真实行为不是检测假象。
新病灶「大纲体」带一个产品级悖论:4.6 是全场唯一逐轮守住 80-220 字篇幅规范的链,同样的 150 字/轮在玄幻场被评委读成「大白话高动作密度、完美契合」,在女频场被读成「叙事干瘪、丧失长篇质感」——spec 遵循与文体期待错位,选模型要按书选不按榜选。残留尾巴是意象级偏爱复用(「铁锈腥气」9 次、「井水」意象 5 轮),已从病降级为癖,且同一意象被一位评委夸有原著神韵、两位评委归入反复。
成本与延迟:官方牌价 $2/M 输入、$6/M 输出(缓存命中输入实测 $0.5,faster 档 ×2 未用),两链 40 轮实付 $2.0955(≈¥15)——牌价是国产模型的 3-10 倍,实付却是系列最低档(K3 轮 ¥12.21、opus5 轮 $12.54),原因就是每轮只写 150 字且 reasoning 单列计量。reasoning 占输出 token 的 95.5-95.6%,历届最高(K3 81-86%),单轮延迟 39-44 秒。「统计贴≠人味」再添反向一例:前代 g45 的女频 dist 0.259 全场最贴(好于冠军),盲评却被 12:0 通杀——病在逐字循环,八项均值测不出。
测试条件披露(hosted 模型是移动目标)
被测模型:grok-4.6(发布 2026-08-12)
评测执行:2026-08-13 · 接入通道:xAI 官方 API(reasoning 默认开)
评审形态:成对双盲判定(每书两套甲乙翻转映射对冲位置偏差),非九模型全排序
与 k3/opus5/gemini36 增量轮逐项一致(同两书 · 同 55% anchor · 同 D2 directive · 20 轮链 · 温度 0.7 · max_tokens=2800,xAI 的 reasoning 单列计量不占正文额度);评委池 deepseek-v4-pro 因本轮当对手回避,gemini-3.5-flash 按先例回位。
诚实边界
Grok 4.6 未参与九模型同协议全排序盲评,主榜的位次列对它不适用——本页只给有票据的成对对决记录,不虚构名次。它何时进全排序取决于下一轮主榜重跑。
成对盲评只对前代与两位冠军的归档快照,未进九模型全排序——与主榜名次不可跨榜硬比(评审形态不同:主榜=双盲全排序,本场=成对判定)。
玄幻场两条对手链为旧 directive 条件归档链(deepseek 系消融 0 回退证据对冲,严格说仍是混入变量);对手均为 2026-07-16 快照非同日重跑——女频冠军 0716 快照的同名现役模型已于 08-13 被热切为 0813(见 DeepSeek V4 Pro 0813 对决页)。
单书单链单锚点(每书 n=1);「女频大纲体」的锚点敏感性未测;grok-4.6 为发布约 24 小时的 hosted 目标,结论绑定 2026-08-13 的官方 API 行为。
价格:grok-4.6 未进 models.dev 列表价快照(capturedAt 2026-08-12),本页成本节如实缺省;官方牌价与逐轮实付见上方定位段与博文。
Foreverse 支持 60+ 家供应商自带钥匙接入——把你的书导进来,配上 Grok 4.6 接着写。
在 Foreverse 里用它续写如何引用
Foreverse Research,《Grok 4.6 写小说怎么样(Fiction Bench 增量对决)》,2026-07。 https://foreverse.app/zh/research/fiction-bench/grok-4-6