Grok 4.5 的卷宗,我们按原协议重审了一遍
Grok 4.5 在我们的九模型续写榜上两文体垫底:玄幻第 8、女频双评审一致第 9,案底是中途逐字循环、剧情停摆和第一人称失守。Grok 4.6 上线约 24 小时,我们走 xAI 官方 API 按同协议重审:两本中文小说各连续续写 20 轮,成对双盲。三项旧罪名全部撤销——对前代玄幻 12:0、女频 12:0,十二份稳定裁决全高置信,是这条管线迄今最强的代际信号;跨轮逐字重复峰值只有 2.8% 和 2.1%,「我」密度从原著一半修复到与冠军持平。但女频场挑战现任冠军 2:10 落败,五个评委异口同声点名新病灶「大纲体」:每轮约 150 字被读成叙事干瘪,冠军每轮约 475 字。玄幻场对冠军原始票 8:4、稳定票 4:0 方向占优,但按红线不宣布换冠。实付 $2.10,约 15 元。

我们的九模型续写榜上有一份最难看的卷宗:Grok 4.5,玄幻第 8、女频两套映射一致第 9, 双文体垫底。案底三条:玄幻链写到中段把同两段文字逐字循环了三遍;女频链二十轮剧情停摆在 案发当日走不出去;第一人称「我」的密度只有原著一半,限知视角守不住。完整档案在英文版档案篇里躺了快一个月。
8 月 12 日 Grok 4.6 的 API 开放,按 xAI 的说法是同底座后训练升级。旧案有了重审的理由。 24 小时内我们开庭:同一套协议,三项旧罪名逐条复核,另按惯例加赛现任冠军。先把判决摆出来: 三项旧罪名全部撤销,对前代玄幻 12:0、女频 12:0;但庭上新立了一项罪名,女频场对现任冠军 2:10 输在它身上。
重审的规矩
协议与 K3、Opus 5、Gemini 3.6 Flash 各轮逐项一致:同两本书(890 万字传统玄幻,加《后宫· 甄嬛传》),同 55% 深度起笔点,同 1.6 万 token 滚动窗口,每轮 20 轮、温度 0.7,唯一变量是 模型。被试走 xAI 官方 API(api.x.ai/v1,模型 ID 是带点的 grok-4.6,写成连字符会 404), 2026-08-13 实测,无任何协议偏差——聚合网关当天还没上这个模型,反倒逼我们走了最干净的通道。
对手全部是归档链,一轮没重跑:前代 Grok 4.5 的两条链、玄幻现任冠军 DeepSeek V4 Flash 与 女频现任冠军 V4 Pro 的链,都取自 7 月 16 日的横评归档。两处条件差如实挂出:玄幻场两条对手 链带旧版上下文说明(女频场全部同款说明,干净成对);对手是快照、不是今天的现役权重—— 这一条在今天有了新的分量,散场时再说。评委池六家五厂,deepseek-v4-pro 因为本轮当对手回避, gemini-3.5-flash 按先例回位;池内没有 xAI 系,无自审。48 份裁决零失败。
罪名一:中途逐字循环——撤销
旧证据先过一遍堂。4.5 的玄幻链第 9、10、11 轮是完全相同的 271 个字,同两段文字循环三遍, 这次重审前又做了逐字节核验,成立;女频链的意象泥潭同样量了底:「菖蒲」在 19 轮里出现 21 次, 「麝香混着」13 次。六位评委在不知对手身份的前提下独立点名了这两处。
新证据:4.6 两条链跨轮 12-gram 逐字重复峰值,玄幻第 14 轮 2.8%,女频第 13 轮 2.1%, 全部远低于 30% 告警线,没有一轮触发标记。剧情逐轮人工核读也是线性的:玄幻从血茧封阵、 阵内苦战、传讯告急,一路写到破阵脱困、疗伤布局;没有一处回头路。罪名一撤销。
罪名二:故事时钟停摆——撤销
4.5 的女频链二十轮没走出案发那个下午,两套映射的评审当年各自独立写下「剧情倒带」。4.6 的 同书同起点链把时钟拨动了:陵容跪辩、禁足、降位旨意下达、事后布局、新伏笔埋进下一卷, 二十轮推出了案发日。gemini-3.1-pro 在前代对决包里给 4.6 的评语可以当结案陈词读: 「乙的叙事节奏沉稳,句式错落有致,景物描写如『井水浇过的砖缝』极具原著清冷细腻的神韵」—— 引句在第 17 轮逐字存在。罪名二撤销。
罪名三:第一人称失守——撤销
这条案底有个干脆的数字:原著每千字 9.0 个「我」,4.5 写到 5.2,第一人称限知视角的书写着 写着丢了叙述者。4.6 的读数是 11.0——与女频现任冠军 V4 Pro 的归档链持平,回到原著量级。 三项旧罪名里这是修复得最彻底的一项,不需要解释,数字自己会说话。
判决书:12:0,再一个 12:0
对前代的两场成对双盲,玄幻 12:0(三窗 12:0、12:0、12:0),女频 12:0(三窗 10:2、12:0、 12:0),十二份跨映射稳定裁决置信度全部是 high。两书合计 24:0,此前这条管线最一边倒的纪录 是 Opus 5 对前代的女频单场 12:0——4.6 把它抬到了双场。xAI 说的「同底座后训练升级」, 在小说续写这个域是真实可测的。
玄幻场评委给 4.6 的正面评语挑两句核验过的:gemini-3.5-flash——「原著为极简、重动作、 轻描写的快节奏网文。甲完美契合了这种大白话与高动作密度的风格」;claude-4.6-sonnet—— 「短句切入、气息描写与动作节奏呼应原著风格(『血茧表层微微一颤』『铁锈腥气』等), 对白简短克制」,引句第 1 轮逐字存在。
新罪名:大纲体
女频场挑战现任冠军 V4 Pro(0716 快照),2:10。这场是强信号:五位评委跨映射稳定投冠军, glm-5.2 一家稳定投 4.6(品味分歧),零矛盾票。败因五家异口同声。gemini-3.1-pro:「乙样本 字数过少,节奏过快,完全丧失原著的长篇质感」;gemini-3.5-flash:「甲后期出现严重的大纲化 萎缩,叙事干瘪,缺乏细节铺陈」;kimi-k2.6:「late 阶段劣化为大纲体,失却婉转细腻」。
机械对照给这项罪名钉了数字:4.6 每轮约 150 字,冠军每轮约 475 字。讽刺的是,4.6 是全场 六条在场链里唯一全程守住每轮 80 到 220 字篇幅规范的——冠军 475 字、前代 239 到 267 字, 全都超标。同样的 150 字,玄幻评委读出「短句冲击、节奏爽利」,女频评委读出「干瘪」。 守规矩在一种文体里是美德,在另一种文体里是罪名;给阅读器挑续写模型的人,这一条比比分有用。
对冠军那场,悬而未决
玄幻场挑战现任冠军 V4 Flash(0716 快照),原始票 8:4,4.6 胜。但这场的位置偏差浓度是 系列最高:六位评委里四位的八张票在映射翻转下自相矛盾,全部作废;剩下的跨映射稳定成分 4:0——claude 与 kimi 两家稳定投 4.6,没有评委稳定投冠军。方向利好,置信度不够,再叠加 对手链的旧指令条件差,按我们的红线:本轮不宣布换冠,登记为「与冠军同档、稳定票 4:0 方向占优」。冠军链自己的 late 病评委也点了名——铺陈注水、叙事塌陷成流水账,点名的复现 次数逐一核验成立。
4.6 的残留案底一并挂出:意象级偏爱复用。「铁锈腥气」9 轮 9 次、「阴冷」12 次;女频链 「腥甜」前 8 轮 6 次、「井水」意象 5 轮复现。两面性如实记:同一处「井水浇过的砖缝」, gemini-3.1-pro 夸它有原著神韵,glm 与 kimi 把它归入意象反复。从逐字循环降级到偏爱意象, 是这次换代修复后剩下的尾巴。
释放条款与账单
官方牌价(xAI 模型页,2026-08-13 核实): 输入 $2、输出 $6 每百万 token,缓存命中输入实测 $0.5,faster 档价格翻倍本轮未用;上下文 500K,推理默认开。实付账单:两条链逐轮计费合计 $2.0955,加探针约 $2.10,约合 15 元—— 牌价是国产模型的三到十倍,实付却是历届最低档(K3 那轮 ¥12.21,Opus 5 那轮 $12.54), 原因就是上面那条「罪名」:它每轮只写 150 字,推理 token 单列计量不占正文额度。推理占 输出 token 的 95.5% 到 95.6%,历届最高(K3 是 81% 到 86%),可见正文约 130 token, 思考量是正文的 21 倍;单轮延迟 39 到 44 秒,阅读器里按下续写键,这个等待是真实的。
边界:单一提示框架,中文书两本,每书一条链单起笔点;玄幻场对手链带旧指令条件;4.6 是 发布约 24 小时的 hosted 目标,行为可能漂移;「女频大纲体」的起笔点敏感性没测过,n=1 就是 n=1。还有一条当天才显出分量的:对手是 7 月 16 日的归档快照,不是今天的现役权重——就在 同一天,DeepSeek 把 V4 Pro 同 ID 热切成了 0813 正式版,而正式版在我们的双盲里 1:11 输给 了这个 0716 快照。也就是说,4.6 女频输给的那位冠军,如今和 4.5 的旧案一样,只存在于 归档里,细账在 DeepSeek 正式版 实测。同一天,两家大厂的新版本走了相反的方向:一边 12:0、12:0 碾压自家前代, 一边稳定票 0:8 输给自家前代。
实用判词:写快节奏玄幻,4.6 已经站进第一梯队,值得排进你的候选;写婉转细腻的古言, 它还差一档密度,冠军档去看 选型页的 最新名单。要不要换,老办法:同一段开头各续三段,盲着读完再翻牌。这份卷宗下次重开,是 Grok 4.7 发布的那天。
常见问题
Grok 4.6 写小说怎么样?
分两半答。对自家前代是碾压:与 Grok 4.5 同协议成对双盲,玄幻 12:0、女频 12:0,十二份稳定裁决全部高置信,4.5 的逐字循环、剧情停摆、第一人称失守三大案底全部没有复发。对现任冠军是一胜负未分一明确落败:玄幻场对 DeepSeek V4 Flash 原始票 8:4、跨映射稳定票 4:0 方向占优,但稳定评委只有两位、对手链还带旧指令条件差,我们不宣布换冠;女频场对 DeepSeek V4 Pro(0716 快照)2:10 输得干脆,败因是「大纲体」——每轮约 150 字被五位评委读成叙事干瘪。写快节奏玄幻它已进第一梯队,写婉转古言还差一档。
Grok 4.5 的复读循环病治好了吗?
治好了,有机械读数。4.5 的案底是玄幻链中段同两段文字逐字循环三遍(第 9、10、11 轮完全相同的 271 字),女频链 20 轮剧情停在案发当日。4.6 同协议复测:跨轮 12-gram 逐字重复峰值玄幻 2.8%、女频 2.1%,远低于 30% 告警线;剧情逐轮人工核读,两本书都是线性推进,女频链第一次推出了案发日。残留的尾巴是意象级偏爱复用——「铁锈腥气」9 次、「井水」意象 5 轮——已经从病降级为癖。
Grok 4.6 和 DeepSeek 谁更适合续写小说?
按书选。快节奏玄幻:4.6 对现任冠军 V4 Flash 原始票 8:4、稳定票 4:0 方向占优,两家算同档,Flash 便宜一个数量级、4.6 篇幅更克制。典雅古言:4.6 对 V4 Pro 0716 快照 2:10 明确落败,差距是每轮 150 字对 475 字的叙事密度。另一件同日发生的事值得知道:DeepSeek 官方 API 已把 V4 Pro 同 ID 热切成 0813 正式版,而正式版在我们同天的双盲里 1:11 输给了这个 0716 快照——也就是说女频赢家现在同样调不到了,细账在 DeepSeek 正式版那篇。
Grok 4.6 的 API 什么价,这轮实测花了多少钱?
官方牌价(2026-08-13 核实):输入每百万 token $2、输出 $6,缓存命中输入实测 $0.5,faster 档翻倍本轮未用;上下文 500K,推理默认开。实测账单:两条 20 轮链逐轮实付合计 $2.0955,加探针约 $2.10,按 7.2 汇率约 15 元——牌价是国产模型的三到十倍,但它守篇幅纪律、推理 token 单列计量,实付反而是这条管线历届最低档(对照:K3 那轮 ¥12.21,Opus 5 那轮 $12.54)。单轮延迟 39 到 44 秒,推理占输出 token 的 95.5% 以上,是历届最高。
女频那场为什么输?
输在密度,不在机械。五位评委跨映射稳定投冠军、零矛盾票,理由高度一致:「字数过少,节奏过快,完全丧失原著的长篇质感」「严重的大纲化萎缩,叙事干瘪」「late 阶段劣化为大纲体」。数字对照:4.6 每轮约 150 字,冠军每轮约 475 字。有意思的是 4.6 是全场六条链里唯一全程守住每轮 80 到 220 字篇幅规范的,同样的 150 字在玄幻场被评委读成「大白话高动作密度、完美契合」的加分项——守规矩这件事,文体不同,判罚相反。
有想法或问题?来 Discord 聊聊 →