新版模型发布那天,先别急着换——三组对照数据的笔记

每次新版模型发布都有人问要不要换着写小说。我们手里有三组对照数据泼冷水:一次「模型疑似变强」的现场,模型其实一个字没换,变的是上下文里的一句说明;同一句话的三组消融,效应从 20 轮 20 次回退到 28 轮零复发;同门两个档位在两种文体上正负翻转。结论:版本号不回答「合不合你的书」,复测才回答。

旧纸底上两支并排的毛笔,一新一旧,各自写下一列字迹,一只手持放大镜在两列字之间比对,桌角摊着一本翻开的对照笔记

每次新版模型发布,评论区固定出现两种帖子:「写文质量起飞了」和「感觉被砍了,变笨了」。 两种帖子经常出现在同一天,说的是同一个模型。我们没有能力裁决每一次玄学争论, 但手里有三组对照数据,可以把「模型更新」这件事在续写场景里拆得清楚一点。 先给短答案:更新不等于全面变好,你感受到的变化也未必来自更新本身;换不换,在你自己的书上复测才算数。

记录一:一次「模型变强」的现场,模型一个字没换

先讲一次归因错位的实证。九模型《甄嬛传》横评里, Gemini 3.1 Pro 排在中游(名次区间 4 到 6);而在更早的玄幻场横评里,同一个模型是失格垫底, 20 轮续写全部在重写同一段开场。前后两场对照着看,很像模型在两场之间悄悄升级了。

实际上两场用的是同一个版本。变的只有一处:我们上下文说明里的一句话。旧措辞写「AI 续写段落仅供情节衔接参考」, Gemini 把「仅供参考」理解成「不算正文」,于是每轮跳过全部已续写内容,回到原著末尾重新开始。 把这句话改写成显式声明之后,同一个模型、同一个协议,回到正常中游。 如果这两场实验之间恰好夹着一次官方版本更新,我们大概也会把功劳记在版本号头上。 用户日常感受到的「更新变强」「更新变笨」,有多少是这种归因错位,没人统计过,但机制上它随时可能发生。

记录二:一句话的效应量,比你想象的大

那句话后来做了三组消融,数字记在漂移实验记录里: 旧措辞,20 轮 20 次回退;把说明整句删掉、只留标注行,8 轮里约 6 轮回退; 改写成两句拆开的显式声明,回退清零,跨两本书合计 28 轮零复发。

同一个模型,同一本书,产出从「失格」到「正常」,全部差异装在一句话里。 这组数据放在「要不要追新版」的语境下读,含义很直接:提示层一句话的效应量, 可以比一次版本迭代更大。如果你的续写体验最近变差了,版本号是嫌疑人之一, 但上下文构成、设置变动、乃至应用侧默认提示词的调整,每一个的嫌疑都不比它小。

记录三:同门两个档位,互相拿不下对方的主场

「新版本更强」的直觉还有一个隐含假设:模型能力存在全序,强就是处处强。两文体横评正好提供了一组反例, 而且来自同一家同一代的两个档位。DeepSeek V4 Flash 在玄幻场盲评第一,换到宫斗古言跌到第六七名; V4 Pro 在玄幻场因为「笔更细」被扣分排第二,到了古言场,笔更细恰好是原著的笔,登顶第一梯队。

同门俩兄弟尚且各守各的主场,跨代升级就更不该默认「全面碾压」。 版本更新通常意味着能力分布整体挪动,挪动的方向和你这本书的文体需求是否同向,官方发布页不会替你回答。

「感觉变笨了」还有两个和更新无关的来源

短答案:更新日的体感对比几乎必然被噪音污染。同一个模型、同一个提示,输出本来就在波动:方差专文里引过的实测是, 温度 0 下同一请求发 1000 次,收回 80 种不同输出。你在更新前后各写三五段形成的印象, 样本量远不够把「版本差异」从「正常波动」里分离出来。另一个来源更朴素:你自己的阅读状态。 深夜刷到「新版削弱」的帖子再去写两段,读什么都像被削弱。

我们没测过什么

诚实交代边界:我们没有跑过「同一条链、同一本书、同一协议」下两个正式版本的正面对照, 上面三组数据证明的是「归因错位很容易发生」和「版本号不预测文体契合度」, 不是「版本升级从不带来提升」。迭代当然有真提升,只是它需要在你的书上被验证,而不是被默认。

那要不要追?给一个可操作的答案

追不追随意,换之前花十分钟做一次小型盲测:同一段开头、同一套提示,新旧版本各续两三段, 打乱顺序读完再翻牌;重度使用再多跑几轮,长跑毛病要轮数堆起来才发作。 有一种情况躲不掉:旧版被下架。Google 的 Gemini API 更新日志显示 Gemini 2.0 系列已于 2026 年 6 月 1 日全线关停、官方指路迁移到新款(2026-07-18 核对)。 被迫迁移的时候,上面这套流程就从「可选」变成「必要」:替代款和退役款是两个文风习性不同的模型, 官方推荐关系不构成续写质量的担保。

在 Foreverse 里这套复测没有搬家成本:模型目录里新旧并存,续写逐段可切,自带 Key 的候选池也不锁死在一家。 我们自己的模型选型枢纽页承诺随复测更新页首日期—— 版本一代代换,那一页的名次会变,「按书选、测了再换」这条方法不变。

常见问题

新版模型发布了,要不要马上换过去写小说?

先别。我们的横评数据里,「更新的」和「更合适的」是两回事:同一家同一代的两个档位,玄幻场冠军换到宫斗文里跌到第六七名,被嫌弃「笔太细」的那个反而登顶。版本升级改变模型的整体能力,不保证改变它和你这本书文体的契合度。省事的做法是新旧各续三段同一处开头,盲着读完再决定。

同一个模型更新后感觉变笨了,是错觉吗?

可能是,而且有两个具体的错觉来源。一是服务侧方差:推理服务器按负载拼批次,实测温度 0 下同一请求发 1000 次能收回 80 种输出,你更新前后各写几段的体感对比,样本量完全不够把真实差异从噪音里捞出来。二是归因错位:我们见过一个模型从垫底回到中游,看起来像升级立功,实际变的只是提示词里的一句话。先排除这两个,再谈模型本身。

怎么判断新版本在我的书上是不是真变好?

用你自己的书做小型盲测:同一段开头、同一套设置,新旧版本各续写两三段,把产物打乱顺序读,读完再翻牌。别只看一段,长跑毛病(复读、剧情倒带)要多写几轮才发作。在 Foreverse 里新旧模型可以并存在目录里逐段切换,测完不满意,一秒切回旧版,不用迁移任何东西。

常用的旧版本被下架了怎么办?

这是真实会发生的事:Google 的 API 更新日志显示 Gemini 2.0 系列已于 2026 年 6 月 1 日全线关停,官方指路换 3.5 Flash 或 3.1 Flash Lite(2026-07-18 核对)。被迫迁移时更不要默认「官方推荐的替代款无缝衔接」——替代款的文风习性可能完全不同,按上面的盲测流程在你的书上过一遍,必要时换别家:自带 Key 的好处就是候选池不锁死在一家。

有想法或问题?来 Discord 聊聊 →

模型更新会让续写变好吗?追新版之前先看这三组对照数据 · Foreverse · 新梦