DeepSeek V4 Pro 正式版上线两小时,我们安排它挑战卫冕冠军——它自己的旧版
DeepSeek V4 Pro 正式版(0813)官宣当晚一到两小时内,我们按九模型横评同一套协议做了增量实测:两本书各连续续写 20 轮,与自家 preview 前代(0716 快照)成对双盲。女频《甄嬛传》场 1:11(跨映射稳定票 0:5)、玄幻场 3:9(稳定 0:3);挑战玄幻现任冠军 V4 Flash 0716 快照的第三场也是 3:9。败因是「现代文艺化」漂移:高武玄幻写成低武武侠,甄嬛体写成现代疼痛文学,「像」字系比喻密度是前代 2.2 倍,皇后居所写成电视剧设定「景仁宫」6 次。机械层反而全干净:40 轮零逐字循环、零半角引号。比比分更要紧的发现:官方 API 不换 ID 热切权重,同一个 deepseek-v4-pro 字符串,7 月与 8 月是文风判若两人的两个模型——榜上的冠军已经调不到了。全实验成本约 5 元。

8 月 12 日深夜,DeepSeek 官方更新日志上线 V4 Pro 正式版,原话是「调用方法不变,使用 deepseek-v4-pro 即可调用最新版本」。一到两个小时后,我们把它拉上了擂台。对阵卡有点罕见: 挑战者是刚上线的正式版(定价页版本行写作 DeepSeek-V4-Pro-0813),卫冕方是它自己的 preview 旧版——我们榜单上的女频现任冠军,7 月 16 日测的 0716 权重快照。三场打完, 比分逐场记:女频《甄嬛传》1:11,玄幻对旧版 3:9,加赛挑战玄幻现任冠军 V4 Flash(同为 0716 快照)也是 3:9。卫冕方三场全胜。
而这位卫冕成功的冠军,已经不在场上了。GA 沿用同一个模型 ID 热切了权重,preview 没有留下任何带日期后缀的调用入口。冠军赢下了卫冕战,然后从 API 里消失。
赛制:对手是录像,协议一个字没动
协议照抄我们从九模型横评一路沿用到 K3、Opus 5、Gemini 3.6 Flash 各轮的那套:同两本书 (890 万字传统玄幻,加《后宫·甄嬛传》),同一个约 55% 深度的起笔点,同 1.6 万 token 滚动窗口,每轮产物拼回上下文再写下一轮,各 20 轮,温度 0.7,唯一变量是模型。评测走 DeepSeek 官方 API(api.deepseek.com/v1),2026-08-13 凌晨 00:36 到 01:20,GA 官宣后 一到两小时,全程平峰时段。
对手侧全部复用历史归档链,一轮没重跑——女频场对手链本来就是现行上下文说明条件下生成的, 天然成对;玄幻场两条对手链是旧版说明条件(当年九模型横评的原始材料),严格说混进了措辞变量。 接受这个混入有依据:三种说明措辞的消融实验里 DeepSeek 系全部零回退不敏感,且本轮正式版新链 40 轮无一处接续点回退。如实登记,不藏在脚注里。
评委六家五厂(claude-4.6-sonnet、gemini-3.1-pro-preview、gemini-3.5-flash、kimi-k2.6、 qwen3.7-max、glm-5.2),每场两套甲乙翻转映射。有一处池变更必须说明:deepseek-v4-pro 本来是评委池成员,这轮它是被试,按先例换成 gemini-3.5-flash 补位——被试两侧都是 DeepSeek 系而池内已无 DeepSeek 评委,自审和同厂偏好都不存在。36 份裁决零失败。
第一场,女频主场:1 比 11
冠军的主场没有悬念。原始票 1:11,按 early、mid、late 三窗分别是 1:11、2:8(平 2)、1:11; 剔除在映射翻转下自相矛盾的位置偏差票后,跨映射稳定票 0:5——五个评委稳定投旧版,没有一个 稳定投正式版。这是本轮三场里信号最强的一场。
败因四家评委独立点到同一处。qwen3.7-max 的原话:「甲陷入现代疼痛文学式的比喻堆砌,文风矫情, 且甄嬛亲探暴室严重 OOC」;gemini-3.1-pro 对照着夸旧版「极好地还原了流潋紫的『甄嬛体』风格」, 再补一刀「甲辞藻过度诗意化,情节跳跃,缺乏原著的从容与细密感」。量化口径能对上:正式版链的 「像」字系比喻密度每千字 7.36 次,旧版 3.35,原著续写窗口 0 次——「像一只垂死的蝶」「像团被 揉碎的烟罗」「像细小拳头擂着人心」,这些句子放进现代言情不违和,放进甄嬛体就是换了个作者。
剧情层还有一处软失效:暴室探监这场戏从第 10 轮滞留到第 19 轮,前后约 10 轮没走出这个场景, 模型甚至自己写出「她又低声重复」。跨轮逐字重复率量出来只有 1.8% 的峰值,机械检测抓不到它, 评委独立点名了它——「场景驻留」这个失效形态在我们的三分类学之外,先记档。
专名记忆探针这轮也更系统地翻了车。正式版把皇后居所写成「景仁宫」6 次:那是电视剧的设定, 小说正文 0 次(全书唯一一次出现在 99.8% 深度、书尾附的下一部预告章里),流潋紫笔下的皇后 住所是昭阳殿,全书 67 次。续写窗口里皇后居所名一次都没出现过,这 6 处景仁宫全部来自参数 记忆——底层记忆偏电视剧。K3 在同一根探针上 只错过 1 次。
第二、三场,玄幻:两个 3 比 9
对旧版 3:9,稳定票 0:3;对玄幻现任冠军 V4 Flash(0716 快照)3:9,稳定票 1:4。输冠军还能 解释成档位分工——Pro 在原榜玄幻本来就排 2-4,Flash 才是第 1——两本书都输给自家前代, 这个没法解释成分工。
玄幻场的病和女频同源不同貌。三家评委独立点名「高武设定降维」:一个宇宙主宰级的人物,late 窗被写成涉溪水、林间避雨、荧光石照明、听夜鸟惊飞的野外潜行。gemini-3.5-flash 的裁决原话: 「甲样本在后期(late)出现了严重的文风偏离,写成了武侠/传统玄幻的细腻写景风(溪水、古木、 荧光石、夜鸟),与原著的宇宙主宰科幻玄幻风严重割裂」——四个意象逐字命中正式版第 16 到 19 轮。 qwen3.7-max 更直接:「主宰涉溪水」的低武画风突变。
少数派意见照登。claude-4.6-sonnet 是全场唯一跨映射稳定投正式版的评委,理由是「甲全程保持 原著短促句式、动作与感知交织的叙事密度、克制内敛的对白腔调及强烈的现场临场感」——与其余 五家相左,属品味分歧,不属位置偏差。另一处如实记:kimi-k2.6 三组对决全部摇摆,6 票全废, 这轮位置偏差浓度偏高,稳定票口径因此比原始票保守得多。
与半个月前的 Opus 5 增量轮对照很说明问题: Opus 5 也「变文艺」,方向是古典向,女频场 12:0 通吃;正式版的文艺化是现代向,女频场 1:11 被杀。同一个动词,两个方向,两种命运。
记分卡:统计又和人味分了家
与原著结构画像的综合距离(越小越贴),玄幻场正式版 0.369,明明优于旧版的 0.454,票却是 3:9——评委抓的设定降维、文艺化、节奏拖沓在句长统计里不显影,旧版的复读和低对话率拖坏了 统计分却没拖垮人味票。「统计贴不等于读着像」这个家族又添一例。女频场倒是同向:正式版 0.386 对旧版 0.280,统计和票一起输。
| 指标(越贴原著越好) | 正式版 0813 | preview 前代 0716 | 原著 |
|---|---|---|---|
| 玄幻 · 综合距离 | 0.369 | 0.454 | 0 |
| 玄幻 · 句长变化幅度 CV | 0.443 | 0.592 | 0.837 |
| 玄幻 · 「的」密度(每百字) | 1.08 | 3.27 | 2.9 |
| 女频 · 综合距离 | 0.386 | 0.280 | 0 |
| 女频 · 「像」字系比喻(每千字) | 7.36 | 3.35 | 0(续写窗) |
| 女频 · 「我」密度(每千字) | 20.7 | 11.0 | 9.0 |
正式版的三个新体征都在表里。句长变化幅度两本书都显著低于旧版,句子越写越匀,这是我们量过的 第一 AI 指纹,方向恶化;玄幻场「的」字密度只有原著的 37%,旧版是超标方向,正式版矫枉过正成了 回避式精修;女频场「我」密度写到原著 2.3 倍,第一人称内心戏过密,K3 当时创下的 16.2 纪录 被刷新到 20.7。
冠军的伤,也在这轮验出来了
成对盲评是照妖镜,两边都照。旧版赢了,评委也没放过它:glm-5.2 点名它 late 窗「『血厉魔主 惨然一笑』与举手投降动作被描写两次,属倒带复读」(第 17、18 轮各一次,核验成立); qwen3.7-max 抓到它发明词汇——「禁果爆裂」,「禁果」在它链里第 12 到 18 轮出现 5 轮, 原著全书 0 次。
复读体检工具这轮还在两条冠军归档链上翻出了当年没查过的旧账:Flash 玄幻链第 13 轮开头逐字 吞并了整个第 12 轮再续写新内容,跨轮重复率瞬时 72%;Pro 旧版玄幻链第 4 轮同款吞并,53%。 两处都不在盲评窗口内,不影响历史票数;「把上一轮整段吞进开头再接着写」与逐字死循环不同种, 各只有一例,登记为第四种机械形态候选,不下结论。
评委也有翻车的。两家评委给 Flash 扣「late 引入全新人物血烬魔主」,我们对全书 grep: 血烬魔主在原著出现 27 次,是既有角色。评委只看得到 6000 字风格锚,看不到全书,把冠军的 正常人物调度误判成了幻觉。此类「新角色/设定错误」指控,今后一律核对全书后才采信。
头条不在比分牌上:同一个 ID,已经是另一个模型
这轮实测最该被记住的事,用三句话就能说完。DeepSeek 官方 API 升级正式版不换模型 ID, deepseek-v4-pro 这个字符串 7 月 16 日供的是 preview 权重、8 月 13 日供的是 0813 正式版, 模型列表里没有带日期后缀的旧入口;两个权重在我们的双盲里文风判若两人(女频稳定票 0:5); 所以任何「我锁死了模型 ID,行为就可复现」的假设,在这类静默热切面前不成立——锁 ID 锁不住权重。
对拿自己 key 连官方 API 的用户(我们 App 的 BYOK 模型选择器正是这类入口),这不是抽象风险: 你上周用得顺手的那个「deepseek-v4-pro」,这周可能已经换了文风,而你的配置页不会有任何提示。 对我们自己的榜单,这件事同样是一记闷棍——榜上 DeepSeek 的三个占位(玄幻冠军 Flash、女频冠军 Pro、玄幻 2-4 的 Pro)全部是 preview 期权重的测量值,Flash 于 7 月 31 日、Pro 于 8 月 13 日 先后被同名热切,选型页上那两顶冠冕如今 都是历史快照。Flash 正式版的 20 轮文风复检我们在0731 那篇单独跑过;巧的是同一天 测的 Grok 4.6 走了完全相反的方向——xAI 对自家前代两书 12:0、12:0 通杀。「新版本不等于更会写小说」,8 月 13 日一天凑齐了正反两例。
票价与散场
账单:正式版两条链 40 轮零失败零重试,牌价折算 ¥2.11、账面实扣 ¥2.30,连同评委轮粗估, 全实验 5 元以内,全程凌晨平峰。官方定价(定价页2026-08-13 核实):平峰输入未命中 ¥3、命中 ¥0.025、输出 ¥6 每百万 token,工作日高峰时段 翻倍;1M 上下文,最大输出 384K,思考默认开,输出 token 的 82% 到 87% 是推理过程,可见正文 每轮约 250 到 280 字,单轮延迟 25.8 到 35.1 秒。8 月 6 日公告的「预计涨幅较大」整体调价 截至实测尚未落地——落地那天,本节数字作废重算。
边界照抄实验记录:单一提示框架,中文书两本,每模型每书一条链单起笔点;玄幻场对手链带旧版 说明条件(消融证据对冲,但严格说是混入变量);正式版是 GA 后约两小时的 hosted 行为,之后 可能漂移;景仁宫、暴室驻留、低武降维都基于单链,复发率无从估计。稳定票合计 12 张,比原始 36 票少了三分之二,位置偏差在这轮评委池里偏高,所以结论全部以稳定票、多评委独立点名、机械 核验三重交叉为准。
要不要跟着换版本,别抄结论:同一段开头,让正式版和你现在用的模型各续三段,盲着读完再翻牌。 在能按段落换模型的阅读器里做这个实验,成本是几分钱; 而如果你想召回那个 1:11 赢了卫冕战的旧版——它已经不接受挑战了。
常见问题
DeepSeek V4 Pro 正式版写小说怎么样?
按票说话:正式版(0813)与 preview 前代(0716 快照)同协议各续写 20 轮成对双盲,女频《甄嬛传》场 1:11 惨败(跨映射稳定票 0:5),玄幻场 3:9(稳定 0:3);挑战玄幻现任冠军 V4 Flash 0716 快照也输 3:9。评委独立点名的病是「现代文艺化」:高武写成低武武侠、甄嬛体写成疼痛文学。机械层倒是历届最干净之一:40 轮零逐字循环、零半角引号、零请求失败。写 agent 和跑基准怎么样本轮没测,但续写中文小说这个用途,正式版相对 preview 是净退步。
榜上的女频续写冠军 V4 Pro 还调得到吗?
调不到了。我们榜单上女频 1-2 名的 V4 Pro 成绩,来自 2026-07-16 官方 API 的 preview 期权重;8 月 12 日深夜 GA 后,官方沿用同一个模型 ID deepseek-v4-pro 直接热切成 0813 权重,模型列表里没有带日期后缀的旧版本入口。现在无论你在哪个 BYOK 客户端里选 deepseek-v4-pro,调到的都是这轮双盲里 1:11 输给旧版的那个新模型。锁定模型 ID 锁不住权重,这是这轮实测最值得记住的一条。
那现在续写小说该选什么模型?
分文体说。女频古言:旧冠军已不可调,现役可调的第一梯队是 Kimi K3(7 月 28 日 12 系统混排重赛里两文体都进前二)与 GPT-5.6 Terra,Claude Opus 5 候补。玄幻:榜上冠军 V4 Flash 的名次同样测于 0716 preview 快照,7 月 31 日它也被同名热切过,正式版的 20 轮文风复检我们单独发过(机械复读峰值 72% 降到 1.2%,但文风距离变大);预算优先仍可选 Flash,追文风优先选 K3。通用保险法不变:同一段开头各续三段,盲着读完再翻牌。
DeepSeek V4 Pro 正式版 API 什么价,这轮实测花了多少钱?
官方定价页(2026-08-13 核实):平峰时段输入未命中缓存 ¥3、命中 ¥0.025、输出 ¥6,单位每百万 token;工作日 9-12 点与 14-18 点高峰时段全部翻倍;上下文 1M,最大输出 384K,思考模式默认开。8 月 6 日公告里「预计涨幅较大」的整体调价截至实测还没落地,等价格换了这页数字要重算。实测账单:两条 20 轮链牌价折算 ¥2.11、账面实扣 ¥2.30,连同评委轮粗估在内全实验约 5 元,全程跑在凌晨平峰。
正式版就没有赢的地方吗?
有,而且值得单独记。工程层它近乎满分:40 轮零请求失败零重试,跨轮逐字重复峰值玄幻 0%、女频 1.8%,全角引号规矩使用——K3 和 GLM-5.2 那个约 85% 对白半角引号的顽疾,它完全没有。文笔本身也不差:连投它反对票的评委都引了「如剑鸣般切开血光」这样的句子夸文笔,六评委里 claude 一家跨映射稳定投它,赞它「短促句式、克制内敛」。它输的不是「写得好不好」,是「像不像你手里这本书」——这两件事我们在九模型横评里就拆开过,正式版是又一个正面标本。
有想法或问题?来 Discord 聊聊 →