Kimi K3 发布 48 小时,我们让它连续续写了 40 轮小说

Kimi K3 发布 48 小时的增量实测:沿用九模型横评同一套协议(同两本书、同起笔点、同上下文说明),与前代 K2.6 各连续续写 20 轮成对双盲,票数玄幻 10:0、女频 11:1,唯一反对票在映射翻转下自相矛盾;K2.6 的比喻堆砌与整段自我复制没有复发,句长变化幅度两本书都更贴原著。三个坑如实记录:约 85% 对白用半角引号(K2.6 没有的新病)、女频「我」密度是原著近 1.8 倍、思考关不掉导致每轮 37-54 秒且八成输出是推理 token。K3 侧 41 次请求实付 ¥12.21。

旧纸底上两株并排的墨线植物:左株枝条自我缠绕打成结,右株挺拔开出一朵花,右株根边搁着一枚小小的秒表

先说结论。续写小说这个用途,Kimi K3 比前代 K2.6 强得不含糊:同一套协议下两本书各连写 20 轮, 六个异构 AI 评委、每本书两套甲乙翻转映射的成对盲评,票数合计 21 比 1, 唯一那张反对票还在映射翻转下自相矛盾。代价同样不含糊:思考模式关不掉,每轮平均等 37 到 54 秒; 输出 token 的八成以上是看不见的推理过程,按 ¥100 每百万 token 照常收费; 对白引号约 85% 用了半角,这个病 K2.6 没有,是 K3 新染上的。

7 月 16 日 K3 上线时,我们在GPT-5.6 对 Kimi 的对决文里写过: 任何「K3 吊打谁」的说法都还没有考卷可查。这份考卷 48 小时内补齐了,下面按实测记录的顺序摆数据。

考卷怎么出的

协议照抄九模型横评,一个字没改:同两本书(890 万字传统玄幻,加《后宫·甄嬛传》), 同一个约 55% 深度的起笔点,同一份上下文说明(就是修掉 Gemini 复读坑的那版终稿, 来龙去脉在文风漂移实验里),同 1.6 万 token 窗口, 每轮产物拼回上下文再写下一轮,连写 20 轮。唯一变量是模型。

基线多花了一道工序。《甄嬛传》场的 K2.6 链直接取横评归档,那条链本来就跑在现行说明上,天然成对; 玄幻场归档的九模型链却全部跑在旧版说明上,直接拿来对比会混进措辞变量, 所以我们用现行说明给 K2.6 重跑了一条玄幻基线。这道工序差点改写故事: 旧说明下 K2.6 的玄幻链第 9 轮曾量出 97.6% 的跨轮逐字重复,现行说明下同一个模型峰值只剩 1.5%。 一句说明措辞就治掉大半复读,这是单链孤证,只记录不下结论; 但拿旧链当靶子等于给 K3 放水。协议诚实是这页所有数字可信度的全部。

评委是六个异构 AI 模型,横跨五家供应商(claude-4.6-sonnet、gemini-3.1-pro-preview、gemini-3.5-flash、 deepseek-v4-pro、qwen3.7-max、glm-5.2),温度 0。敢用 AI 评委有前提: 我们的评审可靠性实验证明过它们做「像不像人」这类绝对判断会系统性翻车, 同题成对的相对判断才是它们够得着的用法,这轮全部是成对判定。 盲评包里的原著参照段严格截取起笔点之前的 6000 字,不让评委看见原著真实的下文。

21 比 1,唯一的反对票自己拆了自己

玄幻场 10 比 0,另有两张无效票,无效得很有画面:claude 评委两次拒绝输出裁决, 顺着盲评包里的小说自己写起了续写。女频场 11 比 1。按 early、mid、late 三个窗口分开数, 票型与总票完全一致,没有「前段谁强、后段谁强」的分裂。

那张反对票值得单讲。deepseek-v4-pro 评委在 2201 号盲评包里选甲,甲对应 K2.6; 到了甲乙翻转的 2203 号包,它还是选甲,这回甲对应 K3。两票放一起是甲位偏好,构不成稳定判断; 其余五个评委跨映射全部一致选 K3。每本书做两套映射,防的就是这种票。

评委给的理由,我们逐条对着链产物做过机械核验。K3 被点名「完美复刻原著短段落、拟声词独立成段及『~~~』标点习惯」, 玄幻链里确实有「轰隆隆~~~」独立成段,这个纹理在九模型横评里只有 GPT-5.6 Terra 复刻过; 「转眼,三人深入第四禁地已有十余年」式的时间跳跃、原著独有的功法法宝专名四到六次自然引用,全部对得上原文。 K2.6 挨的批是「辞藻堆砌」「战斗篇幅长节奏急促」,还有几个评委独立点名反派「去而复返」像剧情倒带: 它的新基线链治好了逐字复读,情节却在绕圈,同一个反派第 9 轮开打、第 11 轮撤走、第 17 轮折返、缠斗到第 19 轮。 K3 同书同起点则一路推进到新的剧情节点;《甄嬛传》场同样线性,从陵容中毒写到字据取证、再写到查封存菊堂, 二十轮没有回头路。

治好的病,数字里看得见

句长变化幅度(CV)是我们量过的第一 AI 指纹:AI 味的典型症状就是句子长短均匀得像流水线。 两本书的原著基准、K3 与同协议 K2.6 基线摆进一张表。

指标(越贴原著越好)Kimi K3Kimi K2.6(同协议基线)原著
玄幻 · 句长变化幅度 CV0.620.500.837
玄幻 · 套话密度(每千字)2.023.681.0
女频 · 句长变化幅度 CV0.4430.4170.495
女频 · 套话密度(每千字)0.631.921.0
女频 · 「我」密度(每千字)16.211.09.0

两本书的句 CV 都压过了 K2.6,玄幻链写到后段达到 0.731,逼近原著的 0.837。大白话讲: 它学会了长短句混着来,短句敢单独占一行。K2.6 在玄幻场排第七的主因「比喻密度全场最高」, 到 K3 身上基本消失:女频全链套话密度 0.63,低过原著自己的 1.0; 玄幻链首轮偏高(13.1),随后快速收敛,后半段大段轮次直接是零。

三种长程失效模式的体检同样干净。跨轮 12-gram 逐字重复,K3 玄幻链峰值 6.8%(第 10 轮,其余轮次接近零), 女频链峰值 1.0%:没有从头复读,没有中途卡死,没有尾段回卷。 K2.6 在横评里的「整段自我复制」标签,这一代没有复发。

三个如实的坑

第一个,半角引号。K3 两本书约 85% 的对白用了英文直引号,玄幻场 39 对半角对 9 对全角,女频场 52 对 8。 这是 GLM-5.2 档案里那个顽疾的同款,而 K2.6 恰恰没有此病, 升级把它带了进来。它还顺手骗过我们只认全角的检测正则:全角口径下两条链的对话率只剩 4% 上下, 人工修正口径后是 20.4% 和 38.9%。提示词里加引号约束值得一试,但按 GLM 那边的经验,别指望一句话根治。

第二个,「我」写得太密。女频场 K3 的第一人称密度每千字 16.2 次,原著是 9.0,接近 1.8 倍; 方向与 Grok 4.5 在同一本书上的「过疏」正好相反。读第一人称限知视角的书,这一笔要留心。

第三个,慢与贵。K3 当前只有满档思考一个档位,关不掉:输出 token 的 81% 到 86% 是推理过程, 可见正文每轮只有 250 字上下,而账单按输出全量计。跑之前我们按这个配置悲观预估过单链一到三小时, 实际墙钟 12.4 分钟和 17.9 分钟,好于预期;但单轮 37 到 54 秒的等待,在阅读器里按下续写按钮时是真实的。 实测平均一段约三毛钱,K2.6 干同样的活不到一毛。

一枚专名彩蛋:景仁宫

K3 在《甄嬛传》链里把「存菊堂」用对了 14 次,这个宫名是小说原设,全书出现 52 次。 但写到皇后居所,它落笔是「景仁宫」。景仁宫是电视剧的设定,小说全书只出现过 1 次, 流潋紫笔下的皇后住所是昭阳殿与凤仪宫那套体系。底层记忆微偏电视剧, 与九模型横评时撞见的「寿康宫对颐宁宫」同族;用一个专名探出模型读的是哪一版《甄嬛传》, 这套测法在专名探针一篇里写成了方法论。

1M 窗口没参战

顺带管理一个预期:这场 21 比 1 全程发生在 1.6 万 token 的窗口里,与 K3 的 1M 上下文没有关系。 窗口解决「装得下」,不解决「以谁为基准」,把整本书塞进去也不会让续写自动变像, 五档对照实验的账我们在 1M 军备竞赛一篇(暂只有英文版)里算过: 装满一次 K3 的窗口,光输入就约 ¥21。

K3 站在哪,以及这场实验的账本

留余地的措辞,按数据边界来。与原著结构画像的综合距离(越小越贴):玄幻场 K3 是 0.388, 那场的冠军 DeepSeek V4 Flash 是 0.356;女频场 K3 是 0.396,那场的冠军 V4 Pro 是 0.280。 两场都进了第一梯队的区间,两场都没有越过冠军。本轮成对盲评只做了 K3 对 K2.6, 与 DeepSeek 双档没有面对面,评委形态也与九模型榜不同(那边是全排序,这边是成对判定), 跨榜只能靠结构指标间接换算。所以「K3 全场第几」我们还写不出来,能负责任写下的是: 它从 K2.6 的中下游位置,一步跨进了与冠军同区间的地带。成对对决在排期中;等对决之前想细看两家的对表与成本账,K3 对 DeepSeek 的对表篇单独展开了, 对决跑完名次会一并更新进选型页

账本与边界:K3 侧 41 次请求(含连通探针与空回复重试)实付 ¥12.21,两条链 20/20 零中断。 规格与价格按官方文档定价页(2026-07-18 核实): 2026 年 7 月 16 日发布,1M token 窗口全程平价,输入未命中缓存 ¥20、命中 ¥2、输出 ¥100 每百万 token。 局限照抄实验记录:每本书一条链、单一起笔点,与横评里各模型的条件一致,但 n=1 就是 n=1。

K2.6 工作流篇里欠过一句账: 「K3 我们还没跑过双盲续写链,这篇对它只有价格、没有判断。」现在有判断了。 至于要不要为它把正在读的书换模型,别抄我们的结论:K2.6 升 K3 的三类账按用户类型把差价和思考税拆开了, 通用的盲测流程在模型更新决策笔记里——同一段开头新旧各续三段,盲着读完再翻牌。

常见问题

Kimi K3 写小说怎么样?

显著强于前代 K2.6,有票可查:同协议下两本书各连续续写 20 轮,六个异构 AI 评委双映射成对盲评,玄幻场 10:0、女频场 11:1,唯一反对票在映射翻转下自相矛盾。句长变化幅度两本书都更贴原著,K2.6 标志性的比喻堆砌和整段自我复制没有复发。坑也有三个:约 85% 对白用半角引号、女频第一人称密度是原著近 1.8 倍、思考模式关不掉导致每轮要等 37 到 54 秒。与 DeepSeek 双档的成对对决还没跑,全场名次先不排。

写小说该从 K2.6 升级到 K3 吗?

质量方向明确,代价也明确。文字上 K3 成对双盲 21:1 压过 K2.6,还治好了比喻堆砌;代价是输入单价从 ¥6.5 涨到 ¥20、输出从 ¥27 涨到 ¥100(每百万 token),实测一段续写成本从不到一毛涨到三毛上下,每轮多等半分钟,另染上 K2.6 没有的半角引号病。预算敏感或讨厌等待,留在 K2.6 不丢人;哪类用户该升、哪类不必,我们在「K2.6 要不要升级 K3」一篇里按三类用户分开算了账。拿不准就别赌:同一段开头新旧各续三段,盲着读完再翻牌。

K3 的 1M 上下文窗口对续写小说有用吗?

这场 21:1 的胜利全程发生在 1.6 万 token 窗口里,与 1M 无关。我们的五档对照实验证明过:把整本书塞进窗口、不加文风指令,产出照样满篇套话,密度是原著的 10 倍,文风不会自动变像;而装满一次 K3 的 1M 窗口光输入就约 ¥21。1M 真正的主场是整卷总结、全书人物梳理这类一口气读完全书的一次性任务,反复续写要的是按相关性挑出的一小撮上下文。

Kimi K3 的 API 什么价,实测一段续写多少钱?

官方牌价(2026-07-18 核实):输入未命中缓存 ¥20、命中 ¥2、输出 ¥100,单位每百万 token,1M 窗口全程平价不分段,当前只有满档思考一个档位。实测:两条 20 轮链共 41 次请求实付 ¥12.21,平均一段约三毛;其中输出 token 的 81% 到 86% 是看不见的推理过程,可见正文每轮约 250 字,推理部分照常按输出价计费。

K3 和 DeepSeek 谁更适合续写小说?

还没有成对考卷,不硬答。间接证据:与原著结构画像的综合距离上,玄幻场 K3 0.388 对冠军 DeepSeek V4 Flash 0.356,女频场 K3 0.396 对冠军 V4 Pro 0.280,K3 两场都进了第一梯队的区间、两场都没有越过冠军。本轮评委形态与九模型榜不同,跨榜换算只能到这一步。K3 对 DeepSeek 的成对双盲是我们下一份考卷;跑完之前,「K3 吊打 DeepSeek」和「K3 不如 DeepSeek」都属于没有考卷的说法。

有想法或问题?来 Discord 聊聊 →

Kimi K3 写小说怎么样?发布 48 小时的 40 轮双盲实测:21:1 碾压前代,但有三个如实的坑 · Foreverse · 新梦