K3 对 DeepSeek:目前能对表,还不能对决
K3 发布 48 小时,对比文全在刷代码榜,写小说角度没人给数据。我们把 K3 刚跑完的两书 20 轮续写链和 DeepSeek 双档的同书归档放上同一把尺:玄幻场 K3 综合贴近度 0.388,落在 V4 Flash 的 0.356 与 V4 Pro 的 0.454 之间;女频场 0.396,未及 V4 Pro 的 0.280;成本这局 DeepSeek 碾压,一段 K3 的钱够 Flash 谷时写二十多段。必须说明:这是同尺隔空对表,不是同场盲评,成对对决在排期中。

K3 发布 48 小时,「K3 对比 DeepSeek」的文章已经冒出来一批。我们翻了一圈,全是编程侧的:刷 SWE 榜、跑代码补全、算 agent 成功率。 写小说这个角度,还没有人给数据。我们手里正好有:K3 刚在我们的 20 轮续写链上跑完两本书,DeepSeek 双档的同书数据在归档里躺着,尺是同一把。
最硬的两个数字先放前面。玄幻场,K3 的综合贴近度 0.388,落在 DeepSeek V4 Flash(0.356,该场盲评冠军)之后、V4 Pro(0.454)之前; 女频场,K3 是 0.396,没有够到 V4 Pro 的 0.280。 但这两句话的性质必须说清楚:这是同一把尺下的隔空对表,不是同场对决。K3 和 DeepSeek 没有进过同一场盲评, 谁「击败」谁,目前没有考卷。想直接看怎么选的,跳到文末决策树;想知道为什么我们不肯宣布胜负的,从下一节读。
为什么只能对表,不能判胜负
两份成绩单的来路不同。K3 的对手是同厂上代 K2.6:同两本书(一本 890 万字传统玄幻、一本《后宫·甄嬛传》)、同起点、同提示、 各连写 20 轮,产物匿名后交 6 个异构评委做成对判定,战绩 21 比 1。DeepSeek 双档的名次来自另一场九模型双盲: 产物匿名成随机字母、两套映射、两个互不知情的评审排全序。两场的书、起点、窗口、轮数、指标定义完全一致, 所以结构指标可以放在同一张表里读;但盲评的形态不同,评委也不同,把「K3 赢 K2.6」和「Flash 是玄幻冠军」硬接成 「K3 对 Flash 的胜负」,中间缺的恰好是那场没跑的比赛。
对表还有一块自带的警示牌。V4 Flash 在女频场的贴近度是 0.296,和 V4 Pro 的 0.280 几乎贴着, 盲评名次却是 6-7 对 1-2。结构指标量的是表层纹理,量不出「笔更细恰好是原著的笔」这种事。 指标能划出档位,判不了名次。这也是本页坚持「对表不判胜负」的原因,不全是姿态。
第一张表:文字贴近度,K3 挤进了 DeepSeek 双档之间
贴近度(dist)是八项结构指标与原著的平均相对差,句长、句长变异、对话率、标点密度、套话密度都在里面,越小越贴。 四条链、两本书,同一套脚本算出来是这样:
| 模型 | 玄幻《踏天境》 | 女频《甄嬛传》 |
|---|---|---|
| DeepSeek V4 Flash | 0.356(该场盲评冠军) | 0.296(盲评却只排 6-7) |
| Kimi K3 | 0.388 | 0.396 |
| DeepSeek V4 Pro | 0.454 | 0.280(该场盲评第一梯队) |
| Kimi K2.6 | 0.504 | 0.400 |
玄幻场 K3 排进了 DeepSeek 双档之间,比冠军 Flash 差一步,压过 Pro 和 GLM 5.2(0.565)。 单项里它有一处全场无人及:句长变异系数 0.62,尾段窗口冲到 0.731,是我们测过的模型里最接近原著 0.837 的一个。 句长忽长忽短的「碎」感,是这类传统玄幻最深的指纹,也是多数模型最治不好的均匀化毛病,K3 在这一项上真有东西。 女频场它就平平了:0.396 对 Pro 的 0.280,差距不是误差级的。
一句口径说明:K3 两本书约 85% 的对白用半角引号,dist 里的对话率项按原始口径算会吃这个亏(修正后玄幻对话率 20.4%、女频 38.9%), 表里的数字没做修正,属保守值;GLM 5.2 的 0.565 也受同款影响。伪影归伪影,半角引号本身就是真实缺陷,读者看得见。
第二张表:长跑失效,两家都是能跑完的选手
我们在 360 轮横评里把长跑失效分成三种:从头复读、中途卡死、尾段回卷(完整分类学在选型答案页)。这一项 K3 和 DeepSeek 双档打平:都没病。 K3 两条链的跨轮逐字重复率峰值分别是 6.8%(玄幻单轮)和 1.0%(女频),其余轮次接近零, 20 轮剧情线性推进不回卷;DeepSeek 双档在两场横评里也从未进过三种失效的名单。 作为参照,K2.6 在旧协议玄幻链上第 9 轮曾出现 97.6% 的整段自我复制;九模型横评里三种失效合计砸中过四家。 把 20 轮跑干净是两家共同的及格线,也是它们都值得进同一场盲评的理由。
第三张表:成本,这一局 DeepSeek 碾压
| 计费项(元/百万 tokens) | DeepSeek V4 Flash(谷时) | Kimi K3 |
|---|---|---|
| 输入(未命中缓存) | 1 | 20 |
| 输入(缓存命中) | 0.02 | 2 |
| 输出 | 2 | 100 |
牌价(DeepSeek 官方定价页、Kimi 官方定价页,均 2026-07-18 核实)之外,K3 还有一笔账面上看不到的思考税: 它的思考模式恒开、只有 max 一档,我们实测两条链的输出 token 里 81% 到 86% 是思考过程,可见正文每轮只有 250 字上下, 思考部分照 100 元的输出价收费。落到钱上,两本书各 20 轮加探针共花 12.21 元,摊到每段约 3 毛;每轮等 37 到 54 秒。 Flash 谷时同样一段一分二厘,缓存命中价是未命中的 1/50,峰时翻倍但避开 9 点到 12 点、14 点到 18 点就行, 账在峰谷计价那篇算到了厘位。 一段 K3 的钱,Flash 谷时能写二十多段。这一局没有悬念。
病历对照:各自治好的,和各自还带着的
DeepSeek 双档的病历在两场横评里写透了:Flash 的强项是称谓式对话、拟声词独立成段、剧情快推进, 评审原话「六个系统中唯一读起来像原著续章的」;它的病是文体错配,白话直给的本能撞上古言典雅语体就使不上力,女频跌到 6-7。 Pro 正相反,「话中有话加叙述解码」的双层结构全场唯一稳定复现,太后审案一场是全部样本的峰值; 病是描写密度系统性偏高,玄幻场评语「像一个笔更细的同题材作者」。同一家的两个档位,互相拿不下对方的主场。
K3 这边,先说治好的。K2.6 那身「比喻密度全场最高」的病,K3 基本治断根了:玄幻套话密度从每千字 3.68 次降到 2.02, 尾段大段清零;女频 0.63,低于原著自己的 1.0。整段自我复制也没了。 评委点名的强项很具体:「完美复刻原著短段落、拟声词独立成段及『~~~』标点习惯」。 我们回头机械核验过,玄幻链里「轰隆隆~~~」真的独立成段,这个纹理在此前九个模型里只有 GPT-5.6 Terra 复刻出来过; 原著专名(宇宙晶、九源境、星河神剑)在链里出现 4 到 6 次,用得都对。
还带着的病也照抄记录。半角引号占对白约 85%,玄幻 39 对半角对 9 对全角,女频 52 对 8,和 GLM 5.2 是同款顽疾; 女频「我」的密度每千字 16.2 次,原著 9 次,第一人称过密,方向与 Grok 4.5 的过疏正好相反; 写皇后居所时它用了「景仁宫」,那是电视剧的设定,小说里是凤仪宫,底层记忆微偏剧版语料, 这个现象我们在专名一篇里单独写过。
怎么选:一棵决策树
预算敏感,或者日常陪读要长跑的,选 DeepSeek,按文体分档:快节奏玄幻用 Flash,古言慢文用 Pro, 谷时账单以分计,这个建议和两场横评的结论一致。 在乎文字纹理、想要拟声词独立成段和碎句节奏这种排版肌肉层面的像,K3 值得一试, 前提是接受每段约 3 毛和 40 秒上下的思考等待;它的完整样张和逐轮数据在实测记录里,先读样张再充值。 两个都想要的,混着用:关键场景 K3 精修,日常推进 DeepSeek 跑量。在 Foreverse 里续写逐段可换模型, 两家都能自带 key 接入,同一本书里这么配是现成操作,不用二选一。
最后是那场没跑的比赛。K3 对 DeepSeek 双档的同场成对盲评在排期中,两本书都会跑,跑完这页的「对表」会改写成「对决」, 以页首日期为准。在那之前,你在别处读到的任何「K3 击败 DeepSeek」或者「K3 不如 DeepSeek」,都还没有考卷可查,包括我们自己的。
常见问题
Kimi K3 和 DeepSeek 哪个写小说更好?
目前只能给对表,给不了胜负。同一把尺(同两本书、同起点、同 20 轮连续续写、同一套指标定义)下:玄幻场 K3 综合贴近度 0.388,介于 DeepSeek V4 Flash(0.356,该场盲评冠军)与 V4 Pro(0.454)之间;女频场 K3 0.396,未及 V4 Pro 的 0.280。但两家从未进过同一场盲评,谁击败谁没有考卷。按预算和场景选:日常长跑选 DeepSeek 按文体双档,想要 K3 的纹理复刻力再为它付溢价。
为什么不直接盲评分个胜负?
成对盲评要求两份产物同场同协议、评委不知来源。K3 这轮的成对对手是同厂上代 K2.6(战绩 21 比 1),DeepSeek 的名次来自另一场九模型双盲,两场评审形态不同,跨榜硬比名次会混入协议变量。结构指标是同一套定义在同两本书上算出来的,所以可以对表;胜负要等 K3 与 DeepSeek 双档进同一场成对盲评,这场在排期中,跑完更新本页。
K3 比 DeepSeek 贵多少?
对 V4 Flash 谷时牌价,输入贵 20 倍、输出贵 50 倍;按实测每段成本折约 25 倍。K3 每百万 token 输入 20 元、输出 100 元,思考恒开且思考 token 照价计费,我们实测两本书各 20 轮共花 12.21 元,摊到每段约 3 毛,每轮等 37 到 54 秒;DeepSeek V4 Flash 谷时输入 1 元、输出 2 元,同样一段一分二厘左右,缓存命中价是未命中的 1/50。一段 K3 的钱在 Flash 谷时能写二十多段。
K3 写中文小说有什么已知的坑?
实测记录里有三个:两本书约 85% 的对白用半角引号(GLM 5.2 同款顽疾,中文网文读者一眼出戏);写第一人称古言时「我」的密度是原著的 1.8 倍(每千字 16.2 次对 9 次);思考模式恒开关不掉,等待和费用都躲不开。另有一处专名细节:它把皇后居所写成了剧版的「景仁宫」,小说设定是凤仪宫,说明底层记忆微偏电视剧语料。
有想法或问题?来 Discord 聊聊 →