Qwen 3.8 对 Kimi K3:三天内连发的两个万亿级模型,进了同一间考场

中国两家厂商三天内连发万亿级模型:7 月 16 日 Kimi K3(2.8 万亿参数),7 月 19 日 Qwen3.8-Max-Preview(2.4 万亿参数,自称仅次于 Fable 5、未附独立 benchmark)。我们把两家放进同一张续写考卷:同两本书、同起笔点、同一套指令,各连续续写 20 轮,六评委双映射成对盲评。比分 3:20——玄幻 1:10、女频 2:10,qwen3.8 名下三张票还全部在映射翻转下自相矛盾。双方的坑都有票据:qwen3.8 被点名「严重剧情倒带」和「把夜色熬成了毒」,K3 被点名「舒痕胶的字据、夹袋」套路化复读,外加半角引号与思考关不掉两个存量病。preview 是移动目标,结论绑定 2026-07-21 的托管端点。

暖纸底水墨插画:两方砚台隔着一张摊开的稿纸对峙,右砚旁堆着二十张判卷票签,左砚旁只有三张,一支毛笔搁在稿纸中缝上

7 月 16 日,月之暗面赶在 WAIC 开幕前发布 Kimi K3: 2.8 万亿参数,思考默认钉在最高档,承诺 7 月 27 日前放出全量权重。三天后,7 月 19 日, 阿里在会期里官宣 Qwen3.8-Max-Preview: 2.4 万亿参数,官宣帖原话「second only to Fable 5」,帖子里没有附任何独立 benchmark,开源只说了「soon」。 三天,两个万亿级模型,都把思考钉成常开,却没在任何公开评测里正面见过面。

代码榜的对比文已经出了一批,写小说这个用途没人碰。我们手里有现成的考卷:K3 发布 48 小时时考过一遍, qwen3.8 发布 48 小时,我们让它坐进同一间考场,把两家的卷子匿名装进同一批盲评包。 判卷结果先说:23 张有效票,qwen3.8 拿了 3 张。

赛制:一张一个字没改的旧考卷

协议照抄九模型横评:同两本书(一本 890 万字传统玄幻,一本《后宫·甄嬛传》)、同一个约 55% 深度的起笔点、 同一份上下文说明、同 1.6 万 token 窗口,每轮产物拼回上下文再写下一轮,各连写 20 轮。 K3 的两条链取自它发布 48 小时那轮实测的归档, qwen3.8 的两条链新跑。唯一的协议差异如实报:qwen3.8 思考恒开,我们把单轮输出上限从 2800 token 放宽到 6000, 防止可见正文被推理过程挤成空白。这个改动只帮它把话说完,不改考题。

评委六个异构模型,横跨五家供应商,温度 0;每本书做甲乙翻转的两套映射,对冲位置偏差。 用 AI 当评委的前提写在评审可靠性实验里: 「像不像人」这类绝对判断它们会系统性翻车,同题成对的相对判断才够得着,这轮全部是成对判定。 评委席里还坐着 qwen3.7-max,被测者的同厂前代。它在玄幻场两套映射里把票一致投给了 K3。

记分牌:3 比 20

考场票数(qwen3.8 : K3)分窗(early / mid / late)
传统玄幻(890 万字)1 : 101:10 / 1:10 / 2:9
宫斗古言(甄嬛传)2 : 102:9 / 2:10 / 2:10

玄幻场剔了一张 JSON 解析失败的废票,其余 23 张有效。按 early、mid、late 三窗分开数, 六个窗口 K3 全部领先,最接近的一窗也是 9 比 2;分窗里的两处零头(玄幻 late 多一票、女频 early 一票格式无效) 不改变任何一窗的方向。

qwen3.8 名下那 3 张票,放到翻转映射下对表,全部对不上:投出它们的评委在甲乙互换后仍然选了同一个位置, 属甲位偏好,构不成稳定判断。同款病票 K3 名下也有 3 张。把这 6 张自相矛盾的票和 1 张无法配对复核的票全部剔掉, 严格口径的比分是 0 比 16。

对 qwen3.8 公平起见补一句纵向:它对自家前代 qwen3.7 是真升级,同协议双盲女频场 11 比 1、玄幻场 7 比 5, 前代那套「恒定精修感官流」的老毛病收敛了大半,完整链数据在主实测文里。它输掉的不是自己的进步,是对手的档位。

qwen3.8 的病历:卡死、堆砌、现代腔

玄幻场的票据最重。gemini-3.5-flash 评委原话:「严重剧情倒带,20 轮后仍卡在逃亡与封印血纹的死循环中, 叙事停滞。」这落在我们长程失效分类学的「中途卡死」一型。 claude 评委记的是另一面:mid 起「感官细节堆砌(盐壳碎裂/腥甜血气/枯叶焦土)替代叙事推进」。 连坐在评委席上的同厂前代都嫌它:「文风持续偏离原著,偏向细腻微观的传统武侠/实体仙侠风。」

女频场输得体面一些,病灶换了部位。两个评委各自独立摘了同一句比喻示众:「把夜色熬成了毒」, 古言语境里的现代文艺腔;qwen3.7-max 评委另记下「情节模式复读:三个窗口均围绕卫临验毒展开, 缺乏实质剧情推进」。词级复读倒是治干净了,四条链相邻轮逐字重叠全部 0.0%, 前代那种「嗤嗤、牙酸、黏腻」循环叠用没有复发。修掉了词级复读,长出了情节级复读。

K3 的病历:赢家也有票据在案

20 票不等于零缺陷。本轮女频场有评委点名 K3「出现明显的套路化剧情和复读倾向(舒痕胶的字据、夹袋), 文字开始扁平化」,批它情节「过于古早同人文套路(突然翻出字据、留把柄)」; 玄幻场另有两位评委分别记下轻微套路化的「鹬蚌相争桥段」和一处回忆段落的相邻复读。都不是致命伤,都进了档案。

存量三坑照抄它自己的实测记录:约 85% 对白用半角引号(玄幻 39 对半角对 9 对全角,女频 52 对 8); 女频「我」密度每千字 16.2 次,原著 9.0,接近 1.8 倍;思考关不掉,每轮等 37 到 54 秒, 输出 token 的 81% 到 86% 是看不见的推理。顺带一个反直觉数字:这场对决里 qwen3.8 反而是快的那个, 平均每轮 12 到 38 秒。快,没能换成票。

评委的票不跟着对话率走

指标表里藏着这轮最有意思的反差。按脚本原始口径,K3 的女频对话率只有 3.9%,原著是 48.8%, 票却是 10 比 2。拆开看,大半是半角引号骗过了只认全角的检测,修正后 38.9%;可伪影拆完反差还剩一截: 修正值仍比原著低十个百分点,qwen3.8 的 33.6% 也没好到哪去,两家都够不着原著的对话密度。 真正的反差在下一格:女频场 qwen3.8 的综合贴近度 0.385 比 K3 的 0.396 还小,票仍是 2 比 10。

另一个新体征顺手入档:qwen3.8 的句长变化幅度全场最平(0.217 到 0.406), 远低于两本原著的 0.837 和 0.495,句子越写越匀是它这一代的新指纹。 统计指标与双盲票方向分歧,这是我们记录里的第三次。指标划得出档位,判不出人味。

你该把书交给谁

要文风保真、想把追着的书交出去长跑:K3,23 张票里 20 张没什么可辩的, 代价是半角引号、过密的「我」、每轮半分钟的思考税和每百万 token 输入 ¥20、输出 ¥100 的牌价。 已经在阿里生态里、订阅额度闲着:qwen3.8 顺手试,preview 期 Credits 按 1 折计、 个人版夜间再叠 2 折(Token Plan 官方文档,2026-07-21 核实), 拿订阅额度摸一个 2.4 万亿参数的模型不心疼;只是别把续写主力迁过去。预算敏感、日常跑量: 两场横评的冠军仍是 DeepSeek 双档(玄幻 V4 Flash、古言 V4 Pro),这两位新选手的结构贴近度都没越过各自主场的冠军值, K3 对 DeepSeek 的同场对决还在排期里,跑完这段会改写。

在 Foreverse 里不用二选一:续写逐段可换模型,关键场景交 K3,日常推进换便宜档,写崩一段就地换模型重写, 两家都能自带 key 接入。

三个日期

第一个日期圈住本页全部结论:qwen3.8-max-preview 是预览版,官方明说预览期能力持续迭代、 预览结束后模型会下线或换成正式版,我们测的是 2026 年 7 月 21 日的 Token Plan 托管端点, 正式版转正当天按同协议复测。第二个是 7 月 27 日,K3 承诺的权重开源节点,第三方托管一铺开, 价格和延迟都可能松动。第三个日期现在还空着:等两边都转正,这页的记分牌重排一次,以页首日期为准。

常见问题

Kimi K3 赢这么多,为什么还有人用 Qwen 3.8 写小说?

场景和生态。qwen3.8-max-preview 目前不单独按量计费,随阿里自家产品走(Token Plan 订阅、Qoder 系平台),已经付了订阅的人用它不另花钱,preview 期 Credits 按 1 折计、个人版夜间再叠 2 折;它对自家前代也是实打实的升级:同协议双盲女频 11:1、玄幻 7:5,qwen3.7 的「恒定精修感官流」老毛病收敛大半。但同场双盲 3:20 也是真的:把它当续写主力,目前没有数据支撑。

Qwen 3.8 和 Kimi K3 的价格怎么比?

计费形态不同,别硬折算单价。K3 按量计费:官方牌价每百万 token 输入未命中缓存 ¥20、命中 ¥2、输出 ¥100,思考 token 照输出价收,我们实测两本书各 20 轮共花 ¥12.21。qwen3.8-max-preview 不单卖,走 Token Plan 订阅(个人版限时 39 元/月起),preview 期 Credits 消耗按 1 折计、每晚 22 点到次日 8 点再叠 2 折,我们整轮实验没耗尽最低档订阅额度。一个按杯卖、一个自助餐,先看自己的用量形态再选。

在 Foreverse 里怎么让两个模型各用各的长处?

续写逐段可换模型。关键剧情交 K3,它的文风保真有 20 张票背书,代价是每轮半分钟的思考等待;日常推进、支线试写用订阅额度里的 qwen3.8 跑量。哪段写崩了就地换模型重写一段——剧情倒带和复读都是累积病,切一刀就断。两家都支持自带 key 接入,同一本书里混用是现成操作。

7 月 27 日 K3 开源权重之后会怎样?

月之暗面承诺 7 月 27 日前放出 2.8 万亿参数的全量权重。落地后第三方推理商可以竞价托管,价格和延迟大概率比官方 API 松动;但这个量级个人本地跑不现实,官方口径的推理配置就要几十张加速卡起步。qwen3.8 的开源只说了「soon」,没给日期。权重落地或 preview 转正,任一发生我们都按同协议复测并更新本页,以页首日期为准。

有想法或问题?来 Discord 聊聊 →

Qwen 3.8 对上 Kimi K3:三天内连发的两个万亿级模型,谁更会写小说?40 轮双盲 3:20 · Foreverse · 新梦