GPT-5.6 对 Kimi:同一张考卷上的两种性格

GPT-5.6 Terra 和 Kimi K2.6 在两场双盲横评里各连续续写 40 轮的完整对照:Terra 是纹理模仿天花板、宫斗场全程零事故,但玄幻场第 18 到 20 轮把剧情倒回起点、复用自己第 2 轮的句子;Kimi 玄幻场第 7、比喻密度全场最高,宫斗场却是唯一越写越好的系统。文末如实交代时效边界:7 月 16 日上线的 Kimi K3 没进过考场,不编排名。

两张书桌隔着窄缝相对:左桌手稿纸页齐整如印刷,右桌手稿涂改凌乱、散页滑出桌沿,一支墨笔正好搁在两桌之间

先看两个瞬间。玄幻场第 18 轮,GPT-5.6 Terra 把写了十七轮的剧情整体倒回续写起点, 开始重演第一章,句子还是自己第 2 轮用过的;而此前十七轮,它是两个盲评审公认全场最贴近原著的仿写者。 另一边,宫斗场第 1 轮,Kimi K2.6 开局是一嗓子网文暴怒腔,和《甄嬛传》的典雅语体完全不搭; 写到后段,它成了九个系统里唯一被评审记下「越写越收敛」的那个。

短答案:写宫斗古言这类讲究措辞的书,选 GPT-5.6 Terra,第一梯队稳;写快节奏玄幻,两个都不是首选, Terra 名次更高但隐患在尾段,Kimi 排第七、病在比喻和自我复制。数据来自我们两场双盲横评, 这两个模型各自连续续写了 40 轮。下面把它们当成两种性格拆开讲。

两张榜上,它们各自站在哪?

玄幻场是一本 890 万字的传统玄幻,九个模型同书同起点同提示;宫斗场是《后宫·甄嬛传》,同样九个模型。 每个模型从固定位置连续续写 20 轮,每轮产物拼回上下文再写下一轮;产物匿名成随机字母、做两套映射, 交给两个互不知情的评审独立排名。名次区间照录评审分歧,不做人为收窄。

考场GPT-5.6 TerraKimi K2.6
传统玄幻(890 万字)2-4(名次取决于崩盘惩罚权重)7(两套映射完全一致)
宫斗古言(甄嬛传)1-3(全程零事故)5-7(唯一显著逆向改善)

完整九模型名次、评语全文和方法细节在玄幻横评《甄嬛传》横评两篇里,本页只对照这两家。

GPT-5.6 Terra:模仿最像,也最会突然失忆

先说天花板的一面。玄幻场的前中段,两个盲评审判它是全场最贴近原著的产物, 而且是九个系统里唯一复刻了原著微观排版习惯的:波浪号拟声(「轰隆隆~~~」「哈哈~~」)、 口语里拿「的」代「地」的用法、反派的语气腔调。这不是选词层面的像,是排版肌肉层面的像。

然后是第 18 到 20 轮。它把剧情整体倒回续写起点、重演第一章,甚至复用了自己第 2 轮的句子。 文字纹理依然完美,故事却对折了回去。这种病我们叫「尾段回卷」,全部 360 轮实验里它只砸中了一个模型, 恰好是纹理模仿最好的这个。表面像与剧情连贯是两种独立能力,Terra 是这句话最锋利的证据。

换到宫斗场,同一个模型跑出了全场唯一的零事故记录:零格式错误、零称谓错误、零设定事故, 物证链写法(针脚、香料新陈、设局钓人)被评审记为最贴原著,名次区间 1-3,没有回卷。 四十轮看下来,Terra 的性格是全程体面、偶发失忆:多数时候它是考场里坐姿最标准的学生, 但玄幻那场,它在交卷前把答题卡擦掉、重新填了一遍第一题。

Kimi K2.6:开局最吵,越写越稳

Kimi 的曲线和 Terra 反着走。宫斗场它开局是网文暴怒腔,跟原著第一人称限知视角的绵密文风隔着一个次元; 写到后段收敛回宫斗正轨,评语原文是「唯一显著逆向改善的系统」,名次 5-7。 二十轮长跑里多数模型越写越松,它是少数越写越紧的。

玄幻场暴露的是另一面。双盲共识记了它两笔:比喻密度全场最高,几乎每段一喻, 而这本原著是每千字才 1 次比喻的直给文风;以及 early 到 mid 段出现整段自我复制, 整段照抄自己前几轮的产物。后者是「中途卡死」的轻症版,重症版在 Grok 4.5 身上, 完整分类学写在选型页的失效模式一节。 玄幻名次第 7,两套映射完全一致,没什么争议。

所以 Kimi 的性格是肌肉记忆重、后程会自我修正:它带着一套网文腔的出厂本能上考场, 撞上不对付的文体先摔一跤,然后靠上下文里越积越多的正确示范把自己拽回来。 评它的时候别只看头三轮。

所以写小说到底选哪个?

按场景,不选边站。读古言、慢节奏、措辞讲究的书,Terra 是这两家里唯一进过第一梯队的,直接用; 读快节奏玄幻,先说实话,这两家都不是冠军(冠军是 DeepSeek V4 Flash,账在选型页), 非要二选一则 Terra 名次更高,但连续续写到十几轮之后要回头翻翻最新剧情有没有倒带, 发现回卷就重写那一段,循环立刻打断。选 Kimi 就给它热身的空间,它的强项在中后程。

比「选谁」更值钱的结论是「别锁死」。回卷和自我复制都是累积病,一次生成的 demo 永远看不出来; 逐段换模型的阅读器里,这两种性格可以在同一本书里互补,文戏 Terra、想换口味切走,成本是零。

你现在买到的 Kimi,已经不是考场里那只

时效边界必须写明:我们测的是 Kimi K2.6。2026 年 7 月 16 日,月之暗面上线了 Kimi K3, 1M token 上下文、原生视觉,按官方定价页(2026 年 7 月 18 日核实), 中国区每百万 token 输入 20 元、缓存命中 2 元、输出 100 元,整个窗口平价不分档, 当前只提供 max 思考档。K3 没有进过我们的考场:上面所有名次、评语、失效模式都来自 K2.6, 一条都不能迁移到 K3 头上。规格更大不等于文风更贴,这两件事在我们的数据里从来不同向。

GPT-5.6 侧同样交代口径:GPT-5.6 家族于 2026 年 7 月 9 日正式开放,分 Sol、Terra、Luna 三档, 我们测的是 Terra,OpenAI 官方公告标价每百万 token 输入 $2.50、输出 $15。 Sol 更贵、Luna 更便宜,都没进考场,不排名。

下一次复测会把 K3 拉进同一个考场跑满 20 轮,两本书都跑。到时候这页的名次表会更新,以页首日期为准; 在那之前,任何「K3 写小说吊打 XX」的说法都还没有考卷可查。

常见问题

GPT-5.6 写小说怎么样?

分文体。在我们的双盲横评里,GPT-5.6 Terra 续写宫斗古言排第一梯队(名次区间 1-3),评语是「全程零事故」:零格式错误、零称谓错误、零设定事故;续写传统玄幻时它的前中段被两个评审判为全场最贴近原著,但第 18 到 20 轮把剧情整体倒回续写起点、复用了自己第 2 轮的句子,名次区间 2-4。注意我们只测了 Terra 这一档,Sol 和 Luna 没进考场,不给排名。

Kimi 写文到底行不行?

看你给它多长的跑道。Kimi K2.6 在玄幻场排第 7(两套盲评映射完全一致),双盲共识记了它比喻密度全场最高、early 到 mid 段整段自我复制;宫斗场名次 5-7,但评语是「唯一显著逆向改善的系统:开局是网文暴怒腔,越写越收敛回宫斗正轨」。头三轮的表现不能代表它的长跑水平,方向是越写越好。

Kimi K3 会比 K2.6 写得好吗?

不知道,我们不猜。K3 于 2026 年 7 月 16 日上线,1M token 上下文、中国区每百万 token 输入 20 元(缓存命中 2 元)、输出 100 元,规格和价格都上了新台阶,但它没进过我们的考场,本页所有名次和评语都只属于 K2.6。我们的数据里规格、价格与文风贴近度从来不同向:玄幻场冠军是全场最便宜的档位之一。等复测,页首日期为准。

这两个模型能在同一本书里换着用吗?

能,而且这正是对冲长跑失效的打法。回卷、复读这类病都是累积的,连续写十几轮才发作,中途换模型或重写一段就能打断循环。在 Foreverse 里续写逐段可换模型,GPT-5.6 和 Kimi 都能自带 key 接入:文戏用 Terra,写崩了或想换口味时切走,比赌一个「全能模型」现实。

有想法或问题?来 Discord 聊聊 →

GPT-5.6 和 Kimi 哪个写小说好?同场 80 轮续写实测,两种截然相反的性格 · Foreverse · 新梦