GLM-5.2 写小说的完整档案:唯一双榜前三,和它绕不开的那个毛病
智谱 GLM-5.2 在我们两场双盲横评(890 万字传统玄幻 + 《甄嬛传》宫斗古言)里是唯一双榜都进前三的模型:玄幻场第 3、宫斗场 2-3,评语「限知观察质感最纯」。这页是它的完整成绩档案:两场名次与盲评评语原文、半角引号顽疾的跨书证据链、检测正则被它骗过的笑话,以及 GLM-5.5 传闻的如实口径——发布当天我们会复测更新本页。

搜「glm-5.2 写小说 怎么样」的人,现在能翻到的多是跑分截图和编程评测。我们手里有一份更对题的材料: GLM-5.2 在两场双盲续写横评里累计写了 40 轮小说,两本书、两种文体、两个互不知情的评审排名。 这一页把它的完整档案摊开:名次、评语原文、顽疾证据链、连它把我们检测脚本骗过去的那次笑话,全在这。 想直接上手接入的读者,Key 怎么建、host 怎么填、免费档怎么用,在工作流篇里;这页只管一件事:成绩单本身。
档案基本页
被测版本是 2026 年 6 月 13 日开源的 GLM-5.2(总参数 744B),我们在 7 月的两场横评里调用。测法: 同一段开头、同一套提示,每轮产物拼回固定 1.6 万 token 的上下文再写下一轮,连写 20 轮; 产物匿名成随机字母、做两套映射,交给两个互相不知道对方存在的评审独立排名。 两本书刻意选在文体光谱两端:一本 890 万字传统玄幻(短句、碎段、拟声词单独占行), 一本《后宫·甄嬛传》(第一人称限知、典雅书面语、称谓礼数严密)。
| 场次 | 名次 | 盲评评语(原文摘录) |
|---|---|---|
| 玄幻场(六模型) | 3 | 内容层贴近(战术商议、单字传讯都对味),但全程用半角引号写对话,表层观感直接出戏 |
| 宫斗场(九模型) | 2-3 | 「限知观察质感最纯」,但全程半角引号的毛病从玄幻场带到了宫斗场——这是它的固有生成习惯 |
这两行放一起才是重点,因为两场的冠军都各自偏科:玄幻第一的 DeepSeek V4 Flash 换到宫斗场跌到 6-7 名, 宫斗第一梯队的 V4 Pro 在玄幻场因为「笔更细」被扣分。九个模型里双榜都进前三的只有 GLM-5.2 一个。 原文的结论半句也照抄:「唯一两个文体都稳进前三的,代价是你要忍它的半角引号」。
正面页:「限知观察质感最纯」是什么水平
宫斗场的鉴别维度里最难的一项是第一人称限知视角纪律:叙述者「我」只能写自己看到猜到的, 机锋藏在观察里。九个系统在这一项上全线挣扎——Grok 4.5 的第一人称密度掉到原著一半, 大量段落漂成第三人称全知——而盲评审给 GLM-5.2 的评语是「限知观察质感最纯」。 玄幻场那条评语同样值得细读:「内容层贴近(战术商议、单字传讯都对味)」, 说明它抓的是这本书怎么推进剧情的骨架,不只是词汇表面。两场证据合起来, 它像个不挑文体的老实学生:不拿单科状元,每科都在前排。
顽疾页:半角引号,跨书复现
档案里最厚的一节。GLM-5.2 写中文对话习惯用半角引号,不用中文书惯用的全角引号或「」。 玄幻场 20 轮里出现 108 处;换书、换文体、换到宫斗场,原样复发。两场的盲评审在互不知情、 也看不到任何统计数字的情况下,都独立抓到了它,都按「表层观感出戏」扣了分。 中文网文全程半角引号,读者一眼就觉得不对。两本书都没自愈,所以我们叫它顽疾。
这个毛病还顺手骗过了我们的检测脚本:对话率正则只认全角引号,一度把它判成 20 轮零对话, 细看产物才发现真实对话率 13.5%。统计指标和人读各有盲区,这是我们坚持双轨评审的原因之一。
能治吗?两条缓解法,全按实话说。第一,提示词里显式加一句引号约束——值得一试, 但我们的横评用统一提示框架、没做过引号专项对照,效果不打包票。第二,绕开它: 对话密集的章节逐段换个模型写,或者对已生成的段落编辑重生原地换笔。 指望一句话根治一家模型的固有生成习惯,我们没有证据支持;完整的三层绕行流程在工作流篇里。
价签页
按 Z.ai 官方牌价(2026-07-18 核实): 输入每百万 token $1.4、输出 $4.4、缓存命中 $0.26。按一次续写输入 1 万 token、输出 800 token 估, 一段一毛钱上下;续写反复携带同一本书的前文,缓存命中的部分只按全价的零头计。 横向比一句:比宫斗第一梯队的 GPT-5.6 Terra(每百万输入 $2.5)便宜,比 DeepSeek 双档贵。 它比 DeepSeek 贵出来的部分,买的就是上一节那个双前三。
前瞻页:5.5 要来了?
先把口径钉死:智谱官方对 GLM-5.5 零官宣,没有日期、没有规格、没有价格。 目前唯一的时间线来自摩根大通 2026 年 6 月下旬的研报预测: 8 月发布,参数量可能突破万亿。投行预测不是事实,8 月也可能跳票,这两句我们写在明处。
但这份档案恰好给了「等 5.5」的人一个基准线:5.2 的双榜名次、两条评语、108 处半角引号, 全部有存档可对。GLM-5.5 发布当天,我们会用同一套双盲协议复测,把新旧两代的成绩单并排放在本页—— 引号修没修掉,会是我们第一个查的项目。以页首日期为准。
档案怎么用
如果你的书文体已经定型,去选型页按那张榜的第一名挑, 更划算;玄幻和宫斗两场的完整过程与评语全文,在玄幻横评和《甄嬛传》横评两篇里。 如果书还没定型、或者一本书里文武戏都有,GLM-5.2 是开局保险牌, 引号绕行靠逐段换模型解决。这套「按场景换笔」的玩法在Foreverse 的续写页里是现成的, 自带 key 接入,写崩了删段重来,原文一个字节不动。
常见问题
GLM-5.2 写小说怎么样?
有双盲实测名次可查:在我们两场横评(890 万字传统玄幻 + 《甄嬛传》宫斗古言,各连续续写 20 轮)里,它玄幻场第 3、宫斗场 2-3,是九个模型里唯一双榜都进前三的。玄幻场评语「内容层贴近(战术商议、单字传讯都对味)」,宫斗场评语「限知观察质感最纯」。代价是跨文体复现的半角引号顽疾,两本书都没改掉。
智谱的模型适合写哪类文?
数据支持的答案是「都不偏科,但都不是第一」。单一文体的峰值它拿不到:玄幻第一是 DeepSeek V4 Flash,宫斗第一梯队是 DeepSeek V4 Pro 和 GPT-5.6 Terra。它的独特位置是跨文体稳定:文体还没定型的书、文戏武戏都要的长跑,双前三是保险牌。宫斗场那条「限知观察质感最纯」的评语,也让它在第一人称限知视角的书里格外值得一试。
GLM 写中文小说的半角引号问题能修好吗?
我们没有证据支持「一句提示词根治」。这个习惯在玄幻场 20 轮里出现 108 处,宫斗场原样复发,两场盲评都按表层观感扣了分。可行的是绕行:提示词里显式加引号约束(值得一试但不打包票),或者对话密集的章节逐段换模型、对已生成段落编辑重生。哪天新版本修掉了,本页会随复测更新。
GLM-5.5 什么时候发布?会更强吗?
官方没有任何官宣。目前唯一的时间口径来自摩根大通 2026 年 6 月下旬的研报预测:8 月发布,参数量可能突破万亿。这属于投行预测而非事实,8 月也完全可能跳票。我们的承诺写在页面里:GLM-5.5 发布当天,用同一套双盲协议复测,更新本页的每一个名次。
有想法或问题?来 Discord 聊聊 →