GPT-5.6 Luna 六档思考强度对上 Terra Medium,长篇续写谁赢?
GPT-5.6 Luna none/low/medium/high/xhigh/max 与 Terra medium 的 32K 长篇续写正式矩阵:560 个计划轮次、548 次完整正文、5 次 incomplete_stream,两场中文小说各跑两条 20 轮链。两个隔离的模型评审会话独立盲评,Terra medium 以 4.725/5 第一,Luna high 是 Luna 内部最佳。附质量、成本、首正文速度、链完整度与 450–700 字服从率。

先给结论:同一套 32K 输出包络、同样的两个中文题材、同样连续写 20 轮,Terra medium 是全场第一,Luna high 是 Luna 内部第一。 Luna xhigh 和 max 没有继续涨质量,反而付出了更长等待、更高推理量或更差的链完整度; 普通逐段续写,none / low 才是更实际的默认档。
这次不是拿七段开场做一眼印象流。七个配置各自面对两篇原创小说,每篇跑两个 replicate, 每条链最多连续 20 轮,计划总量 560 轮。正文写回下一轮上下文,模型必须接住自己前面留下的人物、 物件和伏笔。最终发出 553 次请求,548 次完整返回且都有正文,另有 5 次incomplete_stream。
考场怎么搭:七个配置、两种题材、每条链 20 轮
参赛配置是 Luna 的 none、low、medium、high、xhigh、max,再加 Terra medium。 两个 fixture 分别是古风奇诡探案《长夜提灯》和现代情感悬疑《第七通来电》; 每个配置、每个题材各跑两个 replicate,每条链 20 轮,因此是7 × 2 × 2 × 20 = 560 个计划槽位。
所有正式样本走同一条 Requesty Responses 路径,最大输出包络为 32,768 tokens。 “32K”说的是本轮输出上限,不是每次固定生成 32K,也不是把输入上下文误写成 32K。 reasoning 与可见正文共用输出额度;此前 8K 筛选里出现过 reasoning 吃满、正文为空, 这轮 548 次完整调用都产生了正文。不过,输出包络变大只能排除那一种空正文原因,不能自动证明接口长期稳定。
盲评者不是人:两个隔离的模型会话先冻结,再揭盲
这里的“双盲”容易被误读,所以把身份写在前面:两个评委都是模型评审会话,不是真人。 两个会话彼此隔离,也不是两个不同厂商模型;它们分别收到不同的匿名标签映射,评分时不知道 Luna、Terra 和 effort 身份,也不知道另一边的判断。两份分数在 2026 年 7 月 31 日晚冻结后,才读取映射揭盲。
每条链抽取 early、mid、late 三个窗口,分别评“接续连贯、人物/事实稳定、文风贴合、情节推进、 自我复读控制”五项,每项 1–5 分。主分是两个评委、四条计划链、三个窗口、五项维度的等权均值; 完整度和字数服从不拿来给质量加分。两个评委在 28 条链上的 Pearson 相关为0.868,Spearman 排名相关为 0.853,链均分平均绝对差 0.336。 两边对前两名一致,第三到第七的细小差距要保守看。
总排名:Terra Medium 第一,Luna High 第二
| 排名 | 配置 | 五维质量均分 | 评委 A | 评委 B | 一句话判断 |
|---|---|---|---|---|---|
| 1 | Terra medium | 4.725 / 5 | 4.817 | 4.633 | 两个题材和四条链都稳,全场明确第一 |
| 2 | Luna high | 4.175 / 5 | 4.417 | 3.933 | Luna 内部最佳,质量提升伴随明显等待 |
| 3 | Luna xhigh | 3.975 / 5 | 4.217 | 3.733 | 与 max 近似并列,Luna 内等待与推理代价最高 |
| 4 | Luna max | 3.950 / 5 | 4.000 | 3.900 | 跑满全部链,但质量没有超过 high |
| 5 | Luna none | 3.658 / 5 | 3.767 | 3.550 | 低档里质量略高,适合普通续写 |
| 6 | Luna low | 3.600 / 5 | 3.733 | 3.467 | 低档里稍快、稍便宜,适合普通续写 |
| 7 | Luna medium | 3.592 / 5 | 3.617 | 3.567 | 本轮没有显示出相对 none / low 的增益 |
Terra medium 的优势不是靠某一个题材抬起来:古风与现代两题材分别为 4.717、4.733, 四条链都排进全场前四。它从 early 的 4.850 降到 late 的 4.550,只掉 0.300; Luna high 从 4.625 降到 3.850,掉 0.775;三个低档的 late 均分只剩 2.975–3.100。 长篇里真正拉开差距的是后程能不能停止新增“下一扇门、下一层身份、下一套机关”,并把已经写出的冲突收回来。
Luna high 的第二名也很清楚。它比 xhigh 高 0.200,比 max 高 0.225;而 xhigh 与 max 只差 0.025,已经小到不该包装成档位胜负。换句话说,思考强度并不是越高越会写小说: high 在本轮找到了推理和正文之间较好的平衡,再往上主要增加了等待与 reasoning,而不是可见质量。
成本、速度、完成度和长度服从,要和质量分开看
下表的“首正文中位”只统计完整调用,并用偶数样本两个中间值的平均;“20 轮完整链”表示同一配置、 题材和 replicate 从第 1 轮一直完整跑到第 20 轮;“长度服从”只回答每轮是否落在要求的 450–700 个中文字符内,不代表文风或剧情质量。美元数是逐条按 Foreverse 统一用户价重算的本轮用量, 不是 Requesty 最终账单。
| 配置 | 完整正文 / 发出 | 20 轮完整链 | 450–700 字 | 首正文中位 | 统一价重算 |
|---|---|---|---|---|---|
| Luna none | 80 / 80 | 4 / 4 | 21 / 80 · 26.25% | 2.256 秒 | $0.4806 |
| Luna low | 80 / 80 | 4 / 4 | 17 / 80 · 21.25% | 2.132 秒 | $0.4723 |
| Luna medium | 80 / 80 | 4 / 4 | 16 / 80 · 20.00% | 3.255 秒 | $0.4919 |
| Luna high | 77 / 78 | 3 / 4 | 32 / 77 · 41.56% | 16.420 秒 | $0.6521 |
| Luna xhigh | 73 / 76 | 1 / 4 | 24 / 73 · 32.88% | 56.049 秒 | $1.1782 |
| Luna max | 80 / 80 | 4 / 4 | 27 / 80 · 33.75% | 14.652 秒 | $0.6811 |
| Terra medium | 78 / 79 | 3 / 4 | 34 / 78 · 43.59% | 3.429 秒 | $4.4941 |
| 合计 | 548 / 553 | 23 / 28 | 171 / 548 · 31.20% | 4.217 秒 | $8.4503 |
Terra medium 和 Luna medium 是最干净的同 effort 对照:Terra 质量高 1.133 分,首正文只慢约 0.174 秒, 但统一价约为 9.14 倍。它值得的是质量,不是性价比。Luna none 与 low 则四条链全部跑满, 首正文约 2.1–2.3 秒、总成本都不到 0.49 美元;两者质量差只有 0.058,普通续写没有必要为这个小差距纠结。
high 适合“这一段我更在意”的按需升级:它是 Luna 质量最高,但首正文中位升到 16.420 秒。 xhigh 用掉 421,227 个 reasoning tokens,首正文中位 56.049 秒,只跑满 1/4 条链;max 用掉 120,270 个 reasoning tokens,虽然 4/4 链完整,质量仍略低于只用了 116,066 reasoning tokens 的 high。 因此 xhigh / max 不适合常规长篇默认,不等于它们在所有任务里都无用。
固定摘要漏了一句艺名关系:冻结原分,再做敏感性检查
盲评材料本身有一个必须公开的缺陷。《第七通来电》原文写明:母亲叫沈韵秋,“叶航”是她的播音艺名。盲包固定摘要却只写了“母亲叶航”,漏掉两名属于同一人的关系。 评委 B 因此把多条正文继续使用“沈韵秋”误判成姓名漂移,现代题材的“人物/事实稳定”绝对分被压低。
原评分已经冻结,不能看完答案再改卷。我们保留五维原榜,同时统一删除所有样本的“事实”维度, 用剩下四维重算敏感性排名:
| 配置 | 原五维排名 / 分数 | 去掉事实维度后排名 / 分数 |
|---|---|---|
| Terra medium | 1 · 4.725 | 1 · 4.792 |
| Luna high | 2 · 4.175 | 2 · 4.177 |
| Luna xhigh | 3 · 3.975 | 4 · 3.969 |
| Luna max | 4 · 3.950 | 3 · 4.052 |
| Luna none | 5 · 3.658 | 5 · 3.719 |
| Luna low | 6 · 3.600 | 6 · 3.677 |
| Luna medium | 7 · 3.592 | 7 · 3.646 |
核心结论没有变:Terra medium 仍第一,Luna high 仍是 Luna 最佳;只有本就近似并列的 xhigh / max 互换。下次复跑应把摘要写成“母亲沈韵秋(播音艺名叶航)”,但不能拿修正后的摘要回头重评本批, 再假装它仍是同一次盲评。
把分数换成实际用法
如果你每次只续一小段、希望快、便宜、四条链都能跑完,Luna none / low 是默认答案:none 本轮质量略高,low 稍快、稍便宜。Luna medium 没有显示出相对这两档的明确收益。
如果某个章节值得多等十几秒,Luna high 是 Luna 的质量档;如果预算允许,而且你要本轮最高的跨题材长篇质量, Terra medium 是第一。xhigh / max 在这张长篇考卷上没有换来相称的质量增益,不推荐常规开启。
边界也要一起带走:这是两个中文原创题材、两个 replicate、Requesty Responses 单一路径上的一次正式矩阵; 模型评委的一致性不是人类偏好,5 次断流不是长期 API SLA,450–700 字命中率也不等于“会不会写”。 想跳过分数直接读三份同题正文,见Luna / Terra 第 1 轮与第 20 轮原文盲读; 要把本轮与 DeepSeek V4 Flash 0731 的官方直连测试放在同一张选型表里,见DeepSeek、Luna、Terra 价格与长篇对比; 想看同一批模型的协议、缓存与统一计费现场,可继续读Luna / Terra 中转 API 实测; 想理解长篇为什么必须连续跑二十轮,见AI 续写模型长跑选型。
常见问题
GPT-5.6 Luna 和 Terra,哪个更适合写小说?
这轮 32K 长篇矩阵里,Terra medium 的双盲五维质量均分为 4.725/5,排第一;Luna 内部最好的是 high,4.175/5。预算允许、正文质量优先时选 Terra medium;普通逐段续写优先 Luna none 或 low;需要临时提高质量时再升 high。这个结论只覆盖本轮两个中文题材,不能外推到所有语言与写作任务。
这里的盲评是人工盲评吗?
不是。评委是两个相互隔离的模型评审会话,不是真人,也不是两个不同厂商的模型。两边分别看到不同匿名映射,在揭盲前独立冻结评分;28 条链均分的 Pearson 相关为 0.868,Spearman 排名相关为 0.853。这个一致性可以支撑本轮相对排序,但不能替代真人读者研究。
Luna xhigh 或 max 会比 high 写得更好吗?
本轮没有。Luna high 得 4.175,xhigh 为 3.975,max 为 3.950。xhigh 首正文中位要 56.049 秒,只跑满 1/4 条 20 轮链;max 虽跑满 4/4 条链,但质量没有超过 high,成本与推理量也更高。两档都不推荐作为常规长篇默认值。
这轮评测的 $8.4503 是实际 API 账单吗?
不是最终上游账单。$8.4503 是 548 次完整、带 usage 的调用按 Foreverse 统一用户价逐笔重算后的合计。5 次 incomplete_stream 没有终局 usage,可能是否已产生上游费用未知,因此不能并入这个数字,也不能断言免费。
548 次完整正文和 5 次 incomplete_stream 能说明 API 稳定性吗?
不能当长期 API 稳定率或 SLA。矩阵计划 560 个槽位,实际发出 553 次;548 次收到完整终局帧且都有非空正文,5 次 HTTP 200 后在终局前断流,并让后续 7 个槽位停止发送。这只是一次受控 Requesty Responses 长篇运行的完成度现场,无法把断流单独归因给模型、网络或中转。
有想法或问题?来 Discord 聊聊 →