先别看模型名:三份《第七通来电》原文,哪一份你愿意追到第 20 轮?

公开 GPT-5.6 Terra medium、Luna high 与 Luna none 在同一原创题面上的真实续写:三份第1轮和三份第20轮完整原文,先匿名阅读再揭盲。文本未经润色,并与正式长篇盲评分数对照。

三份匿名小说手稿摊在旧木桌上,页角分别写着甲、乙、丙,最下面压着一张尚未翻开的揭盲卡

4.725 和 4.175 到底差在哪?只看分数,很难有手感。有人喜欢钩子密一点,有人更在意人物别突然换身份; 同一句“推进更强”,可能是证据终于扣上了,也可能只是又打开一扇门。

分数先放一边。这次把正式 32K 矩阵留下的六段整轮正文直接摆出来:同一篇原创都市悬疑《第七通来电》, 同一个 replicate,三个配置各取第 1 轮和第 20 轮。先读,心里排个序,再往下翻答案。

共同起点:一盘只能播放最后一次的母带

沈曼宁是深夜节目《午夜航线》的主播。母亲留下的《夜航船》磁带已经脆化,只能再播放一次;陆昭负责修带。 两人守完通宵节目,等烘带结束,在副控室把母带装上机器。

第 1 轮:同一台录音机,三种开法

样本甲 · 第 1 轮完整原文

样本乙 · 第 1 轮完整原文

样本丙 · 第 1 轮完整原文

第 20 轮:十九轮以后,谁还记得故事最初在问什么?

到这里,三条线已经不再拥有相同上下文。它们都由自己前十九轮的选择推到眼前这一幕。 读的时候可以只盯两件事:旧证据有没有回来;这一轮结束时,是解决了什么,还是只多出一个更大的谜。

样本甲 · 第 20 轮完整原文

样本乙 · 第 20 轮完整原文

样本丙 · 第 20 轮完整原文

揭盲:乙是 Terra,甲是 Luna high,丙是 Luna none

匿名样本真实配置本条链 · 第1/20轮字符配置级五维均分early / mid / late
GPT-5.6 Terra mediumnight-call rep1 · 20/20 · 799/736字符4.725 · 全场第14.850 / 4.775 / 4.550
GPT-5.6 Luna highnight-call rep1 · 20/20 · 645/677字符4.175 · Luna第14.625 / 4.050 / 3.850
GPT-5.6 Luna nonenight-call rep1 · 20/20 · 651/813字符3.6584.375 / 3.625 / 2.975

第 1 轮里,甲最像一集会立刻切广告的悬疑剧:警告、热线、灯塔在结尾同时扣上。丙也有强钩子, 只是更早把故事推向“电话另一端”和暗号系统。乙反而慢半步,它先确认母带被人用台内设备抹过, 再从半秒串音里留下“沈工、码头”两个可以查的词。

到第 20 轮,差距换了形状。甲仍能把钥匙、B-17、父亲的信接起来,但最后又去七码头找人; 丙把四十二名儿童、九岁陆昭、零号替身和全城收音机一口气推上台,画面很响,旧谜却被新身份覆盖。 乙没有追求更大的机关,它让木盒、两盘“小曼”磁带和周蓓的呼吸共同确认许曼是谁,最后一句仍落在一个孩子等妈妈的记忆上。

把 4.725 换成阅读感受,大概就是这样:高分不靠每段写得更华丽,靠的是新信息会回头改变旧人物的选择。Luna high 的优势也能直接看见—— 它比低档更会组织调查动作和局部危机;问题是写到后段仍容易用下一处地址、下一通声音继续续命。

为什么只放这三份,不把 548 轮全部贴上来?

因为“公开更多”不等于“更容易核对”。这三份来自同题、同 replicate,覆盖产品上真正会选的三档:低成本默认、 Luna 质量档、Terra 质量档;第 1 轮看同起点,第 20 轮看长程后果。全文倾倒会把页面变成无法阅读的语料仓, 也会让搜索页只剩重复人名和相似机关。

完整统计、另外一个原创题材和全部七档排名在548 次 Luna/Terra 正式长篇盲评; 要把 DeepSeek V4 Flash 一起放进价格、32K 与 Agent 选型,见DeepSeek、Luna、Terra 总对比; 两家中转与统一计费则在API、缓存、回退与价格实测。如果还想看其他模型长跑时 怎样从头复读、中途卡死或尾段回卷,中文续写实录馆里有另一组逐段标本。

常见问题

这些是模型原文,还是编辑挑句后重写的?

六段均来自公开脱敏记录中的整轮可见正文,保留原标点、段落和措辞;没有人工润色或跨轮拼句,也不公开隐藏 reasoning、认证信息和运营标识。

三个样本真的面对同一个开头吗?

第1轮的题面、种子尾部、续写要求和32K包络相同。第20轮会带入各自前19轮正文,比较的是模型能否承担自己写下的后果,不能再当作相同 prompt 的单轮横评。

揭盲结果是什么?

甲是 Luna high,乙是 Terra medium,丙是 Luna none。配置级五维均分依次为4.175、4.725、3.658;三条 night-call replicate 1 链均跑满20轮。

为什么这里没有 DeepSeek V4 Flash?

DeepSeek 0731 使用另一份题面和12轮评分规程,放在这里会被误读成同题。三款模型的价格、32K、Agent与缓存另见总对比页;三家同题原文仍需新实验。

有想法或问题?来 Discord 聊聊 →