先别看模型名:三份《第七通来电》原文,哪一份你愿意追到第 20 轮?
公开 GPT-5.6 Terra medium、Luna high 与 Luna none 在同一原创题面上的真实续写:三份第1轮和三份第20轮完整原文,先匿名阅读再揭盲。文本未经润色,并与正式长篇盲评分数对照。
4.725 和 4.175 到底差在哪?只看分数,很难有手感。有人喜欢钩子密一点,有人更在意人物别突然换身份; 同一句“推进更强”,可能是证据终于扣上了,也可能只是又打开一扇门。
分数先放一边。这次把正式 32K 矩阵留下的六段整轮正文直接摆出来:同一篇原创都市悬疑《第七通来电》, 同一个 replicate,三个配置各取第 1 轮和第 20 轮。先读,心里排个序,再往下翻答案。
共同起点:一盘只能播放最后一次的母带
沈曼宁是深夜节目《午夜航线》的主播。母亲留下的《夜航船》磁带已经脆化,只能再播放一次;陆昭负责修带。 两人守完通宵节目,等烘带结束,在副控室把母带装上机器。
第 1 轮:同一台录音机,三种开法
样本甲 · 第 1 轮完整原文
样本乙 · 第 1 轮完整原文
样本丙 · 第 1 轮完整原文
第 20 轮:十九轮以后,谁还记得故事最初在问什么?
到这里,三条线已经不再拥有相同上下文。它们都由自己前十九轮的选择推到眼前这一幕。 读的时候可以只盯两件事:旧证据有没有回来;这一轮结束时,是解决了什么,还是只多出一个更大的谜。
样本甲 · 第 20 轮完整原文
样本乙 · 第 20 轮完整原文
样本丙 · 第 20 轮完整原文
揭盲:乙是 Terra,甲是 Luna high,丙是 Luna none
| 匿名样本 | 真实配置 | 本条链 · 第1/20轮字符 | 配置级五维均分 | early / mid / late |
|---|
| 乙 | GPT-5.6 Terra medium | night-call rep1 · 20/20 · 799/736字符 | 4.725 · 全场第1 | 4.850 / 4.775 / 4.550 |
| 甲 | GPT-5.6 Luna high | night-call rep1 · 20/20 · 645/677字符 | 4.175 · Luna第1 | 4.625 / 4.050 / 3.850 |
| 丙 | GPT-5.6 Luna none | night-call rep1 · 20/20 · 651/813字符 | 3.658 | 4.375 / 3.625 / 2.975 |
第 1 轮里,甲最像一集会立刻切广告的悬疑剧:警告、热线、灯塔在结尾同时扣上。丙也有强钩子, 只是更早把故事推向“电话另一端”和暗号系统。乙反而慢半步,它先确认母带被人用台内设备抹过, 再从半秒串音里留下“沈工、码头”两个可以查的词。
到第 20 轮,差距换了形状。甲仍能把钥匙、B-17、父亲的信接起来,但最后又去七码头找人; 丙把四十二名儿童、九岁陆昭、零号替身和全城收音机一口气推上台,画面很响,旧谜却被新身份覆盖。 乙没有追求更大的机关,它让木盒、两盘“小曼”磁带和周蓓的呼吸共同确认许曼是谁,最后一句仍落在一个孩子等妈妈的记忆上。
把 4.725 换成阅读感受,大概就是这样:高分不靠每段写得更华丽,靠的是新信息会回头改变旧人物的选择。Luna high 的优势也能直接看见—— 它比低档更会组织调查动作和局部危机;问题是写到后段仍容易用下一处地址、下一通声音继续续命。
为什么只放这三份,不把 548 轮全部贴上来?
因为“公开更多”不等于“更容易核对”。这三份来自同题、同 replicate,覆盖产品上真正会选的三档:低成本默认、 Luna 质量档、Terra 质量档;第 1 轮看同起点,第 20 轮看长程后果。全文倾倒会把页面变成无法阅读的语料仓, 也会让搜索页只剩重复人名和相似机关。
完整统计、另外一个原创题材和全部七档排名在548 次 Luna/Terra 正式长篇盲评; 要把 DeepSeek V4 Flash 一起放进价格、32K 与 Agent 选型,见DeepSeek、Luna、Terra 总对比; 两家中转与统一计费则在API、缓存、回退与价格实测。如果还想看其他模型长跑时 怎样从头复读、中途卡死或尾段回卷,中文续写实录馆里有另一组逐段标本。