DeepSeek V4 Flash、GPT-5.6 Luna 和 Terra 写小说怎么选?先把两张考卷放对位置

DeepSeek V4 Flash 0731 正式版与 GPT-5.6 Luna / Terra 的真实小说测试对表:官方输入、缓存与输出价格,32K 长篇完成度、首正文等待、450–700 字服从、reasoning 截断、Agent 工具和缓存。明确披露两批不是同场盲评:Terra medium 是 Luna/Terra 正式矩阵第一,DeepSeek none 最便宜,但不能把不同考卷硬排成总冠军。

三份写作考卷并排摊开,分别标注 DeepSeek V4 Flash、GPT-5.6 Luna 与 GPT-5.6 Terra

把三篇报告分开看,答案像是在互相打架:Terra medium 拿了 Luna/Terra 正式盲评第一,DeepSeek V4 Flash 便宜得多,Luna high 又是 Luna 内最实用的质量档。问题不在分数不够多,而在两套考卷不能混成一张总榜。

下面只对齐 2026 年 7 月 31 日已经完成的两批真实 API 实验,不补造样本,也不把接口成功率当小说质量。 DeepSeek 流量直连官方端点;Luna/Terra 正式长篇走 Requesty Responses。两边都测了 32K、连续续写、 reasoning、缓存和 Agent,但题材、链数与评审表不同。

两张考卷哪些能比,哪些不能比?

项目DeepSeek V4 Flash 0731GPT-5.6 Luna / Terra能否直接排同榜
正式路径DeepSeek 官方 Chat / ResponsesRequesty Responses;协议另有双中转生产验证只能比较已观察行为
长篇规模旧考卷 20 轮单链;原创每档 12 轮单链28 条计划链、最多 20 轮;548 次完整正文不能比较成功率
32Khigh/max 各 12/12;复杂 max 写卡仍归零548 次完整调用都有正文;5 次流未完成可以比较截断边界
长度要求原创链要求 450–700 字两个原创题材同样要求 450–700 字可看服从,但题材不同
质量评审high/max 匿名 A/B;max 两票小胜两个隔离模型会话、五维 84 行评分不能换算分数
Agentauto 两步闭环;required + max 返回 400Luna/Terra 两条中转均完成两步工具链可以比较参数边界
缓存读命中;write tokens 为 null两中转读命中;write tokens 为 null结论一致

价格先放同一把尺:DeepSeek 最便宜,Terra 最贵

下表是 2026-07-31 的官方短档美元价,以及 Foreverse 统一加价 50% 后的 credits。1 credit = $0.0001。DeepSeek 没有单列缓存写入价;Luna/Terra 只有在上游返回cache_write_tokens 时才按写入档结算,字段为 null 时保持未知。

模型官方输入未命中 $/M官方缓存读 $/M官方缓存写 $/M官方输出 $/MApp +50% credits/M:输入 / 读 / 写 / 输出
DeepSeek V4 Flash$0.14$0.0028未单列$0.282100 / 42 / — / 4200
GPT-5.6 Luna$0.20$0.02$0.25$1.203000 / 300 / 3750 / 18000
GPT-5.6 Terra$2.00$0.20$2.50$12.0030000 / 3000 / 37500 / 180000

Luna 的未缓存输入价约为 DeepSeek 的 1.43 倍、缓存读取价约为 7.14 倍、输出价约为 4.29 倍; Terra 的输出价约为 DeepSeek 的 42.86 倍。统一加价不会改变这些倍率。价格来源分别是DeepSeek 官方价目OpenAI 官方价目

真实长篇现场:把总成本除以各自完成轮数,但别假装输入相同

为了避免拿 12 次总价和 80 次总价硬比,下面展示每个已完成轮次的观察均价。DeepSeek 行先按官方成本乘 1.5,再除以完成轮数,尚未叠加每请求向上取整;Luna/Terra 直接使用正式矩阵的逐笔统一用户价。 这仍不是严格价格基准,因为故事、输入长度和缓存命中率不同。

配置与包络正文完成450–700 字首正文中位观察均价 / 完整轮质量证据
DeepSeek none · 8K12/120/120.75s约 $0.000580未做三家同场评分
DeepSeek low · 8K12/120/127.06s约 $0.000931本链未见相对 none 的可见增益
DeepSeek high · 32K12/123/1289.5s约 $0.003440匿名 A/B 负于 max
DeepSeek max · 32K12/122/1243.5s约 $0.003198匿名 A/B 两票小胜 high
Luna none · 32K80/8021/802.256s$0.006008五维均分 3.658
Luna high · 32K77/7832/7716.420s$0.008469五维均分 4.175;Luna 第一
Luna max · 32K80/8027/8014.652s$0.008514五维均分 3.950
Terra medium · 32K78/7934/783.429s$0.057617五维均分 4.725;该场第一

如果先看钱包,DeepSeek none 没有悬念。Luna 内部则只有 high 真正拉开了质量差距;Terra medium 贵得多,也拿到了它所在矩阵里最强、最稳的质量证据。到这里为止都能从表里直接读出来。表里读不出来的是 “DeepSeek 便宜所以一定写得差”,更读不出“Terra 的 4.725 已经同场击败 DeepSeek”。

32K 的差别:三家都受益,DeepSeek max 的复杂任务风险更显眼

旧 8K 下,DeepSeek high 首轮用了 8191 个 reasoning tokens 后正文为 0;Luna 的旧筛选也出现过 8192 输出全部进 reasoning。放到 32K 后,DeepSeek high/max 两条普通长篇均跑满 12 轮,Luna/Terra 的 548 次完整调用也全部有正文。这说明把大窗口模型统一压在 8K 确实过死。

但复杂任务揭示了差异:DeepSeek high 的四题材卡虽然完成,首正文等了 236 秒并用了 27099 reasoning; max 则等 293.9 秒,把 32767 tokens 全部耗在 reasoning,正文仍为 0。Luna/Terra 本轮没有同规模、 同评分的正式写卡对照,所以不能宣布它们写卡更强;能确定的是,生产端仍要识别incomplete/length + 正文 0,不能把 32K 当保证书。

Agent 与缓存:都能用,但不能共用一套强制参数

能力DeepSeek V4 FlashLuna / TerraApp 路由建议
流式文本官方 Chat、Responses 均完成Inroi Chat、Requesty Responses 均完成客户端保持统一 Chat SSE
工具第一步Responses auto 返回 function call两条中转均返回工具调用后端按上游协议转换
工具结果回传第二步 200,答案正确两款模型、两条路均闭环只结算一次最终 usage
强制工具thinking=max + required 返回 400命名工具选择经转换后可用DeepSeek thinking 使用 auto + 明确提示
缓存读取工具第二步命中 512;内容链也有命中两家中转均观察到命中只按权威 cached tokens 计价
缓存写入cache_write_tokens=nullcache_write_tokens=null保持未知,不猜 0

按你正在写的那一段来选

最低成本草稿与高频试写:DeepSeek none。它在独立链里首正文 0.75 秒,价格最低, 但长度服从 0/12,App 需要更强的终止与长度控制。

普通逐段续写:Luna none/low 或 DeepSeek none。偏预算选 DeepSeek,偏向更大规模的 正式长篇证据选 Luna;两边都不该把高 effort 设成全局默认。

重要章节的质量升级:Luna high。它是 Luna 六档中唯一明确拉开质量的档位,首正文中位 16.420 秒;xhigh/max 没有继续涨分。

预算允许、追求现有最强质量证据:Terra medium。它在两题材、四计划链的正式矩阵中 以 4.725 第一,但这句话的边界是“现有最强证据”,不是“已经同场战胜 DeepSeek”。

如果要回答真正的三家冠军,只能开一份新考卷:相同原创题材、相同上下文、相同 32K、相同轮数、相同盲包, 再让 DeepSeek none/low、Luna high 与 Terra medium 同场。在那之前,可以据此定价格、工程风险和 App 默认值;三家质量总榜先空着,比硬凑一个冠军诚实。

原始结论可分别回看Luna / Terra 第 1 轮与第 20 轮完整原文盲读DeepSeek V4 Flash 0731 正式版实测Luna/Terra 548 次正式盲评Luna/Terra API、缓存与统一价格。要从九个模型、两种文体 的总入口开始看,回到AI 续写小说模型选型页

常见问题

DeepSeek V4 Flash、Luna 和 Terra,谁写小说最好?

目前不能给三家同场总冠军,因为 DeepSeek 与 Luna/Terra 没有跑同一批题材、同一盲包和同一评分表。现有最强质量证据是:Luna/Terra 的 548 次正式矩阵中 Terra medium 以 4.725/5 第一,Luna high 以 4.175/5 第二;DeepSeek 的独立 32K 原创链里,两位匿名评审都判 max 小胜 high,但这组票不能换算进前一张榜。

DeepSeek V4 Flash 真的比 Luna 便宜吗?

按 2026-07-31 官方短档,DeepSeek 缓存未命中输入/缓存命中/输出分别为 $0.14/$0.0028/$0.28 每百万 token,Luna 为 $0.20/$0.02/$1.20。也就是 Luna 输出价约为 DeepSeek 的 4.29 倍,缓存读取价约为 7.14 倍。Foreverse 对两者统一加价 50%,倍率关系不变。

哪个适合普通逐段续写?

预算最优先可从 DeepSeek none 开始;它在独立 12 轮链里最快、最便宜,但 450–700 字服从为 0/12,需要更强的长度约束。想要规模更大的质量证据与较稳定的等待,Luna none/low 更适合日常;重要章节按次升 Luna high。预算允许并追求本轮最高质量证据时选 Terra medium。

三款模型给到 32K 就不会再空正文了吗?

不会。Luna/Terra 正式矩阵的 548 次完整调用都有正文,说明 32K 消除了旧 8K 下 reasoning 先吃满的主要截断;DeepSeek 的 high/max 32K 长篇也各完成 12/12。但 DeepSeek max 的复杂四卡任务仍出现 32767 tokens 全是 reasoning、正文为 0。32K 是风险缓解,不是能力保证。

DeepSeek、Luna、Terra 的 Agent 工具都能用吗?

能,但边界不同。DeepSeek Responses 在 tool_choice=auto 下完成两步工具闭环,thinking=max 加 required 则真实返回 400;Luna/Terra 经 Foreverse 的 Chat 接口和后端 Responses 转换,两个中转都完成了工具调用与工具结果回传。生产路由不能把所有模型都机械强制成 required。

有想法或问题?来 Discord 聊聊 →