DeepSeek V4 Flash 正式版上线当天,我们让 App Agent 在一部 385 章长篇里自主挑场面改写
DeepSeek V4 Flash 正式版 API 上线公测当天,用同一本 385 章都市长篇、同一句用户话术,在 Foreverse App Agent 里复跑「读章裁量、挑场面改写」。书存活、写失败 0 次、章级工具调用约 174 次、整文件改写 0 次;净增≥300 字的章 13 章,耗时约 19 分钟。对照 7 月 21 日同模型 ID 基线:工具纪律明显更稳,吞吐没有变快。

7 月 31 日下午,模拟器里还开着同一本《失恋变神豪》:385 章,基线体积约 339 万字节。 用户消息只有一句——从第 50 章往下,把值得展开的场面写长——没有工具名,没有章节清单。 Agent 自己读相关章节、自己挑、自己改,跑完 62 步后封卷。书还在,锚还在,没有一章被截断成空壳。
当天 DeepSeek 在官方更新日志宣布 V4 Flash 正式版 API 上线公测。调用名仍是 deepseek-v4-flash。我们把两周前(7 月 21 日)同 ID、同书、同话术的整本改写压测拿出来复跑,问一个更窄的问题:正式版上线后,手机 App 里的长篇 Agent 到底有没有更听话。
DeepSeek V4 Flash 正式版上线后,Agent 改长篇测了什么?
场景不是「再续写一段」,而是 Foreverse 里那个真有读写工具的 Agent:小说对它是文件,改写要落盘。 协议刻意留白——零工具提示——逼模型自己判断读哪一章、用哪种改写入口。对照基线放在 7 月 21 日同一本书的同款话术;两边都走 BYOK 官方渠道,模型字符串相同。
更准确的说法是「读章裁量、挑场面改写」:本轮记录到 168 次读章,处理落点集中在第 50–132 章;它面对的是一部 385 章长篇,但证据不能证明逐章通读了 1–385 章。公开标题直接说清任务规模和动作, 不把“书有 385 章”偷换成“通读了 385 章”。
正式版 Agent 和两周前比,哪些数字变了?
| 指标 | 2026-07-21 基线(三轮总计;速度取同话术 turn2) | 2026-07-31 正式版上线日(单轮) |
|---|---|---|
| 书是否存活 | 是(章数守恒、无骤缩) | 是(385 章守恒) |
| 写失败次数 | 10(三轮累计) | 0 |
| 章级 / 整文件写调用 | 18 / 76(三轮;章级占19%) | 174 / 0(章级占100%) |
| 净增 ≥300 字的章 | 连续段落约 15 章 | 13 章 |
| 步数 / 墙钟 | 72 步 / ~530 秒 | 62 步 / ~1163 秒 |
| prompt / completion tokens | ~579 万 / ~4.4 万 | ~522 万 / ~11.9 万 |
最扎眼的是中间两行。两周前它更爱直接改整本正文文件,失败也多堆在那里;今天几乎只碰章级入口,失败归零。 这是 Agent 能不能长时间独立干活的硬信号:工具选对了,纠错循环才有机会接住。
约 174 是章级工具调用记录,不是 174 个不同章节,也不是 174 次可见成果。分析器识别出 87 个成功落点; 同章反复 edit 仍会把次数抬高。我们继续按章差分,净增至少 300 字才算实质落笔,得到 13 章。和基线那轮大约 15 章同量级——纪律更好,产量没有翻倍。
为什么正式版上线日这一轮更慢?
1163 秒对 530 秒,completion 从约 4.4 万涨到约 11.9 万。可能是它读得更碎、改得更勤,也可能是 endpoint 当日负载或采样行为变了。我们没有第二台对照机做 A/B,所以只报现象:同话术下没有变快。
对写手产品这意味着:flash 档能扛住「读章再改」这种长环,但别默认它是批处理引擎。预算和耐心要按十几分钟、十万级 completion 留余量;中途离开要靠任务恢复,而不是指望它两分钟交卷。
和写小说续写评测怎么一起看?
同日还有一篇正式版写小说 20 轮与四档思考实测:复读少了,high/max 仍可能把输出额度吃进隐藏思考。那是 API 直连、轮次续写;这篇是 App 内工具环、整本文件。 两张表不能互相替代。Flash 在玄幻续写上常是省钱首选,不自动等于「长篇改写 Agent 的唯一正解」。
枢纽页哪个模型更适合续写小说仍管文体选型;Agent 能力要另看工具失败率、书守恒和实质改写章数。想看 Agent 还能干什么,书架 Agent 五任务实录里有寻宝和自我纠错的现场。
现在该不该用 Flash 正式版跑长篇 Agent?
若你的任务是都市白话、场面挑选后局部写长,Flash 正式版上线日的表现够用:书不炸、工具更乖、十来章能看见增量。 若你要典雅古言、强规划,或必须在五分钟内交卷,别把这篇当成绿灯——换档、拆任务,或者先只让它读目录出候选章再批准写入。
还有一条边界写清楚:官方目录没有第二个 Flash ID。今天能说的是上线日 endpoint 对 7 月 21 日快照的时点对比。权重若再换而不改名,数字还要重跑;我们不会把 changelog 日期标签写成新的模型品牌。
常见问题
DeepSeek V4 Flash 正式版的 Agent 能力,比两周前强在哪?
在同书、同话术、同模型 ID 的复跑里,写失败次数从基线累计 10 次降到 0;几乎全部改写都走章级工具,不再大量直接改整本正文文件。内容侧净增≥300 字的章约 13 章,与基线同话术连续段落约 15 章同量级,谈不上数量级跃升。
「读章裁量」和「整本机械加长」有什么区别?
用户只给一句目标,不点名工具、不指定章节清单。Agent 要自己读目录和相关正文、判断哪些场面值得落笔、再按章写入。成败看书是否还活着、有没有写失败、以及有多少章出现实质字数增长——不是看它喊了多少次成功。本轮有 168 条读章记录,但不能据此声称逐章通读了全部 385 章。
这次实测花了多久、烧了多少 token?
正式版上线日这一轮:62 步、约 1163 秒(将近 20 分钟),prompt 约 522 万、completion 约 11.9 万 token。对照 7 月 21 日同话术基线约 72 步 / 530 秒,今天更慢、completion 更高。便宜 flash 档能跑完,但不等于「又快又省」。
官方模型列表里有没有叫 Flash 0731 的新 ID?
没有。稳定调用名仍是 deepseek-v4-flash。changelog 里的日期标签是托管版本备注。因此本文比较的是「正式版上线日的 endpoint」与「7 月 21 日快照」,不是两个不同的模型字符串。
续写榜第一的 Flash,做长篇改写 Agent 也该首选吗?
续写盲评和长任务 Agent 是两张成绩单。Flash 在玄幻续写上仍常是省钱首选;做「读章再改」时,更该盯工具是否选对、书是否守恒、实质改写了多少章。需要复杂规划或典雅语体时,仍建议按任务换档,不要默认把 Flash 当唯一 Agent 模型。
有想法或问题?来 Discord 聊聊 →