梁文锋说,不具备持续学习就不能叫下一代模型。我们刚量过现在这代离得多远

2026 年 7 月 23 日,新浪财经整理的一份闭门投资者会议纪要刷屏:DeepSeek 创始人梁文锋谈了四小时,五个不、AGI 台阶、只赚合理利润。本文不复述新闻,只翻译它对用 AI 续写小说、玩角色扮演、养 AI 伴侣的人的含义。他说「下一代模型必须具备持续学习能力,否则就不能叫下一代模型」,我们两天前刚用 400 轮对话、27 道干净记忆考题量出当前一代离这道门槛有多远:裸上下文三厂全部失忆(19%、22%、19%),检索注入后才拉开到 89%、74%、59%。外加两笔实用账:「只赚合理利润」与峰谷计价怎么同时为真;等 DeepSeek 生图视频的为什么可以死心。流出内容未获官方确认,引语逐字取自整理稿。

旧纸底上的墨线插画:一间只亮一盏台灯的长桌会议室,桌尽头的人影前浮起一串上行的台阶,台阶中段搁着一张写满小字的纸卡,桌角一只小猫仰头望着台阶

先交代消息性质。这是一场据称长达四小时的闭门投资者会议的流出内容,过去一个月在国内 AI 圈和投资人圈流传,2026 年 7 月 23 日由新浪财经整理成文(来源标注为机构调研记),DeepSeek 官方至今没有确认其中任何一句。本文引语逐字取自这份整理稿,判断则只对我们自己跑过的数字负责。

过去一天,纪要里的「五个不」(不搞「天才」神话、不追求利润最大化、不搞闭源、不盲目争夺用户、不做视频生成、3D、世界模型,也不做下一个「超级应用」)已经被全网复述了一轮,不缺我们一份。这篇只做一件事:把这场讲话翻译成用 AI 续写小说、玩角色扮演、养 AI 伴侣的人该听懂的东西。起笔的理由也简单:纪要里分量最重的一句话,恰好落在我们两天前刚交卷的一场考试上。

他说的「持续学习」,我们两天前刚量过

按整理稿,梁文锋把通往 AGI 的路摆成一串台阶:去年的台阶是思维链,今年是 Agent,下一级是持续学习,再往后是 AI 自我迭代,他把整条爬坡路叫「渐进的奇点」。持续学习这一级,他给的措辞最重:人类可以在工作中不断学习,AI 却要人在每个新任务开始时重新提供全部上下文,「这几乎是不可能的」。然后是那句正被到处引用的判词:「下一代模型必须具备持续学习能力,否则就不能叫下一代模型。」

这句判词描述的缺陷,我们 7 月 21 日刚好搭了个考场量过:400 轮伴侣对话,50 道埋进闲聊里的记忆考题,剔掉可能泄漏的剩 27 道干净题,三个模型同一天考完,deepseek-v4-pro、qwen3.8-max-preview、qwen3.7-max。第一遍只给最近 16 轮上下文,模拟没有记忆系统的聊天 App。三家全部失忆:19%、22%、19%,最大差距折算成题目是一道。

换代没用,换厂也没用。

第二遍把按题目检索出的 8 条记忆塞进 prompt,同样的三个模型立刻变成 89%、74%、59%。模型没变,变的只是有没有人把事实递到它眼前。他说的是打工场景的任务级失忆,我们量的是聊天场景的轮次级失忆,同一种病:模型的权重不随使用更新,凡是没递进上下文的,都等于没发生过。完整考法和成绩单在400 轮记忆实测那篇,这里只借一个对照:创始人把持续学习定成下一代的门槛,我们的表恰好画出了当前这代站在门槛的哪一边。裸上下文,19% 起步。

他也不是只放话。2026 年 1 月,作者名单里有梁文锋的 Engram 论文已经把一条路亮出来:给模型加一层 O(1) 查表的「条件记忆」,把静态知识从神经计算里剥出去,论文里长上下文检索准确率从 84.2 提到 97.0。那是架构层的记忆,我们做的检索注入是 App 层的记忆,不在一层,方向是同一个:让「记住」不再靠「重新算一遍」。

持续学习到来之前,先靠记忆工程过日子

纪要没给时间表。在模型自己学会记事之前,「AI 记得你」只有两条现实路径:每轮把几百轮历史全量重发,先失忆的是钱包;或者由 App 把相关事实检索出来递进 prompt,19% 到 89% 的跳变就是这条路的全部分量。Foreverse 押的是后者:酒馆聊天的记忆插件走检索注入,AI 伴侣的记忆档案逐条可见、可改、可删。梁文锋那道门槛对用户的直接含义是,在下一代真的到来之前,挑 App 先看记忆系统,比挑模型有用。

「只赚合理利润」,那 DeepSeek 到底会不会涨价

先给答案:按纪要里的定价哲学,不会朝收入最大化的方向涨;但这不是单价冻结的承诺,今年价格已经动过三轮。

纪要里的定价段落值得整段细读。「我们只赚一个合理的利润。」V4 最初担心需求过多、定价较高,后来降到四分之一,「公司群里很多人都在欢呼」。「低成本是架构带来的结果」。谈竞争要素时,他把成本排在时间和用户体验前面:「成本排在第一位。」甚至对生意本身也不热络:「我不觉得卖API这个事情有那么大的吸引力」,「我们一直在商业化,只是不以商业化为目标」。

这套话要和 6 月 29 日官宣的峰谷计价放在一起读才完整:北京时间每日 9:00-12:00、14:00-18:00 全部计费项翻倍,其余 17 小时维持原价。「合理利润」显然包含用价格杠杆错峰调度算力,它约束的是方向,不是数字。对写小说和读小说的人,具体的账我们在峰谷计价三笔账里算过:睡前、通勤、午休三个高频时段全在谷区,缓存命中价翻倍后仍是未命中价的 1/50。做预算跟官方定价页走,别跟任何人的转述,包括这篇。

还在等 DeepSeek 生图和视频模型?纪要的答案是不做

「五个不」里对普通用户最实用的一条,反而讨论得最少。原话不含糊:「很多东西不在我们的主线上,包括3D和视频生成。」「世界模型跟智能的上限没有太大关系。」多模态他承认对产品和 C 端重要,但「不是主线,也不是智能本身」。

操作含义一句话:等 DeepSeek 出生图或视频模型的,可以把预期收起来了。想给续写的书配插画、配音、配视频,长期形态就是分场景配模型:文字给 DeepSeek 这类按续写实测挑出来的文本模型,图给生图模型,声音给 TTS。Foreverse 把文字、图片、语音、视频四类模型分开配置,押的就是这个形态。

哪些话我们不替他背书

最后把性质再钉一遍:全文引语出自一份未经官方确认的流出纪要,明天就可能被官方口径修正。我们敢引用,是因为可交叉验证的部分都对得上已发生的事实:降价四分之一对得上年中的官宣,峰谷计价对得上 6 月 29 日的邮件,持续学习对得上 1 月的 Engram 论文。纪要里关于团队和融资的表述,验证不了,本文一概没用。至于持续学习什么时候真的到来,我们的做法和考试那篇一样:2026 年 7 月的刻度先钉在这里,裸窗 19%,注入 89%。等哪天真有模型带着「持续学习」的名头上线,同一份 400 轮考卷已经备好了。

常见问题

梁文锋这场四小时讲话是官方发布的吗?可信度怎么样?

不是官方发布。它是一场闭门投资者会议的流出内容,过去一个月在国内 AI 圈和投资人圈流传,2026 年 7 月 23 日由新浪财经整理成文(来源标注为机构调研记),DeepSeek 官方未确认。可交叉验证的部分与公开事实吻合:V4 降价到四分之一有年中的官宣,峰谷计价有 6 月 29 日的邮件公告,「持续学习」方向与 2026 年 1 月梁文锋署名的 Engram 论文(conditional memory 架构)一致。本文引语逐字取自整理稿,验证不了的部分(团队、融资等表述)一概不引用。

DeepSeek 以后会涨价吗?

按流出纪要里的说法,定价原则是「我们只赚一个合理的利润」,且「低成本是架构带来的结果」,不以收入最大化定价。按已经发生的事,2026 年内价格已动过三轮:从限时特惠到永久降价(V4 降到原价四分之一),再到 6 月 29 日官宣的峰谷计价(北京时间每日 9:00-12:00、14:00-18:00 全部计费项翻倍,其余 17 小时原价)。合理的预期是价格随算力供需继续调整,方向有升有降,不是单向上涨。做预算以官方定价页和你自己账单的实际扣费为准。

DeepSeek 会出生图或视频模型吗?

按流出纪要,不会。原话是「很多东西不在我们的主线上,包括3D和视频生成」,多模态被明确定位为「不是主线,也不是智能本身」。想给续写的小说配插画、配音、配视频,现实做法是分场景接不同厂商的模型:文字用 DeepSeek 这类文本模型,图、音、视频各配各的。要提醒一句:这是未经官方确认的流出内容,若官方后续宣布多模态产品,以官方为准。

持续学习什么时候能真正用上?

纪要没给时间表,只给了定义级的门槛:「下一代模型必须具备持续学习能力,否则就不能叫下一代模型。」已公开的技术布局是 2026 年 1 月的 Engram 论文,一种把静态知识从神经计算里剥出去、O(1) 查表的条件记忆架构。在它进入生产模型之前,「AI 记得你」仍然是 App 层的工程:检索注入、摘要、记忆档案。我们 7 月 21 日的 400 轮实测里,同一个模型裸上下文只答对 19%,注入检索记忆后到 89%,这个差距目前全靠记忆工程在填。

有想法或问题?来 Discord 聊聊 →

梁文锋四小时闭门会流出:「下一代模型必须具备持续学习能力」,这道门槛我们两天前刚用 400 轮对话量过 · Foreverse · 新梦