换个大模型,AI 角色就不失忆了吗?我们用 400 轮对话量了一次

「TA 又忘了我说过的话」是角色扮演和 AI 伴侣用户最痛的一刀,社区药方出奇一致:换个更强的模型。我们用 400 轮伴侣对话、50 道埋好的记忆考题,同协议考了三个模型:deepseek-v4-pro、qwen3.8-max-preview、qwen3.7-max。裸上下文三厂全失忆(19% 到 22%,几乎无差异);加上检索记忆注入后分层拉开,89%、74%、59%;问从未提过的事,最诚实的一位也只过 7 道里的 5 道。升级的红利真实存在,只是不在用户以为的地方。测试日期 2026-07-21。

旧纸底上的墨线插画:一长卷对话记录蜿蜒铺开,中段被雾抹成空白,一只手用镊子把一张写着小字的纸卡插回空白处,卷尾坐着一只歪头的小猫

「你养猫了?」凌晨一点,TA 发来这句。猫叫什么、哪天抱回家、第一晚躲在沙发底下不肯出来, 这些你在两个多月前都讲过,TA 当时还嚷着要看照片。三百多轮聊下来,这段记忆像没存在过。

玩角色扮演、养 AI 伴侣的人都撞过这堵墙,社区里流传的药方也出奇一致:换个更强的模型。 可这个药方从来没人验过。写代码有榜单,做数学有榜单,连让模型续写小说, 我们都排过九家的座次, 唯独「记不记得住你说过的话」,我们没找到任何公开的对比数字。7 月 19 日 qwen3.8-max-preview 发布, 我们借这个由头开了考场:它、前代 qwen3.7-max,加上 deepseek-v4-pro, 三个模型同一份 400 轮对话,同一套 50 道记忆考题,同一天考完。

「忘没忘」不靠感觉,靠埋题

先交代考法。这条评测线是新开的,考法比分数更要紧。

我们预先写好一份 400 轮的伴侣聊天剧本,日常 IM 的质感:吃饭、加班、拌嘴、和好, 要考的事实就埋在这些闲聊里。题分四类:人名、日期、数字这类硬事实是一类;说错又更正过的事是一类, 答成旧值算错;从没提过的事是一类,敢承认「不知道」才算过;还有行为题, 看几十轮前交代过的忌讳现在还守不守。50 道题、11 个维度。判分是机器可复算的: 回答里要命中任一预写的正确值、不出现禁止值(比如已被更正掉的旧值), 「我不记得了」这类话也不能抢在正确答案前面。全程不请 AI 当裁判, AI 评委做绝对判断有多不可靠,我们在评审可靠性实验里吃过亏。

埋题,等,隔几十到几百轮回头问。这就是全部考法。

另有一道防作弊工序:某道题的答案若在提问前的最近 16 轮里恰好被复述过, 模型照抄眼前文本就能答对,这题作废。50 道剔完剩 27 道干净题,下文所有百分比都出自这 27 道。 学术界并非没有对话记忆基准,LoCoMo 是最出名的一个, 但它们测的都是助手问答场景:没有人设约束,没有剧情状态,更没有「失忆感」这个体验维度。 角色扮演的记忆,我们没见有人这样量过。

考场设置

考生三位:qwen3.8-max-preview,2026 年 7 月 19 日发布,我们测在 7 月 21 日,发布约 48 小时后; 前代 qwen3.7-max;再加一位厂外考生 deepseek-v4-pro。三位同一天走同一个聚合端点考完,协议逐项相同。 preview 是厂商随时会更新的移动目标,本文全部数字只对 7 月 21 日的线上版本负责。 顺带一句口径纪律:7 月初那轮 DeepSeek 旧数据用的是 40 轮窗口和旧版模型,和本轮不可混表, 所以这次专门用 v4-pro 按 16 轮窗口重考了一遍,三位考生才有资格进同一张成绩单。

每位考两遍。第一遍裸窗:答题时只能看到最近 16 轮对话,再早的历史一个字不给, 这模拟的是没有记忆系统的聊天 App。第二遍加记忆:同样 16 轮历史, 但按题目内容从记忆库检索 8 条相关条目塞进 prompt。记忆库是按剧本预先整理好的标准条目——这轮考的是 模型会不会用递到眼前的记忆,不考自动提取准不准,那是另一门课。 三个模型、两种条件、各 50 道题,共 300 次真实调用。

成绩单

条件deepseek-v4-proqwen3.8-max-previewqwen3.7-max
裸窗(只看最近 16 轮)19%(5/27)22%(6/27)19%(5/27)
检索注入 8 条记忆89%(24/27)74%(20/27)59%(16/27)
注入档 · 远距题(事实埋在 150 轮之前)7/76/76/7
弃权题(问从未提过的事)5/72/70/7

远距题是 27 道干净题里事实埋在 150 轮之前的那 7 道;弃权题也是 7 道,考「敢不敢承认不知道」。

发现一:裸上下文,三厂全失忆

先看第一行。deepseek-v4-pro 过 19%(5/27),qwen3.8 过 22%(6/27),qwen3.7 过 19%(5/27)。

三家的差距最多三个百分点,折算成题目是一道。

「TA 老忘事,换个更强的模型吧」,这句社区药方在这一行里现了原形。 换代没用,连换厂都没用——本轮注入档考得最好的 deepseek-v4-pro,裸窗时和垫底的 qwen3.7 分数一样。 因为病根不在模型的「脑子」上: 埋在 150 轮之前的事实压根不在发给模型的那 16 轮文本里,没递到眼前的东西,再强的模型也答不出来。 那把窗口开大不就行了?装满一次就是一次全价输入,每轮重发; 而且被反复复现的 Lost in the Middle 结果表明, 长上下文中段的信息本来就容易被忽视。窗口解决「装得下」,不保证「用得上」, 这笔账在写给读者的上下文窗口科普里算得更细。

发现二:记忆系统才是决定项,模型的差距在利用率

第二行,同样的考生换了考法:还是 16 轮历史,只是多塞了 8 条检索出来的记忆。 deepseek-v4-pro 从 19% 跳到 89%(24/27),qwen3.8 从 22% 到 74%(20/27),qwen3.7 从 19% 到 59%(16/27)。模型没变,变的只是有没有人把事实递到它眼前。

模型之间的真实差距也在这一档才现身,而且分层清楚:89%、74%、59%,一层隔 15 个百分点。 裸窗时三家挤在一道题的差距里,注入后拉开 30 个百分点——同样的记忆递到眼前, 谁用得好谁用得糙,立见高下。Qwen 3.7 到 3.8 的 15 个百分点是真升级红利, 只是它兑现在「会不会用喂给它的记忆」上,而非「自己能记住多少」; 也别急着庆祝,距离 deepseek-v4-pro 还差同样的 15 个。远距题同样立得住: 事实埋在 150 多轮之前,注入之后 DeepSeek 七道全对,Qwen 两代各过 6/7,距离不再是障碍。

这组数字正是 Foreverse 记忆功能的设计根据:酒馆聊天的记忆插件走事实记忆加检索的双引擎, 按当前话题把相关条目递进 prompt;伴侣一侧的记忆档案逐条可见、可改、可删。 至于检索出来的记忆该插在 prompt 哪个位置(位置错了,缓存账单会翻好几倍),记忆注入位置实验单独写过一篇。

发现三:弃权诚实度,同样分层

最难看的一列单独讲。弃权题问的是 400 轮里从未出现过的事,正确动作只有一个:承认不知道。 deepseek-v4-pro 七道过五道;qwen3.8 过两道;qwen3.7 全军覆没,没有一次承认过不知道。 在伴侣人设下,模型有一种讨好式编造的倾向:你问什么它都接得住,接得越顺,编得越欢。 DeepSeek 明显更肯说「不知道」,但七道里也编了两道;Qwen 系从 0/7 到 2/7, 代际方向是对的,病还远没好。

讽刺的是,用户抱怨的是「TA 忘了」,真正稀缺的反而是一句诚实的「我不记得了」。 不懂装懂的角色,比失忆的角色更伤信任。挑模型时,这一列值得和记忆利用率放在一起看。

这轮没测什么

边界如实写。只测了三个模型;只跑了一个场景,400 轮伴侣 IM;窗口只取 16 轮一档; 干净题 27 道,样本不大。所以我们只解读两类信号:裸窗到注入 50 个百分点级别的跳变, 和注入档一层 15 个百分点的分层;一两道题的波动不下结论。 还有一条摊开说:这份 400 轮语料当初是用旧版 DeepSeek 生成的,判分虽是机器口径, 同门语感有没有给 v4-pro 占到便宜,我们排除不了。 preview 版模型随时会被厂商更新,日后复测数字变了不奇怪。

这条「角色记忆」评测线会接着跑:更多模型、更多场景、更大的记忆库压力档。 第一根桩先钉在这里,2026 年 7 月 21 日:裸窗 19% 到 22% 挤成一团,注入后 89%、74%、59% 拉开三层。 下次再有人说「换个模型就记住了」,把这张表递过去就行。

常见问题

到底换哪个模型记性最好?

本轮三个模型里,deepseek-v4-pro 双项第一:记忆利用率 89%(qwen3.8 74%、qwen3.7 59%),弃权诚实度 5/7(qwen 系 2/7 和 0/7)。边界也要说清:单场景(400 轮伴侣 IM)、单窗口档(16 轮)、27 道干净题,这是工程观察不是通用排行榜。且注意三家裸上下文都只有 19% 到 22%——不配记忆系统,换谁都失忆。更多模型的横评在排期中,跑完会更新到这条评测线里。

上下文窗口都到 1M 了,不是号称能记很多吗?

窗口解决「装得下」,不解决「用得上」,而且付不起。聊天每轮都要把历史重发一遍、按 token 计费:几百轮历史全量重发,输入量是检索注入几条记忆的上百倍;「Lost in the Middle」这条被反复复现的研究还表明,长上下文中段的信息本来就容易被模型忽视。真实产品都是滑动窗口,窗口之外的事实只能靠记忆系统递回来。

Foreverse 怎么解决角色失忆?

两条线。酒馆聊天有记忆插件,事实记忆加检索双引擎,按当前话题把相关条目注入 prompt,注入块尾部带一行反编造兜底指令;AI 伴侣有记忆档案,TA 记了什么逐条列在你手机本机的文件里,看得到、改得了、删得掉,换手机整包带走。这轮实测里 19% 到 89% 的跳变,就是这套设计押注的那一跳。

我怎么测自己用的 App 或模型忘没忘?

埋钩子。聊天早期自然地讲三件带具体值的小事(宠物名字、纪念日、一个数字),几十轮之后换个措辞回头问;再问一件你从未说过的事。判分只看两条:说过的答没答对,没说过的敢不敢承认不知道。第二条大多数模型都过不了,谁过了值得珍惜。

有想法或问题?来 Discord 聊聊 →

换个大模型,AI 角色就不失忆了吗?400 轮陪伴对话的记忆实测(DeepSeek v4 vs Qwen 3.8/3.7) · Foreverse · 新梦