Labs · 上下文透视镜

AI 没有失忆。
是上下文窗口把那句话挤掉了。

每一轮,整场对话都要重发给模型——直到装不下为止。拖一下窗口滑块,亲眼看你在第 3 楼报的名字怎么被挤出请求; 再开自动压缩,看一段钉在窗口头部的摘要能救回什么;开前缀缓存,看「反复重发」到底花多少钱。

免费浏览器本地运行聊天记录不出浏览器

窗口 · 8k

系统提示 + 角色卡900世界书600聊天历史(进窗)5,770回复预留922

聊到第 300 楼时,模型只看得见最近 35 楼

每格 = 一楼。亮色 = 模型看得见;灰 = 已滑出窗口;紫框 = 被摘要覆盖;★ = 埋了关键设定的楼层

固定头部按演示口径 1,500 tokens(系统提示+角色卡 900 · 世界书 600)——你的真实数字取决于卡和世界书体量。

这些设定正在滑出窗口

  • #3你自报了名字:沈约,从南边的渡口镇来已滑出窗口,模型看不见
  • #18白芷说她怕打雷——小时候阁楼漏雨的旧事已滑出窗口,模型看不见
  • #42两人约好春分那天一起去看灯会已滑出窗口,模型看不见
  • #71你提到随身带着母亲留下的铜哨已滑出窗口,模型看不见
  • #108旅店欠着城西米行三十两银子已滑出窗口,模型看不见
  • #150你答应帮白芷修好后院的水车已滑出窗口,模型看不见
  • #199白芷的妹妹叫白蔻,在邻城学医已滑出窗口,模型看不见
  • #242后山捡到一只瘸腿狸花猫,取名「阿灰」已滑出窗口,模型看不见

纯截断模式下这些楼层直接消失——模型会当它们从没发生过。摘要是有损压缩:大意能回来,逐字细节回不来。

 

Foreverse 的自动压缩就是这套语义:摘要钉缝、原文不动、缓存前缀不断。

去 App 聊到 500 楼试试

上下文窗口装满之后,到底发生了什么?

没有什么戏剧性的事——最老的那些轮次不再被发送而已。模型从此再也看不到它们, 在你这边读起来就是「它忘了」。拖上面的窗口滑杆(8k / 32k / 128k)看 300 轮对话里 哪些轮次掉出窗外;再打开压缩开关看钉住的摘要能从被丢掉的前缀里救回什么, 打开前缀缓存开关看每轮重发按真实牌价要花多少。

这个工具怎么来的

窗口装填模型对齐酒馆系前端拼请求的方式:固定头部(系统提示+角色卡+世界书)先占,历史从最新往回装、每条带少量格式开销,再给回复留出空间。压缩语义按我们 App 里已上线的自动压缩层:摘要覆盖前缀 [0, J),缝在两次压缩之间钉死,盘上原文永不改写。它的记忆数字(压缩区 59% vs 纯截断 24%)来自 53 万 token 语料上 7 配置 × 98 探针的评测,2026-07。

缓存价格用 DeepSeek V4 Flash 公开牌价(输入 $0.14/M、缓存读 $0.0028/M——全价的 2%)。三个命中率档位是测出来的不是编的:裸酒馆 91.5%、我们修复前 46.5%、修复后 89.9%,同一场四方计量评测。

它做不到什么

token 是估算口径(字符占比,不是真分词器),固定头部按演示体量 1,500 tokens——你的真实数字取决于卡和世界书。不同前端的头部排法也有差异。

压缩开关演示的是策略行为不是保证效果——摘要救回什么因对话而异。评测数字是单模型工程观察,按此标注。

成本图只算输入侧,且按你选的命中率档位恒定假设;真实命中率取决于客户端怎么组织请求——46.5% 那个档位存在的意义就是这个。

常见问题

所以 AI 到底为什么会忘掉前面聊过的事?

因为每一轮请求都是把对话从头重发一遍,而模型只收固定预算的 tokens。系统提示、角色卡、世界书先占掉一块,剩下的空间从最新的楼层往回装——装不下为止。你在第 12 楼说过的名字不是被「忘了」,是物理上没进这次请求。页面上的格子图直接标出哪些楼层进了窗、哪些没进。

换个窗口更大的模型能解决吗?

能推迟,但要为推迟付钱。128k 窗口装得下很多楼,可每一轮都按整个窗口的输入量计费——成本图里那根越来越高的线就是它。而且超长上下文下注意力质量会衰减,「在窗口里」不等于「被用上」。对聊到几百楼的对话,压缩+缓存是更便宜的答案。

压缩摘要到底能救回什么?

救大意,救不了原话。我们的压缩评测(53 万 token 语料、7 配置 × 98 探针)里,结构化摘要把压缩区的记忆通过率从纯截断的 24% 提到 59%——最大的单一因素是摘要有没有保住名字、数字这类具体值。逐字引用和细节救不回来,所以 App 里的压缩从不改写盘上的原文。

91.5% / 89.9% / 46.5% 这几个命中率哪来的?

2026 年 7 月我们跑的计量评测:同一个模型、同一把 Key、逐字节相同的消息脚本、每次调用过同一个计量网关。裸酒馆出厂布局命中 91.5%;我们自己的 App 只有 46.5%——世界书注入位每轮漂移把缓存打断了。缺陷公开、修复、复测 89.9%。完整报告在方法论一节有链接。

相关工具与阅读

← 全部免费工具

上下文透视镜 — AI 聊天为什么会失忆,看一眼就懂 · Foreverse · 新梦