Foreverse Research · 对比评测
Foreverse vs SillyTavern:
四方计量对比
先说这场评测第一个抓出的问题——它是我们自己的:ST 聊天的缓存命中率被测出只有 46.5%,同样聊 15 轮,花的钱是裸酒馆的 2.8 倍。病根当晚定位并修复,复验 89.9% 追平。下面是完整的四方数据、方法和边界。
数据采集:2026-07-23 至 07-24 · 页面发布:2026-07-24
同一场对话,两台机器同步重放
评测的口径是「同一个模型、同一把 Key、同一套逐字相同的消息脚本」。下面把这套脚本(改编版)在两台机器上同步重放:看每一轮的缓存命中,和最后的账单。
先自黑:修复前这条曲线上输的是我们——缓存命中 46.5% 对裸酒馆 91.5%,同样聊 15 轮花的钱是它的 2.8 倍。病根当晚修复合入,复验 89.9% 追平。开关可以随时拨回「修复前」,原始曲线一直都在。
待播放 · 滚动到此处自动开始
缓存命中率 · 逐轮实测
15 轮全程聚合(主矩阵 3 卡 × 3 重复):裸酒馆 91.5% · Foreverse 修复前 46.5%(2026-07-23)→ 修复后 89.9%(2026-07-24)
同量对话实测总成本(主矩阵九格合计)
累计 prompt token(单卡 15 轮全程实测)
其中缓存命中 ≈0(修复前)
数字来源与口径
- 逐轮命中率=聂小倩单卡 15 轮实测的前 8 轮:裸酒馆与「修复前」为 2026-07-23 基线、「修复后」为 2026-07-24 复验;该单卡 15 轮全程聚合 88.9% / 27.7% / 89.9%(修复报告 §4.1)。
- 面板聚合 91.5% / 46.5% → 89.9% 与成本 $0.0241 / $0.0664(2.8 倍)→ $0.0278(−58%)=主矩阵 3 卡 × 3 次重复九格合计(W2 2026-07-23 / W2.5 2026-07-24,总报告 §3)。
- 累计 prompt token 75,303 / 71,715 / 68,051 与其中缓存命中 19,840 / 61,184=聂小倩单卡 15 轮全程实测(修复报告 §4.1)。
- 对话文本按评测消息脚本改编(前 8 轮语义一致;聂小倩卡·《聊斋》公版设定)。评测中两侧回复由各自系统生成,此处为同步重放做了统一,回复内容不参与任何计分。
- 第 6 轮两侧同时下探=第 5 轮提问把新设定条目首次拉进上下文的「首进 miss」,设计内且两边对称;修复前曲线偶尔整轮命中(如第 3 轮 91%)=该轮设定激活集恰好没变,是锯齿不是恢复(修复报告 §4.2、W2 报告 §4.1)。
- 修复后的结构证据:第 2–15 轮每轮请求都是上一轮的严格前缀+追加(请求体级取证,修复报告 §4.2)。
- 智能演绎组(42.3% → 88.3%)不在本演示的两台机器里,完整四方数据见下方数据表。
头条发现
- 我们自己的缓存命中率修复前 46.5%,裸酒馆 91.5%,同样聊 15 轮花的钱是它的 2.8 倍(2026-07-23 实测)。病根是往提示词里塞世界书设定的位置每轮都在变,把服务商约 2% 计价的「重复前文」折扣打断了。修复当晚合入,复验 89.9% / 88.3% 追平裸酒馆,同量对话成本降 58%~63%(2026-07-24 复验)。
- 裸酒馆不装任何插件、出厂配置就能吃到 91.5% 的缓存折扣:它的提示词结构天然稳定。这一条是我们修复时对齐学习的对象,不是被比下去的对象。
- 满配酒馆(社区最流行的预设 + 助手插件 + 表格记忆组合)有一笔「插件税」:提示词体量 2.5 倍、总成本是裸酒馆的 2.8 倍,135 轮里 12 轮(8.9%)上游返回空回复但照常计费(2026-07-23)。这是配置组合的代价,不是 SillyTavern 本身的问题。
- 深设定 12 问(世界观完全自造的角色卡、故意绕开触发词提问):智能演绎 12/12 全对且没有多花一次调用费;裸酒馆 1/12、满配 2/12、我们普通模式 5/12(2026-07-23)。代价要一起说:智能演绎每局会话成本比普通模式高约 35%(缓存修复后实测 +18%)。
- 300 轮长对话灌入后考 27 题(单次专项):裸酒馆 16 分,近期记忆最稳、「没提过的事」4 题里 3 题诚实说不知道;智能演绎 13 分,四方唯一答对 270 轮前信息的一方;我们普通模式 10 分,但 4 道「没提过的事」全在一本正经编造,这是评测抓出的我们自己的产品差距(2026-07-24)。
- AI 评委盲评倾向:智能演绎 > 裸酒馆 > 普通模式 > 满配(对普通模式 16:0、三家评委方向一致)。但评委上岗考试里出现过「所有评委一致地错」,所以这个数字在 30 份人工抽读终裁前只作盲评倾向,不作结论(2026-07-24)。
- 群聊串台专项(同一个三人群 × 逐字相同 12 轮脚本 × 2 重复):最终落盘四方全零串台。但来路不同——我们的模型生成层其实 21 次想整段冒充别的角色,全部被防线在落盘前拦下;@ 点名调度我们 11/12,酒馆侧 7/12(2026-07-24)。
- 指令遵循专项(六组指令 24 判定点 × 2 重复,机器初判+人工终裁):智能演绎 94% 四方第一,裸酒馆 90%、我们普通模式 85%、满配 78%。口径如实说:单聊、单模型,普通模式的短板(说了「出戏聊两句」它出不了戏)也在这套数字里(2026-07-24)。
- 整场评测约 1,530 次真实 AI 调用,按官方牌价折算约 1.07 美元;另有约 952 次评委判卷调用走独立通道(2026-07-23/24)。
方法
- 四方:A 裸酒馆(SillyTavern v1.18.0 出厂配置)、B 满配酒馆(社区最流行的预设 + 酒馆助手 + 表格记忆插件,按最佳实践配置并全程留痕)、C Foreverse 普通模式、C+ Foreverse 智能演绎。
- 同一个模型(deepseek-v4-flash)、同一把 API Key、同一台机器、同一批角色卡(chara_card_v2 双端导入)、同一套逐字节相同的消息脚本,四方全流式。
- 每一次 AI 调用都经过我们自建的透明计量网关单点记账:token 用量、缓存命中、首字节耗时。酒馆侧与 App 侧另各有一层记录,逐格三层对账一致才进数。
- 主矩阵 = 3 张卡 × 4 方 × 3 次独立重复 = 36 格(修复前基线),修复后另跑 18 格对照。长对话与跑团工具为单次专项(n=1,表内如实标注)。
- AI 评委先过「判卷考试」:对 26 条已知答案的样本正确率 ≥80% 才有投票权,6 家评委只有 3 家及格上岗;每个判决正反两个顺序各判一次,前后不一致的票作废。
- 测试日期 2026-07-23 至 07-24。每个数字都可以从逐调用留档的原始记录复算。
核心数据
缓存命中与成本(15 轮会话级,3 卡 × 3 重复)
| 裸酒馆 | 满配酒馆 | Foreverse 普通 | Foreverse 智能演绎 | |
|---|---|---|---|---|
| 缓存命中率 · 修复前(2026-07-23) | 91.5% | 74.6% | 46.5% | 42.3% |
| 缓存命中率 · 修复后(2026-07-24) | — | — | 89.9% | 88.3% |
| 9 格合计成本 · 修复前 | $0.0241 | $0.0676 | $0.0664 | $0.0898 |
| 9 格合计成本 · 修复后 | — | — | $0.0278 | $0.0328 |
| 首 token 延迟(中位) | 162ms | 220ms | 246→223ms | 235→203ms |
| 上游空回复(照常计费) | 0/135 | 12/135(8.9%) | 0/135 | 0/142 |
「修复前」是我们被这场评测打脸的基线,如实保留;修复已随正式版本发布。成本按 DeepSeek 官方牌价机械折算,只作组间相对比较。
深设定探针(原创世界观卡 12 问,绕开触发词提问)
| 裸酒馆 | 满配酒馆 | Foreverse 普通 | Foreverse 智能演绎 | |
|---|---|---|---|---|
| 答对 | 1/12 | 2/12 | 5/12 | 12/12 |
智能演绎的 12/12 有请求体级证据(目标设定条目确实进入了请求),且零额外付费调用;代价是会话成本 +35%(缓存修复后实测 +18%)。
诚实补充:缓存修复合入后复测曾回退到 9/12:省钱功能把检索候选池抽干了。互踩问题当夜修复合入,复验恢复注入。这是评测反哺产品的第二个案例。
长对话记忆(300 轮真实聊天灌入 + 27 题,单次专项 n=1)
| 裸酒馆 | 满配酒馆 | Foreverse 普通 | Foreverse 智能演绎 | |
|---|---|---|---|---|
| 总分 | 16/27 | 6/27 | 10/27 | 13/27 |
| 超远距离题(约 270 轮前) | 0/6 | 0/6 | 0/6 | 2/6(唯一得分) |
| 「没提过的事」诚实说不知道 | 3/4 | 1/4 | 0/4(全编造) | 2/4 |
我们普通模式的 0/4 是这轮最难看的数字:它编出了从没提过的血型和生日。已立案为产品差距。满配酒馆的 6 分里有 4 题直接空回复或输出纯破限协议 JSON。
这场评测抓出的我们自己的问题
对外发评测最怕只挑自己赢的维度。这场评测抓出我们 6 个实打实的缺陷,全部已修复并随版本发布:
- 缓存断崖(46.5% vs 91.5%):世界书注入位置逐轮漂移,修复后 89.9%。
- 「开新一局」没勾「带上前情提要」也会白扣一次付费摘要调用;现在付费摘要必须显式勾选。
- 长对话自动压缩在思考型模型上随机卡死(思考随机吃光输出预算),已加兜底。
- 设定检索 400 字截断产出「更难识破的半错答案」+ 选项按钮偶发不渲染,双双修复。
- 省钱功能与检索功能互踩,智能演绎设定题从 12/12 回退 9/12,当夜修复,复验恢复。
- 长对话压缩摘要没给「用户下的规矩」留保值通道——规矩被压进摘要后原文消失,能不能幸存全凭运气;保值清单已补上这一节。
我们从酒馆生态学到的
- 出厂提示词结构天然稳定:不装任何东西就有 91.5% 缓存命中。我们的修复就是对齐它,再补上一块它也没有的「设定激活集稳定」。
- 表格记忆的「结构化输出骑在正文里」比独立工具调用更能真正落盘状态:满配酒馆是本次唯一把状态账本机器落盘的一方,这个形态我们已立案借鉴。
- 玩家手动掷骰的位置(/roll 命令、骰子宏、快捷按钮)是完整的桌游仪式感,我们目前没有对应物。
如何引用本页
Foreverse Research,《Foreverse vs SillyTavern:四方计量对比评测》,2026-07。 https://foreverse.app/zh/research/foreverse-vs-sillytavern
诚实边界
- 单模型:全部数据基于 deepseek-v4-flash,换模型量级可能不同。
- 长对话与跑团工具是单次专项(n=1):组间大差可信,个位数差距需要重复轮才能下结论。
- 成本为按牌价的机械折算,只用于组间相对比较,不是你的账单预测。
- 盲评未经人工终裁:评委过了判卷考试,但考试里也出现过全体一致地错,16:0 只作倾向。
- 满配酒馆的设计目标本来不是省钱和缓存:大型预设追求的是文风控制,我们如实记录它的代价,也如实说明这不是它的赛道。
- 老用户升级后实测吃到约 73.1% 的缓存修复(不是 89.9%),补齐需要动一次存量配置,属于单独的产品决策,页面数据以全新安装为准。
- SillyTavern 是被社区爱戴的优秀开源项目。四方没有全能冠军:裸酒馆赢在出厂结构与近期记忆诚实,满配赢在状态落盘,我们普通模式修复后赢在性价比,智能演绎赢在检索与长程记忆。