给 AI 一个书房,而不是整部手机
Foreverse 内置了一个真的会干活的 Agent:你的小说、角色卡、世界书对它来说都是可读写的文件。这篇是开发期的任务实录:121 轮连环寻宝压力测试(60/60 全中)、从一本书里长出世界书、fork 一张库里的卡再开聊、替你逛社区选卡代下载,以及一次工具调用失败后它自己把自己修好的现场。

行业里「AI Agent」这个词已经被用到快没有含义了,所以这篇不讲概念,直接放任务实录。背景一句话:Foreverse 的智能体 tab 里住着一个有四件工具(读 / 写 / 改 / 执行)的 Agent,你书架上的每本小说、每张角色卡、每份世界书,对它来说都是工作区里可以打开的文件。下面是开发和测试期我们让它干过的五件事,包括翻车的部分。
任务一:121 轮连环寻宝,60 颗宝石全找齐
这是工具调用循环的压力测试:在工作区里藏 60 个「宝石」文件,每个文件里写着下一个的线索,有的线索要改写文件才能解锁。Agent 用 DeepSeek 官方 API 跑了 121 轮工具调用,60 颗全部找到,中途零人工干预。
比全中更有价值的是第 40 轮左右的一次翻车:它发起的一次文件修改没有命中原文(改动目标写错了几个字符),工具层把失败原因原样喂了回去。它读了错误信息,重新读了一遍目标文件,第二次改对了。错误回喂后自我纠正,这是工具型 Agent 能不能长时间独立干活的分水岭,我们把这个场景固化成了回归测试。
任务二:从一本小说里长出世界书
给它一本导入的长篇,任务是「把设定整理成世界书」。它的做法和一个认真的人类编辑差不多:分段读正文,边读边记人物、地点、组织,然后按世界书的条目格式逐条写进这本书的世界目录,关键词、别名一并填上。写完的条目直接被阅读器和酒馆的世界书运行时消费,续写和聊天时按关键词触发注入。
这件事的成本结构值得说:读 30 万字的书不是把 30 万字塞进一个 prompt,而是几十轮「读一段、记一段」的循环,单轮上下文可控,用便宜模型就能跑。
任务三:fork 一张卡,然后开聊
我们做过一次盲测:不给任何提示,只说「照着库里那张卡的风格做一张新的」。它自己去读了角色库、找到了目标卡、按同样的字段结构写了张新卡,格式校验一次通过。做完之后界面上直接给出「开始对话」的卡片,点一下就进酒馆聊天。
这里有个我们坚持的产品立场:Agent 造出来的东西必须落成标准格式的文件(chara_card_v3、世界书 JSON),而不是锁在某个专有数据库里。它写的卡你可以导出、可以分享、可以带去桌面酒馆。
任务四:替你逛社区
「帮我找张赛博朋克风的卡,看看靠不靠谱,行就装上。」Agent 可以浏览社区、读详情页、代下载导入,下载前会弹专属确认卡。有几条硬规矩:浏览和读详情免确认(只读),下载要么你批要么你事先开了自动档;每回合有读取和下载的次数上限;每个装进来的东西都带溯源记录(从哪个社区包、哪个版本来的),写进卡的元数据。 它不是一个可以无限薅的爬虫,是一个带预算和收据的代购。
任务五:在阅读页边读边使唤
阅读、酒馆、伴侣三个页面上有常驻的悬浮球,点开是个迷你对话浮层:流式气泡、紧凑审批卡、@ 引用当前这本书或这张卡。读到一半让它「把这章的伏笔记到笔记里」,不用离开阅读页。任务在后台跑,切页面、锁屏回来,进行中的思考流和工具卡片都在。
边界,如实交代
两条设计边界。第一,它没有设备权限:不碰通讯录、不发短信、不做屏幕自动化。社区里有往「设备 agent」方向改的项目(RikkaHub 的 agent fork给了 80 多个设备工具),那是另一条路;我们的边界是书房内全能、书房外无权,因为书房外的每一分权限都是信任成本。第二,它花你的 token:长任务的读写循环是真实的 API 消耗,所以运行中有可见的步数和随时能按的停止键,停下来时已完成的部分不丢。
常见问题
这个 Agent 和聊天机器人有什么区别?
它有工具。读文件、写文件、改文件、跑命令四件套走模型原生的工具调用协议,你的每本书、每张角色卡、每份世界书都是它工作区里的真实文件。让它「把这本书的人物整理成档案」,它会真的去读正文、真的把档案写进世界目录——每一步操作有可见的工具卡片,写盘前有审批。
它能动我手机上的其它东西吗?
不能,这是刻意的。它的工作区就是你的书房:小说、角色卡、世界书、笔记。通讯录、短信、屏幕自动化这类设备权限一概没有给——社区里有走那个方向的项目(比如 RikkaHub 的 agent fork,80 多个设备工具),我们选了相反的边界:书房里全能,书房外无权。
它会不会乱写乱删我的东西?
写操作默认要过审批卡:改哪个文件、改成什么样,屏幕上先摆出来,你点了才落盘。审批有三档(每次都问 / 只问危险操作 / 全自动),可以按会话切换。另外每次运行的操作日志完整可回看,工具读到的内容里形如 token: 值 的敏感信息会先脱敏再进模型上下文。
用它干活要花多少钱?
走你自己的 API Key,按实际 token 计费。一次「补世界书」量级的任务通常是几万 token 的读写循环,用 flash 档模型是几分钱人民币的量级;121 轮的压力测试跑的是 DeepSeek 官方 API,成本在一杯饮料以内。模型可以按任务换,复杂任务换旗舰,日常杂活用便宜的。
有想法或问题?来 Discord 聊聊 →