30 万字的书能整本喂给 AI 吗?先算一笔账

AI 记不住前面的剧情,问题不在「记性」,在窗口。用公开分词器实算:一章 3000 字约合 2100 到 2800 token,30 万字全本约 21 万到 28 万;2026 年主流模型窗口已到 100 万 token,整本装得下。但装得下不等于记得住:中段失焦有论文有厂商自家评测,材料在场不等于被使用有我们自己的对照实验。附读者版正确喂法。

一卷极长的手稿从一扇小小的阅读窗下缓缓穿过,只有窗内的几行字被朱红灯光照亮,窗外的长卷淡成灰白

把一本 30 万字的书丢给 AI,让它接着第 200 章往下写,它把第 3 章就死掉的角色写活了。 第一反应都是「这 AI 记性不行」。这个说法错在用词:模型没有记性这个器官,只有一扇窗, 叫上下文窗口,指一次请求里它能看见的全部文字。窗外的内容对它不存在;书超过窗口时, 被挤出去的恰好是最早的章节,所以越长的书「忘」得越狠,忘掉的总是开头。 窗有多大、你的书有多大,都是能算清楚的数,先把账算完,再谈忘不忘。

一章小说是多少 token?

模型不按字数计量,按 token。中文里一个字大约对得上一个 token,但打几折看文风。 我们拿三本书各抽正文 3000 字,用 OpenAI 公开的 o200k 分词器实算(2026 年 7 月 18 日): 传统玄幻 2149 个 token,现代末世网文 2524 个,宫斗古言 2816 个。 文风越雅致生僻,token 越多。粗口径记两个数就够:一章 3000 字,约 2100 到 2800 token; 30 万字的全本,落在 21 万到 28 万 token。

现在的窗口装得下一整本吗?

装得下。这是 2026 年才成立的新事实,主流规格如下(2026-07-18 按各家官方文档核对):

模型上下文窗口备注
DeepSeek V4(flash / pro)100 万 token官方公告称 1M 已是全线服务默认
Claude(Opus 4.8 / Sonnet 5)100 万 tokenHaiku 4.5 等仍是 20 万
Gemini 3 系100 万 token输出上限 6.4 万
GPT-5.6(Sol / Terra / Luna)105 万 token输出上限 12.8 万

规格出处:DeepSeek 模型页Anthropic 窗口文档Gemini 模型指南GPT-5.6 发布页。 30 万字的书扔进 100 万 token 的窗,只占四分之一,绰绰有余;放三年前,主流窗口 12.8 万 token, 连半本都塞不进。顺带一个有意思的边界:21 万到 28 万 token 的全本, 砸在 20 万 token 窗的模型上恰好装不下,所以同一本书换个模型档位,行为可能从「都看过」 变成「掐头看后半」,这不是玄学,是规格差。另一条规格小字也值得看一眼:输出上限普遍远小于输入, Gemini 单次回复最多 6.4 万 token,Claude 和 GPT-5.6 是 12.8 万,最宽的 DeepSeek 也只放到 38.4 万。 看是一回事,写是另一回事。「能不能整本喂」的答案总体从不能变成了能, 于是真正的问题换了一个:该不该。

装得下,为什么还是忘?

三层原因,一层比一层难躲。

第一层,中段失焦。学界管它叫 lost in the middle:2024 年发在 TACL 的这篇实验发现, 关键信息放在长上下文的开头或结尾时模型答得最好,埋在中段成绩显著下滑, 长上下文特化模型也不例外。厂商自家的数对得上:OpenAI 在 GPT-5.6 发布页公布的长上下文检索评测里, 51 万到 100 万 token 深度找 8 处指定内容,旗舰档得分 73.8%。这是卖百万窗口的厂商自己报的成绩。 你的第 3 章,多半就埋在中段。

第二层,材料在场不等于被使用。我们做过对照:把 27 万字原著整本塞进上下文、不加任何文风指令, 模型照样写出比喻密度十倍于原著的套话腔,完整记录在漂移实验那篇。 窗口装下了整本书,模型「看见」了,落笔模仿的还是它自己的习惯。看见和用上,隔着一层。

第三层,跨请求零记忆。窗口是单次的:这回看过,不留档,下回续写要把材料原样重发。 整本重发意味着每一段续写都为二十几万 token 付费,其中九成九和当前这一幕无关, 比按需注入贵出 20 倍以上,买回来的注意力还更散。读一晚上续二十段,就是把整本书重买了二十遍。

窗口大就等于记性好吗?

不等于。这两个词值得掰开:窗口是视野,一次能看见多少;记性是留存加取用,下次还在不在、用不用得上。 拿开卷考试打比方:书摊在桌上等于进了窗口,可答题时翻没翻到那一页、读没读进去,是另一回事; 而且这场考试交卷即忘,明天再考,书得重新背进考场。 百万窗口解决了装不下,没解决装下了顾不过来,更没解决下次还得重来。 窗口翻十倍是硬件和算法的胜利,取用靠的仍然是喂法。角色聊天场景的同一个问题(伴侣聊到三百楼忘了誓言) 病理相通,这页只管长篇阅读这一支。

30 万字的设定,正确的喂法是什么?

拆开,按需给,而且分两种给法。必须每轮在场的,走常驻位:主角是谁、世界观根基是什么, 写进角色卡,每次请求都完整带上,永远不会被挤出窗外。数量大、但不是每轮都用得上的, 拆成世界书条目,一条写一件事、挂几个触发词:正文这段提到「北境」,北境的条目才进请求; 没提到的门派、支线、伏笔原地待命,一个 token 不占。 这套做法叫结构化供给,设定管理页有完整形态。

写条目有一条实测经验:150 字电报体好过 800 字散文。那篇 237 条世界书的排障记录里, 一条写了 800 字的「惊蛰剑」档案独吞三分之一预算,模型还抓不住里面的三个关键事实; 压成电报体后,同样 20 轮追问,设定命中肉眼可见变好。写同人怕 OOC 的, 同一套方法在三病因拆解里有展开。

最后交代一个我们自己的数字。这个站引用过很多次的那批续写实验(九个模型、两种文体、累计 360 轮), 窗口固定只开 1.6 万 token:装当前场景、触发的条目和最近的正文,够用。 360 轮里没有一轮需要第 100 万个 token。

常见问题

30 万字的小说能整本喂给 AI 吗?

技术上能:30 万字约合 21 万到 28 万 token(实算口径),2026 年主流模型的 100 万 token 窗口装得下还有富余。实践上不建议当默认做法:埋在中段的信息检索成绩会下滑;我们实测过把 27 万字原著整本塞入且不加指令,模型照样按自己的习惯写;而且模型跨请求零记忆,每续一段都要整本重发一遍,九成九的 token 花在本段用不上的章节上。

AI 为什么记不住前面的剧情?

模型没有记忆,只有一扇窗:每次请求它只能看见窗内的文字,上一次「看过」的内容不留档,下次要重发。书超过窗口,最早的章节先被挤出去;即便装得下,埋在长上下文中段的信息也最容易被忽略——学界叫 lost in the middle,开头和结尾答得最好,中段显著下滑。第 3 章的角色恰好就埋在中段。

上下文窗口大就等于记性好吗?

不等于。窗口是单次视野:一次请求能看见多少。记性是留存加取用:下次还在不在、用不用得上。100 万 token 的窗解决了「装不下」,没解决「装下了也顾不过来」——OpenAI 给自家旗舰报的长上下文检索评测,51 万到 100 万 token 深度找 8 处指定内容得分 73.8%,卖窗口的厂商自己报的数。跨请求的留存,模型层面依然是零。

一章小说大概多少 token?

我们拿三本书各抽正文 3000 字,用 OpenAI 公开的 o200k 分词器实算(2026-07-18):传统玄幻 2149 个,现代末世网文 2524 个,宫斗古言 2816 个。粗口径:中文一个字约合 0.7 到 0.95 个 token,文风越雅致生僻越贵;一章 3000 字按 2100 到 2800 token 估算即可。

有想法或问题?来 Discord 聊聊 →

上下文窗口是什么?30 万字的小说,AI 一次能「看见」多少 · Foreverse · 新梦