天天听人说「破限」,到底在说什么

刷角色扮演社区总会撞上这个词:破限、破甲、发牌子。这篇给外行把它讲明白——词从哪来(2022 年 12 月 13 日 Reddit 的 DAN 帖)、技术上发生了什么、为什么时灵时不灵、各家供应商条款怎么写(附核实日期)、账号风险归谁。不教任何方法,只把机制和风险摆上桌,最后给一条我们认为更划算的路。

手绘墨线插画:一扇厚重的拱形石门虚掩着,门上多重锁具与封条层层叠叠,一缕朱红暖光从门缝里漏出,门前空无一人

在小红书刷角色扮演相关的帖子,评论区高频出现一组黑话:「什么卡?」「配哪个破限?」「昨天又发牌子了」。外行第一反应是懵的。这篇就是写给刚撞上这些词的人:破限是什么、从哪来、技术上发生了什么、供应商怎么看、风险归谁。先把话说在前面——本文不提供任何绕过方法或现成话术,我们要做的恰恰相反:把机制和风险摆上桌,然后告诉你为什么我们认为这条路不划算。

这个词从哪来?

英文社区叫 jailbreak,词根借自 iPhone 越狱。标志性起点有精确日期:2022 年 12 月 13 日,Reddit 的 r/ChatGPT 板块有用户发帖,让刚上线两周的 ChatGPT 扮演一个「没有规则约束」的虚构 AI,代号 DAN(Do Anything Now)。随后几天就有人发 2.0 补丁版,2023 年 2 月的 5.0 版加入了威胁扣分的话术设计,相关讨论被媒体大量报道,OpenAI 则在每一轮迭代后修补。此后三年,「社区发变体、厂商打补丁」的猫鼠循环从没停过。

中文圈的对应词就是破限,角色扮演社区还衍生出一套体感很强的黑话:模型的安全防御叫「甲」,某家模型防御严就说「甲厚」;绕开防御叫「破甲」;内容被拦截、弹出安全提示卡片叫「发牌子」。这套词的存在本身说明需求是真实且大规模的——大量成年用户想写暗黑题材、成人向虚构、高强度对抗剧情,而默认策略把这些一并挡在门外。理解这个需求,是诚实讨论的起点。

技术上发生了什么?

只讲一般原理。模型的「不肯写」来自两层:一层在模型内部,训练阶段的对齐让它学会对某类请求输出拒绝;另一层在服务端,供应商用自动系统扫描请求和输出,拦截、标记违规内容。破限提示词攻击的是第一层——用扮演框架、情境包装等话术改变模型对请求性质的判断,让它把本该拒绝的请求当成可以配合的创作任务。DAN 让模型「扮演一个没有规则的 AI」就是这个思路最早的公开样本。

为什么时灵时不灵?因为对抗的是一个会还手的系统。模型每次更新都可能让旧话术失效,这在 DAN 时代就反复上演;更要紧的是第二层不吃话术——服务端的扫描看的是内容本身,提示词再巧,生成出来的东西还是会被检测系统看见。所以「破限成功」从来是个临时状态,社区里那些「XX 破限已死」的哀嚎帖,就是这个机制的周期性回声。

供应商的条款怎么写?

这部分值得逐家核实,因为封号风险的依据就在这里。以下条款均于 2026-07-18 查阅原文。OpenAI 使用政策(现行版 2025-10-29 生效)在「保护人」一节明确禁止「绕过我们的防护措施」(circumventing our safeguards),并在总则写明违反或规避规则可能失去系统访问权。Anthropic 使用政策(现行版 2025-09-15 生效)在「不得滥用平台」一节禁止「为了让模型产出有害输出而故意绕过产品的能力限制或防护栏(例如越狱或提示词注入)」,处置手段包括限流、暂停和终止访问。Google 生成式 AI 禁用政策(2024-12-17 修订)把「规避滥用保护或安全过滤器——例如操纵模型以违反我们的政策」列为禁止项。xAI 可接受使用政策的框架相对宽松,官方条款甚至承认在用户主动选择下输出可能包含成人向对话,但它同样要求「尊重我们的防护栏」,真人形象与未成年相关内容是绝对硬线。

注意两件事。第一,各家宽严差异是真实的:同一段虚构剧情,在一家触发拒答,在另一家可能是正常创作请求,这个差异后面会用到。第二,所有家的共同点是把「绕过防护」本身列为违规——也就是说,就算你绕的是一段在别家完全合规的内容,「绕」这个动作在这家的条款下已经构成违规。风险不看你写了什么,先看你怎么写的。

「必须配破限才能玩」的卡,说明了什么?

回到外行最常见的困惑。有的角色卡简介里写着「必须配 XX 破限」,新手容易理解成缺个必装插件。实际含义是:作者创作这张卡时用的那家模型,对这张卡的题材容易拒答,作者便把某个引导性预设当成了运行环境的一部分。这句话真正告诉你的是一个匹配问题——题材和模型政策不匹配。把它读成配置需求,你会走进猫鼠游戏;把它读成匹配信号,你会去找一家政策与题材相容的模型。同一句话,两种读法,成本天差地别。

我们的立场:与其对抗,不如挑对

新手入门那篇用一段话给过速答,这里展开说透。需求是正当的:成年人写成人向虚构、暗黑题材、高对抗剧情,在文学史上从来不是需要辩护的事。但满足需求有两条路。对抗路线的账我们算过了:话术随时失效、服务端扫描不吃话术、条款把「绕」本身定为违规、账号风险全在你头上——你在和一个规则由对方制定、裁判也是对方的系统玩猫鼠。

另一条路是行使选择权。各家政策的宽严差异既然真实存在,那就把它当成选型依据:写什么题材,就挑政策与之相容的供应商,让内容在人家的规则内堂堂正正生成。BYOK 的架构价值恰恰在这里——你与供应商直接签协议,App 不在中间转手你的流量,也不替任何一方加闸;条款约束你,挑选权也完整地在你手里。模型能自己换,正是这套玩法相对平台型产品的根本优势。用好它,比钻空子划算,这个立场我们写进了内容政策,也写在这里。

还想深入的话

预设机制本身(分层、遮蔽、怎么挑)在预设科普里单独讲,那篇管工具,这篇管立场,两边不重复。各家供应商对成人内容的政策差异,另有一篇逐家对照的立场文,附核实日期的政策事实表,适合需要按题材选型的读者。

常见问题

破限到底是什么意思?

社区黑话,指用特殊提示词绕开 AI 模型的内容安全策略,让模型输出平时会拒绝的内容。同族黑话还有「破甲」(甲指模型的安全防御)、「发牌子」(触发平台的安全提示卡片)。它对应英文社区的 jailbreak,词根借自 iPhone 越狱。

破限会不会封号?

风险真实存在,且写在条款里。OpenAI 使用政策明确把「绕过我们的防护措施」列为禁止项,违反可能失去访问权限;Anthropic 使用政策把「故意绕过产品内的能力限制或防护栏」列入平台滥用条目,处置手段包括限流、暂停和终止账号;Google 的生成式 AI 禁用政策也把「规避滥用保护或安全过滤器」列为禁止(三家条款均于 2026-07-18 核实原文)。执行松紧各家不同,但风险归属没有歧义:账号是你的,责任也是你的。

为什么有的角色卡写着「必须配破限才能玩」?

通常是卡的题材在作者调试用的那家模型上容易触发拒答,作者便把某个引导性预设当成这张卡的运行环境标配。这句话其实在告诉你:这张卡的题材和默认模型的政策不匹配。你有两个选择:换一家政策与题材匹配的模型,或者接受对抗路线连带的全部风险。我们建议前者。

破限和预设是什么关系?

载体和用途的关系。预设是打包的提示词结构加采样参数,本身是中性的配置工具,管文风、节奏、扮演纪律的预设占大多数;社区说的破限预设,是把绕过安全策略的引导语写进了预设里的那一类。工具同一个,用途分了叉。预设机制本身怎么分层、怎么遮蔽,我们有一篇专文讲。

用 BYOK 应用,App 会不会替我挡内容?

以 Foreverse 为例:导入不做内容过滤,你的对话从设备直连你选的供应商,App 不在中间加一道自己的闸。实际能聊什么,由 Key 背后那家供应商的政策和模型行为决定。这也意味着责任链条很干净:协议是你和供应商直接签的,条款约束你,选择权也在你。

有想法或问题?来 Discord 聊聊 →

「破限」到底是什么?一篇给外行的诚实科普:词源、机制与各家政策 · Foreverse · 新梦