「一丝凉意」判 AI,「学费我交过了」判真人:检测器翻车实录
我们给角色卡文案做了一个规则检测器:套话词表加句式配额,用来拦截「一眼 AI」的官方文案。这篇是它的校准记录:金标判例集第一次跑就抓出检测器误杀人类(人类热门卡均分 4.55 低于 AI 的 4.90)、单词黑名单为什么必须降级成句式检测、以及它永远抓不到的那类 AI 味。附一个免费的浏览器版工具。

起因在上一篇里写过:一位真实用户读了我们上架的官方角色卡,一眼判定「AI 写的」,还点名了句式。我们想让 LLM 当评委来把关,结果四个评委的金标正确率只有 12%,一致地把人类判成 AI。评委这条路堵死之后,剩下的选择是笨办法:把「AI 味」拆成可枚举的句式规则,给它写测试,像维护代码一样维护它。这篇是这个规则检测器的校准记录,翻车部分不删。
规则长什么样
检测器两层。第一层是套话词表:「眼底闪过一丝不易察觉的」这类高频机器腔短语,直接命中直接计分。第二层是句式配额,管的是单个看没问题、密度高了才露馅的模具:
| 病灶句式 | 例子 | 配额 |
|---|---|---|
| 引语点题 | 「大二摔的,她说那是学费」——每个设定配一句俏皮话盖章 | 每篇 ≤1 |
| 对仗翻转 | 「骂人不带脏字,全是事实句」 | 每篇 ≤1 |
| 生造概念词 | 把普通行为包装成专有名词 | 0 容忍 |
| 伪精确数字 | 堆砌「18:47」「第 3 次」制造真实感 | 每篇 ≤3 |
| 金句升华结尾 | 以人生感悟收束段落 | 标记复核 |
| 闲笔缺失 | 每句都有信息量、零废话 | 闲笔 ≥1 才像人 |
配额制是关键设计。这些句式人类也用,用一次是俏皮,句句都用是机器。所以规则不禁用,只限量。「闲笔 ≥1」是唯一的反向规则:一段里连一句没用的话都没有,本身就是嫌疑。
金标测试第一次跑,抓出的是检测器自己
规则写完不能直接上岗,得先过金标:拿人类已有共识的样本测它。我们的金标集两边取样,一边是真实用户点名「一眼 AI」的文案(应该低分),一边是累计百万真实对话的人类热门卡(应该高分)。第一次跑,人类样本均分 4.55,AI 样本 4.90——人类比 AI 更像 AI,检测器在系统性误杀。
翻记录找到病灶:单词黑名单。「一丝」「一抹」「带着几分」确实是机器腔高频词,但人类写景照样用,「一丝凉意」「一抹夕阳」是再正常不过的中文。按词扣分,人类的正常描写就被错杀了。修复是把这批词降级:不再单独计分,只在它们出现在解说腔句式里(搭配心理状态词、替角色向读者解释情绪)才命中,同时把词表权重整体下调、句式权重上调。
修完复跑:人类均分 4.55 到 5.00,零误杀;AI 样本分数不变;此前审过的官方卡全部回归通过。这套金标判例集现在是检测器的回归测试,规则每改一次跑一次。「一丝凉意」事件之后,我们不再相信任何没过金标的检测规则,包括自己写的。
它抓不到的那类 AI 味
诚实的边界要写清楚。我们手里有几份按模板精心生成的 AI 文案,句式规避得干干净净:没有套话、配额全过、闲笔也安排了。规则给满分,LLM 评委也看不出来。但人读完仍然觉得假。破绽不在任何一个句子里,在整体纹理:细节密度过于均匀、每段信息量精确相等、没有一处真正的松弛。这种结构层的机器感,目前没有任何自动化手段抓得住。
浏览器版,免费用
我们把这套规则的轻量版做成了网页工具:贴一段中文文字,浏览器本地跑体检,套话标黄、句式计数、给 0-5 分,文字不上传服务器。适合发文前给自己的文案做一遍 lint。它的局限和上面写的一样:低分值得复核,高分不代表清白。检测这件事的上限,LLM 评委实验那篇写得更透。
常见问题
规则能检测出文字是不是 AI 写的吗?
不能,我们也不这么宣称。规则检测器标记的是「读者常判机器味的已知句式」:套话词、对仗翻转模具、伪精确数字这类。得分低说明命中了这些句式、值得逐项复核;不能证明作者是机器,反过来满分也不能证明是人。把它当文案 lint 用,不要当测谎仪。
什么是「金标判例集」校准?
拿人类已有共识答案的样本测检测器:真实用户点名「一眼 AI」的文案应该低分,累计百万对话的人类热门创作应该高分。我们的检测器第一次跑金标就翻车:人类样本均分 4.55 反而低于 AI 样本的 4.90,靠金标测试抓出了误杀规则。修完人类均分 5.00、零误杀。任何检测器上岗前都该过这一关。
为什么单词黑名单会误杀人类?
因为词无罪,句式才有病。「一丝」「一抹」这类词在 AI 腔里高频出现,但人类写景同样用(「一丝凉意」「一抹夕阳」完全正常)。按词扣分就会错杀。修复方案是把这些词降级:只在它们出现在特定病灶句式里(比如搭配心理状态词的解说腔)才计分,单独出现不扣。
检测器抓不到什么?
结构层的 AI 味。按模板精心堆出来的文案可以把每个句式都规避干净,规则给满分,LLM 评委也看不出来,但人读完仍觉得假,因为破绽在「细节密度均匀、零闲笔、结构完美」这种整体纹理里。目前没有自动化手段抓得住它,能抓住的只有读得足够多的人。
有想法或问题?来 Discord 聊聊 →