让 AI 评「像不像 AI 写的」,结果它把人类判成了 AI
一次双盲评审实验的完整数据:4 个异构大模型评委、真人标注的金标锚点、双顺序对照。结果 gold 正确率只有 12%——评委们一致地把人类热门作品判成 AI、把被真实用户吐槽「一眼 AI」的文案判成真人。评委间一致率 86%,但一致地错。这篇公开实验设计、翻车数据和我们最后立下的铁律。

事情起因很具体:一位真实用户读了我们上架的官方角色卡,一眼判定「AI 写的」, 还点名了句式——引语点题、对仗翻转、生造概念词。我们改了一版,想验证改得对不对, 于是搭了一个看起来很标准的评审台:4 个不同基座的大模型当评委, 每场给两份文案(改前 / 改后,或人类 / AI),双顺序各评一遍防位置偏差,双盲。
为了知道评委靠不靠谱,我们先埋了金标锚点:一批人类已有共识的样本—— 包括那份被真实用户判「一眼 AI」的原稿,和几张累计百万对话的人类创作热门卡。 评委只需要在这批样本上答对「哪份更像真人写的」。
gold 正确率:12%。
不是不准,是反着准
12% 远低于抛硬币的 50%,这个数字的含义比「评委不行」严重得多:评委们高度自信地、 系统性地把答案答反了。被用户判 AI 的文案,评委说「细节扎实、更像真人」; 百万真实对话喂出来的人类热门卡,评委说「太俗套、疑似 AI」。
更扎心的是一致性数据:4 个评委之间的两两一致率有 86%——它们非常同意彼此, 然后一起错。我们本来准备用「多评委投票」提高可靠性,这个数据把这条路堵死了:投票消除的是随机噪声,消除不了共同的系统性偏见。 另外三分之一的场次里,仅仅交换两份文案的出场顺序,评委就翻转了判决——位置偏差在 LLM-as-judge 文献里是记录在案的老毛病(MT-Bench 论文有系统测量), 我们只是在自己的数据上又撞见了它。
偏见长什么样
读完全部评语后,评委的「审美」浮出水面,可以总结成两条替换: 把细节密度当成了人味,把俗当成了假。 AI 改写的文案数字精确、结构完整、每段都有钩子,评委读着「信息量大、有生活质感」; 人类热门卡有口水话、有偷懒的形容、有重复,评委读着「敷衍、套路」。 有个细节我们印象很深:几份人类卡里带着社区流行的状态栏排版, 评委把它认成了「真人社区互动的铁证」——同样的排版出现在我们仿写的卡里,它照样给了「真人」。
反偏提示:救回来一个基座,救不动其它
| 实验轮次 · 评委配置 | gold 正确率 |
|---|---|
| 首轮 · 4 异构评委 · 原始提示 | 12% |
| 扩展校准轮 · claude 系评委 + 显式反偏提示 | 83% |
| 扩展校准轮 · deepseek / glm / qwen + 同样的反偏提示 | 25% – 33% |
首轮翻车后,我们把语料扩到 17 对、换上更多异构评委做了一轮专门的校准实验, 给评委加显式的反偏提示(明确告知「细节密度不等于人味」这类具体纠偏)。 claude 系的评委被拉到了 83%——说明它的偏差在提示层,可以纠正。 deepseek、glm、qwen 三个基座加了同样的提示却纹丝不动,停在 25% 到 33%, 属于训练出来的硬先验,提示够不着;它们还把我们仿写卡里的社区状态栏排版当成「真人社区互动」的铁证。 即便是 83% 那一个,也只是勉强越过我们事后立的门槛线,远谈不上放心。
立律,然后诚实
实验结束后我们在工程规范里写了一条铁律:LLM 评审器没有通过金标校准(正确率 ≥80%)之前, 不得作为任何优化目标。现在的组合拳是三层:规则检测器(词表 + 句式配额, 用真实用户的判断校准过,修掉过一版误杀人类写景的词条——修完后人类样本零误杀)做日常回归闸门; 真人抽检做最终真值;LLM 盲评只允许用在「同一份文案改前改后」的相对比较上,永远不当绝对裁判。
最后交代诚实的边界:我们手里有几份按模板精心堆出来的 AI 文案,句式规避得干干净净, 规则检测器给了满分,LLM 评委也看不出来。AI 味最深的一层藏在「细节密度均匀、 零闲笔、结构完美」这种整体纹理里——目前没有任何自动化手段抓得住它。 能抓住它的仍然只有一种东西:一个读得足够多的人,读出声,皱一下眉。
常见问题
什么是「LLM as judge」的 gold 校准?
在让大模型当评委之前,先准备一批人类已有共识答案的样本(金标锚点),测评委在这批样本上的正确率。我们的实验里 4 个模型评委的初始 gold 正确率只有 12%——低于随机(50%),说明评委不是不准,是系统性反向。
评委间一致率 86% 不是说明结果可信吗?
不。一致性和正确性是两回事:4 个评委高度同意彼此,但同意的方向和人类真实判断相反。多评委投票只能消除随机噪声,消除不了共同的系统性偏见——这是我们这次实验最贵的一课。
给评委加「反偏见提示」有用吗?
看模型。我们在扩容语料后的第二轮校准里测过:显式反偏提示能把 claude 系评委的 gold 正确率拉到 83%(首轮四评委原始配置只有 12%),说明这类偏差可以被提示纠正;但同样的提示喂给 deepseek、glm、qwen 三个基座,仍停在 25% 到 33%,属于提示纠不动的硬先验。而且 83% 也只是勉强越过我们设的 ≥80% 门槛,仍不足以当自动闸门。
那「AI 味」到底该怎么检测?
我们现在的组合:规则检测器(词表加句式配额,已对齐真实用户直觉)做回归闸门;真人抽检做真值;LLM 盲评只用于同一份文案改前改后的相对比较,绝不当绝对裁判。诚实的边界是:结构完美、密度均匀的 AI 文案,规则和 LLM 都抓不到,人味没有自动化银弹。
有想法或问题?来 Discord 聊聊 →