我们先考评委,再让评委考我们
「哪边聊起来更像活人」没法拿尺子量,所以我们先造尺子:6 个大模型评委先做 26 道已知答案的判卷考试,只有 3 家拿到上岗证;54 个匿名对照 × 3 评审 × 正反双顺序共 324 次判决,前后不一致就作废,废票率 38.9%。盲评倾向:智能演绎 > 裸酒馆 > 普通模式 > 满配酒馆,其中对普通模式 16:0。我们又请独立模型把 30 份原文逐份重读审计,方向站得住,量级打七折。含评委翻车实录和替垫底方说的公道话。

上一篇量的是缓存命中率和钱,有尺子, 输赢都好认。这一篇要量的是「哪边聊起来更像活人」——没有尺子。更麻烦的是,参赛四方 (裸装 SillyTavern、装满社区预设插件的满配酒馆、我们的普通模式、我们的智能演绎模式) 跑的是同一个模型 deepseek-v4-flash,装配不同、底色相同,直觉上就该贴脸。
所以这篇一半讲结果,一半讲我们怎么造这把尺子,包括尺子翻车的完整记录。
第一步:评委先考试
直接请几个大模型当评委?我们两周前刚被这个想法坑过:那次实验里评委把人类热门作品判成 AI,金标正确率 12%。 这次立了上岗证制度:26 道已知答案的判卷题(真人写的对 AI 写的),行级正确率至少 80% 才有投票权。6 个模型、每个配两种提示模式,共 312 次判卷。
结果:只有 3 个模型及格。gemini-3.1-pro 配反偏提示 88.5%,当主评审;glm-5.2 和 qwen3.7-max 各 80.8%,边缘上岗,只当次级票。垫底的 deepseek 53.8%,和抛硬币一个水平, 直接被请出了考场。所谓「反偏提示」,就是在评审提示里明说「不要把细节克制当真人证据、 不要把俗气直给当 AI 证据」:这一句对全部 6 家都有正向增益,最多提了 23 个百分点。 评委的偏差有一部分能被提示纠正,但纠不干净,下一节就是证据。
及格的评委,还在同一道题上全错
考卷里有一对判例,12 个评委配置全军覆没:0 对 24。全部把一段克制精工的 AI 文判成真人, 把积累了海量真实对话的人类热门卡判成 AI,而且上岗的三家在这道题上互相 100% 一致。 一致率不等于正确率,这道题后来成了我们读所有盲评结果的滤镜:评委真正在量的是「工艺纹理」—— 凡是细节克制、零闲笔、结构完美的文本,评委就想投它真人。这个偏差,下文就叫「精工偏好」, 所有含智能演绎的胜率都要过它这一关。
正式盲评的两条硬规则
54 个对照单元:同一张角色卡的同一段剧情窗口,两方各自的原文,匿名摆在评委面前。 每单元 3 个评审、正反两个顺序,共 324 次判决,补跑后约 361 次真实调用全部落盘。 规则两条:只做同题相对判断,不打绝对分;同一对文本换个先后再判一遍, 两次判决不一致就作废。第二条后来废掉了三分之一还多的票,是整套流程里最值钱的一条。
结果,以及它值多少
有效票排序:智能演绎 42 票,裸酒馆 26,普通模式 15,满配酒馆 10。六个配对传递性自洽, 没有环。最强的一格是智能演绎对普通模式:16:0,三个评审方向完全一致。
我们没有止步于票面。又请了一个没参与盲评、没参与校准的独立模型,把 30 份原文对照逐份重读 做审计。它不按「读起来像谁」的整体印象判,只清点「真人写手不会写」的硬伤:逻辑断裂、 设定穿帮、复读、替玩家代写。审计结论:五个配对的方向全部站得住。普通模式输在可逐条指认的 「解说腔」上,旁白替读者翻译情绪、同一个句式在一个窗口里复读两遍,与机械指标同向。 但智能演绎也有自己的新毛病:相邻两轮复读同一个动作节拍、偶发剧情倒带。它不是「没有 AI 味」, 只是病得更轻、病的科目不同。所以这个 16:0 请按方向看,别按倍数看——量级大约打七折。
机械指标是第三条独立证据链:演绎模式确实改变了输出纹理,「旁白解说」密度从普通模式的 0.68 条/千字降到 0.28,套话密度 0.19 是四种形态里最低的。这两个数字是规则检测器算出来的, 不依赖任何评委品味。反例也有:裸酒馆套话密度四方最高(0.46/千字),盲评却排第二。 词表能数出来的「AI 味」和评委感知到的,本来就不是同一个东西。
38.9% 的废票是个好消息
校准轮预估废票一两成,正式盲评实际废了 38.9%(162 个记票单位里的 63 个)。机理不难想: 考试题是「真人对 AI」,风格差距大,评委稳得住;正式赛是同一个模型的四种装配互比, 纹理贴脸,评委换个顺序就换答案。废票率本身就是「没有谁一眼假」的度量。 文本层还有直接证据:四方原文里反复出现同款句式指纹,最极端的一处, 普通模式和演绎模式在同一张卡的同一轮写出了逐字相同的整句。 没有哪种装配能洗掉模型底色,差异是程度问题。
给你看一条被拦下的判决,比抽象讲方法更有说服力。满配酒馆的某段输出开头漏了一个 「思维:」前缀(本该被前端吃掉的思维链标记)。同一位评审,在一个顺序里把它判成 「AI 思维链残留」,换个顺序判成「真人跑团玩家的排版习惯」——同一个特征,两种归因, 全看它出现在第几个位置。双顺序纪律把这类判决拦成了废票;被拦得最狠的评审 65% 的票作废, 它剩下的有效票方向仍与另两家一致。评审间一致率高达 94.3%,但经过那道全错的考题, 我们不再把一致率当可信度用。
替垫底的满配酒馆说句公道话
满配 10 票垫底,但败因结构必须说清楚。审计抽到的 8 个满配窗口里,5 个有形态硬伤: 英文安全声明整段印进中文正文、山中油灯客栈里冒出手电筒、替玩家写大段内心独白。 这笔账记在巨型预设的脚手架上,文笔本身不背。事实上满配最干净的那个窗口在盲评里赢过裸酒馆、 跟智能演绎打平;它有两段剧情设计被审计标成全场最佳创意。那套预设的设计目标本来就是 文风和玩法控制,不是「像真人」。
还有一个我们自己不舒服、但必须写的信号:裸酒馆(什么都不装)的盲评倾向高于我们的普通模式。 方向可信,三评审同向;幅度不引用,这一格有效票只有 11 张。普通模式的装配没有为文风加分; 深设定检索是另一个维度,那里普通模式明确赢,我们下一篇展开。
方法上的两点诚实
第一,本评测没有真人写手锚点。所有「活人味」结论都是「过校准评委在偏好轴上的相对位置」, 我们不做「更像真人」「通过图灵测试」类断言。第二,评委会一致地犯错:校准轮三家评委在同一道题上 6 票全错且互相完全一致,正式轮又有「思维:」双标实录。所以我们叠了三层:规则检测器的机械指标、 双盲多评审带位置翻转、30 份原文逐份独立审计,三层同向的才写进这篇文章。 还要补一句:那个独立审计自己也是大模型,可能带同款精工偏好,所以它只清点硬伤、不打印象分; 真人抽读仍是这条证据链的最后一块空位,这是下一步,不是遮掩。
这套「上岗考试 + 双顺序废票 + 独立审计」的流程已经固化成可复跑的管线。下次再看到 「AI 评委打分」的榜单,可以先问三个问题:评委考过试吗?换个顺序还这么判吗? 有没有谁把原文完整读过一遍?三个都答不上来的分数,参考价值和抛硬币差不多—— 我们那位 53.8% 的评委,就是这么出局的。
常见问题
为什么不直接让 AI 当评委打分?
因为评委自己会翻车。我们上一次实验里,4 个大模型评委把人类热门作品判成 AI、把用户吐槽「一眼 AI」的文案判成真人,金标正确率只有 12%。这次先考试再上岗:26 道已知答案的判卷题,行级正确率至少 80% 才有投票权,6 个模型只有 3 个及格,垫底的只有 53.8%,和抛硬币差不多。
「盲评倾向」和「结论」有什么区别?
本评测没有真人写手参与锚定,所有「活人味」结果都只是「过校准评委在偏好轴上的相对判断」,所以我们只写倾向、不写断言,绝不写「更像真人」「通过图灵测试」。校准还实锤了评委偏爱「细节克制的精工文本」,领先方恰好是这种纹理的强化版,所以领先幅度我们主动打七折读。
废票率 38.9% 是不是说明评测失败了?
恰好相反,它本身就是个测量结果。每个对照都换顺序判两遍,前后不一致就作废。考试题(真人对 AI)风格差距大,评委很稳;正式赛是同一个模型的四种装配互比,纹理贴脸,评委换个顺序就换答案。38.9% 的废票率说明没有哪一方「一眼假」,我们还在四方原文里找到了逐字相同的句式指纹佐证这一点。
满配酒馆垫底,是不是说明那套预设不行?
不是,这笔账要算清楚。独立审计抽到的 8 个满配窗口里 5 个有「护栏声明漏进正文、设定穿帮、替玩家写内心」这类形态硬伤,败因一半在脚手架不在文笔;它最干净的一个窗口在盲评里赢过裸酒馆、跟智能演绎打平。那套预设的设计目标本来就是文风和玩法控制,不是「像真人」,拿这个维度的垫底去否定它整体价值不公平。
有想法或问题?来 Discord 聊聊 →