Labs · 复读与采样诊断器

把车轱辘话贴进来,
看它到底为什么转

采样参数(留空 = 没动过 / 不知道)

为什么分三层——因为「复读」是三种不同的病

逐字车轱辘、每条都回来的宠物意象、同一个模子倒出来的开头,是三种不同的失效,各有各的治法——把它们压成一个「重复分」, 正是很多工具开错药的原因。第一层用 12-token 滑窗抓跨回复与回复内部的逐字复制,口径就是我们小说评测榜复读数字的那一套, 本页引擎在归档的 Grok 4.5 崩溃链上复算出了逐位一致的结果(连续三轮 100% 旧文)。第二层数跨回复回响的内容短语—— 「琥珀色的眼睛」,八条里出现六次。第三层给回复、段落、句子的开头聚类,抓逐字检测器看不见的结构模具。

分诊树从哪来

根因排序是我们 App 里「聊后调优门诊」复读分支的网页版,也继承了它的诚实纪律:每一句都带置信度标签。「本仓实测」意味着 可复算——Grok / Kimi / DeepSeek 的复读数字来自归档 20 轮链、自测脚本每次重算;「历史污染」的证据(指令 9/10 轮输给历史) 来自受控的 App 侧实验。「官方文档」逐条引供应商原文,比如 OpenAI 的惩罚合理区间 0.1–1、Anthropic 明写 Claude 没有任何 惩罚参数。社区档注明出处。没有数据的地方,页面写「没测过」,不编数字。

它做不到什么

这是对静态快照的诊断:看不见你真实的 prompt 装配、预设里暗藏的参数覆盖、前端静默丢弃了哪些字段。角色口头禅和正常称呼是 合法重复——意象层刻意把单词级习惯放进观察项而不判病,修辞排比只标注不惩罚。对几百条的整段考古,默认只分析最近 40 条: 长聊天里堆积的合法重复,会淹没你真正来查的那个病灶。

常见问题

我的聊天记录会被上传吗?

不会。检测、分诊、参数体检全部在你的浏览器里跑——贴文字或拖 .jsonl,什么都不离开你的设备。这也是为什么页面不会「越用越准」:规则是固定且带版本的,和我们自己评测管线用的是同一套。

照推荐档改参数,就一定不复读了吗?

不一定,我们也不装。采样是按模型各有脾气的玄学;这里的参考区间逐条标注来源(官方文档 / 社区共识 / 本仓实测),定位是「一次只改一个」的排查起点。真正有硬证据的是诊断那一半——复读在哪一层、环是不是已经住进了你的历史。

为什么自救清单总把「先改历史」排在调参前面?

因为测过。本仓 App 侧实验里,坏范例一旦躺进可见历史,纠正指令 9/10 轮无效;而新开会话零残留。模型模仿转录的力度大于服从指令:参数只影响下一个 token,历史却在教下一整条回复。所以历史手术排在一切旋钮之前——这个顺序是有实验依据的。

「12-token 滑窗」到底是什么?

把文本切成每 12 个连续 token(中文一字一个、英文一词一个)的滑窗,数一条回复的滑窗有多少在更早的回复里出现过。这正是我们小说评测榜复读数字的口径。作为标定:本页引擎在归档的 Grok 4.5 链上复算出与发布数字一致的结果——第 10-12 轮 100% 旧文,第 13 轮回落(发布 68.4%、复算 67.7%,分词口径差不到 1 个点)。

相关工具与阅读

← 全部免费工具

复读与采样诊断器 — AI 为什么车轱辘话,哪个参数才真治它 · Foreverse · 新梦