Labs · 文字 X 光

给文字拍张 X 光,
看每个词有多「好猜」

← 全部免费工具

模型:模型在你的浏览器里跑 · 文字不上传
按文字自动选,也可手动切换。两个模型独立下载(各 ~73–81MB,浏览器缓存后免重下)。
示例(来源都标了):

结果会出现在这里——每个词按「模型觉得多好猜」着色。

超过 6000 字只扫前 6000 字。 手机也能跑(同样全本地),但下载和初始化更磨人——赶时间建议桌面。

这台 X 光机的原理

一个语言模型读你的文字时,每到一个位置都在心里排一张「下一个词」的候选榜。我们把你的每个词拿去对榜:排第 1 名到第 10 名算「一猜就中」(标红),第 1000 名开外算「真没想到」(标青)。整段扫完,你就得到一张统计 X 光片——套话和复读会连成红带,真正的个人表达往往是青色的。这套「逐词名次着色」来自 2019 年哈佛与 MIT-IBM 实验室的 GLTR;七年过去,原版停在英文和 GPT-2 服务端,我们把它搬进你的浏览器,补了中文轨。

它不是检测器(这句话有数据撑腰)

上线前我们用五组共 100 段带出处的语料给这台机器做了标定,结果值得写在脸上:真人写的套路网文「一猜就中」占比 64–71%,我们自己在反 AI 味纪律下打磨的官方 AI 小说只有 54–65%,五家大模型的直出续写更低(52–61%)—— 三条区间不但重叠,还和「AI 更好猜」的直觉完全倒挂。原因不复杂:探针小模型量出来的是「离它 2019 年训练分布的远近」,而套路网文恰好是那个分布里最浓的部分。GLTR 当年就承认对更新的模型会失效,我们把这个失效 用自己的数据量化了出来。所以:有人拿「困惑度」给你的文字判 AI 时,这三条倒挂的区间就是你该反问的问题。

三面透镜怎么分工

这是我们「AI 味」工具组的第三面透镜:AI 味体检器管规则层(套话词表与句式模具,逐条点名)、 文本分析仪管结构层(句长节奏、对话占比、复读检测),文字 X 光管统计层(一个真实神经网络的逐词意外度)。三面各有盲区:规则抓不到新套话,结构看不见词级纹理,统计分不清「套路的人」和 「克制的机器」。一起用,比任何一个单独用都诚实。

常见问题

我的文字会被上传吗?

不会。点「扫描」后浏览器从 CDN 下载一个 73–81MB 的量化小模型,之后推理全部发生在你设备的浏览器里(Web Worker + WASM),文字不发给任何服务器。断网状态下(模型已缓存时)照样能扫。

它能判断一段文字是不是 AI 写的吗?

不能,我们也不装能。我们用 100 段带出处的语料做了标定:在探针小模型的量尺下,真人写的套路网文(top-10 命中率中位 69%)反而比大模型直出的续写(57%)更「好猜」——「困惑度高低」和「谁写的」在 2026 年已经对不上号。这个工具给你的是逐词纹理,不是判决。

为什么要下载 70 多 MB 的模型?

因为你的浏览器里真的在跑一个神经网络:中文轨是 6 层蒸馏版 GPT-2 中文模型(uer/gpt2-distil-chinese-cluecorpussmall 的 q8 量化 ONNX,73MB),英文轨是 DistilGPT-2(81MB)。只下载一次,之后存在浏览器缓存里;引擎初始化每次打开页面约 10–30 秒(一次性),扫描本身不到一秒。

和 GLTR 是什么关系?

致敬加接棒。GLTR 是哈佛 NLP 与 MIT-IBM Watson 实验室 2019 年的工作:用 GPT-2 给每个词按预测名次着色,是「AI 检测可视化」这个形态的开山。它停在 2019——服务端运行、只有英文、自己声明对新模型可能失效。这里是同一个思路的 2026 重做:跑在你的浏览器里、中英双轨、并把「对新模型失效」这件事用我们自己的标定数据摆在台面上。

相关工具

← 全部免费工具

文字 X 光 — 逐词困惑度透视,浏览器本地跑小模型给每个词标「好猜程度」 · Foreverse · 新梦