Foreverse Research
研究中心:
数据都能复算,缺陷也在页上
我们围绕「AI 读小说、写小说、扮演角色」做第一手评测:同尺条件、双盲评审、逐调用计量,原始数据归档可复算。这一页是全部研究资产的门面——写文章要引数据,从这里拿。
研究资产
研究档案(可引用长文)
排行榜和评测页背后的完整实验记录,按发表形态归档在博客——每篇都有样本量、日期和方法节。
年度数据报告
还没到发的时候,先不占位。原料在自动积累:模型价格表每天归档一份快照(从 2026-07 起)、每场评测的原始链和判决都进研究档案。攒够一个年度,第一份报告会出现在这一页。
我们怎么做研究
- 同尺条件:对比类评测里各方用同一个模型、同一把 Key、逐字节相同的脚本,每次 AI 调用都经过同一个计量网关记账;不同条件下采的数字不同台展示。
- 排序靠双盲:排名类结论一律双盲评审、两套随机映射对冲位置偏差;前后判决不一致的票作废,不进结论。
- 评委先考试:AI 评审员要在已知答案的样本上达到 80% 正确率才有投票权。我们自己发过「评委一致地错」的研究——所以关键结论要么人工终裁,要么只写「倾向」。
- 结构指标只当闸门:句长、对话率、复读检测用来抓回归、交叉验证盲评;「像不像人写的」这类裁决不交给统计。
- 自家缺陷如实入表:评测抓出我们自己的问题照样发(缓存命中率被打脸、指令措辞 bug 都在页上),修复过程公开。
- 可复算:原始 20 轮链全文、盲评映射密钥、评审判决、逐调用计量日志全部归档;数据页提供 JSON 快照下载。
如何引用
引用惯例:Foreverse Research + 页面标题 + 年月 + 页面 URL。数据类页面都带 JSON 快照下载;转载数字请一并注明我们标注的采集日期——hosted 模型是移动目标,日期是结论的一部分。
Foreverse Research,《AI 续写小说排行榜(Fiction Bench)》,2026-07,https://foreverse.app/zh/research/fiction-bench