本站的说法是:3000 字以内的文本,改写后以 85-95% 的概率通过 AI 检测。这个数字只有在测试方法公开时才有意义。这一页就是那套方法:测什么、怎么算通过、多久重测一次,以及你自己如何复现。

测哪些检测器

四个,选的是学校和出版方真正在用的:GPTZero、Turnitin AI、Originality.ai、Winston AI。检测器更新很频繁,所以每次测试都记录版本号和日期。六个月前的通过率不能证明今天的检测器——这就是我们每月重测、而不是发布一个数字用到永远的原因。

样本集

每次测试至少 150 个 AI 生成样本,覆盖五类真实使用场景:

全部样本 1500-3000 字符——免费工具单次处理的范围——用 ChatGPT、Gemini、Claude 普通提示词生成,不做对抗技巧,只用原始输出。

通过标准

两阶段,刻意保守:

  1. 基线核查 — 原始 AI 样本必须先被该检测器判为 AI。基线没被标记的样本直接剔除,绝不把送分题算成成绩。
  2. 打分 — 改写后的文本过同一个检测器。通过 = 检测器自己的界面判定「非 AI / 低于阈值」。「混合」、「不确定」一律算失败。

通过率 = 通过数 ÷(样本数 × 检测器数)。临界文本不会反复重打分直到通过为止。

每月回归节奏

每月一次完整测试,检测器大版本更新后额外加测。结果直接进下表:

轮次日期检测器样本量通过率
首次完整测试2026 年 11 月GPTZero、Turnitin、Originality.ai、Winston≥150随测试发布

85-95% 来自开发引擎期间的内部校准。从 2026 年 11 月起,每月结果都按这套协议发布在这一页——包括数字下降的月份。

自己复现

  1. 用任意主流聊天机器人,按五类场景生成 150 个短中篇文本。
  2. 每个原始样本过全部检测器打分;没被标记为 AI 的剔除。
  3. 用我们的 AI 改写器改写每个样本——或用你自己的方法,协议不在乎改写出自哪个工具。
  4. 改写稿过同样的检测器,按界面原样记录判定。
  5. 通过数除以总打分数,和我们的记录对比。

局限,直说

相关:免费 AI 检测器——提交前先自查 · GPTZero Bypass 和 Turnitin Bypass——针对单一检测器的改写调优