产品更新 | Wordvice AI率检测工具 2.0 正式发布
距离 2025 年 12 月 Wordvice AI率检测工具 1.0 发布已过去 9 个月,我们完成了一次大规模模型迭代。
过去 9 个月,人工智能技术迭代速度极快,新技术层出不穷。人机协同写作的模式也在持续演变,围绕 AI 生成文本检测方法、人工审核规范以及伦理层面应对措施的讨论始终十分活跃,但在行业尚未形成统一共识的背景下,AI 技术仍在高速发展。
Wordvice 在这样的产业环境中持续优化现有模型性能,同时不断探索模型与服务的底层创新。尤其是我们计划在 2026 年 EMNLP 会议上发表的论文《Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing》(风格作为混淆因素:AI 检测非母语学术写作中的假阳性,查看博文介绍),为本次迭代奠定了扎实的技术基础。今天,Wordvice AI率检测工具 2.0 正式上线。
本次更新的核心目标并非单纯扩大可检测的 AI 生成文本范围,而是重点提升在 Wordvice 真实使用场景下,对 AI 改写文本、模糊边界案例的稳定检测能力;同时强化了句子级检测详情展示功能,帮助用户更好地理解和复查检测结果。
Wordvice AI率检测工具 2.0 的核心特性如下:
- 基于多源数据训练的 AI 生成文本检测模型
- 针对高频误判困难案例优化的困难负样本挖掘(Hard Negative Mining, HNM)技术
- 可在文档中以句子为单位,可视化展示 AI 生成模式相似度较高片段的边界检测器(Boundary Detector)
内部评估结果显示,最终模型在领域内测试集上 F1 值达 0.9773,AUROC 达 0.9979;尤其是在 AI 改写文本(AI Rewrite)专项评估中,F1 值达 0.9819,召回率达 0.9917,表现优异。
需要特别说明的是,高性能指标并不意味着检测结果可以作为判定文本撰写主体的确凿证据。AI率检测工具的输出仅代表文本与训练集中 AI 生成模式的相似程度信号,必须结合写作过程、上下文语境、修改记录以及人工审核结果综合解读。
与此同时,我们也调整了使用额度政策。所有付费用户的 AI率检测工具月度使用额度提升至 100 万字,基本可满足无限制使用需求。做出这一调整,是因为 AI率检测工具的价值不止于单篇文档的检测结果确认,更在于写作过程中持续排查、修正 AI 生成特有的表达痕迹(AI Slop),最终产出更高质量的文章。
Wordvice 在韩国出版文化产业振兴院的官方支持下启动了 AI率检测工具升级项目,并计划于今年年底前完成第二次大规模迭代。第二次更新将不止于 AI 风格文本检测,还将针对 AI 不规范使用可能引发的实际问题,新增引用错误校验、逻辑一致性验证等功能,敬请期待。本文将详细介绍 AI Detector 2.0 的模型结构、训练方法、评估数据及具体性能等技术细节。
Detector 2.0 做了哪些技术升级?
1. 覆盖真实使用场景下的多元写作模式
Detector 2.0 基于约 60 万条人类撰写与 AI 生成的文本样本训练,涵盖学术文本和通用文本,包含各类 AI 生成、AI 改写案例,旨在学习真实使用场景中可能出现的广泛写作模式。
但仅扩充训练数据量远远不够。
我们对初期模型的错误案例分析后发现,误判往往集中在特定边界场景,比如模型判定为 AI 生成、实际为人类撰写的文本,或是 AI 生成但表达高度接近人类写作、被模型漏判的文本。
Detector 2.0 专门筛选了这类困难案例,纳入额外训练集中重点学习。
2. 通过困难负样本挖掘(HNM)针对性优化困难案例
第一阶段训练完成后,模型会自动筛选出判定难度较高的案例用于追加训练,我们内部将这一流程称为困难负样本挖掘(Hard Negative Mining, HNM)。
具体而言,我们在人类撰写文本中筛选出模型判定为 AI 生成概率较高的案例,在 AI 生成文本中筛选出模型判定为 AI 生成概率较低的案例。这并非简单收集模型分类错误的样本,而是无论分类正确与否,重点聚焦模型在区分人类与 AI 写作边界时难以判别的案例。
第二阶段训练中,我们提升了筛选出的困难案例的训练权重,增加其被调用的频率。通过这种方式,模型不止学习容易区分的样本,更重点攻克实际检测中判定难度较高的文本。
3. 新增文档级结果下的句子级详情展示
Detector 2.0 新增了分析功能,用户不仅可以查看整篇文档的检测结果,还可以定位文档内部 AI 生成模式相似度较高的具体片段。
边界检测器(Boundary Detector)是一个 Token 级模型,会对文本中每个 Token 属于人类写作或 AI 生成模式进行分类,再将每个 Token 的得分汇总到词、句子层级,帮助用户直观查看文档中 AI 生成模式较为突出的区间。
边界分析与 Detector 2.0 的独立句子分析是两条相互独立的路径:边界高亮功能通过汇总 Token 级预测结果展示文档内部的细节模式,而句子得分则由独立模型结合上下文对每个句子单独分析得出。
最终检测结果会将文档级检测与句子级分析结合判定,同时将上述两条分析路径作为独立的解释信息提供给用户。因此,边界高亮和句子得分是基于不同逻辑产出的结果,解读时需要区分二者的作用。
AI 改写检测能力有哪些提升?
HNM 技术的效果在 AI 改写现有文本的场景中尤为显著,AI 改写专项评估结果如下:
| 评估指标 | 初期模型 | Detector 2.0 | 提升幅度 |
|---|---|---|---|
| AI 改写 F1 | 约 0.955 | 0.9819 | +0.027 |
| AI 改写召回率 | 约 0.933 | 0.9917 | +0.059 |
在独立的领域内测试集上,最终模型 F1 值为 0.9773,AUROC 为 0.9979。
尤其是在 AI 改写专项评估中,召回率从约 0.933 提升至 0.9917,意味着在该测试集中,AI 改写文本被误判为人类撰写的情况大幅减少。
Detector 2.0 的目标不止于提升整体准确率数值,更重要的是优化真实使用场景下,现有检测器难以识别的 AI 改写文本和边界案例的检测性能。
如何利用句子级检测信息?
如果仅提供整篇文档「与 AI 生成模式相似」的整体结果,用户很难理解判定依据。
Detector 2.0 的边界检测器补充了这一能力,可分析文本内部 AI 生成模式相似度较高的区间,支持用户在句子层级查看详情,示例如下:
| 句子 | AI 相似度 |
|---|---|
| "This study examines…" | 0.82 |
| "We propose a novel…" | 0.31 |
需要注意的是,0.82 这一数值并不代表该句子有 82% 的概率由 AI 撰写。句子得分是通过边界检测器捕捉区间模式后,以用户易于理解的形式呈现的相对 AI 相似度指标。
因此,不能仅凭某句得分较高就断定该句「由 AI 撰写」,句子级信息的核心作用是帮助用户定位需要重点复查的片段。
边界检测器的性能如何评估?
边界检测器的性能通过公开 AI 文本检测基准评估,该基准用于定位人类撰写文本与 AI 生成文本的转换点。
评估采用 MAE(平均绝对误差)指标,衡量预测的人类 / AI 转换位置与实际位置的平均偏差,数值越低,代表边界定位越准确。
在相同 SemEval 测试集上,现有公开系统的结果参考如下:
| 系统 | 整体 MAE ↓ |
|---|---|
| SemEval 官方基线 | 21.54 |
| TM-TREK | 15.68 |
| DeepPavlov | 13.38 |
| Wordvice 边界检测器 | 7.16 |
但该表格不应被解读为系统间的直接性能排名。
不同系统的训练数据、训练条件存在差异,仅凭相同测试集上的数值无法判定绝对性能优劣,该结果仅用于验证 Wordvice 边界检测器在同一公开基准下的边界检测能力。
学术文本表现优异,新场景下需谨慎解读
比起只看整体性能指标,更重要的是明确模型在哪些场景下表现稳定、哪些场景下存在局限。
边界检测器在不同数据环境下的评估结果如下:
| 评估环境 | MAE ↓ | token 级 F1 |
|---|---|---|
| 与训练分布相似的学术文本 | 2.72 | 0.987 |
| 未训练的外部领域 | 15.96 | 0.956 |
| 全部 | 7.16 | 0.973 |
在与训练分布相似的学术文本中,边界检测器表现出较高的检测性能,但在未覆盖的外部领域中误差会有所上升。
这是 AI 检测系统的共性重要局限:在某一数据集上取得较高整体性能,不代表在所有语言、所有类型文本中都能达到同等准确率。
Detector 2.0 在产品设计中也充分考虑了这一特性:当输入信息不足,或针对当前尚未充分验证的语言、领域时,系统会提供专门提示,引导用户谨慎解读结果。
尤其是目前的句子级分析在英语学术文本中验证最为充分,因此针对非英语文本、或与训练分布差异较大的文章,句子级结果需要更加谨慎地解读。
实际使用体验有哪些变化?
结合真实使用场景,Detector 2.0 的优化方向可总结如下:
| 使用场景 | 旧版检测痛点 | Detector 2.0 优化方向 |
|---|---|---|
| 全文由 AI 生成 | 难以覆盖多元生成模式 | 训练集覆盖多元的人类与 AI 写作模式 |
| 人类撰写文本经 AI 改写 | 表达自然化后更难检测 | 通过 HNM 重点学习困难的 AI 改写案例 |
| 人类采用接近 AI 的风格写作 | 人类文本易被误判为 AI 生成 | 将高难度的人类写作案例纳入追加训练 |
| 文档局部 AI 模式突出 | 仅靠整体结果难以定位需复查片段 | 通过边界检测器提供句子 / 区间级别的详情 |
| 短文本或未充分验证的文本类型 | 有限信息下易过度信任结果 | 提供专属提示,引导使用者谨慎解读 |