Wordvice AI Blog

AIチェッカー「Wordvice AI Detector 2.0」をリリース

2025年12月のAI Detector 1.0のリリースから9か月。WordviceのAIチェッカーが、大規模なモデルアップデートを迎えました。

この9か月間、AI技術は急速に進歩し、新しい技術やモデルが日々登場しています。人とAIが協力して文章を書く方法も大きく変わりました。同時に、AI生成テキストをどう検出し、その結果を人がどう確認すべきか、倫理面や実務面でどのように対応すべきかについても議論が活発になっています。明確な結論が出ないまま、AI技術は今も進歩を続けています。

Wordviceはこうした変化の中で、既存モデルの性能改善を続けるとともに、モデルやサービスの抜本的な見直しにも取り組んできました。2026年のEMNLPで発表予定の論文"Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing,"では、人が書いた文章や専門家による校正を受けた文章が、AI検出にどう影響するかについて検証しました。(関連記事)そしてこの度、AI Detector 2.0をリリースする運びとなりました。

今回のアップデートでは、AI生成テキストの検出性能を高めるだけでなく、実際の利用場面でよく見られるAIによるリライトや、人とAIのどちらが書いたか判断しにくい事例を、より確実に検出することに重点を置きました。検出結果を理解し、確認しやすくするため、文単位の詳細な情報も充実させています。

AI Detector 2.0の主な改善点は、次の3つです。

  • 幅広い出所のデータで学習したAI生成テキストの検出モデル
  • 誤分類の起きやすい事例を重点的に追加学習するHard Negative Mining(HNM)
  • 文書内でAI生成パターンが比較的強く表れている箇所を、文単位で可視化するBoundary Detector

社内評価では、最終モデルが学習データと同じ領域のテストセットでF1 score of 0.9773、AUROC of 0.9979を記録しました。特に、AIが既存の文章を書き換えたテキストの検出では、F1 score of 0.9819、recall of 0.9917という結果が得られました。

ただし、性能指標が高くても、検出結果だけで誰が書いたかを断定できるわけではありません。AIチェッカーの結果は、テキストがモデルの学習したAI生成パターンにどの程度似ているかを示すものです。これは執筆の経緯や文脈、修正履歴、人による確認と合わせて判断する必要があります。

利用上限も見直し、すべての有料ユーザーを対象に、AIチェッカーの月間の利用上限を100万文字に拡大します。執筆や推敲の中で繰り返し使えるようにするためです。AIチェッカーは完成した文書を一度確認するだけでなく、執筆の途中でAI特有の表現や「AI slop」を確認・修正し、文章の質を高めるためにも活用できると考えています。

Wordviceは、韓国出版文化産業振興院の公式支援を受け、AI検出性能の向上プロジェクトを開始しました。この取り組みをもとに、年内に2回目の大規模アップデートを予定しています。次回はAIらしい文体の検出に加え、出典の確認や論理の整合性チェックなど、AIの安易な利用から生じる問題への対応を目指します。今後の進展にもご注目ください。以下では、AI Detector 2.0のモデル構造、学習方法、評価データ、詳細な性能を紹介します。

Detector 2.0では技術面で何が変わったのか?

1. 実際の利用場面に即した、多様な文章パターンを学習

Detector 2.0は、人が書いた文章とAIが生成した文章、合わせて約60万件を使って学習しました。

学術文書から一般的な文章まで、AIによる生成やリライトの多様な事例を含め、実際の利用場面で見られる幅広い文章パターンを学習できるようにしました。

しかし、学習データを増やすだけでは十分ではありませんでした。

初期モデルの誤りを分析すると、誤分類は人とAIの区別が難しい事例に集中していました。人が書いた文章をAI生成と判定する一方、AIが生成した文章でも、人の文章に似ていると見逃すケースがあったのです。

Detector 2.0では、こうした事例を選び出し、追加学習で重点的に扱いました。

2. Hard Negative Miningで判別の難しい事例を追加学習

最初の学習を終えた後、モデルが判別しにくい事例を選び、追加学習に使用しました。この手法を、社内ではHard Negative Mining (HNM)と呼んでいます。

具体的には、人が書いた文章のうちAI生成のスコアが比較的高かったものと、AIが生成した文章のうちスコアが比較的低かったものを選びました。誤分類した事例だけを集めるのではなく、判定が正しかったかどうかにかかわらず、人とAIの区別が難しい事例に重点を置く方法です。

2回目の学習では、選んだ事例の重みを高め、学習中により頻繁に使われるようにしました。容易に区別できる事例だけでなく、実際の検出で判断に迷う文章も重点的に学習させています。

3. 文書全体の結果に、文や区間ごとの分析を追加

Detector 2.0では、文書全体の検出結果に加えて、AI生成パターンが文書のどの部分に強く表れているかを詳しく確認できます。

Boundary Detectorは、テキストの各トークンが人とAIのどちらの文章パターンに近いかを分類するモデルです。トークンごとのスコアを単語や文単位に集計し、AI生成パターンが比較的強く表れている箇所を表示します。

このBoundary分析と、Detector 2.0の文単位の分析は別の仕組みです。Boundary Detectorによるハイライトは、トークン単位の予測を集計して文書内の細かなパターンを示します。一方、文ごとのスコアは、前後の文脈も含めて各文を分析する別のモデルで算出されます。

最終的な検出結果は、文書全体の検出と文単位の分析を合わせて決定されます。各分析は、結果を理解するための情報としても使われます。Boundaryのハイライトと文ごとのスコアは算出方法が異なるため、それぞれの役割を踏まえて読み取る必要があります。

AIによるリライトの検出はどう改善されたのか?

HNMの効果が特に明確に表れたのは、AIが既存の文章を書き換えたAI-rewritten textの評価でした。

評価項目 初期モデル Detector 2.0 変化
AI Rewrite F1 約0.955 0.9819 +0.027
AI Rewrite Recall 約0.933 0.9917 +0.059

別途用意した、学習データと同じ領域のテストセットでも、最終モデルはF1 score of 0.9773、AUROC of 0.9979を記録しました。

特に、AIリライトの評価では再現率(Recall)が約0.933から0.9917に向上しました。この評価データでは、AIがリライトした文章を、人が書いた文章と誤判定するケースが減ったことを示しています。

Detector 2.0が目指したのは、全体の性能指標を高めることだけではありません。従来の検出モデルでは判断しにくかったAIによるリライトや、人とAIの区別が難しい事例への対応も、主要な目標でした。

文単位の情報をどう活用するか?

文書全体に対して「AI生成パターンに似ています」とだけ表示されても、なぜその結果になったのかは分かりにくいものです。

Detector 2.0では、AI生成パターンが比較的強く表れている部分を詳しく示し、どこを確認すべきか判断しやすくしています。

例えば、次のように表示されます。

文 AI類似度
"This study examines…" 0.82
"We propose a novel…" 0.31

ただし、0.82というスコアは、その文をAIが書いた確率が82%という意味ではありません。

このスコアは、モデルが捉えたパターンを分かりやすく示すための、相対的なAI類似度の指標です。

スコアが高いだけで、その文を「AIが書いた」と断定することはできません。文単位の情報は、追加で確認すべき箇所を見つけるための手がかりです。

Boundary Detectorをどのように評価したのか?

Boundary Detectorは、人が書いた文章とAIが生成した文章の切り替わる位置を検出する、公開ベンチマークで評価しました。

評価指標には、予測した切り替わり位置と実際の位置のずれを平均したMAE (Mean Absolute Error)を使用しました。値が小さいほど、境界を正確に検出できたことを示します。

参考として、同じSemEvalのテストセットで報告されている既存システムの結果を併記します。

システム Overall MAE ↓
SemEval公式ベースライン 21.54
TM-TREK 15.68
DeepPavlov 13.38
Wordvice Boundary Detector 7.16

ただし、この表はシステムの性能を直接順位付けするものではありません。

各システムは学習データや条件が異なるため、同じテストセットの数値だけで性能の優劣は判断できません。ここでは、Wordvice Boundary Detectorが同じ公開ベンチマークでどのような結果を示したかを確認するための参考情報として掲載しています。

学習データに近い学術文書には強い一方、未学習の分野では慎重な解釈が必要

全体の性能指標だけでなく、モデルがどのような文章を得意とし、どのような文章の判別を苦手とするのかを把握することも大切です。

Boundary Detectorの評価結果をデータの種類別に見ると、次のような差がありました。

評価環境 MAE ↓ Token F1
学習データの分布に近い学術テキスト 2.72 0.987
学習に含まれていない分野のテキスト 15.96 0.956
全体 7.16 0.973

学習データの分布に近い学術文書では高い境界検出性能を示した一方、学習に含まれていない分野では誤差が大きくなりました。

これはAI検出システムの限界の一つです。あるデータセットで高い性能を示しても、すべての言語や分野、文章の種類で同じ精度が得られるとは限りません。

Detector 2.0では、この限界を踏まえたガイドも行います。入力情報が足りない場合や、十分に検証されていない言語・分野の場合は、結果を慎重に読み取っていただくためのガイドを表示します。

現在、文単位の分析で最も検証が進んでいるのはEnglish academic textです。英語以外の文章や、学習データの分布と大きく異なる文章では、文単位の結果をより慎重に解釈する必要があります。

実際の利用では何が変わるのか?

Detector 2.0の改善点を、利用場面ごとにまとめました。

利用場面 従来の検出における課題 Detector 2.0の改善点
AIが文章全体を生成した場合 多様な生成パターンをすべて捉えるのが難しい 人とAIの幅広い文章パターンを学習
人が書いた文章をAIでリライトした場合 表現が自然になることで検出が難しくなる HNMにより、判別の難しいAIリライトの事例を重点的に学習
人がAIに似た文体で書いた場合 人が書いた文章をAI生成と誤判定する可能性がある 判別の難しい、人が書いた文章を追加学習に使用
文書の一部にAI生成パターンが強く表れている場合 文書全体の結果だけでは、確認すべき箇所が分かりにくい Boundary Detectorと文単位の分析により、文や区間ごとの情報を提供
短い文章や、検証が十分でない種類の文章 情報が限られる中で、結果を過信するおそれがある 結果を慎重に解釈するためのガイドを表示