Wordvice AI Blog

產品更新 | Wordvice AI 檢測工具 2.0 正式發布

距離 2025 年 12 月 Wordvice AI 檢測工具 1.0 發布已過去 9 個月,我們完成了一次大規模模型疊代。

過去 9 個月,人工智慧技術疊代速度極快,新技術層出不窮。人機協同寫作的模式也在持續演變,圍繞 AI 生成內文的檢測方法、人工審核規範以及倫理層面應對措施的討論始終十分活躍,但在產業尚未形成統一共識的背景下,AI 技術仍在高速發展。

Wordvice 在這樣的產業環境中持續優化現有 AI 檢測器的模型效能,同時不斷探索模型與服務的底層創新。尤其是我們計畫在 2026 年 EMNLP 會議上發表的論文《Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing》(風格作為混淆因素:AI 檢測非母語學術寫作中的偽陽性,查看相關解讀),為本次疊代奠定了扎實的技術基礎。今天,Wordvice AI 檢測工具 2.0 正式上線。

本次更新的核心目標並非單純擴大可檢測的 AI 生成內文範圍,而是重點提升在 Wordvice 真實使用情境下,對 AI 改寫文字、模糊邊界案例的穩定檢測能力;同時強化了句子級檢測詳情展示功能,幫助使用者更好地理解和複核檢測結果。

Wordvice AI 檢測工具 2.0 核心特性如下:

  • 基於多源資料訓練的 AI 生成內文檢測模型
  • 針對高頻誤判困難案例最佳化的難例挖掘(Hard Negative Mining, HNM)技術
  • 可在文件中以句子為單位,視覺化展示 AI 生成模式相似度較高片段的邊界檢測器(Boundary Detector)

內部評估結果顯示,最終模型在領域內測試集上 F1 值達 0.9773,AUROC 達 0.9979;尤其是在 AI 改寫內文(AI Rewrite)專項評估中,F1 值達 0.9819,召回率達 0.9917,表現優異。

需要特別說明的是,高效能指標並不代表 AI 檢測結果可以作為判定內文撰寫主體的確鑿證據。AI 檢測工具的輸出僅代表文字與訓練集中 AI 生成模式的相似程度訊號,必須結合寫作過程、上下文語境、修改紀錄以及人工審核結果綜合解讀。

與此同時,我們也調整了使用額度政策,所有付費使用者的 AI 檢測工具月度使用額度提升至 100 萬字,基本可滿足無限制使用需求。這一調整是因為 AI 檢測工具的價值不止於單篇文件的檢測結果確認,更在於寫作過程中持續排查、修正 AI 生成特有的表達痕跡(AI Slop),最終產出更高品質的文章。

Wordvice 在韓國出版文化產業振興院的官方支持下啟動了 AI 檢測工具升級專案,並計畫於今年年底前完成第二次大規模疊代。第二次更新將不止於 AI 風格內文檢測,還將針對 AI 不合規使用可能引發的實際問題,新增引用錯誤校驗、邏輯一致性驗證等功能,敬請期待。下文將詳細介紹 AI Detector 2.0 的模型結構、訓練方法、評估資料及具體效能等技術細節。

Detector 2.0 做了哪些技術升級?

1. 涵蓋真實使用情境下的多元寫作模式

Detector 2.0 基於約 60 萬條人類撰寫與 AI 生成的內文樣本訓練,涵蓋學術內文和通用內文,包含各類 AI 生成、AI 改寫案例,旨在學習真實使用情境中可能出現的廣泛寫作模式。

但僅擴充訓練資料量遠遠不夠。

我們對初期模型的錯誤案例分析後發現,誤判往往集中在特定邊界場景,比如模型判定為 AI 生成、實際為人類撰寫的內文,或是 AI 生成但表達高度接近人類寫作、被模型漏判的內文。

Detector 2.0 專門篩選了這類困難案例,納入補充資料集中進行重點訓練。

2. 透過難例挖掘(HNM)針對困難案例進行最佳化

第一階段訓練完成後,模型會自動篩選出判定難度較高的案例用於追加訓練,我們內部將這一流程稱為難例挖掘(Hard Negative Mining, HNM)。

具體而言,我們在人類撰寫的內文中篩選出模型判定為 AI 生成機率較高的案例,在 AI 生成內文中篩選出模型判定為 AI 生成機率較低的案例。這並非簡單收集模型分類錯誤的樣本,而是無論分類正確與否,重點聚焦於模型難以劃分人類與 AI 寫作邊界的案例。

第二階段訓練中,我們提高了這些困難案例的訓練權重與抽樣頻率。透過這種方式,模型不再只是學習容易辨識的樣本,更能集中攻克實際檢測中判定難度較高的文字。

3. 新增文件級結果下的句子級細節分析

Detector 2.0 新增了分析功能,使用者不僅可以查看整篇文件的檢測結果,還可以定位文件中 AI 生成特徵較高的具體片段。

邊界檢測器(Boundary Detector)是一個 Token 別的模型,會評估文字中每個 Token 屬於人類寫作或 AI 生成模式,再將得分彙整至詞彙與句子層級,幫助使用者更直覺地掌握文件中 AI 生成模式較為突出的區間。

邊界分析與 Detector 2.0 的獨立句子分析是兩條相互獨立運作的機制:邊界標示功能透過彙整 Token 級別的預測結果,呈現文件內部的細節模式;而句子得分則由獨立模型結合前後文語境,對每個句子進行單獨評估。

最終的檢測結果會結合文件級檢測與句子級分析進行綜合判定,同時將上述兩條分析機制產生的結果作為獨立的輔助資訊提供給使用者。因此,邊界標示與句子得分是基於不同邏輯產出的結果,解讀時需要區分二者的作用。

AI 改寫檢測能力有哪些提升?

HNM 技術的效果在「AI 改寫既有文字」的情境中格外顯著,AI 改寫專項評估結果如下:

評估指標 初期模型 Detector 2.0 提升幅度
AI 改寫 F1 約 0.955 0.9819 +0.027
AI 改寫召回率 約 0.933 0.9917 +0.059

在獨立的領域內測試集中,最終模型 F1 值為 0.9773,AUROC 達 0.9979。尤其是在 AI 改寫專項評估中,召回率從約 0.933 提升至 0.9917,這代表在此測試集中,AI 改寫文字被誤判為人類撰寫的情況已大幅減少。

Detector 2.0 的目標不止於提升整體準確率等數據,更重要的是優化真實使用情境下,現有檢測器難以識別的「AI 改寫文字」與「模糊邊界案例」的檢測表現。

如何利用句子級檢測資訊?

如果僅提供整篇文件「與 AI 生成模式相似」的整體結果,使用者很難理解判定依據。

Detector 2.0 的邊界檢測器補充了這項能力,可分析文字內部 AI 生成模式相似度較高的區間,支援使用者在句子層級查看詳情,範例如下:

句子 AI 相似度
"This study examines…" 0.82
"We propose a novel…" 0.31

需特別注意的是,0.82 這一數值並不代表該句子有 82% 的機率由 AI 撰寫。句子得分是透過邊界檢測器捕捉區間模式後,以使用者易於理解的形式呈現的「相對 AI 相似度指標」。

因此,不能僅憑某句得分較高,就斷定該句「由 AI 撰寫」,句子層級資訊的核心作用,在於協助幫助使用者定位需要重點複核的片段。

邊界檢測器的效能如何評估?

邊界檢測器的效能透過公開的 AI 文字檢測基準進行評估,該基準用於定位人類撰寫文字與 AI 生成文字的轉換點。

評估採用 MAE(平均絕對誤差)指標,用來衡量預測的人類與 AI 轉換位置與實際位置的平均偏差,數值越低,代表邊界定位越精準。

在相同 SemEval 測試集上,現有公開系統的結果參考如下:

系統 整體 MAE ↓
SemEval 官方基線 21.54
TM-TREK 15.68
DeepPavlov 13.38
Wordvice 邊界檢測器 7.16

不過,此表格不應被解讀為各系統間的效能排名。由於不同系統的訓練資料、訓練條件存在差異,僅憑相同測試集上的數值無法斷定效能的絕對優劣,該結果僅用於驗證 Wordvice 邊界檢測器在同一公開基準下的邊界檢測能力。

學術文字表現優異,新型態情境仍需謹慎解讀

比起只看整體效能指標,更重要的是明確瞭解模型在哪些情境下表現穩定、哪些情境下仍有侷限。

邊界檢測器在不同資料環境下的評估結果如下:

評估環境 MAE ↓ Token 級 F1
與訓練分布相似的學術文本 2.72 0.987
未納入訓練的外部領域 15.96 0.956
整體平均 7.16 0.973

在與訓練分布相似的學術文本中,邊界檢測器展現出較高的檢測效能,但在未涵蓋的外部領域中誤差則有所上升。

這是 AI 檢測系統普遍存在的限制:即使在某一資料集上取得優異的整體表現,也不代表在所有語言或各類型文本中都能達到相同的準確率。

Detector 2.0 在產品設計上也充分考量了這項特性:當輸入資訊不足,或針對當前尚未充分驗證的語言或領域時,系統會提供專屬提示,引導使用者更謹慎地解讀結果。

尤其是目前的句子級分析在英語學術文本中的驗證最為充分,因此針對非英語內文、或與訓練資料分布差異較大的文章,句子級結果需要更加謹慎地解讀。

實際使用體驗有哪些變化?

結合真實使用情境,Detector 2.0 的優化方向可總結如下:

使用情境 舊版檢測痛點 Detector 2.0 優化方向
全文由 AI 生成 難以涵蓋多元的生成模式 訓練資料集覆蓋多元的人類與 AI 寫作模式
人類撰寫內文經 AI 改寫 表達自然化後更難檢測 透過 HNM 重點學習困難的 AI 改寫案例
人類採用接近 AI 的風格寫作 人類撰寫的內文易被誤判為 AI 生成 將高難度的人類寫作案例納入追加訓練
文件局部 AI 模式顯著 僅靠整體結果難以定位需複查的片段 透過邊界檢測器提供句子 / 區間級別的詳情
短文本或未充分驗證的文本類型 有限資訊下易過度信任檢測結果 提供專屬提示,引導使用者謹慎解讀