Mise à jour produit : lancement de Wordvice AI Detector 2.0
Neuf mois après la sortie d'AI Detector 1.0 en décembre 2025, nous déployons une mise à jour majeure du modèle.
Au cours des neuf derniers mois, l'intelligence artificielle a progressé à un rythme extraordinaire, avec de nouvelles technologies et de nouveaux modèles apparaissant presque quotidiennement. Les façons dont les humains et l'IA collaborent dans le processus d'écriture ont également évolué rapidement. Dans le même temps, les discussions se sont intensifiées sur la manière de détecter le texte généré par l'IA, sur la manière dont les résultats de détection devraient être examinés par des humains, et sur les mesures éthiques ou pratiques à adopter. Pourtant, malgré ces discussions en cours, aucun consensus clair n'a encore émergé, alors que la technologie de l'IA continue de progresser à une vitesse remarquable.
Dans ce contexte en constante évolution, Wordvice a continué à améliorer les performances de ses modèles existants tout en envisageant des changements plus fondamentaux, à la fois pour le modèle lui-même et pour l'ensemble du service. En particulier, notre article de recherche, « Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing », qui doit être présenté à EMNLP 2026, a permis d'approfondir notre compréhension technique de la manière dont les textes rédigés par des humains et révisés professionnellement interagissent avec les systèmes de détection de l'IA. Lisez-en plus sur notre article de blog.
Et aujourd'hui, nous lançons AI Detector 2.0.
Cette mise à jour ne consiste pas simplement à détecter davantage de texte généré par l'IA. Elle vise à identifier de manière plus fiable le texte réécrit par l'IA et les cas limites difficiles qui apparaissent dans l'utilisation réelle de Wordvice. Nous avons également amélioré les informations au niveau de la phrase pour aider les utilisateurs à mieux comprendre et examiner les résultats de détection.
Les trois principales améliorations d'AI Detector 2.0 sont :
- Un modèle de détection de texte généré par l'IA entraîné sur des données provenant d'un large éventail de sources
- Le Hard Negative Mining (HNM), qui concentre l'entraînement supplémentaire sur les cas difficiles fréquemment mal classés
- Un Boundary Detector qui met en évidence les parties d'un document présentant des schémas générés par l'IA relativement plus marqués au niveau de la phrase
Dans notre évaluation interne, le modèle final a obtenu un score F1 de 0,9773 et un AUROC de 0,9979 sur l'ensemble de test in-domain. En particulier, pour la détection de réécriture par l'IA, où l'IA est utilisée pour réécrire un texte existant, le modèle a obtenu un score F1 de 0,9819 et un rappel de 0,9917.
Cependant, des indicateurs de performance élevés ne signifient pas que les résultats de détection de l'IA peuvent être considérés comme une preuve définitive de la paternité d'un texte. Un détecteur d'IA fournit un signal indiquant à quel point un texte ressemble aux schémas générés par l'IA appris par le modèle. Ses résultats doivent donc être interprétés conjointement avec le processus d'écriture, le contexte, l'historique des révisions et un examen humain.
Nous mettons également à jour notre politique d'utilisation. Pour permettre aux utilisateurs payants d'utiliser l'AI Detector sans limitation pratique réelle, le quota d'utilisation mensuel est porté à 1 million de caractères. Cela reflète notre conviction qu'un détecteur d'IA ne devrait pas être utilisé une seule fois pour vérifier un document terminé. Il peut au contraire être utilisé tout au long du processus d'écriture et de révision pour identifier et réduire les schémas spécifiques à l'IA, ou « AI slop », aidant ainsi les utilisateurs à produire finalement un texte de meilleure qualité.
En septembre, Wordvice a également lancé un projet d'amélioration des performances du détecteur d'IA avec le soutien officiel de la Publication Industry Promotion Agency of Korea. Sur cette base, nous prévoyons une seconde mise à jour majeure avant la fin de l'année. La prochaine mise à jour ira au-delà de la simple identification des schémas d'écriture proches de l'IA et se concentrera sur les problèmes pratiques pouvant résulter d'une utilisation négligente ou inappropriée de l'IA, notamment la vérification des sources et les contrôles de cohérence logique.
Nous sommes impatients de partager davantage au fil de l'avancement du projet. Ci-dessous, nous examinons plus en détail l'architecture du modèle, la méthodologie d'entraînement, les données d'évaluation et les performances détaillées d'AI Detector 2.0.
Qu'est-ce qui a techniquement changé dans Detector 2.0 ?
1. Entraîné sur un éventail plus large de schémas d'écriture réels
Detector 2.0 a été entraîné sur environ 600 000 textes rédigés par des humains et générés par l'IA. Les données d'entraînement comprennent des écrits académiques et généraux, ainsi qu'un large éventail de textes générés et réécrits par l'IA, ce qui permet au modèle d'apprendre des schémas reflétant plus fidèlement l'utilisation réelle.
Cependant, une simple augmentation du volume des données d'entraînement n'était pas suffisante.
Notre analyse du modèle initial a montré que les erreurs de classification avaient tendance à se concentrer autour de cas limites difficiles. Dans certains cas, le modèle identifiait un texte rédigé par un humain comme généré par l'IA. Dans d'autres, un texte généré par l'IA ressemblait fortement à une écriture humaine et passait inaperçu.
Pour résoudre ce problème, Detector 2.0 identifie ces cas difficiles séparément et leur accorde une importance accrue lors de l'entraînement supplémentaire.
2. Le Hard Negative Mining concentre l'entraînement sur les cas difficiles
Après la phase d'entraînement initiale, nous avons sélectionné des exemples que le modèle avait relativement du mal à classer et les avons intégrés dans un cycle d'entraînement supplémentaire. En interne, nous appelons ce processus Hard Negative Mining (HNM).
Plus précisément, nous avons sélectionné des textes rédigés par des humains ayant reçu des scores de génération par l'IA relativement élevés, ainsi que des textes générés par l'IA ayant reçu des scores relativement faibles. En d'autres termes, ce processus ne se limite pas à rassembler les exemples que le modèle a mal classés. Il se concentre plus largement sur les cas où la distinction entre écriture humaine et écriture par l'IA est difficile à établir pour le modèle, indépendamment du fait que sa prédiction initiale était techniquement correcte.
Lors de la seconde phase d'entraînement, ces exemples difficiles ont reçu un poids plus important afin qu'ils apparaissent plus fréquemment dans le processus d'entraînement. Cela a permis au modèle de se concentrer non seulement sur des exemples déjà faciles à distinguer, mais aussi sur des textes représentant de véritables défis dans la détection réelle.
3. Ajout d'une analyse plus détaillée au niveau de la phrase et du segment
Detector 2.0 va au-delà d'un résultat unique pour l'ensemble d'un document. Il fournit également des informations plus détaillées sur les endroits où les schémas générés par l'IA apparaissent le plus fortement dans le texte.
Le Boundary Detector est un modèle au niveau du token qui classe les schémas humains ou générés par l'IA pour chaque token individuel. Ces scores au niveau du token sont ensuite agrégés au niveau du mot et de la phrase, permettant aux utilisateurs d'identifier les sections d'un document où les schémas générés par l'IA sont relativement plus prononcés.
Cette analyse Boundary est distincte du chemin d'analyse au niveau de la phrase de Detector 2.0. Alors que le Boundary Detector agrège les prédictions au niveau du token pour mettre en évidence des schémas détaillés au sein d'un document, le score de phrase est généré par un modèle distinct qui évalue chaque phrase avec son contexte environnant.
Le résultat de détection final prend en compte à la fois la détection au niveau du document et l'analyse au niveau de la phrase, tandis que ces différents chemins d'analyse fournissent également des informations explicatives supplémentaires. Les mises en évidence Boundary et les scores de phrase sont donc générés de manières différentes et doivent être interprétés selon leurs rôles respectifs.
Comment la détection de réécriture par l'IA s'est-elle améliorée ?
L'impact du HNM s'est révélé particulièrement clair dans notre évaluation du texte réécrit par l'IA, où l'IA est utilisée pour réécrire un contenu existant.
| Indicateur d'évaluation | Modèle initial | Detector 2.0 | Évolution |
|---|---|---|---|
| AI Rewrite F1 | Env. 0,955 | 0,9819 | +0,027 |
| AI Rewrite Recall | Env. 0,933 | 0,9917 | +0,059 |
Sur un ensemble de test in-domain distinct, le modèle final a également obtenu un score F1 de 0,9773 et un AUROC de 0,9979.
En particulier, le rappel sur l'évaluation de réécriture par l'IA est passé d'environ 0,933 à 0,9917. Cela indique que, dans cet ensemble de données d'évaluation, moins de textes réécrits par l'IA ont été incorrectement classés comme rédigés par des humains.
L'objectif de Detector 2.0 n'était pas simplement d'améliorer les indicateurs de performance globaux. Un objectif clé était d'améliorer la détection du texte réécrit par l'IA et des cas limites difficiles avec lesquels les détecteurs existants peuvent avoir du mal dans l'utilisation réelle.
Comment les informations au niveau de la phrase peuvent-elles être utilisées ?
Lorsqu'un détecteur ne fournit qu'un résultat au niveau du document, tel que « Similaire aux schémas générés par l'IA », il peut être difficile pour les utilisateurs de comprendre ce qui a contribué à ce résultat.
Detector 2.0 fournit des informations plus détaillées sur les endroits où les schémas générés par l'IA apparaissent relativement fortement dans le texte, aidant les utilisateurs à identifier quelles parties pourraient justifier un examen plus approfondi.
Par exemple :
| Phrase | Similarité IA |
|---|---|
| « This study examines… » | 0,82 |
| « We propose a novel… » | 0,31 |
Un score de 0,82 ne signifie pas qu'il y a 82 % de probabilité que la phrase ait été écrite par l'IA.
Ces scores sont des indicateurs relatifs conçus pour rendre les schémas identifiés par le modèle plus faciles à interpréter pour les utilisateurs. Un score élevé pour une phrase donnée ne doit donc pas être considéré comme une preuve que la phrase a été générée par l'IA.
L'objectif des informations au niveau de la phrase est d'aider les utilisateurs à identifier les parties d'un document susceptibles de nécessiter un examen plus approfondi.
Comment le Boundary Detector a-t-il été évalué ?
Nous avons évalué le Boundary Detector à l'aide d'un benchmark public de détection de texte par l'IA conçu pour identifier les points de transition entre texte rédigé par un humain et texte généré par l'IA.
L'indicateur d'évaluation principal était le MAE (Mean Absolute Error), qui mesure la distance moyenne entre le point de transition humain/IA prédit et le point de transition réel. Un MAE plus faible indique une détection de frontière plus précise.
À titre de référence, les résultats précédemment rapportés sur le même ensemble de test SemEval sont présentés ci-dessous.
| Système | Overall MAE ↓ |
|---|---|
| Référence officielle SemEval | 21,54 |
| TM-TREK | 15,68 |
| DeepPavlov | 13,38 |
| Wordvice Boundary Detector | 7,16 |
Ce tableau ne doit toutefois pas être interprété comme un classement direct des performances des systèmes.
Chaque système a été entraîné avec des données et des conditions différentes, si bien que les résultats mesurés sur le même ensemble de test seuls ne suffisent pas à établir une supériorité absolue de performance. Ces résultats démontrent plutôt la manière dont le Wordvice Boundary Detector s'est comporté sur ce même benchmark public.
Plus performant sur les textes académiques familiers, mais une prudence accrue est nécessaire dans les nouveaux domaines
Les indicateurs de performance globaux ne racontent qu'une partie de l'histoire. Il est tout aussi important de comprendre où un modèle est performant et où il peut rencontrer davantage de difficultés.
Lorsque nous décomposons les résultats du Boundary Detector par environnement de données, une différence claire apparaît.
| Environnement d'évaluation | MAE ↓ | Token F1 |
|---|---|---|
| Textes académiques similaires à la distribution d'entraînement | 2,72 | 0,987 |
| Domaines externes non vus | 15,96 | 0,956 |
| Global | 7,16 | 0,973 |
Le Boundary Detector a affiché de bonnes performances sur les textes académiques proches de sa distribution d'entraînement, tandis que le taux d'erreur a augmenté sur les domaines externes non représentés dans l'entraînement.
Il s'agit d'une limite importante des systèmes de détection de l'IA. Une forte performance globale sur un jeu de données ne garantit pas le même niveau de précision pour toutes les langues, tous les domaines ou tous les types d'écriture.
Detector 2.0 reflète également cette limite dans l'expérience produit. Lorsque les informations d'entrée sont insuffisantes, ou lorsqu'une langue ou un domaine n'a pas encore été suffisamment validé, les utilisateurs reçoivent des indications supplémentaires les encourageant à interpréter les résultats avec plus de prudence.
Actuellement, l'analyse au niveau de la phrase a été le plus largement validée sur les textes académiques en anglais. Les résultats au niveau de la phrase pour un texte non anglais ou un texte qui diffère sensiblement de la distribution d'entraînement doivent donc être interprétés avec une prudence accrue.
Qu'est-ce qui change dans l'utilisation réelle ?
Les améliorations pratiques de Detector 2.0 peuvent être résumées comme suit.
| Scénario d'utilisation | Difficulté avec la détection existante | Amélioration apportée par Detector 2.0 |
|---|---|---|
| L'IA génère l'intégralité du texte | Difficile de capturer toute la gamme des schémas de génération par l'IA | Entraînement sur un éventail plus large de schémas d'écriture humains et générés par l'IA |
| Un texte rédigé par un humain est réécrit par l'IA | La réécriture peut rendre le texte plus naturel et plus difficile à détecter | Pondération d'entraînement accrue sur les cas difficiles de réécriture par l'IA grâce au HNM |
| Un humain écrit dans un style proche de l'IA | Un texte rédigé par un humain peut être incorrectement identifié comme généré par l'IA | Les cas difficiles rédigés par des humains sont intégrés dans l'entraînement supplémentaire |
| Les schémas de l'IA apparaissent fortement dans une seule partie d'un document | Un résultat au niveau du document seul ne montre pas quelles sections nécessitent un examen | Informations au niveau de la phrase et du segment grâce au Boundary Detector et à l'analyse de phrase |
| Le texte est court ou appartient à un domaine peu validé | Des informations limitées peuvent amener les utilisateurs à accorder trop de confiance au résultat | Des indications supplémentaires encouragent une interprétation plus prudente |