Wordvice AI Blog

제품 업데이트: 워드바이스 AI 탐지기 2.0 출시

2025년 12월 AI 탐지기 1.0을 출시한 이후, 9개월 만에 대규모 모델 업데이트를 진행하였습니다.

지난 9개월 동안 인공지능 기술은 매우 빠른 속도로 발전하여, 매일 새로운 기술이 등장하고 있습니다. AI와 인간의 협업 글쓰기 방식 역시 역동적으로 변화해 왔으며, AI가 작성한 텍스트의 탐지 방법 및 윤리적 검토 방향에 대한 논의도 활발히 이루어지고 있습니다. 그러나 명확한 결론이 나지 않은 상태에서 AI 기술은 여전히 급속도로 발전하는 중입니다.

워드바이스는 이러한 산업 환경 속에서 기존 모델의 성능을 지속적으로 개선해 왔으며, 근본적인 모델 및 서비스 혁신을 위해 꾸준히 고민하고 있습니다. 특히 2026년 EMNLP 학회에서 발표 예정인 'Style as a Confound: False Positives in AI Detection of Non-Native Academic Writing'(블로그 포스트 참조) 연구를 통해 기술적 깊이를 더했습니다. 그리고 오늘, AI 탐지기 2.0을 새롭게 공개합니다.

이번 업데이트는 단순히 AI 생성 텍스트를 더 많이 탐지하는 데 그치지 않고, 실제 워드바이스 사용 환경에서 접하는 'AI 재작성 텍스트' 및 판단이 어려운 '경계 사례'를 보다 안정적으로 탐지하는 데 중점을 두었습니다. 또한 사용자가 탐지 결과를 명확히 이해하고 검토할 수 있도록 문장 단위의 상세 분석 기능을 강화하였습니다.

AI 탐지기 2.0의 주요 특징은 다음 세 가지입니다.

  • 다양한 출처의 데이터를 학습한 AI 생성 텍스트 탐지 모델
  • 오분류가 빈번한 어려운 사례를 집중적으로 재학습하는 Hard Negative Mining(HNM) 기법
  • 문서 내에서 상대적으로 AI 생성 패턴에 가까운 부분을 문장 단위로 시각화하는 Boundary Detector

내부 평가 결과, 최종 모델은 In-domain(도메인 내) 테스트셋에서 F1 점수 0.9773, AUROC 0.9979를 기록하였으며, 특히 AI가 기존 텍스트를 재작성한 AI 리라이트(Rewrite) 평가에서는 F1 0.9819, 재현율 0.9917의 우수한 성능을 나타냈습니다.

다만, 높은 성능 지표가 곧 'AI 탐지 결과가 작성 주체를 확정 짓는 절대적 증거'임을 의미하지는 않습니다. AI 탐지기의 결과는 텍스트가 학습된 AI 생성 패턴과 얼마나 유사한지 나타내는 판단 신호일 뿐이며, 작성 과정과 맥락, 수정 이력, 그리고 인간의 검토와 함께 종합적으로 해석되어야 합니다.

사용량 정책도 새롭게 개편됩니다. 모든 유료 사용자가 사실상 제한 없이 AI 탐지기를 활용할 수 있도록 사용량을 월 100만 자로 대폭 확대합니다. 이는 AI 탐지기의 역할이 단일 문서의 탐지 결과를 확인하는 데 그치지 않고, 글을 작성하는 전 과정에서 AI 특유의 흔적(AI Slop)을 지속적으로 확인하고 수정하여 최종적으로 더 높은 품질의 글을 완성하는 데 있다고 보기 때문입니다.

워드바이스는 한국출판문화산업진흥원의 공식 지원을 받아 AI 탐지기 향상 프로젝트를 시작했으며, 이를 바탕으로 올해 말까지 2차 대규모 업데이트도 계획하고 있습니다. 2차 업데이트는 단순히 AI 스타일의 글을 탐지하는 것을 넘어, 출처 및 논리 오류 검증 등 불성실한 AI 단순 활용으로 발생할 수 있는 실제 문제들을 해결하는 기능들을 선보일 예정입니다. 많은 관심 부탁드리며, AI Detector 2.0의 모델 구조, 학습 방식, 평가 데이터 및 세부 성능 등 상세한 기술적 내용은 아래에서 계속 소개합니다.

Detector 2.0에서는 기술적으로 무엇이 달라졌나요?

1. 실제 사용 환경의 다양한 글쓰기 패턴을 반영했습니다

Detector 2.0은 약 60만 건의 인간 작성 및 AI 생성 텍스트를 바탕으로 학습했습니다.

학술 및 일반 텍스트를 비롯해 다양한 AI 생성 및 재작성 사례를 포함하여, 실제 사용 환경에서 나타날 수 있는 폭넓은 글쓰기 패턴을 학습할 수 있도록 구성했습니다.

하지만 단순히 학습 데이터의 양을 늘리는 것만으로는 충분하지 않았습니다.

초기 모델의 오류를 분석해 보니 오분류는 특정한 경계 사례에 집중되는 경향을 보였습니다. 예를 들어 모델이 AI라고 판단했지만 실제로는 사람이 작성한 텍스트가 있는 반면, AI가 생성한 텍스트임에도 사람의 글과 유사해 모델이 이를 놓치는 경우도 있었습니다.

Detector 2.0에서는 이러한 어려운 사례를 별도로 선별해 추가 학습에 집중 반영했습니다.

2. Hard Negative Mining으로 어려운 사례를 다시 학습했습니다

첫 번째 학습 단계 이후에는 모델이 상대적으로 판단하기 어려워하는 사례를 선별해 추가 학습에 활용했습니다. 내부적으로는 이 과정을 Hard Negative Mining(HNM)으로 명명하고 있습니다.

구체적으로 인간 작성 텍스트 중에서는 모델이 AI일 가능성을 상대적으로 높게 평가한 사례를, AI 생성 텍스트 중에서는 AI일 가능성을 상대적으로 낮게 평가한 사례를 선별했습니다. 이는 단순히 모델이 잘못 분류한 사례만을 모으는 방식이 아니라, 정답 여부와 관계없이 사람과 AI의 경계에서 모델이 구분하기 어려운 사례에 더 집중하기 위한 과정입니다.

두 번째 학습 단계에서는 이렇게 선별된 어려운 사례가 학습 과정에서 더 자주 활용되도록 가중치를 높였습니다. 이를 통해 이미 쉽게 구별할 수 있는 데이터뿐 아니라 실제 탐지 과정에서 판단이 까다로운 텍스트까지 보다 집중적으로 학습하도록 개선했습니다.

3. 문서 전체 결과에 문장 수준 정보를 더했습니다

Detector 2.0에서는 문서 전체의 탐지 결과와 함께, 문서 내부에서 AI 생성 패턴이 상대적으로 강하게 나타나는 부분을 세부적으로 확인할 수 있는 분석 기능을 제공합니다.

Boundary Detector는 텍스트의 각 토큰을 대상으로 인간 및 AI 생성 패턴을 분류하는 토큰 단위 모델입니다. 산출된 토큰별 점수는 단어와 문장 단위로 집계되어, 사용자가 문서 내에서 AI 생성 패턴이 상대적으로 두드러지는 구간을 한눈에 확인할 수 있도록 표시됩니다.

이 Boundary 분석은 Detector 2.0의 별도 문장 분석 경로와는 구분됩니다. Boundary 하이라이트가 토큰 단위 예측을 집계해 문서 내부의 세부 패턴을 보여주는 기능이라면, 문장 점수는 각 문장을 문맥과 함께 분석하는 별도의 모델에서 산출됩니다.

최종 탐지 결과는 이러한 분석 경로를 독립적인 설명 정보로만 제공하는 것이 아니라, 문서 수준 탐지와 문장 수준 분석을 종합 고려하여 결정됩니다. 따라서 Boundary 하이라이트와 문장 점수는 서로 다른 방식으로 산출되는 결과이며, 각각의 역할을 구분하여 해석하는 것이 중요합니다.

AI 재작성 탐지가 어떻게 개선됐나요?

HNM의 효과는 특히 AI가 기존 텍스트를 다시 작성한 AI 리라이트 평가에서 뚜렷하게 나타났습니다.

평가 항목 초기 모델 Detector 2.0 변화
AI 리라이트 F1 약 0.955 0.9819 +0.027
AI 리라이트 재현율(Recall) 약 0.933 0.9917 +0.059

독립된 In-domain(도메인 내) 테스트셋에서도 최종 모델은 F1 0.9773, AUROC 0.9979를 기록했습니다.

특히 AI 리라이트 평가에서 재현율(Recall)이 약 0.933에서 0.9917로 상승했습니다. 이는 해당 평가 데이터에서 AI 재작성 텍스트가 인간 작성 텍스트로 오인되는 오탐 사례가 줄어들었음을 보여줍니다.

Detector 2.0에서 지향하는 목표는 단순히 전체 정확도 수치를 높이는 데 그치지 않습니다. 실제 사용 환경에서 기존 탐지기가 진단하기 어려워했던 AI 리라이트 및 경계 사례에 대한 탐지 성능을 보완하는 것이 핵심 과제였습니다.

문장 수준 정보는 어떻게 활용할 수 있나요?

문서 전체에 대해 "AI 생성 패턴과 유사합니다"라는 단순 결과만 제공하면 사용자는 왜 그런 결과가 나왔는지 원인을 이해하기 어렵습니다.

Detector 2.0의 Boundary Detector는 이를 보완하기 위해 텍스트 내부에서 AI 생성 패턴이 상대적으로 강하게 나타나는 구간을 분석하고, 사용자가 이를 문장 수준에서 확인할 수 있도록 합니다.

예를 들어, 다음과 같은 방식입니다.

문장 AI 유사도
"This study examines…" 0.82
"We propose a novel…" 0.31

다만 0.82라는 값이 해당 문장을 AI가 작성했을 확률이 82%라는 절대적 의미는 아닙니다.

문장별 점수는 Boundary Detector가 포착한 구간별 패턴을 사용자가 이해하기 쉬운 형태로 보여주는 상대적인 AI 유사도 지표입니다.

따라서 특정 문장의 점수가 높다는 이유만으로 해당 문장을 "AI가 작성한 문장"이라고 단정 지어서는 안 됩니다. 문장 수준 정보의 목적은 사용자가 어떤 부분을 추가로 검토해야 할지 판단하도록 도움을 주는 것입니다.

Boundary Detector는 어떻게 평가했나요?

Boundary Detector의 성능은 사람 작성 텍스트와 AI 생성 텍스트 사이의 전환 지점을 찾는 공개 AI 텍스트 탐지 벤치마크를 통해 평가했습니다.

평가 지표로는 예측한 인간/AI 전환 위치와 실제 위치 사이의 평균 오차를 나타내는 MAE(Mean Absolute Error)를 사용했습니다. 이 값은 낮을수록 실제 경계 위치를 더 정확히 찾아냈음을 뜻합니다.

동일한 SemEval 테스트셋에 보고된 기존 결과와 비교하면 다음과 같습니다.

시스템 Overall MAE ↓
SemEval 공식 baseline 21.54
TM-TREK 15.68
DeepPavlov 13.38
Wordvice Boundary Detector 7.16

단, 위 표를 시스템 간의 절대적인 순위 비교로 해석해서는 안 됩니다.

각 시스템마다 학습 데이터와 조건이 다르므로, 동일한 테스트셋 수치만으로 절대적인 성능 우열을 판단하기는 어렵습니다. 이 수치는 동일한 공개 벤치마크에서 워드바이스 Boundary Detector의 경계 탐지 역량을 확인한 결과로 보는 것이 적절합니다.

익숙한 학술 문서에서는 강하지만, 새로운 환경에서는 더 신중해야 합니다

전체 성능 수치보다 중요한 것은 모델이 잘 작동하는 환경과 한계를 명확히 파악하는 것입니다. Boundary Detector의 평가 결과를 데이터 환경에 따라 분석하면 다음과 같은 차이가 나타납니다.

평가 환경 MAE ↓ Token F1
학습 분포와 유사한 학술 텍스트 2.72 0.987
학습하지 않은 외부 도메인 15.96 0.956
전체 7.16 0.973

학습 분포와 유사한 학술 문서에서는 높은 경계 탐지 성능을 보였지만, 학습하지 않은 외부 도메인에서는 오차가 다소 증가했습니다.

이는 AI 탐지 시스템이 지닌 본질적인 한계이기도 합니다. 단일 데이터셋에서 높은 전체 성능을 기록했다고 해서 모든 분야와 언어의 글에서 동일한 수준의 정확도를 보장할 수는 없습니다.

Detector 2.0은 이러한 특성을 제품 설계에도 엄격히 반영하고 있습니다. 입력 정보가 충분하지 않거나 아직 다각도로 검증되지 않은 언어 및 도메인에서는 사용자가 결과를 보다 신중하게 해석할 수 있도록 별도의 안내를 제공합니다.

특히 현재 문장 수준 분석은 영어 학술 텍스트에서 가장 최적화되어 있습니다. 따라서 비영어 텍스트나 기존 학습 분포와 차이가 큰 글의 문장 수준 분석 결과는 참고용으로 신중하게 해석해야 하며, 워드바이스는 앞으로도 지속적인 도메인 확장 학습을 통해 정밀도를 극대화해 나갈 계획입니다.

실제 사용할 때 무엇이 달라지나요?

Detector 2.0의 변화를 실제 사용 상황을 기준으로 정리하면 다음과 같습니다.

사용 상황 기존 탐지의 어려움 Detector 2.0의 개선 방향
AI가 전체 텍스트를 생성한 경우 다양한 생성 패턴을 모두 포착하기 어려움 다양한 인간·AI 작성 패턴을 반영하여 기본 탐지력 강화
사람이 작성한 글을 AI로 재작성한 경우 표현이 자연스럽게 바뀌면서 탐지가 어려워질 수 있음 HNM을 통해 까다로운 AI 재작성 사례를 집중적으로 학습
사람이 AI와 유사한 스타일로 작성한 경우 사람이 쓴 글을 AI 생성 글로 잘못 판단할 가능성 존재 판단이 모호한 인간 작성 사례를 추가 학습에 반영하여 오탐 최소화
문서 일부에서 AI 패턴이 강하게 나타나는 경우 문서 전체 결과만으로 어느 부분을 검토해야 할지 알기 어려움 Boundary Detector를 통한 문장·구간 단위의 세부 정보 제공
짧거나 검증이 부족한 유형의 텍스트 제한된 정보만으로 결과를 과도하게 신뢰할 위험 존재 신중한 결과 해석을 위한 별도 안내 제공