**오픈AI(OpenAI)**가 유럽연합(EU)에서 제공하는 챗GPT와 코덱스(Codex) 생성 텍스트에 눈에 보이지 않는 워터마크를 심는다. 다만 자체 실험 결과, 전체 단어의 10%만 동의어로 바꿔도 탐지 성공률이 66% 수준으로 떨어지는 것으로 나타났다.

핵심 포인트

  • 향후 몇 주 내 EU 거주 챗GPT·코덱스 이용자 전 요금제에 워터마크가 도입되며, API 고객은 ‘옵트인(선택 활성화)’ 방식으로 이용 가능.

  • 자체 평가에서 단어의 25%를 동의어로 교체하자 탐지율이 17%까지 급락.

  • 탐지 시스템은 초기에는 승인된 연구자 및 전문 기관에만 제한 제공.

오픈AI, 워터마크 단계적 도입

오픈AI는 월요일 블로그 공지를 통해, 워터마크 기술을 향후 몇 주에 걸쳐 EU 내 챗GPT·코덱스 이용자 전 요금제에 적용할 계획이라고 밝혔다. 출범 시점부터 전 세계 기본값으로 적용되지는 않는다.

전 세계 어떤 지역이든, 오픈AI API를 사용하는 개발자들은 특정 모델에 한해 지금부터 워터마크 기능을 켜도록 설정할 수 있지만, 기본값은 ‘꺼짐’ 상태로 유지된다. 이번 조치는 8월 2일부터 발효된 EU AI 법(EU AI Act)의 표시 의무에 대응한 것이다. 이 법은 AI 텍스트 제공사가 기계가 판별할 수 있는 형태로 AI 생성 텍스트를 식별 가능하게 할 것을 요구한다. 이미 시장에 나와 있는 기업들은 올해 12월 2일까지 규정을 준수해야 한다는 유예기간이 부여돼 있다.

관련 기사: 바이낸스 AI 에이전트, 문장만 입력하면 전략 설계…거래 수수료 19.99 USDC

‘텍스트그레인’ 탐지 성능의 한계

오픈아이의 워터마킹 방식 ‘텍스트그레인(textGrain)’은 눈에 보이는 표식을 남기지 않는다. 대신 모델의 어휘 선택을 미세하게 조정해 통계적 패턴을 형성하고, 탐지기가 이 패턴을 포착하도록 설계됐다. 이 패턴은 텍스트가 복사·전달돼도 함께 이동한다.

오픈AI는 이 방식이 자사가 시험한 다른 워터마크 기법, 특히 **구글(Google)**의 텍스트용 SynthID와 비교해 동등하거나 더 나은 성능을 보였다고 밝혔다. 회사는 해당 기술을 오픈소스로 공개할 계획도 내놨다.

그러나 편집이 이루어지면 신호는 급격히 약해진다.

오픈AI가 400토큰 분량의 문단을 대상으로 평가한 결과, 전체 단어의 약 10%를 동의어로 교체했을 때 탐지율은 약 92%에서 66%로 하락했다. 단어의 25%를 동의어로 바꾸자 탐지율은 17%까지 떨어졌다. 분량이 짧은 답변, 수학 문제 풀이, 번역문 역시 탐지가 더 어려운 것으로 나타났다. 예컨대 심리학 등 주제로 작성된 200토큰 분량 텍스트의 경우, 허위 양성률(사람이 쓴 글을 AI로 잘못 판단하는 비율)을 1%로 제한했을 때 약 80%만 포착하는 수준이다.

챗GPT 탐지기, 일반 공개는 ‘보류’

오픈AI는 워터마크 탐지 도구의 접근 권한을 당분간 승인된 연구자와 전문 기관에만 제한한다고 밝혔다. 워터마크가 있음에도 놓치는 사례(미탐)와 사람 글을 AI로 잘못 분류하는 오탐 위험을 이유로 들었다.

또 “워터마크가 없다고 해서 곧바로 인간이 작성했다는 증거가 되는 것은 아니다”라고 경고했다. 워터마크 자체도 작성자, 계정, 프롬프트(질의) 정보는 담지 않아 개별 사용자를 특정할 수 없다고 설명했다.

이번 조치는 **앤트로픽(Anthropic)**의 행보를 사실상 뒤따르는 것이다. 앤트로픽은 지난 8월, 자사 AI인 클로드(Claude)가 생성하는 텍스트에 전 세계적으로 워터마크를 적용하겠다고 발표했으며, 이 결정은 일부 이용자들의 반발을 불러일으켰다. 오픈AI 역시 과거 텍스트 워터마크를 개발해 놓고도, 이용자가 경쟁 서비스로 이탈할 수 있다는 우려 등으로 공개를 미뤄온 것으로 2024년 보도에서 전해졌다.

오픈AI와 앤트로픽, 구글, 메타(Meta), 마이크로소프트(Microsoft) 등 주요 빅테크 기업들은 모두 AI 생성 콘텐츠 투명성에 관한 EU 자율 규범(Code of Practice)에 서명한 상태다.

다음 읽기: 조르자 멜로니, 자신의 목소리 상표 등록 추진…AI 딥페이크 막을 수 있을까