AI가 쓴 글인데... 사람이 쓴 걸로 오해받는다?

AI가 쓴 글을 잡아내는 탐지기가 오히려 '기본 AI 모델'이 쓴 글은 사람 글이라고 판단하는 경우가 많다는 연구 결과가 나왔습니다. 상식적으로 생각하면 AI 탐지기는 AI 글을 잘 찾아내야 하는데, 오히려 특정 AI 글은 '사람 글'로 오해하는 겁니다.

왜 이런 연구가 필요했을까?

요즘 학교나 시험에서 학생이 제출한 과제가 AI로 썼는지 확인하는 프로그램을 많이 씁니다. GPTZero나 팡그램(Pangram) 같은 서비스인데요. 그런데 이 연구진은 재미있는 사실을 발견했습니다. AI가 답을 내놓는 방식을 살짝 바꿔서 만든 '지시형 AI 모델'이 쓴 글은 탐지기가 잘 걸러냅니다. 하지만 아무런 조작 없이 기본 상태로 글을 쓰는 '기본 AI 모델'이 쓴 글은 오히려 '사람이 쓴 글'로 판단하는 경우가 많았습니다. 이 말은 탐지기가 진짜 AI 글을 제대로 못 찾고 있다는 뜻입니다.

연구진이 찾아낸 해결 방법

연구진은 이 문제를 해결하기 위해 간단한 방법을 제안했습니다. 바로 '반복해서 다시 쓰기(HIP)'라는 기법입니다. 기본 AI 모델을 가져와서, 이미 써진 글을 다시 쓰는 능력만 살짝 키워줍니다. 그러면 원래 의미는 그대로 유지하면서도 AI 탐지기가 '사람 글'로 착각하게 만드는 겁니다. 이 방법은 Llama-3나 Qwen-3 같은 여러 AI 모델에서 효과가 있었고, 심지어 아주 작은 모델(0.6B 크기)부터 큰 모델(70B 크기)까지 모두 잘 작동했습니다. 연구진은 이 결과를 통해 현재 AI 탐지기가 AI의 '지시 조정'이라는 특정 기술 자국만 추적하고 있다는 사실을 밝혀냈습니다.

우리 생활에 어떤 영향을 줄까?

이 연구가 의미하는 바는 간단합니다. 지금 학교에서 쓰는 AI 탐지기가 완벽하지 않다는 겁니다. 학생이 AI로 과제를 썼는지 확인하는 프로그램이 오히려 AI 글을 사람 글이라고 판단할 수 있습니다. 반대로 사람이 직접 쓴 글을 AI 글이라고 잘못 판단할 수도 있습니다. 연구진이 제안한 방법은 이런 탐지기를 속이기 위한 기술이지만, 동시에 탐지기가 왜 실패하는지 알려주는 단서이기도 합니다. 앞으로 더 똑똑한 탐지기를 만들기 위해서는 AI가 글을 쓰는 진짜 특징을 찾아내는 연구가 필요해 보입니다.

📖 원문 보기: arXiv 원문

본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.