서울대의 AI 탐지기 사용 중단, 교육의 본질을 되묻다
생성형 AI가 대학가에 빠르게 스며들면서 부정행위 적발을 위한 AI 탐지 서비스의 사용이 급증하고 있는 가운데, 서울대학교가 전격적으로 AI 탐지기 사용을 중단해 교육계의 주목을 받고 있다. 단순히 부정행위를 적발하
매일경제 보도 | 4 days ago 서울대의 AI 탐지기 사용 중단, 교육의 본질을 되묻다
생성형 AI가 대학가에 빠르게 스며들면서 부정행위 적발을 위한 AI 탐지 서비스의 사용이 급증하고 있는 가운데, 서울대학교가 전격적으로 AI 탐지기 사용을 중단해 교육계의 주목을 받고 있다. 단순히 부정행위를 적발하는 기술적 도구의 도입·폐기를 넘어, AI 시대에 대학 교육과 평가 방식이 어떻게 변화해야 하는지에 대한 근본적인 질문을 던지는 사건이다. 서울대의 이번 결정은 탐지 기술의 신뢰성 문제를 지적하면서도, 더 나아가 '교육의 본질'이 무엇인지에 대한 고민이 반영된 결과로 풀이된다. 과연 AI 탐지기는 공정한 평가를 위한 방패인가, 아니면 교육을 왜곡하는 걸림돌인가.
매일경제의 단독 보도에 따르면, 서울대는 지난달 1일자로 AI 탐지 서비스 'GPT킬러'와의 제휴 계약을 종료했다. GPT킬러는 입력된 문서가 생성형 AI로 작성됐을 확률을 분석해 알려주는 서비스로, 서울대는 학생뿐만 아니라 교수진에게도 해당 서비스 사용 권한을 제공하지 않고 있다. 학교 측은 "AI 탐지 서비스는 AI 사용 여부를 명확히 판단하는 대신 가능성을 추정하는 데 그친다"며 "정확도가 떨어지는 상황에서 사용하면 부작용이 커질 수 있다고 판단했다"고 배경을 설명했다. 이는 AI 부정행위가 확산되면서 탐지 서비스 도입을 오히려 강화해온 전국 대학가의 흐름과 뚜렷이 대비되는 이례적인 결정이다.
실제로 AI 탐지 서비스의 이용량은 폭발적으로 증가했다. GPT킬러 운영사인 무하유에 따르면 지난해 10월 중간고사 기간 이용량은 전년 동기 대비 3.9배로 늘었고, 특히 교수들의 평가용 이용량은 4.3배까지 급증했다. 부정행위에 대한 우려가 커지면서 탐지 서비스가 일종의 '표준 평가 도구'처럼 자리 잡아가는 분위기였다. 그러나 문제는 탐지기의 신뢰성이 충분히 검증되지 않았다는 데 있다. 대다수 AI 탐지기는 글에 나타난 생성형 AI 특유의 패턴을 분석하는 방식인데, 사람이 쓴 글이라도 자주 쓰는 표현이나 문장 구조에 따라 AI가 작성한 것으로 오판할 가능성이 크다. 반대로 AI가 쓴 글도 탐지망을 교묘히 회피할 수 있다는 한계가 지적된다.
이런 기술적 불완전성에도 불구하고 일부 강의 현장에서는 AI 탐지 결과가 사실상 평가의 잣대로 활용되고 있는 실정이다. AI 사용 정황이 포착됐다는 이유만으로 성적을 깎거나 F학점을 부여하는 사례가 나타나면서, 학생들 사이에서는 탐지기를 피하기 위한 꼼수가 횡행하고 있다. 중앙대에 재학 중인 한 학생은 "과제의 AI 유사도 결과가 일정 수준을 넘기면 채점조차 하지 않겠다는 수업도 있다"며 "논문이나 기사 등 자료를 인용하면 AI 유사도가 높아지기도 해 문장을 무의미하게 고쳐야 한다"고 토로했다. 이는 학생들이 글의 완성도나 논리적 깊이를 높이는 데 에너지를 쏟는 대신, 탐지율을 낮추기 위한 기계적인 문장 수정에 매달리는 기현상을 낳고 있다.
서울대의 이번 결정은 기술적 한계에 대한 인식과 함께 교육적 폐해에 대한 우려가 결합된 결과로 보인다. 한 서울대 공대 교수는 "교수는 학생이 무엇을 이해했는지보다 AI를 썼는지 가려내는 데 집중하고, 학생은 좋은 글을 쓰기보다 탐지율을 낮추려 문장만 고치는 상황이 벌어지고 있다"며 "수업 내용을 이해하는 데도, AI를 올바르게 활용하는 공부를 하는 데도 아무런 도움이 되지 않는다"고 지적했다. 탐지기를 통한 감시가 오히려 교육의 본질인 사고력과 창의성을 신장하는 과정을 왜곡하고 있다는 것이다. 탐지기를 의존할수록 교수와 학생 모두 진정한 학습 활동에서 멀어지는 아이러니가 발생하는 셈이다.
이러한 움직임은 비단 서울대만의 선택은 아니다. 해외 주요 대학들도 AI 탐지기의 낮은 신뢰도와 편향 가능성을 이유로 부정행위 판정 도구로서의 사용을 제한하거나 폐기하는 추세다. 예일대, 존스홉킨스대, 뉴욕대 등 미국의 주요 대학 10여 곳은 AI 탐지 서비스 '턴잇인(Turnitin)'의 사용을 제한하고 있으며, 일본 와세다대 역시 2023년 12월 턴잇인 기능 제공을 종료하고 이후에도 재도입 계획이 없다고 공식적으로 밝혔다. 전 세계적으로 AI 탐지 기술에 대한 신뢰가 낮아지고, 이를 평가에 활용하는 것에 대한 회의적인 시각이 확산되고 있는 것이다.
전문가들은 생성형 AI가 더 이상 부정행위의 도구가 아니라 일상적인 학습 도구로 자리 잡은 상황에서, 대학의 평가 방식 자체가 근본적으로 바뀌어야 한다고 입을 모은다. 기존의 리포트와 과제 중심 평가 체계를 유지한 채 탐지기만 덧붙이는 방식은 학생의 사고력과 문제해결 능력을 평가하기보다 'AI를 사용했는지 여부'에만 초점을 맞추게 만들기 때문이다. AI 활용 여부를 감시하는 소모적인 전쟁을 벌이는 대신, AI를 학습 과정에 자연스럽게 통합하고 학생의 이해도와 비판적 사고력을 제대로 평가할 수 있는 새로운 평가 모델의 설계가 시급한 과제로 떠오른다.
서울대의 AI 탐지기 사용 중단은 에듀테크 업계에도 중요한 시사점을 던진다. 단순히 AI가 작성한 글을 찾아내는 기술의 정확도를 높이는 방향으로 발전해온 탐지 서비스 시장의 성장 전망에 제동이 걸릴 수 있다. 정확도가 아무리 높아져도 '감시와 적발'이라는 프레임 자체가 교육 현장의 신뢰를 얻기 어렵다는 사실을 이번 사례가 보여줬기 때문이다. 업계는 부정행위 적발 도구로서의 포지셔닝을 넘어, AI 시대에 학생의 학습 과정을 진단하고 교수자의 교육 방법을 개선하는 데 기여할 수 있는 방향으로 서비스의 패러다임 전환을 모색해야 할 시점이다. 궁극적으로 AI 탐지기의 존재 이유는 학생을 잡아내는 데 있는 것이 아니라, AI 시대에 걸맞은 교육의 본질을 지키는 데 있어야 한다는 교훈을 이번 서울대의 결정은 다시 한번 상기시킨다.