AI가 과제를 채점한다고? 학생들은 믿을까
누가 학생 과제를 채점하고 피드백을 줘야 할까? 사람 선생님일까, 인공지능일까? 대학에서 AI가 글 평가에 투입되는 일이 많아지면서, 이 질문은 더 이상 먼 미래 이야기가 아니다.
왜 이런 연구가 필요했나
최근 연구들은 AI가 만들어 주는 글쓰기 피드백이 실제로 학생들의 글을 나아지게 하는 경우가 꽤 많다고 말한다. 그러나 잘 알려지지 않은 부분이 하나 있다. 학생들이 "내 점수를 매긴 존재가 AI다"라는 사실을 알면, 그 점수를 어떻게 받아들이는가 하는 점이다. 같은 점수라도 누가 채점했느냐에 따라 다르게 느낄 수 있다는 것이다.
사람은 자신을 평가한 주체가 누구인지에 따라 결과를 다르게 해석한다. 예를 들어 같은 칭찬이라도 친구에게 들을 때와 모르는 사람에게 들을 때 느낌이 다르다. 논문은 바로 이 점을 평가 영역에 옮겨왔다.
실험은 이렇게 진행됐다
사우디아라비아의 한 공립대학교에서 실험이 열렸다. 컴퓨터를 전공하는 남학생 13명이 참여했다. 학생들은 강의실에서 글쓰기 과제를 손으로 썼다. 수업 내용은 컴퓨터 계열 학생들이 배우는 '기술 문서 작성'이다. 연구진은 그 종이를 스캔해 챗GPT에 넘겼다. 챗GPT는 수업 목표에 맞춰 만든 '평가 기준표'대로 점수와 피드백을 만들었다.
여기서 핵심은 다음 단계다. 연구진은 학생들에게 "이번 점수는 사람이 아니라 인공지능이 매긴 것입니다"라고 투명하게 밝혔다. 그리고 학생들이 그 평가를 어떻게 이해하고 느끼는지 질문하고 반응을 분석했다. 숫자로 측정하는 대신, 직접 들은 말과 태도를 해석하는 방법을 쓴 것이다.
학생들이 꺼낸 이야기
학생들의 반응은 하나로 모이지 않았다. 어떤 학생은 AI 채점이 오히려 공정하다고 느꼈다. 사람 선생님은 컨디션이나 호불호가 점수에 스며들 수 있지만, 인공지능은 늘 같은 기준을 적용한다고 본 것이다. 하지만 그와 반대로 걱정도 컸다. AI가 글의 전후 맥락이나 숨은 의도를 다 읽어낼 수는 없다는 점이 불안하게 다가왔다.
학생들이 가장 민감하게 반응한 순간은 "누가 채점했는지 분명히 알게 된 때"였다. 이 연구는 채점 주체가 사람이냐 인공지능이냐의 문제가 아니라, 그 사실을 학생에게 투명하게 공개하는 방식이 평가의 신뢰를 좌우할 수 있음을 보여 준다.
우리 교육에는 어떤 의미일까
앞으로 학교와 직장 교육에서 AI를 이용한 평가는 점점 더 많아질 것이다. 이 연구는 채점 자체를 AI에게 맡기기 전에 "학생들이 그 결과를 어떻게 받아들일까"를 먼저 고민해야 한다고 말해 준다. 단순히 채점 결과만 통보하는 방식은 신뢰를 얻기 어렵다는 뜻이다.
물론 이번 연구에 참여한 학생은 열세 명에 불과하다. 그래서 결과를 모든 대학에 일반화하기에는 한계가 있다. 다만 AI가 평가하는 시대가 가까워진 지금, 학생들의 생생한 목소리를 담았다는 점에서 의미가 있다.
한 가지 분명한 점은 AI가 사람을 완전히 대체하는 평가는 아직 먼 이야기라는 것이다. AI가 만든 피드백을 사람이 다시 보고, 학생들이 의문을 제기할 수 있는 과정이 함께 필요하다. 이런 고민이 실제 교육 현장에서 쌓여야 하겠다.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.