AI, 수천 장 서술형 답안 채점도 잘할까?
전국 시험에서 학생들이 쓴 글 답안이 수천 장이라면? 사람이 전부 읽기엔 벅찹니다. 그렇다고 AI만 맡기자니 불안합니다. 사람과 AI가 함께 채점하면 어떨까요? 이 논문은 실제 시험 자료로 그 방법을 확인한 이야기입니다.
글쓰기 답안 채점은 왜 어려울까
객관식 문제는 정답 번호만 채점하면 됩니다. 하지만 글쓰기 답안은 그럴 수 없어요. 답이 하나가 아니니까요. 내용이 주제에서 벗어나지 않았는지, 문장이 매끄러운지, 맞춤법이 맞는지 따져야 합니다. 응시자가 많아질수록 채점에 드는 시간과 비용도 커집니다. 이 문제를 풀기 위해 AI 채점이 등장했습니다.
AI가 먼저, 사람은 마지막 확인
AI는 많은 답안을 빠르게 읽을 수 있습니다. 하지만 결과가 사람과 완전히 같을 것이라고 기대하기는 어렵습니다. 그래서 연구진은 사람이 최종 확인을 맡는 구조를 설계했습니다. AI가 모든 답안을 먼저 채점합니다. 그중 AI가 확신하지 못하는 답안을 사람이 다시 봅니다. 모든 답안을 사람이 읽을 필요가 없으니 업무가 줄어듭니다.
이번 연구에는 최근 두 해 전국 시험에서 얻은 자료가 쓰였습니다. 해마다 학생 답안이 약 5,000개였어요. 답안은 150~200단어짜리 짧은 글이고, 채점 항목도 여러 개로 나누어져 있었습니다. 주제 일치, 문장 구성, 어휘 사용 같은 항목에서 사람의 점수와 AI 점수를 비교했습니다.
AI 점수는 얼마나 믿을 만했나
결과는 대체로 좋았습니다. 대부분의 항목에서 AI 점수와 사람 점수가 꽤 가깝게 나왔습니다. 완벽하게 같지는 않았지만, 실제로 쓰기에 충분한 수준이었습니다. 논문은 이 정도를 '중간 이상의 일치'라고 표현합니다.
흥미로운 점은 합격과 불합격이 갈리는 최종 판정입니다. AI 혼자 결정할 때보다 사람이 마지막에 확인했을 때 결과가 더 안정적이었습니다. 완전 자동 채점이 아니라, 사람이 필요한 순간에만 집중하도록 만든 방식입니다.
교실에서는 어떻게 달라질까
이런 방식이 실제로 쓰이면 채점 부담이 줄어들 겁니다. 모든 답안을 일일이 읽는 대신, AI가 어렵다고 판단한 답안만 골라서 검토하면 되니까요. 채점 기간이 짧아지고, 사람은 더 가치 있는 판단에 힘을 쏟을 수 있습니다.
물론 남은 과제도 있습니다. AI는 학생들의 참신한 표현이나 글에 담긴 속뜻을 놓치기 쉽습니다. 그래서 채점 기준을 보완하고 결과를 검토하는 사람의 역할은 앞으로도 중요합니다. 이번 연구는 이런 질문에 답했습니다. AI가 사람을 대체할까요? 아닙니다. 사람과 AI가 함께 일해야 더 좋은 결과를 낼 수 있습니다. 그걸 실제 시험 자료로 보여주었습니다.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.