리눅스 시험, AI가 채점하면 얼마나 정확할까?
컴퓨터 전공 수업에서 리눅스 명령어 시험을 본 적 있나요? 학생이 쓴 답이 다양해서 선생님이 일일이 채점하기 힘들 때가 많아요. 최근 연구에서는 인공지능(AI)이 이런 시험을 사람만큼 잘 채점할 수 있는지 확인했어요.
컴퓨터를 배우는 학생이 많아지면서 시험 답안을 채점하는 일이 점점 어려워지고 있어요. 특히 리눅스나 유닉스 명령어를 입력하는 실습 시험은 학생마다 답이 조금씩 달라서 기계가 자동으로 채점하기가 까다롭습니다. 기존 자동 채점 프로그램은 정답만 맞추면 점수를 주지만, 부분 점수나 비슷한 다른 방법으로 푼 경우는 처리하지 못했어요. 그래서 연구진은 최신 AI 언어 모델(사람처럼 글을 읽고 쓰는 인공지능)을 이용해 이 문제를 해결할 수 있는지 실험했습니다.
연구팀은 GPT, 클로드 오퍼스(Claude Opus), 제미나이(Gemini), GLM 등 네 가지 유명 AI 모델을 사용했어요. 이 모델들에게 학생이 실제 시험에서 쓴 리눅스 명령어 답안 1200개를 채점하도록 시켰습니다. 비교를 위해 세 명의 전문 교수도 같은 답안을 직접 채점했어요. AI가 얼마나 비슷하게 채점하는지 알아보기 위해, 간단한 질문만 넣는 방법과 채점 기준(루브릭)을 함께 알려주는 방법 두 가지를 시도했습니다.
AI가 사람과 비슷하게 채점하다
실험 결과, 구글의 제미나이 3.0 프로(Gemini 3.0 Pro) 모델이 채점 기준을 함께 받았을 때 사람 교수와 가장 비슷한 점수를 냈어요. 통계적으로 보면 두 평가가 거의 일치한다고 할 수 있는 수준이었습니다. 특히 간단한 파일 조작이나 정보 찾기 같은 쉬운 문제에서 성적이 좋았지만, 고급 시스템 관리처럼 복잡한 문제는 여전히 사람보다 정확도가 떨어졌습니다. 이 연구가 의미하는 바는 AI가 완벽하지는 않지만, 교수님들의 채점 부담을 덜어주는 도구로 쓸 수 있다는 점입니다.
이 기술이 실제 교육 현장에 도입된다면 어떤 변화가 생길까요? 우선 교수님들은 반복적인 채점 시간을 줄이고 학생 지도에 더 집중할 수 있습니다. 학생 입장에서는 빨리 점수를 받고 부족한 부분을 바로바로 보완할 수 있어요. 물론 아직 모든 문제를 완벽하게 채점하지는 못하지만, 앞으로 더 나은 AI 모델이 나오면 더욱 정확해질 것입니다. 리눅스뿐 아니라 다른 프로그래밍 언어 시험에도 응용할 수 있을 거예요.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.