챗GPT, 대학 코딩 시험에서 학생 평균 점수 넘어섰다

챗GPT가 대학 코딩 시험에서 좋은 성적을 받았다는 소식, 들어보셨나요? 실제 시험을 봤더니 학생 평균을 훌쩍 넘었습니다.

프로그래밍을 처음 배우는 사람에게 '객체 지향 프로그래밍'은 큰 벽처럼 느껴집니다. 프로그램을 설계하는 하나의 방식인데, '객체'라는 개념을 이해해야 합니다. 이런 입문 수업에서 AI가 실제로 어떤 성적을 받는지 확인한 연구가 나왔습니다. 특히 요즘 학생들은 AI를 공부에 자주 활용합니다. 그래서 AI의 실력이 어느 정도인지 정확히 아는 것이 중요해졌습니다. 이 연구는 AI와 교육의 미래를 고민하는 사람들에게 유용한 자료입니다.

왜 이런 연구가 필요했나

최근 생성형 AI는 코드를 작성하고 설명하는 능력이 크게 좋아졌습니다. 생성형 AI란 사용자가 요청하면 새로운 글, 이미지, 코드 등을 만들어 내는 AI입니다. 이런 AI들은 '대규모 언어 모델'을 기반으로 합니다. 쉽게 말해, 방대한 양의 글과 코드를 읽고 패턴을 익힌 거대한 AI입니다. 지난해만 해도 일부 AI는 학생 평균보다 낮은 점수를 받았습니다. 그런데 올해는 상황이 달라졌습니다. 학교 시험에서 AI가 어느 수준까지 왔는지 확인할 필요가 생긴 것입니다.

시험에 참여한 다섯 가지 AI

연구진은 객체 지향 프로그래밍 입문 수업에서 사용하는 시험 문제를 다섯 가지 AI에 풀게 했습니다. 챗GPT, 딥시크, 제미니, 클로드, 코파일럿이 주인공입니다. 모델마다 특성이 다르기 때문에, 하나의 AI만 시험하는 것보다 훨씬 정확한 결과를 얻을 수 있습니다. 채점은 학생과 똑같은 기준으로 진행했습니다. 그리고 같은 과목의 지난 학생 성적과 비교했습니다. 지난해 연구 결과와도 대조했습니다. 특히 실제 수업에서 쓰는 시험지를 그대로 사용했다는 점이 의미 있습니다.

AI의 시험 성적, 어땠나

결과는 놀라웠습니다. 모든 AI가 학생 평균 점수보다 높은 성적을 받았습니다. 코드가 길고 복잡한 문제에서는 만점을 받는 경우도 많았습니다. 다만 가끔 실행이 되지 않는 코드를 제출했습니다. 이것은 학생들에게도 흔히 나타나는 실수입니다. 연구진은 AI 모델별로 반복되는 오류 유형도 분석했습니다. 예를 들어 특정 문법에서 비슷한 실수를 반복하는 모델이 있었습니다. 흥미로운 점은 학생들이 자주 틀리는 문제에서 AI도 비슷한 어려움을 겪었다는 사실입니다. 이러한 실수가 왜 발생하는지 연구진은 깊게 살펴보았습니다.

이 연구가 교육에 주는 시사점

이 연구가 의미하는 바는 간단합니다. AI는 이제 입문자 수준의 프로그래밍 시험을 통과할 만큼 성장했습니다. 학교는 시험 방식을 다시 생각해야 합니다. 학생이 스스로 문제를 풀었는지 AI가 도와줬는지 구분하기 어려워졌기 때문입니다. 앞으로는 AI 활용을 막기보다는, AI와 함께 문제를 해결하는 새로운 평가 방식이 필요할지도 모릅니다. 예를 들어 시험 중 AI 사용을 허용하는 대신 더 창의적인 문제를 내는 방법이 있습니다. 물론 이번 연구가 다룬 것은 입문 수준의 시험입니다. 더 어려운 문제에서는 AI가 어떻게 행동할지 아직 알 수 없습니다. 이 연구는 교육 현장과 AI 개발자 모두에게 중요한 질문을 던집니다.

📖 원문 보기: arXiv 원문

본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.