AI를 제대로 아는지, 고등학생 시험으로 검증한다
AI가 똑똑해질수록, 우리가 AI를 얼마나 잘 이해하는지도 중요해지고 있어요. 그런데 학생들이 AI를 진짜 이해하는지 객관적으로 확인할 방법은 없었어요. 이 연구는 그 문제를 풀기 위해 만들어진 새로운 시험을 소개해요.
왜 이런 시험이 필요했을까
요즘 학교에서는 AI를 배우는 게 기본이 됐어요. 생성형 AI는 텍스트, 그림, 음악 같은 콘텐츠를 스스로 만들어내는 인공지능을 말해요. 챗GPT 같은 대화형 AI가 대표적이죠. 이런 AI가 일상에 깊이 들어오면서, 학교에서도 AI를 이해하고 올바르게 활용하는 능력이 중요해졌어요. 이런 능력을 AI 리터러시라고 불러요.
그런데 학생들이 AI를 얼마나 아는지 확인할 방법이 마땅치 않았어요. 선생님이 문제를 내자니 기준이 없고, 학생들에게 '얼마나 아는지' 물어보면 실제 실력과 다른 경우가 많아요. 이 연구팀은 고등학생용 AI 이해력 시험을 새로 만들었어요. 시험 이름은 GenAIT이에요.
어떤 시험인가
시험은 18개의 객관식 문제로 구성돼 있어요. 문제는 세 가지 영역을 다뤄요. 첫째, AI가 어떻게 작동하는지에 대한 지식이에요. 둘째, 실제로 AI를 활용하는 실용적인 능력이에요. 셋째, AI가 사회와 사람에게 미치는 영향에 대한 이해이죠. 예를 들어 'AI가 어떻게 답을 만들어내는지', 'AI의 답을 무조건 믿는 게 왜 위험한지' 같은 내용이 문제로 나와요.
시험의 신뢰도를 어떻게 확인했나
연구팀은 에스토니아 고등학생 7,432명에게 이 시험을 쳐 보게 했어요. 먼저 전문가들이 문제가 적절한지 꼼꼼히 검토했어요. 그 다음에는 통계 기법으로 시험이 믿을 만한지 확인했어요. 통계 기법이 어렵게 느껴질 수 있는데, 간단히 말하면 '이 시험이 학생들의 실제 능력을 얼마나 정확하게 재는지' 확인하는 과정이에요.
결과는 꽤 좋았어요. 시험 점수의 일관성을 보여주는 신뢰도가 0.72, 문제들이 같은 능력을 재는지 보여주는 값이 0.69로 나왔어요. 보통 0.7 이상이면 '집단을 비교할 때 쓸 만한 수준'으로 봐요. 또 통계 모델이 실제 데이터와 얼마나 잘 맞는지 보여주는 지표도 아주 좋게 나왔어요. RMSEA는 0.013, TLI는 0.987이었어요. RMSEA는 0.05 이하면 좋다고 보는데, 0.013이면 거의 완벽한 수준이에요. TLI는 1에 가까울수록 좋은데, 0.987이면 아주 높은 편이에요.
이 연구가 의미하는 것
이 연구가 의미하는 바는, 이제 고등학생들의 AI 이해력을 객관적으로 잴 수 있는 도구가 생겼다는 거예요. 기존에는 설문지로 학생들이 스스로 '잘 알고 있다'고 대답하는 방식이 흔했어요. 하지만 정답이 있는 시험은 주관적인 평가보다 훨씬 정확해요. 학교에서 AI 교육을 한 뒤, 그 교육이 실제로 효과가 있었는지 점수로 확인할 수 있게 된 거예요. 어떤 부분이 부족한지도 알 수 있구요.
물론 한계도 있어요. 시험이 에스토니아어로 만들어졌기 때문에 다른 나라에서 쓰려면 번역과 추가 검증이 필요해요. 또 18개 문제가 모든 AI 지식을 다 담을 수는 없겠죠. 그래도 이번 연구는 AI 리터러시 교육 연구에 튼튼한 발판을 마련했다고 볼 수 있어요. 앞으로 다른 언어와 문화에서도 검증된다면, 전 세계 학교에서 널리 쓰일 수 있을 거예요.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.