교육 설명의 위험을 AI로 감사한다

선생님이 수업에서 하는 설명이 진짜 맞는 말인지, 학생들이 이해하기 어렵지는 않은지, 혹시 편향된 생각이 섞여 있지는 않은지—이런 걱정을 AI가 대신 체크해주는 도구가 나왔습니다. 'AIriskEval-edu'라는 플랫폼인데, 다섯 가지 기준으로 설명을 평가하고 문제가 있는 부분을 콕 집어 알려줍니다.

이 플랫폼은 수업 시간에 쓰는 설명을 다섯 가지 측면에서 검사합니다. 첫째, 설명이 사실과 맞는지(정확성), 둘째, 설명이 충분히 깊고 자세한지(깊이와 완전성), 셋째, 주제에서 벗어나지 않고 핵심에 집중하는지(초점과 관련성), 넷째, 설명이 해당 학년 학생 수준에 맞는지(학생 수준 적합성), 다섯째, 특정 이념이나 편견이 들어가 있지 않은지(이념적 편향)입니다. 각 항목마다 '위험 있음' 또는 '위험 없음'을 판단하고, 그 판단이 얼마나 확실한지 점수로 알려줍니다. 위험이 발견되면, 왜 그런지 자연어로 설명해주고, 문제가 있는 문장이나 부분을 구체적으로 표시해줍니다.

두 종류의 AI가 함께 평가한다

이 플랫폼은 두 가지 인공지능 모델을 사용합니다. 하나는 오픈AI의 최신 모델인 GPT-5.5로, 인터넷을 통해 연결해 씁니다. 다른 하나는 메타의 라마 3.1 8B 모델로, 비교적 작아서 일반 가정용 그래픽카드(예: 게임용 컴퓨터에 들어가는 GPU)에서도 실행할 수 있습니다. 이 작은 모델은 'AIriskEval-edu'라는 데이터셋으로 미리 학습되었습니다. 이 데이터셋에는 초중등학교 수준의 수업 설명과, 그 설명의 각 위험 요소에 대한 평가 결과가 들어 있습니다.

플랫폼은 두 가지 모드로 작동합니다. 'AI 모드'에서는 두 모델을 모두 써서 평가하므로 더 정확한 결과를 얻을 수 있습니다. 다른 모드에서는 인터넷 연결 없이 로컬 모델만 사용하므로, 개인정보 보호에 유리하고 오프라인에서도 쓸 수 있습니다. 연구팀은 가상의 교사 프로필 여섯 개를 만들어, 각 교사가 만든 설명을 평가해봤습니다. 이 시연을 통해 플랫폼이 실제로 유용하게 작동한다는 것을 보여주었습니다.

이 플랫폼이 의미하는 것

이 플랫폼은 교사들이 자신의 수업 설명을 스스로 점검하고 개선하는 데 큰 도움이 될 수 있습니다. 특히 교육 자료를 만들 때, AI가 객관적으로 평가해주면 잘못된 정보나 부적절한 내용을 미리 발견할 수 있습니다. 또한 학생 수준에 딱 맞는 설명을 만드는 데도 활용할 수 있습니다. 앞으로 더 많은 학교에서 이와 같은 도구를 사용한다면, 수업의 질이 전반적으로 높아질 것으로 기대됩니다.

📖 원문 보기: arXiv 원문

본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.