AI 평가 시험을 직접 만드는 수업?
요즘 학교에서 AI 활용법을 배우는 건 흔한 일이지만, 정작 AI가 내놓은 답이 믿을 만한지 판단하는 방법은 가르치지 않습니다. 이 연구는 학생들이 직접 문제를 만들어 AI의 한계를 시험해보는 새로운 수업 방식을 제안합니다.
AI 교육의 빈틈을 메우다
많은 수업이 AI를 생산성 도구로 가르칩니다. "이렇게 질문하면 좋은 답을 얻을 수 있다"거나 "코드를 더 빨리 짜는 법" 같은 식이죠. 하지만 연구진은 여기서 더 나아가야 한다고 말합니다. 학생들이 AI가 만들어낸 지식이 정말 맞는지 스스로 확인하는 능력을 길러야 한다는 겁니다. 마치 선생님이 답을 알려주는 대신, 학생들이 스스로 시험지를 만들어보게 하는 것과 비슷합니다.
직접 문제를 만들고, 서로 평가하고
연구진은 대학 수업에서 학생들에게 과제를 냈습니다. 각자 전공 분야(역사, 사회학 등)에서 깊이 있는 질문을 만들어보라고 했죠. 예를 들어 "조선 시대 과거 험은 오늘날 수능과 어떻게 다른가?"처럼 전문가 수준의 질문입니다. 학생들은 동료의 질문이 모호하거나 지름길을 찾기 쉬운지 검토하고, 실제 AI 시스템에 같은 질문을 던져 답변의 신뢰성을 평가했습니다. 이 과정을 통해 학생들은 AI를 단순히 쓰는 게 아니라, AI의 한계를 직접 체험하게 됩니다.
256개의 질문이 모인 '퀘스트벤치'
이렇게 만들어진 시험 세트가 바로 QuestBench입니다. 모두 14개 인문사회 분야에서 256개의 질문으로 구성됐죠. 연구진이 이 질문으로 여러 AI 모델을 테스트한 결과, 학생들이 만든 문제가 생각보다 까다롭다는 사실을 발견했습니다. 특히 정답이 명확하지 않은 주제(예: "민주주의의 정의는 무엇인가?")에서 AI가 쉽게 헤맨다는 점이 드러났죠. 이는 AI 교육이 단순히 사용법을 넘어, 비판적 사고를 키우는 방향으로 바뀌어야 한다는 걸 보여줍니다.
일상 속 의미는?
이 연구가 우리 생활에 주는 교훈은 간단합니다. AI를 쓸 때는 "이 답이 진짜 맞는 걸까?"라고 의심하는 습관이 필요하다는 겁니다. 학교에서든 회사에서든, 직접 검증해보는 방법을 배우는 게 중요합니다. 연구진이 제안한 수업 방식은 좋은 사례입니다. 앞으로 더 많은 교육 현장에서 이런 접근법이 활용된다면, AI를 더 똑똑하게, 더 책임감 있게 다루는 데 도움이 될 거예요.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.