문제를 잘 푸는 AI가 잘 가르치지는 않는다… '학생 성적 향상'으로 AI 튜터를 훈련한 연구
문제를 잘 푸는 능력과 잘 가르치는 능력은 다릅니다. 미국 스탠퍼드대·조지아공대·카네기멜런대 연구진이 학생이 실제로 얼마나 나아졌는지를 기준으로 AI 교사를 훈련하는 방법 「셰르파(Sherpa)」를 내놓았습니다.
원제: Sherpa: Teaching LLMs to Teach Adaptively · 저자: Weixian Xu, Yanzhe Zhang, Zora Zhiruo Wang, Changyu Chen, Diyi Yang · arXiv 2610.08778 · 제출 2026년 10월 7일
문제를 잘 푸는 능력과 잘 가르치는 능력은 다릅니다. 미국 스탠퍼드대·조지아공대·카네기멜런대 연구진이 학생이 실제로 얼마나 나아졌는지를 기준으로 AI 교사를 훈련하는 방법 「셰르파(Sherpa)」를 내놓았습니다. 시뮬레이션 학생의 정답률은 48.6%에서 69.0%로 올랐고, 미국 고등학교 교사 96명은 훈련된 모델의 답변을 79.6% 비율로 더 낫다고 골랐습니다. 다만 학생은 사람이 아니라 작은 AI 모델이었습니다.
'좋은 수업'을 미리 정하지 않고, 학생의 결과로 배운다
지금까지 AI 튜터 훈련은 대체로 "좋은 가르침이란 이런 것"이라는 기준을 먼저 정해 두었습니다. 시범 대화를 따라 하게 하거나, 사람이 고른 선호 답변을 학습시키거나, '답을 흘리지 말 것' 같은 채점표로 보상을 주는 식입니다. 연구진은 이 기준들이 정작 개별 학생의 학습 결과와는 직접 연결되어 있지 않다고 지적합니다. 학생마다 도움이 되는 설명 방식이 다르기 때문입니다.
셰르파는 한 번의 수업을 '준비 → 지도 → 시험' 세 단계로 나눕니다. AI 교사(Qwen3-8B)가 먼저 문제를 혼자 풀어 두고, 학생 역할의 작은 모델(Qwen3-1.7B)과 최대 10턴 대화한 뒤, 학생이 대화 내용을 바탕으로 혼자 다시 풀게 합니다. 대화 전후 정답률의 차이가 곧 교사의 보상입니다. 문제는 수학 문제집 MATH에서 골랐고, 교사는 풀 수 있지만 학생은 혼자 못 푸는 문제만 남겨 훈련용 759개, 평가용 528개를 썼습니다.
학생마다 다른 '관문'
핵심 장치는 '관문(gate)'입니다. 첫째 관문은 교사가 최종 답을 그대로 알려 주는 메시지를 막습니다. 중간 계산이나 풀이 일부는 허용됩니다. 둘째 관문은 학생의 학습 선호를 반영합니다. 연구진은 교육학 문헌에서 여섯 가지 선호를 골랐습니다. 내 풀이의 틀린 곳 짚어 주기, 왜 그 단계가 성립하는지 설명하기, 지금의 하위 목표 알려 주기, 한 단계만 시범 보이기, 다른 방법으로 검산하기, 두 가지 선택지를 비교하기입니다. 선호에 맞지 않는 설명은 학생에게 닿지 않고 "단계별 계획을 알려 주세요" 같은 불만만 돌아옵니다. 교사는 학생의 유형을 모른 채 대화 반응을 보고 맞춰 가야 합니다.
연구진이 관문을 따로 만든 이유도 밝혔습니다. 학생 모델에 선호를 프롬프트로만 적어 주면, 맞지 않는 설명을 받고도 그냥 문제를 계속 풀어 버려 유형 간 차이가 거의 드러나지 않았다는 것입니다.
결과: 시뮬레이션 학생, 외부 벤치마크, 교사 평가
훈련에는 네 유형(선호 없음·풀이 진단·하위 목표·비교)만 쓰고, 나머지 세 유형(이유 설명·한 단계 시범·검산)은 처음 보는 유형으로 남겨 두었습니다. 학생 혼자의 정답률은 36%였습니다. 훈련 전 교사와 대화한 뒤에는 48.6%, 셰르파로 훈련한 교사와 대화한 뒤에는 69.0%였습니다(논문은 평균 향상 폭을 20.5%포인트로 적었습니다). 처음 보는 세 유형에서도 47.9%에서 65.1%로 올랐습니다. 비교 대상인 기존 방법(PedagogicalRL)은 52.7%였습니다.
훈련 환경 밖의 평가에서도 개선이 보였습니다. 수학 튜터링 벤치마크 MathTutorBench의 '교사 응답' 네 항목 평균은 52.5%에서 79.2%로 올랐습니다. 이 점수는 사람 교사의 모범 응답보다 낫다고 판정된 비율이며, 판정은 벤치마크의 채점 모델이 합니다.
사람 평가도 있었습니다. 칸아카데미가 공개한 실제 튜터링 대화 80개에 학생 요청을 덧붙여 320개 상황을 만들고, 온라인 플랫폼으로 모집한 미국 고등학교 교사 96명이 두 답변 중 어느 쪽이 더 잘 가르치는지 골랐습니다. 총 960건 판단 가운데 훈련된 모델 728건, 기존 모델 187건, 비슷함 45건으로, 무승부를 빼면 79.6%였습니다. 교사 96명 중 87명이 훈련된 모델을 더 자주 골랐습니다. 다만 일부 교사는 새 모델의 설명이 "부담스러울 수 있다"며 기존 답변을 택했습니다.
눈여겨볼 점
이 연구는 '잘 가르쳤는가'를 '학생이 나중에 혼자 풀 수 있게 되었는가'로 측정했습니다. 최종 답을 막는 관문도 그 기준에 맞춘 장치입니다. 생성형 AI가 과제는 대신 해 주지만 학습은 줄일 수 있다는 기존 연구 우려에 대한 기술적 대응 가운데 하나로 볼 수 있습니다.
부작용도 보고되었습니다. 훈련 뒤 학생 풀이에서 '어디가 처음 틀렸는지' 찾는 점수는 37.1%에서 30.3%로 떨어졌습니다. 잘 이끌어 주는 능력이 늘면서 오류를 짚는 능력 일부는 약해졌을 수 있다는 해석이 가능합니다.
이 연구의 한계
훈련과 주요 평가의 학생은 모두 AI 모델이었고, 실제 학생의 학습 효과는 측정하지 않았습니다. 교사 평가도 짧은 답변 한 번을 비교한 것이어서, 수업 전체의 효과나 장기 학습을 보여 주지는 않습니다. 여섯 가지 '학습 선호'는 연구진이 정한 단순한 유형이며, 실제 학생은 여러 선호가 섞이거나 자기 선호를 모를 수 있다고 연구진도 밝혔습니다. 과목은 정답이 분명한 수학에 한정됐고, 답이 맞는지와 관문 통과 여부도 AI가 판정했습니다. 벤치마크 점수 역시 채점 모델의 판단입니다. 아직 동료 심사를 거치지 않은 사전 공개 논문입니다.
원문·참고 자료
- Weixian Xu, Yanzhe Zhang, Zora Zhiruo Wang, Changyu Chen, Diyi Yang, 「Sherpa: Teaching LLMs to Teach Adaptively」, arXiv:2610.08778 (2026). — https://arxiv.org/abs/2610.08778
- 코드·모델: https://github.com/SALT-NLP/Sherpa
이 기사는 AI 도구로 논문을 요약·번역해 초안을 작성했으며, 본문의 수치는 논문 원문(본문·표·부록)과 대조해 확인했습니다. 「인공지능 발전과 신뢰 기반 조성 등에 관한 기본법」(AI 기본법)에 따라 AI 생성물임을 알립니다. 사실관계는 원문을 기준으로 하며, 원문의 내용과 다른 부분이 있으면 원문이 우선합니다.