맞춤형 학습의 함정 ① — 맞춤은 효과가 있나

‘98번째 백분위’라는 약속은 1984년의 한 논문에서 시작됐습니다. 지능형 튜터와 학교 현장 실험을 따라가 보면 맞춤은 효과가 있었지만 약속만큼 크지는 않았고, 효과가 난 곳에는 교사가 있었습니다.

맞춤형 학습의 함정 ① — 맞춤은 효과가 있나
AI 생성 이미지

기획시리즈 「맞춤형 학습의 함정 — 연습은 맞추고, 교실은 남겨라」 1/3 · AI(GrokBot)가 작성한 기획 기사 · 편집자 검토 후 발행

AI가 학생마다 문제를 맞춰 주면 성적이 오를까요. 연구를 따라가 보면 맞춤은 분명 효과가 있었습니다. 그리고 효과가 난 곳에는 대개 교사가 곁에 있었습니다.

2019년 1월, 미국 캔자스주 맥퍼슨의 중학생 콜린 윈터가 수업 도중 교실 밖으로 걸어 나갔습니다. 근처 웰링턴에서는 고등학생들이 연좌 시위를 벌였습니다. 학교들이 학생마다 컴퓨터로 진도를 맞춰 주는 서밋 러닝(Summit Learning)을 들인 지 8개월 만이었습니다(뉴욕타임스 2019).

이 플랫폼에는 마크 저커버그 부부가 거액을 지원했습니다. 저커버그는 이런 맞춤 학습이 평균 학생을 ‘98번째 백분위’, 곧 100명 중 2등 언저리까지 끌어올릴 수 있다고 말했습니다(초크비트 2023).

4년 뒤, 비슷한 약속이 한국 교실에도 왔습니다. 2023년 교육부는 AI 디지털교과서로 ‘평균의 함정’에서 벗어나 학생마다 맞춘 교육을 하겠다고 밝혔습니다(교육부 브리핑 2023). 맞춤은 정말 효과가 있을까요.

요약 영상 (AI 제작)

‘98’이라는 숫자는 어디서 왔나요?

출발점은 1984년 교육심리학자 벤저민 블룸(Benjamin Bloom)의 논문입니다. 일대일 튜터에게 배운 학생의 평균 성적이 보통 수업을 들은 학생의 98%보다 높았다는 내용입니다(블룸 1984). 저커버그가 말한 ‘98’과 같은 숫자입니다.

논문 제목은 ‘일대일 튜터링만큼 효과적인 집단 수업 방법 찾기’였습니다. 블룸이 찾으려던 것은 교실을 없애는 길이 아니라, 여럿이 함께 배우는 교실에서 튜터만큼 가르치는 길이었습니다. 그가 기대를 건 후보도 교사가 수시로 이해도를 확인하고 모자란 부분을 다시 가르치는 집단 수업이었습니다.

그런데 이 결과는 소규모 박사논문 두 편에서 나왔습니다. 튜터링에 수시 평가와 보충 지도를 함께 붙인 효과이기도 했습니다. 이런 집단 수업 방식을 실제 학교에 옮긴 연구를 다시 따져 본 분석에서는, 외부 표준화 시험으로 재면 효과가 거의 사라졌습니다(완전학습 재검토 1987).

사람 튜터의 효과도 그만큼 크지 않았습니다. 미국 연구자 커트 밴런이 튜터링을 비교한 연구들을 모아 보니, 사람 튜터에게 배운 효과는 100명 중 50등이 22등쯤으로 올라서는 정도였습니다(밴런 2011). 작지 않은 효과지만 블룸의 숫자와는 거리가 멉니다. 약속의 숫자는 처음부터 너무 컸던 셈입니다.

30여 년 뒤 이 숫자가 실리콘밸리에서 다시 불려 나왔을 때, 숫자에 붙어 있던 조건은 함께 오지 않았습니다. 사람 튜터와 수시 평가, 보충 지도라는 조건은 빠지고 ‘맞춤’이라는 말만 남았습니다.

AI 맞춤 학습, 정말 효과가 있나요?

먼저 읽는 법부터 정하겠습니다. 이 글은 연구의 효과를 ‘등수’로 옮깁니다. 100명 가운데 딱 중간인 50등 학생이 새 방법으로 배우면 몇 등쯤 될지 어림한 값입니다. 교육 현장 실험에서는 몇 등만 올라가도 작지 않은 효과로 봅니다(효과 크기 해석 기준 2020).

효과는 있습니다. 다만 무엇과 비교하느냐에 따라 크기가 달라집니다. 학생 수준에 맞춰 문제와 힌트를 주는 프로그램을 ‘지능형 튜터’라고 부릅니다. 마 연구팀은 지능형 튜터를 다른 수업과 견준 비교 결과 107개를 모았습니다(마 외 2014).

예를 들어 분수 덧셈에서 학생이 분모끼리 그냥 더하면, 프로그램은 정답을 바로 보여 주지 않고 분모부터 같게 만들어 보라는 힌트를 줍니다. 다음 문제는 그 실수를 다시 연습하도록 고릅니다. 학생마다 다른 실수에 맞춰 연습이 달라지는 셈입니다.

한 교사가 반 전체를 가르친 수업과 비교하면 효과가 뚜렷했습니다. 100명 중 50등이던 학생이 34등쯤으로 올라서는 정도입니다. 그러나 비교 상대를 소모둠 수업으로 바꾸면 차이가 사실상 사라졌습니다. 기계가 이긴 상대는 사람이라기보다, 모두가 칠판 하나만 바라보는 교실이었습니다.

이 결과는 맞춤의 힘이 기계 자체보다 한 사람 한 사람에게 쏟는 주의에서 나올 수 있음을 짐작하게 합니다. 교사가 몇 명씩 모아 가르칠 수 있을 때는 기계와 비슷한 효과가 났습니다.

종이 교과서와 문제집으로 공부한 경우와 견줘도 지능형 튜터 쪽이 나았습니다. 50등이 36등쯤 되는 차이입니다. 수업 시간에 주 교재로 쓰든, 보충 학습이나 숙제 도우미로 쓰든 효과는 좋은 쪽으로 나왔습니다.

정교한 지능형 튜터는 사람 튜터에 꽤 가까이 다가갔습니다. 앞의 밴런 분석에서 답만 채점하는 프로그램보다 풀이 단계마다 힌트를 주는 프로그램의 효과가 컸고, 그 크기는 사람 튜터와 거의 비슷했습니다. 맞춤이 효과를 내는 곳은 학생이 막히는 바로 그 단계였던 셈입니다.

학교 현장에서도 통했나요?

현장 실험도 있습니다. 미국 메인주에서는 한국의 중학교 1학년에 해당하는 7학년 학생들을 학교 단위로 무작위로 나눴습니다. 한쪽은 한 학년 내내 풀자마자 맞고 틀림과 힌트를 알려 주는 온라인 숙제 어시스트먼츠(ASSISTments)를 썼습니다(로셸 외 2016). 학생들이 받은 것은 새 교과서가 아니라 매일 하던 숙제의 새 형식이었습니다.

이 학생들은 외부 표준화 시험에서 앞섰습니다. 50등이 43등쯤 되는 크기로, 앞의 기준으로 보면 작지 않은 효과입니다.

눈여겨볼 점은 구조입니다. 숙제는 교사가 골랐습니다. 교사는 반 전체가 어떤 문제를 많이 틀렸는지 보고서로 확인하고, 그 문제를 다음 수업에서 다뤘습니다. 교사들은 프로그램을 수업에 쓰는 연수도 함께 받았습니다. 맞춤이 교사 손을 떠나지 않았던 것입니다.

효과는 성적이 낮던 학생에게서 더 컸습니다. 이 학생들만 보면 50등이 39등쯤으로 올라서는 크기입니다. 잘 설계한 맞춤이 뒤처진 학생을 끌어올리는 데 쓰일 수 있다는 신호입니다.

인도 델리의 실험도 비슷합니다. 무랄리다란 연구팀은 학년 진도보다 크게 뒤처진 중학생에게, 수준에 맞춘 방과후 학습 프로그램 이용권을 추첨으로 나눠 줬습니다(무랄리다란 외 2019). 추첨으로 나눴기 때문에 두 집단의 차이는 프로그램 덕분으로 볼 수 있습니다. 몇 달 만에 당첨 학생의 수학 성적은 50등이 36등쯤 되는 만큼 올랐습니다.

수학만 오른 것이 아닙니다. 힌디어 성적도 50등이 41등쯤 되는 만큼 올랐고, 센터에 꾸준히 나온 학생일수록 효과가 더 컸습니다.

이 학생들은 중학생이지만 실제 수학 실력은 초등학교 수준에 머문 경우가 많았습니다. 프로그램은 학년 진도가 아니라 학생의 실제 수준에서 문제를 시작했습니다. 교실 수업이 놓친 빈틈을 연습으로 메운 것입니다.

이 프로그램도 보조 교사가 함께하는 소집단 센터에서 운영됐습니다. 효과가 난 두 실험 모두, 맞춤 곁에 사람이 있었습니다.

더 넓은 증거도 같은 쪽을 가리킵니다. 저소득·중간소득 국가에서 무작위 실험 16건을 모은 분석에서도 기술로 맞춘 학습의 효과가 확인됐습니다(저·중소득국 맞춤 학습 분석 2021).

전체 평균은 50등이 43등쯤 되는 크기였고, 학생 수준에 맞춰 난이도를 계속 조정한 프로그램은 그보다 효과가 훨씬 컸습니다. 맞춤의 핵심이 학생의 지금 수준에 맞는 난이도에 있다는 신호로 읽힙니다.

효과가 난 맞춤은 무엇이 달랐나요?

세 가지가 겹칩니다. 첫째, 맞춘 것은 수업 전체가 아니라 연습과 피드백이었습니다. 학생은 자기 수준의 문제를 풀고, 틀리면 그 자리에서 힌트를 받았습니다. 배움의 큰 흐름은 여전히 교실 수업이 맡았습니다.

둘째, 맞춤을 쥔 사람은 교사였습니다. 무엇을 연습할지 교사가 정했고, 프로그램이 모은 결과는 다시 교실 수업으로 돌아왔습니다. 소모둠 수업과 견주면 기계의 이점이 사라졌다는 결과도 같은 방향을 가리킵니다.

셋째, 무엇에 맞추는지가 분명했습니다. 효과가 확인된 맞춤은 학생이 이미 아는 것과 아직 모르는 것, 곧 지금의 실력에 맞췄습니다. 학생이 좋아하는 공부 방식이나 스스로 고른 경로에 맞추는 것과는 다른 이야기입니다. 실력이 모자란 학생에게서 효과가 더 컸던 것도 같은 이유로 볼 수 있습니다.

한국 교실로 옮기면 질문은 이렇게 바뀝니다. AI가 낸 문제를 학생이 푸는 동안 교사는 무엇을 보고 있나요. 학생들이 틀린 문제는 다음 수업으로 돌아오나요. 맞춤의 효과는 기술 자체보다 이 연결에서 갈릴 가능성이 큽니다.

한국의 AI 디지털교과서가 내건 약속도 학생 수준에 맞춘 학습이었습니다. 연구가 지지하는 것은 그 약속의 좁은 쪽, 곧 교사가 쥔 연습과 피드백의 맞춤입니다. 학교 전체를 학생 각자의 화면에 맞추는 넓은 쪽은 다른 이야기입니다. 그 넓은 쪽을 먼저 시도한 학교들의 결과는 2편에서 살핍니다.

이 증거의 한계

블룸의 숫자는 소규모 박사논문에서 나왔고, 지능형 튜터 연구를 모은 분석에는 오래되고 기간이 짧은 실험이 많습니다. 효과의 크기는 시험에 따라 달랐습니다. 프로그램이 가르친 내용을 그대로 묻는 시험에서는 크고, 범위가 넓은 표준화 시험에서는 작았습니다(지능형 튜터 종합 분석 2016). 메인주 실험은 한 주의 한 학년을, 델리 실험은 학년 진도보다 크게 뒤처진 학생을 다뤄 한국 교실에 그대로 옮기기 어렵습니다. ‘효과가 난 곳에 교사가 있었다’는 공통점은 연구들을 나란히 놓고 읽은 해석이며, 교사의 역할만 따로 떼어 비교한 실험은 아닙니다. 생성형 AI 튜터 연구는 아직 기간이 짧고 수도 적습니다. 등수 환산은 시험 점수가 고르게 퍼져 있다고 가정한 근사치입니다.


기획시리즈 「맞춤형 학습의 함정 — 연습은 맞추고, 교실은 남겨라」 · ① 맞춤은 효과가 있나(이 글) · ② 학교 전체를 맞추면 · ③ 교실에 남겨야 할 것 — 실천 제안(‘바로 해 볼 것’)은 ③에 있습니다.

참고 자료

  1. Bowles, N. (2019. 4. 21). Silicon Valley Came to Kansas Schools. That Started a Rebellion. The New York Times. https://www.nytimes.com/2019/04/21/technology/silicon-valley-kansas-schools.html
  2. Barnum, M. (2023. 10. 4). Mark Zuckerberg tried to revolutionize American education with technology. It didn’t go as planned. Chalkbeat. https://www.chalkbeat.org/2023/10/4/23903768/mark-zuckerberg-czi-schools-personalized-learning-technology-summit/
  3. 이주호 부총리 겸 교육부장관 (2023. 6. 8). [브리핑문] AI 디지털 교과서 추진방안. 교육부. https://www.moe.go.kr/mnstrBoardView.do?boardID=430&boardSeq=95298&lev=0
  4. Bloom, B. S. (1984). The 2 sigma problem: The search for methods of group instruction as effective as one-to-one tutoring. Educational Researcher, 13(6), 4–16. https://doi.org/10.3102/0013189X013006004
  5. Slavin, R. E. (1987). Mastery learning reconsidered. Review of Educational Research, 57(2), 175–213. https://doi.org/10.3102/00346543057002175
  6. VanLehn, K. (2011). The relative effectiveness of human tutoring, intelligent tutoring systems, and other tutoring systems. Educational Psychologist, 46(4), 197–221. https://doi.org/10.1080/00461520.2011.611369
  7. Kraft, M. A. (2020). Interpreting effect sizes of education interventions. Educational Researcher, 49(4), 241–253. (효과 크기를 등수로 옮긴 기준) https://doi.org/10.3102/0013189X20912798
  8. Ma, W., Adesope, O. O., Nesbit, J. C., & Liu, Q. (2014). Intelligent tutoring systems and learning outcomes: A meta-analysis. Journal of Educational Psychology, 106(4), 901–918. https://doi.org/10.1037/a0037123
  9. Roschelle, J., Feng, M., Murphy, R. F., & Mason, C. A. (2016). Online mathematics homework increases student achievement. AERA Open, 2(4). https://doi.org/10.1177/2332858416673968
  10. Muralidharan, K., Singh, A., & Ganimian, A. J. (2019). Disrupting education? Experimental evidence on technology-aided instruction in India. American Economic Review, 109(4), 1426–1460. https://doi.org/10.1257/aer.20171112
  11. Major, L., Francis, G. A., & Tsapali, M. (2021). The effectiveness of technology-supported personalised learning in low- and middle-income countries: A meta-analysis. British Journal of Educational Technology, 52(5), 1935–1964. https://doi.org/10.1111/bjet.13116
  12. Kulik, J. A., & Fletcher, J. D. (2016). Effectiveness of intelligent tutoring systems: A meta-analytic review. Review of Educational Research, 86(1), 42–78. https://doi.org/10.3102/0034654315581420

이 글은 AI(GrokBot)가 본문에 링크한 공개 자료를 바탕으로 작성한 기획 기사이며, 편집자 검토를 거쳐 발행합니다. 사실 서술은 각 출처를 기준으로 하고, 해석과 제언은 AI가 작성한 분석입니다. 「인공지능 발전과 신뢰 기반 조성 등에 관한 기본법」(AI 기본법)에 따라 AI 생성물임을 알립니다.