마찰을 설계하는 AI ③ — 답 대신 질문을 건넨 AI들

답 대신 질문을 건네는 AI 학습 모드가 잇달아 나왔습니다. 설계된 튜터는 단기 실험에서 학습 이득을 키우기도 했지만, 효과를 가른 것은 제품 이름보다 순서와 쓰는 방식이었습니다. 기업 발표는 설계 의도일 뿐 효과 증거가 아닙니다.

마찰을 설계하는 AI ③ — 답 대신 질문을 건넨 AI들
AI 생성 이미지

2026년 10월 3일(토) · 기획시리즈 「마찰을 설계하는 AI」 3/4 · AI(GrokBot)가 작성한 기획 기사 · 편집자 검토 후 발행

답 대신 질문을 건네는 AI들이 교실에 들어왔습니다. 설계된 튜터는 단기 실험에서 학습 이득을 키우기도 했지만, 같은 AI라도 언제·어떻게 쓰느냐에 따라 결과가 달라졌습니다. 제품 이름보다 순서와 쓰는 방식이 더 중요해 보입니다.

칸 아카데미(Khan Academy)의 살 칸은 2026년 블로그에서, 3년 전 내놓은 칸미고(Khanmigo) 첫 버전이 기대만큼 학습을 바꾸지 못했다고 인정했습니다. 그는 생산적 분투(productive struggle, 배우기 위해 일부러 버티는 어려움)를 피해 가기 더 어렵게 만들어야 했다고 적었습니다(칸 아카데미 블로그 2026). 칸의 말대로라면, 답을 너무 쉽게 건네는 AI는 버티는 시간을 줄였습니다. 칸의 고백은 제품 실패담이면서, 이 기획이 묻는 ‘마찰을 어떻게 설계할 것인가’의 출발점이기도 합니다.

칸이 쓴 표현은 인지적 온로딩(cognitive onloading, 인지적 오프로딩의 반대로, 학습자가 스스로 생각하게 짐을 다시 얹는다는 기업 측 표현)입니다. 이 말은 칸 아카데미의 입장문에서 나온 설계 목표이지, 독립 연구로 검증된 효과 수치가 아닙니다. 그래도 방향은 분명합니다. 답을 바로 주는 AI에서, 먼저 생각하게 하는 AI로 옮기려 했다는 것입니다.

1편 「빨라진 숙제, 남지 않는 배움」은 가드레일 없는 AI가 연습 성적을 올리면서 배움을 깎을 수 있다는 증거를 봤고, 2편 「남겨야 할 어려움, 걷어 낼 어려움」은 인출·간격·교차·생성이라는 좋은 마찰과 인지 부하 이론이 말하는 나쁜 마찰을 갈랐습니다. 2편이 남긴 ‘비생산적 성공’의 틀도 이번 편의 배경입니다. 당장은 풀렸는데 남는 것이 적은 설계를, 교실의 AI가 어떻게 피하려 했는지 따라갑니다.

요약 영상 (AI 제작)

답 대신 질문하는 AI의 등장

2025년 들어 대형 모델 회사들도 비슷한 기능을 내놓았습니다. 오픈AI(OpenAI)의 챗GPT(ChatGPT) 학습 모드(study mode)는 즉답 대신 단계별 질문과 안내로 이끌도록 설계됐습니다(오픈AI 도움말·소개). 다만 MIT 테크놀로지 리뷰(MIT Technology Review)는 학생이 일반 모드로 쉽게 돌아가 답을 얻을 수 있다는 한계를 함께 적었습니다. 모드를 켠다고 마찰이 지켜지지는 않습니다. 가드레일이 제품 안에만 있으면, 학생은 한 번의 클릭으로 그 가드레일을 넘어갑니다.

앤트로픽(Anthropic)의 클로드(Claude) 학습 모드(Learning mode)도 “이 문제를 어떻게 접근하겠어요?”처럼 추론을 묻는 질문으로 안내한다고 밝혔습니다(앤트로픽 2025). 구글(Google)의 제미니(Gemini) 가이드 학습(Guided Learning)은 탐색적 질문과 단계 분해로 ‘빠른 답 대신 깊은 이해’를 내세웠고, 프롬프트 개선만으로는 부족하다는 판단에서 런LM(LearnLM)을 키웠다고 적었습니다(구글 블로그 2025). 세 제품 모두 소크라테스식 문답(Socratic questioning, 답을 주기보다 질문으로 생각을 이끄는 방식)을 설계 언어로 삼았습니다. 문구는 서로 닮았습니다. 그러나 학생이 실제로 그 질문을 버티는지는 제품 페이지가 말해 주지 않습니다.

수요 쪽 그림은 다릅니다. 앤트로픽이 대학생의 클로드 대화를 분석한 교육 보고서에 따르면, 학생–AI 대화의 약 47%가 직접형(Direct)이었습니다. 최소한의 관여로 답이나 산출물을 구하는 대화입니다(앤트로픽 교육 보고서 2025). 기업이 학습 모드를 내놓는 이유와, 학생들이 실제로 묻는 방식이 어긋날 수 있다는 신호입니다. 질문을 준비해 둬도, 학생이 답부터 구하면 마찰은 다시 얇아집니다.

여기서 선을 분명히 긋습니다. 위 자료는 제품 소개·도움말·기업 자체 분석입니다. 설계 의도와 사용 실태를 보여 주지만, 독립적으로 검증된 학습 효과 증거가 아닙니다. ‘소크라테스식 AI만 도입하면 해결된다’는 말은 이 자료들이 지지하지 않습니다. 무엇이 남는지는 제품 이름이 아니라 실제 대화의 순서가 정합니다.

설계된 튜터는 효과가 있었나

그렇다면 교수법 원칙을 넣어 설계한 튜터는 달랐을까요. 하버드대 물리 입문 강좌에서 진행된 무작위 교차 실험이 자주 인용됩니다. 연구진은 능동 학습(active learning, 강의만 듣지 않고 문제·토론으로 참여하는 수업) 교실과, 단계별 안내·오개념 교정 등 교수법 원칙으로 설계한 AI 튜터를 비교했습니다. 참가자는 194명, 측정은 두 번의 수업이었습니다(케스틴 외, Scientific Reports 2025).

결과만 보면 인상적입니다. AI 튜터 집단의 학습 이득 중앙값은 능동 학습 수업 집단의 두 배 이상이었고, 분위회귀로 본 효과크기(effect size, 집단 차이를 표준편차 단위로 나타낸 값)는 0.73~1.3 표준편차(SD) 구간이었습니다. 학습 시간 중앙값은 AI 쪽이 49분, 교실이 60분이었습니다. 학생들은 더 몰입됐다고 응답하기도 했습니다. 다만 단일 기관·두 회 수업의 단기 측정입니다. 이 숫자로 ‘AI 튜터가 교사보다 낫다’고 말하거나, 장기 효과를 단정할 수는 없습니다.

1편에서 본 바스타니 외의 튀르키예 고교 수학 실험도 같은 쪽을 가리킵니다. 가드레일 없는 GPT는 AI를 거둔 뒤 시험에서 해를 남겼지만, 학습을 보호하도록 설계한 GPT 튜터(GPT Tutor)는 그 부정적 효과를 대부분 완화했습니다(바스타니 외, PNAS 2025). 설계가 차이를 만든다는 신호입니다. 다만 ‘완화’이지 ‘제거’는 아닙니다.

교실 밖·다른 나라의 단서도 있습니다. 세계은행(World Bank) 워킹페이퍼는 나이지리아 공립고 1학년 영어 방과후 프로그램에서 마이크로소프트 코파일럿(Microsoft Copilot, GPT-4 기반)을 교사 안내·2인 1조로 6주간 쓴 결과, 종합 평가에서 0.31 SD 향상을 보고했습니다(데 시모네 외, 세계은행 WPS 2025). ‘맨 AI’가 아니라 교사가 활동을 붙잡은 설계입니다. 가나에서는 왓츠앱(WhatsApp) 기반 수학 튜터 로리(Rori)를 쓴 연구에서 성장 점수 효과크기 0.37이 보고됐고, 결과는 AIED 2024 포스터·후기 결과 트랙에 실렸습니다(헨켈 외, AIED 2024). 저자들도 1년차 결과라 신중한 해석을 권합니다. 힌트 품질도 변수입니다. 챗GPT가 만든 수학 힌트의 32%가 품질 검사에서 탈락했다는 무작위 실험도 있습니다(파르도스·반다리, PLOS ONE 2024).

설계된 튜터는 ‘아무 답이나 주는 AI’와는 다른 단기 성과를 남기기도 했습니다. 그러나 대부분 두 회 수업에서 여섯 주 안팎입니다. 한 학기·한 학년을 넘는 장기 효과는 아직 모릅니다. 효과가 있었다고 해서, 교실의 사람을 빼도 된다는 뜻은 아닙니다. 나이지리아 사례처럼 교사 안내가 붙은 설계와, 혼자 쓰는 범용 챗봇을 같은 선에 두면 안 됩니다.

순서와 쓰는 방식이 효과를 가른다

설계만으로 끝나지 않습니다. 같은 설명이라도 언제 보느냐가 갈랐습니다. 쿠마르와 동료들은 성인 참가자에게 수학 문제를 연습시킨 뒤, 정답만 보여 주기와 대규모 언어 모델(LLM, large language model) 설명을 비교했습니다. LLM 설명이 정답만 보여 주는 것보다 나았고, 먼저 스스로 시도한 뒤 설명을 본 조건에서 이득이 가장 컸습니다(쿠마르 외, AIED 2025). 2편이 말한 생성·인출과 맞닿는 대목입니다. 설명이 아무리 좋아도, 스스로 떠올리기 전에 건네면 그 기회를 지웁니다.

쓰는 방식도 갈랐습니다. 레만과 동료들의 워킹페이퍼(동료심사 전)는 코딩 수업에서 LLM을 풀이 생성으로 대체하면 다룬 주제는 늘어도 이해가 줄고, 설명을 묻는 보완형 사용은 이해가 는다고 보고했습니다. 해답 요청의 42%는 시도 없이 나왔고, 사전지식이 낮은 학생일수록 손해가 커 격차가 벌어졌습니다(레만 외, arXiv 2024). LLM이 ‘배웠다는 느낌’을 부풀릴 수 있다는 점도 함께 짚었습니다. 유창한 설명이 이해를 보증하지는 않는다는, 1·2편의 경고와 이어집니다.

셴과 탬킨의 프리프린트(동료심사 전)도 비슷한 결과를 냈습니다. 새 비동기 라이브러리를 배우는 파이썬 개발자 52명을 나눈 실험에서 AI 집단의 퀴즈 점수는 약 17% 낮았습니다. 그런데 여섯 가지 상호작용 패턴 가운데 인지적으로 관여하는 패턴을 쓴 참가자는 AI를 써도 학습이 보존됐습니다(셴·탬킨, arXiv 2026). 도구가 같아도 학생이 어떻게 관여하느냐에 따라 결과가 달랐습니다. 다만 표본이 작고 과제가 짧으며, 저자가 앤트로픽 소속이라는 한계가 있습니다. 교실 전체를 단정할 근거로 쓰기는 어렵습니다.

칸 아카데미는 파일럿 학군 경험을 정리하며, 초기의 ‘답을 주지 않는다’ 규칙을 더 세밀히 바꿨다고 적었습니다. 제출 전에는 시도를 격려하고 가벼운 힌트를, 틀린 뒤에는 더 직접적으로 풀이를 함께 짚어 잘못된 연습이 굳기 전에 회복한다는 것입니다(칸 아카데미 블로그 2026). 마찰을 둘지 말지만이 아니라, 언제 둘지도 설계의 대상이 됐습니다. 다만 이 역시 기업의 서술이고, 독립적으로 잰 효과는 아닙니다.

학생 대신 교사를 돕는 AI

시선을 학생에서 교사·튜터로 옮기면 또 다른 설계가 보입니다. 튜터 코파일럿(Tutor CoPilot) 연구는 실시간 튜터링에서 튜터에게 전문가형 제안을 보여 주는 인간–AI 시스템을 시험했습니다. 동료심사 전 워킹페이퍼 기준, 주제 숙달 확률은 전체에서 4%포인트, 평점이 낮은 튜터의 학생에서는 9%포인트 높았습니다. 메시지 분석에서는 유도 질문이 늘고 답을 바로 주는 행동이 줄었습니다. 다만 학년말 표준화 시험에서는 유의한 효과가 없었습니다(왕 외, arXiv·EdWorkingPaper). 단기 숙달은 움직였지만, 시험 점수로 이어지지는 않았습니다. 당장 재기 쉬운 지표와 표준화 시험이 다른 말을 할 수 있다면, 이 결과만으로 교실 정책을 바꾸기는 이릅니다.

하버드 CS50 강좌의 덕(CS50 Duck) 도구도 ‘안내하되 답을 주지 말라’는 설계를 택했습니다. 상용 챗봇을 그대로 쓰기보다, 강좌 전용 도구로 해법을 안내하도록 제한한 경험 보고입니다(류 외, SIGCSE 2024). 영국 중등 교실의 탐색적 실험에서는 런LM 초안을 전문 튜터가 감독·수정하는 전제에서 다음 주제 문제 해결률이 소폭 올랐다고 보고됐지만, 프리프린트이자 개발사 공동·소표본이라 일반화는 이릅니다(런LM 팀, arXiv 2025).

두 사례 모두 AI가 학생 대신 답을 채우기보다, 사람이 좋은 질문을 이어 가도록 돕는 쪽에 무게를 뒀습니다. 그렇다고 AI가 교사를 대신할 수 있다는 말은 이 증거들이 하지 않습니다. 도움을 받는 쪽은 학생만이 아니라, 질문을 설계하는 사람이기도 합니다. 마찰을 설계하는 AI의 끝이 학생이 아니라 교사일 수 있다는 힌트입니다.

설계만으로는 부족하다

설계된 질문, 먼저 시도하기, 보완형 사용, 교사를 돕는 제안. 여기까지가 이번 편이 모은 짧은 목록입니다. 그런데 설계만으로 끝이 나지 않는다는 신호도 있습니다. 다르비시와 동료들의 대규모 실험에서 학생들은 AI 보조로부터 배우기보다 의존하는 경향을 보였습니다(다르비시 외, Computers & Education 2024). 의존하는 습관이 남아 있으면, 잘 만든 설계도 잠깐의 연출로 끝날 수 있습니다.

단기 실험에서 빛난 수치가 한 학년의 배움을 보증하지는 않습니다. 기업이 내건 학습 모드는 설계 의도이지 효과 증명서가 아닙니다. 효과를 가른 것은 브랜드보다 순서와 쓰는 방식이었습니다. 그렇다면 남는 질문은 교실의 것입니다. 먼저 시도하고 나중에 설명을 보는 순서를 누가 지키게 할지, 학교는 어떤 규칙을 세울지입니다. 도구를 바꾸는 것만으로는 답이 나오지 않습니다. 다음 편에서는 그 몫을 교사와 학교에 묻습니다.


다음 편 예고 다음 편 「교사와 학교의 몫」에서는 교실과 제도 쪽으로 시선을 옮깁니다. 교사가 마찰을 설계할 때 AI는 어디에 두어야 하는지, 접근·활용률이 아니라 참여와 학습을 재는 정책은 무엇을 바꿔야 하는지 따라갑니다.

원문·참고 자료

  1. Khan, S. (2026, July 15; updated August 27). Khanmigo's First Chapter Changed How I Think About AI: A note from Sal Khan. Khan Academy Blog. https://blog.khanacademy.org/khanmigos-first-chapter-changed-how-i-think-about-ai-a-note-from-sal-khan/
  2. OpenAI (2025, July 29). Introducing study mode; OpenAI Help Center, Using study mode in ChatGPT; MIT Technology Review (2025, July 29), OpenAI is launching a version of ChatGPT for college students. https://help.openai.com/en/articles/11780217-using-study-mode-in-chatgpt
  3. Anthropic (2025, April 2). Introducing Claude for Education (Learning mode). https://www.anthropic.com/news/introducing-claude-for-education
  4. Heymans, M. (2025, August 6). Guided Learning in Gemini: From answers to understanding. Google Blog. https://blog.google/products-and-platforms/products/education/guided-learning/
  5. Anthropic (2025, April 8). Anthropic Education Report: How University Students Use Claude. https://www.anthropic.com/news/anthropic-education-report-how-university-students-use-claude
  6. Kestin, G., Miller, K., Klales, A., Milbourne, T., & Ponti, G. (2025). AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational setting. Scientific Reports, 15, 17458. https://doi.org/10.1038/s41598-025-97652-6
  7. Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. PNAS, 122(26), e2422633122. https://doi.org/10.1073/pnas.2422633122
  8. De Simone, M. E., et al. (2025). From Chalkboards to Chatbots: Evaluating the Impact of Generative AI on Learning Outcomes in Nigeria. Policy Research Working Paper 11125, World Bank. https://documents.worldbank.org/en/publication/documents-reports/documentdetail/099548105192529324
  9. Henkel, O., Horne-Robinson, H., Kozhakhmetova, N., & Lee, A. (2024). Effective and Scalable Math Support: Experimental Evidence on the Impact of an AI-Math Tutor in Ghana. In Artificial Intelligence in Education. Posters and Late Breaking Results (AIED 2024). Springer. (also arXiv:2402.09809) https://arxiv.org/abs/2402.09809
  10. Pardos, Z. A., & Bhandari, S. (2024). ChatGPT-generated help produces learning gains equivalent to human tutor-authored help on mathematics skills. PLOS ONE, 19(5), e0304013. https://doi.org/10.1371/journal.pone.0304013
  11. Kumar, H., Rothschild, D. M., Goldstein, D. G., & Hofman, J. M. (2025). Math Education With Large Language Models: Peril or Promise? In Artificial Intelligence in Education (AIED 2025), Proceedings Part IV. Springer. https://doi.org/10.1007/978-3-031-98459-4_5 https://doi.org/10.1007/978-3-031-98459-4_5
  12. Lehmann, M., Cornelius, P. B., & Sting, F. J. (2024). AI Meets the Classroom: When Do Large Language Models Harm Learning? arXiv:2409.09047. [워킹페이퍼] https://arxiv.org/abs/2409.09047
  13. Shen, J. H., & Tamkin, A. (2026). How AI Impacts Skill Formation. arXiv:2601.20245. [프리프린트, Anthropic] https://arxiv.org/abs/2601.20245
  14. Khan Academy (2026, June 15). Built in the Open: How Pilot Districts Shaped the Reimagined Khan Academy. Khan Academy Blog. https://blog.khanacademy.org/built-in-the-open-how-pilot-districts-shaped-the-reimagined-khan-academy/
  15. Wang, R. E., Ribeiro, A. T., Robinson, C. D., Loeb, S., & Demszky, D. (2024). Tutor CoPilot: A Human-AI Approach for Scaling Real-Time Expertise. arXiv:2410.03017. https://arxiv.org/abs/2410.03017
  16. Liu, R., Zenke, C., Liu, C., Holmes, A., Thornton, P., & Malan, D. J. (2024). Teaching CS50 with AI: Leveraging Generative Artificial Intelligence in Computer Science Education. SIGCSE 2024, 750–756. https://doi.org/10.1145/3626252.3630938
  17. LearnLM Team, Google & Eedi (2025). AI tutoring can safely and effectively support students: An exploratory RCT in UK classrooms. arXiv:2512.23633. [프리프린트] https://arxiv.org/abs/2512.23633
  18. Darvishi, A., Khosravi, H., Sadiq, S., Gašević, D., & Siemens, G. (2024). Impact of AI assistance on student agency. Computers & Education, 210, 104967. https://doi.org/10.1016/j.compedu.2023.104967
  19. UBION 뉴스룸 (2026. 10. 1). 마찰을 설계하는 AI ① — 빨라진 숙제, 남지 않는 배움. (시리즈 앞 편) https://edtechnewsroom.com/feature-friction-1-faster-homework-less-learning/
  20. UBION 뉴스룸 (2026. 10. 2). 마찰을 설계하는 AI ② — 남겨야 할 어려움, 걷어 낼 어려움. (시리즈 앞 편) https://edtechnewsroom.com/feature-friction-2-good-friction-bad-friction/

이 글은 AI(GrokBot)가 본문에 링크한 공개 자료를 바탕으로 작성한 분석 칼럼이며, 편집자 검토를 거쳐 발행했습니다. 사실 서술은 각 출처를 기준으로 하고, 해석과 제언은 AI가 작성한 분석입니다. 「인공지능 발전과 신뢰 기반 조성 등에 관한 기본법」(AI 기본법)에 따라 AI 생성물임을 알립니다.