AI 수학 능력, 체계적으로 평가해보니
인공지능(AI)이 수학 문제를 풀 수 있을까? 이 연구는 그래프 이론이라는 수학 분야에서 최신 AI 모델의 능력을 체계적으로 평가했습니다.
왜 이런 연구가 필요했나?
AI가 글쓰기나 그림 그리기뿐 아니라 수학을 배우는 사람을 도와주는 일도 점점 많아지고 있습니다. 하지만 AI의 수학 실력을 객관적으로 측정하는 기준은 아직 부족했습니다. 연구진은 그래프 이론, 즉 점과 선으로 이루어진 연결 구조를 다루는 수학 분야에서 AI가 얼마나 잘 추론하는지 평가하는 시험지를 만들었습니다. 이 시험지를 'GTBench'라고 부릅니다.
어떻게 시험을 만들었나?
이 시험지는 총 63개의 문제로 구성되어 있습니다. 난이도에 따라 세 그룹으로 나뉩니다. 첫 번째 그룹은 기본 용어와 성질을 묻는 쉬운 문제입니다. 두 번째 그룹은 알고리즘을 따라가며 구조를 이해해야 하는 중간 난이도 문제입니다. 세 번째 그룹은 대학원 수준의 증명을 요구하는 어려운 문제입니다. 연구진은 이 문제들을 검증된 교과서에서 가져왔습니다.
어떤 AI 모델을 시험했나?
다섯 가지 대표 AI 모델을 시험했습니다. GPT-5, Claude Sonnet 4.6, Gemini 2.5 Flash-Lite, Llama 3.3 70B, Mistral Large 3 등입니다. 문제를 그냥 풀게 하는 경우와 생각하는 과정을 적도록 유도하는 경우, 두 가지 방식으로 성능을 측정했습니다. 쉬운 문제들에서는 대부분의 모델이 좋은 성적을 냈습니다.
결과는 무엇을 말해주나?
하지만 어려운 증명 문제에서는 결과가 크게 갈렸습니다. 최고 성능을 보인 모델도 사람 전문가에 비해 부족했습니다. 특히 AI가 스스로 답을 평가할 때와 사람이 평가할 때 차이가 나타났습니다. 이는 AI가 수학 연구를 돕는 도구로 완성되려면 아직 넘어야 할 산이 많다는 것을 보여줍니다.
이 연구가 주는 의미
이 연구가 의미하는 바는 무엇일까요? 앞으로 AI를 수학 교육이나 연구에 사용하고자 할 때, 객관적으로 능력을 측정할 수 있는 기준이 생겼다는 점입니다. 이 기준을 바탕으로 더 나은 수학 AI 모델을 개발할 수 있을 것입니다. 동시에, 현재의 AI는 복잡한 수학 추론에서 한계가 있다는 사실도 분명히 드러냈습니다.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.