여러 AI 선생님, 언제 누구를 믿을까?
AI를 한 분야만 잘하는 여러 모델에서 모든 분야를 두루 잘하는 한 모델로 합치려면 어떻게 해야 할까? 이번 연구는 각 질문마다 '그 문제를 가장 정확히 푼' 전문가를 찾아 그 답을 배우는 방법을 내놓았습니다.
챗봇, 번역기, 코딩 도우미 등 오늘날 AI는 분야별로 잘하는 전문 모델을 따로 만들어 씁니다. 하지만 사용자들은 여러 전문 모델을 동시에 쓰기보다 하나의 똑똑한 AI를 원할 때가 많습니다. 그래서 각 분야 전문가의 지식을 한 학생 모델에 옮겨 담는 '증류' 과정이 필요합니다. 증류란 마치 여러 명의 전문가가 한 제자에게 각자의 비법을 가르치는 것과 같습니다. 최종 제자는 모든 비법을 자기 것으로 만들어 혼자서 일해야 합니다.
기존에는 질문이 어느 분야에 속하는지 먼저 판단해 그 분야의 전문가 모델을 학생의 선생님으로 정했습니다. 문제는 분야 전문가라는 사실이 그 질문도 완벽히 잘 푼다는 뜻이 아니라는 점입니다. 수학 전문이면서도 특정 수학 문제에서 틀리고, 문학 전문 모델이 오히려 그 문제를 맞힐 수도 있습니다. 평균적으로 잘하는 것과 지금 이 문제에서 맞는 것은 별개인 셈이죠.
정답을 확인한 뒤에야 가르치는 구조
이에 연구자들은 MT-SDPO라는 학습 방법을 만들었습니다. 첫 번째 요소는 자기 기준입니다. 학생 모델이 스스로 만들어낸 답 가운데 옳은 것이 있다면, 그것을 기본 바탕으로 삼아 자기 스스로 더 나아진 방향으로 갱신합니다. 두 번째 요소는 정답 검증을 통과한 교사만 가르치게 하는 것입니다.
어떤 전문가 모델이든 특정 문제에서 정확한 답을 쓴 경우에만 그 답을 학생이 참고하게 합니다. 이렇게 하면 분야가 같다는 이유만으로 틀린 선생님에게 잘못된 답을 배우는 일을 막을 수 있습니다. 마지막으로, 이렇게 모인 정답 데이터로 학생 모델이 올바른 행동을 내놓도록 학습을 조정합니다. 쉽게 말해 선생님의 명성이 아니라 '그 문제의 답'이 진짜 지식의 기준이 되는 것입니다.
여러 전문가 하나의 AI로, 비용도 절감
이 방식이 의미를 가지는 이유는 실제 서비스에서 여러 전문 모델을 하나로 합치려는 요구가 크기 때문입니다. 분야별 라벨을 붙이는 비용을 들이지 않고도 각 질문의 정답을 검증해 올바른 선생님을 자동으로 고르는 일이 가능해집니다. 그러면 학생 모델 하나만 배포하면 되므로 서버 운영 비용을 줄일 수 있고, 사용자들에게는 더 정확한 답변을 제공할 가능성이 커집니다.
이번 연구는 그동안 '어느 분야 전문가가 가르칠지'에 집중하던 시선을 '누가 지금 정답을 알고 있느냐'로 옮겼다는 점에서 새로운 시도로 볼 수 있습니다.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.