AI도 자기 경험으로 배운다?
AI가 자신의 대화 기록을 보고 매번 더 나은 답을 만든다면? 한 연구팀이 그 꿈에 한 걸음 다가선 시스템을 내놨습니다.
오늘날 AI 챗봇은 대량의 데이터를 미리 배우고 나서 배포됩니다. 그리고 나서는 사용자와 주고받은 대화를 다시 학습 재료로 쓰기 어렵습니다. 연구팀은 실제 사용 기록이야말로 가장 좋은 학습 자료라고 봤습니다. AI가 특정 질문에 약한 모습을 보이면, 그 기록을 다음 학습에 반영하자는 것이지요. 이런 흐름을 '반복적 자기 개선'이라고 부릅니다.
기록을 남기고, 그 기록으로 학습한다
연구팀이 만든 NeoHorse-1은 하나의 거대한 모델이 아니라 여러 AI 모델을 묶은 시스템입니다. 시스템 앞에는 중간 관리자 역할을 하는 '라우팅 하네스'가 있습니다. 관리자가 질문 유형을 파악해 적합한 모델을 고르는 방식입니다. 예를 들어 코딩 문제는 코딩에 강한 모델에, 감정적인 대화는 공감에 강한 모델에 배정되죠.
핵심은 모든 과정이 기록된다는 점입니다. 어떤 능력이 필요했고, 어떤 모델을 선택했고, 사용자 반응은 어땠는지가 데이터로 남습니다. 좋은 기록만 추려 새로운 학습 데이터로 바꿉니다. 단순한 질문-답변 쌍이 아니라, 검색이나 계산 같은 도구를 중간에 쓴 과정도 그대로 살립니다. 다만 품질이 낮은 기록은 걸러냅니다. 여섯 가지 기준으로 평가하고, 대화 장면을 세밀하게 라벨링해서, 잘못된 내용이 학습에 들어가는 것을 막았습니다.
쉬운 문제부터, 선생님 모델과 함께
학습 과정도 설계가 필요합니다. 연구팀은 커리큘럼을 세 단계로 나누어 쉬운 문제부터 차근차근 풀게 했습니다. 그리고 '온폴리시 증류'라는 방법을 썼습니다. 풀어 말하면, 뛰어난 선생님 모델이 학생 모델이 낸 답을 보고 같은 문제로 더 나은 풀이를 제시해 주는 방식입니다. 선생님의 추론 흐름을 학생 모델이 흡수하게 만드는 것이지요. 여기에 평가 결과를 다음 학습 방향에 반영했습니다. 특정 분야에서 오답이 많다면 그 분야에 학습 데이터를 더 배정하는 방식입니다.
이 연구는 무엇을 의미하나
이 방식이 자리 잡으면 사용자와 주고받는 대화가 쌓일수록 AI가 더 정확해질 수 있습니다. 마치 일을 하면서 경험을 쌓는 사람처럼, AI가 자신의 기록으로 성장하는 것이지요. 다만 자칫 잘못된 데이터가 강화되면 같은 실수를 반복할 위험도 있습니다. 그렇기에 훈련 데이터를 엄격하게 검증하는 과정이 앞으로 더 중요해질 것 같습니다. 이 연구는 AI가 스스로 학습할 수 있는 방향을 구체적인 시스템으로 보여줬다는 점에서 의미가 큽니다.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.