AI 스스로 학습 진행 상황을 깨닫다
인공지능이 문제를 풀 때 스스로 '지금 어디까지 왔지?'라고 묻는 법을 배웠어요. 연구진은 AI가 자신의 진행 상태를 깨닫도록 훈련하는 새 방법을 개발했습니다.
왜 인공지능에 '진도 체크'가 필요할까?
인공지능이 복잡한 문제를 풀려면 여러 단계를 거쳐야 합니다. 마치 요리할 때 재료를 준비하고, 자르고, 볶는 것처럼요. 그런데 기존 AI는 각 단계마다 '지금 무엇을 해야 하는지'만 배웠습니다. '전체 과정에서 지금이 몇 번째 단계인지'는 알지 못했죠. 이렇게 전체 그림을 모르면 긴 작업에서 실수할 확률이 높아집니다. 예를 들어 쇼핑 목록을 작성할 때 중간에 까먹는 것과 비슷합니다.
연구진이 찾아낸 뜻밖의 발견
연구진은 먼저 작은 실험을 했습니다. AI에게 일을 하는 중간에 '지금까지 잘하고 있어'라고 말해주면 어떤 일이 일어나는지 봤습니다. 놀랍게도 이렇게 중간에 격려를 해주면 오히려 성적이 나빠졌습니다. 반면에 일을 다 끝낸 후 '여기서는 잘했고, 저기서는 실수했어'라고 과거를 돌아보는 정보를 주면 성적이 좋아졌습니다. 즉, AI는 일을 하는 도중에 피드백을 받는 것보다, 끝나고 되돌아보는 피드백이 더 효과적이었습니다.
RePro: 스스로 되돌아보는 훈련법
이를 바탕으로 연구진은 RePro라는 새 훈련 방법을 만들었습니다. RePro는 두 단계로 이뤄집니다. 먼저 AI가 스스로 문제를 풉니다. 그리고 나서 자신이 했던 행동을 다시 보며 '이 단계에서는 진전이 있었는지'를 스스로 판단하게 합니다. 이때 외부에서 알려주지 않고, AI 스스로 판단하도록 훈련합니다. 처음에는 몇 가지 예시를 보여주고, 이후에는 스스로 점수를 매기게 합니다. 이렇게 하면 AI가 점점 더 정확하게 자신의 진행 상황을 알게 됩니다.
연구진은 이 방법을 쇼핑 웹사이트, 가상 일상 과제, 퍼즐 게임 등 세 가지 다른 환경에서 시험했습니다. 그 결과, RePro로 훈련한 AI가 기존 방법보다 더 높은 점수를 받았습니다. 특히 긴 작업일수록 차이가 컸습니다. AI가 스스로 '이제 반쯤 왔구나' 또는 '여기서 막혔네'를 인지하면서 더 똑똑하게 행동하게 된 것입니다.
우리 일상에 어떤 변화가?
이 연구가 의미하는 바는 간단합니다. 앞으로 인공지능이 더 복잡하고 긴 작업을 스스로 처리할 수 있게 된다는 것입니다. 예를 들어 AI 비서가 여행 계획을 세울 때, 각 단계별로 진행 상황을 스스로 체크하며 더 정확하게 일을 처리할 수 있습니다. 또는 AI가 문제를 풀다가 막히면 스스로 '여기서 도움이 필요하다'고 알려줄 수도 있습니다. 이 기술이 발전하면 우리 일상에서 AI가 더 믿음직스러운 도우미가 될 것입니다.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.