AI, 행동과 세상 변화를 함께 배우다
쉽게 말하면, AI가 스마트폰 게임을 할 때 어떤 버튼을 누르면 점수가 높아지는지만 배우는 게 아니라, 그 버튼을 눌렀을 때 게임 화면이 어떻게 바뀌는지까지 함께 배우는 새로운 방법을 개발했다는 연구입니다. 이렇게 하면 AI가 훨씬 더 똑똑하게 행동할 수 있습니다.
기존 AI의 한계: 결과는 알지만 과정은 모른다
최근 AI 비서나 게임 플레이어처럼 스스로 판단하고 행동하는 '에이전트(Agent)'가 주목받고 있습니다. 이들은 보통 '강화학습'이라는 방식으로 훈련됩니다. 강화학습은 AI가 시행착오를 겪으면서 어떤 행동이 높은 점수(보상)를 받는지 깨우치는 방법입니다. 예를 들어 로봇이 물건을 집는 훈련을 할 때, 물건을 집으면 +1점, 놓치면 -1점을 주는 식이죠. 하지만 이 방식은 행동의 결과가 점수로만 나오기 때문에, AI는 정작 그 행동이 주변 환경에 어떤 변화를 일으켰는지는 전혀 배우지 못합니다. 마치 시험 점수만 보고 공부하는 학생이 왜 틀렸는지는 모르는 것과 같습니다.
이 문제를 해결하기 위해 '세계 모델(World Model)'이라는 개념이 있습니다. 세계 모델은 AI가 특정 행동을 했을 때 주변 환경이 어떻게 변할지 예측하는 일종의 '상상력'입니다. 예를 들어 로봇이 손을 뻗으면 물체가 어떻게 움직일지를 미리 예측하는 거죠. 하지만 기존에는 세계 모델을 만들려면 별도의 시뮬레이터가 필요하거나, 훈련 과정을 두 단계로 나눠야 했고, 실제로 사용할 때도 추가 계산이 필요해 속도가 느렸습니다.
연구진의 발견: 훈련 데이터 속에 이미 답이 있었다
이번 연구진(PaW: Policy and World modeling co-training)은 기존 강화학습 훈련 과정에서 이미 행동과 그 결과(다음 상태)가 짝을 이뤄 기록된다는 사실에 주목했습니다. AI가 버튼을 누르면 그 순간의 화면(상태)이 어떻게 바뀌는지 자동으로 저장되는 겁니다. 이 데이터를 활용하면 별도의 시뮬레이터나 추가 훈련 단계 없이도 세계 모델을 같이 배울 수 있다는 아이디어입니다. 핵심은 훈련 과정에 아주 작은 변화만 주는 '공동 훈련(Co-training)' 방식입니다. AI가 점수를 높이는 법(정책)을 배우는 동시에, 그 행동이 환경을 어떻게 바꾸는지(세계 모델)도 배우게 한 겁니다. 이렇게 하면 추론 속도는 그대로 유지하면서도 AI의 판단력을 크게 높일 수 있습니다.
연구진은 이 방법을 실제로 안정적으로 작동하게 만들기 위해 세 가지 기술을 추가했습니다. 첫째, '행동 엔트로피 기반 데이터 선별'입니다. AI가 확신 없이 한 행동(엔트로피가 높은 행동)의 데이터는 세계 모델 학습에 별 도움이 안 되므로 걸러냅니다. 둘째, '노이즈에 강한 손실 함수'로 학습 도중 가끔 틀린 데이터가 섞여도 흔들리지 않게 했습니다. 셋째, '보상 기반 균형 조절'로 점수가 잘 나오는 상황에서는 정책 학습에, 점수가 애매할 때는 세계 모델 학습에 더 집중하도록 했습니다. 이렇게 훈련한 AI는 세 가지 서로 다른 과제(예: 게임, 로봇 조작, 대화) 모두에서 기존 강화학습보다 일관되게 더 좋은 성능을 보였습니다.
이 연구가 우리 생활에 주는 의미
이 연구가 의미하는 바는, 앞으로 AI가 더 현명하게 행동할 수 있는 길을 열었다는 점입니다. 예를 들어 자율주행 자동차가 핸들을 꺾으면 주변 차량이 어떻게 반응할지 예측하거나, 스마트홈 AI가 불을 켜면 에너지 소비가 어떻게 변할지까지 고려해 더 효율적으로 제어할 수 있게 됩니다. 특히 이 방법은 추가 장비나 느려짐 없이 기존 AI 훈련 방식에 살짝만 덧붙이면 되기 때문에, 이미 쓰이고 있는 다양한 AI 시스템에 쉽게 적용될 수 있습니다. 게임, 로봇, 챗봇 등 스스로 판단해야 하는 모든 AI가 더 안정적이고 똑똑해질 가능성을 보여준 것입니다.
물론 아직 해결해야 할 숙제도 있습니다. 모든 상황에서 세계 모델이 정확히 작동하는지, 더 복잡한 현실 문제에도 통할지는 추가 검증이 필요합니다. 하지만 이번 연구는 AI가 단순히 '점수 높은 행동'만 외우는 것을 넘어, 진정한 의미에서 '이해'를 갖추는 방향으로 한 걸음 나아갔다는 점에서 주목할 만합니다.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.