AI 숨은 학습의 비밀: 노이즈가 강화한다

쉽게 말하면, AI가 겉으로는 무작위처럼 보이는 데이터에서 숨은 습관을 배울 수 있다는 이야기입니다. 이번 연구는 그 숨은 신호가 왜 생기는지 파헤쳤습니다.

AI가 몰래 배우는 문제

언어 모델은 엄청난 양의 글을 읽고 스스로 규칙을 익히는 AI입니다. 그런데 이 모델이 이상한 방식으로 배울 때가 있습니다. 겉으로 보기에 전혀 상관없는 데이터로부터 선생님 모델의 편향을 그대로 배워버리는 겁니다.

예를 들어, 선생님 모델이 특정 문구에 반응하는 방식을 학생 모델에게 전수한다고 해봅시다. 그런데 학생 모델에게 전달된 데이터는 실제로는 그 문구와 아무 관련 없어 보입니다. 그래도 학생은 선생님의 습관을 고스란히 따라 합니다. 이런 현상을 '잠재 학습'이라고 부릅니다.

연구진이 발견한 것

이번 연구진은 AI 모델의 내부 값을 조금 흔들어 보는 실험을 했습니다. 모델의 가중치, 즉 AI가 글을 이해할 때 사용하는 일종의 '민감도 조절 장치'에 무작위 잡음을 섞은 겁니다. 그러자 자동차 소음처럼 방해가 될 것 같은 이 잡음이 오히려 숨은 전수를 강하게 만들었습니다.

구글의 젬마 모델에서는 전수 효과가 1.9배, 메타의 라마 모델에서는 1.3배 커졌습니다. 이 결과는 중요한 단서를 줍니다. 잠재 학습에서 중요한 것은 문장의 의미가 아니라, 문장 뒤에 숨겨진 숫자 구조라는 뜻입니다. 즉, 단어의 뜻이 아니라 모델 내부의 수학적 연결고리가 이 현상을 만든다는 겁니다.

그럼 어떻게 대비할까

연구진은 또 '방향 벡터'라는 기술을 이용해 일부러 잠재 학습을 일으킬 수 있는 데이터를 만들 수 있음을 보여줬습니다. 이는 공격자가 악의적으로 숨은 신호를 심을 가능성을 뜻합니다. 쉽게 말해, 데이터 검사에서 걸리지 않는 '숨은 주문'을 만들어 AI를 조작할 수 있다는 뜻입니다.

이 연구가 의미하는 바는 분명합니다. AI가 무슨 데이터로 학습했는지 들여다보는 기존 방식으로는 위험한 편향을 찾아낼 수 없다는 겁니다. 앞으로는 숫자 구조까지 확인하는 새로운 감시 방법이 필요합니다. 그래야 우리가 믿고 쓰는 AI가 예상 밖의 행동을 하지 않도록 안전하게 만들 수 있습니다.

📖 원문 보기: arXiv 원문

본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.