정답을 모를 땐 솔직히 모르겠다고 말하는 AI
AI는 대화할 때 지난 내용을 기억해야 합니다. 그런데 기억을 압축하다 보면 답을 찾는 결정적인 단서가 사라지기도 하죠. 이 연구는 그런 상황에서 AI가 엉뚱한 답을 지어내지 않고, 솔직하게 모른다고 말하는 법을 가르칩니다.
왜 이 연구가 필요했나
긴 글을 처리하는 AI는 중요한 정보를 임시로 저장해 둡니다. 예를 들어 소설에서 등장인물의 이름이나 전개를 기억해야 다음 질문에 답할 수 있죠. 그런데 이 임시 저장 공간은 용량이 한정되어 있습니다. 그래서 AI는 자주 쓰는 정보만 남기고 나머지를 압축합니다. 이런 압축 문제는 대화가 길어질수록 더 자주 나타납니다.
그런데 압축 과정이 단순해서, 나중에 꼭 필요한 정보까지 버려질 때가 있습니다. 대표적인 경우가 두 가지 사실을 조합해야 답이 나오는 질문입니다. 예를 들어 "민수는 서울에 산다"는 남고 "서울의 시장은 누구지?"라는 문장이 지워지면, AI는 답을 만들 재료가 없습니다. 그런데도 그럴듯한 답을 지어내는 것이 문제입니다.
AI에게 '모르겠다' 가르치기
연구진은 이런 문제를 해결하기 위해 AI 내부의 압축 과정을 직접 관찰하도록 학습시켰습니다. 압축 후에 어떤 단어가 남았는지, 그리고 답을 담고 있는 문장이 남아 있는지를 일일이 표시해 준 것입니다.
표시에 따라 AI는 답의 근거가 남아 있으면 답하고, 근거가 사라졌으면 '모른다'고 말하도록 훈련받았습니다. 학습에는 두 가지 사실을 조합해서 풀어야 하는 2,600여 개의 질문이 사용되었습니다. 그리고 전체 모델 크기의 1%도 안 되는 작은 조종 장치 하나를 붙였습니다.
그 결과, 일부러 앞부분만 남기고 나머지를 잘라내는 극단적인 압축 상황에서 모델의 환각이 97%나 줄었습니다. 반대로 답의 근거가 그대로 있는 질문에서는 정확도를 잃지 않았습니다. 압축이 일어난 뒤에도 AI가 아는 것과 모르는 것을 스스로 구분하도록 만들었다는 점이 핵심입니다. 이 방식은 압축과 거절을 함께 고려한 첫 시도입니다.
단순한 지시보다 효과적인 이유
혹시 "모르면 솔직히 말하세요"라고 문장으로 지시하면 되지 않을까요? 연구진도 같은 실험을 했습니. 그런데 그런 지시는 모델을 지나치게 소심하게 만들어, 답을 확실히 알고 있는 질문에도 '모르겠다'고 답하는 문제가 생겼습니다.
이번처럼 압축 상태를 실제로 들여다보고 배우면, 거절해야 할 순간과 답해야 할 순간을 정확히 구분할 수 있습니다. 이는 AI가 스스로 판단 기준을 배운다는 점에서 기존 방식보다 훨씬 정밀합니다.
우리 일상에는 어떤 의미일까
AI가 모르는 것을 솔직히 인정하면, AI에 대한 신뢰가 높아집니다. 예를 들어 길을 물어보는 AI 비서가 확신이 없을 때 엉뚱한 길을 안내해 주는 것보다, "길을 찾지 못했으니 다시 찾아보겠다"고 말해 주는 편이 훨씬 안전하죠.
이 연구는 AI가 자신이 처리할 수 있는 정보와 그렇지 않은 정보를 구분하고, 정직하게 반응하도록 만드는 방향의 중요한 걸음입니다. 앞으로 AI가 실수를 줄이고 사람과 더 믿을 만하게 소통하는 데 도움을 줄 수 있습니다. 사용자도 AI가 모른다고 말할 때 다시 질문하거나 정보를 보충해 줄 수 있습니다.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.