AI 검색, 이제 문서 세트로 찾는다

여러 문서를 한꺼번에 꿰뚫어야 정답이 보이는 질문들이 있습니다. 기존 AI 검색 방식은 문서 하나하나만 따로 보지만, 이 연구는 문서들의 '조합'을 평가하는 새로운 방법을 제시했습니다.

예를 들어 "베를린 장벽이 무너질 당시 미국 대통령은 누구였나요?" 같은 질문을 생각해보세요. 답을 찾으려면 '베를린 장벽 붕괴'와 '미국 대통령'이라는 두 가지 정보를 연결해야 합니다. 이런 질문을 연구에서는 '멀티홉'이라고 부르는데, 여러 단계를 건너뛰며 정보를 모아야 하기 때문입니다. 문제는 기존 AI 검색 시스템이 각 문서를 혼자 평가할 뿐, 문서들끼리 서로 얼마나 잘 맞는지는 전혀 고려하지 않는다는 점입니다. 그래서 중요한 정보가 여러 문서에 흩어져 있으면 놓치기 쉽습니다.

최근에는 큰 언어 모델을 이용해 문서 조합을 직접 평가하는 방법도 나왔지만, 이 방식은 컴퓨터 연산 비용이 너무 많이 들어 실제 서비스에 쓰기 어려웠습니다. 서울대학교 연구진은 이 문제를 해결하기 위해 '세트 수준 검색'이라는 새로운 틀을 만들었습니다. AI가 문서 하나하나의 점수가 아니라, 여러 문서로 이뤄진 묶음이 질문에 얼마나 잘 맞는지 한 번에 평가하도록 훈련시킨 것입니다. 훈련 과정에서 AI는 완전하고 잘 짜인 증거 묶음은 높은 점수를, 빠진 내용이 있거나 서로 맞지 않는 묶음은 낮은 점수를 주는 법을 배웁니다. 이렇게 하면 문서 개수가 달라지거나 일부 정보가 없어도 제대로 작동합니다.

두 가지 보완적인 방법

연구진은 이 틀을 실제로 구현하기 위해 두 가지 방법을 함께 사용했습니다. 첫 번째는 '파라셋'이라는 가벼운 평가자입니다. 각 문서를 미리 숫자로 변환해 저장해두고, 질문이 들어오면 문서들을 서로 비교하는 '자기 주의' 과정을 거쳐 한꺼번에 점수를 매깁니다. 미리 계산해둔 값을 쓰기 때문에 속도가 빠릅니다. 두 번째는 '시크셋'이라는 순차적 평가자입니다. 이미 찾은 문서들을 바탕으로 다음에 어떤 문서가 더 필요한지 단계적으로 판단합니다. 이 두 방법을 함께 쓰면 속도와 정확도를 모두 잡을 수 있습니다.

이 연구가 의미하는 바는 무엇일까요? AI 검색이 단순히 '가장 관련 있는 문서 하나'를 찾는 데서 나아가, '문제를 푸는 데 꼭 필요한 문서 세트'를 통째로 찾아낼 수 있게 되었다는 점입니다. 우리가 자주 쓰는 검색 포털이나 AI 비서가 복잡한 질문에도 더 정확한 답변을 줄 수 있는 길이 열린 것입니다. 또한 훈련 방식이 효율적이어서 실제 서비스에 적용하기에도 부담이 적습니다. 앞으로 학교 과제나 업무에서 여러 자료를 조합해야 할 때, AI가 알아서 알맞은 문서들을 골라주는 시대가 더 가까워졌습니다.

📖 원문 보기: arXiv 원문

본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.