AI 선생님, 교과서를 재조립해 가르치다

AI가 방대한 문서를 읽고 질문과 답변을 스스로 만들어내는 기술이 등장했습니다. 이 기술은 마치 선생님이 여러 교과서를 찢어서 새로운 문제집을 만드는 것과 같습니다.

AI를 특정 분야에서 똑똑하게 만들려면 그 분야의 질문과 답변을 많이 가르쳐야 합니다. 그런데 사람이 직접 질문과 답변을 만들려면 시간과 돈이 엄청나게 듭니다. 예를 들어, 의학 AI를 키우려면 의사들이 수천 개의 질문과 답변을 손수 작성해야 합니다. 연구진은 이 문제를 해결하기 위해 'EmbGen'이라는 새로운 방법을 만들었습니다. 이 방법은 큰 AI 선생님(선생님 역할을 하는 대형 언어 모델)이 문서를 읽고 스스로 질문과 답변을 만들어내도록 합니다.

문서를 쪼개고 다시 조립하는 기술

EmbGen은 먼저 문서를 '개체'와 '설명'으로 나눕니다. '개체'란 예를 들어 '코로나19 바이러스' 같은 중요한 대상이고, '설명'은 '호흡기를 통해 전염된다' 같은 정보입니다. 그 다음, 비슷한 의미를 가진 개체와 설명끼리 묶습니다. 이때 '임베딩 유사도'라는 기술을 씁니다. 임베딩이란 단어나 문장을 숫자로 바꾸는 기술로, 비슷한 뜻을 가진 것끼리 가까이 모이게 합니다. 이렇게 묶인 그룹 안에서 질문과 답변을 만들어내는데, 가까운 것끼리, 그룹 안에서, 그룹 사이에서 다양하게 뽑아냅니다. 이렇게 하면 단순히 문서를 복사하는 게 아니라, 여러 문서의 정보를 조합해 새로운 질문을 만들 수 있습니다.

기존 방법보다 뛰어난 성능

연구진은 EmbGen을 기존 방법인 EntiGraph, InstructLab, Knowledge-Instruct와 비교했습니다. 세 가지 다른 종류의 데이터셋을 사용했는데, 하나는 위키백과처럼 다양한 주제를 다루고, 다른 하나는 특정 분야에 집중된 문서들입니다. 실험 결과, EmbGen은 더 다양하고 정확한 질문과 답변을 만들어냈습니다. 특히 서로 다른 문서에 흩어져 있는 정보를 연결하는 능력이 뛰어났습니다. 예를 들어, 한 문서에는 '아이슬란드는 화산이 많다'고 쓰여 있고, 다른 문서에는 '화산 폭발이 기후에 영향을 준다'고 쓰여 있다면, EmbGen은 '아이슬란드의 화산이 기후에 어떻게 영향을 줄까?'라는 질문을 만들어낼 수 있습니다.

이 연구가 의미하는 바는, 앞으로 AI를 특정 분야에 맞게 키우는 비용이 크게 줄어들 수 있다는 점입니다. 학교나 병원, 법률 사무소 등에서 자신만의 AI 비서를 만들 때, 값비싼 데이터 수집 없이도 문서만 있으면 훌륭한 AI를 만들 수 있습니다. 예를 들어, 한 학교가 자체 교과서만으로 수학 문제를 만들어내는 AI 튜터를 개발할 수 있습니다. 이 기술은 AI 교육의 민주화를 앞당길 것입니다.

📖 원문 보기: arXiv 원문

본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.