AI 학습용 데이터의 ‘개방’을 넘어 ‘순환’으로… 서울대 수요조사가 던지는 대학 에듀테크의 전환점
과학기술정보통신부가 대학이 보유한 인공지능 학습용 데이터를 국가 차원의 통합 제공 시스템에 등록·제공하도록 하는 수요조사에 착수했다. 단순한 데이터 공유 요청처럼 보이지만, 이번 조사는 국내 대학 에듀테크 생태계의
me.snu.ac.kr 보도 | 1 day ago AI 학습용 데이터의 ‘개방’을 넘어 ‘순환’으로… 서울대 수요조사가 던지는 대학 에듀테크의 전환점
과학기술정보통신부가 대학이 보유한 인공지능 학습용 데이터를 국가 차원의 통합 제공 시스템에 등록·제공하도록 하는 수요조사에 착수했다. 단순한 데이터 공유 요청처럼 보이지만, 이번 조사는 국내 대학 에듀테크 생태계의 데이터 주권과 산업적 활용 가치를 가늠하는 중대한 분기점이 될 전망이다. 서울대학교를 통해 공지된 이번 사업은 대학이 쌓아온 교육·연구 데이터가 국가 인프라로 편입되는 첫 공식적인 통로가 될 수 있다는 점에서 주목된다.
과기정통부가 추진하는 인공지능 학습용데이터 통합제공시스템은 공공·민간 및 대학 등이 보유한 데이터의 활용가치를 높이고, 다양한 연구·산업 현장에서 폭넓게 활용될 수 있도록 지원하는 국가 차원의 데이터 인프라 사업이다. 이번 수요조사의 핵심은 대학이 보유한 AI 학습용 데이터를 시스템에 등록할 때 필요한 품질 지원, 가공, 표준화 작업에 대한 대학 측의 수요를 파악하는 데 있다. 즉, 단순히 데이터를 ‘모으는’ 단계를 넘어, 대학이 가진 원천 데이터를 AI 모델 학습에 적합한 고품질 데이터로 승격시키는 전 과정을 국가가 지원하겠다는 의지의 표현이다.
이번 조사가 에듀테크 업계에서 특히 주목받는 이유는 대학 데이터의 특수성 때문이다. 대학은 강의 영상, 학술 논문, 실험·실습 데이터, 도서관 이용 기록, 온라인 교육 플랫폼(LMS) 로그 데이터, 연구 노트 등 기업이나 공공기관에서는 확보하기 어려운 고유한 데이터를 대량으로 보유하고 있다. 특히 한국어 기반의 학술 텍스트, 이공계 실험 데이터, 의학·바이오 분야의 임상 교육 자료 등은 글로벌 AI 기업들이 쉽게 접근하지 못하는 ‘한국형 특화 데이터’라는 점에서 전략적 가치가 크다.
그러나 대학 데이터의 활용에는 오랜 기간 구조적 장벽이 존재해 왔다. 개인정보보호법상의 민감 정보 처리 문제, 연구 윤리와 저작권 문제, 데이터 표준화의 부재, 그리고 무엇보다 데이터를 정제·가공할 전문 인력과 예산의 부족이 주요 걸림돌로 작용해 왔다. 실제로 국내 주요 대학들은 수년간 LMS와 학사 행정 시스템을 통해 방대한 교육 데이터를 축적해 왔지만, 이를 AI 학습용으로 재가공하거나 외부에 개방한 사례는 극히 드물었다. 데이터의 ‘양’은 충분하지만 ‘질’과 ‘접근성’에서 한계에 봉착해 있었던 것이다.
이번 수요조사가 시사하는 바는 정부가 이러한 대학 데이터의 잠재력을 인식하고, 데이터 보유 기관인 대학과 수요 기관인 AI 산업계 사이의 간극을 국가가 직접 메우겠다는 전략적 판단을 내렸다는 점이다. 과기정통부의 통합제공시스템이 실제로 가동되면 대학은 데이터 제공자로서의 역할을 넘어, AI 학습용 데이터 시장의 핵심 공급자로 부상할 가능성이 크다. 이는 대학이 교육 서비스의 소비자이자 생산자로서 새로운 수익 모델을 창출할 수 있는 기회이기도 하다.
다만, 이 과정에서 해결해야 할 과제도 적지 않다. 첫째는 데이터 제공의 ‘자발성’ 문제다. 수요조사라는 명칭과 달리, 정부 주도 사업에 대학이 참여하지 않을 경우 향후 국가 연구개발 사업 평가나 정부 재정 지원에서 불이익을 받을 수 있다는 우려가 업계 내에서 제기된다. 둘째는 데이터 제공 이후의 관리 주체와 수익 배분 구조의 모호성이다. 대학이 제공한 데이터가 민간 기업의 상업적 AI 모델 개발에 활용될 경우, 그에 대한 적절한 보상 체계가 마련되어야 한다는 지적이다. 셋째는 데이터 품질 기준의 문제다. 교육 데이터는 단순히 정확성만으로 평가할 수 없는 영역이 많다. 교수법의 효과성, 학습자의 인지 과정, 교육적 맥락 등 정성적 요소가 포함된 데이터를 어떻게 표준화하고 품질을 평가할 것인지에 대한 세밀한 기준이 필요하다.
에듀테크 산업의 관점에서 이번 사업은 중장기적으로 교육 AI 모델의 고도화를 촉진하는 촉매제가 될 전망이다. 현재 국내 에듀테크 기업들이 개발하는 AI 튜터, 적응형 학습 시스템, 자동 채점·평가 도구 등은 대부분 제한된 규모의 사설 데이터에 의존하고 있다. 대학이 보유한 방대한 학습 데이터가 국가 시스템을 통해 개방된다면, 에듀테크 기업들은 보다 정교하고 한국 교육 환경에 최적화된 AI 모델을 개발할 수 있게 된다. 특히 한국어 처리 기술, 수학·과학 문항의 자동 생성 및 평가 기술, 학습자 행동 패턴 분석 기술 등은 대학 데이터의 유입을 통해 비약적인 발전이 가능할 것으로 기대된다.
이번 수요조사는 단순한 행정적 절차 이상의 의미를 지닌다. 그것은 한국 교육 데이터가 국가 디지털 인프라의 핵심 자산으로 재탄생하는 과정의 서막이며, 대학이 교육 기관에서 ‘데이터 경제의 허브’로 그 역할을 확장하는 전환점이 될 수 있다. 정부가 제시한 데이터 통합 제공의 틀 안에서 대학의 자율성과 데이터 주권이 어떻게 보호되고, 산업계의 혁신 수요가 어떻게 충족될지 그 균형점을 찾는 것이 향후 과제로 남는다. AI 시대의 경쟁력은 결국 데이터의 확보와 활용 능력에 달려 있다는 점을 고려할 때, 이번 사업의 향후 전개 과정은 국내 에듀테크 생태계의 미래를 좌우할 중요한 시금석이 될 것이다.