시끄러운 교실 속 목소리 구별하는 AI, 오류율 24% 줄여

교실처럼 시끄러운 곳에서도 누가 말하는지 정확히 구별하는 AI 기술이 있다. 이번 연구는 그 기술을 실제 교실 소음에 맞게 훈련시키는 방법을 다뤘다.

왜 교실 목소리 인식은 어려운가

요즘 학교에서는 온라인 수업과 AI 튜터가 점점 더 많이 쓰인다. AI가 학생을 돕기 위해서는 말하는 사람이 누구인지 정확히 알아야 한다. 예를 들어 AI가 "지금 발표한 사람이 누구?"라고 맞혀야 하는 상황이 많다. 또 아이의 목소리와 선생님의 목소리를 구분해야 과제를 나눠 줄 수도 있다. 그런데 교실은 결코 조용한 곳이 아니다. 친구들이 웅성거리는 소리, 의자 끄는 소리, 발소리, 때로는 큰 웃음소리까지 녹음에 섞인다. 이런 배경 소음 때문에 목소리 인식 오류가 자주 생긴다. 특히 아이들의 목소리는 어른과 높낮이가 달라서 더 어렵다. 배경 소음을 지우는 기술은 이미 있지만, 실제 사람들의 목소리 특징을 해치지 않으면서 소음을 지우는 것은 어렵다. 이 연구는 바로 그런 현실적인 문제를 풀기 위해 시작됐다.

실제 수업 녹음으로 훈련하다

연구진은 실제 영어 수업에서 녹음된 소리 데이터를 사용했다. 문제는 대부분의 녹음에 말하는 사람의 정보가 없었다는 것이다. 정답 없는 데이터로 학습하는 기법을 '자기지도 학습'이라고 한다. AI가 소리에서 스스로 규칙을 찾아내는 방식이다. 연구진은 이 '자기지도 학습'과, 그다음에 정답이 있는 소량의 데이터로 다듬는 '두 단계 방식'을 비교했다. 두 단계 방식은 기본기를 먼저 익힌 뒤 작은 정답 데이터로 마지막 조정을 하는 훈련법이다. 먼저 많은 정답 없는 데이터로 기본적인 소리 패턴을 익힌 다음, 적은 정답 데이터로 세부 특징을 다듬는 것이다. 마치 운동을 처음 배울 때 기본 자세를 먼저 배우고, 그다음에 코치의 교정을 받는 것과 비슷하다. 그 결과 두 단계 방식이 훨씬 안정적이고 정확했다.

결과: 오류율이 크게 줄었다

성능 측정에는 '오류율'이라는 지표를 썼다. 오류율은 말하는 사람을 잘못 맞힌 비율이다. 이 숫자가 낮을수록 정확한 모델이다. 연구진이 만든 새 모델은 기존에 널리 쓰이던 음성 모델보다 오류율이 23.99% 줄었다. 같은 모델을 교실 데이터로 미리 훈련시킨 경우와 비교해도 6.32% 줄었다. 그리고 두 단계 방식은 자기지도 학습만 쓴 경우보다 13.39% 더 좋은 성능을 보였다. 연구진은 다섯 번의 교차 검증으로 이 결과가 안정적이라고 확인했다. 교차 검증은 데이터를 다섯 덩어리로 나눠 번갈아 가며 실험하는 방법이다. 여러 번 반복해서 시험했으므로 한 번의 실험으로 내린 결론보다 믿을 수 있다.

이 연구가 우리 삶에 주는 의미

이 연구가 의미하는 바는 실제 교실에서 사용할 수 있는 AI 음성 인식 기술이 한 걸음 더 가까워졌다는 것이다. 시끄러운 환경에서도 AI가 말하는 사람을 잘 구별한다면, 선생님은 학생들의 말하기 연습을 자동으로 기록하고 평가할 수 있다. AI 튜터가 "지금 누가 말했는지"를 정확히 알면 학생에게 맞춤형 피드백도 줄 수 있다. 예를 들어 발표에 서툰 학생을 수업에서 발표할 때 격려하는 알림을 보낼 수도 있다. 또한 스마트 스피커가 교실에서 여러 학생의 목소리를 구별하는 데도 응용될 수 있다. 아이들이 영어 말하기 연습을 할 때 AI가 발음을 분석해 주는 것이다. 아직 해결해야 할 과제는 남아 있지만, 이번 연구는 교육용 인공지능이 복잡한 현실 교실로 다가서는 데 중요한 발판을 마련했다.

📖 원문 보기: arXiv 원문

본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.