AI, 비즈니스 사례 문제도 해결할까?

요즘 인공지능(AI)이 각종 시험에서 사람보다 높은 점수를 받고 있다는 뉴스, 많이 보셨죠? 그런데 막상 직장에서 실제 업무를 시키면 어떨까요? 이 논문은 AI가 경영대학원(MBA) 수업에서 다루는 실제 비즈니스 사례를 얼마나 잘 풀 수 있는지 측정하는 새로운 시험을 만들었습니다.

지금까지 AI의 능력을 평가하는 시험들은 주로 암기력, 간단한 질문 답변, 수학 문제 풀이, 코딩 같은 영역에 집중되어 있었습니다. 하지만 사무직 전문가들이 실제로 하는 일, 예를 들어 복잡한 정보를 종합해서 결론을 내리거나, 불확실한 상황에서 판단을 내리고, 여러 이해 관계자(회사, 고객, 정부 등) 사이에서 전략적으로 생각해야 하는 일은 거의 평가되지 않았습니다. 이 연구는 바로 그 빈 곳을 채우려고 시작되었습니다.

MBA 수업 방식을 AI 평가에 도입하다

연구진은 세계적인 경영대학원들이 가르칠 때 쓰는 ‘사례 연구법(case method, 실제 기업 상황을 글로 제시하고 토론하는 방식)’에서 아이디어를 얻었습니다. 이 방법은 학생들에게 실제 회사가 겪은 어려움을 주고, 제한된 정보 속에서 최선의 결정을 내리도록 훈련합니다. 연구진은 경영학의 8개 분야(마케팅, 재무, 전략 등)에서 수백 개의 사례 문제를 모아 ‘BusinessCaseBench(비즈니스 사례 평가 기준)’이라는 데이터베이스를 만들었습니다. 그리고 최신 AI 모델들에게 이 문제들을 풀게 했습니다.

AI의 예상 밖 강점과 뚜렷한 한계

결과는 흥미로웠습니다. AI는 마케팅이나 회계처럼 명확한 규칙이 있는 분야에서는 상당한 능력을 보여주었습니다. 예를 들어 재무제표를 분석하거나, 고객 데이터를 바탕으로 광고 예산을 배분하는 문제는 잘 풀었습니다. 하지만 불확실성이 크고 여러 사람의 입장을 고려해야 하는 전략(戰略, 장기적인 큰 그림)이나 윤리(倫理, 옳고 그름 판단) 관련 문제에서는 훨씬 더 낮은 점수를 받았습니다. 특히 정보가 부족할 때 ‘추측해서 채우는’ 능력이나, 상대방의 움직임을 예측하는 ‘전략적 사고’는 여전히 취약했습니다.

이 연구가 의미하는 바는, 앞으로 AI가 단순 시험 점수뿐만 아니라 실제 업무 현장에서도 유용한 도구가 되기 위해서는 아직 개선해야 할 부분이 많다는 점입니다. 특히 경영자나 정책 입안자들이 AI를 도입할 때, AI가 잘하는 일(정형화된 분석)과 못하는 일(직관이나 타협이 필요한 판단)을 정확히 이해하는 것이 중요합니다. 교육 분야에서도 이 평가 기준은 학생과 AI의 협업 능력을 키우는 새로운 교육 과정 개발에 도움을 줄 수 있습니다.

📖 원문 보기: arXiv 원문

본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.