AI, 로스쿨 시험에 도전하다

AI가 법률 시험을 풀 수 있을까? 독일 연구팀이 만든 BenGER 데이터셋은 AI의 법적 추론 능력을 평가하는 새로운 기준을 제시합니다.

왜 이 연구가 중요할까?

변호사가 되려면 법을 배우고, 실제 사례에 법 조문을 적용하는 능력을 길러야 합니다. 이 과정을 '법적 추론'이라고 하는데, AI도 이런 능력을 가질 수 있을까요? 연구팀은 대형 언어 모델(LLM)이 독일 법률 문제를 얼마나 잘 푸는지 테스트하기 위해 BenGER 데이터셋을 만들었습니다. 이 데이터셋은 실제 로스쿨 시험 문제 596개와 법률 이론 문제 531개로 구성되어 있습니다.

연구진이 발견한 것은?

연구진은 12개의 최신 AI 모델을 테스트했습니다. 유료 모델, 효율성 중심 모델, 오픈소스 모델이 모두 포함되었습니다. AI의 답변을 사람이 만든 답변과 비교했는데, 사람이 혼자 쓴 답변, 사람과 AI가 함께 작성한 답변도 함께 비교했습니다. 평가는 사람 평가자와 AI 평가자를 모두 사용했습니다. AI 평가자는 미리 정한 기준(루브릭)에 따라 점수를 매겼습니다.

놀라운 점은 AI 평가자를 사람 평가자 대신 사용해도 전체 평가 결과가 크게 달라지지 않았다는 것입니다. 이는 AI가 사람의 평가를 대신할 수 있는 가능성을 보여줍니다. 하지만 아직 AI 변호사가 현장에 나올 수준은 아닙니다.

일상생활에 어떤 의미가 있을까?

이 연구는 AI가 단순히 텍스트를 요약하는 수준을 넘어 전문적인 추론을 할 수 있는지 평가하는 데 의의가 있습니다. 법률 교육에서 AI 튜터로 활용되거나, 변호사가 사건을 분석할 때 보조 도구로 쓰일 가능성이 있습니다. 예를 들어, 법률 문서 초안을 검토하거나 유사 판례를 찾는 데 도움을 줄 수 있습니다.

또한 AI 평가 시스템이 발전하면 법률 시험 채점의 효율성과 공정성을 높일 수 있습니다. 다만 AI의 판단을 완전히 신뢰하기에는 아직 한계가 있으므로 사람의 감독이 필요합니다.

📖 원문 보기: arXiv 원문

본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.