AI 의사 평가, 인간과 얼마나 같을까?
의료 현장에서 AI가 점점 더 많이 쓰이고 있어요. 그런데 AI가 내놓는 진료 기록이나 진단 제안이 제대로 됐는지 평가하는 건 사람에게도 어려운 일입니다. 이 논문은 그 평가를 또 다른 AI에게 맡겼을 때 과연 믿을 만한지 체계적으로 살펴본 첫 연구입니다.
병원에서 AI가 환자 증상을 듣고 진단을 돕거나, 약을 추천하고, 의대생을 가르치는 시대가 다가오고 있습니다. 그런데 이런 AI가 내놓은 결과물이 정확한지 확인하려면 사람 전문가가 일일이 검토해야 합니다. 시간과 비용이 너무 많이 들죠. 그래서 최근에는 AI를 평가자로 쓰는 'LLM-as-a-Judge' 방식이 떠오르고 있습니다. 풀어 말하면, 하나의 AI가 다른 AI의 답변을 미리 정해둔 기준에 따라 채점하는 방법입니다. 하지만 의료 분야에서 이 방식이 실제로 통하는지, 사람과 얼마나 비슷한 판단을 내리는지 체계적으로 확인한 연구는 없었습니다.
연구진은 2023년 1월부터 2026년 2월까지 전 세계에서 발표된 관련 논문 541건을 검토하고, 그중 엄격한 기준을 통과한 134편을 골라 분석했습니다. 이 논문들은 크게 네 가지 의료 상황을 다루고 있습니다. 첫째는 진료 기록을 자동으로 요약하는 것, 둘째는 환자 증상을 보고 병명을 추정하는 진단 보조, 셋째는 약을 추천하는 것, 넷째는 의대생 교육입니다. 모든 경우에서 AI 평가자가 사람 평가자와 얼마나 일치하는지 비교했습니다.
결과는 분야마다 달랐습니다. 예를 들어 진료 기록 요약이나 간단한 질문 답변에서는 AI 평가자가 사람과 80% 이상 일치하는 경우도 있었습니다. 하지만 복잡한 임상 판단, 이를테면 암 진단이나 응급 상황 판단에서는 일치율이 크게 떨어졌습니다. 특히 AI 평가자는 사람이 가진 미묘한 맥락 이해나 환자 개인별 상황을 잘 반영하지 못했습니다. 연구진은 "AI 평가가 비용을 줄이고 속도를 높일 수는 있지만, 아직은 의료 영역에서 완전히 신뢰하기 어렵다"고 결론 내렸습니다.
이 연구가 우리에게 주는 교훈
의료 AI를 실제로 쓸 때, AI 평가자만 믿고 중요한 결정을 내려서는 안 된다는 점입니다. AI 평가는 빠르고 값싸지만, 생명과 직결된 의료 현장에서는 반드시 사람이 최종 검토를 해야 합니다. 앞으로 연구자들은 AI 평가자가 사람처럼 맥락을 이해하고 다양한 환자 사례를 고려하도록 개선하는 작업이 필요합니다. 이 연구는 그 첫걸음이 될 것입니다.
📖 원문 보기: arXiv 원문
본 요약은 AI로 작성되었습니다. arXiv 논문을 바탕으로 재구성되었습니다.