의료 AI는 정답은 잘 맞힙니다. 문제는 임상 추론입니다

의료 AI 평가, 시험을 잘 보는 것과 진료를 잘하는 것
의료 AI 성능을 이야기할 때 가장 자주 등장하는 숫자는 시험 점수입니다. 의사 국가시험 몇 점, 수의사 국가시험 몇 점. 저희도 오픈소스로 공개한 VetJarvis-4B가 일본 수의사 국가시험에서 81.67%를 받았다는 내용을 여러 자리에서 소개했습니다.
하지만 시험 성적과 실제 임상 추론 능력은 같은 개념이 아닙니다.
시험은 다섯 개 보기 중에서 답을 고르는 일이고, 진료는 주어진 정보에서 가능한 원인을 검토하고, 최선의 치료 계획을 만들어가는 과정입니다.
“3살 말티즈, 이틀째 구토, 식욕 없음.”
여기서 시작할 때 임상의의 머릿속에 떠오르는 것은 정답 하나가 아니라 의심 목록입니다. 이물일 수도, 췌장염일 수도, 신부전일 수도 있습니다. 어제 보호자가 준 간식이 원인일 가능성도 있습니다.
이 감별진단 목록을 얼마나 적절하게 펼치느냐가 다음 검사를 결정합니다.
지난 4월 JAMA Network Open에 실린 연구는 바로 이 질문을 다뤘습니다.
의료 LLM이 시험 문제의 정답을 잘 맞히는 것은 알겠는데, 진료의 전체 과정도 잘 따라올 수 있을까요?
21개 AI 에 29개 의료 케이스를 질문하고 처음부터 끝까지 평가했습니다.
하버드 의대와 매스제너럴브리검 연구팀은 GPT, Claude, Gemini, DeepSeek, Grok 등 21개 AI 모델에 29개의 임상 질문을 던졌습니다.
모든 정보를 한 번에 제공하지 않았습니다. 실제 진료 순서에 맞춰 병력을 주고 “무엇을 의심하겠는가”라고 물었습니다. 이어 검사 결과를 제공하고 “다음에 무엇을 하겠는가”라고 질문했습니다. 이런 방식으로 최종진단과 치료 계획까지 평가했습니다.
의대생 평가자들은 총 16,254개의 답변을 채점했습니다.
평가 항목은 다섯 가지였습니다.
감별진단 — 무엇을 의심할 것인가
진단검사 — 무엇을 확인할 것인가
최종진단 — 결국 무엇인가
치료·관리 — 어떻게 할 것인가
그 외 임상 판단
AI는 최종진단보다 감별진단에 약했습니다
숫자 하나만 기억한다면 이것입니다.
최종진단 문항의 실패율은 40% 미만이었습니다.
반면 감별진단 문항의 실패율은 80%를 넘었습니다.
대부분의 모델에서 비슷한 패턴이 나타났습니다. 충분한 정보를 받은 뒤 “이 질환은 무엇인가”라고 물으면 비교적 잘 맞혔습니다. 하지만 정보가 부족한 초기 단계에서 “무엇을 의심해야 하는가”라고 물으면 성능이 크게 떨어졌습니다.
사람 임상의는 불확실한 상황에서 여러 가능성을 열어둔 채 판단을 이어갑니다. 반면 이 평가에서 AI는 하나의 가능성으로 빠르게 좁혀가는 경향을 보였습니다. 그럴듯한 답 하나를 제시하고 다른 가능성을 충분히 유지하지 못한 것입니다.
몇 가지 결과를 더 살펴보겠습니다.
전체 정확도만 보면 21개 모델은 81~90% 범위에 모여 있었습니다. 하지만 다섯 평가 항목을 종합한 면적 지표에서는 0.64에서 0.78까지 차이가 벌어졌습니다. 평균 점수 하나만으로는 모델별 약점을 확인하기 어렵다는 뜻입니다.
회사별로 모델을 묶어 비교했을 때는 통계적으로 유의한 차이가 나타나지 않았습니다. 특정 회사의 모델이 의료 전반에서 더 우수하다고 결론 내릴 근거는 확인되지 않았습니다.
추론 특화 모델은 상대적으로 나은 결과를 보였습니다. 다만 감별진단 성능이 취약하다는 전체적인 패턴은 남아 있었습니다.
모델 가운데 영상 정보(이미지) 추가 후 유의미한 성능 향상을 보인 모델은 7개였습니다. 이미지를 처리할 수 있는 18개 모델 중 영상 입력을 지원한다는 사실만으로 임상 추론 성능이 일관되게 향상되지는 않았습니다.
연구팀은 현재의 범용 AI가 의료진의 감독 없이 독립적으로 환자를 평가할 수준은 아니라고 결론 내렸습니다.

연구 결과를 해석할 때 확인해야 할 두 가지 조건
논문의 결과를 그대로 받아들이기 전에 두 가지 조건을 확인해야 합니다.
첫째, 채점 방식이 감별진단에 불리하게 작용했을 가능성이 있습니다.
평가는 “해당하는 것을 모두 고르시오”와 유사한 방식이었습니다. 정답을 모두 선택하고 오답을 하나도 고르지 않아야 점수를 받을 수 있었습니다.
하지만 감별진단은 원래 여러 가능성을 폭넓게 검토하는 작업입니다. 목록을 넓힐수록 평가 기준상 오답이 포함될 가능성도 커집니다.
따라서 80%가 넘는 실패율에는 AI가 가능성을 충분히 유지하지 못한 문제와 함께, 넓은 답변에 불리한 채점 구조의 영향이 섞여 있을 수 있습니다.
둘째, 이 연구는 외부 도구를 사용하지 않는 AI만 평가했습니다.
연구팀은 자료 검색, 가이드라인 참조, 계산기와 같은 도구를 모델에 제공하지 않았다고 밝혔습니다. 따라서 이번 결과는 도구와 임상 시스템을 결합했을 때 도달할 수 있는 최대 성능이 아니라, 범용 모델 자체의 출발점에 가깝습니다.
실제 임상 의사결정 지원에서는 모델 단독 성능뿐 아니라 검색, 가이드라인, 계산 도구, 의료진 검토가 결합된 전체 Clinical Workflow를 함께 평가해야 합니다.
수의 의료 AI에서 감별진단이 더 중요한 이유
[동물 환자는 자신의 증상을 직접 설명하지 못합니다.]
병력의 상당 부분도 보호자의 관찰과 설명을 거쳐 전달됩니다. 처음 주어지는 정보가 불완전할수록 여러 가능성을 열어두는 능력이 중요해집니다.
[모든 검사를 시행할 수도 없습니다.]
보험 보급률이 낮은 국내 수의 진료 환경에서 진단을 위한 검사 순서와 비용의 문제이기도 합니다. 어떤 질환을 우선 의심하느냐가 결국 “다음 검사 한 건”의 선택을 결정합니다.
[품종과 나이도 판단을 바꿉니다.]
같은 증상이라도 견종과 연령에 따라 감별진단의 우선순위가 달라집니다. 이를 반영하지 못한다면 목록이 그럴듯해 보여도 실제 임상에서는 활용하기 어렵습니다.
이 논문의 핵심 교훈은 단순히 “AI가 아직 부족하다”는 것이 아닙니다. 평균 정확도 하나만으로는 의료 AI가 임상 추론 과정의 어느 지점에서 위험해지는지 알 수 없다는 것입니다.
시험 점수를 제시하는 것은 어렵지 않습니다. 더 어려운 일은 시스템이 어떤 상황에서, 어떤 방식으로, 얼마나 자주 틀리는지를 구체적인 지표로 공개하는 것입니다.
Veterinary AI도 마찬가지입니다. 수의사를 대신해 진단하는 시스템이 아니라, 감별진단과 검사 선택을 포함한 임상 의사결정을 안전하게 지원하는지를 평가해야 합니다.
저희도 그 평가가 필요하다고 생각합니다.
참고 문헌 Rao AS, Esmail KP, et al. Large Language Model Performance and Clinical Reasoning Tasks. JAMA Network Open. 2026;9(4):e264003.






댓글