top of page
추상 디지털 메시

의료 AI 에이전트의 지도가 그려지고 있다.

5월 26일
3분 분량

왜 "에이전트"라는 단어를 다시 정의하는가


2026년 AI와 관련하여 가장 많이 들은 단어는 아마도 "에이전트(Agent)"일 것입니다.


EBM 검색 도구, 환자 대면 음성 시스템, 임상추론 시스템도, 의료 스크라이빙도 모두 스스로를 "헬스케어 AI 에이전트"라고 설명하고 있습니다.


하지만 단순히 LLM에 의료 데이터를 연결한 시스템과, 임상 워크플로우 안에서 자율적으로 계획하고, 행동하고, 기억하는 시스템은 기술적으로도 임상적으로도 다른 범주에 해당합니다.


2026년 3월, 싱가포르 국립내(NUS), 뮌헨공대(TUM), 하버드 등 11개 기관 25명 연구진은 이러한 혼란을 정리하기 위한 서베이 논문 <<The Landscape of Medical Agents: A Survey>>를 발표했습니다.


의료 AI 에이전트의 가치는 벤치마크 점수가 아닌, 임상 워크플로우를 얼마나 잘 재구조화하는가로 평가되어야 한다.

이는 곧 "시험을 잘 보는 AI"와 "임상에서 실제로 작동하는 AI"는 다른 문제라는 것을 의미하기도 합니다.


코드


의료 AI 에이전트의 5가지 조건


논문은 의료시스템을 단순 AI 모델이 아니라 "에이전트"라고 부르기 위한 다섯가지 조건을 제시하고 있습니다.


  • 다중모달 및 종단 데이터 처리: 텍스트 뿐 아니라 의료 영상, 바이탈, 검사 결과, 장기추적 데이터 등 통합적으로 다룰 수 있어야 한다


  • 내부 상태와 메모리 유지: 단발성 응답이 아닌 이전 상호작용을 토대로 환자 상태를 기억할 수 있어야 한다.


  • 계획과 적응 능력: 상황에 따라 행동 순서를 조정하고 다음 단계를 계획할 수 있어야 한다.


  • 임상 시스템과의 상호작용: EMR, PACS, CDSS 등 실제 의료 인프라 안에서 거버넌스 제약을 준수하며 작동해야 한다.


  • 워크플로우 중시 구조: 단일 진단 모 델이 아니라, 실제 임상 워크플로우 안에서 의사결정을 지원하는 구조여야 한다.


의료 AI 에이전트의 3단계 발달 로드맵


LEVEL 1 - 워크플로우 기반

명시된 워크플로우와 규칙 기반 안전 제약이 유지되고, LLM은 사전 정의된 절차의 일부로 작동한다.

모든 단계를 통제하기 때문에안정성과 예측 가능성은 높지만 유연성은 제한적일 수 있다.


LEVEL 2 - 하이브리드

명시된 워크플로우와 규칙기반 안전임계치를 유지하면서 일부 로컬 계획과 결정을 에이전트에 위임하는 단계이다.

큰 구조는 인간이 설계하고, 그 안에서 AI가 제한적 자율성을 가지는 형태다.


LEVEL 3 - 에이전트

하나 이상의 모델이 중앙 통제를 가지며, 작업분해, 도구 선택, 메모리 활용, 계획, 행동, 반성 등 사이클을 반복 수행한다.

가장 유연한 구조이지만 의료에서는 안전성, 설명 가능성, 책임 등 위험성을 가질 수 있다.


AI

의료 AI 에이전트를 평가하는 6대 역량


  • Planning: 복잡한 임상 작업을 단계별로 분해하고 우선순위를 조정할 수 있는가.


  • Tool Use: EMR, 검색 시스템, 의료영상 시스템 등 외부 도구와 안전하게 상호작용할 수 있는가.


  • Memory :단기 대화 맥락뿐 아니라 장기 임상 경과와 환자 히스토리를 안정적으로 유지할 수 있는가.


  • Self-Improvement: 반복적 상호작용과 피드백을 통해 행동 전략을 갱신할 수 있는가.


  • Reasoning: 구조화된 추론 과정을 통해 할루시네이션을 줄이고 evidence-based reasoning을 수행할 수 있는가.


  • Perception: 텍스트뿐 아니라 의료영상, 병리, 바이탈, 음성 등 다중모달 데이를 통합적으로 해석할 수 있는가.


이 프레임워크의 핵심은 의료 AI를 단순 LLM 성능 경쟁이 아니라, 실제 임상 의사결정 수행 능력 관점으로 평가해야 한다는 점에 있습니다.


특히 Veterinary AI에서는 환자가 자신의 상태를 직접 설명할 수 없기 때문에, Perception·Memory·Reasoning의 중요성이 더욱 커진다.

평가 철학의 전환


논문이 던지는 마지막 화두는 평가 메트릭의 변화라고 생각합니다.


기존 의료 AI는 Accuracy, Sensitivity, Specificity 같은 정적 벤치마크 중심으로 평가되어 왔지만 의료 AI 에이전트는 임상 workflow 안에서 작동하는 시스템이기 때문에 workflow outcome(성과) 중심 평가가 필요하다는 것이 논문의 쟁점입니다.


즉 중요한 것은:


  • 진료 시간이 실제로 단축되는가

  • 진단 정확도가 개선되는가

  • 재방문율과 의료사고를 줄일 수 있는가

  • 임상의 cognitive burden를 낮출 수 있는가


같은 operational outcome 입니.다.


논문은 이를 위해 다섯 가지 횡단 과제를 제시합니다.


  • Safety: 환자 안전을 위협하지 않는가

  • Robustness: 환경 변화와 예외 상황에서도 안정적으로 작동하는가

  • Fairness: 특정 환자군이나 데이터 분포에 편향되지 않는가

  • Evaluation: 실제 임상 workflow에서 효과를 검증할 수 있는가

  • Governance: 추적 가능성(auditability)과 책임 구조를 확보할 수 있는가


이는 의료 AI를 단순 생성 모델이 아니라,

신뢰 가능한 Clinical Decision Support System(CDSS)으로 평가해야 한다는 의미로 해석할 수 있습니다.


춘옥컴퍼니가 바라보는 의료 AI Agent


춘옥컴퍼니는 의료 AI 에이전트를 "의사를 대체하는 시스템"으로 보지 않습니다.


특히 앞에서 언급되었듯이 의료 영역에서는 워크플로우 밖에서 독립적으로 판단하는 에이전트가 높은 위험성을 가질 수 있습니다.


수의학도 크게 다르지 않을 것으로 생각됩니다.


Veterinary AI는 환자가 자신의 증상을 직접적으로 설명하기 힘든 상황으로 데이터 불완전성이 높은 편이기 때문에, 보호자 진술, 신체검사, 혈액검사, 영상소견을 조합한 복합적 임상 추론이 필요합니다.


또한 할루시네이션이 단순 오류가 아닌 진단을 놓치는 치명적인 문제와 연결될 수 있어 AI Agent 설계와 평가 과정에 반영하는 것 역시 중요할 수 있습니다.


즉, 수의학에서도 실제 벤치마크에 기반한 성능보다는

  • 실제 진료 워크플로우에서 얼마나 안정적으로 지원하는가

  • 의료 사고 가능성을 얼마나 줄일 수 있는가

  • 의료진들의 무의식적인 부담을 얼마나 감소시킬 수 있는가

  • 설명 가능성과 추적가능성을 확보할 수 있는가

등으로 평가되어야 할 것이다.



출처: Reference  Hu, X., Qian, Y., Yu, J., et al. (2026). The Landscape of Medical Agents: A Survey. TechRxiv. 

댓글


더 이상 게시물에 대한 댓글 기능이 지원되지 않습니다. 자세한 사항은 사이트 소유자에게 문의하세요.
bottom of page