top of page
OUR STORY (BLOG)


수의 AI는 왜 국가고시 만점보다 어려운가: 벤치마크를 넘어 Spectrum of Care로
AI가 의사 국가고시를 만점으로 통과했다는 이야기는 더 이상 새로운 소식이 아닙니다. USMLE(United States Medical Licensing Examination) 에서는 이미 최고 수준의 성과가 보고되었고, 춘옥컴퍼니가 개발한 VetJarvis 역시 스마트폰에서 구동되는 4B 규모의 온디바이스 모델임에도 일본 수의사 국가고시 합격선을 넘어섰습니다. 이제 모델이 시험 문제를 푸는 능력 자체는 상당한 수준에 도달했습니다. 그렇다면 진료의 미래도 이미 결정된 것일까요? 최근 발표된 두 편의 연구를 읽으며 오히려 반대의 생각을 하게 되었습니다. 시험을 잘 보는 것과 진료를 잘하는 것은 생각보다 훨씬 다른 문제였습니다. 시험을 잘 본 AI가 좋은 수의 AI인 것은 아닙니다 NYU 연구팀은 흥미로운 비교 실험을 수행했습니다. GPT-5, Gemini 3 Pro, Claude Sonnet 4.5와 같은 범용 대규모 언어모델과 OpenEvidenc
6월 22일4분 분량


LLM 최신성: 의료 LLM은 최신 의료지식을 충분히 알고 있는가?
LM 최신성은 의료 AI 신뢰성의 핵심 과제다. 최신 연구는 GPT-5를 포함한 의료 LLM이 최신 진료지침과 과거 지식을 구분하는 데 한계를 보인다고 지적한다. 본 글에서는 Medical LLM의 최신성 문제와 CDSS가 해결해야 할 과제를 살펴본다.
6월 8일2분 분량
bottom of page






