top of page
OUR STORY (BLOG)


의료 AI는 정답은 잘 맞힙니다. 문제는 임상 추론입니다
의료 AI 평가, 시험을 잘 보는 것과 진료를 잘하는 것 의료 AI 성능을 이야기할 때 가장 자주 등장하는 숫자는 시험 점수입니다. 의사 국가시험 몇 점, 수의사 국가시험 몇 점. 저희도 오픈소스로 공개한 VetJarvis-4B가 일본 수의사 국가시험에서 81.67%를 받았다는 내용을 여러 자리에서 소개했습니다. 하지만 시험 성적과 실제 임상 추론 능력은 같은 개념이 아닙니다. 시험은 다섯 개 보기 중에서 답을 고르는 일이고, 진료는 주어진 정보에서 가능한 원인을 검토하고, 최선의 치료 계획을 만들어가는 과정입니다. “3살 말티즈, 이틀째 구토, 식욕 없음.” 여기서 시작할 때 임상의의 머릿속에 떠오르는 것은 정답 하나가 아니라 의심 목록입니다. 이물일 수도, 췌장염일 수도, 신부전일 수도 있습니다. 어제 보호자가 준 간식이 원인일 가능성도 있습니다. 이 감별진단 목록을 얼마나 적절하게 펼치느냐가 다음 검사를 결정합니다. 지난 4월 JAMA Net
8월 2일3분 분량


동물병원 진료비, AI는 어떻게 영향을 줄 수 있을까? GraphDx 논문이 보여준 것
동물병원 진료비는 사람의 의료비와 다릅니다. 국가적으로 지원하는 금액이 거의 없기 때문에 보호자의 부담이 큰 것도 사실입니다. 보호자의 동물병원 진료비 부담을 낮추기 위해 항목별 가격을 조정하는 정책을 검토하고 있기도 하지만, 실제 진료 현장에서 현실성을 잘 반영하고 있는지는 더 확인이 필요합니다. GraphDx는 인체 의학의 순차적 진단 과정을 대상으로, 비용과 침습도를 의사결정에 포함한 의료 LLM 프레임워크입니다. 실제 동물병원에 적용된 시스템은 아니지만, 비용을 진단 이후에 계산하는 결과값이 아니라 다음 검사를 선택하기 위한 입력값으로 다뤘다는 점에서 주목할만 합니다. 이 연구는 진료비 문제를 가격만의 문제가 아니라 불확실성 아래에서 진료 경로를 어떻게 설계할 것인가의 문제로 바라볼 수 있는 하나의 관점을 제시했습니다. 현재 동물병원 진료비 부담과 정책 2026년 동물의료 정책의 한가운데에는 진료비가 있습니다. 올해 1월 진료비 부가가치세
7월 27일4분 분량


춘옥컴퍼니, 소동물 임상 AI의 원칙과 한계 담은‘VETfr.ai.day 헌장’ 공개
AI를 이용하여 제작되었습니다. 춘옥컴퍼니가 소동물 임상 의사결정지원 AI ‘VETfr.ai.day’가 지향하는 원칙과 시스템의 한계를 담은 「VETfr.ai.day 헌장」을 공개했습니다. 이번 헌장은 AI의 성능을 소개하는 문서가 아니라, 실제 진료 현장에 사용되는 임상 AI가 어떤 원칙에 따라 설계되어야 하며 무엇을 하지 않아야 하는지를 밝히기 위해 작성되었습니다. 임상 AI의 오답은 일반적인 챗봇의 오류와 결과의 무게가 다릅니다. 확인되지 않은 약물 용량이나 잘못된 임상 정보가 그럴듯한 답변으로 제시될 경우, 그 영향은 사용자의 불편을 넘어 동물 환자의 안전으로 이어질 수 있기 때문입니다. 이에 춘옥컴퍼니는 임상 AI의 신뢰를 정확도나 벤치마크 점수만으로 설명하기보다, 시스템이 지켜야 할 원칙과 한계를 먼저 공개해야 한다고 판단했습니다. 춘옥컴퍼니 VETfr.ai.day가 지켜야 할 네 가지 약속 VETfr.ai.day 헌장은 다음 네 가지
7월 20일2분 분량


수의사는 진료 과정에서 AI에 무엇을 질문할까? 춘옥컴퍼니, 임상 단계별 AI 질문 유형 연구 프리프린트 공개
춘옥컴퍼니, 수의 임상 현장의 AI 활용 패턴을 3개 범주·21개 유형으로 체계화 이번 연구의 제목은 ‘Development of an Exploratory Taxonomy for Veterinary Professionals’ AI Query Patterns Across Clinical Stages: An Expert Panel Study’로, 수의 임상 현장에서 발생하는 AI 질문을 임상 단계와 질문 목적에 따라 체계적으로 분류하는 것을 목표로 했다. 해당 논문은 2026년 6월 9일 bioRxiv에 게시됐다. 춘옥컴퍼니 개발/연구팀은 수의 임상 AI 챗봇에서 8개월간 수집된 실제 질문 로그 5,372건을 분석해 초기 분류체계를 구축했다. 이후 관련 문헌 검토와 임상 현장에서 활동 중인 수의 전문가 38명의 구조화된 설문 검토를 거쳐 AI 질문을 ▲임상 지원 ▲근거 기반 연구 ▲용어·약물 정보의 3개 범주와 21개 세부 유형으로 분류했다. 전문가
7월 13일1분 분량


연구를 대신 해주는 의료 AI가 나왔다. MedGenesis가 보여준 임상 연구 자동화 가능성
최근 의료 ai 분야에서는 단순 질의응답을 넘어, 임상 연구 과정 자체를 지원하려는 시도가 등장하고 있습니다. 그 중 하나가 중국 푸단대병원과 옥스퍼드 등이 함께 발표한 논문 “MedGenesis: Toward a World Model for Autonomous Clinical and Translational Research”는 의료 AI가 단순 답변 생성을 넘어, 임상 연구 과정 자체를 지원할 수 있는 가능성을 다룹니다. 사례 1. 논문 2,420편을 192분 만에 분석하다 연구자들은 MedGenesis에게 하나의 질문을 제시했습니다. 신장 기능이 저하된 암 환자에게도 면역항암제가 효과가 있을까? 이 질문에 답하려면 일반적으로 다음 과정이 필요합니다. 관련 논문 수천 편 검색 제목과 초록 기준 1차 선별 본문 정독 데이터 추출 연구 품질 평가 통계적 통합 분석 MedGenesis는 이 과정을 자동화된 워크플로우 안에서 수행했습니다. 구체적인 결과
7월 6일4분 분량


수의 AI는 왜 국가고시 만점보다 어려운가: 벤치마크를 넘어 Spectrum of Care로
AI가 의사 국가고시를 만점으로 통과했다는 이야기는 더 이상 새로운 소식이 아닙니다. USMLE(United States Medical Licensing Examination) 에서는 이미 최고 수준의 성과가 보고되었고, 춘옥컴퍼니가 개발한 VetJarvis 역시 스마트폰에서 구동되는 4B 규모의 온디바이스 모델임에도 일본 수의사 국가고시 합격선을 넘어섰습니다. 이제 모델이 시험 문제를 푸는 능력 자체는 상당한 수준에 도달했습니다. 그렇다면 진료의 미래도 이미 결정된 것일까요? 최근 발표된 두 편의 연구를 읽으며 오히려 반대의 생각을 하게 되었습니다. 시험을 잘 보는 것과 진료를 잘하는 것은 생각보다 훨씬 다른 문제였습니다. 시험을 잘 본 AI가 좋은 수의 AI인 것은 아닙니다 NYU 연구팀은 흥미로운 비교 실험을 수행했습니다. GPT-5, Gemini 3 Pro, Claude Sonnet 4.5와 같은 범용 대규모 언어모델과 OpenEvidenc
6월 22일4분 분량


춘옥컴퍼니, 대한수의학회 춘계학술대회 AI 세션에서 수의학 생성형 AI 개발 방향 소개
대한수의학회 2026년 춘계학술대회 첫 세션은 반려동물 임상 분야의 인공지능 - 춘옥컴퍼니 허찬 대표 춘옥컴퍼니는 지난 4월 23일 대전 인터시티호텔에서 열린 대한수의학회 2026년 춘계학술대회 인공지능(AI) 세션에서 수의 임상 영역에 적용 가능한 생성형 AI 개발 방향을 소개했다. 이번 세션은 반려동물 임상 분야에서 인공지능 기술의 현재와 적용 가능성을 조명하기 위해 마련됐다. 이날 발표에서 춘옥컴퍼니 허찬 대표는 대형언어모델(LLM)을 기반으로 한 수의학 인공지능 개발 흐름과 임상 적용 가능성을 설명했다. 춘옥컴퍼니는 기존의 영상 분석 중심 인공지능과 달리, 생성형 대형언어모델(LLM)을 기반으로 수의사의 임상 의사결정을 보조하는 인공지능 개발에 나서고 있다. 허찬 대표는 발표에서 생성형 AI의 핵심 구조를 제안한 2017년 Google의 Attention is all you need 논문을 비롯해, LLM과 의학·수의학 인공지능 발전에 영향
5월 17일1분 분량


수의학 AI 정확도가 높아지면 AI 안정성도 함께 높아질까?
Safety and Accuracy Follow Different Scaling Laws in Clinical Large Language Models 리뷰 의료AI와 임상 의사결정 지원 시스템(CDSS)에서 대형언어모델(LLM)을 활용하려는 시도는 확산되고 있습니다. 우리는 흔희 “더 큰 모델, 더 긴 컨텍스트, 더 정교한 retrieval, 더 많은 inference-time compute”를 AI 정확성을 높이고 안정성을 향상시키는 방법으로 가정합니다. 그러나 평균 정확도가 높아진다고 해서 임상적으로 안전한 모델인가? 최근 공개된 Preprint 논문⌈Safety and accuracy follow different scaling laws in clinical large language models⌋은 이 질문을 정면으로 다루고 있습니다. 임상 LLM에서 정확도와 안정성은 같은 방향으로 움직일 수는 있지만, 동일한 지표는 아닙니다. 특히 의료
5월 17일3분 분량


보호자가 다르게 말하면, 수의사도 다르게 묻는다 _ 수의학 LLM 신뢰성과 AI
같은 환자, 같은 증상이라도 보호자가 어떻게 표현하느냐에 따라 AI의 답변은 달라질 수 있습니다. 최근 UC Berkeley·UCSF 연구팀이 발표한 「Green Shielding: A User-Centric Approach Towards Trustworthy AI — LLM-Assisted Medical Diagnosis as a Case Study」는 의료 LLM 신뢰성을 단순 “정답률”이 아니라, 실제 사용자 표현 방식 관점에서 바라본 연구입니다. 그리고 이 문제는 보호자 진술에서 시작되는 수의학 AI에서 더 중요할 수 있습니다. 의료 LLM 신뢰성을 단순 “정답률”이 아니라, 실제 사용자 표현 방식 관점에서 바라본 연구입니다. 그리고 이 문제는 보호자 진술에서 시작되는 수의학 AI에서 더 중요할 수 있습니다. 같은 환자, 같은 증상인데 표현 방식만 달라지면LLM은 다른 판단을 내릴 수 있을까? 연구 결과는 명확했습니다.답은 “그렇다”였습니다
5월 10일3분 분량


AI는 동물을 어떻게 바라보는가 _ 수의학 AI를 만들기로 한 이유
수의학 AI와 동물 의료 AI는 동물을 어떻게 바라보고 있을까? 춘옥컴퍼니 창업 계기와 AI 윤리, 그리고 Veterinary AI의 방향성을 허찬 대표의 시선에서 설명하고 있다.
5월 5일4분 분량
bottom of page






