오픈웨이트 AI는 어디까지 왔나 — 오픈 모델 Kimi K3를 읽고
7월 27일 중국 Moonshot AI가 Kimi K3 기술 보고서와 모델 가중치를 공개했습니다. 누구나 가중치를 내려받아 직접 운영할 수 있는 오픈웨이트 AI입니다.
AI 모델은 크게 두 진영으로 나뉩니다. Claude나 GPT처럼 내부를 공개하지 않고 API로 사용하는 폐쇄형 모델, 그리고 가중치를 내려받아 직접 운영할 수 있는 오픈 모델입니다. 지금까지 최상위 성능에서는 폐쇄형 모델이 앞서 있었습니다.
이 글에서는 그 격차가 얼마나 좁아졌는지, 그리고 의료영상 판독을 준비하는 입장에서 이 논문의 어떤 부분이 눈에 띄었는지를 정리합니다.

1. 오픈웨이트 AI는 얼마나 따라잡았나
논문에는 40여 개 벤치마크에서 K3와 주요 폐쇄형 모델을 비교한 표가 있습니다. 오픈 모델인 K3가 1위를 차지한 항목도 여럿 있습니다.
벤치마크 | K3 | 2위 |
ProgramBench (코딩) | 77.8 | GPT-5.6 Sol 77.6 |
BrowseComp (웹 검색) | 91.2 | GPT-5.6 Sol 90.4 |
MCPMark-Verified (도구 사용) | 94.5 | GPT-5.6 Sol 92.9 |
OmniDocBench (문서 파싱) | 91.1 | Fable 5 89.8 |
외부 기관 평가에서도 종합 상위권에 들었고, 사람이 직접 비교 투표하는 웹개발 리더보드에서도 오픈 모델 가운데 높은 평가를 받았습니다.
물론 전체적으로는 여전히 최상위 폐쇄형 모델에 뒤집니다. 논문도 그렇게 씁니다. 어려운 연구 수준 문제나 복잡한 컴퓨터 조작 과제에서는 격차가 남아 있습니다.
순위만 보면 과대 해석하기 쉽다는 점도 짚어둘 만합니다. 모델을 어떤 환경에서 평가했느냐에 따라 점수가 달라질 수 있고, 경쟁 모델이 안전상의 이유로 거부한 문항이 점수에 영향을 주는 경우도 있습니다.
그럼에도 방향은 분명합니다. 격차는 좁아지고 있고, 일부 벤치마크에서는 오픈 모델이 더 높은 점수를 기록했습니다.

2. 눈에 띈 부분 — AI가 그림을 보는 방식
춘옥컴퍼니는 수의 임상의사결정지원 시스템 VETFR.AI.DAY를 만들고 있고, 의료영상 판독 보조도 준비하고 있습니다. 그래서 이 논문의 이미지 처리 부분을 자세히 봤습니다.
1.관행을 뒤집었습니다
AI가 그림을 이해하려면 먼저 이미지를 읽는 부품이 필요합니다.
지금까지는 사진과 설명문을 대량으로 짝지어 미리 학습한 비전 인코더를 가져와 언어모델에 연결하는 방식이 널리 쓰였습니다. 이미 시각 정보를 학습한 부품에서 시작하는 것이 유리하다는 접근입니다. Moonshot도 이전 세대까지는 이런 방식을 사용했습니다.
K3는 이 관행을 버렸습니다.
그림을 읽는 비전 인코더를 백지 상태에서 시작해 언어모델과 처음부터 함께 훈련했습니다.
2.이유가 성능만은 아니었습니다
논문이 밝히는 첫 번째 이유는 학습 안정성입니다.
미리 학습된 비전 인코더를 붙여 함께 훈련하면 최적화가 불안정해질 수 있습니다. 논문에 실린 그래프에서도 기존 방식은 학습 중 값이 크게 튀는 구간이 반복되는 반면, 처음부터 함께 학습한 방식은 상대적으로 안정적인 모습을 보입니다.
이 규모에서는 학습 한 번의 실패 비용이 크기 때문에 안정성 자체가 중요한 조건입니다.
두 번째 이유가 더 흥미롭습니다.
논문은 사진과 설명문을 대응시키는 contrastive 학습이 전체적인 의미를 파악하는 데 유리하지만, 세밀한 텍스트나 구조적 단서를 표현하는 데는 한계가 있을 수 있다고 설명합니다.
의료영상 관점에서 생각해볼 지점이 여기 있습니다.
의료영상에서는 영상 전체가 무엇인지 아는 것만으로 충분하지 않습니다. 작은 구조의 변화와 위치 관계까지 읽어야 합니다. 그렇다면 비전 인코더를 어떤 학습 목표에 맞춰 만드는지도 중요한 변수가 됩니다.
K3는 next-token prediction을 통해 비전 인코더를 언어모델의 학습 목표에 직접 맞췄습니다. 그리고 기존의 contrastive pre-training으로 초기화한 방식과 비교했을 때 비전 평가에서 대등한 성능을 확인했습니다.
적어도 이번 실험에서는 사전에 contrastive 학습을 거친 비전 인코더가 반드시 필요한 출발점은 아니었다는 결과입니다.
3.이 발견이 반가웠던 이유
수의 의료영상에서는 사람 의료영상이나 일반 이미지 분야만큼 활용할 수 있는 사전학습 모델과 데이터가 풍부하지 않습니다.
그래서 좋은 출발점이 부족하다는 것이 반드시 결정적인 불리함만을 뜻하지 않을 수도 있다는 점이 눈에 들어왔습니다.
처음부터 어떤 데이터로, 어떤 목표에 맞춰 학습시키느냐 역시 중요한 문제입니다.
3. 오픈 모델이 많아지면 좋겠습니다
AI 서비스를 만들다 보면 결국 비용 이야기로 돌아옵니다.
상용 API만으로 서비스를 구성하면 사용량이 늘수록 비용도 따라 늘어납니다. 그러면 이용료를 낮추기 어렵습니다. 진료 기록처럼 외부 전송과 데이터 관리에 주의가 필요한 정보를 다룰 때는 직접 운영할 수 있는 모델이 있느냐도 중요한 변수가 됩니다.
그런 점에서 오픈웨이트 AI가 계속 나오는 것은 반가운 일입니다.
다만 Kimi K3 자체는 우리 같은 규모에서 쉽게 운영할 수 있는 모델이 아닙니다. 2.8조 파라미터 모델이고, 권장 배포 구성도 대규모 연산 자원을 전제로 합니다.
열려 있지만 우리 것은 아닌 셈입니다.
그래서 바라는 것은 단순합니다.
가장 큰 모델이 얼마나 커지느냐보다, 작은 팀이 감당할 수 있는 크기의 오픈 모델도 계속 좋아지는 것입니다.
이번 논문처럼 모델뿐 아니라 학습 방법이 함께 공개되면 다른 연구와 더 작은 모델을 만드는 데 참고할 수 있습니다. 우리에게 중요한 것도 2.8조 파라미터 모델 자체보다 그 안에서 검증된 방법입니다.
오픈 모델의 선택지가 많아지면 비용과 배포 방식에서도 선택지가 늘어납니다.
작은 회사와 동물병원이 각자의 환경에 맞는 AI를 선택할 가능성도 커집니다.
오픈웨이트 AI의 발전을 반기는 이유입니다.

마치며
2.8조 파라미터가 모두의 손에 닿지는 않습니다.
다만 가져갈 것은 있습니다.
그림을 읽는 부품을 어떤 목표로 학습시킬 것인가, 위치 정보를 어떤 형식으로 줄 것인가, 우리가 가진 데이터의 성격과 학습 방식을 어떻게 맞출 것인가.
곧 직접 부딪힐 문제들입니다. 닿은 것은 모델이 아니라 방법이었습니다.
참고
Kimi Team, Kimi K3: Open Frontier Intelligence, arXiv:2607.24653 (2026)





댓글