임상 진단 분야의 생성형 AI가 이제 통계적 기준점을 갖게 됐습니다. 그 수치는 헤드라인이 시사하는 것보다 훨씬 낮습니다. 현재까지 가장 대규모의 종합 분석에서 도출된 풀링 진단 정확도는 약 절반 수준으로, 벤치마크 경쟁이 더욱 달아오르기 전에 짚어둘 만한 맥락입니다.
의료 AI, 지금 어디쯤 왔나? — 83편이 답한다
생성형 AI는 벤치마크에서 일반 의사 수준과 경쟁하지만 전문가 수준에는 못 미치며, 측정된 진단 정확도는 약 52%입니다. 이 수치의 근거는 Takita 외 연구진이 Nature 산하 npj Digital Medicine에 2025년 3월 22일 발표한 체계적 문헌 고찰 및 메타분석으로, 18,371건의 문헌을 스크리닝하고 2018년 6월부터 2024년 6월까지의 83개 연구를 종합했습니다 . 이 주제를 다룬 메타분석 중 현재까지 최대 규모이며, 그 결과는 이후 모든 논의의 기대치를 설정합니다.
모든 구성을 통틀어 산출한 풀링 진단 정확도는 52.1%(95% CI 47.0–57.1%)였습니다 . 이 수치는 다양한 모델·사례 유형·연구 설계를 아우른 평균값으로, 실제 배포된 특정 시스템의 점수가 아닙니다. 제품 사양이 아닌 중력 중심점으로 받아들여야 합니다.
평가 대상은 두 OpenAI 모델에 크게 편중돼 있었으며, 이는 집계치를 해석할 때 중요하게 고려해야 할 사항입니다:
| 모델 구성 | 평가 논문 수 |
|---|---|
| GPT-4 | 54 |
| GPT-3.5 | 40 |
| GPT-4V, PaLM2, Llama 2, Claude 3 계열, Gemini | 소규모 샘플로 포함 |
GPT-4가 54편으로 가장 많이 평가된 구성이었고, GPT-3.5가 40편으로 그 뒤를 이었습니다 . 따라서 52.1%라는 수치는 주로 2023년 시점의 OpenAI 모델 동작을 반영하며, 최신 모델들은 표본이 매우 적습니다.
저자들은 이 풀이 무엇이 아닌지 명확히 밝힙니다. 실제 배포 환경의 중립적 표본이 아니라는 것입니다. 연구들 전반에 걸쳐 높은 비뚤림 위험과 출판 비뚤림 가능성이 있음을 지적하고 있습니다 .
"생성형 AI는 비전문의 수준과 비슷하나 전문가 수준의 신뢰도에는 미치지 못하는 중간 정도의 진단 성능을 보인다." — Takita et al., npj Digital Medicine (source: Nature, 2025-03).
AI vs 비전문의 vs 전문의: 진단 능력 위계

이 한 문장 안에는 모순처럼 들리지만 실제로는 그렇지 않은 두 가지 발견이 담겨 있습니다. 동일한 메타분석에서 생성형 AI는 의사 전체(p=0.10)와 비전문의(p=0.93) 모두를 상대로 통계적으로 유의미한 차이를 보이지 않았습니다 . 합당한 해석은 이렇습니다: 텍스트 기반 진단 추론에서 일반과 의사 평균에 필적합니다.
격차는 전문의를 구분했을 때 나타납니다. 전문의와 비교했을 때 AI는 15.8퍼센트포인트 뒤처졌습니다(95% CI 4.4–27.1; p=0.007) . 이는 통계적으로 유의미할 뿐 아니라 임상적으로도 중요한 수치로, 반올림 오차가 아니라 실제 임상 현장에서 체감할 수 있는 차이입니다.
결국 두 헤드라인 모두 하나의 결과를 묘사합니다:
- "비전문의와 동등" — p값에서 차이가 없는 일반의 수준에서는 사실.
- "전문의보다 15.8pp 낮음" — 한 단계 위에서는 격차가 실재하므로 마찬가지로 사실.
- 어느 한쪽만 인용하면 오해를 낳습니다. 정직한 주장은 두 가지를 함께 담아야 합니다.
더 깊은 주의사항은 비교 대상 자체에 있습니다. 이 83개 연구에서 "의사"는 전공의, 일반의, 세부 전공 주치의를 하나의 레이블로 묶습니다 . 어떤 논문에서 "의사를 능가"한 모델은 1년 차 전공의를 상대한 것일 수 있고, 다른 논문에서는 세부 전공 전문의가 비교군일 수 있습니다. 이 비교들은 사과와 사과를 견주는 것이 아니며, 그래서 "AI가 의사를 이겼다"는 단순한 헤드라인은 데이터가 세심하게 구분해 놓은 위계를 뭉개버립니다.
임상 코파일럿을 출시하는 개발자라면, 어떤 수준의 의사를 벤치마크에 사용했는지 먼저 확인해야 합니다. 동등성 주장을 그냥 믿기 전에 그 답을 알아야 숫자의 의미가 달라지기 때문입니다.
시간적 불안정성: 답변 번복 빈도, 캘리브레이션 침식, 노후화 원인
벤치마크 점수는 스냅샷이며, 그 스냅샷은 시간이 지나면서 낡아간다. 방사선과 수련의 시험 문제를 몇 달 후 GPT-4에 다시 제시했을 때, 모델은 25.5%의 경우에서 이전과 다른 답을 선택했다 . 이 불안정성은 — Guan, Bates, Zhou가 리뷰 논문 "Keeping Medical AI Healthy and Trustworthy"(IEEE Transactions on Biomedical Engineering, 2025년 12월 10일)에서 기록한 — 단일 벤치마크 승리가 편리하게 외면하는 변수다.
이 드리프트는 LLM이 시험 문제에 답하는 영역에만 국한되지 않는다. 같은 리뷰는 프로덕션에서 저하되는 고전적 임상 모델들을 추적한다: 원내 사망률 예측은 2.5년간의 전향적 배포 기간 동안 측정 가능한 수준으로 저하되었고, 급성 신장 손상(AKI) 캘리브레이션은 9년 추적 기간에 걸쳐 미끄러졌다 . 성능은 고정된 점이 아니라 움직이는 선이다.
원인은 크게 두 가지 범주로 나뉜다:
- 데이터 수준 변화 — 공변량 변화(입력 분포 변화), 레이블/유병률 변화(질병 기저율 이동), 개념 변화(입력과 결과 간의 관계 변화).
- 모델 수준 저하 — 캘리브레이션 드리프트, 파국적 망각, 훈련 컷오프 노후화(모델이 지식 컷오프 이후 발표된 가이드라인을 학습하지 못한 경우).
"모델 성능은 배포 후 정적이지 않으며, 지속적인 모니터링 없이는 저하가 환자에게 영향을 미칠 때까지 감지되지 않을 수 있다"고 저자들은 주장하며, 저하를 제한하기 위한 탐지–진단–수정(Detect–Diagnose–Correct) 프레임워크를 제안한다 (source: Guan, Bates & Zhou, IEEE TBME, 2025-12).
두 가지 전용 벤치마크가 노후화 문제를 정량화한다. BioPulse-QA는 모델의 훈련 컷오프 이후 발표된 의약품 라벨, 임상시험, 가이드라인에서 도출된 질문으로 모델을 평가하며, 임상시험 추출형 F1이 최저 0.36까지 떨어졌다. 이는 헤드라인 정확도가 양호해 보이는 동안 가이드라인 최신성이 조용히 저하된다는 의미다 . DriftMedQA는 4,290개의 진화하는 가이드라인 시나리오에서 7개 모델을 실행했고, 모델들이 시효가 지난 권고사항을 거부하는 데 어려움을 겪는 것을 발견했다. 검색 증강과 선호도 튜닝의 조합이 가장 효과적인 개입 방법이었다 .
임상 코파일럿을 출시하는 누구에게나 실무적 교훈은 명확하다: 평가판을 버전으로 관리하고, 일정에 따라 재테스트하며, 출시일 벤치마크를 유효기간이 있는 것으로 취급하라. 3월에 통과한 모델이 가을이면 조용히 다른 답을 낼 수 있다.
조율된 패널: Mira 87.1%, MAI-DxO 약 80%, AMIE의 OSCE 선두

'AI가 의사를 능가한다'는 서사를 이끄는 헤드라인 점수는 단일 프롬프트가 아닌 조율된 다단계 시스템에서 나온다. 세 가지가 두드러진다: 어려운 케이스에서 약 80%를 달성한 Microsoft의 MAI-DxO, 응급 분류에서 87.1%를 기록한 드레스덴/하이델베르크의 Mira, 시뮬레이션 방문에서 일차 진료 의사와 동등하거나 앞선 Google의 Gemini 기반 AMIE. 세 시스템 모두 서류상으로는 인간 비교군을 앞섰다. 하지만 세 시스템 모두 개발사 스스로 연구 시연(research demonstration)이라고 명시하고 있다.
Microsoft의 순차 진단(Sequential Diagnosis) 연구는 304개의 뉴잉글랜드 의학저널 임상병리학 컨퍼런스 케이스를 단계별 대화로 전환하며, 풀이기가 게이트키퍼 모델에 반복적으로 질의하고 정확도 및 검사 비용으로 채점된다 . OpenAI의 o3로 모델 페르소나 패널을 조율한 MAI-DxO는 약 80%에 도달했는데, 이는 21명의 일반의 평균 약 20%의 약 4배다 . 함정이 있다: 그 의사들은 교과서, 동료, 웹 검색 없이 작업했다.
Mira는 임상 워크플로에 더 깊이 들어간다. 이 독일 학술 시스템은 전자건강기록 데이터를 기반으로 작동하며 85,000개 이상의 임상 행위 중에서 선택할 수 있다. 500개 이상의 응급실 케이스에서 8개 질환(췌장암, 폐렴, 충수염, 폐색전증 포함)에 대해 87.1%의 진단 정확도를 기록했으며, 이는 6명의 전문의 패널의 78.1%를 앞선 수치다 . 케이스는 AI 환자 에이전트를 통해 제시되었으며, 실제 응급실 대화보다 구조화되어 있었을 가능성이 있다.
AMIE는 진단뿐 아니라 관리(management)를 목표로 한다. 21명의 일반의를 대상으로 한 100개 다방문 케이스의 무작위 맹검 가상 OSCE에서, AMIE는 관리 추론에서 비열등성을 보였고 가이드라인 준수, 치료 정밀도, 미국 및 영국 국가 의약품 목록에서 도출된 약물 관련 질문에서 더 강한 성능을 나타냈다 .
| 시스템 | AI 점수 | 의사 비교군 | 설정 |
|---|---|---|---|
| MAI-DxO (o3) | ~80% | ~20% (일반의 21명) | 304개 NEJM CPC 케이스, 순차적 |
| Mira | 87.1% | 78.1% (전문의 6인 패널) | 500개 이상 응급실 케이스, 환자 에이전트 |
| AMIE | 비열등 / 우위 | 일반의 21명 | 100개 케이스 가상 OSCE |
이 중 어느 것도 실제 환자를 대상으로 출시된 제품이 아니며, 전향적·대규모 RCT 검증도 갖추고 있지 않다. 패턴은 일관된다: 조율과 순차적 질의가 점수를 단일 프롬프트 방식보다 훨씬 높이지만, 비교 조건은 기계에 유리하게 설정되어 있다.
테스트 형식이 AI 능력을 부풀리거나 축소하는 이유

테스트 설계 자체가 하나의 변수다 — 시험형 강제선택 방식과 자유 대화형 방식은 동일한 모델을 두고 정반대의 결과를 낼 수 있다. 2026년 2월 Nature Medicine 연구는 21개 전문과 60개 시나리오에 걸쳐 ChatGPT Health를 평가한 결과, 응급 사례의 51.6%에서 과소 분류가 나타났고 자살 위기 안전장치도 일관성이 없었다 — 심지어 정상 검사 수치를 추가하자 위기 알림이 완전히 사라진 시나리오도 있었다 .
2026년 3월 재현 연구는 그 실패가 모델의 문제라는 해석에 이의를 제기했다. 원본 연구가 시험형 강제 다지선다 방식을 사용했으며, 환자 중심의 자연스러운 입력으로 바꾸면 결과가 달라진다고 주장했다. 5개 최신 모델을 대상으로 한 부분 재현에서 대화형 방식은 분류 정확도를 6.4%p 향상시켰다 . 특정 질환에서는 변화가 뚜렷했다:
- 당뇨병성 케톤산증은 자연스러운 입력 방식에서 100% 정확하게 분류됐다 .
- 천식 분류 정확도는 동일 모델에서 48%에서 80%로 올랐다 .
재현 연구 저자들은 형식 자체가 중립적 렌즈가 아니라 혼입 변수라고 규정한다:
"강제 다지선다 시험은 실제 환자 대화에서는 재현되지 않는 안전 실패를 인위적으로 만들어낼 수 있다 — 평가 틀 자체가, 모델만큼이나, 시험대에 올라 있다." — 2026년 3월 재현 연구의 주장 (source: arXiv:2603.11413).
평가 난이도 역시 헤드라인 수치를 그만큼 크게 좌우한다. OpenAI의 HealthBench — 48,562개 의사 작성 기준으로 채점된 5,000건의 다중 대화 — 는 모델별로 큰 편차를 낸다: GPT-3.5 Turbo 16%, GPT-4o 32%, o3 60% . 엄선된 HealthBench Hard 부분집합에서는 최고 점수조차 32%에 불과했다 . 같은 모델, 다른 슬라이스, 결과는 거의 두 배 또는 절반 — 그래서 "AI가 X% 달성"이라는 단일 주장은 그것을 만들어낸 평가 틀과 함께 제시되어야만 의미를 가진다.
실제 환자 전향적 임상시험이 밝혀낸 것, 그리고 밝히지 못한 것
전향적 실제 환자 증거는 빈약하며, 가장 강력한 데이터 포인트도 범위가 좁다. 외래 응급 진료 성인 100명을 대상으로 한 단일군 타당성 연구에서, Google의 AMIE는 최종 차트 검토 진단을 감별 진단 목록에 포함시킨 비율이 90%였고 상위 3위 안에 든 비율은 75%였으며, 실시간 안전 감독자 중단은 한 건도 발생하지 않았다 (source: AMIE feasibility study, 2026-03).
함정은 같은 연구 안에 있다: 처치 실용성과 비용 효과성에서는 의사가 여전히 AMIE를 앞섰다. 격차는 실행 단계에 있지 감별 생성에 있지 않다 — 모델은 올바른 가능성을 나열하지만, 그것을 실용적이고 경제적인 계획으로 전환하는 데는 임상의에 못 미친다.
MAI-DxO, Mira, AMIE의 현재 구성에 대한 전향적·대규모·생환자 무작위 대조 시험은 존재하지 않는다. 조율형 패널 관련 헤드라인은 시뮬레이션 진료에서 나온 것이며, Microsoft 스스로 MAI-DxO와 SDBench를 연구 시연으로 규정하고 있다 (source: Microsoft, 2025-06).
"MAI-DxO와 SDBench는 연구 시연이며, 출시되거나 실제 환자에게 검증된 시스템이 아닙니다." — Microsoft AI, Sequential Diagnosis with Language Models (source: arXiv:2506.22405).
임상 AI를 통합하는 엔지니어에게 운영상의 함의는 구체적이다. 재시험한 방사선과 문항에서 25.5%의 답변 변동률이 나타났다는 사실은, 버전 고정만으로는 파이프라인을 안정화할 수 없음을 의미한다 (source: Guan, Bates & Zhou, 2025-12). 이 연구의 Detect–Diagnose–Correct 프레임워크가 제시하는 처방은 다음과 같다:
- 일회성 벤치마크 통과가 아닌, 새로운 레이블 케이스를 활용한 지속적인 홀드아웃 모니터링.
- 공변량·레이블·개념 드리프트에 걸친 자동 분포 이동 감지.
- 임상 정답 레이블이 늦게 도착하는 특성을 고려한 주기적 재평가.
결론: 전문 임상의는 복잡한 처치 영역에서 여전히 이 시스템들을 앞서며, 실세계에서의 지속적 신뢰성은 아직 입증되지 않았다. 벤치마크 점수는 유효 기간이 있는 스냅샷으로 다루고, 단일 출시일 결과가 아닌 실시간·버전 관리·배포 후 평가를 기반으로 의사+AI 협업 워크플로를 구축해야 한다.
자주 묻는 질문
2025~2026년 기준, AI의 의료 진단 정확도는 일반 의사와 비교해 어느 수준인가요?
텍스트 기반 진단 추론에서 생성형 AI는 이제 비전문의 수준에 도달했지만, 전문의에는 미치지 못합니다. Nature npj Digital Medicine에 게재된 83개 연구 메타분석 결과, 통합 진단 정확도는 52.1%(95% CI 47.0–57.1%)로, 비전문의 대비 통계적으로 유의미한 차이가 없었으나(p=0.93), 전문의 대비로는 15.8%p의 격차를 보였습니다(p=0.007) . 한 줄 요약: 일반의 수준은 되지만, 전문의 수준에는 이르지 못합니다.
AI 의료 벤치마크 결과는 왜 시간이 지나면 저하되거나 유효기간이 만료되나요?
벤치마크 점수는 구조적인 세 가지 이유로 시간이 지날수록 신뢰도가 떨어집니다:
- 모델 업데이트가 답변 분포를 바꿉니다. 방사선과 전공의 시험 문제를 수개월 후 GPT-4에 다시 제출했을 때, 25.5%의 문항에서 다른 답변을 선택했습니다 .
- 훈련 데이터 컷오프 노후화로 인해 가이드라인 최신성 관련 질문에서 성능이 저하됩니다 — BioPulse-QA에서는 임상시험 추출형 F1 점수가 0.36까지 하락했습니다 .
- 임상 진료 자체도 변화하며, 기반 환자 집단에서 공변량 및 개념 드리프트가 발생합니다.
MAI-DxO란 무엇이며, 단일 모델 평가와 어떻게 다른가요?
MAI-DxO는 Microsoft의 진단 오케스트레이터입니다. 하나의 모델을 한 번만 조회하는 대신, 여러 모델 '페르소나'로 구성된 패널을 운영하고, 단계적 진단 쿼리를 게이트키퍼를 통해 라우팅한 뒤 최종 답변을 합성합니다. SDBench를 통해 304건의 NEJM 임상병리학 케이스에서 비용 추적과 함께 평가됐으며, OpenAI의 o3 모델로 약 80%의 정확도를 달성했습니다 . 이는 연구 단계의 시연이며, 출시됐거나 실제 환자를 대상으로 검증된 제품이 아닙니다.
ChatGPT Health의 51.6% 과소 분류 결과는 신뢰할 수 있나요?
결과는 논란이 있습니다. 원래의 Nature Medicine 연구에서는 응급 시나리오의 51.6%에서 과소 분류가 발생했다고 보고했지만, 2026년 3월 재현 연구에서는 강제 객관식 시험 형식이 대부분의 실패를 유발했다고 주장했습니다. 자연스러운 자유 텍스트 방식으로 상호작용할 경우, 트리아지 정확도는 6.4%p 상승했으며 천식 트리아지는 48%에서 80%로 향상됐습니다 . 혼재 변수는 모델 동작 자체가 아니라 평가 설계에 있습니다.
임상 AI를 제품에 통합할 때 시간적 성능 저하에 대처하는 실질적인 방법은 무엇인가요?
Guan, Bates, Zhou는 탐지–진단–교정(Detect–Diagnose–Correct) 프레임워크를 제안합니다. 임상 정답 레이블이 늦게 도달하는 경우가 많기 때문에, 홀드아웃 임상 케이스에 대한 지속적 모니터링, 자동화된 분포 이동 감지, 그리고 정기적인 재평가 주기가 포함됩니다 . 가이드라인 최신성 쿼리의 경우, DriftMedQA 연구에서 검색 증강(retrieval augmentation)과 선호도 튜닝(preference tuning)을 결합했을 때 오래된 권고사항 거부에서 가장 강력한 결과를 보였습니다 .