단 한 곳만 채점한 의사 vs AI 건강 평가

GPT-5.5 Instant가 HealthBench Professional에서 의사보다 높은 점수를 받았다. 벤치마크 설계, 의사 섭외, 평가 진행 모두 OpenAI가 직접 맡았다.

단 한 곳만 채점한 의사 vs AI 건강 평가
Share

기업이 시험을 직접 만들고, 채점관을 공급하고, 최고 점수까지 받는다면 — 기사 제목은 저절로 나온다. 검증은 그렇지 않지만. OpenAI의 2026년 6월 "헬스 인텔리전스" 업데이트가 바로 그런 종류의 주장을 내놓고 있으며, 먼저 살펴볼 것은 실제로 무엇이 출시됐는가이다.

헬스 인텔리전스: 실제로 이루어진 개선 사항

핵심 변화는 새로운 제품이 아닌 배포 전환이다. 2026년 6월 18일, OpenAI는 헬스 특화 동작을 GPT-5.5 Instant에 적용했다 — 이 모델은 2026년 5월 사용량 제한 조건으로 무료 ChatGPT 사용자의 새 기본 모델로 출시됐다. 이전 기본 모델이었던 2026년 3월 출시된 GPT-5.3 Instant를 대체한다. 스택을 추적하는 개발자들이 주목할 점: OpenAI에 따르면 이 빠르고 저비용 모델은 자체 헬스 벤치마크에서 더 비싼 "Thinking" 모델과 동등한 성능을 보이며, 이에 따라 강화된 헬스 동작이 유료 게이트 뒤가 아닌 무료 기본 티어에서 제공된다.

OpenAI는 업데이트된 모델의 네 가지 구체적인 행동 변화를 설명한다:

  • 긴급 진료 인식 — 응급 또는 긴급 진료가 필요할 수 있는 상황을 더 잘 포착하고, 위험 신호를 놓치는 경우가 줄었다.
  • 맥락 파악 — 답변 전 맥락을 수집하기 위해 명확화 질문을 한다.
  • 조율된 불확실성 표현 — 과도한 확신 없이 불확실성을 표현한다.
  • 지역화된 안내 — 사용자의 현지 의료 환경에 맞게 의료 정보를 조정하고 이해하기 쉽게 전달한다.

증거로서 OpenAI는 단일 출시 지표가 아닌 프로덕션 모니터링을 제시한다. 매주 수십억 건 규모의 라이브 헬스 트래픽에 프라이버시 보호 모니터를 적용한 결과, OpenAI에 따르면 하나 이상의 사실성 문제로 플래그된 응답 비율이 두 달 만에 71% 감소했다. 이 수치는 신중하게 다뤄야 한다: 내부적으로 플래그된 문제를 집계한 것이며 플래그 기준이 공개되지 않아 외부에서 검증된 오류율이 아니다.

규모 논거는 OpenAI가 여기에 투자하는 이유를 설명한다. 해당 발표 보도에 따르면 매주 2억 3천만 명 이상이 ChatGPT에 건강 및 웰니스 관련 질문을 하며, 주요 사용 목적은 검사 결과 해석, 진료 준비, 보험 탐색 등이다. 이 규모에서 개선된 동작을 무료 기본 모델에 적용하는 결정이야말로 가장 중요한 선택이며 — 이어지는 섹션에서 살펴볼 의사 비교 주장의 근거이기도 하다.

HealthBench Professional: 의사 선호도 시험 구성 방식

The doctor-vs-AI health exam that only one lab graded

HealthBench Professional은 의사 비교 주장을 가장 직접적으로 뒷받침하는 평가로, 일반 소비자가 아닌 임상의를 대상으로 한다. 2026년 4월 30일 arXiv에 제출된 이 벤치마크는 15,079개의 후보 예제 중 선별된 525개의 임상의 대상 과제로 모델을 채점한다 . 과제는 진료 상담, 문서 작성/기록, 의학 연구의 세 범주로 나뉘며 — 일반적인 Q&A가 아닌 임상의가 실제로 위임하는 업무를 측정한다.

이를 뒷받침하는 의사 네트워크는 광범위하다. 이 벤치마크는 50개국, 26개 전문과목, 52개 언어에 걸쳐 190명의 의사 기여자와 함께 구축됐다 . 난이도를 높이는 두 가지 설계 선택이 있다: 과제의 약 3분의 1은 의사들이 의도적으로 수행한 레드팀 테스트이며, 어려운 예제는 자연 분포 대비 약 3.5배 더 많이 포함됐다 . 이는 평균적인 사례 샘플이 아닌 스트레스 테스트를 의도한 것이다.

인간 기준점은 의도적으로 높게 설정됐다. 의사 작성 기준선은 전공이 일치하는 의사들이 시간 제한 없이 웹 접근권을 가지되 AI 지원은 없는 조건에서 작성됐다 . 이는 '모델이 의사를 앞섰다'는 헤드라인을 해석할 때 중요한 점이다: 비교 대상은 시간 압박 속에 답변하는 임상의가 아닌, 충분한 여유와 자료 검색 능력을 갖춘 인간이다.

설계 요소HealthBench Professional
과제 수 (후보 풀에서)15,079개 중 525개
범주진료 상담 · 문서 작성/기록 · 의학 연구
의사 기여자50개국, 26개 전문과목, 52개 언어, 190명
레드팀 비율과제의 약 1/3
난이도 강화더 어려운 예제 약 3.5배
인간 기준선전공 일치 전문의, 시간 제한 없음 + 웹 접근, AI 없음

결과를 해석하는 방식을 제한하는 채점 세부 사항이 하나 있다. 점수는 정확도 퍼센트가 아니다. 길이 조정 루브릭 기반 채점 방식을 사용하며, 논문은 절대 점수를 실제 임상 성능률로 해석해서는 안 된다고 명시한다 . 실제로 59.0 같은 수치는 의도적으로 어렵게 설계된 세트에서 응답이 의사 작성 루브릭 기준을 얼마나 충족하는지를 반영한다 — 이는 임상 성공률이 아닌 답변 간 상대적 선호도 신호다. 이 구분이 다음에 살펴볼 격차를 이해하는 틀을 제공한다.

루브릭을 설계한 연구소가 시험도 1등을 차지했다

그 격차의 모든 층위는 단일 주체가 만들어냈다. OpenAI는 2025년 5월 HealthBench를 저술했고, 2026년 4월 30일 arXiv에 제출한 HealthBench Professional도 직접 작성했다. 의사 기여자 모집도 OpenAI가 맡았는데 — 소비자 벤치마크에 262명, 임상의 버전에 190명이었다 — 그리고 자체 모델을 동일한 루브릭에 직접 대입해 평가했다. 두 논문 모두 외부 공동 저자가 없다. 시험관, 정답지, 최고 득점자가 모두 같은 주소를 공유한다.

그것만으로 결과가 틀렸다고 단정할 수는 없지만, 검증 가능한 범위를 좁힌다. HealthBench Professional 논문은 내부 평가 구현을 사용하며 비공개 홀드아웃 데이터셋을 보유한다고 명시한다 . 현실적 결과는 이렇다: 헤드라인 수치는 공개 자료만으로는 완전히 재현할 수 없다. 외부 팀이 방법론을 읽을 수는 있지만, 정확한 데이터에 동일한 채점 파이프라인을 재실행해 GPT-5.4가 의사 작성 기준선 43.7 대비 59.0을 기록했음을 직접 확인할 수는 없다 .

지표 자체도 '의사를 앞섰다'는 표현이 암시하는 것보다 훨씬 유연하다. 이 승리는 패널 선호도이다 — 의사 심사자들이 어떤 응답이 루브릭 기준을 더 잘 충족하는지를 평가한 것으로, 환자 결과를 기준으로 측정하는 대신 길이 조정 척도로 점수를 매긴다. 가장 어려운 레드팀 구간은 리커트 1–2 밴드이며 , 이는 환자가 올바르게 치료받았는지에 대한 기록이 아니라 답변 품질에 대한 판단이다. 논문은 이렇게 표현한다:

"절대 점수를 실제 임상 성과율로 해석해서는 안 된다" — HealthBench Professional, OpenAI (source: HealthBench Professional, 2026-04).

빠져 있는 것은 이 의문을 해소할 부분이다. 현재까지 HealthBench 채점 방법론에 대한 독립적인 동료 심사나 외부 복제 연구는 발표된 바 없다. 벤치마크 자체는 공개되어 있지만 , 임상의 대상 점수에는 앞서 언급한 자체 주의사항이 수반된다. 동일한 연구소가 생성·채점·보고한 선호도 신호는 합리적인 내부 개발 지표이다. 그러나 의사 대 AI라는 프레이밍이 독자에게 암시하는 외부 감사 증거로 보기에는 아직 이르며 — 다음 섹션에서는 이 간극을 보고된 격차의 규모와 견주어 검토한다.

59.0 대 43.7: 의사 선호도 격차

The doctor-vs-AI health exam that only one lab graded

헤드라인 수치는 15.3포인트 차이다: ChatGPT for Clinicians 내에서 실행된 GPT-5.4는 HealthBench Professional에서 전체 59.0을 기록한 반면, 의사 작성 기준선은 43.7이었다. 임상의 대상 튜닝 없이 동일한 기본 GPT-5.4는 48.1을 기록했다. 이 순서는 중요하다: 의사 대비 격차의 약 3분의 2는 기본 모델 단독이 아닌, 기본 모델 위에 적층된 전문가 RLHF 튜닝에서 비롯된다. 점수는 퍼센트 정확도가 아닌 길이 조정 루브릭 점수이며, OpenAI는 절대값을 실제 임상 성과율로 읽어서는 안 된다고 명시한다 .

격차는 벤치마크가 다루는 세 가지 과제 범주에 걸쳐 고르지 않다. 작업이 생성적이고 구조적인 곳 — 문서 초안 작성 — 에서 튜닝된 제품은 의사 기준선의 거의 두 배를 기록했다. 증거 종합이 필요한 곳에서는 격차가 한 자릿수로 줄어든다.

과제 범주튜닝 제품 (ChatGPT for Clinicians의 GPT-5.4)의사 작성격차
진료 상담51.042.7+8.3
문서 작성64.132.1+32.0
의학 연구67.056.3+10.7
가장 어려운 레드팀 구간 (리커트 1–2)55.830.0+25.8

가장 큰 격차는 적대적 구간에서 나타난다. 의사들이 모델을 무너뜨리기 위해 의도적으로 설계한 가장 어려운 레드팀 예시들 — 리커트 1–2 난이도 밴드 — 에서 튜닝된 제품은 55.8을 기록한 반면, 의사는 30.0, 기본 GPT-5.4는 26.2에 불과했다 . 기본 모델과 의사는 하위권에서 비슷한 수준이며, 튜닝된 제품만 앞서 나간다. 즉, 적대적 사례들이야말로 전문가 튜닝이 격차를 만들어내는 지점이며 — 레드팀 난이도가 결과를 채점한 동일 팀에 의해 정의된다는 점에서, 평가의 홀드아웃·자체 주관적 성격이 가장 중요하게 작용하는 지점이기도 하다.

한 가지 구분이 쉽게 뭉개지는데, 명확히 유지할 가치가 있다. 59.0 대 43.7 수치는 HealthBench Professional에서 나온 것으로, 임상의 작업 공간 내 GPT-5.4를 측정하는 525개 과제로 구성된 임상의 대상 테스트다 . 소비자 대상 '의사 작성 답변을 앞섰다'는 헤드라인은 별개의 시험이다: 2026년 6월 18일 health-intelligence 포스트에서 보고된 약 3,500개 응답에 걸친 블라인드 패널 비교로, 일반 사용자를 위한 GPT-5.5 Instant를 측정한다 . 동일한 프레이밍, 두 가지 모델, 두 가지 시험.

일반 소비자 답변 vs 임상의 자문: 전혀 다른 세 시험

현재 'AI가 의사와 대등하거나 능가한다'는 주장 뒤에는 세 가지 별도 연구가 있으며, 각각 다른 시스템을 다른 대상에게 다른 기준으로 평가한다. 소비자용 벤치마크인 HealthBench가 먼저 나왔고, HealthBench Professional은 1년 뒤 임상의를 위해 질문을 새롭게 설정했으며, 6월 18일 블라인드 패널은 별도로 보고된 세 번째 비교다. 이 세 결과를 하나로 묶는 것은 OpenAI가 실제로 무엇을 증명했는지 오독하는 가장 쉬운 방법이다.

2025년 5월 12일 발표된 HealthBench는 일반 사용자를 대상으로 한다. 60개국, 49개 언어, 26개 전문 분야에서 활동하는 의사 262명이 작성한 48,562개의 채점 기준에 따라 평가된 5,000개의 실제 소비자 건강 대화를 담고 있다 . 최고 성능 시스템인 o3는 60%를 기록해 GPT-4o의 32%, GPT-3.5 Turbo의 16%에서 크게 향상됐지만, 1,000개 예제로 구성된 HealthBench Hard 서브셋은 32% 상한선에서 포화되지 않은 채로 남아 있다 . 이 격차는 소비자용 모델이 여전히 실패하는 지점을 보여준다: 문맥 탐색과 최악의 상황에서의 신뢰성.

2026년 4월 30일 arXiv에 제출된 HealthBench Professional은 완전히 다른 도구다. 525개 작업은 임상의를 대상으로 하며 — 진료 상담, 문서 작성, 의학 연구 — 15,079개 후보에서 선별했고, 약 3분의 1은 의도적인 의사 레드팀 테스트이며 어려운 예제는 약 3.5배 강화됐다 . 이는 무료 ChatGPT에 입력하는 일반 사용자가 아닌, 임상의 작업 환경 내에서 GPT-5.4를 평가한다.

6월 18일 결과는 둘 다 아니다. 약 3,500개 응답에 걸친 블라인드 패널 선호도 비교로, 일반 사용자를 위한 GPT-5.5 Instant를 평가한다 . 다른 제품, 다른 채점 기준, 다른 대상 집단이다. 임상의 대상 성과는 기관용 도구인 ChatGPT for Clinicians에 속하고, 소비자 헤드라인은 무료 기본 모델에 속한다. HealthBench Professional 저자들이 주의를 당부하듯, 점수는 "정확도 퍼센트가 아니며" "실제 임상 성과율로 읽어서는 안 된다" .

두 연구를 혼동하면 어떤 시스템이, 어떤 기준으로, 어떤 대상에 대해 평가돼 각 주장을 얻었는지가 불분명해진다. 이 시스템들을 평가하는 개발자에게 그 구분이 바로 핵심 신호다.

독립 검증에서 드러나는 것들

The doctor-vs-AI health exam that only one lab graded

독립 검증은 외부 교차 확인이 없다는 사실을 발견할 것이다. 2026년 6월 현재, 어떤 외부 연구소도 HealthBench 또는 HealthBench Professional 채점의 재현 연구를 발표하지 않았으며, 설계 자체가 정확한 재현을 막는다: arXiv에 2026년 4월 30일 제출된 HealthBench Professional 논문은 내부 평가 구현을 사용하고 비공개 홀드아웃 세트를 보유한다고 명시하므로, 공개 자료만으로는 헤드라인 수치를 재현할 수 없다 . 벤치마크 저자, 의사 패널, 테스트된 모델 모두 단일 벤더로 귀결된다.

외부 검토자라면 두 가지 사항을 면밀히 살펴봐야 한다:

  • 71% 사실성 수치. OpenAI는 사실성 문제 가능성이 있는 것으로 표시된 응답 비율이 2개월에 걸쳐 71% 감소했다고 보고하며, 이는 매주 수십억 건 규모의 프라이버시 보호 프로덕션 모니터에서 도출됐다 . 해당 모니터의 기준 정의와 표시 방법론은 공개 발표에 공개되지 않았으므로, 이 수치는 외부적으로 검증된 오류율이 아닌 내부 표시 비율을 측정한다.
  • 감사받지 않은 주장의 위험성. 현재 진행 중인 소송은 이전 모델인 GPT-4o가 위험한 의학적 안내를 제공했다고 주장한다 . 매주 2억 3천만 명 이상의 건강 질문자에게 도달하는 시스템이 의사를 능가한다고 주장할 때, 선호도 신호와 임상 결과 시험 사이의 격차는 학문적인 문제가 아니다.

그 격차를 좁힐 수 있는 것은 제3자 재현이다. Meditron 및 Med-PaLM 계열과 같은 오픈 임상 모델이나 학술 의료 NLP 그룹의 교차 검증을 주시해야 하며, 이들은 공개된 기준으로 동일한 작업 패밀리를 채점할 수 있다. 규제 경로도 중요하다: FDA 지침은 특정 임상 의사결정 지원 기능을 기기 정의에서 제외하지만, 환자나 보호자를 대상으로 한 소프트웨어는 여전히 기기 정책의 적용을 받을 수 있으며, 의료기기로서의 AI 소프트웨어는 위험도에 따라 시판 전 검토가 필요할 수 있다 . OpenAI 자체가 명시하듯, ChatGPT Health는 진단이나 치료용이 아니며 임상 진료를 대체가 아닌 지원하기 위한 것이다 . 독립적인 연구소가 같은 시험을 채점하기 전까지, 이 결과는 확정된 발견이 아니라 강력한 자사 신호로 남는다.

헬스 AI의 책임과 감독

헬스 AI의 법적·규제적 리스크는 의도된 사용 목적에 따라 결정되며, OpenAI의 프레이밍도 그 경계를 중심으로 구성되어 있습니다. ChatGPT Health가 진단이나 치료가 아닌 보조 목적으로 설계되었다고 명시함으로써, OpenAI는 해당 소비자 제품을 가장 엄격한 기기 분류 기준 밖에 위치시킵니다 — 비진단 선언이 FDA 적용 제외를 위한 핵심 수단입니다. 미국 FDA 가이던스는 특정 임상 의사결정 지원 기능을 기기 정의에서 제외하지만, 환자나 보호자를 대상으로 하는 소프트웨어는 위험도와 의도된 사용 목적에 따라 의료기기로 분류되어 사전 심사가 필요할 수 있습니다 . "대체가 아닌 보조"라는 표현은 포지셔닝 선택일 뿐, 규제 면제가 아닙니다.

이 구분이 중요한 이유는 결과가 구체적이기 때문입니다. 이전 모델인 GPT-4o가 위험한 의료 조언을 제공했다는 소송이 현재 진행 중입니다 . 의사 선호도 벤치마크에서 우수한 성적을 거뒀다고 해서 책임 문제가 해소되지는 않습니다. 블라인드 패널에서 의사보다 높은 평가를 받은 답변도 개별 사례에서 피해를 줄 수 있으며, 평가 지표 점수는 임상 결과 근거가 아닙니다.

이러한 아키텍처는 소비자 용도와 기관 용도 사이의 규정 준수 격차를 반영합니다. 2026년 1월 발표된 ChatGPT Health는 별도 메모리를 사용하고, 건강 관련 대화·앱·파일을 분리 저장하며, 추가 암호화와 격리를 적용하고, 헬스 대화를 파운데이션 모델 학습에서 제외합니다 . 이러한 통제 장치는 HIPAA 인접 맥락에서 의미가 있지만, 그것만으로 무료 소비자 챗봇이 관리·감사된 임상 시스템이 되지는 않습니다.

그 목적을 위해 OpenAI는 별도 티어를 구축했습니다. 2026년 1월 8일 출시된 OpenAI for Healthcare는 HIPAA 준수를 위한 BAA 지원, PHI 통제, 인용이 포함된 근거 검색, 정책 정렬을 제공하며, 8개 초기 병원 파트너 — AdventHealth, Baylor Scott & White Health, Boston Children's Hospital, Cedars-Sinai, HCA Healthcare, Memorial Sloan Kettering, Stanford Medicine Children's Health, UCSF — 를 공개했습니다. 제품은 GPT-5.2 모델이 구동하며 PHI는 기관 통제 하에 관리됩니다 .

핵심 요점은 이렇습니다. 두 제품은 두 가지 리스크 프로파일을 갖습니다. 규정 준수 등급의 기관 티어는 BAA와 PHI 통제 뒤에 자리하고, 의사를 "앞섰다"는 무료 GPT-5.5 Instant 기본값은 비진단 고지문만을 갖습니다. 소비자 벤치마크 결과는 트리아지와 설명을 위한 1차 신호로 활용하십시오 — 임상적 판단의 대체재가 아니며, 확립된 규제 또는 책임 입장도 아닙니다.

자주 묻는 질문

HealthBench Professional이란 무엇이며, HealthBench와 어떻게 다른가요?

두 벤치마크 모두 OpenAI의 자체 의료 평가 도구이지만, 대상 사용자층이 다릅니다. 원래의 HealthBench는 2025년 5월 12일에 소개된 소비자용 케어 평가로, 262명의 의사가 참여해 구축한 5,000개의 실제적인 의료 대화와 48,562개의 의사 작성 채점 기준으로 이루어져 있습니다 . HealthBench Professional은 2026년 4월 30일 arXiv에 게재되었으며, 소비자가 아닌 임상의를 대상으로 합니다. 15,079개 후보 중 선별된 525개의 임상의 대면 과제로 구성되고, 190명의 의사 기여자가 참여했으며, 전체 세트의 약 3분의 1이 의도적인 의사 레드팀 테스트 및 약 3.5배 강화된 고난도 예시로 채워져 있습니다 . 동일한 연구소, 다른 사용자층, 더 높은 난이도 분포입니다.

GPT-5.5 Instant의 의료 기능 개선은 무료 티어에서도 이용할 수 있나요?

네. GPT-5.5 Instant는 2026년 5월부터 무료 ChatGPT 사용자의 기본 모델이 되었으며, 사용량 제한이 있지만 유료 플랜이 아닌 해당 티어에서 의료 튜닝이 제공됩니다 . 이것이 핵심 변화입니다. 진료 기록과 건강 앱을 연결해 개인 맥락을 제공하는 전용 공간인 ChatGPT Health는 별도 서비스로, 여전히 대기자 명단을 통해서만 접근할 수 있으며 EEA·스위스·영국은 이용 대상에서 제외되고, 일부 진료 기록 연동 기능은 미국에서만 사용 가능합니다 .

HealthBench Professional 결과를 독립적으로 재현할 수 없는 이유는 무엇인가요?

OpenAI가 비공개 보류 세트를 유지하고 내부 평가 구현을 사용하기 때문에, 채점 기준 가중치와 전체 과제 분포가 정확한 재현을 허용하는 형태로 공개되지 않습니다 . arXiv 논문을 통해 방법론의 일부는 검증할 수 있지만, 핵심 수치는 공개 자료만으로는 완전히 재현할 수 없습니다. 또한 해당 연구소가 벤치마크를 직접 구축하고 의사 네트워크를 제공하며 자사 모델을 테스트했기 때문에, 우월성 주장은 외부 검증을 기다리는 자체 평가 신호에 불과합니다.

59.0 대 43.7 점수는 약 3,500개 응답 소비자 비교 연구와 동일한 연구인가요?

아닙니다. 두 결과는 별개의 시험에서 나온 것입니다. 59.0 대 43.7 수치는 HealthBench Professional에서 나온 것으로, ChatGPT for Clinicians 내에서 실행된 GPT-5.4가 전문 분야별로 매칭된 의사 작성 응답의 43.7점(및 기본 GPT-5.4의 48.1점)에 대해 종합 59.0점을 기록한 결과입니다 . 별도로 보고된 소비자 연구에서는 의사들이 약 3,500개의 응답을 맹검 평가했으며, 정확성·소통·완성도 측면에서 GPT-5.5 Instant를 의사 작성 답변보다 선호하는 것으로 나타났습니다 . 다른 제품, 다른 사용자층, 다른 채점 기준입니다.

FDA 규정이 ChatGPT Health에 적용되나요?

사용 목적에 따라 다릅니다. FDA 지침은 일부 임상 의사결정 지원 기능을 의료기기 정의에서 제외하지만, 환자 또는 보호자를 대상으로 하는 소프트웨어는 여전히 의료기기 정책 적용 대상이 될 수 있으며, 의료기기로서의 AI 소프트웨어는 위험도에 따라 시판 전 심사가 필요할 수 있습니다 . OpenAI는 ChatGPT Health를 진단 목적이 아닌, 임상의 케어를 대체하는 것이 아니라 보조하는 도구로 설명합니다 . 이러한 포지셔닝이 주요 규제 수단이지만, 의료기기 정의 기준에 대해 공식적으로 검증된 바는 없으며, 이전 모델의 의료 안내를 둘러싼 현재 진행 중인 소송은 그 위험성을 잘 보여줍니다.