AMIE 만성질환 논문은 강력하다. 단서 조항은 그보다 더 길다.

AMIE, 장기 만성질환 관리로 확장: 627개 가이드라인, 케어 플랜 품질 88% vs PCP 74%, 약물 지식 상한 73%.

AMIE 만성질환 논문은 강력하다. 단서 조항은 그보다 더 길다.
Share

Google의 의료 AI가 '무엇이 문제인가?'라는 질문을 넘어, '앞으로 세 번의 진료에서 어떻게 대처할 것인가?'라는 더 어려운 질문으로 나아갔습니다. 결과는 인상적이면서도 신중한 단서가 달린 지점 어딘가에 자리합니다.

AMIE 만성질환 논문의 핵심 발견

AMIE(Articulate Medical Intelligence Explorer)는 3회의 맹검 시뮬레이션 가상 진료 전반에 걸쳐, 관리 계획 품질 15개 평가 축에서 보드 인증 1차 진료 의사 21명과 동등하거나 이를 상회했습니다. Google Research의 발표입니다 . 이것이 질병 관리 연구(사전 인쇄본 arXiv:2503.06074, 2025년 3월 8일 제출)의 핵심 주장이지만 , 연구 결과일 뿐 출시된 제품이 아닙니다.

전문가 평가단이 도출한 핵심 수치는 다음과 같습니다. 첫 번째 진료의 치료 계획 적절성에서 AMIE는 88%, 1차 진료 의사(PCP)는 74%(p = 0.019)를 기록했습니다 . 평가는 심장내과, 호흡기내과, 산부인과/비뇨기과, 소화기내과, 신경과 5개 전문 분야에 걸쳐 100개의 다중 방문 시나리오를 아우르며, 검증된 환자 역할 배우 21명과 전문가 평가자 10명이 참여했고 모두 출처를 알지 못한 상태에서 평가했습니다 .

그러나 하나의 논문 안에 두 가지 상반된 이야기가 공존합니다. 계획 품질 측면에서는 정밀도와 가이드라인 근거에서 AMIE가 우세했지만, 새로운 RxQA 벤치마크로 별도 측정한 처방 능력은 두 그룹 모두 75% 미만에 그쳐, 깔끔한 승리가 아닌 명확한 상한선을 드러냈습니다 . 이 글의 나머지 부분에서는 AMIE가 실제로 무엇을 바꿨는지, 추론의 근거를 어떻게 마련하는지, 그리고 시뮬레이션 설정이 실제 만성 질환 치료에 어디까지 미치지 못하는지를 살펴봅니다.

진단에서 장기적 관리로: 핵심 전환

AMIE's chronic care paper is strong. The fine print is longer.

이 전환은 단순한 모델 업그레이드가 아니라 질문 자체의 변화입니다. 2024년 1월 11일 사전 인쇄본으로 제출되어 Nature에 게재된 초기 AMIE 는 PaLM 2 기반 시스템으로, 단일 진료를 위해 설계되었습니다. 텍스트 채팅으로 병력을 청취하고 감별 진단을 출력하는 방식입니다. 2025년 3월 8일 제출된 새 질병 관리 논문 은 기반 모델을 Gemini 1.5 Flash로 교체하고, 진료 간 지속 상태를 추가하며, 각 진료마다 구조화되고 인용 근거가 뒷받침된 관리 계획을 생성합니다 .

쉽게 말해, 범위가 'AI가 올바른 감별 진단에 도달할 수 있는가?'에서 '근거가 변화함에 따라 AI가 세 번의 진료에 걸쳐 환자를 관리할 수 있는가?'로 이동합니다. 이는 전혀 다른 공학적 과제입니다. 진단은 고정된 병력에 대한 일회성 추론이지만, 관리는 각 진료가 이전 내용을 기억하고 검사 결과에 반응하며 이전 결정과 모순 없이 치료를 조정해야 하는 상태 기반 루프입니다.

케이스 설계에는 이러한 특성이 반영되어 있습니다. 연구 설계상 최소 24시간 간격을 둔 3회 진료로 구성된 100개의 다중 방문 시나리오 전반에 걸쳐, 연구팀은 단일 추론 모델에 유리한 깔끔한 사례 대신 진화하는 증상, 치료 반응, 검사 및 영상 결과, 내부 불일치, 다중 질환을 의도적으로 포함시켰습니다 . 다중 방문 구조가 방법론적 혁신점입니다. 고립된 정확도가 아닌, 진료 에피소드 전반에 걸친 기억, 종합, 일관된 소통 능력을 검증합니다.

저자들은 이것이 여전히 제한된 테스트임을 명시합니다. Google Research 팀이 이전 OSCE 형식에 대해 언급하듯, 동기식 텍스트 채팅은 "의사에게 익숙하지 않으며 일반적인 임상 실습이 아닙니다." 이 단서는 종단적 설계에도 그대로 이어집니다 . 이 재구성이 중요한 이유는, 이후에 다루는 모든 내용—근거 설정, 진료 전반의 계획 품질, 처방 한계—의 토대가 되기 때문입니다.

AMIE가 대화와 임상 계획을 나누는 방식

AMIE는 역할을 둘로 나눕니다. 환자를 직접 대면하는 대화 에이전트(Dialogue Agent)가 실시간 공감 대화를 담당하고, 별도의 느린 Mx(관리 추론) 에이전트가 진료 계획을 제시하기 전에 오프라인에서 가이드라인 교차 검증을 수행합니다 . 두 에이전트 모두 Gemini 1.5 Flash 기반이지만, 각각 상반된 우선순위로 조정되어 있습니다. 한쪽은 응답 속도, 다른 쪽은 감사 가능한 추론입니다. 이 설계 패턴은 임상 AI를 구축하는 누구에게나 직접 적용할 수 있는 가장 핵심적인 교훈입니다.

핵심 요약: AMIE는 이중 에이전트 구조를 사용합니다. 대화 에이전트가 환자와 실시간으로 대화하는 동안, 느린 Mx 에이전트는 오프라인에서 임상 가이드라인을 검토해 네 가지 후보 계획을 초안으로 작성한 뒤 병합하고, 모든 권고사항에 가이드라인 출처를 첨부합니다. 감사 가능한 추론 과정이 응답 지연 경로 밖에서 이루어지는 구조입니다 .

Mx 에이전트는 한 번에 답을 내지 않습니다. 네 가지 독립적인 관리 계획 초안을 생성한 뒤, 이를 정제·병합해 단일 권고 세트로 만들고, 대화에 전달하기 전에 각 권고사항에 가이드라인 출처를 첨부합니다 . 초안 작성과 병합 단계는 앙상블처럼 작동합니다. 첫 번째로 그럴듯한 계획을 바로 내놓는 대신, 확정하기 전에 경쟁하는 선택지들을 수면 위로 올립니다. 구축자 입장에서 핵심 교훈은, 여기서 계획 품질이 단일 프롬프트가 아니라 의도적인 다중 초안 추론의 결과라는 점입니다.

약물 지식은 기억 문제가 아닌 그라운딩 문제로 취급됩니다. 용량이나 상호작용을 기본 모델의 파라메트릭 메모리에 의존하는 대신, Mx 에이전트는 영국 국가 처방집(British National Formulary)FDA/OpenFDA 라벨링을 기준으로 처방을 검증합니다 . 팀이 이를 직접 테스트하기 위해 별도의 RxQA 벤치마크를 구축했다는 점에서도 같은 방향성이 드러납니다. 약물 안전이 우발적으로 나타나는 모델 동작이 아니라 감사 가능한 독립 서브시스템으로 설계되었다는 신호입니다.

두 컴포넌트를 분리한 이유는 외형적인 것이 아니라 운영상의 필요 때문입니다. Mx 에이전트의 검색, 다중 초안 생성, 출처 첨부 단계는 비용이 큽니다. 이를 환자 응답 처리 안에서 실행하면 모든 메시지에 지연이 발생합니다. 해당 추론을 오프라인으로 분리함으로써 AMIE는 출처가 명시되고 추적 가능한 계획을 생성하면서도, 대화 에이전트는 유창한 대화 흐름을 유지합니다.

"사용자 대면 대화 에이전트가 실시간 대화를 관리하는 동안, 별도의 관리 추론 에이전트가 권위 있는 임상 지식을 교차 검증해 구조화된 출처 기반 계획을 생성합니다"라고 Google Research 및 Google DeepMind 팀은 밝혔습니다 (source: Google Research).

이 구분—앞단의 공감 대화, 뒷단의 느리고 가이드라인에 기반한 추론—은 의료 분야를 넘어 적용할 수 있는 아키텍처 교훈입니다. 답변이 빠르면서도 방어 가능해야 하는 곳이라면 어디서든, 응답 레이어와 검증 레이어를 분리하면 서로 타협 없이 각자 최적화할 수 있습니다 .

AMIE 진료 계획의 토대가 되는 627개 가이드라인 코퍼스

AMIE's chronic care paper is strong. The fine print is longer.

Mx 에이전트의 권위는 모델의 파라메트릭 메모리가 아닌 고정 참고 라이브러리에서 나옵니다. AMIE의 추론 레이어는 총 약 1,050만 토큰 규모의 큐레이션된 임상 지식을 담은 627개 문서 코퍼스(NICE 가이던스 527개, BMJ Best Practice 100개)를 활용합니다 . 모든 출처 기반 관리 계획은 이 코퍼스에 대해 검증되므로, 시스템이 권고사항에 명시적인 가이드라인 근거를 달 수 있습니다. 검증 불가능한 주장이 아닌 것입니다.

명확한 엔지니어링 제약이 존재합니다. 여기서 사용하는 기본 모델인 Gemini 1.5 Flash의 컨텍스트 창은 약 200만 토큰인 반면, 가이드라인 코퍼스는 이를 약 5배 초과합니다 . 이 규모에서는 전체 컨텍스트 로딩이 불가능하므로, AMIE는 추론 시점에 검색을 수행합니다. Gecko 1B 임베딩과 모델이 생성한 검색 쿼리로 관련 자료를 선별하며, 외부 지식에 추론 호출당 256,000토큰을 할당해 케이스당 평균 약 6개의 가이드라인 문서를 가져옵니다 .

지식 레이어규모활용 방식
전체 가이드라인 코퍼스627개 문서 / 약 1,050만 토큰인덱싱만, 직접 로딩 없음
Gemini 1.5 Flash 컨텍스트약 200만 토큰하드 상한 (코퍼스의 1/5)
호출당 외부 지식 예산256K 토큰Gecko 1B 임베딩으로 검색
케이스당 사용 문서 수평균 약 6개생성된 검색 쿼리로 선별

약물 지식도 동일한 그라운딩 원칙을 따릅니다. 파라메트릭 메모리에 의존하는 대신, AMIE는 영국 국가 처방집(British National Formulary)OpenFDA를 통한 FDA 라벨링을 기준으로 약물 추론을 검증합니다 . 이후 에이전트는 네 가지 관리 계획 초안을 생성하고, 이를 정제·병합한 결과에 가이드라인 출처를 첨부합니다.

이 시사점은 임상 AI를 훨씬 넘어 일반화됩니다. 아무리 크고 권위 있는 코퍼스라도 컨텍스트 안에 모두 담을 수는 없습니다. 이 규모에서는 추론 시점의 검색만이 실용적인 패턴입니다. 구축자 입장에서의 교훈은, 그라운딩 품질이 원시 컨텍스트 크기보다 임베딩 모델, 쿼리 생성, 그리고 호출당 할당하는 토큰 예산에 더 크게 달려 있다는 것입니다.

진료 계획에서 AMIE 대 일차진료의: 방문별 전문가 평가

10명의 전문가 평가자가 블라인드로 채점했을 때, AMIE는 3회 방문에 걸쳐 15개의 관리 계획 품질 항목 전체에서 21명의 전문의 자격증을 보유한 일차진료의(PCP)에 비해 비열등한 것으로 평가되었으며, 정밀도와 가이드라인 근거 측면에서는 명확히 더 우수했습니다 . 수치보다 패턴이 더 중요합니다. AMIE에 유리한 격차는 검색 기반 추론 에이전트라면 당연히 낼 법한 결과(가이드라인 외 치료 감소, 명시적 인용 증가)이며, 그 중 여럿은 치료 과정이 진행될수록 더 벌어집니다.

치료 정밀도는 데이터셋에서 가장 크고 가장 일관된 격차 항목입니다. AMIE는 3회 방문에 걸쳐 94% / 90% / 91%를 기록한 반면 PCP는 67% / 70% / 70%였습니다 . 치료 권고의 가이드라인 일치도 역시 AMIE가 우세했으며 시간이 지날수록 높아졌습니다: 89% / 91% / 93% 대 75% / 76% / 81%. 계획 내 명시적 가이드라인 참조는 AMIE가 거의 완벽(98% / 100% / 100%)했고, PCP는 ~87%로 안정적이었습니다 .

지표 (1차 / 2차 / 3차 방문)AMIEPCP
치료 정밀도94% / 90% / 91%67% / 70% / 70%
치료 가이드라인 일치도89% / 91% / 93%75% / 76% / 81%
명시적 가이드라인 참조98% / 100% / 100%86% / 87% / 88%
초진 계획 적절성88%74%

초진 전체 계획 적절성은 AMIE 88% 대 PCP 74%(p = 0.019), 첫 번째 추적 방문에서의 적절한 치료는 85% 대 71%(p = 0.014)였으며, 추적 검사 정밀도는 2차 방문에서 99% 대 84%, 3차 방문에서 100% 대 88%에 달했습니다 . 방향이 일관적이라는 것 자체가 신호입니다. 세 번의 분리된 방문에 걸쳐 유지되는 정밀도 우위는 단일 우연한 결과로 보기 어렵습니다.

정성적 지표는 이야기에 균형을 잡아줍니다. 모니터링과 조정, 공유 의사결정, 경쟁 우선순위, 예후 판단, 진료 구성을 다루는 관리 추론 경험적 핵심 기능 루브릭(MXEKF)에서 비교의 약 절반은 동점이거나 해당 없음이었습니다. 평가자가 선호를 표현한 경우, 51개의 평가자-항목-방문 조합에 걸쳐 AMIE의 중앙값 승률은 42%였고 PCP는 8%였습니다 .

"AMIE는 관리 계획 품질 항목 전반에 걸쳐 PCP에 비해 비열등했으며, 더 높은 정밀도와 가이드라인 기반 추론을 보여주었습니다"라고 Google Research 및 DeepMind 팀은 보고했으며, 이 결과를 전면 대체가 아닌 더 탄탄한 근거를 갖춘 동등한 판단력으로 규정했습니다 (source: Google Research).

수치를 꼼꼼히 읽으면, AMIE가 가이드라인 준수에 더 일관적이고 출처 인용에 더 뛰어나지만, 정량화하기 어려운 추론 능력에 대해서는 평가자들이 거의 균등하게 갈렸습니다. 이것은 정밀도와 추적 가능성의 승리이지, 더 나은 임상적 판단의 증거가 아닙니다. 다음 섹션의 처방 결과는 이 구분을 더욱 선명하게 합니다.

만성 질환 약물 처방: 한계선은 어디인가

AMIE's chronic care paper is strong. The fine print is longer.

처방은 AMIE의 우위가 솔직한 수준으로 좁혀지는 영역입니다. 약물 안전성을 직접 탐구하기 위해 팀은 OpenFDA와 영국 국가 처방집(BNF)에서 도출하고 전문 약사들이 검토한 600문항 다지선다 벤치마크인 RxQA를 구축했습니다. 항목은 적응증, 금기, 용량, 부작용, 상호작용을 포함합니다 . 문항은 난이도 낮음 282개, 난이도 높음 318개로 구분되며, AMIE의 약물 지식은 모수적 기억에 의존하지 않고 BNF와 FDA 라벨링을 기반으로 합니다 . RxQA는 점수판보다 재사용 가능한 공개 산출물로서 더 큰 의미가 있습니다. 임상 AI 개발자들은 자신의 시스템으로 동일한 문항을 풀어 약리학적 추론을 스트레스 테스트할 수 있습니다.

점수는 낙관을 경계하게 합니다. 난이도 낮음 오픈북 문항에서 최고 성능은 AMIE 73.8%, PCP 67.4%였습니다 . 격차는 실재하지만 절대적 상한선이 높지 않습니다. 참고 자료를 펼쳐놓고도 어느 그룹도 75%를 넘지 못했습니다. 난이도 높은 문항에서도 순위는 유지됐고 격차는 벌어졌습니다: 오픈북에서 AMIE 57.9% 대 47.8%(p < 0.001), 클로즈드북에서 50.6% 대 41.5%(p = 0.013)였습니다 .

진료 계획 평가와 대조해보면, 패턴은 모순되기보다 일관됩니다. AMIE는 가이드라인 준수에 더 안정적이고 단독 약리학 문항에서 임상의를 소폭 앞서지만, 인위적으로 구성된 선택형 시험에서 75% 미만의 최고 성능은 자율적 용량 적정이나 상호작용 검사를 운영 환경에 적용하려는 사람에게 냉정한 데이터 포인트입니다. 난이도 높은 용량 및 금기 문항은 오답이 환자에게 해를 끼치는 영역인데, 바로 거기서 양 그룹 모두 여전히 약 절반을 틀렸습니다. 개발자들에게 시사점: 기반 약물 지식은 확정된 역량이 아닌 검증이 필요한 보조 수단으로 다루고, RxQA는 배포 전에 한계를 드러내는 적대적 벤치마크로 활용하십시오.

AMIE 만성질환 시뮬레이션 케어가 아직 다루지 못하는 것들

AMIE의 만성질환 케어 결과는 시뮬레이션된 텍스트 전용 OSCE 환경에서 도출된 것으로, 실제 질환 관리에 필수적인 임상 정보 환경이 빠져 있습니다. EHR 차트 접근, 영상 검토, 실제 검사 연동, 오더 입력 기능이 없으며, 시스템은 오직 채팅 기록으로 전달된 정보만을 바탕으로 추론합니다 . 깔끔하게 정리된 대화 속에서는 엄밀해 보이는 케어 플랜도, 복잡한 차트나 판독이 애매한 영상, 상충하는 기존 오더와 맞닥뜨리면 무너질 수 있습니다.

앞선 섹션의 수치를 일반화하는 데는 두 가지 추가적인 제약이 있습니다:

  • 압축된 타임라인. 연구 설계상 케이스당 세 번의 진료는 최소 24시간 간격으로 이루어졌지만, 실제 만성질환은 진료와 진료 사이가 몇 주 또는 몇 달에 걸쳐 전개됩니다 . 종단적 기억에 대한 검증은 이루어진 셈이지만, 장기 간격에 걸친 변화 추적에 대한 검증은 이루어지지 않았습니다.
  • 영국 중심 가이드라인. 627개 문서 코퍼스는 NICE 가이던스와 BMJ Best Practice를 기반으로 하며, 다른 의료 체계에 맞춘 지역 처방집 적용은 포함되지 않았습니다 . 특정 국가의 진료 경로에 근거한 플랜은 수정 없이 다른 국가에 그대로 적용할 수 없습니다.

저자들은 임상 적용까지의 간극을 명확히 지적합니다. AMIE의 코드와 가중치는 환자 안전을 이유로 오픈소스로 공개되지 않으며, 실제 임상 활용 전에 윤리적·안전 감독 하에 전향적 타당성 연구가 선행되어야 한다고 촉구합니다 .

"임상 활용을 위해서는 적절한 윤리적·안전 감독을 갖춘 전향적 타당성 연구가 필요합니다." — Google Research / DeepMind AMIE 팀 (source: Google Research).

이 신중한 태도는 현재까지 유일한 실세계 데이터 포인트가 뒷받침해 줍니다. 2026년에 진행된 별도의 타당성 연구에서 성인 긴급 진료 환자 100명을 대상으로 한 결과, 안전 감독관의 중단 조치는 없었고 AMIE의 감별 진단 목록에 최종 진단이 포함된 비율은 90%, 상위 3위 이내 정확도는 75%였습니다. 그러나 이는 진료 전 진단 지원이었을 뿐 종단적 관리가 아니었으며, 케어 플랜의 실용성과 비용 효과성에서는 여전히 일차의료의사가 AMIE를 앞섰습니다 .

핵심 시사점은 이렇습니다. 이 논문은 통제된 환경에서 가이드라인 기반의 다회 방문 추론이 일차의료의사에 필적할 수 있다는 강력한 존재 증명으로 읽어야지, 안전한 자율적 만성질환 케어의 근거로 받아들여서는 안 됩니다. 이 패턴을 기반으로 무언가를 구축한다면, 시뮬레이션 OSCE 수치를 상한선으로 삼고, AMIE가 전혀 다루지 않은 EHR·영상·오더 입력 영역까지 설계 범위에 포함하며, 지역 가이드라인 적용과 전향적 임상시험을 선택 사항이 아닌 필수 전제 조건으로 간주해야 합니다.

자주 묻는 질문

AMIE 질병 관리 논문은 초기 진단 AMIE 연구와 어떻게 다른가요?

두 연구는 이름을 공유하지만 기반 모델, 범위, 결과 측정 도구에서 차이가 있습니다. 초기 AMIE("Towards conversational diagnostic artificial intelligence," arXiv:2401.05654, 2024년 1월 제출)는 PaLM 2 기반 시스템으로 단일 방문 병력 청취와 감별 진단에 최적화되었으며, 149개 OSCE 시나리오로 평가되었습니다 . 질병 관리 논문(arXiv:2503.06074, 2025년 3월 제출)은 기반 모델을 Gemini 1.5 Flash로 전환하고, 3회 방문에 걸친 지속적 상태 관리를 추가하였으며, 진단 중심 지표를 15개 관리 계획 품질 축·가이드라인 근거·전용 처방 벤치마크(RxQA)로 대체했습니다 .

AMIE 만성 질환 관리 설계의 Mx 구성 요소란 — 왜 분리가 중요한가요?

Mx 에이전트는 실시간 환자 대화와 분리되어 느리게, 오프라인으로 실행되는 전용 관리 추론 레이어입니다. 실시간 대화는 별도의 공감형 대화 에이전트가 담당합니다. Mx 에이전트는 627개 문서로 구성된 가이드라인 코퍼스를 조회하고, 네 가지 독립적인 관리 계획 초안을 생성한 뒤 이를 정제·통합하며, 각 권고 사항에 가이드라인 출처를 주석으로 답니다 . 분리가 중요한 이유는 응답성 있는 대화를 방해하지 않으면서도 감사 가능하고 출처가 명시된 계획을 생성할 수 있기 때문입니다. 개발자에게 전이 가능한 패턴이 바로 이것입니다: 사용자 대면 대화와 무거운 검색 기반 추론을 분리하세요.

RxQA란 무엇이며, 자체 임상 AI 시스템 벤치마킹에 활용할 수 있나요?

RxQA는 이 논문에서 도입된 600문항 객관식 약리학 벤치마크로, OpenFDA와 British National Formulary에서 도출되어 전문의 자격을 갖춘 약사들이 검토했습니다. 적응증, 금기사항, 용량, 부작용, 상호작용을 다루며 난이도 낮은 282문항과 난이도 높은 318문항으로 구성됩니다 . 저자들은 이를 안전 처방 평가를 위한 재사용 가능한 커뮤니티 벤치마크로 제시하고 있습니다. 자체 테스트 스위트에 통합하기 전에 논문의 보충 자료에서 접근 방법을 먼저 확인하세요.

AMIE의 만성 질환 관리 기능은 API나 오픈소스로 제공되나요?

아니요. AMIE의 코드와 모델 가중치는 오픈소스로 공개되지 않으며, 저자들은 환자 안전을 명시적인 이유로 밝히고 있습니다 . 다운로드 가능한 SDK, API 엔드포인트, 체크포인트는 없습니다. 공개된 것은 아키텍처입니다: 별도의 대화 에이전트와 관리 추론 에이전트, 가이드라인 코퍼스 기반 검색, 공인 라벨링을 활용한 약물 근거화입니다. 이 패턴은 문서화되어 있어 자체 스택으로 재현할 수 있지만, AMIE 자체를 호출하거나 파인튜닝하는 것은 불가능합니다.

'PCP 대비 비열등' — 이 평가에서 실제로 무슨 의미인가요?

이는 각 계획의 출처를 모른 채 평가한 전문의 평가자들이, 15개 관리 축에 걸쳐 3회 방문 동안 AMIE의 관리 계획이 전문의 자격을 갖춘 일차 진료의(PCP)의 계획과 적어도 동등하며 정밀도와 가이드라인 근거 측면에서는 더 우수하다고 판단했음을 의미합니다 . AMIE가 안전하거나 자율적 임상 사용에 준비되었다는 의미는 아닙니다. 이 결과는 EHR 연동 없이, 실제 처방 입력 없이, 환자 결과 측정 없이 진행된 시뮬레이션 텍스트 전용 OSCE 환경 안에서만 유효합니다. 저자들은 실제 환경에서의 사용은 윤리적·안전 감독이 포함된 전향적 타당성 연구가 선행되어야 한다고 명시하고 있습니다.