HiRO-ACE, 기후 에뮬레이션을 45분으로 단축 — 한계도 있다

Ai2 HiRO-ACE: ACE2S 확률 에뮬레이터 + HiRO 32배 확산 다운스케일러. 3km 강수량을 45분에. Apache-2.0.

HiRO-ACE, 기후 에뮬레이션을 45분으로 단축 — 한계도 있다
Share

킬로미터 규모의 기후 시뮬레이션을 실행하려면 보통 슈퍼컴퓨터를 몇 달씩 예약해야 합니다. Ai2의 최신 오픈 웨이트 릴리스는 다른 선택지를 제안합니다. 물리 과정을 신경망으로 에뮬레이션하고, 단일 GPU에서 지역별 고해상도 강수량을 얻는 방식입니다.

HiRO-ACE 한눈에: ACE2S 확률적 에뮬레이터와 HiRO 확산 다운스케일러의 결합

HiRO-ACE는 Allen Institute for AI(Ai2)가 공개한 오픈 웨이트 2모델 시스템으로, 킬로미터 규모 기후 모델을 에뮬레이션하고 다운스케일링합니다. 2026년 1월 21일 발표된 이 시스템은 확률적 전 지구 대기 에뮬레이터인 ACE2S와, 거친 대기장을 3 km 지표 강수량으로 변환하는 확산 기반 다운스케일러 HiRO를 결합합니다. 이 작업은 NOAA의 Geophysical Fluid Dynamics Laboratory와 함께 수행됐으며, 2025년 12월 20일 제출된 기술 보고서 arXiv:2512.18224에 문서화되어 있습니다 .

ACE2S가 핵심 엔진입니다. 1° × 1°(약 100 km) 해상도의 확률적 자기회귀 전 지구 대기 에뮬레이터로, 6시간 간격으로 상태를 전진시키며 기온, 습도, 바람, 강수량을 출력합니다 . 이는 결정론적 ACE2 모델의 생성형 변형으로, 수 시간에서 수 세기에 이르는 시간 규모의 전 지구 대기 변동성을 시뮬레이션하는 Ai2의 더 넓은 ai2cm/ace 계열 안에 자리합니다.

HiRO(High Resolution Output)는 공간적 세부 묘사를 맡습니다. 이 확산 모델은 32배 다운스케일링을 수행해, ACE2S의 100 km 거친 장을 사용자가 지정한 지역의 3 km 해상도 6시간 평균 지표 강수량으로 변환합니다 . 역할 분담은 의도적입니다. ACE2S가 빠르고 긴 전 지구 롤아웃을 처리하고, HiRO가 필요할 때 지역별 킬로미터 규모 강수 구조를 더합니다.

이 시스템의 토대는 학습 목표에 있습니다. 두 구성 요소 모두 거친 재분석 자료나 저해상도 물리 모델이 아니라, GFDL의 10년치 X-SHiELD 시뮬레이션, 즉 3 km 전 지구 폭풍 해상 물리 모델을 기반으로 학습됩니다 . 다시 말해 이 ML 시스템은 실제 킬로미터 규모 모델을 모방하도록 학습하기 때문에, 대류 규모 강수 출력이 매끈하게 뭉개진 결과가 아니라 그럴듯한 구조를 갖게 됩니다.

이 산출물은 Hugging Face의 체크포인트 번들로 제공됩니다. allenai/HiRO-ACE 저장소에는 다음이 공개되어 있습니다.

  • ACE2S.ckpt — 대기 에뮬레이터, 1.83 GB
  • HiRO.ckpt — 다운스케일러, 921 MB
  • 추론 설정, 강제력 데이터, 초기 조건, run-hiro-ace.sh 스크립트 — 총 9.08 GB

이 저장소는 Apache-2.0 라이선스로 제공되며 Ai2의 Responsible Use Guidelines를 따릅니다. 학습과 추론은 fme 패키지로 처리됩니다 . 논문만 있는 결과가 아니라 오픈 웨이트와 실행 가능한 스크립트를 함께 묶어 제공한다는 점이 실용적인 핵심입니다. 두 체크포인트를 내려받아 로컬에서 워크플로를 재현할 수 있습니다.

ACE2S가 확률적이어야 하는 이유: 결정론적 에뮬레이터가 놓치는 강수 변동성 문제

HiRO-ACE cuts climate emulation to 45 minutes — with a ceiling

ACE2S가 확률적 모델인 이유는 결정론적 에뮬레이터가 강수 연구에서 가장 중요한 대상, 즉 간헐적으로 나타나는 격자 규모 강우를 체계적으로 매끈하게 평균화해 버리기 때문이다. ACE2 같은 결정론적 자기회귀 모델은 각 시간 단계마다 하나의 평균 궤적만 예측한다. 그래서 어떤 특정 셀에서 대류가 발생할지 해상하지 못하면, 물리 모델이 만들어 내는 날카롭고 국지적인 폭우 대신 여러 셀에 약한 이슬비를 퍼뜨리는 식으로 절충한다. ACE2S는 이런 조건부 평균 출력을 가능한 대기 상태들의 분포에서 샘플링하는 생성형 공식으로 바꾸어, 결정론적 ACE2가 평균 처리로 지워 버리는 소규모 변동성을 되살린다 .

이 메커니즘은 꼬리 영역에서 가장 중요하다. 극한 강우, 홍수 위험, 대류성 이벤트 분석이 다루는 영역이 바로 아격자 변동성이며, 평균으로 회귀하는 모델은 이런 사건의 빈도와 강도를 모두 과소평가한다. 하나의 기대값을 내보내는 대신 샘플을 뽑기 때문에 ACE2S는 물리 기반 폭풍 해상 모델에서 나타나는 것과 일관된 격자 규모 강수 변동성을 보존한다. Ai2는 이 개선이 결정론적 에뮬레이터가 가장 어려워하는 필드인 지표 강수에서 가장 뚜렷하다고 보고한다 .

그렇다면 모델은 실제로 무엇을 학습하는가? 모델 카드는 ACE2S를 100 km로 조립화한 X-SHiELD의 확률적 에뮬레이터로 설명하며, 이전 ACE 모델 대비 업데이트된 학습 절차를 사용해 2014년부터 2022년까지 9년치 데이터로 학습했다고 밝힌다 . 목표가 거친 재분석 자료가 아니라 킬로미터 규모 물리 시뮬레이션이기 때문에, 확률적 목적함수는 격자 규모 간헐성이 얼마나 존재해야 하는지에 대한 구체적인 기준을 갖는다. 즉 모델은 매끈한 평균이 아니라 분포를 재현하도록 맞춰진다.

ACE2에서 이어진 두 가지 설계 속성은 샘플링 출력으로 옮겨 간 뒤에도 유지된다.

  • 개선된 소규모 변동성. ACE2S는 결정론적 ACE2에 비해 간헐적 강수를 더 잘 표현하며, 그 이득은 전체 평균보다 분포의 꼬리 영역에 집중된다 .
  • 정확한 보존. ACE2S는 설계상 전 지구 건조 공기 질량과 총 수분을 정확히 보존하도록 강제한다. 이는 ACE2 계열이 부드러운 패널티가 아니라 ML 기반 보존으로 도입한 제약이다 .

두 번째 지점이 확률적 롤아웃의 표류를 막는다. 6시간마다 서로 다른 대기 상태를 샘플링하는 일은, 그 샘플 궤적이 긴 실행에서도 질량과 수분 예산을 지킬 때에만 유용하다. 강한 보존 제약이 없으면 생성형 에뮬레이터는 수천 단계에 걸쳐 가짜 물이나 공기를 누적할 수 있다. ACE2 설계는 이 예산을 정확히 인코딩하므로, ACE2S는 물리적으로 닫힌 상태를 유지하면서도 서로 독립적으로 보이는 여러 실현값을 뽑을 수 있다. 이것이 ACE2S를 하나의 매끈한 추정값이 아니라 고해상도 강수 앙상블에 적합하게 만드는 속성이다 .

HiRO의 32배 확산 다운스케일링: 100 km 거친 대기에서 3 km 강수로

HiRO(High Resolution Output)는 32배 공간 다운스케일링을 수행하는 확산 모델이다. ACE2S의 100 km 거친 대기 상태를 사용자가 지정한 지역의 3 km 해상도 6시간 평균 지표 강수로 변환한다 . HiRO는 한쪽에는 동일한 3 km X-SHiELD 필드를 100 km로 조립화한 자료를, 다른 한쪽에는 원래의 킬로미터 규모 강수를 둔 쌍 샘플로 학습한다. 그리고 하나의 결정론적 매핑이 아니라, 거친 상태가 주어졌을 때의 미세 규모 강우 조건부 분포를 학습한다 . 생성형 모델이기 때문에 HiRO는 그럴듯한 고해상도 강수장을 샘플링할 수 있고, 이 덕분에 보간이나 회귀 기반 다운스케일러가 흐릿하게 만들 간헐적 대류 구조를 복원한다.

실용적인 효과는 물리적으로 세밀한 강수가 거친 입력만으로 나온다는 데 있다. Ai2는 HiRO가 킬로미터 규모의 지형성 강수 세부 구조, 즉 산악 강수 그림자와 지형성 강수 강화를 복원하며, 추론 시점에 어떤 미세 규모 필드도 보지 않고도 그럴듯한 열대저기압, 전선, 대류성 이벤트를 생성한다고 보고한다 . 조건 입력에는 바람, 습도, 거친 강수 발자국 같은 충분한 대규모 신호가 담겨 있어 확산 모델이 기반 지형과 일관된 소규모 질감을 채워 넣는다. 바로 이 영역에서 결정론적 ML 다운스케일러는 대체로 매끈하고 분산이 낮은 출력을 만든다.

두 구성 요소는 모두 GFDL의 3 km 전 지구 폭풍 해상 모델에서 나온 동일한 10년 X-SHiELD 시뮬레이션으로 학습되므로, HiRO는 거친 재분석이 아니라 실제 킬로미터 규모 물리 모델을 재현하도록 학습한다 . 이 차이는 편향을 해석할 때 중요하다. HiRO 강수는 관측값이 아니라 X-SHiELD 출력의 특성을 대표한다. 부모 폭풍 해상 모델에 들어 있는 편향, 그리고 X-SHiELD가 우량계나 위성 기록과 달라지는 지점은 HiRO 결과에도 전파된다 .

공간 범위에도 한계가 있다. HiRO는 66S에서 70N 사이에서만 학습 및 테스트되었고, 실행 자체가 불가능한 절대 한계는 88S/88N이다. 극지방은 완전히 제외된다. Ai2는 매우 큰 지역 범위에서 블렌딩 아티팩트도 지적하므로, 이 모델은 하나의 전 지구 타일보다는 경계가 정해진 연구 영역에 적용하는 것이 가장 적합하다 .

속성HiRO 사양
모델 유형확산 기반 다운스케일러(생성형)
다운스케일링 배율32배(100 km → 3 km)
출력6시간 평균 지표 강수
학습 데이터10년 X-SHiELD 3 km 시뮬레이션(GFDL)
테스트된 위도대66S–70N(하드 리밋 88S/88N)
체크포인트 크기HiRO.ckpt — 921 MB

H100 하루로 수십 년치 대기 에뮬레이션: Ai2 측정치 해설

HiRO-ACE cuts climate emulation to 45 minutes — with a ceiling

HiRO-ACE가 내세우는 핵심 주장은 범용 가속기 하드웨어에서 충실도를 유지하면서도 높은 처리량을 낸다는 점입니다. Ai2는 HiRO가 단일 지역의 3 km 해상도 표면 강수량 1년치를 하나의 NVIDIA H100 GPU에서 약 45분 만에 생성한다고 보고했습니다 . 또한 전체 ACE2S + HiRO 파이프라인은 같은 단일 H100에서 6시간 간격의 고해상도 지역 강수량을 수십 년치까지 하루 안에 생성할 수 있다고 설명합니다 . 비교 기준은 물리 기반 대안입니다. 같은 수준의 킬로미터급 폭풍 해상 시뮬레이션은 수개월이 걸립니다 . 몇 분에서 하루 대 수개월이라는 이 격차가 에뮬레이터를 쓰는 실질적인 이유입니다.

대기 단계는 ACE 계열의 처리량 특성을 이어받습니다. ACE2 Nature 논문은 4억 5천만 개 파라미터의 자기회귀 에뮬레이터가 8개 수직층에 걸쳐 1° 해상도와 6시간 timestep으로 구동될 때, 실제 하루에 약 1,500년치 시뮬레이션을 처리한다고 보고했습니다 . Ai2는 ACE2S도 이와 비슷한 처리량을 낸다고 보고합니다 . 이는 자연스럽습니다. ACE2S는 1° × 1°, 6시간 자기회귀 설계를 공유하고, 더 무거운 backbone 대신 확률적 formulation을 추가하기 때문입니다. 실제 비용이 어디서 발생하는지에 주목해야 합니다. 거친 전 지구 rollout은 저렴하고, 45분이라는 수치는 diffusion downscaler가 지역별로 32배 초해상화를 수행하는 데 드는 시간입니다. 출력 하나당 더 비싼 작업은 이쪽입니다.

보고된 측정 항목하드웨어출처
HiRO downscaling, 3 km 해상도 1년치, 단일 지역약 45분1× NVIDIA H100Ai2 blog / preprint
전체 ACE2S + HiRO 파이프라인, 6시간 간격 고해상도 강수량실제 하루 안에 수십 년치1× NVIDIA H100arXiv:2512.18224
ACE2 대기 처리량(450M params, 1°, 6시간 step)약 1,500 시뮬레이션 년/일GPU (ACE2 baseline)ACE2 Nature paper
ACE2S 대기 처리량ACE2와 유사하다고 보고됨Single H100arXiv:2512.18224

워크로드를 가늠하는 개발자라면 핵심은 병목이 대기 rollout 길이가 아니라 downscaling할 지역 수와 목표 해상도에 따라 커진다는 점입니다. 경계가 정해진 하나의 domain에서 여러 realization을 생성하는 비용은 낮습니다. 반면 3 km 해상도로 많은 지역을 타일링하면 45분이라는 단위 비용이 그대로 곱해집니다. 보스턴대학교의 Elizabeth Barnes는 ACE의 가치를 “속도와 충실도의 독특한 조합”이라고 설명하며, 열대저기압 형성 같은 “비용 때문에 사실상 어려웠던” 연구를 다룰 수 있게 한다고 말했습니다 .

검증상의 단서는 중요합니다. 여기의 모든 속도와 skill 수치는 Ai2의 자체 기술 보고서인 arXiv:2512.18224에서 나온 것입니다. 이 보고서는 2025년 12월 20일 제출됐고 2026년 2월 4일 마지막으로 수정됐습니다 . 여기에 동반 블로그 글이 더해졌지만, 2026년 6월 기준으로 어느 쪽도 peer review를 완료하지 않았고 H100 timing에 대한 독립 재현 결과도 아직 공개되지 않았습니다. 수치는 그럴듯하고 공개된 ACE2 baseline과도 일관되지만, 외부 benchmark가 나오기 전까지는 vendor-reported 수치로 보는 편이 맞습니다. 공개 weights와 `run-hiro-ace.sh` script 덕분에 이 독립 timing test는 직접 실행해볼 수 있습니다.

극한 강수는 얼마나 잘 잡아내나? Ai2 검증 결과 풀어보기

HiRO-ACE의 검증은 강수량 분포의 꼬리에 초점이 맞춰져 있으며, 핵심 결과는 99.99th percentile까지 극한 강수 분포를 재현한다는 것입니다 . 이 percentile은 평균보다 더 중요합니다. 홍수 위험과 열대저기압 연구는 드물고 강도가 높은 꼬리 영역을 다루기 때문입니다. 강수를 매끈하게 만들어버리는 deterministic emulator라면 실제로 관심 있는 사건을 과소평가하게 됩니다. Ai2는 이 framework가 거의 모든 지역에서 time-mean precipitation bias를 대략 10% 미만으로 유지하고, 거친 100 km 입력에서 산악 rain shadow와 지형성 강수 강화 같은 킬로미터급 지형 detail도 복원한다고 보고합니다 .

빠른 답: Ai2는 HiRO-ACE가 99.99th percentile까지 극한 강수를 재현하고, time-mean precipitation bias를 거의 모든 곳에서 약 10% 미만으로 유지하며, 킬로미터급 지형 detail을 복원한다고 보고합니다. 다만 자체 X-SHiELD training baseline과 비교하면 열대저기압 빈도는 과대추정합니다 .

확률적 설계는 여기서 제 역할을 합니다. deterministic ACE2와 비교해 ACE2S가 내세우는 핵심 주장은, 특히 표면 강수에서 소규모 variability가 개선된다는 것입니다. preprint의 자체 비교도 generative formulation이 단순한 주장에 그치지 않고 실제로 그 이점을 낸다는 점을 보여줍니다 . 구체적으로는 grid-scale의 intermittent rainfall이 축축하고 균일한 field로 평균화되지 않고 보존된다는 뜻입니다. 이는 앞선 deterministic ML emulator들이 보였던 실패 모드였습니다. Ai2는 또한 HiRO-ACE가 거친 field에서 그럴듯한 열대저기압, 전선, 대류 사건을 생성한다고 보고하는데, 이는 같은 능력의 정성적 측면입니다 .

솔직한 단서는 같은 검증 안에 들어 있습니다. HiRO는 학습 기준으로 삼은 X-SHiELD baseline에 비해 열대저기압 생성을 과대추정합니다. 즉 모델이 자기 ground truth보다 더 많은 storm을 만들어내므로, HiRO-ACE의 cyclone count는 calibrated된 값이라기보다 위쪽으로 기운 값으로 읽어야 합니다 . intensity와 공간 구조가 합리적으로 보이더라도, cyclone-frequency 작업에 쓰려는 사람에게는 의미 있는 제약입니다.

두 가지 framing point는 유지할 필요가 있습니다. 첫째, baseline은 GFDL의 3 km storm-resolving model인 X-SHiELD입니다. 따라서 “skillful”하다는 말은 관측값 자체가 아니라 그 물리 simulation에 충실하다는 뜻입니다 . X-SHiELD에 들어 있는 bias는 그대로 이어집니다. 둘째, 이 skill 수치들은 Ai2의 preprint와 blog에서 나온 것이며, 2026년 6월 기준 peer review를 완료하지 않았습니다. 따라서 percentile과 bias 주장에 대한 독립 benchmarking은 아직 충분하지 않습니다 . 공개 weights를 이용하면 자신이 잘 아는 지역에서 tail behavior를 직접 확인할 수 있습니다.

강제 조건의 한계: HiRO-ACE가 일반화할 수 없는 지점

HiRO-ACE는 훈련 중에 본 기후 범위 안에서만 안정적으로 작동하며, 그 범위를 벗어나면 물리적으로 말이 되지 않는 결과가 나올 수 있습니다. ACE2S는 2014~2022년에 해당하는 X-SHiELD 데이터 9년치만으로 훈련되었습니다 . 이 기간에는 해수면온도(SST)와 CO2가 함께 상승하므로, 모델은 두 강제력을 분리해 이해할 방법이 없습니다. 강한 미래 온난화나 갑작스러운 CO2 증가를 입력하면 대기 반응이 무너질 수 있습니다. Ai2의 모델 카드도 이 시스템이 "is not expected to generalize outside its limited forcing conditions"라고 밝히고 있습니다 .

이는 가상의 위험이 아닙니다. 2026년 6월 6일 공개된 arXiv 논문(2606.07928)은 이전 ACE 버전들이 AMIP SST +4 K 및 abrupt 4×CO2 실험에서 물리적으로 부자연스럽게 반응했음을 기록했습니다. 원인은 바로 훈련 데이터에서 SST와 CO2가 서로 상관되어 있었기 때문입니다 . 저자들은 해결책으로 무작위 CO2 훈련과 명시적 에너지 제약을 제안하지만, 이는 별도의 연구 흐름이며 오늘 다운로드할 수 있는 HiRO-ACE 릴리스에는 포함되어 있지 않습니다. 연구가 훈련 범위보다 더 뜨거운 기후로 외삽하는 데 달려 있다면, 그런 제약이 실제로 배포되기 전까지 이 에뮬레이터는 맞지 않는 도구입니다.

실험을 계획하는 사람이라면 세 가지 경계도 더 중요합니다.

  • 예보 모델이 아닙니다. ACE2S에는 자료동화도, 종관 규모 초기화도 없으므로 날씨 예보를 할 수 없습니다 . 특정 화요일의 날씨가 아니라 통계적 변동성을 에뮬레이션합니다.
  • "수 세기"는 처리량이지 검증된 전망이 아닙니다. 모델 카드는 ACE가 "from days to centuries" 범위의 변동성을 시뮬레이션한다고 설명합니다 . 하지만 이는 극단적인 속도 덕분에 가능한 길고 빠른 자기회귀 롤아웃으로 읽어야지, 동료검토로 검증된 다세기 강제 기후 전망으로 보아서는 안 됩니다. Ai2는 이 릴리스를 운영 예측기가 아니라 연구 및 교육용 도구로 명시적으로 자리매김하고 있습니다 .
  • 통계적 독립성은 약 9년을 지나면 약해집니다. 모델 카드는 단일 체인에서 모델을 9년보다 훨씬 길게 실행하면 "may not yield statistically independent samples"일 수 있다고 경고합니다 . 실무적 의미는 분명합니다. 많은 실현 표본이 필요하다면 매우 긴 연속 실행 하나보다 여러 병렬 앙상블 멤버를 선호하는 편이 낫습니다.

이 모든 내용이 앞서 다룬 속도 이점을 부정하는 것은 아닙니다. 다만 그 적용 범위를 정해 줍니다. HiRO-ACE는 훈련 분포에 가까운 조건에서는 변동성을 강력하게 샘플링하지만, 본 적 없는 기후 상태를 스트레스 테스트하는 용도로는 좋지 않습니다. 어떤 출력이든 신뢰하기 전에 할 수 있는 가장 깔끔한 검사는 두 가지입니다. 강제 시나리오가 2014~2022년과 유사한 조건 안에 있는지 확인하고, 마라톤식 장기 롤아웃 대신 앙상블을 실행하십시오.

시작 방법: fme 설치, ACE2S YAML 수정, 스크립트 실행

HiRO-ACE cuts climate emulation to 45 minutes — with a ceiling

HiRO-ACE를 실행하려면 Python 패키지 하나를 설치하고, 체크포인트 저장소를 받은 뒤, 두 개의 설정 파일이 로컬 경로를 가리키도록 지정하면 됩니다. Ai2는 ACE 계열 모델의 훈련, 실행, 평가를 처리하는 fme 패키지(버전 2026.5.1)를 제공합니다. 이 패키지는 SFNO, GNN, UNet, 대기 및 해양 에뮬레이션, 다운스케일링을 지원하며 문서는 ai2-climate-emulator.readthedocs.io에서 볼 수 있습니다. pip로 설치한 다음, 무엇이든 수정하기 전에 Hugging Face에서 가중치와 강제 데이터를 가져오십시오.

아티팩트는 독립형 모델 페이지가 아니라 체크포인트 저장소 형태로 제공됩니다. allenai/HiRO-ACE를 클론하면 약 9.08 GB가 내려받아지며, 여기에는 ACE2S.ckpt(1.83 GB), HiRO.ckpt(921 MB), 추론 설정, 강제 데이터, 초기 조건, run-hiro-ace.sh 스크립트가 포함됩니다. 강제 파일과 초기 조건 파일은 체크포인트와 함께 묶여 있으므로, 공개된 실행을 재현하기 위해 재분석 입력을 별도로 구할 필요는 없습니다.

설정은 코드를 고치는 일이 아니라 경로를 수정하는 일입니다. ace2s_inference_config_global.yaml과 HiRO의 지역별 설정 파일을 열어 로컬 체크포인트 및 강제 파일 위치를 가리키도록 경로를 업데이트하십시오. 그런 다음 run-hiro-ace.sh를 실행하면 ACE2S 자기회귀 롤아웃과 HiRO 다운스케일링 단계가 처음부터 끝까지 진행됩니다. 이 저장소는 Apache-2.0 라이선스(Ai2의 Responsible Use Guidelines 적용)를 따르며, 파이프라인을 수정해야 한다면 기반 훈련 및 추론 코드는 ai2cm/ace GitHub 저장소에 있습니다.

  • 설치: pip install fme(2026.5.1)를 실행합니다. GPU 접근을 확인하십시오. Ai2의 벤치마크는 단일 NVIDIA H100을 전제로 합니다.
  • 클론: 체크포인트, 설정, 강제 데이터, 초기 조건이 포함된 allenai/HiRO-ACE(~9.08 GB)를 받습니다.
  • 수정: ace2s_inference_config_global.yaml과 HiRO 지역 설정에서 로컬 경로를 지정합니다.
  • 실행: run-hiro-ace.sh를 실행합니다.

기준 맥락을 잡으려면 Hugging Face ACE 컬렉션의 결정론적 형제 모델인 ACE2, ACE2-ERA5, ACE2-SOM과 출력을 비교하십시오. 같은 초기 조건을 ACE2S와 그 결정론적 전신에 넣어 실행하는 것이 앞선 섹션에서 설명한 확률적 강수 변동성을 확인하는 가장 빠른 방법이며, 새 지역에 적용하기 전에 로컬 설치가 Ai2가 보고한 동작을 재현하는지 점검하는 방법이기도 합니다.

HiRO-ACE를 신뢰하기 전에: 아키텍처 공백, 극지 제외, 아티팩트 위험

HiRO-ACE의 대표 성능 수치를 확정된 것으로 받아들이기 전에, 이번 공개가 남겨 둔 세 가지 공백을 따져봐야 한다. 모델 규모 비공개, 제한적인 외부 검증, 강한 지리적 한계다. 이 중 어느 것도 연구용 활용 자체를 무너뜨리지는 않지만, 각각은 그 출력값을 어디까지 확장해 해석할 수 있는지를 좌우한다. 가장 기본적인 문제는 모델 카드가 ACE2S의 파라미터 수를 밝히지 않는다는 점이다 . 따라서 ACE2 계열의 4억 5천만 파라미터 자기회귀 에뮬레이터와 직접적인 규모 비교를 할 수 없다 . 1.83GB 체크포인트를 실행할 수는 있지만, 카드만으로는 결정론적 형제 모델들과 비교해 용량이나 스케일링을 판단할 수 없다.

두 번째 공백은 검증의 깊이이며, Ai2도 이를 명확히 인정한다. 모델 카드는 ACE2S가 ACE2-ERA5보다 덜 엄격하게 테스트되었다고 밝히고, HiRO의 ablation 작업도 재분석 자료로 학습한 모델을 뒷받침하는 수준보다 명시적으로 얇다 . 두 구성요소 모두 관측이 아니라 X-SHiELD에서 학습하므로, 강수는 실제 대기가 아니라 해당 시뮬레이션을 대표한다. 의미 있는 외부 신호, 즉 ERA5 재분석에 대한 커뮤니티 벤치마킹은 아직 없으며, 속도와 성능 수치도 독립 리더보드가 아니라 Ai2의 자체 프리프린트와 블로그에서 나온 것이다.

지리적 한계는 조정 가능한 설정이 아니다. HiRO는 66S–70N 밖에서 학습되거나 테스트되지 않았고 88S/88N을 넘어 실행할 수 없으므로 극지 지역은 제외된다. 또한 큰 대상 지역에서는 블렌딩 아티팩트가 생길 수 있다 . 이를 우회해서 해결할 구성 문제가 아니라 설계 제약으로 다뤄야 한다.

마지막은 출처다. 이를 뒷받침하는 연구는 2025년 12월 20일 제출되고 2026년 2월 4일 마지막으로 수정된 프리프린트 arXiv:2512.18224다 . 아직 동료심사를 거치지 않았다. 학술지 게재 전까지는 정량적 성능 주장, 예컨대 99.99백분위 극한값이나 10% 미만 평균 편향 수치는 잠정적인 것으로 읽어야 한다.

실무적 결론은 이렇다. HiRO-ACE는 지역 강수의 여러 실현값을 저렴하게 생성하는 데 쓸 수 있는 신뢰할 만한 Apache-2.0 연구 및 교육용 도구다. 그 용도에 맞게 사용하라. 66S–70N 안에서 실행하고, 새 지역을 신뢰하기 전에는 자체 기준 데이터로 검증하며, 독립 벤치마킹과 동료심사가 따라오기 전까지는 그 출력을 운영 예보나 수 세기 규모의 강제력 기반 전망으로 격상하지 말아야 한다.

자주 묻는 질문

ACE2S와 결정론적 ACE2는 무엇이 다른가?

ACE2는 앙상블 평균처럼 작동하는 하나의 결정론적 궤적을 생성하며, 물리 기반 모델에서 나타나는 하위 격자 규모의 간헐적 강수를 매끄럽게 만든다. ACE2S는 생성적이고 확률적인 공식을 더한다. 대기 상태의 분포에서 샘플링하므로 격자 규모 강수 변동성과 극단 꼬리 거동을 보존한다. 둘 다 전 지구 건조 공기 질량과 수분을 정확히 보존한다 . 앙상블 멤버 간 현실적인 강수 분산이 중요하다면 ACE2S가 더 적합하다. 비교용으로는 결정론적 ACE2, ACE2-ERA5, ACE2-SOM이 Hugging Face ACE 컬렉션에 계속 제공된다 .

HiRO-ACE를 미래 기후 전망이나 시나리오 분석에 사용할 수 있는가?

아니다. ACE2S는 2014–2022년의 X-SHiELD 데이터 9년치로만 학습되었고, 이 기간에는 해수면 온도와 CO2가 서로 상관되어 있으므로 제한된 강제력 조건 밖으로 일반화될 것으로 기대하기 어렵다 . 2026년 6월 6일 프리프린트는 바로 이 이유 때문에 이전 ACE 버전들이 AMIP SST +4K와 급격한 4×CO2에 비물리적으로 반응했음을 문서화했으며, 이를 해결하기 위해 무작위 CO2 학습과 에너지 제약을 도입했다 . Ai2는 HiRO-ACE를 운영용 기후 예측기가 아니라 연구 및 교육용 도구로 규정한다 .

HiRO는 어떤 해상도를 만들며, 어느 지역을 지원하는가?

HiRO는 사용자가 지정한 지역에 대해 3km 해상도의 6시간 평균 지표 강수를 생성하며, 100km의 조밀하지 않은 대기를 32배 다운스케일링한다 . 학습과 테스트는 66S와 70N 사이에서 이루어졌고 절대 한계는 88S/88N이므로 극지 지역은 제외된다. 큰 지역을 실행하면 블렌딩 아티팩트가 생길 수 있다 . 출력은 직접 관측 재분석이 아니라 X-SHiELD 물리 모델의 통계를 나타내며, 이는 관측소나 위성 데이터로 검증할 때 중요하다.

내 인프라에서 HiRO-ACE를 어떻게 실행하나?

ACE 계열 모델의 학습, 실행, 평가를 처리하는 fme 패키지(버전 2026.5.1)를 설치한 뒤, Hugging Face에서 allenai/HiRO-ACE 저장소를 클론한다. ACE2S.ckpt(1.83GB)와 HiRO.ckpt(921MB)를 포함해 약 9.08GB다 . ace2s_inference_config_global.yaml과 HiRO 지역 설정의 경로 변수를 수정한 뒤 run-hiro-ace.sh를 실행하면 된다. 강제력 데이터와 초기 조건은 저장소 안에 포함되어 있다 . 시뮬레이션 1년당 약 45분이라는 처리량 수치의 기준 하드웨어는 NVIDIA H100 한 장이다 .

HiRO-ACE는 날씨 예보에 적합한가?

아니다. 모델 카드가 이를 명시한다. ACE2S는 며칠에서 수십 년 시간 규모의 대기 변동성을 에뮬레이션하지만, 자료동화가 없고 종관 상태 초기화도 없으므로 결정론적 단기 예보가 아니라 기후 시간 규모의 앙상블 통계를 생성한다 . 예보 작업에는 Pangu나 GraphCast 같은 날씨 전용 모델을 사용하라. HiRO-ACE는 위험, 극한 강수, 열대저기압 연구를 위해 지역 강수의 많은 실현값을 생성하는 용도로 남겨두는 것이 맞다 .