논문 발표 전 Borg에서 돌던 AlphaEvolve: 구체적인 성과들

DeepMind의 진화적 코드 최적화 — 2024년부터 Borg 적용, TPU 23% 속도 향상, Strassen 알고리즘 개선.

논문 발표 전 Borg에서 돌던 AlphaEvolve: 구체적인 성과들
Share

AlphaEvolve의 진화적 탐색, 실제 운영 환경에서 통할까?

그렇다. AlphaEvolve가 산출한 결과물 여러 개가 백서 공개 전부터 이미 1년 이상 Google 운영 시스템 내부에서 실행 중이었으며, 논문이 발표되는 시점에도 측정 가능한 컴퓨팅 자원을 계속 회수하고 있었다 . AlphaEvolve는 2025년 5월 14일 DeepMind 블로그를 통해 발표됐으며, arXiv:2506.13131에서 정식으로 기술됐다 .

한줄 요약: AlphaEvolve는 Gemini 모델과 프로그래밍 방식 평가자를 결합한 진화형 코딩 에이전트다. 실제 운영 환경에서 검증됐으며, 클러스터 스케줄링 휴리스틱이 1년 이상 Google 전체 플리트에서 실행 중이고, 평균적으로 전 세계 컴퓨팅 자원의 0.7%를 회수하고 있다.

명칭보다 메커니즘이 중요하다. AlphaEvolve는 단순히 'AI가 코드를 작성하는' 시스템이 아니다 — LLM이 폐쇄적이고 검증 가능한 루프 안에서 후보를 생성하는 구조다. Gemini Flash는 빠르고 폭넓은 아이디어를 제공하고, Gemini Pro는 더 깊고 품질 높은 제안을 생성하며, 둘 다 공유 진화 프로그램 데이터베이스에 공급된다. 생성된 각 프로그램은 실행된 후 프로그래밍 방식 평가자에 의해 점수가 매겨지고, MAP-Elites 및 섬 기반 집단과 같은 전략을 통해 향후 변이 대상으로 선택된다 . LLM이 제안하고, 평가자가 생존 여부를 결정한다. 하드 메트릭에 기반한 이 구조가 환각을 억제하는 핵심이다.

또한 DeepMind의 이전 시스템인 FunSearch에서 크게 도약한 결과이기도 하다. FunSearch가 단일 메트릭을 기준으로 작은 Python 함수 하나를 진화시키는 데 수백만 개의 샘플이 필요했던 반면, AlphaEvolve는:

  • 어떤 언어로든 파일 전체 또는 전체 코드베이스를 진화시키며;
  • 여러 목표를 동시에 최적화하고;
  • 가속기에서 후보별로 수 시간의 병렬 평가를 실행하며;
  • 수백만 개가 아닌 약 1,000개의 샘플로 수렴한다 .

도입 전에 팀이 내면화해야 할 것은 제약 조건이다. AlphaEvolve는 평가가 완전히 프로그래밍 방식으로 이루어지는 영역 — 지연 시간, 정확성, 비용 — 에서 강력하며, 결과 판단에 인간의 판단이나 물리적 실험이 필요한 경우에는 성능이 저하된다 . 수석 저자들은 백서에서 다음과 같이 밝혔다:

"AlphaEvolve는 전체 코드베이스를 진화시키고 훨씬 더 복잡한 알고리즘을 개발하는 것을 가능하게 합니다." — Alexander Novikov and Matej Balog, AlphaEvolve 백서, Google DeepMind (source: arXiv:2506.13131).

요약하면: 목적에 맞는 빠르고 정직한 평가자를 작성할 수 있다면 루프는 작동한다. 그렇지 못하면, AlphaEvolve에서 가장 인상적인 부분은 적용되지 않는다. 이어지는 섹션에서는 그 빠른 평가자가 존재했던 곳 — Borg, TPU 커널, 하드웨어 RTL, 그리고 순수 수학 — 과 각각의 성과가 실제로 무엇을 가져다줬는지 살펴본다.

Borg 클러스터 스케줄링: 전체 플릿 단위의 휴리스틱 개선

AlphaEvolve in Borg before the paper: the concrete wins

가장 뚜렷한 실전 성과는 클러스터 스케줄링 분야에서 나왔습니다. AlphaEvolve는 Google의 클러스터 매니저 Borg 내부의 머신 랭킹 휴리스틱을 진화시켰고, 재작성된 휴리스틱은 평균적으로 Google 전 세계 컴퓨팅 자원의 0.7%를 낭비 없이 회수합니다. Borg는 수천 개의 애플리케이션으로부터 수십만 개의 작업을 처리하며, 클러스터 하나에 수만 대의 머신이 연결되어 있습니다 . 따라서 1% 미만의 활용률 개선도 절대적 수치로는 상당한 규모입니다.

한눈에 보기: AlphaEvolve는 대기 중인 작업에 어떤 서버를 할당할지 점수를 매기는 함수, 즉 Borg의 머신 랭킹 휴리스틱을 재작성했습니다. 진화된 버전은 1년 이상 프로덕션에서 운영되며 Google 전 세계 컴퓨팅 자원의 평균 0.7%를 낭비 없이 회수하고 있습니다 .

이것이 효과를 낸 이유는 평가자(evaluator) 논거와 직결됩니다. 탐색 공간이 구조적으로 유효했기 때문입니다. Borg는 이미 CPU와 메모리 요구 사항을 기준으로 작업을 호스팅할 수 있는 머신을 걸러내는 정확성 필터를 갖추고 있습니다. AlphaEvolve는 Borg가 사전 승인한 머신에만 점수를 부여했으므로, 루프가 실행 가능 여부를 따질 필요 없이 실행 보장된 선택지들 사이에서 랭킹 품질만 최적화하면 됐습니다 . 이 휴리스틱은 대기 작업의 자원 요구량과 머신별 여유 자원을 입력받아 점수를 산출합니다. 이 단일 스칼라 값이 바로 진화 루프에 필요한, 측정하고 자동화하기 쉬운 지표입니다.

훈련과 배포는 단계적으로 신중하게 진행됐습니다. 초기 AlphaEvolve 버전은 과거 플릿 스냅샷을 입력한 시뮬레이터를 기반으로 휴리스틱을 진화시켰고, 이후 학습에 사용되지 않은 최신 워크로드로 검증한 뒤, 기존 버전을 능가한다는 확인 후에야 플릿 전체에 배포됐습니다 . 논문은 이것이 벤치마크 결과가 아닌 실제 배포 결과임을 명시합니다. 2025년 5월 발표 시점에 이미 프로덕션 운영 기간이 1년을 넘었습니다 .

항목상세
대상Borg 머신 랭킹(스케줄링) 휴리스틱
규모수십만 개의 작업, 수천 개의 앱, 클러스터당 최대 수만 대의 머신
평가자과거 플릿 스냅샷 기반 시뮬레이터; 정확성 사전 필터링은 Borg 담당
검증배포 전 학습에 사용되지 않은 최신 워크로드로 테스트
결과전 세계 컴퓨팅 자원 평균 ~0.7% 낭비 없이 회수
현황2025년 5월 발표 기준 1년 이상 플릿 전체 프로덕션 운영 중

개발자들이 주목할 만한 세부 사항이 있습니다. 사람이 읽을 수 있는 휴리스틱이라는 점 자체도 가치입니다. 진화된 함수는 엔지니어가 직접 살펴보고 추론하며 유지보수할 수 있는 코드입니다. 스케줄러에 끼워 넣은 블랙박스 모델이 아닙니다.

"AlphaEvolve는 1년 이상 프로덕션에서 운영되며 평균적으로 Google 전 세계 컴퓨팅 자원의 0.7%를 지속적으로 회수하는 휴리스틱을 발견했습니다." — Google DeepMind AlphaEvolve 팀, Alexander Novikov·Matej Balog (source: DeepMind blog)

여기서 얻을 교훈은 LLM이 "스케줄러를 작성했다"는 것이 아닙니다. 측정 가능한 목표(활용률), 빠른 시뮬레이터, 탐색 공간을 제한하는 실행 가능성 필터가 모두 갖춰졌고, 루프가 이를 최대한 활용했다는 것입니다 . 다음 섹션에서는 지표가 실제 실행 시간(wall-clock runtime)인 영역, TPU 커널로 넘어갑니다.

TPU 타일링 최적화와 XLA 트랜스포머 가속

TPU 커널에서 AlphaEvolve는 프록시 지표 대신 실제 실행 시간(wall-clock runtime)을 기준으로 최적화하여 두 가지 배포된 성능 향상을 이끌어냈습니다. 가장 주목할 만한 결과는 Gemini 훈련에 사용되는 Pallas/JAX 행렬 곱셈 커널입니다. AlphaEvolve는 타일링 휴리스틱 — 대형 행렬 곱셈을 가속기 친화적인 블록으로 분할하는 규칙 — 을 진화시켜, 실제 사용자 입력 형태 분포에서 측정한 전문가 설계 기준 대비 평균 23% 속도 향상을 달성하고 프로덕션에 배포했습니다 . 평가 기준은 명확합니다. 커널이 실제로 접하는 형태 분포에서 실제 하드웨어의 실제 실행 시간을 측정하므로, 검색이 단순화된 모델 대신 엔지니어가 실제로 중요시하는 것을 최적화합니다.

이 커널 수준의 성능 향상은 누적됩니다. 23% 타일링 개선은 Gemini 전체 훈련 시간에서 약 1% 단축으로 이어졌습니다 . 동일한 Gemini 모델 패밀리가 AlphaEvolve의 제안 단계를 구동하는 LLM을 제공하므로, 이는 모델이 자신의 후속 모델 훈련을 돕는 기록된 순환 고리입니다 — 구호가 아닌 측정된 수치가 뒷받침하는 재귀적 자기 개선입니다.

두 번째 성과는 추론을 대상으로 합니다. AlphaEvolve는 GPU 추론 규모에서 실행되는 트랜스포머의 FlashAttention 관련 XLA 생성 중간 표현을 재작성하여, 대상 어텐션 패스에서 최대 32.5% 속도 향상과 전/후처리에서 15% 속도 향상을 보고했으며 이 역시 배포되었습니다 . 컴파일러 IR 수준에서 작업한다는 점이 주목할 만합니다. AlphaEvolve는 사람이 손으로 거의 건드리지 않는 코드를 편집하며, 여기서 작은 구조적 변경이 성능을 크게 바꿀 수 있습니다.

대상레이어보고된 속도 향상상태
Pallas/JAX 행렬 곱셈 커널 (Gemini 훈련)타일링 휴리스틱평균 23%; 전체 훈련 시간의 약 1%프로덕션
FlashAttention (GPU 규모 추론)XLA 중간 표현어텐션 최대 32.5%; 전/후처리 15%프로덕션

논문이 명시적으로 밝히는 한 가지 주의사항: 두 결과 모두 특정 구성 — 특정 TPU 입력 형태와 하나의 FlashAttention 설정 — 에 종속되며, 해당 수치가 임의의 하드웨어나 워크로드 형태로 이전된다고 주장하지 않습니다 . 이 방법은 평가 대상 분포에 대한 강력한 솔루션을 찾습니다. 형태를 바꾸면 루프를 다시 실행해야 합니다. 이는 고정된 측정 가능한 목표를 가진 팀에게는 장점이지만, 이식 가능한 커널을 기대하는 이들에게는 한계입니다. AlphaEvolve의 기여자들 스스로도 이 접근 방식을 정확히 이렇게 정의합니다 — 검증된 검색 루프 안의 LLM 제안 (동영상: AlphaEvolve 설명). 다음 섹션은 시스템 엔지니어링에서 순수 수학으로 넘어가며, 여기서 지표는 정확성 그 자체가 됩니다.

슈트라센을 넘어: 4×4 복소수 행렬 곱셈의 새 한계

AlphaEvolve in Borg before the paper: the concrete wins

정확성이 지표가 될 때, AlphaEvolve는 파라미터 조정이 아닌 알고리즘적 혁신을 만들어냅니다. 가장 주목할 만한 결과는 두 4×4 복소수 행렬을 스칼라 곱셈 48번만으로 곱하는 절차입니다. 기존 최고 기록인 49번에서 줄인 것으로, 1969년 슈트라센 알고리즘 이후 56년 만의 첫 개선입니다 . 곱셈 한 번 줄이는 것이 사소해 보일 수 있지만, 행렬 곱셈 지수는 재귀적으로 누적되므로 구조적 변화가 횟수보다 더 중요합니다.

이 결과를 일회성이 아닌 신뢰할 만한 것으로 만드는 것은 그 범위입니다. 수학의 50개 이상의 미해결 문제에 걸쳐, AlphaEvolve는 약 75%의 경우 최선의 알려진 솔루션에 필적했고 약 20%에서는 최첨단 기술을 개선했습니다 . 그 개선 중 하나는 11차원 키싱 넘버의 새로운 하한: 이전 592개에서 593개로 늘어난 외부 구 배열입니다 . 이것들은 존재 결과입니다 — 유효한 구성은 검증되거나 그렇지 않거나 둘 중 하나입니다 — 이는 검증된 검색 루프가 환각을 억제하는 바로 그 영역입니다.

동일한 논리는 하드웨어로도 확장됩니다. AlphaEvolve는 TPU 행렬 곱셈 유닛 내 고도로 최적화된 산술 회로에 대한 Verilog 재작성을 제안했습니다. 형식 검증 하에 기능을 보존하면서 불필요한 비트를 제거했으며, TPU 설계자들이 이를 검증하고 향후 출시될 칩에 반영할 예정입니다 . 주목할 만한 점은, 다운스트림 합성 도구들이 독립적으로 동일한 단순화를 발견했다는 것입니다 — 따라서 기여는 발견이 아닌 타이밍에 있습니다. AlphaEvolve는 설계 흐름의 더 이른 단계에서, 엔지니어들에게 친숙한 Verilog로 RTL 변경 사항을 드러냈습니다.

"AlphaEvolve는 4×4 복소수 행렬을 스칼라 곱셈 48번으로 곱하는 알고리즘을 찾아냈으며, 이는 슈트라센의 1969년 알고리즘을 개선한 것입니다," — Alexander Novikov와 Matej Balog, Google DeepMind (source: arXiv:2506.13131).

중요한 점은, 그 수학을 직접 여러분의 컴퓨터에서 확인할 수 있다는 것입니다. Google은 조합론적 발견에 대한 Colab 노트북과 검증 코드가 포함된 결과 저장소를 공개했습니다 . 이는 여전히 비공개인 AlphaEvolve의 실행 코드와는 구별됩니다 — 검색을 다시 실행할 수는 없지만 답을 확인할 수는 있습니다.

OpenEvolve, 동형 암호화, 그리고 재현 가능성

실행 코드는 비공개로 유지되지만, 그 메커니즘은 본질적으로 재현 가능하며 독립적인 팀들이 이를 전이할 수 있음을 보여주고 있습니다. Google의 공개 릴리스는 수학적 내용만 다룹니다. 조합론적 발견에 대한 Colab 노트북과 검증 코드가 포함된 결과 저장소로, AlphaEvolve의 검색 루프를 실행하는 코드는 명시적으로 제외되어 있습니다 . 일반 제품 접근은 불가능합니다. DeepMind가 밝힌 경로는 학술 연구자를 대상으로 한 얼리 액세스 프로그램으로, 대부분의 개발자는 AlphaEvolve 자체를 직접 실행할 수 없습니다 .

가장 중대한 전이 결과는 암호학 분야에서 나왔습니다. 이 분야에서는 환각(hallucination) 코드가 단순한 버그가 아니라 보안 위협입니다. 2026년 Google·Georgia Tech·DeepMind의 공동 연구는 이 접근법을 Google Cloud TPUv5e의 완전 동형 암호화 커널에 적용했으며, 하드웨어 인더루프 지연 시간 측정과 엄격한 정확성 테스트를 병행했습니다. 24시간 이내에 TFHE 부트스트랩 지연 시간을 2.5배, CKKS 회전 및 곱셈 지연 시간을 각각 1.31배·1.18배 향상시켜 인간이 설계한 최신 기술을 뛰어넘었습니다 . 이 성능 향상이 공식 정확성 검사를 통과한다는 점이 핵심입니다. 묵묵한 오류 하나가 암호화 보장을 깨뜨리는 분야에서, 검증 가능한 루프야말로 생성된 커널을 신뢰할 수 있게 만드는 장치입니다.

오픈소스 재구현은 Google의 릴리스보다 빠르게 진행되고 있습니다. OpenEvolve는 분산 진화, 다중 언어 및 다중 공급자 지원, GPU 커널 탐색 기능을 갖춰 이 패턴을 재구현했으며, AMD의 ROCm 팀은 이를 HPC 코드 최적화를 위한 MCP 도구로 배포했습니다 . 2026년 5월 28일 개정된 CodeEvolve는 9개 벤치마크 문제 중 5개에서 AlphaEvolve의 보고된 결과와 동등하거나 이를 초과했다고 주장하는 오픈소스 프레임워크입니다 .

주의 깊게 읽어야 합니다. 독립적인 재현은 부분적으로 진행 중일 뿐, 전 과정이 확인된 것은 아닙니다. 공개된 9개 벤치마크 중 5개를 일치시킨 것은 루프의 일반화 가능성을 보여주는 신뢰할 만한 신호이지만, Google의 프로덕션 결과를 재현한 것과는 다릅니다. 지금으로서는 아이디어는 이식 가능하지만 원본 시스템은 그렇지 않다는 것이 솔직한 결론입니다.

이 패턴 적용하기: 진화적 탐색이 프로젝트에 도움이 되는 때

AlphaEvolve in Borg before the paper: the concrete wins

AlphaEvolve에서 전이할 수 있는 교훈은 마법이 아니라 구조적인 것입니다. 빠른 프로그래밍 방식의 평가자를 작성할 수 있는 곳이라면 어디서든 작동합니다. 핵심 조건은 비용이 낮은 자동화 지표입니다. 지연 시간 측정, 정확성 테스트 묶음, 또는 비용 함수 등 사람의 개입 없이 생성된 각 변형을 점수화하는 것이 필요합니다. 이것 없이는 진화적 선택 루프가 닫힐 수 없습니다. 선택의 기준이 없기 때문입니다. AlphaEvolve는 LLM을 엔드투엔드 코드 생성기가 아닌 최적화 하네스 안의 컴포넌트로 재정의합니다. Gemini가 변형을 제안하고, 평가자가 엄격한 지표로 점수를 매기며, 최선의 것이 살아남아 사이클이 반복됩니다 . 측정 가능한 목표와 신뢰할 수 있는 평가자를 갖춘 팀이라면 누구든 이 구조를 복제할 수 있습니다.

시간을 투자하기 전에 미해결 질문들에 대해 솔직해져야 합니다. 백서는 LLM과 오케스트레이션 루프의 컴퓨팅 비용을 공개하지 않아 실행 비용을 알 수 없습니다 . 저렴하고 고충실도의 평가자가 있는 도메인 이외 영역으로의 전이 가능성은 규모 면에서 아직 검증되지 않았습니다. 그리고 Borg 결과에는 숨겨진 변수가 있습니다. 휴리스틱은 전체 플리트에 배포되기 전 과거 플리트 스냅샷의 시뮬레이터 피드백을 기반으로 진화했으므로, 이 설정을 복제하려는 사람에게는 시뮬레이터 대 실제 하드웨어 간의 충실도가 중요합니다 .

이 설계를 요약한 한 실무자의 말을 빌리자면, "혁신은 LLM이 코드를 작성한다는 것이 아니라 코드가 배포되기 전에 기계가 채점한다는 것입니다" (영상: AlphaEvolve explained). 이것이 실질적인 기준을 정확히 포착합니다.

2026년 6월 기준 구체적인 시작점: OpenEvolve, AMD의 ROCm 팀이 HPC 코드 최적화에 이미 활용 중인 오픈소스 MCP 호환 재구현 , 그리고 공개된 수학적 발견을 검토하기 위한 Google Colab 검증 노트북. AlphaEvolve 실행 환경 자체는 계획된 학술 얼리 액세스 프로그램 외에는 접근할 수 없습니다 . 핵심 교훈: Google의 시스템을 기다리지 마세요. 자동으로 점수화할 수 있는 목표 하나를 선택하고, OpenEvolve로 LLM을 생성-평가-선택 루프에 연결한 다음, 무엇을 배포할지 결정하는 것은 모델이 아닌 지표에 맡기세요.

참고 영상 / 시청 / 출처

자주 묻는 질문

AlphaEvolve는 LLM에 코드 최적화를 프롬프트하는 것과 어떻게 다른가요?

AlphaEvolve는 Gemini 모델을 후보 프로그램 생성에만 활용합니다. 각 프로그램의 실행과 점수 산정은 별도의 프로그래밍 방식 평가기가 담당하며, 그 점수—모델의 신뢰도가 아닌—가 진화적 선택 과정에 피드백됩니다 . LLM은 자신의 출력을 절대 정답으로 취급하지 않으므로, 정확성이나 성능을 자동으로 측정할 수 있는 모든 영역(지연 시간, 스칼라 곱셈 횟수, 커널 실행 시간 등)에서 환각된 코드는 선택 과정에서 자연스럽게 걸러집니다. 단순히 "이걸 최적화해줘"라고 프롬프트하는 방식에는 이런 루프가 없습니다. 그저 그럴듯한 텍스트를 반환할 뿐이며, 검증도, 점수 산정도, 명확한 지표를 향한 반복적 압력도 없습니다.

Borg에서의 0.7% 컴퓨팅 회수란 무엇이며, 왜 중요한가요?

AlphaEvolve는 Google의 클러스터 관리 시스템 Borg 내부의 머신 랭킹 휴리스틱을 진화시켰습니다. 이 휴리스틱은 대기 중인 작업을 실행할 최적의 머신을 선별해 낭비될 뻔한 자원을 줄이며, Google의 전 세계 컴퓨팅 플릿에서 평균 0.7%를 회수합니다 . 수만 대에 달하는 클러스터 규모에서 1% 미만의 활용률 개선은 충분히 의미 있는 인프라 성과입니다. 이는 벤치마크가 아닙니다. 이 휴리스틱은 논문이 2025년 6월에 발표되기 1년 이상 전부터 이미 프로덕션 환경에서 실제로 실행되어 왔습니다 .

AlphaEvolve의 코드는 공개되어 있나요?

아니요. Google은 수학적 발견 사항의 검증 코드와 Colab 노트북이 포함된 결과 저장소를 공개했지만, AlphaEvolve 자체를 실행하는 데 필요한 코드는 명시적으로 제외되어 있습니다 . 광범위한 제품 접근은 학술 연구자 대상의 얼리 액세스 프로그램으로 제한될 예정입니다. 현재 직접 실행해볼 수 있는 가장 가까운 대안은 OpenEvolve로, 동일한 생성-평가-선택 아키텍처에 분산 진화 및 다중 제공자 지원을 갖춘 오픈소스 재구현체입니다 .

AlphaEvolve는 어떤 유형의 문제에 적합한가요?

AlphaEvolve는 빠르고 프로그래밍 방식으로 평가 가능한 문제, 즉 후보 프로그램을 실행하여 명확한 지표 기준으로 자동 점수를 매길 수 있는 문제에 적합합니다. 실증된 사례로는 클러스터 스케줄링 휴리스틱, TPU 커널 타일링, 50개 이상의 미해결 수학 문제에 대한 조합 최적화, 완전 동형 암호화 커널 튜닝 등이 있습니다 . 반면 평가가 느리거나 주관적이거나 인간의 판단 혹은 물리적 실험이 필요한 경우에는 약점을 보입니다. 진화적 루프 자체가 선택을 이끌어 나가기 위해 저렴하고 정확도 높은 피드백에 의존하기 때문입니다.

AlphaEvolve가 슈트라센 알고리즘에서 정확히 무엇을 개선했나요?

AlphaEvolve는 4×4 복소수 행렬 두 개를 곱하는 절차를 발견했는데, 스칼라 곱셈 횟수를 기존 49회에서 48회로 줄였습니다. 이는 1969년 슈트라센의 결과 이후 해당 특정 조건에서 56년 만의 첫 개선입니다 . 이 결과는 독립적으로 검증 가능합니다. Google이 공개한 Colab 노트북에는 해당 구성을 확인하는 검증 코드가 포함되어 있습니다 .