프론티어 AI는 코딩 퀴즈라면 거뜬히 통과하지만, 투자 은행가의 실무 산출물을 실제로 완성할 수 있을까? 2026년 1월 공개된 벤치마크가 마침내 그 수치를 측정했고, 결과는 작았다.
Mercor의 APEX, 전문 산출물을 평가하는 방식
APEX-Agents는 AI 에이전트가 단순히 개별 프롬프트에 답하는 수준을 넘어, 장기적인 전문 업무를 클라이언트에게 납품 가능한 수준으로 자율적으로 완수할 수 있는지를 측정하는 벤치마크다. 2026년 1월 21~22일 학습 데이터 기업 Mercor가 공개했으며, Goldman Sachs, McKinsey, Cravath의 시니어 실무자들로부터 과제를 도출해 투자 은행, 컨설팅, 기업 법무 영역을 다룬다 . 핵심은 단편적 지식이 아닌 통합적 지식 업무를 측정하는 데 있다.
각 과제에는 전문가가 작성한 1~10개의 합격/불합격 기준이 있으며, 평균 7년 이상 경력의 도메인 전문가들이 클라이언트 납품 기준에 맞춰 평가한다 . 이 채점 방식이 중요한 이유는, 산출물이 전문가의 합격 기준을 충족하거나 그렇지 않거나 둘 중 하나이며, 그럴듯하게 들린다고 해서 부분 점수를 주지 않기 때문이다.
환경 설정이야말로 APEX를 퀴즈형 평가와 구분 짓는 핵심이다. 모든 실행은 Box 파일 시스템을 기반으로 한 시뮬레이션 Google Workspace 환경에서 이루어지므로, 에이전트는 파일을 검색하고 내용을 종합적으로 추론한 뒤 결과물을 전달해야 한다 . 평가 범위는 전체 워크플로우를 포함한다:
- 모호하고 불완전한 지시 처리;
- 올바른 입력값을 찾기 위한 다수 파일 탐색;
- 여러 문서와 도메인에 걸친 정보 종합;
- 최종 클라이언트 납품 산출물 작성.
Mercor는 Hugging Face와 GitHub에서 CC-BY 라이선스로 오픈소스로 공개했으며, 자체 오픈 평가 인프라인 Archipelago로 채점한다. 저자는 Brendan Foody, Bertie Vidgen, Osvald Nitski다 . TechCrunch가 출시를 평가한 것처럼, 이 설계는 에이전트가 벤치마크 형식에 맞춘 문제가 아닌 실제 업무 과제를 수행할 준비가 됐는지 의도적으로 검증한다 . 모델별 점수는 좁은 범위에 집중됐다.
APEX에서 AI별 성적: 1회 시도 24%, 8회 시도 후 40%

어떤 프론티어 모델도 첫 시도에서 APEX-Agents 과제의 4분의 1을 넘기지 못했다. Gemini 3 Flash (Thinking=High)가 약 24%로 선두였고, GPT-5.2가 약 23%로 뒤를 이었으며, Claude Opus 4.5, Gemini 3 Pro, GPT-5는 약 18% 수준에 몰렸다 . 모든 점수는 Goldman Sachs, McKinsey, Cravath 전문가들이 설정한 클라이언트 납품 기준에 따른 1회 시도 합격률이다 .
| 모델 | 1회 시도 합격률 | 평가 도메인 |
|---|---|---|
| Gemini 3 Flash (Thinking=High) | ~24% | 투자 은행 · 컨설팅 · 기업 법무 |
| GPT-5.2 | ~23% | 투자 은행 · 컨설팅 · 기업 법무 |
| Claude Opus 4.5 | ~18% | 투자 은행 · 컨설팅 · 기업 법무 |
| Gemini 3 Pro | ~18% | 투자 은행 · 컨설팅 · 기업 법무 |
| GPT-5 | ~18% | 투자 은행 · 컨설팅 · 기업 법무 |
모델별 점수는 세 분야를 합산한 것으로, 도메인별로 분리되지 않는다. APEX는 투자 은행, 컨설팅, 기업 법무 분야의 장기 과제를 구성하고, 모델별 단일 합격률을 보고한다 .
재시도도 결과를 바꾸지 못한다. 8번의 시도를 허용해도 최고 성능 에이전트는 과제의 약 40%에만 도달한다 . 이는 Goldman, McKinsey, Cravath 수준의 산출물 중 약 60%가 모델이 반복해서 시도해도 허용 기준에 미치지 못한다는 의미다.
"AI 에이전트는 직장 환경에 투입될 준비가 됐는가? 새로운 벤치마크가 의문을 제기한다." — APEX-Agents 출시에 대한 TechCrunch의 평가 (source: TechCrunch, 2026-01).
성장 궤도는 가파르다. Mercor에 따르면 APEX 점수는 1년 전 5~10% 수준에서 현재 20% 이상으로 상승했다 . 방향성은 고무적이지만, 절대 수치는 빠르게 낡아간다.
제품을 만드는 입장에서는 단일 리더보드 스냅샷에 로드맵을 고정하지 말아야 한다는 뜻이다. 1위 모델과 약 18% 그룹 간의 격차는 릴리스 하나 만에 뒤집힐 만큼 좁다. 분기별 재보정을 계획하라: 두 세대 전 모델의 수치를 믿기보다, 매 분기 자체 과제 세트를 직접 다시 실행해 확인하라.
실패 지점: 모호성, 탐색, 도메인 조율
문제는 추론 능력이 아니라 워크플로우 오케스트레이션에 있습니다. Mercor가 APEX-Agents에서 내린 진단은 단호합니다. 프런티어 모델은 "모호성을 처리하거나, 올바른 파일을 찾거나, 전체 워크플로우에 걸쳐 컨텍스트를 유지하지 못한다"는 것입니다 . 단일 역량 평가에서 높은 점수를 받은 모델도, 하나의 작업이 여러 문서와 도구에 걸쳐 있으면 무너집니다. 클라이언트 납품물을 완성하는 것은 통합 문제이지, 퀴즈가 아니기 때문입니다.
에이전트는 "모호성을 처리하거나, 올바른 파일을 찾거나, 전체 워크플로우에 걸쳐 컨텍스트를 유지하지 못하며", 여러 도메인과 플랫폼에 걸쳐 정보를 동시에 추적해야 할 때 가장 크게 어려움을 겪는다. Mercor, APEX-Agents (source: Mercor, 2026-01).
가장 어려운 사례는 여러 도메인과 플랫폼을 동시에 조율해야 하는 경우입니다 . 이 격차는 원시 지능이 아니라 에이전트 조율에 있으며, 이것이 바로 전체 업무를 넘기려는 계획자에게 최고 벤치마크 수치가 오해를 불러일으키는 이유입니다.
Remote Labor Index는 실패 양상에 수치를 부여합니다. 실제 수주 프리랜서 프로젝트 240건을 대상으로 한 시도 전체에서 그 분포는 다음과 같습니다 :
| 실패 유형 | 시도 비율 |
|---|---|
| 전문가 수준 미달 | 45.6% |
| 불완전하거나 형식이 잘못된 납품물 | 35.7% |
| 파일 무결성 문제 | 17.6% |
| 파일 간 내부 불일치 | 14.8% |
항목이 중복되어 합산 시 100%를 넘지만, 패턴은 분명합니다 . 대부분의 실패는 미묘한 품질 부족이 아니라, 납품물 자체가 깨져 있거나, 불완전하거나, 파일 간 자기 모순을 드러내는 형태로 나타납니다. 이는 APEX가 지적한 "올바른 파일 찾기, 컨텍스트 유지" 결함과 정확히 맞닿아 있습니다. 에이전트가 맥락을 잃는 곳은 바로 다중 파일, 장기 지속 작업입니다.
다만 RLI가 전 영역에서 균일하게 낮은 것은 아닙니다. 논문은 에이전트가 이미 수용 가능한 결과물을 내놓는 분야를 명시하고 있습니다 :
- 오디오 및 이미지 처리: 범위가 좁고 단일 결과물로 끝나는 작업.
- 글쓰기: 명확한 브리프가 있는 단문 텍스트.
- 데이터 조회 및 웹 스크래핑: 명세가 잘 정의된 추출 작업.
- 인터랙티브 데이터 시각화: 정해진 입력, 정해진 차트.
성과를 낸 분야의 공통점은 입력 범위가 좁고, 출력 형식이 단일하며, 유지해야 할 문서 간 상태가 거의 없다는 것입니다. 이러한 분야는 오늘날 충분히 대응 가능합니다. 반면 실패는 이기종 파일을 추적하고, 이를 조율하며, 긴 워크플로우 전반에 걸쳐 의도를 유지해야 하는 작업에 집중됩니다. 바로 이 오케스트레이션 계층이 앞으로 구축해야 할 핵심입니다.
Remote Labor Index: 프리랜서 프로젝트 240건, 자율 완료율 2.5%

Remote Labor Index(RLI)는 수요 측면에서 동일한 오케스트레이션 계층을 검증합니다. 스크립트화된 작업을 통과하는지가 아니라, 에이전트가 실제 수주 프로젝트 전체를 납품할 수 있는지를 묻습니다. Center for AI Safety 및 Scale AI 소속 연구진이 구축해 2025년 10월 말에 공개한 RLI는, 총액 $143,991에 달하는 진짜 유료 프리랜서 프로젝트 240건을 기준으로 에이전트를 평가하며, 이는 인간 전문가의 6,000시간 이상의 작업에 해당합니다 . 개별 프로젝트 중에는 $10,000을 넘고 100시간 이상 소요된 것도 있습니다 .
평가 지표는 자동화율입니다. 인간 평가자가 AI 납품물을 합리적인 클라이언트 기준에서 인간 참조물과 동등 이상으로 판단한 프로젝트의 비율입니다. 프런티어 에이전트들은 최저 수준에 가까운 성적을 기록했습니다.
| 에이전트 | 자동화율 |
|---|---|
| Manus | 2.5% |
| Grok 4 | 2.1% |
| Claude Sonnet 4.5 | 2.1% |
| GPT-5 | 1.7% |
| ChatGPT agent | 1.3% |
| Gemini 2.5 Pro | 0.8% |
최고 성적을 낸 Manus조차 자율적으로 완료한 프로젝트는 2.5%에 불과하며, 나머지는 그에도 못 미칩니다 . 이 결과는 APEX의 진단을 그대로 반영합니다. 병목은 단일 납품물에 대한 원시 역량이 아니라, 이기종·장기 지속 작업을 끝까지 마무리하는 것입니다.
이 수치를 읽는 개발자라면 두 가지 주의 사항에 유의해야 합니다:
- 재현성이 제한됩니다. 240건 중 230건은 오염 방지와 개인정보 보호를 위해 비공개로 유지되어, 직접 확인하거나 재실행할 수 있는 공개 예시는 10건에 불과합니다 .
- 라이브 수치는 개선됐지만 근거가 빈약합니다. CAIS의 실시간 대시보드에는 현재 완전 자동화율이 약 4.17%로 표시되어 논문 발표 이후 개선이 있었음을 시사합니다 . 다만 사용 모델, 실행 조건, 신뢰 구간이 공개되지 않으므로, 논문 표를 대체하는 수치가 아니라 참고용 업데이트 지표로 받아들여야 합니다.
어느 쪽이든 결론은 같습니다. 명세가 명확한 단일 출력 작업은 해결 가능합니다. 하지만 전체 프리랜서 브리프(모호한 범위, 혼합 파일 형식, 클라이언트 수용 가능 품질)의 자율 납품은 여전히 바닥에 가깝습니다. 다음 세대 에이전트 툴링이 메워야 할 것은 최고 벤치마크 점수가 아니라 바로 이 격차입니다.
GDPval 47%: 증강은 자율 납품이 아니다
GDPval은 자율성 수치와 낙관론이 둘 다 사실일 수 있는 이유를 설명하는 벤치마크다. 2025년 9월 25일 OpenAI가 공개한 이 벤치마크에서 Claude Opus 4.1은 44개 직종에 걸친 지정 작업의 47.6%에서 인간의 결과물과 동등하거나 이를 능가하는 점수를 받았다. RLI의 2.5%와는 전혀 다른 세계처럼 들리지만, 각 테스트가 실제로 무엇을 묻는지 읽어보면 이야기가 달라진다.
GDPval은 정해진 단일 결과물에 대한 출력 품질을 측정한다. 이 보고서, 이 분석, 이 설계를 작성한 뒤 전문가들이 평가하는 방식이다. 220개 과제로 구성된 오픈 골드 세트는 미국 GDP 상위 9개 산업에서 선발된 평균 14년 이상 경력의 전문가들이 구성했다. 이 벤치마크가 검증하는 것은 증강(augmentation)이다. 범위가 명확히 정해진 요청에 대한 강력한 결과물이 바로 그 대상이다.
APEX와 RLI는 더 어려운 명제를 검증한다. 이질적인 파일, 모호한 기준, 긴 시간 지평을 포함한 전체 프로젝트를 자율적으로 완수하는 것이다. 이것이 자동화이며, 깔끔한 요청에서 47.6%를 달성하는 동일한 모델도 전체 의뢰를 완수하는 비율은 극히 일부에 불과하다.
OpenAI는 헤드라인 수치가 실제 비용을 과소평가한다고 명시했다.
"모델은 인간 전문가 기준보다 약 100배 빠르고 100배 저렴할 수 있지만, 이 추정치는 감독·반복 작업·통합 비용을 제외한다"고 OpenAI는 GDPval 발표에서 밝혔다 (source: OpenAI).
그 제외된 비용들이 바로 APEX와 RLI 에이전트가 실패하는 지점이다. 실제 배포의 배율이 정확히 알려지지 않은 것은, 통합 레이어가 여기서 측정되지 않았기 때문이다.
두 편의 선행 연구가 이 패턴을 뒷받침한다:
- TheAgentCompany (카네기 멜론대): 175개 직장 과제로 구성된 가상 소프트웨어 회사 환경에서 최고 에이전트는 24.0%만 자율적으로 완수했다.
- QuestBench: 256개 연구 영역 질문에 걸쳐 13개의 심층 연구 시스템을 평가한 결과 평균 통과율은 16.85%였다.
이 격차는 모든 테스트에서 일관되게 나타난다. 작업 범위를 좁히면 최전선 모델들은 유용한 협업자가 되지만, 전체 작업을 맡기면 자율 납품은 바닥으로 무너진다.
무엇을 목표로 해야 할까: 신뢰성·그라운딩·반복 실행 일관성

병목 지점은 최고 단일 턴 품질이 아니다. 에이전트가 상태를 잃거나 파일을 잘못 식별하거나 모호성에 막히지 않고 반복 실행에 걸쳐 전체 파이프라인을 깔끔하게 완수하는지 여부가 관건이다. APEX-Agents는 실패 원인을 원시 추론이 아닌 워크플로 역량에서 찾는다. 모델들이 "모호성 처리, 올바른 파일 찾기, 전체 워크플로에 걸친 컨텍스트 유지"를 해내지 못한다는 것이다 . RLI도 오류 분석에서 같은 이야기를 한다. 시도의 35.7%가 불완전하거나 잘못된 형식의 결과물을 제출했고, 17.6%는 파일 무결성 문제가 있었다 .
빌더 관점에서 이는 단일 시도 정확도 개선보다 우선해야 할 세 가지 투자 영역을 가리킨다:
- 환경 그라운딩: 결정론적 파일시스템 및 도구 접근성 확보. 에이전트가 가상 워크스페이스와 Box 레이아웃을 추측하는 대신 올바른 파일을 안정적으로 찾고 쓸 수 있게 한다.
- 명시적 모호성 해소: LLM 추론이 확정되기 전에 불충분하게 명시된 지시를 해소한다. 모델이 그럴듯하지만 틀린 해석을 즉흥적으로 만들어내도록 놔두지 않는다.
- 문서 간 상태 추적: 긴 시간 지평에 걸쳐 여러 도메인과 플랫폼 전반의 컨텍스트를 유지한다. APEX 모델들이 가장 고전하는 바로 그 축이다 .
이 점수들을 확정된 것으로 받아들이기 전에 두 가지 주의 사항이 있다. 두 벤치마크 모두 벤더 이해관계를 내포한다(Mercor는 훈련 데이터를 판매하고 Scale AI는 평가 서비스를 판매한다). 비공개 테스트 세트에 대한 독립적 재현도 아직 이뤄지지 않았으므로, 수치는 방향성 면에서 맞다고 읽되 최종적인 것으로 보지 말아야 한다. 그리고 성장 궤도는 가파르다. APEX 점수는 1년 전 5~10%에서 현재 20% 이상으로 올랐다는 보고가 있으며 , 이는 정적 역량 가정이 몇 분기 내에 틀릴 가능성이 높다는 것을 의미한다.
자율 납품까지의 격차는 실재하지만, 좁혀지는 속도 또한 실재한다. 지금은 반복 실행 일관성에 맞춰 구축하고 매 분기 재벤치마크하라. 이 테스트들이 측정하는 기준선은 어떤 단일 헤드라인 점수가 시사하는 것보다 빠르게 올라가고 있다.
자주 묻는 질문
APEX-Agents는 기존 AI 벤치마크가 놓치는 무엇을 측정하나요?
APEX-Agents는 단일 프롬프트 퀴즈나 고립된 코딩 퍼즐이 아닌, 장기적이고 다단계 전문 업무를 측정합니다. Mercor는 에이전트를 Box 파일 시스템이 갖춰진 모의 Google Workspace에 배치하고, 투자 은행·컨설팅·기업 법무 분야에서 전문가가 작성한 고객 납품 기준의 1~10개 합격/불합격 기준으로 각 실행을 채점합니다 . 핵심은 워크플로 역량, 즉 올바른 파일 찾기·맥락 유지·모호함 처리 능력입니다. 리더보드 퀴즈 점수는 이 중 어느 것도 테스트하지 않습니다.
RLI 자율 완료율(2.5%)이 APEX(24%)보다 훨씬 낮은 이유는 무엇인가요?
범위가 다릅니다. Remote Labor Index는 파일 형식이 다양하고 납품 기준이 모호하며 개별 완료 시간이 100시간을 초과하는 실제 의뢰 프리랜서 프로젝트 240개를 사용합니다 . 최고 에이전트인 Manus도 그 중 2.5%만 자동화했습니다 . APEX는 단일 세션 작업 통과율을 측정하며, Gemini 3 Flash는 약 24%에 도달했습니다 . RLI는 프로젝트 전체를 완료하는 더 어렵고 장기적인 테스트입니다.
GDPval의 47.6%는 25% 미만의 APEX 및 RLI 수치와 모순되나요?
아닙니다. 두 지표는 서로 다른 사항을 측정합니다. GDPval은 명확하게 정의된 단일 결과물 직업 과제에서 출력 품질을 테스트하며, Claude Opus 4.1은 골드 서브셋의 47.6%에서 인간 기준과 동등하거나 이를 능가했습니다 . 이는 증강(augmentation)입니다. APEX와 RLI는 모호한 지시에서 최종 결과물까지 자율적인 프로젝트 완료를 테스트합니다. 이는 자동화(automation)입니다. 모델은 명확하게 정의된 출력물을 훌륭하게 생성하면서도 의뢰된 프로젝트 전체를 완료하는 데 실패할 수 있으므로, 두 결과 모두 동시에 유효합니다.
APEX-Agents에서 가장 뛰어난 성능을 보인 모델은 무엇이며, 차이는 얼마나 되나요?
Gemini 3 Flash(Thinking=High)가 약 24%로 선두였으며, GPT-5.2가 약 23%로 뒤를 이었습니다 . Claude Opus 4.5·Gemini 3 Pro·GPT-5는 18% 근처에 몰려 있었고, 최고 에이전트는 8번의 시도가 허용된 경우에만 약 40%에 도달했습니다 . 모델 간 격차는 모든 모델과 고객이 수용할 수 있는 성능 수준 사이의 간극보다 훨씬 좁습니다.
APEX-Agents 결과는 이를 개발한 벤더로부터 독립적인가요?
완전하지는 않습니다. 훈련 데이터 벤더인 Mercor가 APEX를 구축했고, 평가 및 데이터 벤더인 Scale AI가 RLI를 공동 제작했습니다 . 두 회사 모두 역량 격차를 부각할 상업적 이유가 있습니다. Mercor의 평가 인프라(Archipelago)는 오픈 소스이지만, 비공개 테스트 세트(RLI는 240개 프로젝트 중 230개를 비공개로 유지)로 인해 완전한 외부 재현이 불가능합니다 . 독립적인 재현이 이루어질 때까지 이 결과를 방향성 지표로만 취급하십시오.