요즘 대부분의 AI 벤치마크에서는 최상위 모델들이 반올림 오차 수준의 차이 안에 몰려 있습니다. 그런데 애널리스트와 컨설턴트가 실제로 하는 일을 겨냥한 새 평가는 훨씬 덜 우호적인 모습을 보여줍니다.
AA-Briefcase는 무엇을 평가하나?
AA-Briefcase는 Artificial Analysis가 2026년 6월 18일 공개한 에이전트형 벤치마크로, 짧고 독립적인 문제가 아니라 현실적인 수 주짜리 지식 업무 프로젝트에서 프런티어 모델을 평가합니다 . 단발성 질문 대신, 모델은 조각난 기업 맥락을 스프레드시트, 이사회 발표자료, 재무 모델, 디자인 목업, 메모, 동영상 같은 완성 산출물로 바꿔야 합니다 . 핵심은 기업이 원래 사람에게 돈을 주고 만들게 할 만한 결과물을 테스트하는 데 있습니다.
이 벤치마크가 나온 이유는 기존 평가들이 더 이상 차이를 잘 드러내지 못하게 되었기 때문입니다. GPQA, 수학 문제 세트, 코딩 평가 같은 벤치마크들은 프런티어 영역에서 대체로 포화 상태에 이르렀고, 그래서 상위 모델들이 천장 가까이에 모여 경제적으로 의미 있는 작업에서 깔끔하게 구분되지 않습니다 . AA-Briefcase는 출시 시점부터 의도적으로 포화되지 않도록 설계되었고, 실제로도 그렇습니다. 전체 과제 세트에서 어떤 모델도 안정적으로 문제를 해결하는 수준에 가까이 가지 못하기 때문에, 이 리더보드는 수확 체감보다 실패 양상을 측정합니다 .
또한 코딩이나 과학 평가와는 다른 집단을 겨냥합니다. 초점은 애널리스트, 컨설턴트, 제품 관리자, 뱅커, 기업 전략 담당자의 워크플로에 맞춰져 있습니다. 바로 기업 자동화 수요가 가장 높은 사무직 업무들입니다. 그 목표는 다음과 같은 구성에 반영됩니다:
- 91개 과제가 비공개로 유지되는 네 가지 수 주짜리 시나리오, 즉 데이터 사이언스, 제품 관리, 은행 운영, 중공업 전략에 걸쳐 배치되어 있습니다 .
- 과제는 Google, McKinsey & Company, Boston Consulting Group 등 여러 회사 출신의 도메인 전문가들이 수개월에 걸쳐 개발했습니다 .
- 점수에 반영되는 네 가지 시나리오는 학습 데이터 오염을 막기 위해 비공개로 유지되며, 공식 점수에는 반영되지 않는 별도의 공개 예시 시나리오가 제공됩니다 .
Artificial Analysis 입장에서는 이번 공개가 자체 평가 라인업의 빈자리를 채웁니다. 이 회사는 이제 더 넓은 Intelligence Index(v4.1), GDPval-AA 제품군과 함께 AA-Briefcase를 전용 지식 업무 벤치마크로 운영하고 있으며, 이는 정적인 문제은행 대신 에이전트형 장기 업무로 방향을 튼 2026년 전략의 일부입니다 . 이어지는 섹션에서는 이 테스트가 어떻게 구성되고, 어떻게 채점되며, 왜 최고의 모델조차 기준에 한참 못 미치는지 살펴봅니다.
비공개 시나리오: Slack 스레드, 이메일, 어수선한 기업 아카이브

AA-Briefcase는 점수에 반영되는 네 가지 시나리오, 즉 데이터 사이언스, 제품 관리, 은행 운영, 중공업 전략을 완전히 비공개로 유지해 프롬프트, 소스 파일, 채점 기준이 학습 세트에 들어가지 않도록 합니다 . 이 비공개성이 핵심입니다. 수 주짜리 지식 업무를 평가하는 벤치마크는 어떤 모델도 답을 외우지 않았을 때만 의미가 있습니다. 별도의 공개 시나리오인 AA-Briefcase-Lite는 검토용으로 존재하지만 공식 Elo에는 전혀 반영되지 않으므로, 누구나 비공개 세트를 훼손하지 않고 형식을 살펴볼 수 있습니다 .
각 시나리오를 어렵게 만드는 것은 의도적인 혼란입니다. 모델은 거의 2,000개에 달하는 소스 파일로 이루어진 조각난 기업 아카이브에 투입됩니다. 여기에는 3,500건이 넘는 이메일, 약 25,000개의 Slack 메시지, 회의 녹취록, 회사 문서, 스프레드시트, 표준 문서, 시장 조사 자료가 포함됩니다 . 미리 요약된 것은 없습니다. 이사회 자료나 재무 모델에 필요한 사실들은 스레드와 첨부파일 곳곳에 흩어져 있고, 에이전트가 산출물을 만들기 전에 그것들을 애초에 찾아낼 수 있는지 자체가 테스트의 일부입니다 . 이는 깔끔하고 독립적인 프롬프트보다 실제 애널리스트 업무에 훨씬 가깝고, 대부분의 실패가 시작되는 지점이기도 합니다.
실행은 통제된 환경에서 이루어집니다. 각 에이전트는 Artificial Analysis의 Stirrup 프레임워크로 구동되는 주 단위 E2B 샌드박스 안에서 실행되며, 인터넷 접근은 없고 과제당 최대 500턴으로 제한됩니다 . 도구 세트는 의도적으로 좁게 잡혀 있습니다:
- 파일 파싱, 스프레드시트 작성, 결과물 렌더링을 위한 코드 실행.
- 모델이 산출물을 제출하거나 완료할 수 없는 과제를 포기할 수 있게 하는 완료/포기 제출 도구.
- 차트, 목업, 스캔 문서를 읽어야 하는 비전 지원 모델을 위한 이미지 보기 도구 .
인터넷이 없다는 것은 모델이 웹 검색으로 빈틈을 덮을 수 없다는 뜻입니다. 답은 제공된 아카이브 안에서 나와야 합니다. 이런 격리 덕분에 점수는 검색 운이 아니라 어수선한 맥락을 놓고 추론하는 능력을 반영합니다.
Artificial Analysis가 공개적으로 밝힌 구조적 단서도 하나 있습니다. 시나리오는 주간 워크플로, 즉 수 주짜리 프로젝트를 닮은 순서로 구성되어 있지만, 현재 실행은 과제별로 독립적입니다. 모델은 앞선 주에 제출한 결과물을 이후 과제로 가져가지 않기 때문에, 전주에 만든 재무 모델이나 메모를 바탕으로 다음 작업을 이어갈 수 없습니다 . 현재로서는 실제 애널리스트 업무에서 가장 어려운 부분이라고 할 수 있는 진짜 장기 연속성이 빠져 있으며, 따라서 이 벤치마크는 누적된 프로젝트 상태보다 깊이 있는 단일 과제 수행 능력을 테스트합니다 . 이는 알려진 한계이며, 향후 버전에서 개선될 가능성이 큰 지점입니다.
루브릭, 페어와이즈 Elo, 심사 패널을 결합한 종합 평가
AA-Briefcase는 각 과제를 하나의 정확도 숫자로만 평가하지 않고 세 가지 별도 차원에서 채점한다. 첫 번째는 이진 pass/fail 루브릭으로, 지시 사항 준수, 숨겨진 요구사항 발견, 올바른 근거 사용, 결론의 정확성을 확인한다 . 두 번째는 분석 품질로, 모델 간 페어와이즈 비교를 통해 점수를 매긴다. 세 번째는 제시 품질이며 같은 방식으로 평가한다 . 이렇게 점수를 나누면 벤치마크가 "모델이 요청받은 일을 했는가"와 "결과물이 실제로 좋은가"를 분리해서 볼 수 있다. 단일 루브릭에서는 이 두 실패 양상이 쉽게 뒤섞인다.
그다음 세 차원은 하나의 대표 숫자인 AA-Briefcase Elo로 합쳐진다. 분석 품질 Elo와 제시 품질 Elo는 페어와이즈 비교에서 바로 나오지만, 루브릭 통과율은 원래 Elo 값이 아니다. Artificial Analysis는 각 모델의 통과율에서 파생한 합성 헤드투헤드 매치를 실행한 뒤, 최대가능도 Elo 집계를 적용해 루브릭 성과를 두 비교 기반 점수와 함께 반영한다 . 결과는 하나의 순위지만, 서로 다른 통계적 가정을 가진 세 가지 측정 체계를 조립해 만든 값이다.
채점은 사람이 아니라 모델이 한다. 세 개의 프런티어 심사 모델로 구성된 균형 패널이 점수를 매긴다. Claude Opus 4.8 (max), GPT-5.5 (xhigh), Gemini 3.1 Pro Preview가 그 구성원이며, 단일 심사자 편향과 같은 계열 편향을 줄이기 위해 판정 전반에 걸쳐 샘플링된다 . 세 업체의 모델을 섞은 것은 특정 심사 모델이 자기 계열의 스타일과 비슷한 출력물을 더 선호할 위험을 의도적으로 줄이기 위한 장치다. 예를 들어 순위 후보에 Claude 모델이 있고 심사 패널에도 Claude 모델이 들어가는 경우 이런 위험은 실제로 존재한다.
리더보드를 읽는 개발자에게는 방법론 자체가 주의해야 할 부분이다. 루브릭을 Elo로 변환하는 단계는 새로운 방식이다. pass/fail 비율을 합성 매치로 바꾸고 최대가능도 집계에 넣는 것은 Artificial Analysis가 선택한 설계이지, 확립된 표준은 아니다. 아직 외부 동료평가나 제3자 재현 검증도 거치지 않았다 . 페어와이즈 비교 가중치와 심사자 샘플링도 마찬가지다. Artificial Analysis도 이것이 블라인드 방식의 인간 전문가 리뷰가 아니라 모델 심사자 기반 평가라는 점을 명확히 밝히고 있으므로, 세 업체 패널을 쓰더라도 심사 모델 편향과 채점 기준의 드리프트는 여전히 열린 문제로 남는다 .
그렇다고 순위가 무효가 되는 것은 아니지만, 읽는 방식은 달라져야 한다. AA-Briefcase Elo는 외부 감사를 거친 절대적 진실이라기보다, Artificial Analysis가 내부적으로 일관되게 적용한 종합 지표로 보는 편이 적절하다. 같은 파이프라인을 거친 모델끼리 상대 비교를 하는 데는 유용하다. 가장 약한 고리는 루브릭이나 비교 각각이 아니라, 그것들을 결합하는 검증되지 않은 접착제다.
Elo 순위 뒤에 있는 불편한 수치

따로 떼어 읽으면 AA-Briefcase 리더보드는 익숙한 프런티어 모델 서열처럼 보입니다. 하지만 절대 점수는 순위보다 훨씬 냉정한 이야기를 들려줍니다. 2026년 6월 18일 기준 Anthropic의 Claude Fable 5 (Adaptive Reasoning)가 약 1586 Elo (±15)로 1위에 올랐고, Claude Opus 4.8 (max)는 약 1353 (±11), Claude Opus 4.7은 약 1291 (±11), Z AI의 GLM-5.2 (max)는 1261 (±11), OpenAI의 GPT-5.5 (xhigh)는 약 1159 (±10)였습니다 . 1위와 2위의 격차는 230 Elo가 넘을 만큼 크고, 리더보드는 계속 변합니다. 따라서 이 수치는 고정된 순위가 아니라 Artificial Analysis가 출시 시점에 측정한 값입니다.
| 모델 | AA-Briefcase Elo (±) |
|---|---|
| Claude Fable 5 (Adaptive Reasoning) | ~1586 (±15) |
| Claude Opus 4.8 (max) | ~1353 (±11) |
| Claude Opus 4.7 | ~1291 (±11) |
| GLM-5.2 (Z AI, max) | 1261 (±11) |
| GPT-5.5 (xhigh) | ~1159 (±10) |
Source: Artificial Analysis, AA-Briefcase, 2026-06-18 기준.
Elo 순서보다 더 중요한 것은 그 아래에 놓인 내용입니다. 이번 공개에서 눈에 띄는 숫자는 누가 이겼느냐가 아니라, 이겼다는 말의 의미가 얼마나 작으냐입니다. Claude Fable 5는 91개 과제 중 약 3%에서만 모든 평가 기준을 완전히 충족했습니다 . 이는 테스트된 모든 모델 중 가장 높은 완전 충족률이지만, 절대 기준으로는 여전히 0에 가깝습니다. 3%를 중간값이 아니라 최고점으로 봐야 합니다. 지식 노동 벤치마크의 선두 모델도 처음부터 끝까지 전체 업무를 완수하는 경우는 대략 30개 중 1개에 불과합니다.
분포도 많은 것을 말해줍니다. 91개 과제 중 31개에서는 평가 대상 모델 어느 것도 루브릭 통과율 50%를 넘지 못했습니다 . 벤치마크의 약 3분의 1은 현재 역량 수준에서는 사실상 풀리지 않은 상태입니다. 그래서 AA-Briefcase는 포화되지 않은 상태로 출발했고, 거의 완벽한 경쟁자들을 가르는 대신 프런티어 모델의 실패 양상을 측정하고 있습니다.
"Even the best models fully satisfy every requirement on only a small fraction of tasks, and on roughly a third of the benchmark no model clears a 50% rubric pass rate," — Artificial Analysis (source: AA-Briefcase).
모델의 실패 방식은 역량 단계에 따라 뚜렷하게 갈립니다. 이 구분은 에이전트형 배포 범위를 정하는 사람에게 특히 유용합니다.
- 약한 모델은 기본 단계에서 실패합니다. 지저분한 출처 묶음에서 필요한 입력을 안정적으로 찾아오지 못하거나, 애초에 쓸 수 있는 산출물을 만들지 못합니다. 이 실패는 분석적이라기보다 기계적인 실패입니다 .
- 강한 모델은 상한선에서 실패합니다. 숨겨져 있거나 미묘한 요구사항을 놓치고, 분석을 불완전하게 만들거나, 형식과 파일 무결성에 문제가 있는 산출물을 내놓는 경우가 더 많습니다. 이메일, Slack 스레드, 문서처럼 조각난 증거를 종합해야 할 때 비로소 드러나는 오류입니다 .
실무적으로 읽으면 이렇습니다. Elo가 높아질수록 기본적인 실행 실패는 줄어들지만, 몇 주짜리 애널리스트 업무를 감독 없이 끝까지 맡겨도 되는 모델이 된다는 뜻은 아닙니다. 오류 양상은 "올바른 파일을 열지 못했다"에서 "결론을 바꾸는, 묻혀 있던 제약 하나를 놓쳤다"로 이동합니다. 그리고 두 번째 실패는 검토 과정에서 훨씬 더 잡아내기 어렵습니다.
오픈웨이트 AI의 경제성: GLM-5.2와 Fable 5 비교
그 신뢰성 격차는 실제 비용으로 이어지고, 차이는 매우 크다. AA-Briefcase에서 작업당 비용은 800배 이상 벌어진다. 리더보드 1위인 Claude Fable 5는 평균 31달러가 넘는 반면, DeepSeek V4 Flash (Max)는 약 0.04달러에 그쳐 약 775배 차이가 난다 . 다만 가장 저렴한 모델들은 점수도 훨씬 낮기 때문에, 이 숫자를 공짜 지능처럼 받아들일 수는 없다. 배포 결정을 내릴 때 더 중요한 질문은 가격 대비 성능 곡선이 어디에서 꺾이느냐이며, Artificial Analysis는 그 지점으로 오픈웨이트 계층을 가리킨다.
가장 눈에 띄는 사례는 Z AI의 GLM-5.2 (max)로, 이 벤치마크에서 가장 앞선 오픈웨이트 모델이다. 이 모델은 Claude Opus 4.8 (max)보다 약 90 Elo 낮은 점수를 기록했지만, 작업당 비용은 25% 미만이었다 . 품질 저하를 어느 정도 감수할 수 있는 비용 민감형 파이프라인이라면 충분히 방어 가능한 선택지다. DeepSeek V4 Pro (max)도 비슷한 가치 구간에 들어오며, MiniMax-M3는 GLM-5.2 바로 뒤인 1113 Elo를 기록했다 . 이 모델들 중 어느 것도 루브릭 통과율에서 최상위 폐쇄형 모델을 따라잡지는 못하지만, 질문의 초점을 "무엇이 최고인가"에서 "달러당 무엇이 충분히 좋은가"로 바꿔 놓는다.
소요 시간은 두 번째 축이며, 도구 작업보다 추론 깊이를 더 잘 반영한다. 프런티어 모델은 작업당 대략 11~23분이 걸린다. Claude Opus 4.8은 약 23분, GLM-5.2는 약 16.3분, GPT-5.5 (xhigh)는 약 11분이다 . 코드 실행과 파일 입출력 같은 도구 실행은 이 시간의 약 12%에 불과하고, 나머지는 출력의 길이, 턴 수, 추론 속도에서 나온다 .
| 모델 | AA-Briefcase Elo | 평균 비용 / 작업 | 소요 시간 / 작업 |
|---|---|---|---|
| Claude Fable 5 (Adaptive Reasoning) | ~1586 | >$31 | ~28.5분 (추정) |
| Claude Opus 4.8 (max) | ~1353 | 기준선 (높음) | ~23분 |
| GLM-5.2 (max) — 오픈웨이트 | 1261 | Opus 4.8의 <25% | ~16.3분 |
| GPT-5.5 (xhigh) | ~1159 | — | ~11분 |
| MiniMax-M3 | 1113 | — | — |
| DeepSeek V4 Flash (Max) | 하위권 | ~$0.04 | — |
확장 추론은 처리량 비용을 동반하며, 1위 모델이 이를 구체적으로 보여준다. Claude Fable 5는 작업당 약 28.5분이 걸리는 것으로 추정되는데, 이는 초당 약 91토큰 속도로 약 139,000개의 출력 토큰을 생성하는 시간에 실제 도구 실행 시간 약 3.1분이 더해진 값이다 . 다시 말해 최고 점수는 더 무거운 도구 사용이 아니라, 여러 문서가 얽힌 단절적인 시나리오를 놓고 토큰과 시간을 들여 생각한 대가다. 에이전트형 분석가 파이프라인의 예산을 짜는 팀에게 실용적인 결론은 이렇다. 가장 높은 Elo는 가장 느리고 가장 비싼 항목이기도 하며, 실제 업무가 최상위 계층을 요구하기 전까지는 비용이 4분의 1인 오픈웨이트 모델이 합리적인 기본값일 수 있다.
판정 패널 채점 방식의 사각지대

AA-Briefcase의 모든 숫자에서 가장 큰 단서는 작업 내용을 직접 확인할 수 없다는 점이다. 점수화된 네 가지 시나리오인 데이터 사이언스, 제품 관리, 은행 운영, 중공업 전략과 그 루브릭은 학습 데이터 오염을 막기 위해 비공개로 유지된다. 따라서 독립 연구자가 대표 Elo 수치를 재현하거나 감사할 수 없다 (source: Artificial Analysis, 2026-06). 이런 비공개 방침은 방어할 수 있다. 공개 벤치마크는 다음 학습 과정으로 새어 들어가기 때문이다. 하지만 여기서는 채점이 단일 정확도 숫자가 아니라 복합 지표이기 때문에 특히 큰 의미를 갖는다.
대표 지표가 어떻게 만들어지는지 다시 보자. 이진 루브릭 통과율, 모델 간 쌍대 비교에서 나온 분석 품질 Elo, 발표 품질 Elo를 합친 뒤, 합성 일대일 대결과 최대우도 집계를 통해 하나의 AA-Briefcase Elo로 융합한다 . 이 각각의 단계, 즉 쌍대 집계, 루브릭을 Elo로 바꾸는 합성 변환, 여러 판정 모델의 가중 방식은 모두 방법론적 선택이며, 동료 심사, 제3자 재현, 독립적으로 공개된 채점 프로토콜을 거친 것은 아니다. 합리적인 선택을 다르게 하면 리더보드 순서가 바뀔 수도 있다.
채점자 자체도 문제다. 균형 잡힌 설계에도 불구하고, 이는 여전히 AI가 판정하는 평가다. 채점은 Claude Opus 4.8 (max), GPT-5.5 (xhigh), Gemini 3.1 Pro Preview로 구성된 3개 모델 패널에서 이뤄지며, 단일 판정자 편향과 같은 계열 편향을 줄이기 위해 샘플링된다 (source: Artificial Analysis, 2026-06). 이 패널은 상관된 오류를 줄여 주지만, 판정 모델 편향이나 채점 드리프트를 제거하지는 못한다. 또한 모델 판정자를 실제 정답에 맞춰 고정하기 위한 블라인드 인간 전문가 검토도 수행되지 않았다. 최상위 모델인 Claude Fable 5가 판정 패널에 올라 있는 플래그십 모델과 같은 벤더에서 나온 모델이라는 점을 고려하면, 인간 대조군의 부재는 계속 염두에 둘 필요가 있다.
Artificial Analysis도 이 경계를 솔직히 밝힌다. 팀은 AA-Briefcase가 "패널 설계에도 불구하고 판정 모델 편향과 채점 드리프트가 여전히 열린 우려로 남아 있는, 블라인드 인간 전문가 검토가 아닌 모델 판정 기반 평가"라고 설명한다 (source: Artificial Analysis, 2026-06). 실무적으로는 리더보드를 감사된 사실이 아니라 벤더가 공개한 동적인 스냅샷으로 읽어야 한다.
이런 관점은 결과를 인용하는 방식에도 중요하다. Claude Fable 5의 약 1586 Elo, 약 3%의 전체 기준 통과율, 800배에 이르는 비용 격차는 모두 2026년 6월 18일 기준 Artificial Analysis 자체 측정치다 . 방향성을 보여 주고 내부적으로는 일관되지만, 외부 검증을 거친 수치는 아니다. 출시 이후 순위가 바뀌었을 수 있으며, Artificial Analysis, Hugging Face, GitHub, 그리고 The Decoder의 초기 2차 보도를 넘어선 독립 보도는 아직 많지 않다. 이 수치들은 유용한 최전선 신호로 활용하되, 확정된 진실이 아니라 한 회사의 스냅샷으로 인용해야 한다.
시연 시나리오: AA-Briefcase-Lite와 Stirrup 라이브러리
AA-Briefcase의 숫자를 신뢰하기 전에 직접 살펴보고 싶다면, Artificial Analysis가 벤치마크와 함께 Hugging Face에 공개한 점수 미반영 실사 시나리오인 AA-Briefcase-Lite부터 보면 됩니다 . 이 시나리오는 가상의 인수자 Halberd Capital Partners가 가상의 인수 대상 Aurora Eggs Ltd를 일주일 동안 평가하는 설정으로, 실제 뉴질랜드 계란 시장 데이터를 바탕에 두고 진짜 문서와 합성 문서를 의도적으로 섞어 놓았습니다. 에이전트가 해결해야 하는 심어진 모순도 포함됩니다 . 점수에 반영되는 네 개 시나리오는 오염을 막기 위해 비공개로 유지되므로, Lite는 이 제품군에서 실제로 열어 읽을 수 있는 유일한 부분입니다.
규모도 구체적입니다. 공유 폴더와 주차별 폴더에 나뉜 67개 출처와 147개 파일 풀에서 나온 4개 과제와 63개 체크 항목으로 구성됩니다 . 요구 산출물을 보면 여기서 말하는 "지식 작업"이 실제로 무엇인지 분명해집니다. 채팅 답변이 아니라 파일 묶음입니다:
market_overview.tex/.pdf— 조판된 시장 개요market_model.xlsx— 작동하는 재무/시장 모델target_assessment.pptx— 이사회 보고 형식의 평가 덱briefing.mp4및briefing.srt— 자막이 포함된 녹화 브리핑
이 데이터셋은 Apache-2.0 라이선스로 제공되며 전체 용량은 104MB이고, 출시 시점 스냅샷 기준 다운로드 수는 약 465회였습니다 . 공식 Elo 순위에는 아무 영향도 주지 않지만, 점수 반영 시나리오를 움직이는 과제 구조, 채점 기준 형식, 파일 무결성 기대치를 충실히 보여 주는 참고 자료입니다.
실행 도구도 공개되어 있습니다. AA-Briefcase 실행을 구동하는 MIT 라이선스 Python 에이전트 프레임워크인 Stirrup은 GitHub에 공개되어 있으며, 코드 실행, 웹 도구, MCP, 문서 입출력, 컨텍스트 관리, 멀티모달 처리를 지원합니다 . 자체 에이전트 평가를 만들려는 팀에는 이 조합이 실질적으로 유용합니다. 허용 범위가 넓은 라이선스의 하네스와, 복잡한 입력이 어떻게 채점 가능한 산출물로 바뀌는지 보여 주는 실제 예시가 함께 제공되기 때문입니다. 둘 다 역공학 없이 내부 파이프라인에 맞게 바꿔 쓸 수 있습니다.
실무적인 결론은 이렇습니다. AA-Briefcase의 대표 Elo 점수는 2026년 6월 18일 기준 한 회사의 신호로 보고, Lite와 Stirrup은 재사용 가능한 인프라로 보아야 합니다. 데이터셋을 복제하고 Stirrup에서 실행하면, 자체 과제 위에서 산출물 채점 루프를 재현할 수 있습니다. 이는 단일 리더보드 순위보다 더 오래가는 이점입니다. 애널리스트형 자동화를 검토하고 있다면 먼저 하네스를 만들고, 무엇을 출시할지는 벤더 순위가 아니라 자체 평가 기준의 통과율로 결정하십시오.
자주 묻는 질문
AA-Briefcase는 GPQA나 SWE-bench 같은 벤치마크와 무엇이 다른가요?
AA-Briefcase는 장기간에 걸친 여러 문서 기반 지식 업무를 측정합니다. 이메일, Slack 스레드, 스프레드시트, 회의록처럼 정돈되지 않았지만 현실적인 입력으로 구성된, 여러 주에 걸친 애널리스트와 컨설턴트 시나리오가 대상입니다. 채점되는 각 시나리오는 3,500개가 넘는 이메일과 약 25,000개의 Slack 메시지를 포함해 거의 2,000개의 원본 파일을 바탕으로 합니다 . GPQA, 수학 문제 세트, 코딩 제품군 같은 벤치마크는 짧고 독립적인 문제를 테스트하며, 최상위권에서는 상당 부분 포화되어 더 이상 상위 모델을 잘 구분하지 못합니다. AA-Briefcase는 2026년 6월 18일 출시 시점부터 의도적으로 포화되지 않게 설계되었습니다 . 그래서 더 어렵고, 경제적으로도 더 의미 있는 신호가 됩니다.
2026년 6월 기준 AA-Briefcase에서 가장 높은 점수를 받은 AI 모델은 무엇인가요?
Anthropic의 Claude Fable 5(Adaptive Reasoning)가 약 1586 Elo(±15)로 선두이며, Claude Opus 4.8(max)은 약 1353, Claude Opus 4.7은 약 1291, Z AI의 GLM-5.2(max)는 약 1261, OpenAI의 GPT-5.5(xhigh)는 약 1159로 뒤를 이었습니다 . Fable 5는 루브릭 통과율과 분석 품질에서 모두 앞섰고, Opus 4.8은 프레젠테이션 부문 공동 1위를 기록했습니다 . 이 수치는 Artificial Analysis가 2026년 6월 18일 기준으로 측정한 결과로 보아야 합니다. 리더보드는 동적으로 바뀌며, 더 많은 모델이 평가되면 순위도 달라질 수 있습니다.
Fable 5가 과제의 3%만 완전히 통과했다는 것은 무슨 뜻인가요?
루브릭은 지시사항 준수, 숨겨진 요구사항 발견, 올바른 증거 사용, 결론의 정확성을 다루는 이진 통과/실패 항목으로 각 과제를 평가합니다. 완전 충족은 모든 항목을 한 번에 통과했다는 뜻입니다. Claude Fable 5는 91개 과제 중 약 3%에서만 모든 기준을 완전히 충족했습니다 . 내장된 요구사항 하나만 놓쳐도 전체 과제는 미완료로 처리됩니다. 이 3%는 중앙값이 아니라 상한선입니다. 최상위 모델조차 현실적인 애널리스트 시나리오에서는 거의 항상 최소 한 가지 기준을 놓치며, 91개 과제 중 31개에서는 테스트된 어떤 모델도 루브릭 통과율 50%를 넘지 못했습니다 .
AA-Briefcase 과제를 직접 재현하거나 실행할 수 있나요?
채점 대상 시나리오는 불가능합니다. 공식 시나리오 4개인 데이터 사이언스, 제품 관리, 은행 운영, 중공업 전략은 학습 데이터 오염을 막기 위해 비공개로 유지되므로 독립적으로 감사하거나 다시 실행할 수 없습니다 . 사용할 수 있는 것은 AA-Briefcase-Lite입니다. Hugging Face에 공개된 Apache-2.0 데모 시나리오로, 4개 과제와 63개 체크를 포함하며 검토와 비채점 실험에 활용할 수 있습니다 . 채점 하네스인 MIT 라이선스 Stirrup 에이전트 프레임워크는 GitHub에 공개되어 있으며, 자체 파이프라인에서 코드 실행, 웹 도구, MCP, 문서 입출력을 지원합니다 .
오픈 웨이트 AI는 AA-Briefcase에서 최전선 독점 모델과 경쟁할 만한가요?
성능만 보면 아직 아닙니다. 비용까지 보면 확실히 경쟁력이 있습니다. 선두 오픈 웨이트 모델인 GLM-5.2(max)는 Claude Opus 4.8(max)보다 약 90 Elo 낮았지만, 과제당 비용은 25% 미만이었습니다 . 최상위 모델의 비용이 얼마나 높은지를 고려하면 이 격차는 중요합니다. Claude Fable 5는 과제당 평균 31달러를 넘었지만, DeepSeek V4 Flash(Max)는 약 0.04달러였습니다. 800배가 넘는 차이입니다 . DeepSeek V4 Pro(max)도 주목할 만한 비용 대비 성능 선택지입니다. 과제당 지출이 핵심 제약인 팀이라면 오픈 웨이트 모델이 가장 분명한 대안입니다.