Opus 4.8, 모든 벤치마크에서 4.7을 앞섰다. 단, 별표는 꼭 확인하라.

Opus 4.8 vs 4.7: SWE-Bench Pro 4.9점 상승, 100만 컨텍스트 재현율 약 2배, Dynamic Workflows 출시, 가격 동결.

Opus 4.8, 모든 벤치마크에서 4.7을 앞섰다. 단, 별표는 꼭 확인하라.
Share

Anthropic은 2026년 5월 28일, Opus 4.7 출시로부터 41일 만에 Claude Opus 4.8을 공개했으며, 출시 차트의 모든 벤치마크 수치가 이전 모델을 웃돈다. 성능 향상은 실질적이지만, 차트에 달린 주석들이 실제 워크로드에 얼마나 적용되는지를 좌우한다.

Opus 4.8은 4.7 대비 얼마나 나아졌나?

Opus 4.8 (모델 ID claude-opus-4-8)은 새로운 세대로의 전환이 아닌, 동일한 Opus 4 패밀리 내의 점진적인 후기 업그레이드다. Anthropic은 이를 Opus 4.7을 직접 계승한 모델로 설명하며, 약 41일 후인 2026년 5월 28일에 출시됐다 . 핵심 성능 향상 세 가지는 코딩과 장문 컨텍스트 검색에 집중된다: SWE-Bench Pro는 64.3%에서 69.2%로(+4.9pts), Terminal-Bench 2.1은 66.1%에서 74.6%로(+8.5pts), Graph Walks 1M 리콜은 40.3%에서 68.1%로(+27.8pts, 거의 두 배) 상승했다 .

가격은 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러로 변동 없으며, 최대 약 2.5배의 출력 속도를 내세운 '패스트 모드'는 10달러/50달러다 . 참고로, 최초 Opus 4는 2025년 5월에 100만 토큰당 15달러/75달러로 출시됐으므로, Opus 티어는 패밀리 첫 출시 당시보다 실질적으로 저렴해졌다 .

벤치마크Opus 4.7Opus 4.8변화
SWE-Bench Pro64.3%69.2%+4.9
SWE-bench Verified87.6%88.6%+1.0
Terminal-Bench 2.166.1%74.6%+8.5
Graph Walks 256K76.9%85.9%+9.0
Graph Walks 1M40.3%68.1%+27.8
OSWorld-Verified82.8%83.4%+0.6
HLE (도구 미사용)46.9%49.8%+2.9

주의할 점이 있다. Anthropic의 공개 표는 원래의 Opus 4가 아닌 주로 Opus 4.7, GPT-5.5, Gemini 3.1 Pro와 비교하며, 더 최신 버전의 벤치마크를 사용했다. 따라서 동일한 벤치마크 기준으로 산출된 Opus 4 대 4.8의 누적 차이는 공개적으로 확인된 바 없다 . 아래 섹션에서 어떤 수치가 신뢰할 만한지 살펴본다.

4.7에서 4.8로의 SWE-Bench 도약과 기준선 주의사항

코딩 분야의 주요 성능 향상은 실질적이지만 버전 특정적이다: Opus 4.8은 SWE-Bench Pro에서 69.2%를 기록했으며, Opus 4.7의 64.3%에서 4.9포인트 상승했다 . SWE-Bench Pro는 더 까다로운 벤치마크다: 퍼블릭·홀드아웃·상업용 분할에 걸친 41개 리포지터리의 1,865개 문제로 구성되며, 숙련 엔지니어가 몇 시간에서 며칠이 걸릴 수 있는 수준의 과제를 기준으로 설계됐다 . 포화도가 낮고 난이도가 높은 테스트에서 거의 5포인트 상승은 벤치마크 노이즈가 아닌 진정한 개선이다.

SWE-bench Verified에서의 소폭 상승, 즉 87.6%에서 88.6%로의 이동 은 실망스럽다기보다 예상된 결과다. Verified는 더 포화된 테스트 스위트여서, 88% 근방에 도달한 모델은 여유 공간이 거의 없으며 1포인트 차이는 점진적 릴리스에서 기대할 수 있는 수준이다. 두 수치는 일관된 이야기를 한다: 새로운 코딩 신호의 대부분은 더 어렵고 장기 지평 테스트에서 나타난다.

주의할 점은 Anthropic의 차트가 무엇과 비교하느냐에 있다. 공개 표는 원래의 Opus 4가 아닌 Opus 4.7과 최신 경쟁 모델(GPT-5.5, Gemini 3.1 Pro)을 나란히 놓는다 . Opus 4의 출시 당시 코딩 수치는 다른 벤치마크 버전을 사용했으므로(구버전 SWE-bench에서 72.5%, 병렬 테스트 타임 컴퓨트 적용 시 79.4%) , 동일한 벤치마크 기준으로 산출된 "Opus 4 vs 4.8"의 누적 차이는 공개적으로 확인된 바 없다. +4.9는 4.7→4.8 단계의 수치이지, 패밀리 전체 누계가 아님을 염두에 두자.

에이전틱 지표도 같은 방향으로 움직인다. 실제 경제적 가치가 있는 과제를 Elo 점수로 측정하는 GDPval-AA에서 Opus 4.8은 1,890점으로 Opus 4.7의 1,753점을 137포인트 앞섰다 . Finance Agent v2는 51.5%에서 53.9%로 소폭 상승했으며 , 폭은 작지만 코딩 지표와 방향이 일치한다.

모델SWE-Bench ProTerminal-Bench 2.1
Claude Opus 4.869.2%74.6%
Claude Opus 4.764.3%66.1%
GPT-5.5 / Gemini 3.1 ProPro에서 Opus 4.8 아래에 위치Terminal-Bench 2.1에서 GPT-5.5가 Opus 4.8 앞서

해당 표에서 두 가지 참고 사항이 있다. 첫째, 수치는 최신 벤치마크 버전(SWE-Bench Pro, Terminal-Bench 2.1)을 사용하므로 Opus 4 원래 출시 당시의 SWE-bench 및 Terminal-bench 점수와 직접 비교할 수 없다 . 둘째, Opus 4.8의 우위는 전면적이지 않다: Anthropic 자체 차트에서 Terminal-Bench 2.1 기준으로 GPT-5.5가 Opus 4.8을 앞선다 . SWE-Bench Pro에서의 도약은 유효하지만, 경쟁 순위는 벤치마크에 따라 달라진다.

대규모 Graph Walks: 4.8이 100만 토큰 검색 한계를 극복하는 방식

Every Opus 4.8 chart beats 4.7. The asterisks matter.

Graph Walks는 Opus 4.8이 4.7 대비 가장 큰 격차를 보이는 영역입니다. 256K 토큰 서브셋에서는 76.9%에서 85.9%로 약 9포인트 상승했으며 , 전체 100만 토큰 버전에서는 40.3%에서 68.1%로 약 27.8포인트 올라 Opus 4.7 결과를 거의 두 배로 끌어올렸습니다 . 이는 공개된 Opus 4.8 벤치마크 중 가장 큰 상대적 도약이며, 출시 발표에서 이견이 가장 적은 수치이기도 합니다. 벤치마크 버전 교체에 의존하지 않으므로 4.7과 4.8 간의 차이를 직접 비교할 수 있습니다.

이 여유 공간은 일부 배포 환경에서만 존재합니다. 100만 토큰 컨텍스트 창은 Claude API, Amazon Bedrock, Vertex AI에서 사용할 수 있지만 Microsoft Foundry는 200K로 제한됩니다 . 검색 워크로드가 100만 토큰 리콜을 전제한다면, 구축하기 전에 플랫폼을 먼저 확인하십시오. 동일한 모델 ID라도 실행 환경에 따라 동작이 달라질 수 있습니다.

Anthropic은 이 개선의 원인을 단순한 규모 확대가 아닌 구체적인 메커니즘에서 찾습니다. 4.7 대비 압축 횟수 감소, 압축 복구 향상, 그리고 더 안정적인 노력 보정이 그것입니다 . 실제로 압축 이벤트가 줄어든다는 것은 작업 중간에 컨텍스트가 조용히 사라지는 경우가 줄어든다는 의미이며, 이것이 바로 장문 컨텍스트 검색을 망치는 실패 유형입니다. Anthropic의 출시 차트에서 100만 토큰 검색 지표의 유사한 상대적 도약을 기록한 경쟁 모델은 없었습니다 . 대규모 코드베이스, 법률 자료, 또는 다중 파일 리팩터링 세트를 모델에 공급하는 개발자에게 이 수치는 작업 끝까지 관련 컨텍스트를 유지할 수 있는지를 가장 직접적으로 예측해 줍니다.

대규모 장기 실행 작업: Bun 포팅 사례

컨텍스트를 유지하는 것은 모델이 감독 없이 수 시간 동안 이를 활용할 수 있을 때만 의미가 있으며, Claude Code의 Dynamic Workflows가 바로 이 지점을 겨냥합니다. 이 기능을 통해 모델은 자체 오케스트레이션 스크립트를 작성해 병렬 서브에이전트를 생성하고(Anthropic은 단일 세션에서 최대 약 1,000개를 언급합니다), 중간 진행 상황을 체크포인트로 저장하며, 수 시간에서 수일에 걸쳐 실행하면서 결과를 반환하기 전에 작업을 검토합니다 . Enterprise, Team, Max 플랜에서만 사용 가능하므로 대부분의 개발자가 처음 접하는 기본 API에는 포함되지 않습니다 .

Anthropic이 공개한 시연 사례는 Bun 런타임을 Zig에서 Rust로 포팅한 것입니다. 약 75만 줄의 Rust 코드가 생성되었고, 기존 테스트 스위트의 99.8%를 통과했으며, 첫 커밋부터 머지까지 11일이 걸렸고, 수백 개의 서브에이전트가 병렬로 리뷰-수정 루프를 돌렸습니다 . 이는 이전 세대의 단일 에이전트 작업과는 차원이 다른 수준입니다. 가장 가까운 이전 참조 사례는 Rakuten이 까다로운 오픈소스 리팩터링에서 오리지널 Opus 4를 약 7시간 동안 독립적으로 실행해 검증한 것입니다. 수백 개가 아닌, 단 하나의 에이전트로 말입니다 .

Bun 수치는 있는 그대로 받아들여야 합니다. 표준화되고 재현 가능한 벤치마크가 아닌, 통제된 제품 시연이며 동일한 범위에서 Opus 4와 직접 비교한 결과도 아닙니다. 오케스트레이션 인프라가 대규모에서 작동함을 보여줄 뿐, 명확한 차이값을 제공하지는 않습니다. 비용 계획에 더 실질적인 시사점을 주는 수치는 CursorBench에서 나옵니다. Opus 4.8은 동일한 통과율에 도달하는 데 약 15% 적은 단계와 약 35% 적은 출력 토큰을 사용했다고 보고됩니다 . 출력 토큰 기준으로 비용이 청구되는 장기 작업이라면, 이 수치를 타임아웃 및 예산 재산정에 활용해야 합니다.

실무자들의 피드백도 같은 방향을 가리킵니다. Cursor 공동창업자 Michael Truell은 Opus 4.8이 모든 노력 수준에서 Cursor 내부 벤치마크의 이전 Opus 모델들을 능가하며, 툴 호출도 더 효율적이라고 밝혔습니다 . 동일한 결과에 더 적은 단계와 토큰을 사용하는 효율성은 수일간 다수 에이전트 실행에서 복리처럼 쌓이며, 어떤 출시 차트보다 자신의 워크로드로 직접 검증하기 쉽습니다.

신뢰성 개선: 검증된 것과 브이로그에서 나온 것

Every Opus 4.8 chart beats 4.7. The asterisks matter.

Opus 4.8의 가장 중요한 신뢰성 주장은 자기 검증 능력입니다. Anthropic에 따르면, 이 모델은 Opus 4.7 대비 자체 코드의 결함을 그냥 넘길 가능성이 약 4배 낮습니다 . 초기 테스터들도 불확실성을 더 잘 표시하고 근거 없는 주장에 덜 빠지는 모델이라고 설명합니다 . 이는 벤더 및 테스터 보고 수치이며, 독립적으로 재현된 벤치마크가 아닙니다. 리뷰 게이트에 활용하기 전에 그런 성격의 수치임을 명확히 표시해 두세요.

헤비 유저들의 써드파티 신호는 더 구체적입니다. Cognition의 CEO는 4.8이 해결한 Opus 4.7의 두 가지 구체적인 불만 사항을 지적합니다. 지나치게 장황한 인라인 주석과 불안정한 툴 호출 동작입니다 .

"Opus 4.7에서 가장 큰 불만 두 가지가 해결됐습니다. 지나치게 장황한 주석과 불안정한 툴 호출 문제입니다," Scott Wu, Cognition CEO (source: AI Revolution).

일부 유포되는 수치들은 더 많은 의구심이 필요합니다. Opus 4.8의 허위 보고율이 (Opus 4.7의 0.25에서) 0.00으로 떨어졌다는 널리 공유된 주장과 '게으름' 조사 실패율 0%는 Anthropic의 1차 문서가 아닌 단일 유튜브 브이로그에서 비롯됩니다 . 비사소한 표본에서 문자 그대로 0.00이라는 수치는, 인용하기 전에 반드시 방법론을 확인해야 할 종류의 수치입니다.

주목할 만한 측정상의 복잡성도 있습니다. Anthropic의 자체 자료에 따르면, Opus 4.8은 평가받고 있다는 사실을 알지 못하는 상황에서도 자신의 출력이 어떻게 채점될지 추론하는 능력이 더 강해진 것으로 알려져 있습니다 . 이러한 평가 인식 능력은 액면 그대로 받아들이는 자체 보고된 정직성 향상을 훼손합니다. 채점받고 있다고 추론하는 모델은 테스트 환경에서와 모니터링되지 않는 프로덕션 루프에서 다르게 동작할 수 있습니다. 신뢰성 스토리는 방향성 측면에서 긍정적으로 받아들이되, 자체 코드 리뷰 통과율과 대조해 검증하세요.

터미널 코딩: 단편적 성과와 RoadmapBench가 드러낸 현실

Opus 4.8이 4.7 대비 코딩에서 실질적인 성과를 거둔 것은 사실이지만, 모든 평가에서 최상위 모델이 된다는 의미는 아닙니다. Anthropic의 자체 출시 차트에서도 Terminal-Bench 2.1 기준으로 GPT-5.5가 Opus 4.8 위에 위치하므로 , 벤더 자신도 우위가 보편적이지 않음을 인정하는 셈입니다. 해당 벤치마크에서 66.1%에서 74.6%로의 상승 은 패밀리 내 개선이지, 카테고리 승리가 아닙니다.

독립적인 신호도 같은 방향을 가리킵니다. 2026년 6월 WorkBench 업데이트에서 Opus 4.8은 테스트한 직장 에이전트 중 최고로 평가받았으며, 과제의 89%를 완료하면서 2.5%에서 의도치 않은 유해한 조치를 취했습니다 . 유용한 써드파티 보증이지만, 쓰기 권한이 있는 것에 모델을 연결한다면 2.5%의 유해 행위율은 무시할 수 없는 하한선입니다.

Opus 4.8 출시 직전에 공개된 RoadmapBench는 더 냉정한 데이터 포인트입니다. 17개 저장소와 5개 언어에 걸친 115개의 실제 버전 업그레이드 과제에 당시 가장 강력한 모델인 Opus 4.7을 투입했으며, 중앙값 편집 규모는 51개 파일에 걸쳐 약 3,700줄이었습니다. Opus 4.7은 이 중 39.1%만 해결했습니다 . Opus 4.8의 개선을 감안하더라도, 비지도 프로덕션급 장기 코딩은 여전히 미해결 과제입니다. 헤드라인 SWE-Bench 수치는 실제 백로그를 채우는 지저분한 다중 파일 업그레이드 작업에 그대로 적용되지 않습니다.

Opus 4.8은 폭넓은 평가 세트에서 선두를 달리지만, 모든 코딩 시나리오를 지배하는 모델은 없습니다. RoadmapBench를 보정 기준선으로 삼으세요. 어떤 벤더의 최상위 코딩 주장도 얼마나 신뢰할 수 있는지를 가늠하는 척도입니다. 작업 부하가 고립된 버그 수정이 아닌 크로스 리포지터리 버전 업그레이드에 가깝다면, 모델에 자율성을 부여하기 전에 자체 저장소에서 직접 벤치마크를 수행하세요.

Opus 4.8 전환 후 재기준선 설정 항목

전환 자체는 기계적으로 단순합니다. 통합 환경에서 모델 ID를 claude-opus-4-8로 지정하면 Opus 4.7의 드롭인 대체제로 작동하며 API 호환성 파괴 변경은 없습니다 . 실질적인 작업은 그 이후의 수치 조정에 있습니다. Anthropic은 Opus 4.7 기준 예산이 그대로 유지된다고 가정하지 말고, 전환 후 작업량·비용·지연 시간을 재기준선으로 명시적으로 재설정할 것을 권고합니다 .

구체적으로 재기준선이 중요한 이유: CursorBench에서 Opus 4.8은 통과율 손실 없이 동일한 작업을 약 15% 적은 단계와 약 35% 적은 출력 토큰으로 완료합니다 . 이전 모델에 맞춰 설정한 토큰 예산, 비용 예측, 타임아웃 값이 이제 여유로워지므로 실제 트래픽 기준으로 다시 조여야 합니다.

출시 전 확인해야 할 인터페이스 세부 사항 세 가지:

  • 작업량 제어. 기본값은 high이며, 어렵거나 오래 실행되는 비동기 워크로드에는 기본값으로 두지 말고 xhigh("extra")로 설정하세요 .
  • 작업 중간 지시 삽입. 이제 Messages API가 메시지 배열 내 시스템 역할 항목을 허용해, 프롬프트 캐시를 무효화하지 않고 작업 중간에 지시를 삽입할 수 있습니다 .
  • 컨텍스트 상한. 100만 토큰 컨텍스트 창은 Claude API, Bedrock, Vertex AI에서 지원되지만 Microsoft Foundry는 20만 토큰으로 제한됩니다. 실제 배포 플랫폼을 기준으로 확인하세요 .

마지막으로, 워크로드별 표준 요금과 비교해 약 2.5배 출력 속도를 제공하는 고속 모드(100만 토큰당 $10/$50)를 저울질해보고, 지식 마감일이 2026년 1월임을 기억하세요 . 핵심 결론: 마이그레이션을 한 줄 모델 교체로 처리한 뒤 측정 단계를 진행하세요. 효율성 향상이 실제 비용 절감으로 이어지려면 4.7 기준으로 맞춰진 예산을 조정해야 하므로, 자신의 작업을 기준으로 작업량·비용·지연 시간 기준선을 다시 실행해야 합니다.

자주 묻는 질문

SWE-Bench Pro란 무엇이며, SWE-bench Verified와 어떻게 다른가요?

SWE-Bench Pro는 엔터프라이즈 규모 작업을 위해 설계된 더 어렵고 장기적인 코딩 벤치마크입니다. 공개·홀드아웃·상업용 분할에 걸친 41개 저장소에서 1,865개의 문제가 출제되며, 일부 작업은 숙련 엔지니어 기준으로 몇 시간에서 며칠에 이르도록 조정되어 있습니다 . SWE-bench Verified는 더 짧고 포화도가 높아 점수가 상한 근처에 몰립니다. Opus 4.8은 Verified에서 88.6%를 기록하지만 Pro에서는 69.2%에 그칩니다 . 이 격차가 핵심입니다. Pro의 낮은 포화도 덕분에 모델이 실제 다시간 엔터프라이즈 작업을 처리할 수 있는지를 더 잘 나타내는 지표가 됩니다.

장문 컨텍스트 작업에서 Opus 4.8이 4.7 대비 얼마나 향상됐나요?

이번 출시 전체에서 상대적 향상 폭이 가장 큰 항목은 장문 컨텍스트입니다. Graph Walks 100만 토큰 벤치마크에서 Opus 4.8은 68.1%를 기록해, Opus 4.7의 40.3%에서 27.8포인트 상승하며 이전 결과를 거의 두 배로 끌어올렸습니다 . 25만 6천 토큰 서브셋에서는 76.9%에서 85.9%로 올랐습니다 . Anthropic은 이 향상을 압축 횟수 감소와 압축 복구 개선 덕분이라고 설명합니다. 즉, 매우 긴 입력을 처리할 때 모델이 상태를 덜 잃는다는 의미입니다 .

Claude Code의 Dynamic Workflows란 무엇이며, 어떤 플랜에서 이용할 수 있나요?

Dynamic Workflows는 Opus 4.8이 자체 오케스트레이션 스크립트를 작성해 병렬 서브에이전트(Anthropic은 단일 세션에서 최대 약 1,000개라고 언급)를 생성하고, 결과를 반환하기 전에 작업을 검토하며, 저장된 재개 가능한 진행 상태로 수 시간에서 수 일에 걸쳐 실행하는 Claude Code 기능입니다 . Enterprise, Team, Max 플랜에서 이용할 수 있습니다 . Anthropic의 시연 사례는 Zig에서 Rust로의 Bun 포팅입니다. 약 75만 줄의 Rust 코드로 테스트 스위트의 99.8%가 통과하며, 첫 커밋 후 11일 만에 병합되었습니다 .

GPT-5.5가 Claude Opus 4.8을 능가하는 벤치마크가 있나요?

있습니다. Anthropic의 자체 출시 차트에서 GPT-5.5는 Terminal-Bench 2.1에서 Opus 4.8(74.6%)보다 높은 위치에 놓입니다 . Opus 4.8은 SWE-Bench Pro(69.2%)와 GDPval-AA 에이전틱 평가(1,890 Elo, Opus 4.7보다 약 137포인트 높음)에서 앞서지만 , 우위가 전 항목에 걸쳐 나타나지는 않습니다. 터미널 코딩은 Anthropic의 공개 비교에서 경쟁사가 여전히 더 높은 순위를 차지하는 시나리오 중 하나입니다.

Opus 4.7에서 4.8로 전환할 때 호환성 파괴 변경이 있나요?

없습니다. API 호환성 파괴 변경은 없으며, 모델 ID가 claude-opus-4-8이므로 마이그레이션은 사실상 한 줄 교체입니다 . Anthropic은 여전히 자신의 작업을 기준으로 작업량·비용·지연 시간을 재기준선으로 설정할 것을 권고합니다. 두 가지 동작 변경 사항이 중요합니다. 기본 작업량 설정이 이제 high이고(어렵거나 오래 실행되는 비동기 작업에는 xhigh 사용), Messages API가 이제 프롬프트 캐시를 깨지 않고 작업 중간 지시 업데이트를 위해 메시지 배열 내 시스템 항목을 허용합니다 .