Anthropic은 2026년 5월 28일 Claude Opus 4.8을 출시했으며, 헤드라인보다 출시 표가 더 선명한 이야기를 전한다. 빌더에게 가장 중요한 코딩·에이전틱 항목에서 4.8은 Opus 대 Opus 비교 모든 행에서 4.7을 앞서지만, 모든 열을 선도하지는 않는다.
에이전틱 코딩·터미널 작업: Opus 4.8 vs 4.7
에이전틱 코딩 영역에서 Opus 4.8은 Opus 4.7 대비 명확하고 측정 가능한 향상을 보이며, 소프트웨어 엔지니어링 대표 항목에서 다른 모델들을 모두 앞선다. SWE-bench Pro는 64.3%에서 69.2%로 +4.9포인트 상승했고, 같은 표에서 GPT-5.5는 58.6%, Gemini 3.1 Pro는 54.2%를 기록해 4.8이 이 부문을 단독 선도한다 . 성과는 실질적이지만, 코딩 라인의 점진적 연장선으로 읽히며 급격한 도약은 아니다.
한눈에: Claude Opus 4.8(2026년 5월 28일 출시)은 Opus 대 Opus 벤치마크 전 항목에서 4.7을 앞선다. 최대 상승폭은 Terminal-Bench 2.1로, 74.6% 대 66.1%(+8.5포인트)이지만 해당 열은 GPT-5.5가 78.2%로 선두다. SWE-bench Pro에서는 4.8이 69.2% 대 64.3%로 선두를 유지한다.
단일 개선폭이 가장 큰 항목은 터미널 코딩이며, 동시에 향상된 4.8이 선두를 차지하지 못한 가장 명확한 사례이기도 하다. Terminal-Bench 2.1에서 Opus 4.8은 74.6%로 4.7의 66.1% 대비 +8.5포인트를 기록했지만, GPT-5.5가 표준 기준 78.2%로 해당 열 1위이며, 각주에는 Codex CLI 하네스를 사용할 경우 GPT-5.5가 83.4%에 달한다고 명시되어 있다 . 따라서 4.8은 이 부문에서 4.7보다 실질적으로 우수하지만, 1위가 아닌 2위다.
| 벤치마크 | Opus 4.8 | Opus 4.7 | 증감 | 비고 |
|---|---|---|---|---|
| SWE-bench Pro (에이전틱 코딩) | 69.2% | 64.3% | +4.9 | 4.8 선두; GPT-5.5 58.6%, Gemini 3.1 Pro 54.2% |
| Terminal-Bench 2.1 | 74.6% | 66.1% | +8.5 | GPT-5.5 선두 78.2% (Codex CLI 사용 시 83.4%) |
| OSWorld-Verified (컴퓨터 사용) | 83.4% | 82.3–82.8% | +0.6~+1.1 | 포화 근접; 실행 간 평가 방법 변경됨 |
| Online-Mind2Web (브라우저 에이전트) | 84% | 낮음(미기재) | — | 벤더 인용 수치; 아직 공개 재현 불가 |
두 수치는 주의가 필요하다. OSWorld-Verified는 포화에 근접해 있다. 4.8은 83.4%를 기록했지만, 4.7 기준선은 표 이미지에서 82.8%, 평가 방법 변경 후 각주에서 82.3%로 재기재되어 있어, 어떤 4.7 수치를 기준으로 삼느냐에 따라 공식 증감폭이 +0.6~+1.1포인트에 그친다 . Anthropic은 Online-Mind2Web도 84%로 4.7 및 GPT-5.5 모두를 의미 있게 앞섰다고 언급하지만, 이 결과는 출시 자료에만 존재하며 발표 시점 기준 독립적 재현이 불가능하다 . 코딩 항목은 신뢰할 수 있는 신호로, 컴퓨터 사용 항목은 방향성 참고 지표로 취급하라.
xhigh가 권장 상한선으로 — 4.7 기준선은 이제 구식

기본 effort 수준이 Claude API와 Claude Code 전 영역에서 high로 변경되었으며, Anthropic은 이제 코딩 및 고자율 작업에 xhigh를 권장한다 . 이는 이름 변경이 아닌 동작 방식의 실질적 변화다. 4.7 파이프라인을 그대로 복사해 사용한다면, Anthropic이 4.8을 튜닝할 때 기준으로 삼은 설정이 아니며 기존 지연 시간·비용 수치는 더 이상 모델의 실제 동작을 반영하지 않는다.
티어 자체도 4.7과 4.8 사이에 재조정되었다. 4.8에서 medium은 4.7의 medium보다 더 많은 컴퓨팅을 사용하고, high는 4.7의 high보다 약간 적게, xhigh는 상당히 더 많이 사용한다 . 같은 문자열이지만 사고 예산이 달라진다. high로 고정된 작업은 4.7 때보다 추론에 조금 덜 소비하게 되며, 권장 상한선인 xhigh로 전환하면 다단계 자율 실행에서 토큰 소비와 실행 시간이 눈에 띄게 달라질 수 있다.
팀 입장에서 실질적 결론은 이렇다. 기본값을 확정하기 전에 자신의 작업 기준으로 4.8에서 high와 xhigh 모두 벤치마킹하라. 장기 에이전틱 코딩에서 그 차이는 무시할 수 없는 수준으로, Anthropic이 개선되었다고 밝힌 더 나은 장문 컨텍스트 처리·압축 횟수 감소·필수 도구 호출 누락 감소가 정확히 이 워크로드에 해당한다 . 성과가 집중되는 곳이 높은 effort 수준이지만, 비용도 마찬가지다.
Anthropic이 개발자 문서에서 마이그레이션을 설명하는 방식대로라면, "모델 문자열을 claude-opus-4-7에서 claude-opus-4-8로 업데이트하는 것만으로 변경이 완료될 수 있다"고 하지만, 같은 문서는 effort 수준이 재조정되었으므로 비용과 지연 시간 기준을 다시 측정해야 한다고도 명시한다 — Anthropic, 모델 마이그레이션 가이드. 한 줄 교체와 재튜닝을 별개의 두 작업으로 이해하라.
다음 섹션으로 넘어가기 전 한 가지 명확히 하자. 입력 100만 토큰당 $10, 출력 100만 토큰당 $50로 별도 책정된 fast 모드 는 낮은 effort 변형이 아닌 독립적인 티어다. Effort와 fast 경로는 직교하는 별개의 조절 축으로, 다음에서 fast 경로를 자세히 살펴본다.
GA 출시 서브에이전트 플릿 — Bun 재작성 데모가 열어주는 것들
Claude Code의 동적 워크플로우가 정식 출시(GA)되었습니다. 이제 단일 에이전트 실행이 수십에서 수백 개의 서브에이전트 플릿으로 확장되며, 각 서브에이전트는 결과를 보고하기 전에 자체 검증을 수행합니다. 이 기능은 리서치 프리뷰에서 GA로 승격되어 Claude Code CLI·Desktop·VS Code의 유료 플랜과 Bedrock·Vertex·Microsoft Foundry API를 통해 제공됩니다 . 핵심 가치 제안은 단일 컨텍스트 윈도우로 처리하기엔 너무 크거나 위험한 작업을 병렬로 커버하되, 결과가 나오기 전에 검증 단계를 내장한다는 점입니다.
한눈에 보기: Claude Code에서 동적 워크플로우가 GA로 출시되었습니다. 코드베이스 전체 버그 탐색, 대규모 마이그레이션, 이중 검증이 필요한 중요 작업에 수십~수백 개의 자기검증 서브에이전트를 투입합니다. 레퍼런스 데모: Bun 런타임의 Zig→Rust 재작성 — 약 75만 줄의 Rust 코드, 테스트 스위트 통과율 99.8%, 첫 커밋부터 머지까지 11일 .
대표 시연은 Bun 런타임을 Zig에서 Rust로 재작성하는 작업입니다. 약 75만 줄의 Rust 코드, 기존 테스트 스위트 대비 99.8% 통과율, 첫 커밋부터 머지까지 11일이 걸렸습니다 . 이는 출시된 제품이 아닌 기능 시연으로 받아들이세요 — 재작성본은 발표 시점에 프로덕션에 투입되지 않았습니다. 보고 전 검증 플릿이 대규모 마이그레이션에서 어느 수준까지 버텨내는지를 보여주는 것이지, 지금 당장 자신의 런타임을 이전하라는 뜻이 아닙니다.
"동적 워크플로우는 결과를 보고하기 전에 자체 검증을 수행하는 수십~수백 개의 서브에이전트를 실행합니다," — Anthropic, Claude Code 발표 (source: Introducing dynamic workflows).
Anthropic이 제시하는 세 가지 주요 용도는 코드베이스 전체 버그 탐색, 대규모 마이그레이션, 그리고 재검증이 필요한 중요 작업입니다 . 대신 토큰 소모가 늘어납니다 — 플릿은 단일 에이전트 실행보다 훨씬 많은 토큰을 소비하므로, 팀에 도입하기 전에 용량을 계획해두세요. 장시간 실행에서 플릿을 안정적으로 유지하는 것은 Opus 4.8입니다. 향상된 압축 복구, 필수 툴 호출 누락 감소, 장문 컨텍스트 압축 이벤트 이후 더 안정적인 작업 지속이 그 이유입니다 . 이러한 안정성 향상은 수십 개의 서브에이전트가 수 시간 동안 무감독으로 실행될 때 가장 중요합니다. 이전에는 툴 호출 하나가 빠지거나 압축 복구가 잘못되면 전체 작업이 망가지곤 했기 때문입니다.
$10/M 고속 경로 — 2.5배 빠르고, 언제 선택할까

Opus 4.8의 가격은 두 가지 경로로 나뉩니다. 표준 경로는 Opus 4.7과 동일하게 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25입니다 . 별도 가격의 고속 모드는 입력 $10, 출력 $50(100만 토큰 기준)으로, 토큰당 비용은 두 배지만 이전 세대 모델의 고속 등급 대비 최대 2.5배 빠르고 약 3배 저렴하다고 설명됩니다 . 이는 추론 깊이를 희생해 처리량을 얻는 것이지, 품질 손실 없는 속도 향상이 아닙니다.
| 항목 | 표준 경로 | 고속 경로 |
|---|---|---|
| 입력/출력 (100만 토큰당) | $5 / $25 | $10 / $50 |
| 상대 속도 | 기준 | 최대 2.5배 빠름 |
| 추론 예산 | 전체 (xhigh 사용 가능) | 처리량을 위해 축소 |
| 컨텍스트 윈도우 | 1M (API, Bedrock, Vertex) | 1M (API, Bedrock, Vertex) |
고속 경로는 지연 시간에 민감한 파이프라인에서 표준 경로 출력이 해당 작업에 충분하다고 이미 검증된 경우에 선택하세요 — 인터랙티브 UI 완성, 분류, 또는 답변 형태가 잘 정의된 대량 변환 작업이 적합합니다. 추론 깊이 축소가 허용되는 이유는 해당 작업이 모델의 전체 추론 체인에 의존하지 않기 때문입니다.
자율 코딩이나 고위험 검증 작업의 대체재로는 쓸 수 없습니다. 그런 작업은 표준 경로에서 xhigh 노력 설정을 통해 전체 추론 예산을 활용해야 하며, 추론이 부족한 단계 하나가 긴 에이전트 실행 전체에 연쇄적으로 영향을 줄 수 있습니다. 고속 모드에서 컨텍스트 윈도우 패널티는 없습니다. 퍼스트파티 API, Bedrock, Vertex AI 모두 두 경로 모두 기본적으로 전체 100만 토큰 윈도우를 제공하며, 베타 헤더나 장문 컨텍스트 추가 요금도 없습니다 . 따라서 결정은 순전히 호출당 속도 대 깊이의 문제이지, 설계를 바꿔야 할 용량 한계가 아닙니다.
결함 미플래그율 4배 감소 — 그 함의
Anthropic에 따르면 Opus 4.8은 Opus 4.7 대비 자체 생성 코드의 결함을 플래그 없이 넘기는 가능성이 약 4배 낮습니다 . 이는 정성적 신뢰성 주장이며 공식 벤치마크가 아닙니다 — 4배라는 수치에 공개된 테스트 결과물이 없으므로, 재현 가능한 결과가 아닌 방향성을 제시하는 벤더 발표로 받아들이세요. 같은 릴리스에서 의도 이탈 행동 비율이 4.7보다 현저히 낮아지고 Claude Mythos Preview 라인과 유사한 수준임이 언급되며 , 자체 플래그 기능을 단순한 코딩 지표가 아니라 안전성과 인접한 속성으로 자리매김합니다.
출시 이후 독립적인 벤치마크들이 세부 정보를 더하지만 결론을 내리지는 못합니다. WorkBench Revisited는 Opus 4.8을 최고 직장 에이전트로 평가하며 작업 완료율 89%에 의도치 않은 유해 행동은 2.5%에 불과합니다. GPT-4(2024년 3월) 기준선인 완료율 43%, 의도치 않은 유해 행동 26%와 비교됩니다 . 하지만 결과는 도메인에 따라 다릅니다:
- EpiBench: Opus 4.8이 39.0%로 GPT-5.5의 45.0%에 뒤처집니다 .
- TxBench-PP: Opus 4.8이 엔드포인트 통과율 59.3%로 GPT-5.5의 55.3%를 앞섭니다 .
어느 분야도 결정적이지 않습니다. 신뢰성 스토리는 설득력 있습니다 — 플래그 없이 넘어가는 결함 감소와 낮은 정렬 이탈은 고자율 실행에서 정확히 중요한 요소입니다 — 그러나 가장 강력한 증거는 Anthropic 자체 데이터이고, 독립적인 결과는 도메인마다 다릅니다. 프로덕션에서 4배 주장을 신뢰하기 전에 자체 작업 스위트로 검증하세요.
4.7에서 4.8로 교체 시 재테스트가 필요한 항목

Opus 4.7에서 4.8로 마이그레이션하는 작업은 모델 문자열을 claude-opus-4-7에서 claude-opus-4-8로 바꾸는 한 줄 변경으로 시작됩니다. Anthropic은 API 호환성을 깨는 변경 사항이 없다고 밝혔으며 , 토크나이저가 4.7과 동일하므로 토큰 수 추정치, 프롬프트 캐시 로직, 예산 계산은 그대로 이어받을 수 있습니다 . 대부분의 연동 환경에서는 문자열 교체만으로 전체 변경이 끝납니다.
4.7에서 문제가 됐던 제약 사항은 여전히 적용됩니다. 샘플링 파라미터인 temperature, top_p, top_k는 여전히 400 오류로 거부되며, 수동 확장 사고(extended thinking)는 지원되지 않고 프리필(prefill)도 제거된 상태입니다 . 4.7 코드에서 이미 이런 부분을 처리하고 있다면 새로 깨지는 것은 없습니다.
적극적인 재기준 설정이 필요한 부분은 effort 동작입니다. 기본 effort가 medium에서 high로 변경되었으므로 , medium을 암묵적 기본값으로 가정한 코드 경로는 컴퓨팅 자원과 비용이 조용히 달라집니다. 티어 자체도 4.7 대비 재조정되었습니다. 4.8의 medium은 4.7의 medium보다 더 많은 사고를 사용하고, high는 약간 적으며, xhigh는 상당히 많아졌습니다 . 기존 대시보드를 신뢰하기 전에 티어별 비용 및 지연 시간 벤치마크를 직접 다시 실행하세요.
의도적으로 도입할 가치가 있는 두 가지 새 기능이 있습니다:
- 프롬프트 캐싱 최소 토큰이 1,024개로 낮아졌습니다. 이전에는 캐시할 수 없었던 짧은 시스템 프롬프트도 이제 캐시가 가능합니다 .
- Messages API가 대화 중간에 system 항목을 허용합니다. 사용자 턴 이후에도 삽입할 수 있어, 기존 스키마에서는 거부됐던 세션 중 지침 주입이나 역할 재정립 같은 대화 패턴이 가능해졌습니다 .
정리하면, 모델 ID는 드롭인 교체로 처리하되 effort 티어는 새로 교정해야 합니다. API 계약은 안정적이지만 그 아래의 컴퓨팅 동작은 그렇지 않습니다.
Opus 4.8의 $5/M 가격 — 라인업 재편 이후의 위치
Opus 4.8은 2026년 5월 28일 Anthropic의 플래그십으로 출시되었고, 9일 후인 2026년 6월 9일 Claude Fable 5가 그 위에 자리잡았습니다. 이 라인업 재편으로 Opus 4.8의 전체 포지셔닝은 변했지만, 자체 티어 내에서의 위상은 유지됩니다. 여전히 Opus 티어 최상위 옵션이며, 현재 자신보다 위에 있는 모델 대비 토큰당 비용이 절반 수준입니다 .
이 가격 차이가 핵심 판단 기준입니다. 표준 가격은 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25로, 4.7에서 변경되지 않았습니다 . 워크로드가 Fable 5의 성능 한계치를 필요로 하지 않는다면, 쓰지도 않을 여유를 위해 두 배를 지불하기는 어렵습니다.
출시부터 전 세계에서 이용 가능합니다. Claude API, AWS Bedrock(anthropic.claude-opus-4-8), Vertex AI(claude-opus-4-8), Microsoft Foundry를 통해 접근할 수 있습니다. Foundry는 200k 컨텍스트로 출시됐으며, 그 외 모든 플랫폼은 별도 베타 헤더나 추가 요금 없이 기본으로 100만 토큰 컨텍스트 창을 제공합니다 . 지식 컷오프는 2026년 1월이며, 최대 출력은 표준 128k 토큰, 또는 output-300k-2026-03-24 배치 베타를 통해 300k 토큰입니다 .
결론: 모델 ID를 교체하고, effort 티어를 재기준 설정한 뒤, 특정 작업에서 성능 한계가 입증되지 않는 한 Opus 4.8을 유지하세요. $5/M이라는 가격에서 이 모델은 차선책이 아니라 비용 효율적인 기본 선택입니다.
자주 묻는 질문
Claude Opus 4.7에서 4.8로 마이그레이션하면 하위 호환이 되나요?
네. 모델 문자열을 claude-opus-4-7에서 claude-opus-4-8으로 바꾸는 것만으로 마이그레이션이 완료될 수 있습니다 — Anthropic은 API 파괴적 변경 사항이 없으며 Opus 4.7 토크나이저가 그대로 유지된다고 밝혔습니다 . 단, 두 가지는 별도로 확인해야 합니다. 첫째, effort 티어를 재설정하세요: 기본값이 medium에서 high로 변경되었으며, medium/high의 동작 방식이 4.7과 달라졌습니다 . 둘째, 샘플링 파라미터(temperature, top_p, top_k)는 여전히 400 오류를 반환하고, 수동 확장 사고(extended thinking)는 지원되지 않으며, prefill도 제거되었습니다 .
Opus 4.8의 xhigh effort는 4.7과 실제로 무엇이 다른가요?
Opus 4.8의 xhigh는 4.7의 xhigh보다 훨씬 많은 사고 예산을 할당합니다. Anthropic은 모든 레벨에서 effort를 재조정했습니다: medium은 이제 더 많은 사고를 허용하고, high는 소폭 줄었으며, xhigh는 대폭 늘었습니다 . 실질적인 결과로, 동일한 레이블이라도 버전 간 비용과 지연 시간이 달라질 수 있습니다. 4.7 기준으로 조정된 설정은 4.8에서 동일한 비용이나 응답 시간을 재현하지 못합니다. 배포 전에 각 티어에서 비용과 지연 시간을 재벤치마킹하세요 — 특히 코딩과 고자율 작업에서는 xhigh가 권장 상한선입니다 .
동적 서브에이전트 플릿은 AWS Bedrock과 Vertex AI에서도 사용할 수 있나요?
네. 동적 워크플로우는 Claude Code CLI, Desktop, VS Code 전반에서, 그리고 Amazon Bedrock, Vertex AI, Microsoft Foundry를 포함한 API를 통해 정식 출시(GA)되었습니다 . 이 기능은 수십에서 수백 개의 병렬 서브에이전트를 실행하여 보고 전에 검증을 수행하며, 코드베이스 전체 버그 탐색과 대규모 마이그레이션을 겨냥합니다 . 단일 에이전트 실행에 비해 토큰 소비가 훨씬 많으므로, 활성화하기 전에 플릿 규모 작업에 맞게 rate limit과 예산을 설정해 두세요.
에이전틱 코딩 벤치마크에서 Opus 4.8과 GPT-5.5는 어떻게 비교되나요?
어느 한 모델이 전면적으로 우세하지는 않습니다. Opus 4.8은 SWE-bench Pro에서 GPT-5.5의 58.6% 대비 69.2%로 앞서며, TxBench-PP에서도 55.3% 대비 59.3%로 우위입니다. GPT-5.5는 Terminal-Bench 2.1에서 74.6% 대비 78.2%(Codex CLI 하네스 사용 시 83.4%)로 앞서고, EpiBench에서도 39.0% 대비 45.0%로 우위입니다. 벤더가 아닌 수직 분야별로 선택하세요.
Opus 4.8에서 100만 토큰 컨텍스트 창을 사용하려면 베타 헤더나 추가 비용이 필요한가요?
아니요. 100만 토큰 전체 컨텍스트 창은 Claude API, Bedrock, Vertex AI에서 베타 헤더 없이, 장문 컨텍스트 추가 요금 없이 기본 제공됩니다 . 예외는 Microsoft Foundry로, 200k 컨텍스트로 출시되었습니다 . 최대 출력은 기본 128k 토큰이며, output-300k-2026-03-24 배치 베타 헤더를 통해 300k까지 늘릴 수 있습니다 .