M3와 GLM-5.2, 실제로 무엇을 하는가
MiniMax M3와 Z.ai의 GLM-5.2는 장기 실행 코딩 에이전트에 최적화된 오픈 웨이트 모델입니다 — 단순히 완성문 하나를 출력하는 것이 아니라, 저장소 규모의 컨텍스트를 유지하고, 루프 내에서 도구를 호출하며, 수 시간 동안 실행되고, 실패한 시도에서 복구하는 시스템입니다. MiniMax(상하이)는 2026-06-01에 M3를 출시했으며, Z.ai/Zhipu는 2026-06-17에 GLM-5.2를 공개하고 전체 오픈 웨이트를 Hugging Face에 게시했습니다. 두 모델 모두 폐쇄형 API 가격 대비 약 5~20배 저렴하며, SWE-bench 유형 작업에서 최전선 폐쇄 모델(GPT-5.5, Gemini 3.1 Pro, Claude Opus 4.8)과 동등하거나 이를 능가한다고 주장합니다 — 단, 벤더가 보고한 수치이며, 스캐폴딩 관련 유의사항은 아래에서 다시 다룹니다.
Z.ai가 두 모델 모두 수치를 공개한 네 개 벤치마크 항목에서 GLM-5.2가 모두 앞서며, 특히 DeepSWE에서는 46.2 대 M3의 20.0으로 2배 이상 차이가 납니다. 두 모델은 아키텍처 면에서도 완전히 다릅니다:
- M3 (MiniMax): 총 ~4280억 / 활성 ~230억 파라미터의 혼합 전문가(MoE) 모델로, 이미지·동영상·데스크톱 입력을 기본 지원하며, 1M 토큰 컨텍스트, MiniMax Sparse Attention(MSA), minimax-community 라이선스를 갖춥니다.
- GLM-5.2 (Z.ai/Zhipu): 텍스트 전용, 1M 컨텍스트 / 최대 128K 출력, MIT 모델 라이선스, IndexShare 희소 어텐션, 선택 가능한 추론 강도 수준을 제공합니다.
간단히 말해: GLM-5.2는 에이전트 최적화에 집중한 순수 코딩 엔진이고, M3는 코딩 우위 일부를 시각 및 데스크톱 기능과 맞바꾼 모델입니다. 이 가이드의 나머지 부분에서는 각 격차가 실제로 의미 있는 부분이 어디인지, 그리고 어떤 모델이 여러분의 스택에 적합한지 살펴봅니다.
공통 항목 전체에서 GLM-5.2 대 M3 비교

Z.ai의 공개 비교 보고서에서 두 모델 수치가 모두 제시된 모든 벤치마크에서 GLM-5.2가 M3를 앞서지만, 격차는 반올림 오차 수준에서 2배 이상까지 다양합니다. 가장 좁은 격차는 SWE-bench Pro로, GLM-5.2가 62.1점, M3가 59.0점으로 3.1점 차이입니다 . 가장 큰 격차는 DeepSWE로, 2시간 타임아웃과 인터넷 없이 mini-swe-agent 하네스로 실행하며 GLM-5.2가 46.2점, M3가 20.0점을 기록했습니다 .
| 벤치마크 (하네스) | GLM-5.2 | M3 | 차이 |
|---|---|---|---|
| SWE-bench Pro | 62.1 | 59.0 | +3.1 |
| MCP-Atlas (공개 세트) | 76.8 | 74.2 | +2.6 |
| NL2Repo | 48.9 | 42.1 | +6.8 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 65.0 | +16.0 |
| DeepSWE (mini-swe-agent) | 46.2 | 20.0 | +26.2 |
전체 합계보다 패턴이 더 중요합니다. 단발성 패치·수정 작업에 가장 가까운 두 항목 — SWE-bench Pro와 MCP-Atlas 공개 세트(76.8 대 74.2) — 에서는 두 모델이 거의 동등합니다 . 그러나 장기 실행, 터미널 중심 작업에서는 격차가 크게 벌어집니다: Terminal-Bench 2.1은 81.0 대 65.0으로 16점 차이이고, DeepSWE에서는 GLM-5.2가 M3 점수의 2배 이상을 기록합니다 . 에이전트가 셸 환경에서 수 시간 동안 반복 작업을 수행한다면, 바로 거기서 격차가 가장 크게 나타납니다.
M3 비교 수치가 없는 항목도 여러 개 있습니다. GLM-5.2만의 수치로는 FrontierSWE 74.4, ProgramBench 63.7, PostTrainBench 34.3, Tool-Decathlon 48.2, SWE-Marathon 13.0이 있습니다 . 마지막 두 수치는 자랑이 아닌 경고로 읽어야 합니다: SWE-Marathon 13.0과 50점 미만의 Tool-Decathlon은 수십 번의 호출을 연결하면서 맥락을 놓치지 않아야 하는 장기 멀티 툴 오케스트레이션에서 GLM-5.2의 우위가 좁혀진다는 신호입니다 . 표 전체에 걸친 마지막 유의사항: 이 수치들은 다양한 스캐폴딩 아래 벤더가 직접 실행한 결과이므로, 제3자 하네스가 재현할 때까지는 방향성 지표로만 참고하시기 바랍니다.
GLM-5.2가 크게 앞서는 영역
벤더가 아닌 외부 기관이 점수판을 관리하는 벤치마크에서, GLM-5.2는 견조한 성적을 유지하는 반면 M3는 거의 보이지 않는다. 독립적인 FrontierSWE 리더보드에서 GLM-5.2는 약 74% 지배율로 3위를 기록했는데, Claude Opus 4.8(~75%)에 이어 GPT-5.5(~73%)를 앞선 수치다 . M3는 해당 목록에 전혀 등장하지 않으며 , 결국 현재 가능한 가장 공정한 교차 벤더 비교에 M3는 참여조차 하지 않은 셈이다.
PostTrainBench도 비슷한 이야기를 전한다. 변경 이력에는 GLM-5.2가 2026-06-17에 1위를 달성한 기록이 남아 있으며, 이는 Opus 4.8 Max가 두 번 실행으로 갱신된 이후의 결과다 . 이 표는 Z.ai가 아닌 외부에서 운영된다는 점이 핵심이다 — 제3자가 테스트 환경을 통제할 때도 GLM-5.2의 코딩 에이전트 우위는 M3뿐 아니라 최전선 클로즈드 모델들 사이에서도 유지된다.
그러나 가장 큰 격차를 보인 비교들은 각 벤더가 자체적으로 설계한 테스트에서 나온 것으로, 조건이 동일하지 않았다. Z.ai는 DeepSWE를 2시간 타임아웃과 인터넷 미연결 환경의 mini-swe-agent로 실행했고, Terminal-Bench는 256K 컨텍스트로 제한된 Terminus-2로 진행했다. 반면 MiniMax는 M3를 자체 내부 인프라에서 별도의 컨텍스트 및 출력 제한 조건으로 측정했다 .
"SWE-bench Pro는 400K 컨텍스트의 OpenHands를 통해, DeepSWE는 2시간 타임아웃·인터넷 미연결 환경의 mini-swe-agent를 통해, Terminal-Bench는 256K 컨텍스트의 Terminus-2를 통해 진행했다" — Z.ai의 GLM-5.2 벤치마크 공식 문서 (source: datanorth.ai).
이 점을 염두에 두고 보면, 격차는 크게 두 가지 범주로 나뉜다. 26포인트의 DeepSWE 격차(46.2 vs 20.0)와 16포인트의 Terminal-Bench 격차(81.0 vs 65.0)는 테스트 환경 노이즈를 감안해도 유의미한 수준이다 — 방향성은 실제이지만, 한 실험실이 단일 통제 환경에서 두 모델을 재현하기 전까지는 잠정적이다 . 반면 3.1포인트의 SWE-bench Pro 차이(62.1 vs 59.0)와 2.6포인트의 MCP-Atlas 차이(76.8 vs 74.2)는 테스트 환경 노이즈 범위 안에 있으므로 확정된 우위로 인용해서는 안 된다 .
M3는 눈이 있다. GLM-5.2는 없다.

두 모델의 가장 선명한 차이는 벤치마크 수치가 아니라, 각 모델이 받아들일 수 있는 입력의 종류에 있다. M3는 기본적으로 멀티모달이다: 이미지, 영상, 데스크톱/컴퓨터 사용 입력을 모두 받아들이며, MiniMax는 이 클래스에서 최전선 코딩, 1M 토큰 컨텍스트, 네이티브 멀티모달리티를 결합한 유일한 오픈 웨이트 모델로 소개한다 . GLM-5.2는 텍스트 전용이다 . 이 차이는 에이전트가 스크린샷을 읽거나, 렌더링된 페이지를 파싱하거나, UI를 조작해야 하는 순간 즉시 중요해진다. M3는 비전 단계가 모델 내부에서 처리되지만, GLM-5.2 파이프라인은 별도의 비전 컴포넌트를 추가로 연결해야 한다. 관련 지표를 보면, M3는 BrowseComp에서 83.5를 기록해 Claude Opus 4.7의 79.3을 앞섰다 — 브라우징·에이전틱 검색 경로가 단순한 체크박스 이상임을 보여주는 근거다.
MiniMax는 비교 표보다 장시간 실행 데모를 전면에 내세운다. ICLR 2025 Outstanding Paper를 약 12시간에 걸쳐 재현하며 18개의 커밋과 23개의 실험 그림을 산출했고, 별도로 Hopper FP8 GEMM 커널을 약 24시간 동안 최적화했다 — 벤치마크 147회 제출, 도구 호출 1,959회, 최대 하드웨어 활용률을 7.6%에서 71.3%로 끌어올려 9.4배 속도 향상을 달성했다고 보고했다 . 이는 벤더가 직접 제공한 추적 데이터이지 표준화된 점수가 아니므로, 일대일 비교 증거가 아닌 성능 데모로 읽어야 한다 — 그러나 실행 시간과 도구 호출 횟수는 SWE-bench 행 하나로는 절대 포착할 수 없는 종류의 스트레스 테스트다.
MiniMax는 M3를 "최전선 코딩, 1M 컨텍스트, 네이티브 멀티모달리티를 결합한 최초의 오픈 웨이트 모델"로 소개한다 (source: MiniMax).
효율성 이야기도 갈린다. M3의 MiniMax Sparse Attention(MSA)은 1M 컨텍스트에서 토큰당 어텐션 연산을 28.4배 줄이고 디코드 속도를 최대 15배 향상시킨다고 주장한다 — 단, 이 수치는 출시된 ~428B 모델이 아닌 109B 파라미터 실험 환경에서 나온 것이다 . GLM-5.2는 스파스 어텐션에 IndexShare를 적용해 1M 컨텍스트에서 2.9배 FLOP 감소를 달성했다고 밝힌다 .
결정을 내리기 전에 짚어둬야 할 GLM-5.2의 코딩 특화 비용이 있다. 일반 추론 지표가 하락했다: Humanity's Last Exam과 GPQA-Diamond가 5~10포인트 떨어졌다 . 수학 추론은 코딩 튜닝 과정에서도 온전히 살아남았다 — GLM-5.2의 AIME 2026 점수는 99.2%다 . 에이전트가 코드와 터미널 안에서만 작동한다면 이 트레이드오프는 거의 무관하다. 하지만 개방형 추론이나 비전 작업도 필요하다면, GLM-5.2의 코딩 우위보다 M3의 폭넓은 지원이 더 중요해지기 시작한다.
각 모델의 요금과 재배포 가능 범위

순수 토큰 비용 면에서 MiniMax M3가 훨씬 저렴하며, GLM-5.2는 에이전틱 코딩 우위에 프리미엄을 붙여 요금을 책정합니다. M3의 정가는 입력 1M 토큰당 $0.60, 출력 1M 토큰당 $2.40이며, 출시 첫 주 한정 요금으로 $0.30 / $1.20으로 할인되었습니다. GLM-5.2의 정가는 1M 토큰당 입력 $1.40, 캐시 입력 $0.26, 출력 $4.40입니다. 이로써 GLM-5.2의 출력 토큰은 M3 출시 요금보다 토큰당 약 3.7배 더 비쌉니다 — 하루 종일 긴 diff와 툴 호출을 생성하는 에이전트에게는 실질적인 비용 부담입니다.
| 플랜 / 지표 | MiniMax M3 | Z.ai GLM-5.2 |
|---|---|---|
| 입력 / 1M 토큰 | $0.60 (출시가 $0.30) | $1.40 |
| 캐시 입력 / 1M | 혼합 최저 ~$0.06 | $0.26 |
| 출력 / 1M 토큰 | $2.40 (출시가 $1.20) | $4.40 |
| 월간 토큰 플랜 | ~1.7B/$20 · ~5.1B/$50 · ~9.8B/$120 | 미제공 |
| 모델 라이선스 | minimax-community | MIT |
MiniMax는 대량 구매자를 위해 $20에 약 1.7B 토큰, $50에 약 5.1B, $120에 약 9.8B의 월간 토큰 플랜을 추가로 제공하며, 캐시 최적화 혼합 요금은 1M당 ~$0.06까지 낮아집니다. 고처리량 에이전트 플릿에서 추론 비용이 병목이라면, 이 격차는 빠르게 누적됩니다.
라이선스 측면에서는 계산이 역전됩니다. GLM-5.2는 MIT 조건으로 배포되며, 가중치는 Hugging Face와 ModelScope에 공개되어 있고 지역 제한도 명시되어 있지 않습니다 — 상업적 이용, 파인튜닝, 재배포, 파생 저작물 모두 별도 승인이 필요하지 않습니다. M3는 minimax-community 라이선스로 배포되며, MiniMax의 이전 플래그십은 상업적 이용에 승인이 필요했으므로 상업용 파생 제품을 출시하기 전에 현재 모델 카드를 반드시 확인하세요.
기업 환경에서 주의할 점이 있습니다: Z.ai를 통한 GLM-5.2 API 접근이 중국 데이터 처리 우려로 일부 구매자들의 지적을 받았습니다. MIT 가중치가 공개되어 있으므로 자체 인프라에서 GLM-5.2를 셀프 호스팅하면 데이터 레지던시 문제를 완전히 피할 수 있습니다 — M3의 더 제한적인 라이선스는 이 경로를 동일하게 열어주지 않습니다.
스택에 무엇을 선택할 것인가
에이전트가 텍스트 전용 레포지토리 작업을 수행하거나, 상업적 재배포에 가장 깔끔한 라이선스가 필요하거나, 평가 하네스가 Z.ai의 Terminal-Bench 및 DeepSWE 방법론을 따른다면 GLM-5.2를 선택하세요. MIT 가중치는 지역 및 상업적 이용 제약을 제거하며, DeepSWE 46.2 대 20.0, Terminal-Bench 2.1 81.0 대 65.0의 우위는 순수 코딩 에이전트 분야에서 보고된 가장 큰 격차입니다.
파이프라인이 스크린샷, 동영상, 또는 데스크톱 상태를 처리하거나, 1M 컨텍스트에서 컴퓨팅 효율적인 셀프 호스팅이 필요하거나, 출력 토큰당 비용이 핵심 제약 조건이라면 M3를 선택하세요. 백만 토큰당 약 $1.20의 출시 출력 요금은 GLM-5.2의 $4.40보다 약 3.7배 저렴하며 , MiniMax Sparse Attention은 장문 컨텍스트 추론의 호스팅 비용을 낮춰줍니다 .
제3자가 동일한 스캐폴딩 하에 두 결과를 재현하기 전까지 DeepSWE 및 Terminal-Bench 격차는 확정적 판단이 아닌 마이그레이션 신호로 삼으세요 — SWE-bench Pro 3.1포인트와 MCP-Atlas 2.6포인트의 차이는 하네스 노이즈 범위 안에 있습니다. 핵심 결론: 현재 장기 세션에 클로즈드 모델 요금을 지불하고 있다면, 전체 스택 마이그레이션을 결정하기 전에 현재 API 가격으로 오픈 웨이트 모델 중 하나를 먼저 테스트해 보세요.
자주 묻는 질문
GLM-5.2는 코딩 에이전트에서 M3보다 확실히 우수한가요?
확실하다기보다는 방향성이 그렇습니다. Z.ai의 표에서 두 모델이 모두 보고된 네 항목 전부에서 GLM-5.2가 앞섭니다: DeepSWE 46.2 대 20.0, Terminal-Bench 2.1 81.0 대 65.0, SWE-bench Pro 62.1 대 59.0, MCP-Atlas 76.8 대 74.2 . 다만 각 실행에 서로 다른 스캐폴딩이 사용되었으므로, 제3자가 동일한 조건에서 재현하기 전까지는 방향성 정도로만 받아들이는 것이 좋습니다. DeepSWE와 Terminal-Bench의 격차는 노이즈를 감안해도 충분히 크지만, SWE-bench Pro 3.1점 차와 MCP-Atlas 2.6점 차는 하네스 노이즈 범위 안에 들어올 수 있습니다. 대부분의 에이전트 코딩 작업에서 GLM-5.2가 현재로서는 더 안전한 선택이지만, 확정된 결론은 아닙니다.
두 모델 모두 로컬에서 실행할 수 있나요?
네 — 두 모델 모두 Hugging Face에서 오픈 웨이트로 공개되어 있습니다. GLM-5.2는 지역 제한 없이 MIT 모델 라이선스 하에 배포되어 자체 호스팅 및 재배포에 더 깔끔한 선택지입니다 . M3는 총 약 4,280억 개의 파라미터 중 약 230억 개가 활성 상태인 혼합 전문가(MoE) 모델로, minimax-community 라이선스를 따릅니다 . 따라서 멀티 GPU 자체 호스팅이 가능하고, 희소 어텐션 설계 덕분에 토큰당 추론 비용도 낮습니다. GLM-5.2의 공급업체 자료에는 활성 파라미터 수가 공개되어 있지 않으므로, 하드웨어 규모를 결정하기 전에 Hugging Face 카드를 확인하세요.
minimax-community 라이선스는 MIT와 비교해 어떤 제한이 있나요?
MIT는 승인 절차 없이 상업적 이용, 파인튜닝, 재배포, 파생 저작물 모두 허용하며, 이것이 GLM-5.2에 적용되는 조건입니다 . M3는 MIT가 아닌 minimax-community 라이선스를 따르며, MiniMax의 이전 모델은 상업적 이용 시 승인이 필요했습니다 . 상업용 제품에 해당 웨이트를 적용하기 전에 현재 M3 라이선스 카드를 반드시 확인하세요. 승인 절차 없이 재배포를 원하는 상업 팀이라면 GLM-5.2의 MIT 조건이 더 단순한 선택입니다.
두 모델이 같은 작업을 목표로 한다면 DeepSWE 격차는 왜 이렇게 큰가요?
두 점수가 동일한 통제된 하네스에서 산출된 것이 아니기 때문입니다. Z.ai는 2시간 타임아웃과 인터넷 접근 차단 조건에서 mini-swe-agent를 통해 DeepSWE를 실행했고, MiniMax는 서로 다른 스캐폴딩, 컨텍스트 한도, 판정 모델을 사용했습니다 . 46.2 대 20.0처럼 큰 격차는 순수한 모델 성능보다 타임아웃, 재시도, 컨텍스트 윈도우 설정의 영향을 받는 경우가 많습니다. 어느 공급업체도 동일 조건에서의 직접 비교를 공개하지 않았으므로, DeepSWE 격차는 독립적인 하네스가 동일 조건에서 두 모델을 모두 실행할 때 가장 좁혀질 가능성이 높은 항목입니다.
M3의 24시간 자율 실행이 실제 장기 작업에서 더 유리하게 만드나요?
그것만으로는 그렇지 않습니다. M3가 보고한 약 24시간의 FP8 GEMM 최적화 — 벤치마크 제출 147회, 툴 호출 1,959회, 최대 활용률 7.6%에서 71.3%로 향상 — 는 매우 긴 실행을 지속할 수 있음을 보여줍니다 . 그러나 이는 공급업체 데모이지 표준화된 벤치마크가 아니며, 두 모델 모두 100만 토큰 컨텍스트를 지원하고 장기 작업에 맞게 설계되어 있습니다 . 실제로 달성 가능한 실행 길이는 모델 자체보다 오케스트레이션 프레임워크, 재시도 로직, 세션당 비용 허용 범위에 더 크게 좌우됩니다.