Gemma 4 12B는 16GB라고 말한다. BF16 풀 프리시전은 24GB가 필요하다.

인코더 없는 멀티모달, 256K 컨텍스트, Apache 2.0. Gemma 4 12B의 16GB 주장 뒤에 숨겨진 스펙, 성능 평가, 메모리 계산.

Gemma 4 12B는 16GB라고 말한다. BF16 풀 프리시전은 24GB가 필요하다.
Share

Google DeepMind의 중형 오픈 모델이 이제 데이터센터 랙이 아닌 책상 위 컴퓨터에서도 실행됩니다. Gemma 4 12B Unified는 '최첨단급 멀티모달 AI, 그것도 로컬로'라는 물음에 대한 이 패밀리의 답입니다.

Gemma 4 12B Unified란?

Gemma 4 12B Unified는 Google DeepMind가 개발한 고밀도(dense) 멀티모달 오픈 모델로, 텍스트·이미지·오디오를 입력받아 텍스트만 출력합니다. 2026년 6월 3일 퍼미시브 Apache 2.0 라이선스로 출시됐으며, 사전 학습 및 인스트럭션 튜닝 체크포인트가 출시 시점부터 모두 제공됩니다. 공식 모델 카드에는 파라미터 119.5억 개, 레이어 48개, 컨텍스트 윈도우 256K 토큰으로 명시돼 있으며, Google은 Gemini 3와 동일한 연구 기반 위에 구축됐다고 밝혔습니다.

한줄 요약: Gemma 4 12B Unified는 Google DeepMind가 개발한 119.5억 파라미터 고밀도 멀티모달 모델로, 2026년 6월 3일 Apache 2.0으로 출시됐습니다. 텍스트·이미지·오디오를 입력받아 텍스트만 출력하며, 256K 컨텍스트를 지원하고, 출시 첫 달에 Hugging Face 다운로드 100만 5,883회를 기록했습니다.

이 모델은 Gemma 4 라인업의 중간에 위치합니다. 엣지용 E4B 변형 — 128K 컨텍스트로 제한됨 — 보다 상위이며, 26B 혼합 전문가(MoE) 모델보다는 하위입니다. 256K 윈도우는 엣지 티어가 아닌 상위 패밀리 멤버들과 동일합니다.

기능 면에서 이 모델은 Gemma 4 풀 툴킷을 갖추고 있습니다. 네이티브 함수 호출, 구조화된 JSON 출력, 가변 해상도 이미지 및 동영상 처리, 그리고 140개 이상 언어 지원이 포함됩니다. 초기 채택 지표도 주목할 만합니다 — 지난 한 달간 100만 건 이상의 다운로드 외에도, Google은 Gemma 4 발표 시점에 더 넓은 Gemma 패밀리 전체가 총 다운로드 4억 건, 커뮤니티 파생 모델 10만 개를 돌파했다고 밝혔습니다. 이 글의 나머지 부분에서는 12B 빌드를 기술적으로 차별화하는 요소를, 인코더 프리 아키텍처부터 차례로 살펴봅니다.

550M 인코더를 대체한 35M 임베더

Gemma 4 12B says 16 GB. BF16 full precision needs 24 GB.

인코더 프리 설계는 Gemma 4 12B Unified에서 가장 핵심적인 기술적 변화입니다. 기존 Gemma 4 변형들은 별도의 멀티모달 인코더를 탑재합니다 — 엣지 크기에서는 약 1억 5,000만 파라미터 규모의 비전 인코더, 중간 크기 모델에서는 약 5억 5,000만 파라미터, E2B/E4B 엣지 티어에는 3억 파라미터 규모의 오디오 인코더가 붙습니다 . 12B 빌드는 이 모듈들을 전부 제거하고, 모든 모달리티를 전처리 단계로 외부에 붙이는 대신 언어 모델 내부로 직접 통합합니다.

비전 경로에는 CNN이나 트랜스포머 비전 타워가 없습니다. 원시 48×48 픽셀 패치가 약 3,500만 파라미터 규모의 임베더를 통해 LLM 히든 차원으로 투영되며, 공간 위치는 학습된 2D 위치 그리드 대신 인수분해(factorized) 좌표 룩업으로 인코딩됩니다 . 이는 기존 5억 5,000만 파라미터 인코더 대비 전용 파라미터를 15배 이상 줄인 것이며, 패치들은 일반 임베딩 형태로 디코더에 전달됩니다.

오디오도 같은 방식을 따릅니다. 16kHz 원시 신호를 640개 float로 구성된 40ms 프레임으로 슬라이싱한 뒤, 별도의 오디오 인코더 모듈 없이 트랜스포머 입력 공간으로 바로 선형 투영합니다 . Google은 이를 네이티브 오디오 입력을 갖춘 첫 번째 중형 모델로 소개합니다 .

비전·오디오·텍스트는 단일 디코더 전용 트랜스포머로 흘러 들어가며, 임베더들은 별도 퍼셉션 스택 위에 동결된 채 올라가는 것이 아니라 함께 학습됩니다.

"인코더를 경량 임베더로 통합하면 멀티모달 지연 시간이 줄고, 단일 파인튜닝 패스로 비전-오디오-텍스트 전체 루프를 업데이트할 수 있습니다 — 우회해야 할 고정 인코더가 사라집니다." — Google for Developers, Gemma 4의 새로운 점(What's new in Gemma 4) (video: Google for Developers).

개발자 입장에서 실질적인 이점은 다운스트림 튜닝에 있습니다. 그래디언트를 가로막는 고정 인코더가 없으므로, LoRA 어댑터나 풀 파인튜닝 시 한 번의 패스로 전체 멀티모달 경로에 변경 사항이 전파됩니다 . 35M 임베더가 전용 550M 인코더 대비 어려운 비전 태스크에서 어떤 성능을 내는지는 이후 벤치마크 수치에서 확인할 수 있지만, 아키텍처적 선택은 분명합니다. 움직이는 부품을 줄이고, 단일 손실 함수로, 하나의 모델만 학습한다는 것입니다.

BF16 기준 24 GB, Q4 기준 약 6–8 GB: 메모리 사용량 분석

"단일 모델로 학습"이라는 단순함이 디스크나 메모리 점유율의 작음으로 이어지지는 않습니다. Hugging Face에 배포된 체크포인트는 BF16 기준 119.5억 파라미터로, 파라미터당 2바이트를 적용하면 가중치만 약 24 GB에 달하며 — KV 캐시나 런타임 오버헤드는 포함하지 않은 수치입니다 . 따라서 Google이 내세운 "16 GB 노트북에서 실행 가능"이라는 표현은 순수 BF16 추론을 전제로 한 것이 아닙니다. 개발자 가이드에서는 이를 전용 GPU 또는 통합 메모리 16 GB를 갖춘 노트북으로 한정하고 있으며, 실제로 이 조건을 충족하려면 양자화와 최적화된 런타임이 필요합니다 .

이 간극을 메우는 것이 바로 양자화입니다. 약 4비트로 양자화하면 가중치 점유율이 약 6–8 GB로 줄어듭니다 . Google은 2026년 6월 3일 출시에 이어 6월 5일 양자화 인식 학습(QAT) 체크포인트를 공개하며 Q4_0과 모바일 최적화 포맷을 함께 제공했습니다 . 수치 해석 시 한 가지 주의할 점이 있습니다. 널리 인용되는 1 GB 점유율은 E2B 모바일 패키지의 수치이지 12B 모델의 수치가 아니며, 이 모델에 대한 동등한 수치를 Google이 공개한 바는 없습니다 .

구성가중치 점유율 (근사)실질 대상 환경
BF16 (풀 정밀도)~24 GB24 GB+ VRAM, KV 캐시 제외
Q4_0 / QAT (~4비트)~6–8 GB16 GB VRAM 또는 통합 메모리 노트북

26B 모델과 구분해서 이해하는 것도 중요합니다. 26B 모델은 혼합 전문가(MoE) 구조로, 순전파 시 실제 활성화되는 파라미터는 약 40억 개에 불과합니다. 명목상 규모에도 불구하고 ~16 GB에서 실행 가능한 것은 이 희소성 덕분이며 — 여기서 설명하는 밀집 모델+양자화 방식과는 다른 효율입니다. 마지막으로 플랫폼별 하드웨어 동작도 다릅니다. Apple M 시리즈의 통합 메모리는 CPU/GPU 대역폭을 공유하는 구조로, 독립형 16 GB VRAM 카드와 동작 방식이 다르며 오프로드 동작도 런타임에 따라 달라집니다. 단일 점유율 수치만 믿기보다는 실제 추론 계획을 세우기 전에 대상 하드웨어에서 직접 테스트해 보시기 바랍니다.

벤치마크: MMLU 77.2%, GPQA 78.8%, LiveCodeBench 72.0%

Google 자체 벤치마크 기준으로 Gemma 4 12B Unified IT는 이 규모의 모델로서 최고 수준의 성능을 보여줍니다. MMLU Pro 77.2%, 도구 없이 AIME 2026 77.5%, GPQA Diamond 78.8%, LiveCodeBench v6 72.0%를 기록했으며, Codeforces ELO는 1659입니다 . 단일 출처 벤치마크 수치가 자주 어긋나는 점을 감안하면, 독립적인 연구 보고서 두 곳에서 77.2% / 77.5% / 78.8% 수치를 별도로 확인한 것은 유효한 교차 검증입니다 .

멀티모달·다국어 항목에서는 통합 아키텍처의 강점이 두드러집니다. MMMLU 83.4%, MMMU Pro 69.1%, MATH-Vision 79.7%, Tau2 69.0%, BigBench Extra Hard 53.0%를 기록했습니다 . 맥락을 함께 보면, 12B는 여러 추론·코딩 벤치마크에서 Gemma 3 27B 비사고(no-thinking) 기준선을 넘어섰지만, 복잡한 비전 과제와 다단계 추론에서는 26B A4B MoE에 뒤처지는 반면 에이전틱·코딩·다국어 지표에서는 근접한 수준을 유지합니다 .

벤치마크Gemma 4 12B Unified IT측정 항목
MMLU Pro77.2%일반 지식 추론
AIME 2026 (도구 없음)77.5%수학 경시
GPQA Diamond78.8%대학원 수준 과학 Q&A
LiveCodeBench v672.0%코드 생성
Codeforces (ELO)1659알고리즘 경쟁 프로그래밍
MMMLU83.4%다국어 지식
MMMU Pro69.1%멀티모달 이해
MATH-Vision79.7%시각적 수학 추론

믿을 수 있는 수치일까요? 벤치마크 공급사 점수는 결론이 아니라 출발점으로 삼으세요. Google의 Hugging Face 문서 자체도 12B가 더 큰 A4B 모델 전체를 능가하기보다는 이식성을 우선해 정확도를 일부 양보했다고 솔직하게 밝히고 있습니다 .

"여러 주요 추론·비전 과제에서 12B는 26B A4B에 뒤처지지만, 에이전틱·코딩·다국어 지표에서는 근접한 성능을 보입니다." — Google DeepMind, Gemma 4 모델 카드 분석 (source: Hugging Face / Google)

날짜 기준으로 한 가지 더 주의할 점이 있습니다. 오픈 모델 리더보드는 매주 변동되며, 서드파티 문서에서 가져온 모델별 비교표 — 특히 31B 밀집 모델 수치 — 는 잠정적입니다. 인용 시점에 Google 공식 모델 카드를 교차 확인하고, 순위를 "오픈 모델" 기준인지 "전체 모델" 기준인지 명확히 구분해서 사용하시기 바랍니다 .

Apache 2.0: MAU 제한 폐지, 상업적 이용 무제한

Gemma 4 12B says 16 GB. BF16 full precision needs 24 GB.

Gemma 4 12B Unified는 Apache 2.0 라이선스로 출시됩니다 — 사전 훈련 및 명령어 튜닝 체크포인트 모두 해당 — 귀속 표시만 요구하며 사용량 상한, 허용 사용 정책, 상업용 제품에 대한 분야별 이용 제한이 없습니다 . 이 차이가 중요한 이유는 초기 Gemma 릴리즈가 정반대로 작동하는 Google 커스텀 라이선스를 사용했기 때문입니다. 월간 활성 사용자 임계값, 허용 사용 정책, 가중치 기반으로 구축한 상업용 제품의 출시 방식을 제한하는 분야별 이용 규정이 포함되어 있었습니다.

이 제품군은 4월 Gemma 4 출시와 함께 Apache 2.0으로 전환되었으며, 12B 모델도 이를 그대로 계승합니다 . 개발자에게 있어 실질적인 의미는 규모가 더 이상 법적 문제가 되지 않는다는 점입니다. 승인 절차도, MAU 상한도, 엔터프라이즈 예외 조항도 없습니다. 10명을 대상으로 하는 개인정보 보호 중심의 배포와 천만 명을 대상으로 하는 소비자 앱이 동일한 조건 아래 놓입니다. 상업적 이용은 명시적으로 허용됩니다 .

재배포 권한은 자신의 작업물에도 적용됩니다. 두 체크포인트 모두 허용적 라이선스를 따르므로, 파인튜닝 파생물 — LoRA 어댑터나 전체 파인튜닝 결과물 — 도 귀속 표시를 유지하는 한 자유롭게 출시하고 재판매할 수 있습니다. 이것이 다음 섹션에서 다루는 엔드투엔드 파인튜닝 이야기의 법적 측면입니다.

이 맥락에서 비교 대상은 Llama입니다. Meta의 Llama 4는 여전히 표준 오픈소스 라이선스가 아닌 커스텀 라이선스로 출시되며, 월간 활성 사용자 7억 명 이상의 제품에는 별도 허가가 필요한 사용량 제한 조항이 남아 있습니다. Apache 2.0은 해당 범주의 제한을 통째로 제거합니다. 그래서 대규모 상업 배포에 깔끔하고 감사 가능한 라이선싱이 필요한 팀들은 Gemma 4를 더 마찰이 적은 옵션으로 봅니다 (영상: Matthew Berman). 대부분의 개발자에게 이 차이는 성장하기 전까지는 보이지 않습니다 — 그리고 바로 그 시점에 커스텀 라이선스 예외 조항을 뒤늦게 발견하면 비용이 커집니다.

12B vs 26B: Gemma 4가 정확도와 이식성을 맞바꾸는 지점

Gemma 4 12B Unified와 26B A4B 중 무엇을 선택할지는 원시 파라미터 수가 아니라 런타임 복잡성과 성능 여유 사이의 균형으로 귀결됩니다. 26B는 포워드 패스당 ~4B 파라미터만 활성화하는 혼합 전문가(MoE) 모델로, 명목 크기에도 불구하고 약 16 GB에서 실행됩니다 . 단점은 MoE 지원 런타임이 필요하고 희소 어텐션 오버헤드를 감수해야 한다는 점입니다. 12B Dense 모델은 ~4비트 양자화 시 동일한 ~16 GB 범위를 목표로 하지만, MoE 전용 튜닝 없이 훨씬 광범위한 툴링에서 실행되며 인코더 없는 설계 덕분에 멀티모달 파인튜닝 경로도 단순합니다 .

성능 면에서는 26B가 복잡한 다단계 비전 태스크, 고난도 추론 벤치마크, 깊은 컨텍스트 활용에서 앞섭니다. 12B는 많은 개발자에게 중요한 영역에서 근접한 성과를 냅니다. LiveCodeBench v6에서 72.0%, Codeforces ELO 1659, MMMLU에서 83.4%를 기록하며 코딩과 다국어 작업에서 경쟁력을 유지합니다 .

항목12B Unified (Dense)26B A4B (MoE)
패스당 활성 파라미터~11.95B26B 중 ~4B
Q4 / MoE 메모리 목표Q4 기준 ~6–8 GB (≤16 GB)~16 GB
런타임 요건표준 Dense; 광범위한 호환성MoE 지원 런타임 필요
강점코딩·다국어·간편 배포고난도 추론·복잡한 비전·긴 컨텍스트

실용적인 판단 기준: 통합 메모리 또는 대형 디스크리트 VRAM이 24 GB 이상이라면 26B를 먼저 테스트하고 추론과 비전 여유가 그 가치를 증명하는지 확인하세요. 예산이 제한되어 있거나 엣지·모바일 파이프라인을 구축한다면 12B 양자화 버전을 사용하세요 — 정확도를 약간 희생하는 대신 이식성, 더 단순한 런타임 지원, 앞서 설명한 인코더 없는 파인튜닝 경로를 얻을 수 있습니다.

엔드투엔드 파인튜닝: 우회할 고정 인코더 없음

인코더 없는 설계는 파인튜닝 방식을 바꿉니다. 기존 멀티모달 스택에서 비전 또는 오디오 인코더는 별도 모듈입니다 — Gemma 4의 중간 모델들은 약 5억 5천만 파라미터의 비전 인코더와 3억 파라미터의 오디오 인코더를 탑재합니다 — 따라서 모델을 적응시키려면 해당 인코더를 고정하거나 별도 스케줄로 훈련해야 합니다. 어느 쪽이든 컴퓨트 그래프가 분리되고, LoRA 어댑터는 보통 LLM 부분에만 적용되어 인식 프론트엔드는 고정된 채로 남습니다. Gemma 4 12B는 이 제약을 없앱니다. ~3,500만 파라미터 임베더가 원시 픽셀과 오디오 프레임을 디코더에 직접 투영하므로, LoRA 한 번 또는 전체 파인튜닝 한 번의 패스로 비전·오디오·텍스트 경로를 단일 그래디언트 스텝에서 모두 업데이트합니다 .

도메인 특화 모달리티 — 영수증, 차트, 음성 명령 — 를 모델에 학습시키는 경우, 고정된 컴포넌트가 없으므로 적응이 전파될 수 있는 범위에 제한이 없습니다. Google의 Gemma 4 개발자 가이드는 이를 다음과 같이 표현합니다:

"통합 설계를 통해 다운스트림 LoRA 또는 전체 파인튜닝이 한 번의 패스로 멀티모달 루프 전체를 업데이트할 수 있습니다." — Google DeepMind, Gemma 4 개발자 문서 (source: blog.google).

양자화 인식 훈련(QAT)은 이 경로를 더욱 넓혀줍니다. 2026년 6월 5일 출시된 QAT 체크포인트 — Q4_0 및 모바일 지향 포맷 — 를 사용하면 float32 마스터에서 다시 빌드하고 재양자화하는 과정 없이 양자화된 표현을 직접 대상으로 파인튜닝할 수 있습니다 . 실제 배포 풋프린트를 유지하면서도 단순 사후 훈련 양자화보다 더 높은 정확도를 보존할 수 있습니다. 툴링 지원도 기본 제공됩니다. Unsloth와 Hugging Face Transformers는 커스텀 포크 없이 Gemma 4 12B를 지원하며 (영상: Google for Developers), 모델의 네이티브 함수 호출 및 구조화된 JSON 출력은 파인튜닝 후에도 다시 연결할 필요 없이 그대로 유지됩니다 .

실용적인 결론: 에이전트 또는 문서 비전 파이프라인을 단일 16 GB급 머신에서, 이전 멀티모달 파인튜닝 방식이 전제했던 인코더 관리 오버헤드 없이, 처음부터 끝까지 특화할 수 있습니다.

다운로드 경로: Hugging Face, Ollama, MLX, QAT 팩

Gemma 4 12B says 16 GB. BF16 full precision needs 24 GB.

Gemma 4 12B Unified는 오픈 웨이트를 이미 받고 있는 모든 곳에서 배포됩니다. 인스트럭션 튜닝 체크포인트 google/gemma-4-12B-it는 Hugging Face에 있으며, 지난 한 달간 다운로드 수가 1,005,883건을 넘어섰고 , 동일한 웨이트가 Kaggle, Google AI Studio, Vertex AI, Google AI Edge Gallery, Android Studio에도 미러링되어 있습니다 . 로컬 서빙의 경우 Ollama, LM Studio, Apple Silicon용 MLX, vLLM, SGLang, LiteRT-LM, Unsloth에서 추론을 지원합니다 . 26B MoE 형제 모델보다 dense 12B가 호스팅이 간단하지만, 인코더 없는 입력 경로를 런타임 버전이 지원하는지 먼저 확인하고 기능 동등성을 가정하세요.

놓치기 쉬운 운영 세부 사항이 두 가지 있습니다. 첫째, Multi-Token Prediction 드래프터는 투기적 디코딩(speculative decoding)을 위해 준비된 상태로 출시되며, Google은 출력 품질 저하 없이 최대 3배 속도 향상을 예고하고 있습니다 — 단, 명시적으로 활성화해야 하며 모든 서빙 스택에서 기본적으로 켜져 있지 않으므로, 기본 설정으로 실행하면 이 이점을 놓치게 됩니다. 둘째, 멀티모달 처리 한도는 런타임에 따라 다릅니다. 모델 카드에는 오디오 최대 30초, 1 FPS 기준 동영상 최대 60초로 명시되어 있지만, 개발자 가이드에서는 5분짜리 클립을 313개 프레임과 오디오로 추출해 처리하는 방법을 보여줍니다 . 모델 카드만 보지 말고 사용하는 런타임의 문서를 반드시 확인하세요.

가장 작은 메모리 공간을 원한다면 2026년 6월 5일에 출시된 Q4_0 및 모바일 형식의 양자화 인식 훈련(QAT) 팩을 받으세요 . 핵심 결론: 빠른 오프라인 시작을 위해 Ollama나 MLX에서 QAT Q4_0 빌드를 받은 후, 지연 시간이 중요해지면 MTP 드래프터를 활성화하고 오디오/동영상 한도를 확인하세요.

영상 / 출처

자주 묻는 질문

Gemma 4 12B는 양자화 없이 16GB 노트북에서 실행되나요?

아니요. Hugging Face 체크포인트는 BF16 기준 11.95B 파라미터로 , KV 캐시와 런타임 오버헤드를 제외한 웨이트만으로도 약 24GB가 필요합니다. 16GB에서 실행하려면 Q4 양자화가 필요하며, 이 경우 메모리 공간이 약 6~8GB로 줄어듭니다 . llama.cpp, MLX, Ollama 같은 최적화된 런타임도 함께 사용해야 합니다. Apple M 시리즈의 통합 메모리는 독립 VRAM과 다르게 동작하므로, 확정하기 전에 실제 사용 기기에서 테스트하세요.

'인코더 없음(encoder-free)'은 Gemma 4 12B에서 실제로 무엇을 의미하나요?

대부분의 멀티모달 모델은 별도의 비전·오디오 인코더를 통해 입력을 처리합니다. Gemma 4 패밀리의 다른 모델에서 비전 인코더는 약 150~550M 파라미터, 오디오 인코더는 약 300M 파라미터입니다 . Gemma 4 12B는 이를 제거하고, 약 35M 파라미터의 임베더를 사용해 원시 48×48픽셀 패치와 40ms·16kHz 오디오 프레임을 디코더에 직접 선형 투영합니다 . 실제로는 단일 디코더 전용 트랜스포머가 모든 모달리티를 처리하며, LoRA 또는 전체 파인튜닝을 한 번만 수행해도 멀티모달 루프 전체가 업데이트됩니다.

12B Unified 대신 26B A4B를 선택해야 할 때는 언제인가요?

복잡한 비전 작업이나 다단계 추론에서 26B A4B의 우위가 필요할 때 선택하세요. 이 모델은 활성 파라미터가 약 4B에 불과한 전문가 혼합(MoE) 모델로, 크기에 비해 약 16GB에서 실행됩니다 . 12B Unified는 이식성 면에서 강점이 있습니다. 지원 런타임이 더 많고, 양자화가 간단하며, MoE 라우팅 오버헤드가 없습니다. 통합 메모리가 24GB 이상이라면 26B를 먼저 테스트해 보고, 그렇지 않다면 Q4 양자화된 12B가 실용적인 기본 선택입니다.

Gemma 4 12B는 파인튜닝 모델 재배포를 포함한 상업적 이용에서 Apache 2.0이 적용되나요?

네. 사전 학습 및 인스트럭션 튜닝 체크포인트 모두 Apache 2.0으로 출시되었으며 , 이로써 기존 Gemma 커스텀 라이선스의 제한이 모두 제거되었습니다. 월간 활성 사용자 기준도 없고, 허용 사용 정책도 없으며, 사용 분야 제한도 없습니다 . 상업적 이용이 명시적으로 허용되고, 파인튜닝 파생 모델을 재배포할 수 있으며, 별도의 승인 절차도 필요하지 않습니다.

Gemma 4 12B의 Multi-Token Prediction(MTP)은 어떻게 작동하며 얼마나 빠른가요?

Gemma 4 12B는 투기적 디코딩 기법인 Multi-Token Prediction을 위한 드래프터가 탑재된 채로 출시됩니다. 별도의 MTP 헤드가 여러 토큰을 한 번에 제안하면 메인 모델이 병렬로 검증하는 방식입니다. Google은 출력 품질 저하 없이 최대 3배 속도 향상을 보고했습니다 . 이 이점은 자동으로 얻어지지 않으며, 서빙 스택이 MTP를 명시적으로 지원해야 합니다. vLLM과 SGLang이 이를 지원하는 런타임 중 하나입니다 .