수 기가바이트짜리 모델을 내려받기 전에 모든 것을 가르는 질문은 하나입니다. 내 GPU에 실제로 들어갈까, 그리고 얼마나 빠르게 돌아갈까? 하드웨어를 인식하는 새로운 계산기들은 이 답을 브라우저에서 보여줍니다. 한 한국어 walkthrough는 RTX 3090 Ti와 Qwen 모델을 비교하고, 이런 사이트에서 추정 tokens/second 값을 읽어내는 흐름을 소개합니다 .
감으로는 알 수 없는 VRAM 계산기의 역할
VRAM 계산기는 특정 모델이 내 GPU에 들어가는지, 그리고 메모리가 가중치와 컨텍스트 사이에서 어떻게 나뉘는지 추정합니다. 이 두 수치는 모델 카드에 올라오지 않습니다. Hugging Face Space인 NyxKrage의 LLM Model VRAM Calculator는 좋아요 약 510개와 커뮤니티 토론 11개를 보유하고 있으며 , Hugging Face 모델 ID, 양자화 형식, 컨텍스트 길이를 입력받아 가중치에 필요한 VRAM과 KV 캐시에 필요한 VRAM을 나눠 보여줍니다. 감으로 놓치기 쉬운 지점이 바로 이 분리입니다. 4k 컨텍스트에서는 로드되는 모델도 캐시가 커지면 128k에서 넘칠 수 있습니다.
추천 도구들은 한 발 더 나아가 “들어가나”를 “무엇을 쓰고 얼마나 빠른가”로 바꿉니다. ModelFit은 RAM 또는 VRAM을 입력받아 75개 모델 카탈로그를 확인하고, 최적의 단일 추천 모델과 추정 tokens/second를 반환합니다. 전 과정은 브라우저 안에서 이뤄지고 가입도 필요 없으며, 호환성 데이터셋은 CC BY 4.0으로 공개되어 있고 npm CLI도 함께 제공됩니다 . LLMfit.io는 NVIDIA 소비자용 RTX 3000-5000, 데이터센터용 A100/H100/H200, Apple Silicon M1-M4, AMD RX 7000까지 다루며, 각 조합에 대해 tok/s, 실행 가능 여부, 사용성 등급을 반환합니다 .
이제 정확도는 경험칙이 아니라 측정에서 나옵니다. Oobabooga의 GGUF VRAM 공식은 60개 모델 양자화에 대한 실제 llama.cpp 측정값 19,517건에서 중앙 절대 오차 365 MiB를 기록했고, 95% 로드 신뢰도를 위해 577 MiB의 안전 버퍼를 더합니다 . 덕분에 오래된 “10억 파라미터당 2 GB” 식의 휴리스틱은 실측 기반 보정으로 대체됩니다.
| 도구 | 입력값 | 반환값 |
|---|---|---|
| NyxKrage (HF Space) | 모델 ID, 양자화, 컨텍스트 | 가중치와 컨텍스트 VRAM 분리 |
| ModelFit | RAM / VRAM | 최적 추천 + tok/s, 75개 모델 카탈로그 |
| LLMfit.io | 하드웨어, 모델, 양자화 | tok/s, 실행 가능 여부, 사용성 등급 |
시작 전에 준비할 것: 그래픽카드 이름, VRAM, LLM

추천 도구를 열기 전에 네 가지 입력값을 모으세요. GPU의 정확한 VRAM, 목표 모델과 파라미터 수, 실행할 양자화 방식, 그리고 컨텍스트 상한입니다. 사양표의 메모리 표기만 믿기보다 nvidia-smi나 GPU-Z에서 VRAM을 직접 확인하세요. 소비자용 카드의 흔한 수치는 RTX 3090과 3090 Ti가 각각 24 GB, RTX 4090이 24 GB, RTX 4070 Ti가 12 GB, RTX 3080이 10 GB입니다.
가중치는 ModelFit의 보정 비율인 Q4 기준 10억 파라미터당 약 0.6 GB를 쓰면 빠르게 어림할 수 있습니다. 8B ≈ 4.8 GB, 14B ≈ 8.4 GB, 27B ≈ 16.2 GB, 34B ≈ 20.4 GB입니다 . Q8은 10억 파라미터당 약 1 GB, fp16은 약 2 GB에 가깝습니다.
컨텍스트 길이는 가중치 위에 KV 캐시 비용을 추가합니다. 4k에서 128k로 올리면 몇 GB가 더 필요할 수 있으므로 먼저 상한을 정해야 합니다. 시스템 RAM도 중요합니다. llama.cpp는 전체 VRAM보다 큰 모델에 대해 CPU와 GPU에 걸쳐 추론을 나눕니다 . 따라서 RAM은 부가 정보가 아니라 fallback 기준선입니다.
ModelFit, NyxKrage, LLMfit.io 추정값 읽는 법

각 도구가 묻는 질문이 다르기 때문에, 추정값도 특정 질문에 대한 답으로 읽어야 합니다. ModelFit 같은 추천 도구는 하드웨어에서 출발해 후보를 돌려줍니다. NyxKrage's Space 같은 모델별 계산기는 이미 고른 모델에서 출발해 실행 가능 여부를 보여줍니다. 지금 단계에 맞는 도구를 고르세요.
ModelFit은 총 RAM 또는 VRAM을 입력받아 75개 모델 카탈로그에서 뽑은 순위 목록, 단일 최적 추천, 추정 tokens/sec를 반환합니다. 모두 브라우저 안에서 동작하고 가입은 필요 없습니다 . 호환성 데이터셋은 CC BY 4.0으로 제공되며, npm CLI를 통해 스크립트나 CI 쿼리에서도 같은 조회를 사용할 수 있습니다 . 하드웨어는 있지만 후보 목록이 없을 때 쓰기 좋습니다.
NyxKrage는 반대쪽 입구입니다. Hugging Face 모델 ID를 붙여 넣고 양자화 형식(GGUF, EXL2, GPTQ)과 컨텍스트 길이를 선택하면, 추정치를 가중치 VRAM과 KV 캐시 VRAM의 별도 막대로 나눠 보여줍니다 . 이 분리가 핵심입니다. 컨텍스트가 예산을 얼마나 조용히 잡아먹는지 보여주기 때문입니다. 후보가 정해진 뒤에 쓰는 것이 가장 좋습니다.
LLMfit.io는 하드웨어 등급, 모델, 양자화를 조합해 세 가지 상태, 즉 실행 가능, 컨텍스트 축소 시 실행 가능, VRAM 초과로 판정하고, NVIDIA, Apple Silicon, AMD를 하나의 UI에서 다루며 사용성 등급을 'poor'부터 'interactive'까지 보여줍니다 . Local AI Master's Model Recommender는 선택 후 설치하는 흐름에 가장 가깝습니다. 작업과 하드웨어를 고르면 VRAM 요구량, 벤치마크 메모, 복사해 붙여 넣을 수 있는 Ollama 및 llama.cpp 명령과 함께 순위가 매겨진 추천을 제공합니다 .
모델이 그래픽카드 용량을 살짝 넘는다면, GPUforLLM's calculator는 GQA 비율에 따른 KV 캐시 할당을 조정해 실행 가능하게 만드는 데 필요한 정확한 컨텍스트 창 축소 폭을 계산합니다 . 모델을 포기할지, 32k 대신 8k로 돌릴지를 가르는 차이입니다.
추정치가 빗나가는 지점 — KV 증가, LoRA 배수, OS 예약분

추정치는 입력한 컨텍스트 길이만큼만 정직합니다. KV 캐시는 토큰 수에 따라 커지고, oobabooga의 GGUF VRAM 공식은 512토큰부터 131,072토큰까지의 범위에 맞춰 보정되어 있습니다 . 이 범위의 상단에서는 128k 윈도우가 24GB 카드에서 가중치 자체와 맞먹거나 이를 넘어설 수 있습니다. 항상 모델이 홍보하는 최대값이 아니라 실제로 쓰려는 컨텍스트를 입력하세요.
도구 전반에서 반복되는 사각지대는 세 가지입니다.
- 파인튜닝은 범위 밖입니다. 이런 계산기는 추론 용량만 계산합니다. LoRA는 추론 VRAM의 대략 1.5배를 더 쓰고, 전체 파인튜닝은 약 4~6배가 필요합니다 . 그래서 채팅용으로는 로드되는 모델도 학습 단계에서는 바로 실패할 수 있습니다.
- OS와 드라이버 예약분은 실제로 존재하지만 모델링되지 않습니다. oobabooga는 점 추정치가 계속 낮게 나오는 문제 때문에 95% 로드 신뢰도를 위해 577MB 안전 버퍼를 더합니다. 19,517건의 측정에서 중앙값 오차는 365MiB였습니다 . 실제 오버헤드는 추론 엔진, 플래시 어텐션 경로, 상주 프로세스에 따라 달라집니다.
- 카탈로그 최신성은 도구마다 다릅니다. Qwen3 32B, Llama 4 Scout, DeepSeek V3가 특정 도구에 없을 수 있습니다. 이것은 호환성 판정이 아니라, 그 도구의 마지막 업데이트일 기준 카탈로그 지연으로 봐야 합니다 .
추정치에서 실제 tok/s까지: quantest로 프로파일링하기
정적인 판정과 실제 측정값 사이의 간극은 quantest로 좁힐 수 있습니다. quantest는 Ollama 또는 Hugging Face에 GGUF 모델을 질의해 모든 양자화와 컨텍스트 길이에 대한 예상 VRAM과 tok/s를 한 번의 명령으로 반환하는 MIT 라이선스의 Go 도구입니다 . 두 계산기의 적재 가능 여부가 서로 다르다면 GPUforLLM/llm-vram-calculator로 교차 확인하세요. 이 도구는 GGUF 크기와 GQA 비율 KV 캐시를 계산하며 NyxKrage를 크레딧으로 명시합니다 .
그다음에는 자기 장비에서 확인해야 합니다. ollama ps를 실행해 실제 GPU 대 CPU 분할을 확인하세요. 100% GPU, 100% CPU, 또는 48%/52% 같은 혼합 형태로 표시됩니다. 기본 4096토큰 한도는 OLLAMA_CONTEXT_LENGTH 환경 변수로 높일 수 있습니다 . 플래그도 중요합니다. llama.cpp 가이드는 A6000에서 30B Q4 모델이 n_gpu_layers와 스레드 수를 조정한 뒤 0.1 tok/s 미만에서 9.1 tok/s로 올라가는 예를 보여줍니다. 이때 60개 레이어를 오프로딩하면 17,223MB를 사용합니다. 결론은 간단합니다. 추정으로 후보를 좁히고, 프로파일링으로 신뢰하세요.
자주 묻는 질문
ModelFit과 NyxKrage의 LLM VRAM Calculator는 무엇이 다른가요?
두 도구는 같은 문제의 서로 다른 절반을 풉니다. ModelFit은 추천기입니다. 전체 VRAM 또는 RAM을 입력하면 75개 모델 카탈로그 중 실행 가능한 모델, 단일 최적 선택지, 예상 토큰/초를 반환합니다. 전부 브라우저 안에서 실행되며 호환성 데이터셋은 CC BY 4.0으로 공개되어 있습니다 . NyxKrage의 LLM Model VRAM Calculator는 계산기입니다. 특정 Hugging Face 모델, 양자화, 컨텍스트 길이를 지정하면 가중치 VRAM과 컨텍스트 VRAM의 정확한 분할을 반환합니다 . 탐색에는 ModelFit을 쓰고, 다운로드 전 특정 후보 검증에는 NyxKrage를 쓰면 됩니다.
이 사이트들이 보여주는 tok/s 수치는 얼마나 정확한가요?
보장값이 아니라 방향성으로 봐야 합니다. 토큰/초는 대략 메모리 대역폭을 가중치 크기로 나누고 효율 계수를 곱한, 대역폭 기반 근사치입니다. 토큰 생성은 메모리 대역폭의 영향을 크게 받기 때문입니다. 가장 엄밀한 벤치마크는 oobabooga의 실측 GGUF VRAM 공식입니다. 19,517건의 실제 측정에서 중앙 절대 오차 365MiB를 기록했고, 그래도 95% 로드 신뢰도를 위해 577MB 안전 버퍼를 더합니다 . 이렇게 보정해도 실제 tok/s는 드라이버 버전, 배치 크기, 프리필 단계와 디코드 단계 중 무엇을 측정하는지에 따라 달라집니다. 공개 수치는 후보를 좁히는 데 쓰고, 최종 판단은 로컬 프로파일링으로 하세요.
GPU VRAM이 부족하면 시스템 RAM도 중요한가요?
그렇습니다. llama.cpp는 CPU+GPU 하이브리드 추론을 지원해 트랜스포머 레이어를 VRAM과 시스템 RAM에 나누어 배치하므로, 전체 VRAM보다 큰 모델도 실행할 수 있습니다 . Ollama에서는 이것이 GPU%/CPU% 분할로 표시됩니다. 100% GPU, 100% CPU, 또는 48%/52% 같은 혼합 형태이며 ollama ps로 확인할 수 있습니다 . 레이어가 RAM으로 넘어가는 순간 tok/s는 크게 떨어진다고 봐야 합니다. 시스템 RAM 대역폭은 GPU 메모리 대역폭보다 대략 10~20배 낮아, 토큰마다 가중치를 읽는 속도를 제한하기 때문입니다.
VRAM 계산기로 모델 파인튜닝 가능 여부도 알 수 있나요?
아니요. 현재 계산기는 모두 추론만 다룹니다. 파인튜닝은 메모리 양상이 다릅니다. LoRA는 추론 VRAM의 대략 1.5배, 전체 파인튜닝은 약 4~6배가 필요합니다 . 추론용으로는 여유 있게 로드되는 모델도 같은 카드에서 학습 단계에는 들어가지 않을 수 있습니다. 학습 예산은 추론 풋프린트가 아니라 파인튜닝 메모리를 추정하는 Unsloth나 axolotl 같은 전용 도구를 쓰세요.
LLMfit.io의 'fits with context reduction'은 무슨 뜻인가요?
선택한 양자화에서는 모델 가중치가 VRAM에 들어가지만, 요청한 전체 컨텍스트 길이에 필요한 KV 캐시는 들어가지 않는다는 뜻입니다. LLMfit.io는 NVIDIA, Apple Silicon, AMD 등급 전반에서 VRAM 적재 판정과 사용성 등급을 제공합니다 . GPUforLLM 계산기 같은 도구는 실제로 들어가는 최대 컨텍스트 윈도우를 정확히 계산합니다 . 실무적으로는 128k 대신 4k~8k 컨텍스트로 실행한다는 뜻이며, 대부분의 채팅과 코딩 작업에는 충분합니다.
이 글이 도움이 되셨다면, 새 글이 올라올 때마다 이메일로 받아보세요.