프런티어급 오픈 모델을 쓰기 위해 더 이상 유료 API 키만 바라볼 필요는 없습니다. NVIDIA가 대규모 호스팅 모델 카탈로그로 연결되는 무료 OpenAI 호환 게이트웨이를 조용히 마련해 두었고, 전환도 마이그레이션이 아니라 두 줄만 바꾸면 됩니다.
NIM 무료 개발자 티어로 할 수 있는 것
NVIDIA NIM(NVIDIA Inference Microservices)은 호스팅형 OpenAI 호환 API로, 개발자라면 신용카드 없이도 NVIDIA가 호스팅하고 TensorRT/TensorRT-LLM에 최적화한 모델을 호출할 수 있습니다. NVIDIA의 NIM FAQ에 따르면 Developer Program 회원과 90일 AI Enterprise Trial 사용자는 160개 이상의 주요 모델을 무료 API 엔드포인트로 프로토타이핑할 수 있습니다. 새로 막 출시된 서비스는 아닙니다. 무료 티어는 2024년 7월 29일에 열렸고, 이후 build.nvidia.com의 카탈로그는 크게 확장되었습니다.
요약: NVIDIA NIM의 무료 개발자 티어는 integrate.api.nvidia.com/v1의 OpenAI 호환 엔드포인트를 통해 TensorRT 최적화 모델 160개 이상을 제공합니다. 카드도, 만료도 필요 없습니다. 무료 NVIDIA Developer Program 멤버십만 있으면 됩니다. 기본 URL과 모델 문자열만 바꾸면 기존 OpenAI 클라이언트가 그대로 동작합니다.
호스팅 LLM 카탈로그에는 다음과 같은 모델 계열이 포함됩니다.
- Meta Llama, Mistral/Mixtral, NVIDIA Nemotron
- DeepSeek, Qwen, Moonshot AI의 Kimi K2
- Google Gemma, Microsoft Phi, IBM Granite, OpenAI gpt-oss
모든 모델은 NVIDIA DGX Cloud에서 실행됩니다. 엔드포인트가 https://integrate.api.nvidia.com/v1에서 OpenAI Chat Completions 스키마를 사용하므로, 바꿀 것은 기본 URL과 meta/llama-3.3-70b-instruct 같은 네임스페이스형 org/name 모델 ID뿐입니다. 같은 엔드포인트 계열은 NeMo Retriever 임베딩 및 리랭킹 API도 지원합니다. bge-m3, nv-embedqa-e5-v5, llama-nemotron-embed-1b-v2, llama-nemotron-rerank-1b-v2가 포함되므로 RAG 스택은 하나의 키로 생성과 검색을 모두 처리할 수 있습니다(NVIDIA docs).
build.nvidia.com에서 로그인하고 nvapi- 키 만들기

키 발급에는 1분 정도면 충분합니다. build.nvidia.com을 열고 기존 NVIDIA 계정으로 로그인하거나 새 계정을 만드세요. 신용카드는 필요 없으며, 가입하면 자동으로 Developer Program에 등록됩니다. 이 등록이 무료 호스팅 엔드포인트를 사용할 수 있게 해 줍니다 .
로그인한 뒤 아무 모델 카드에서 Get API Key를 클릭하거나, 바로 build.nvidia.com/settings/api-keys로 이동하면 됩니다. 하나의 키가 전체 카탈로그에서 동작합니다. 모델별 키가 아니라 계정 단위 키이므로 Llama에서 Qwen이나 Kimi로 바꿀 때 다시 만들 필요가 없습니다 . 키에는 nvapi- 접두사가 붙습니다. 하드코딩하지 말고 NVIDIA_API_KEY로 내보낸 뒤 환경 변수에서 읽으세요.
계정 내비게이션 화면에는 개인별 속도 제한도 표시됩니다. 고정된 40 RPM을 보장된 SLA처럼 가정하지 말고, 그 화면에서 수치를 확인하세요. 한도는 모델과 현재 플랫폼 부하에 따라 달라집니다 .
integrate.api.nvidia.com으로 연결 바꾸기

호스팅 엔드포인트가 OpenAI Chat Completions 사양을 사용하므로 기존 앱을 연결하는 작업은 두 줄이면 됩니다. 클라이언트가 NVIDIA의 기본 URL인 https://integrate.api.nvidia.com/v1을 바라보게 하고, 모델 문자열을 네임스페이스형 org/name 카탈로그 ID로 바꾸세요. 요청이나 응답 처리의 다른 부분은 그대로입니다.
Python에서 OpenAI SDK를 쓴다면 생성자에 base_url과 키를 넘기고, meta/llama-3.3-70b-instruct, moonshotai/kimi-k2-instruct, qwen/qwen3-coder-480b-a35b-instruct 같은 모델을 사용하면 됩니다. 아래 스니펫은 예시이며 여기서 실행한 것은 아니지만, 문서화된 패턴을 반영합니다.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key=os.environ["NVIDIA_API_KEY"],
)
response = client.chat.completions.create(
model="meta/llama-3.1-8b-instruct",
messages=[{"role": "user", "content": "Say hello in exactly five words."}],
max_tokens=20,
)
print(response.choices[0].message.content)TypeScript에서는 Vercel AI SDK가 같은 baseURL과 Authorization: Bearer 헤더를 createOpenAICompatible에 넣고, deepseek-ai/deepseek-r1 또는 openai/gpt-oss-120b 같은 카탈로그 ID를 호출합니다. 해당 Bearer 헤더와 표준 messages 배열을 넣어 /v1/chat/completions로 보내는 원시 curl POST도 구조적으로 OpenAI 호출과 동일합니다.
"NIM microservices... support industry-standard APIs" including "the OpenAI API specification for large language model (LLM)-based NIM microservices" — NVIDIA Developer Blog, 2024-07 (source: NVIDIA).
자체 호스팅 NIM 컨테이너에서도 애플리케이션 계층은 그대로 유지됩니다. base_url이 로컬 /v1 엔드포인트를 가리키게 하면 되고, 로컬 인증 설정에 따라 API 키는 자리 표시자여도 될 수 있습니다 (LiteLLM docs).
NIM 무료 티어가 발목을 잡는 지점

무료 티어의 명확한 한계는 모델 접근이 아니라 처리량입니다. 개발자들은 호스팅 엔드포인트에서 실질적인 상한이 대략 분당 40건의 요청이라고 보고하며, NVIDIA Developer Forum의 한 모더레이터도 2026년 4~5월 스레드에서 "the 40 rpm rate limit"를 명시적으로 인정했습니다. NVIDIA는 모델별 SLA를 공개하지 않습니다. FAQ에서는 한도가 모델, 사용 사례, 현재 플랫폼 트래픽에 따라 달라진다고 설명하므로, 40 RPM은 보장값이 아니라 현재 관측된 상한으로 봐야 합니다. build.nvidia.com의 계정 내비게이션에서 개인별 수치를 확인할 수 있습니다.
"We are aware of the 40 rpm rate limit," — NVIDIA Developer Forum 모더레이터, 2026년 4~5월 (source: NVIDIA Developer Forums).
이 제한은 팬아웃 방식의 에이전트 워크로드에서 가장 크게 체감됩니다. 한 포럼 게시자는 대화형 코딩 중 쿼터가 "runs out in 2–3 minutes" 안에 소진되고, 작업 중간에 HTTP 429 오류가 발생한다고 언급했습니다 . 나중에 덧붙이기보다 첫날부터 이를 감안해 설계하세요.
- 토큰 버킷 큐: 외부 호출을 초당 속도로 제한해 순간적인 요청 폭주가 상한을 넘지 않게 합니다.
- 429에 대한 지수 백오프: 엔드포인트를 계속 두드리는 대신 점점 길어지는 지연을 두고 재시도합니다.
- 프롬프트 단위 캐싱: 반복되거나 동일한 호출은 네트워크로 나가기 전에 합칩니다.
RPM 숫자만 보면 놓치기 쉬운 주의점도 있습니다. 호스팅 카탈로그는 프로토타이핑과 평가 용도로만 문서화되어 있으며, NVIDIA는 전체 플랫폼 부하가 높을 때 지연 시간이 증가할 수 있다고 설명합니다(NVIDIA LLM API reference). 요청 속도를 안정적으로 조절하면 도움이 되지만, 공유 티어의 혼잡까지 완전히 막아주지는 못합니다.
무료 개발자 티어 다음 단계
프로토타이핑이 공유 티어의 혼잡을 넘어설 만큼 커지면, 동일한 OpenAI 호환 인터페이스를 호스팅 카탈로그 밖에서도 그대로 사용할 수 있습니다. Developer Program 회원은 연구, 개발, 실험 목적으로 최대 16개 GPU에서 NIM 컨테이너를 무료로 다운로드해 셀프 호스팅할 수 있습니다 . 클라이언트 변경은 거의 없습니다. base_url을 integrate.api.nvidia.com 대신 로컬 /v1 엔드포인트로 지정하면 되고, 더미 키를 쓰는 경우도 많습니다 .
실제 사용자에게 프로덕션 트래픽을 제공하는 순간 라이선스가 필요합니다. NVIDIA AI Enterprise 라이선스가 요구되며, 비용은 대략 GPU당 연 4,500달러 또는 클라우드 파트너를 통해 GPU 시간당 약 1달러 수준입니다. 여기에는 엔터프라이즈 지원, 보안 패치, API 안정성 보장이 포함됩니다 . 상업적 사용 권한을 먼저 확인해야 하는 팀은 NVIDIA 엔터프라이즈 포털을 통해 90일 AI Enterprise 평가판을 신청할 수 있습니다 .
핵심은 이렇습니다. LiteLLM 같은 프록시 계층을 쓰면 애플리케이션 계층 변경 없이 호스팅 무료 엔드포인트와 셀프 호스팅 또는 클라우드 NIM 사이를 라우팅할 수 있습니다. 시작할 때 썼던 두 줄짜리 교체 방식이 프로덕션까지 그대로 확장되는 셈입니다.
자주 묻는 질문
NVIDIA NIM 무료 개발자 티어에서는 몇 개의 모델을 사용할 수 있나요?
NVIDIA의 공식 NIM FAQ에는 Developer Program 회원과 90일 AI Enterprise Trial 사용자가 무료 프로토타이핑에 사용할 수 있는 호스팅 모델이 160개 이상이라고 안내되어 있습니다. 실제로 보이는 정확한 수는 카탈로그 업데이트, 지역, 계정 유형에 따라 달라지므로, 이 숫자는 고정 보장값이 아니라 공식적으로 게시된 기준 수치로 보는 것이 맞습니다. 모델군에는 Meta Llama, Mistral, NVIDIA Nemotron, DeepSeek, Qwen, Moonshot AI의 Kimi K2, Google Gemma, Microsoft Phi, IBM Granite가 포함되며, LLM API reference에는 meta/llama-3.3-70b-instruct, moonshotai/kimi-k2-instruct 같은 구체적인 ID가 문서화되어 있습니다.
NVIDIA NIM API는 정말 OpenAI와 호환되나요?
네. NVIDIA의 호스팅 엔드포인트는 OpenAI와 동일한 Chat Completions 요청/응답 스키마를 사용하므로 base_url과 모델 문자열만 바꾸면 되고, 나머지 코드는 그대로 둘 수 있습니다. NVIDIA의 2024년 7월 발표에서도 NIM이 “the OpenAI API specification for large language model-based NIM microservices”를 제공한다고 설명합니다. 서드파티 도구에서도 실제 호환성이 확인됩니다. LiteLLM과 Promptfoo는 모두 NVIDIA NIM을 OpenAI 호환 provider로 기본 등록하며, LangChain과 Cursor도 같은 방식으로 동작합니다.
NVIDIA NIM 무료 티어의 rate limit은 어느 정도인가요?
무료 티어에서 흔히 관측되는 상한은 대략 분당 40개 요청 수준이며, NVIDIA 포럼 moderator들이 2026년 4월-5월 스레드에서 이 수치를 언급했습니다. NVIDIA는 모든 모델에 적용되는 공통 SLA를 공개하지 않습니다. 호스팅 제한은 모델, 사용 사례, 현재 트래픽에 따라 달라집니다. 개인별 한도는 build.nvidia.com 계정 대시보드에 표시되며, 그곳이 기준입니다. 에이전트형 fan-out 워크로드라면 클라이언트 측 throttling과 HTTP 429에 대한 exponential backoff를 추가하세요.
NVIDIA NIM 무료 티어로 프로덕션 트래픽을 보낼 수 있나요?
아니요. 호스팅 무료 티어 엔드포인트는 명시적으로 프로토타이핑과 평가용이며, 부하가 높을 때 지연 시간이 길어질 수 있습니다. 프로덕션 사용에는 NVIDIA AI Enterprise 라이선스가 필요합니다. 가격은 대략 GPU당 연간 4,500달러부터 시작하거나, 자체 호스팅 NIM 컨테이너를 사용해야 합니다. 상업적 권한이 필요한 팀을 위해 무료 90일 enterprise evaluation이 제공되며, Developer Program 회원은 연구 개발 목적이라면 최대 16개 GPU까지 NIM 컨테이너를 무료로 자체 호스팅할 수 있습니다.
NVIDIA NIM API를 호출하려면 GPU가 필요한가요?
로컬 GPU는 필요하지 않습니다. 호스팅 무료 티어 엔드포인트는 NVIDIA DGX Cloud에서 실행되므로 모든 추론은 NVIDIA 인프라에서 처리됩니다. 필요한 것은 무료 NVIDIA Developer Program 계정과 build.nvidia.com에서 생성한 nvapi- 접두사의 개인 API 키뿐입니다. 신용카드도, 클라우드 계정도, 본인 소유 GPU도 필요 없습니다. 로컬 GPU는 나중에 NIM 컨테이너를 자체 호스팅할 때에만 관련됩니다.
이 글이 도움이 되셨다면, 새 글이 올라올 때마다 이메일로 받아보세요.