무료 LLM API 리소스: GitHub 저장소 목록, 무료 제공사, 속도 제한, Claude Code·Cursor 2026

무료 LLM API 리소스: GitHub 저장소 목록, 무료 제공사, 속도 제한, Claude Code·Cursor 2026
Share

이제 코딩 에이전트를 돌리기 위해 유료 API 키가 꼭 필요하지 않습니다. GitHub의 작은 디렉터리 몇 곳이 실제 무료 티어가 있는 모든 추론 제공업체를 모아 두고, 속도 제한과 바로 넣어 쓸 수 있는 설정까지 함께 정리해 두고 있기 때문입니다. 이 글의 출발점은 한 워크스루 영상이지만, 진짜 핵심은 저장소 자체에 있습니다.

cheahjs/free-llm-api-resources와 최신 디렉터리들이 다루는 것

Screenshot of https://github.com/amardeeplakshkar/awesome-free-llm-apis

기준이 되는 저장소는 cheahjs/free-llm-api-resources입니다. Python 기반으로 활발히 관리되는 목록이며, 대략 스타 27.7k개, 포크 2.9k개, 커밋 423개를 보유하고 있습니다. 2026년에 무료 LLM 추론이 실제로 어디에 존재하는지 보여 주는 실용적인 색인이지만, 실제 분류 체계는 마케팅 문구보다 훨씬 작습니다. 헤드라인의 “100+”가 아니라 영구 무료 제공업체 항목 약 13개와 체험 크레딧 항목 13개 정도입니다.

그 “100+”라는 숫자는 개별 모델 엔드포인트 수로 보면 방어 가능합니다. OpenRouter, Groq, GitHub Models, Cloudflare Workers AI 같은 멀티 모델 애그리게이터는 각각 수십 개의 모델 슬러그를 노출하므로, 서로 다른 제공업체 수보다 전체 수치가 훨씬 부풀어 오릅니다.

그 옆에는 더 새로운 동반 저장소도 있습니다. open-free-llm-api/awesome-freellm-apis는 freellm.net에서 매일 갱신되는 30개 제공업체의 453개 모델(스타 806개, 마지막 업데이트 2026-07-22)을 내세웁니다. 가장 유용한 포크들은 영구적이고 카드 등록이 필요 없는 티어만 따로 걸러냅니다. 다만 모두에 공통되는 주의점이 있습니다. cheahjs는 “Please don't abuse these services, else we might lose them,”라는 경고를 앞에 붙이고, 리버스 엔지니어링된 엔드포인트는 제외합니다.

카드 없이 쓰는 영구 무료 플랜: 2026년 7월 제공업체별 정확한 한도

Screenshot of https://ai.google.dev/gemini-api/docs/rate-limits

카드 등록이 필요 없는 지속형 무료 티어는 다섯 개 게이트웨이를 중심으로 모입니다. 각각 병목이 다릅니다. Groq는 처리량, Google AI Studio는 토큰 예산, Cloudflare Workers AI는 엣지 모델 호스팅, GitHub Models는 프런티어 모델 접근, Cohere는 RAG 기본 기능에서 강점이 있습니다. 아래 수치는 특정 시점의 스냅샷입니다. 무료 티어는 예고 없이 줄어들 수 있습니다. 그래도 2026년 7월 기준으로 코딩 에이전트나 사이드 프로젝트에 키를 꽂았을 때 실제로 마주치는 한도를 보여 줍니다.

Groq는 이 그룹 중 가장 투명한 공식 할당량 표를 모델별로 공개합니다. Google의 한도는 프로젝트별로 적용되고, 일일 요청 수는 태평양 시간 자정에 초기화되며, 모델마다 다릅니다. AI Studio에서 직접 확인할 수 있고, 속도 제한 문서는 2026-07-21에 마지막으로 업데이트되었습니다 [G]. 가장 큰 매력은 Gemini Flash의 100만 토큰 컨텍스트 창입니다. 무료 목록에서 긴 컨텍스트를 시작하기에 가장 넉넉한 진입로입니다.

제공업체모델(예시)무료 한도특징
Groqllama-3.3-70b-versatile30 RPM / 1,000 RPD / 12k TPM / 100k TPD [Gr]처리량 선두
Groqllama-3.1-8b-instant30 RPM / 14,400 RPD / 6k TPM / 500k TPD [Gr]가장 높은 RPD/TPD
Google AI StudioGemini Flash프로젝트별 적용, 태평양 시간 자정 초기화; 100만 토큰 컨텍스트 [G]가장 큰 토큰 예산
Cloudflare Workers AIDeepSeek R1, Kimi하루 10,000 Neurons(00:00 UTC 초기화), 이후 1k Neurons당 $0.011 [C]엣지 호스팅 모델
GitHub ModelsLow-tier / DeepSeek-R1low-tier 15 RPM / 150 RPD; high-tier 10 RPM / 50 RPD; DeepSeek-R1 1 RPM / 8 RPD [GH]Copilot 티어로 제한
CohereChat / Rerank월 1,000회 호출; chat 20 req/min, Rerank 10 req/min [Co]가장 빡빡한 한도; RAG 기본 기능

Cloudflare Workers AI는 00:00 UTC에 초기화되는 하루 10,000 Neurons를 제공하고, 이후에는 1,000 Neurons당 $0.011를 과금합니다. 또한 DeepSeek R1과 Kimi를 엣지에서 실행하는 몇 안 되는 호스트 중 하나입니다 [C]. GitHub Models는 프런티어 모델(GPT-4o, Claude, DeepSeek-R1, Llama 4)을 노출하지만 Copilot 티어에 따라 접근을 제한하며, DeepSeek-R1은 1 RPM / 8 RPD로 강하게 제한됩니다 [GH]. Cohere는 가장 낮은 상한을 갖습니다. 월 1,000회 API 호출뿐이라 매일 쓰는 주력 도구로는 부족하지만, RAG 기본 기능을 구축하는 데는 쓸 만합니다 [Co]. 현실적인 결론은 이렇습니다. 하나의 티어가 모든 것을 해결하지 못하기 때문에, 이런 저장소들은 여러 무료 티어를 조합해 쓰는 방식을 권합니다.

무료 제공자 키로 Claude Code와 Cursor 사용하기: 환경 변수 방식

코딩 에이전트에 무료 제공자 키를 연결하려면 환경 변수 두 개면 충분하지만, 정확한 연결 방식은 에이전트가 어떤 wire protocol을 쓰는지에 따라 달라집니다. Claude Code는 OpenAI 형식이 아니라 Anthropic API 형식으로 통신하므로, 문서화된 방식은 ANTHROPIC_BASE_URL로 엔드포인트를 덮어쓰고 ANTHROPIC_AUTH_TOKEN에 제공자 키를 담아 OpenAI 호환 게이트웨이를 거치게 합니다. 이때 기본 Anthropic 인증 경로가 끼어들지 않도록 ANTHROPIC_API_KEY는 비워 둡니다. cheahjs/free-llm-api-resourcesawesome-freellm-apis 모두 같은 OpenRouter 스니펫을 제공하며, Claude Code 자체 환경 변수 문서에서도 두 override가 모두 지원된다고 확인할 수 있습니다.

export ANTHROPIC_BASE_URL="https://openrouter.ai/api"
export ANTHROPIC_AUTH_TOKEN="$OPENROUTER_API_KEY"
# leave ANTHROPIC_API_KEY unset

다만 저장소들이 짚는 주의점이 하나 있습니다. OpenRouter의 Anthropic 형식 경로는 한 번 $10을 충전해야 하므로, 이 경로를 통한 "무료 Claude Code"는 엄밀히 말해 완전한 0원은 아닙니다.

Cursor의 BYOK 지원 범위는 더 좁습니다. 문서에는 OpenAI, Anthropic, Google, Azure OpenAI, AWS Bedrock에 대한 네이티브 직접 지원이 나열되어 있고, 사용자 지정 키는 탭 완성과 같은 특화 기능에는 영향을 주지 않습니다. 이런 기능은 여전히 Cursor의 내장 구성을 사용합니다. OpenRouter에 연결하려면 OpenRouter의 Cursor 연동 가이드에 따라 전용 base URL인 https://openrouter.ai/api/v1/cursor를 써야 합니다. 일반적인 /api/v1이 아닙니다.

Groq와 그 밖의 OpenAI 호환 제공자에서는 마찰이 대체로 사라집니다. Aider나 Cline 같은 에이전트는 Anthropic 형식 변환 없이 사용자 지정 baseURL과 모델 slug를 받을 수 있습니다. 매일 할당량을 직접 지켜보지 않으려면 @musistudio의 Claude Code Router (ccr)를 쓸 수 있습니다. MIT 라이선스인 이 도구는 설정된 제공자들 사이에서 fallback을 자동화해 유료 크레딧을 쓰기 전에 무료 티어부터 소진하며, 비용을 70–85% 줄일 수 있다고 주장합니다.

"Please don't abuse these services, else we might lose them." — maintainer note, cheahjs/free-llm-api-resources

저장소 목록만 보고 놓치기 쉬운 세 가지

Claude Code and Cursor with free provider keys: the env-var approach

카탈로그는 정확한 스냅샷이지만, 복사해 붙여넣는 과정에서 세 가지 주의점은 자주 빠집니다. 첫째, "OpenRouter를 통한 무료 Claude Code"는 0원이 아닙니다. Anthropic 형식 경로를 쓰려면 최소 $10 크레딧을 한 번 충전해야 합니다. 충전하지 않으면 무료 모델 변형은 지출 이력이 있을 때 열리는 하루 1,000회가 아니라 하루 50회 요청으로 제한됩니다 . 에이전트를 이 경로 중심으로 구성하기 전에 이 최소 비용을 예산에 넣어야 합니다.

둘째, Cerebras는 조용히 바뀌었습니다. 여러 목록에서 아직 영구적인 카드 없는 티어처럼 설명하지만, 2026년 중반 현재는 검증된 결제 수단을 추가한 뒤에야 $5 크레딧을 제공하며, 이 크레딧은 지급 후 30일이 지나면 만료됩니다 . "카드 필요 없음"이라는 라벨은 디렉터리의 확정 정보가 아니라, 제공자 콘솔에서 다시 확인해야 할 주장으로 취급하세요.

셋째, 무료 티어에는 금전이 아닌 비용이 따를 수 있습니다. 무료 Gemini API 및 AI Studio 호출은 Google 제품 개선에 사용될 수 있고 사람이 검토할 수도 있는 반면, 유료 Vertex AI는 다르게 처리됩니다 . 독점 코드를 무료 키로 보내기 전에 이 조항을 확인해야 합니다.

다음 단계는 명확합니다. 2026년 중반의 공통된 결론은 하나에 올인하지 말고 여러 티어를 쌓아 쓰라는 것입니다. 넉넉한 일일 한도를 위해 Google AI Studio를 기본 드라이버로 쓰고, 지연 시간이 중요한 호출에는 Groq를, frontier 모델 접근이 필요할 때는 GitHub Models를 사용하세요 . 그런 다음 라우터가 순서를 강제하게 두면 됩니다. @musistudio의 Claude Code Router (ccr)나 decolua의 9Router는 모두 MIT 라이선스이며, 유료 요청이 발생하기 전에 무료 할당량부터 소진하도록 구성할 수 있고, 70–85% 절감을 주장합니다 . 핵심은 이렇습니다. 디렉터리는 출발점이 되는 지도일 뿐 계약서가 아닙니다. 각 티어는 원천에서 확인하고, 독점 코드는 무료 키에 올리지 말며, 할당량 계산은 라우터에 맡기세요.

자주 묻는 질문

OpenRouter를 거치면 Claude Code를 실제로 무료로 쓸 수 있나요?

엄밀히 말하면 아닙니다. OpenRouter의 무료 모델 변형은 하루 50회 요청으로 제한되지만, Claude Code에 필요한 Anthropic 형식 라우트는 최소 10달러 크레딧을 한 번 충전해야 하며, 그러면 한도가 하루 1,000회 요청으로 올라갑니다. 따라서 사실상 한 번 결제한 뒤 무료 변형 호출을 소진해 가는 구조입니다. 이 단서는 매일 코딩할 때 중요합니다. 하루 50회 요청은 디버깅 한 번이면 사라지기 때문에, 실제 사용은 10달러를 이미 썼다는 전제를 깔게 됩니다. 비용을 완전히 0으로 맞추려는 사람이라면 Claude Code를 카드가 필요 없는 게이트웨이로 라우팅하고, 대신 와이어 프로토콜 설정에 드는 수고를 감수하는 편이 낫습니다.

2026년에 개인 개발자가 쓰기 좋은 노카드 LLM 요금제 중 처리량이 가장 높은 것은 무엇인가요?

순수 요청량만 보면 Groq의 llama-3.1-8b-instant가 앞섭니다. 문서화된 무료 플랜 한도가 하루 14,400회 요청으로, 영구 노카드 티어 중 RPD가 가장 높습니다. 하지만 처리량이 전부는 아닙니다. 토큰 예산과 컨텍스트에서는 Google AI Studio가 유리합니다. Gemini Flash에서 100만 토큰 컨텍스트를 제공하기 때문에, 요청 수보다 대규모 코드베이스 추론이 더 중요한 작업에서 강점이 큽니다. 정리하면 지연 시간과 호출량이 중요한 반복 작업에는 Groq, 긴 컨텍스트 작업에는 Google AI Studio, 최상위급 성능이 필요할 때는 GitHub Models가 맞습니다. 대부분의 개발자는 하나만 고르기보다 세 가지를 함께 쌓아 씁니다.

GitHub 저장소 목록은 얼마나 자주 오래된 정보가 되나요?

저장소마다 다르며, 어느 쪽도 제공업체 약관 변화를 실시간으로 따라가지는 못합니다. awesome-freellm-apis는 상위 소스에서 매일 갱신됩니다(마지막 업데이트 2026-07-22). 반면 cheahjs/free-llm-api-resources는 수동으로 관리됩니다. 매일 업데이트하더라도 조용한 정책 변경은 뒤늦게 반영됩니다. 2026년의 가장 분명한 예는 Cerebras입니다. 영구 노카드 티어 대신, 결제 수단을 추가한 뒤에야 5달러 크레딧을 주는 방식으로 조용히 바뀌었습니다. 어떤 저장소에 있는 rate limit 수치든 특정 시점의 스냅샷으로 보고, 그 위에 무언가를 만들기 전에 반드시 제공업체의 콘솔에서 직접 확인하세요.

Cursor에서 커스텀 API 키를 쓰면 탭 자동완성에도 영향을 주나요?

아니요. 이 부분에서 많이들 놀랍니다. Cursor 문서는 직접 가져온 키 자격 증명이 채팅과 에이전트 모델 호출에만 적용되고, 특화된 편집기 기능에는 적용되지 않는다고 설명합니다. 탭 자동완성과 비슷한 편집기 내 예측 기능은 어떤 키를 설정하든 Cursor의 내장 모델을 계속 사용합니다 (BYOK does not cover tab completion). 따라서 무료 OpenRouter나 Groq 키를 연결하면 명시적으로 보낸 요청은 해당 제공업체로 라우팅되지만, Cursor의 자동완성이 무료가 되거나 다른 모델로 바뀌지는 않습니다. 탭 자동완성이 워크플로의 핵심이라면 Cursor 구독 비용은 따로 잡아야 합니다.

이런 무료 플랜을 프로덕션 서비스에 써도 괜찮나요?

안정적으로 쓰기에는 어렵습니다. 무료 티어는 변동성이 크고 점점 줄어드는 추세입니다. 2026년에 Cerebras가 단순한 노카드 플랜을 없앤 것이 가장 최근의 사례이며, cheahjs도 README에서 "Please don't abuse these services, else we might lose them"라는 경고로 취약성을 직접 짚고 있습니다 [README]. 요청 한도, 모델 목록, 심지어 티어 자체의 존재 여부도 예고 없이 바뀔 수 있고, 유료가 아닌 Gemini 트래픽은 Google 제품 개선을 위해 사람이 검토할 수도 있습니다. 이런 플랜은 개발, 프로토타이핑, 개인 프로젝트에 쓰고, 사용자에게 노출되는 기능이 의존하기 전에는 유료 계약 티어로 옮기세요.

이 글이 도움이 되셨다면, 새 글이 올라올 때마다 이메일로 받아보세요.

구독하기