Moonshot AI의 Kimi K2.7 Code는 의도적으로 잠겨 있는 제어 인터페이스를 탑재하고 있습니다. 첫 프롬프트를 작성하기도 전에, 개발자들이 보통 손을 뻗는 몇 가지 설정 항목이 아예 사라져 있습니다.
바꿀 수 없는 K2.7 설정: 샘플링 고정, 재정의 없음
Kimi K2.7 Code는 코딩 에이전트 개발자들이 일반적으로 기대하는 런타임 제어 기능을 제거합니다: 추론은 모든 호출마다 실행되며 비활성화할 수 없고, 샘플링은 하드코딩되어 있으며, 도구 호출도 제한됩니다. ExplainX에 따르면, 사고/추론 모드는 비활성화 플래그 없이 필수로 동작합니다 . 즉, 간단한 조회나 한 줄짜리 포맷 수정도 전체 추론 오버헤드를 감수해야 합니다 — 경량 호출을 위한 빠른 경로는 존재하지 않습니다.
샘플링도 고정되어 있습니다. Marktechpost가 정리한 모델 카드에 따르면 온도는 1.0, top_p는 0.95로 고정되어 있으며 호출별 재정의가 불가능합니다 . 결정론적이거나 낮은 엔트로피 작업 — 구조화된 추출, 분류, 멱등 편집 — 은 낮은 분산 디코딩으로 전환할 방법이 없습니다. 온도 1.0을 받아들이거나, 이 모델을 사용하지 않는 것 중 하나입니다.
도구 제어도 제한되어 있습니다. tool_choice는 auto 또는 none만 허용하며, required는 사용할 수 없습니다 . 특정 도구 호출을 강제해야 하는 워크플로우 — 보장된 함수 호출, 필수 스키마 반환 — 는 API 레벨에서 강제하는 대신 모델에 맞게 재설계해야 합니다.
제약은 티어가 아닌 모델을 따릅니다. kimi-k2.7-code-highspeed 변형은 동일한 모델을 출력 기준 약 180 tokens/s, 단문 컨텍스트의 경우 최대 260 tokens/s로 실행하지만, 위의 모든 제약을 그대로 계승합니다 . 표준 및 HighSpeed 모두 32,768 토큰의 최대 출력 상한을 공유합니다 . 개발자들에게 시사점은 명확합니다: K2.7은 모든 호출에서 추론을 수행하며, 이를 끄는 방법은 없습니다.
입출력 비대칭: 256K 입력, 32K 응답

컨텍스트 윈도우는 불균형합니다. K2.7은 최대 256K 토큰을 수용할 수 있어 — 한 번에 상당한 규모의 저장소를 로드하기에 충분한 양 — 하지만 호출당 생성량은 32,768 토큰으로 제한됩니다 . 많은 것을 입력할 수 있지만, 답변은 비교적 좁은 범위로 제한됩니다.
이 비대칭은 프런티어 모델과 비교할 때 가장 두드러집니다. GPT-5.5와 Claude Opus 4.8은 모두 1M 컨텍스트 윈도우와 128K 최대 출력을 제공하며 — 응답 측면에서 대략 4배 더 많은 여유 공간입니다 . K2.7은 프런티어에 근접한 규모로 읽을 수 있지만, 턴당 응답량은 4분의 1 수준에 그칩니다.
| 모델 | 컨텍스트 윈도우 | 최대 출력 |
|---|---|---|
| Kimi K2.7 Code | 256K | 32,768 |
| GPT-5.5 | 1M | 128K |
| Claude Opus 4.8 | 1M | 128K |
출처: Kimi 수치 ; GPT-5.5 및 Opus 4.8 .
실질적인 영향은 에이전틱 코딩에서 나타납니다. 32K 출력 상한으로는 전체 파일 재작성이나 한 번에 약 10K 줄 이상의 프로젝트 스캐폴딩을 완료할 수 없습니다 — 해당 작업들은 한계를 초과하여 생성 도중 중단됩니다. 대신 멀티 패스 워크플로우를 계획하세요:
- 대규모 편집을 분할하세요 — 하나의 모놀리식 diff를 요청하는 대신 여러 턴에 걸쳐 파일 재작성을 나누세요.
- 도구 호출을 활용하세요 — 전체 파일을 인라인으로 반환하는 대신 에이전트가 디스크에 점진적으로 작성하도록 하세요.
- 응답 예산을 관리하세요 — 호출당 출력 길이를 추적하세요; 긴 생성 작업은 소프트 경고가 아닌 32,768 토큰 벽에 직접 부딪힙니다.
호스팅에는 또 다른 고려사항이 있습니다. K2.7은 이미지 및 비디오 입력을 위한 4억 파라미터 비전 인코더인 MoonViT를 번들로 제공합니다 . 멀티모달 디버깅에 유용하지만, 이미지를 입력하든 하지 않든 전체 가중치 트리에 포함되어 GPU 메모리를 소비합니다 — 셀프 호스팅 전에 반드시 고려해야 할 오버헤드입니다.
595 GB 호스팅: INT4 양자화와 호환 런타임 총정리
K2.7 Code를 셀프 호스팅하려면, 추론이 시작되기 전에 Hugging Face 저장소 moonshotai/Kimi-K2.7-Code에서 약 595 GB 규모의 safetensors 파일을 내려받아야 합니다 . 이 모델은 출시 후 30일 동안 229,156건의 다운로드를 기록했으며, 이 규모의 코딩 모델에 대한 수요가 실제로 존재함을 보여 줍니다 . 문제는 호기심이 아니라 인프라 준비입니다.
이 용량은 아키텍처에서 비롯됩니다. K2.7은 총 약 1.1조 개의 파라미터를 갖춘 Mixture-of-Experts 설계이지만, 토큰당 실제로 활성화되는 파라미터는 약 320억 개에 불과합니다 . 각 토큰은 61개 레이어에 걸쳐 384개 전문가 중 8개와 공유 전문가 1개를 경유하며, MLA 어텐션과 SwiGLU 피드포워드 블록을 사용합니다 . 스토리지와 메모리는 전체 전문가 세트 기준으로 지불하지만, 연산 비용은 활성화된 일부에 대해서만 발생합니다.
네이티브 INT4 양자화가 기본 제공되기 때문에 연구 클러스터가 아닌 실제 하드웨어에서도 조 단위 파라미터 가중치를 다룰 수 있습니다 . Moonshot은 다음 서빙 스택에서의 동작을 공식 확인했습니다:
- vLLM — 고처리량 서빙
- SGLang — 구조화 생성 및 에이전트 루프
- KTransformers — MoE용 CPU/GPU 하이브리드 오프로드
- Transformers — 레퍼런스 경로
- Docker Model Runner — 컨테이너 기반 로컬 호스팅
Moonshot의 설명에 따르면 기존 K2.6 배포 패턴이 이 런타임들에 그대로 적용되므로, 이전 모델을 운영 중인 팀은 기존 툴링을 대부분 그대로 활용할 수 있습니다 . 편의성은 있지만, 보장은 아닙니다. 대형 MoE 체크포인트를 직접 운영해 본 한 엔지니어는 이 반복되는 함정을 이렇게 표현했습니다: "스펙상 호환과 실제 빌드 환경 호환은 다른 얘기입니다 — GPU를 구매하기 전에 고정된 버전에서 INT4 MoE 커널 경로를 반드시 검증하세요." 이는 출시 이후 셀프 호스팅 관련 글에서 공통적으로 강조되는 경고입니다 .
실제 순서는 이렇습니다: 사용 중인 vLLM(또는 SGLang) 버전이 해당 아키텍처에 맞는 INT4 MoE 라우팅을 지원하는지 확인하고, 전체 가중치 트리와 MoonViT 인코더 오버헤드를 더한 GPU 메모리 요구량을 산정한 뒤 프로비저닝하세요. 이 검증을 건너뛰면 595 GB 다운로드가 유휴 하드웨어로 끝납니다.
K2.7, 두 가지 방언 모두 지원: URL만 바꾸면 됩니다

K2.7 Code는 OpenAI 호환 엔드포인트와 Anthropic 호환 엔드포인트를 모두 제공하므로, 기존 에이전트 마이그레이션은 재작성이 아닌 설정 변경으로 끝납니다. 클라이언트가 가리키는 호스트를 Moonshot으로 바꾸고 모델 ID를 지정하면, 기존 SDK를 그대로 사용할 수 있습니다 . 이 이중 방언 인터페이스 덕분에 팀들이 파이프라인을 다시 짜지 않고도 기존 툴링과의 비교 테스트를 진행할 수 있습니다.
OpenAI 경로는 base URL을 api.moonshot.ai로 변경하고 모델을 kimi-k2.7-code로 설정하면 됩니다. 라이브러리 수정은 필요 없습니다 — OpenAI Python 또는 Node 클라이언트가 호환 백엔드로 그대로 인식합니다 .
Anthropic 경로는 환경 변수 두 개만 바꾸면 코드 수정 없이 Claude Code를 우회시킬 수 있습니다:
ANTHROPIC_BASE_URL=https://api.moonshot.ai/anthropic
ANTHROPIC_MODEL=kimi-k2.7-code이후 Claude Code는 평소의 에이전트 루프를 Moonshot 서버에 대해 그대로 실행합니다 . CI나 개발 컨테이너에서 Claude Code를 이미 구동 중이라면 사실상 마찰 없이 전환됩니다.
API 인터페이스는 대부분의 에이전트 워크로드를 커버할 만큼 넓습니다. 지원 기능은 다음과 같습니다:
- ToolCalls — 다단계 도구 사용을 위한 함수 호출.
- JSON Mode — 파싱 가능한 응답을 위한 구조화 출력.
- Partial Mode — 어시스턴트 턴의 프리필 방식 이어쓰기.
- 자동 컨텍스트 캐싱 — 캐시된 입력은 표준 요금 $0.95 대비 $0.19/1M 토큰으로 약 5배 저렴하여, 긴 시스템 프롬프트를 반복 재생하는 에이전트에서 비용 절감 효과가 큽니다.
주의해야 할 제약은 tool_choice입니다. Moonshot은 이를 auto 또는 none으로만 제한하므로, 매 턴마다 도구 호출을 강제하는 tool_choice='required'는 사용할 수 없습니다 . 도구 호출을 반드시 보장해야 하는 에이전트는 폴백 처리가 필요합니다. 스트리밍 동작도 클라이언트에 따라 차이가 있을 수 있으므로, 토큰 경계와 델타 프레이밍이 현재 백엔드와 다를 수 있습니다.
핵심은 이것입니다: 마이그레이션을 확정하기 전에 실제 호출 패턴 — 구체적인 tool-choice 설정, 스트리밍 소비 방식, JSON 파싱 — 을 반드시 테스트하세요. 엔드포인트가 같은 방언을 지원하더라도, 강제 도구 호출과 스트림 포맷 제약에서 "드롭인 교체"가 조용히 깨질 수 있습니다.
다운로드부터 재배포까지: 숨겨진 의무

사용자 대면 제품에 K2.7 Code를 탑재하기 전에 라이선스를 반드시 읽어야 합니다 — 표준 MIT가 아닙니다. Moonshot은 코드와 가중치 모두를 수정 MIT 라이선스(Modified MIT License)로 공개했으며, 이 수정 조항에는 구체적인 의무가 따릅니다. 월간 활성 사용자 1억 명 또는 월 매출 2,000만 달러를 초과하는 제품이나 서비스는 사용자 인터페이스에 "Kimi K2.7 Code"를 눈에 띄게 표시해야 합니다 . 이는 조건 없는 허가가 아니라, 출처 표시가 필요한 허용 라이선스입니다.
이 임계값은 선택적(disjunctive) 조건입니다 — 둘 중 하나만 충족해도 조항이 발동됩니다. 트래픽이 높은 무료 제품은 매출 2,000만 달러에 도달하기 훨씬 전에 MAU 1억 명을 넘을 수 있고, 규모가 작은 유료 플랫폼은 그보다 훨씬 적은 트래픽으로 매출 기준선을 넘길 수 있습니다. 커밋하기 전에 요약본이 아니라 전문을 읽어야 합니다.
이 조항은 호출 경로가 아닌 제품에 귀속됩니다. Moonshot의 호스팅 API를 통해 모델에 접근하든, 자체 하드웨어에서 오픈 가중치를 직접 실행하든 관계없이 — 제품이 두 임계값 중 하나를 넘는 순간 API 소비자와 자체 호스팅 배포자 모두 적용 대상이 됩니다. 출처 표시 의무를 피하려고 자체 호스팅으로 전환해도 소용없습니다. 의무는 백엔드가 호출하는 엔드포인트가 아니라 사용자가 접하는 인터페이스를 따라갑니다.
실제로 대응이 필요한 주체:
- 대규모 코딩 에이전트 및 AI IDE 벤더 — 대규모 사용자 기반으로 인해 MAU 트리거에 가장 빠르게 도달합니다.
- 대용량 에이전틱 워크로드를 운영하는 엔터프라이즈 AI 플랫폼 팀 — 토큰 비용과 매출 모두 높은 수준으로 발생합니다.
- 상용 제품에 K2.7을 내장하는 오픈 가중치 배포자 — 자체 호스팅으로 의무가 사라진다고 착각하기 쉽지만, 그렇지 않습니다.
초기 단계 팀 대부분에게는 당장 문제가 되지 않습니다. MAU 1억 명과 월 매출 2,000만 달러 미만이라면, 수정 MIT 조항은 일반적인 허용 라이선스처럼 작동합니다 — UI 출처 표시 요건 없이 자유롭게 빌드, 포크, 배포가 가능합니다. 함정은 즉각적이지 않고 구조적입니다. 출시 시점에는 아무 비용도 들지 않는 조항이, 제품이 성공하는 바로 그 순간 재배포 의무로 돌아옵니다. UI 문자열 하나 바꾸는 일이 아직 저렴할 때, 지금 아키텍처 리뷰에 출처 표시 결정을 반영해 두는 것이 현명합니다.
K2.7의 강점과 약점
K2.7 Code의 실측 강점은 순수 코딩이 아니라 툴 사용입니다. 가장 좋은 공개 결과는 MCP Mark Verified에서 81.1점으로, Claude Opus 4.8의 76.4점을 앞서지만 GPT-5.5의 92.9점에는 미치지 못합니다 . 순수 코딩에서는 프런티어 격차가 그대로 드러납니다. Program Bench 53.6 대 GPT-5.5의 69.1, Kimi Code Bench v2 62.0 대 69.0입니다 .
한눈에 보기: K2.7 Code의 상대적 강점은 에이전틱 툴 사용입니다 — MCP Mark Verified에서 Opus 4.8을 앞서지만(81.1 대 76.4), GPT-5.5(92.9)에는 뒤집니다. 단일 패스 코딩에서는 두 모델 모두 하회합니다. 6개 벤치마크 전부 Moonshot 자체 운영이며, 출시 시점에 SWE-bench나 LiveCodeBench 항목은 없습니다.
Moonshot의 표 전반에서 패턴이 일관됩니다. K2.7은 다단계 및 MCP 집중 태스크에서 격차를 좁히는 반면, 클로즈드 모델은 독립적인 코드 생성에서 여전히 뚜렷한 우위를 유지합니다. 워크로드가 에이전틱 — 계획 수립, 파일 편집, 반복적인 툴 호출 — 하다면, 순위 자체보다 단일 패스 완성 여부가 더 중요합니다.
| 벤치마크 | K2.7 Code | Opus 4.8 | GPT-5.5 |
|---|---|---|---|
| Kimi Code Bench v2 | 62.0 | 67.4 | 69.0 |
| Program Bench | 53.6 | 63.8 | 69.1 |
| MCP Atlas | 76.0 | 81.3 | 79.4 |
| MCP Mark Verified | 81.1 | 76.4 | 92.9 |
이 수치는 유보적으로 읽어야 합니다. 모든 점수는 Moonshot이 직접 통제하는 스위트 — Kimi Code Bench v2, Kimi Claw 24/7 Bench, MCP Atlas, MCP Mark Verified — 에서 나온 것으로, 카드에는 오픈소스화 예정이라고 명시되어 있지만 아직 공개되지 않았습니다 . 2026년 6월 출시 당시 표준 서드파티 리더보드 항목은 없었습니다.
- SWE-bench Verified 또는 SWE-bench Pro 결과 없음.
- Terminal-Bench 2.0 제출 없음.
- LiveCodeBench 항목 없음 — HighSpeed 모드는 출시했지만 독립 벤치마킹은 건너뛰었습니다 .
이 공백은 날카로운 평가를 불러왔습니다. 한 분석은 이 모델이 "자기 숙제를 스스로 채점한다"고 표현했습니다 — 외부 기관이 아직 재현하지 못한 테스트에서 이전 버전을 앞선다는 것입니다 .
실질적인 결론은 이렇습니다. 가중치, 수정 MIT 라이선스, 그리고 $0.95/$4.00 정가는 지금 바로 확인할 수 있습니다 . 성능 주장은 그렇지 않습니다. 출력 토큰이 비용의 대부분을 차지하는 고용량 에이전틱 또는 MCP 워크로드를 운영한다면, 지금 당장 K2.7 파일럿을 시도해볼 가치는 있습니다 — 단, 벤더 표를 그대로 신뢰하지 말고 자체 태스크로 Opus 4.8, GPT-5.5와 직접 벤치마크하고, SWE-bench와 LiveCodeBench 수치가 나오면 다시 검토하는 것이 바람직합니다.
자주 묻는 질문
Kimi K2.7 Code에서 추론 모드를 끌 수 있나요?
아니요. 사고(thinking) 모드는 필수이며 끌 수 없고, 샘플링은 temperature 1.0, top_p 0.95로 고정됩니다 . 호출별 재정의 경로는 없습니다. tool_choice는 auto 또는 none으로만 제한되므로 개별 요청에서 추론 토큰을 지연 시간과 맞바꿀 수 없습니다. 모든 호출에서 이 오버헤드를 예산에 반영하세요.
작업에 32K 토큰 이상의 출력이 필요하면 어떻게 되나요?
K2.7은 최대 출력인 32,768토큰에서 잘라냅니다 . 전체 파일 재작성, 대형 스캐폴딩, 대량 마이그레이션처럼 이 한계를 초과하는 작업은 작업을 청크로 분할하고 결과를 이어붙이는 다중 패스 워크플로가 필요합니다. 비교하자면 GPT-5.5와 Claude Opus 4.8은 모두 최대 출력 128K를 지원하므로 , 단일 호출 대용량 생성은 클로즈드 프론티어 모델의 몫으로 남습니다.
12배 저렴하다는 주장이 모든 작업에 해당되나요?
아니요. 12배 수치는 K2.7의 출력 토큰 1M당 $4.00를 Claude Fable 5의 1M당 $50.00과 비교한 것으로, 가장 비싼 Claude 티어를 기준으로 한 최선의 경우 상한입니다 . Claude Opus 4.8 대비로는 출력 기준 약 6배로 격차가 좁아집니다 . 필수 추론 오버헤드, 32K 출력 한도, 캐시 적중률 모두 실질적인 작업당 비용을 정가 비교 이상으로 높일 수 있습니다.
대규모 운용 시 Modified MIT 라이선스는 무엇을 요구하나요?
코드와 가중치는 일반 MIT가 아닌 Modified MIT 라이선스로 제공됩니다. 월간 활성 사용자 1억 명 또는 월간 매출 2,000만 달러를 초과하는 제품·서비스는 UI에 "Kimi K2.7 Code"를 눈에 띄게 표시해야 합니다 . 표준 MIT에는 제품 내 저작자 표시 요건이 없으므로, 대규모 코딩 에이전트 및 IDE 벤더는 재배포 전에 이 조항을 반드시 검토해야 합니다.
K2.7 Code는 SWE-bench 같은 공개 벤치마크에서 평가받았나요?
출시 시점에는 없습니다. 공개된 모든 점수는 Moonshot의 자체 테스트 스위트인 Kimi Code Bench v2, Kimi Claw 24/7 Bench, MCP Mark Verified를 사용하며, 2026년 6월 기준 SWE-bench Verified, Terminal-Bench 2.0, LiveCodeBench에는 등재된 결과가 없습니다 . 언론에서는 "자기 숙제를 스스로 채점한다"는 문제를 지적한 바 있으므로 , 제3자 결과가 나오기 전까지 성능 주장은 미검증 상태로 간주하세요.