DeepSeek, 토큰 가격 $0.87/M으로 인하. 미국 경쟁사는 $15 유지.

DeepSeek, V4-Pro를 $0.87/M으로 영구 인하. Xiaomi 99% 인하. 2026년 랩별 요금 분석 및 연쇄 파급 효과.

DeepSeek, 토큰 가격 $0.87/M으로 인하. 미국 경쟁사는 $15 유지.
Share

DeepSeek는 2026년 5월 플래그십 출력 토큰 가격을 백만 개당 약 $0.87로 낮췄습니다. Claude Opus 4.6는 여전히 $25에 책정되어 있습니다. 이 28배 격차는 하루아침에 생긴 것도 아니고, 다섯 개 연구소가 동시에 조율한 결정에서 비롯된 것도 아닙니다.

2026년 중국 AI 토큰 가격 전쟁은 무엇이 촉발했는가?

2026년 중국 AI 토큰 가격 전쟁은 다섯 개 연구소의 동시 인하가 아니라, DeepSeek가 2026년 5월 말 V4-Pro 75% 프로모션 할인을 영구 확정하면서 촉발됐습니다. DeepSeek는 2026년 4월 24일 V4-Pro를 입력 백만 개당 $1.74, 출력 백만 개당 $3.48에 출시하고 75% 프로모션을 진행하다가, 5월 22~23일경 할인을 철회하지 않겠다고 확인했습니다 . 공시 가격은 입력 백만 개당 약 $0.435, 출력 백만 개당 약 $0.87으로, 출시 가격의 약 4분의 1 수준으로 내려갔습니다 .

핵심 요약: 2026년 가격 전쟁은 DeepSeek가 2026년 5월 V4-Pro 75% 할인을 영구 확정하면서 시작됐으며, 플래그십 출력 가격을 ~$0.87/M 토큰으로 끌어내렸습니다. 다른 연구소들은 수일에서 수 주에 걸쳐 뒤를 따랐으며, 다섯 개 연구소가 조율한 동시 인하가 아니었습니다. Claude Opus 4.6의 출력 가격 $25/M과 비교하면 28배 격차입니다.

이번이 첫 번째 물결이 아니라 두 번째입니다. 2024년 5월 7일 제출된 DeepSeek V2 논문은 236B 파라미터의 Mixture-of-Experts 모델에 21B 활성 파라미터와 93.3% 더 작은 KV 캐시를 갖추고 있음을 설명했습니다. 이러한 효율성 향상이 이례적으로 낮은 추론 가격을 뒷받침하며 2024년 원조 연쇄 인하를 촉발하는 데 기여했습니다 . 두 사례 모두 같은 패턴을 공유합니다: DeepSeek가 방아쇠를 당기고, 나머지가 반응하는 구도.

흔히 퍼진 "다섯 개 연구소가 동시에 최대 99% 가격 인하"라는 표현은 사실과 다릅니다. 인하는 하나의 협약처럼 동시에 이뤄진 게 아니라, DeepSeek의 방아쇠 이후 수일에서 수 주에 걸쳐 산발적으로 이뤄졌습니다. 99%라는 수치는 특정하게 Xiaomi에서 나온 것으로, Xiaomi는 2026년 5월 27일 MiMo-V2.5 시리즈 전반에 걸쳐 최대 99%까지 가격을 인하하고 기존 고객에게 사용 가능 크레딧을 5~8배 늘려줬습니다 . "최대 99%"는 한 공격적 업체와 그 경량 티어에 대한 최대치이지, 모든 연구소와 모델에 걸친 평균이 아닙니다. 이 분석의 나머지 부분에서는 실제로 누가 인하했고 누가 유지했으며 각 연구소가 현재 얼마를 받는지 세부적으로 다룹니다.

DeepSeek가 V4-Pro 75% 인하를 영구 확정한 이유

DeepSeek cut to $0.87/M. US equivalents stayed at $15.

DeepSeek가 할인을 영구화한 이유는 낮은 가격이 일시적 손실 유발 전략이 아니라 아키텍처상 언제나 감당 가능했기 때문입니다. 회사는 2026년 4월 24일 플래그십 V4-Pro를 입력 백만 개당 $1.74, 출력 백만 개당 $3.48에 출시하면서 처음부터 75% 프로모션 할인을 붙였습니다 . 2026년 5월 22~23일에 할인 철회 없음을 확인하며 공시 가격을 입력 약 $0.435, 출력 약 $0.87(백만 개당)로 확정했는데, 이는 출시가의 약 4분의 1 수준입니다 .

핵심 요약: DeepSeek는 2026년 5월 22~23일 V4-Pro 75% 할인을 영구 확정하며 공시 가격을 입력 ~$0.435 / 출력 ~$0.87(백만 개당)로 고정했습니다. 모델의 Mixture-of-Experts 설계(236B 파라미터 중 21B 활성, 93.3% 더 작은 KV 캐시, 5.76배 높은 처리량)가 이 가격을 일시 프로모션이 아닌 구조적으로 지속 가능하게 만듭니다.

개발자에게 가장 중요한 세부 사항은 캐시 히트율입니다. DeepSeek는 KV 캐시 히트 시 입력 토큰을 백만 개당 약 $0.003625로 책정하는데, 이는 캐시 미스 요금보다 두 자릿수 낮은 수준입니다 . 이는 캐시 안정적 프롬프트 패턴에 직접적인 이점을 줍니다. 고정 시스템 프롬프트를 사용하는 에이전트, 검색된 컨텍스트를 재사용하는 RAG 루프, 반복 구조 완성 모두 임의적인 일회성 호출보다 캐시를 훨씬 자주 활용합니다. 이제는 모델 선택뿐 아니라 프롬프트 아키텍처가 비용을 좌우합니다.

"고정 프리픽스는 여러분이 전송하는 토큰 중 가장 저렴합니다. 시스템 프롬프트와 도구 정의가 턴 사이에서 바뀌지 않도록 에이전트를 설계하세요." — 프롬프트 안정적 에이전트 설계를 다룬 컨텍스트 엔지니어링 안내(영상: Robert Ta)에서.

이 가격에는 아키텍처적 근거가 있습니다. DeepSeek의 MoE 계보는 토큰당 전체 236B 파라미터 중 21B만 활성화하고, 이전 밀집 세대 대비 KV 캐시를 93.3% 줄이며, 최대 생성 처리량을 5.76배 높입니다 . 활성 파라미터와 캐시가 줄어든다는 것은 제공 토큰당 메모리와 연산이 낮아진다는 의미입니다. 이것이 $1 미만의 출력 가격을 영구 보조금 없이 유지할 수 있게 하는 추론 경제학의 핵심입니다.

일부 매체는 이 움직임을 "가장 스마트한 모델 구축에서 최저 비용 서비스 제공으로"의 전략적 전환으로 풀이했습니다 . 개발자에게 실질적인 시사점은 명확합니다. V4-Pro에 안정적이고 캐시 친화적인 프롬프트 구조를 적용하면 실효 입력 비용을 캐시 히트 최저선 근처로 낮출 수 있으며, 미국 플래그십 모델에서는 엄두도 못 냈던 다단계 에이전트 루프를 일상적인 워크로드로 전환할 수 있습니다.

샤오미 이후의 연쇄 반응: 인하한 곳과 하지 않은 곳

샤오미는 DeepSeek의 영구 인하를 업계 전체의 사건으로 만들었다. 2026년 5월 27일부터 MiMo-V2.5 전 시리즈의 API 가격을 최대 99% 인하하고, 기존 고객에게는 동일한 비용으로 5~8배 더 많은 크레딧을 제공했다 . '최대 99%'는 가장 공격적인 티어의 상한선이지, 평균이 아니다. 이후 전개될 모든 것의 기준점이 됐다.

이 사건이 설정한 경계선은 출력 100만 토큰당 1달러 미만이며, 각 기업은 이 선을 넘었는지 여부에 따라 명확히 갈렸다. 움직인 곳들:

  • 샤오미 MiMo V2 Flash: 100만 토큰당 입력 약 $0.09 / 출력 $0.29로, OpenRouter 트래픽의 약 21.1%를 차지한다(주간 약 4.21조 토큰) .
  • 알리바바 Qwen 3.5 Flash: 100만 토큰당 입력 약 $0.065 / 출력 $0.26로, 입력 가격에서는 샤오미보다도 낮다 .
  • 바이두 Ernie: 최신 라인업 가격을 인하하고 일부 경량 모델은 무료로 전환했다 .

눈에 띄는 두 곳은 이 선 위에 머물렀다. Zhipu의 GLM 5.1은 출력 100만 토큰당 약 $4.40, Moonshot의 Kimi K2.6은 약 $4.00으로, 둘 다 DeepSeek의 약 $0.87 출력과 샤오미의 $0.29보다 확연히 높다 . 대용량 트래픽을 라우팅하는 개발자 입장에서 이 차이는 반올림 오차가 아니라 라우팅 결정이다: Qwen Flash에서 몇 센트에 불과한 멀티스텝 에이전트 루프가 GLM 5.1에서는 같은 토큰 수에 몇 달러가 될 수 있다.

기업별 패턴이 중요한 이유는 이 연쇄 반응이 업계 전체의 제로 경쟁이 아니기 때문이다. 2026년 초 Zhipu는 API 가격을 83% 인상했고, 2026년 3월 18일 알리바바는 수요가 인프라를 초과하자 AI 컴퓨팅 가격을 최대 34% 올렸다 . 이러한 역전이 핵심을 드러낸다: 인하가 프로모션이거나 용량 제약 때문이었던 곳은 가동률이 높아지자마자 가격이 원상 복귀했다. 개발자를 위한 교훈: 각 공급자의 가격을 독립적이고 용량에 종속된 신호로 봐야 한다. '다섯 곳 모두 하락세'라고 가정하지 말고, 모델별 실시간 요금을 직접 확인하라.

2026년 중국 AI 기업별 토큰 요금표

DeepSeek cut to $0.87/M. US equivalents stayed at $15.

2026년 중반 기준, 중국의 주요 및 경량 LLM 티어는 미국 공시가보다 훨씬 낮게 형성되어 있지만, 기업 간 격차는 크다. DeepSeek의 1달러 미만 플래그십 출력부터 미국 수준에 가까운 Zhipu·Moonshot 요금까지 다양하다. 아래 표는 조사에서 수집한 100만 토큰당 공시 요금을 정리한 것으로, 개발자들이 가장 자주 비교 기준으로 삼는 미국 두 곳의 요금도 함께 담았다. 워크로드 규모 산정을 위한 스냅샷으로 활용하되, 계약 기준으로 삼지 말 것: 일부 수치는 프로모션 일정에 따라 변동된다.

기업플래그십 / 모델입력 $/백만 토큰출력 $/백만 토큰컨텍스트캐시 히트 입력 $/백만 토큰
DeepSeekV4-Pro$0.435$0.87$0.003625
DeepSeekV4-Flash$0.14$0.281M
XiaomiMiMo V2 Flash$0.09$0.29
AlibabaQwen 3.5 Flash$0.065$0.26
BaiduERNIE-Lite-Pro-128KRMB 0.0002 / 1KRMB 0.0004 / 1K128K
ZhipuGLM 5.1~$4.40
MoonshotKimi K2.6~$4.00
OpenAI (참고)GPT-5.4$2.50$15.00
Anthropic (참고)Claude Opus 4.6$5.00$25.00

DeepSeek V4-Pro는 공격적인 가격대의 기준점이다: 영구 할인 적용 후 100만 토큰당 입력 $0.435, 출력 $0.87이며, 캐시 히트 입력 요금은 약 $0.003625로, 캐시 미스와 캐시 히트 입력 간 약 120배 차이가 나 프롬프트가 안정적인 에이전트 설계에 직접적인 이점을 제공한다 . 더 저렴한 V4-Flash는 $0.14 / $0.28로, 100만 토큰 컨텍스트 윈도우를 제공한다 .

경량 티어는 더 낮다. 샤오미의 MiMo V2 Flash는 100만 토큰당 약 $0.09 / $0.29, 알리바바의 Qwen 3.5 Flash는 약 $0.065 / $0.26이다 . 바이두는 ERNIE-Lite-Pro-128K를 1K 토큰당 위안(RMB) 단위로 공시하며(입력 RMB 0.0002, 출력 RMB 0.0004), 일부 경량 버전은 완전 무료로 전환했다 .

모든 중국 플래그십 모델이 저가인 건 아니다. Zhipu의 GLM 5.1(출력 ~$4.40)과 Moonshot의 Kimi K2.6(~$4.00)은 DeepSeek의 ~$0.87에 비하면 경쟁력이 낮아 보이지만, 여전히 GPT-5.4($15.00)와 Claude Opus 4.6($25.00)보다는 낮다 . 워크로드를 확정하기 전 실무상 주의사항: 이 수치는 여러 보고서에서 수집한 공시 금액이며, 단위 체계가 다를 수 있다(백만 단위 vs. 1K 단위, 캐시 히트 vs. 캐시 미스). 라이브 카탈로그가 이미 여러 2026년 전/후 비교 표를 덮어쓴 사례가 있으므로, 각 기업의 공식 요금 페이지에서 모든 요금을 직접 확인하라 .

OpenRouter 트래픽의 45%를 차지한 중국 AI: 공급 방정식이 기울어진 경위

가격 전쟁에서 수요 측면의 가장 뚜렷한 신호는 OpenRouter의 트래픽 구성이다. 중국 모델의 토큰 소비 비중은 2025년 초 2% 미만에 불과했으나, 2026년 4월에는 45%를 넘어섰다 . 이는 플랫폼 역사상 가장 빠른 공급 측 집중도 변화이며, 과반선을 순식간에 돌파했다. 중국 모델은 2026년 2월경 OpenRouter 전체 소비량에서 미국 경쟁사를 앞질렀다고 알려진다 . 저렴한 토큰은 벤치마크를 이기는 데 그치지 않았다. 대규모 라우팅 결정을 통째로 가져갔다.

이 성장의 상당 부분을 한 공급자가 독식했다. 2026년 2분기 기준 샤오미 단독으로 OpenRouter 트래픽의 약 21.1%를 차지했으며, 이는 주간 약 4.21조 토큰으로 같은 플랫폼에서 OpenAI 점유율의 약 3배에 달한다 . 경쟁 구도는 연쇄 재편 이후 약 10개의 주요 사업자로 압축되었다: 샤오미, 알리바바, 즈푸, DeepSeek, 문샷, 미니맥스, StepFun, 바이트댄스, 바이두, 텐센트 .

OpenRouter 지표 (2026년 2분기)수치
중국 모델 점유율, 2025년 초2% 미만
중국 모델 점유율, 2026년 4월45% 초과
샤오미의 플랫폼 트래픽 점유율~21.1% (~주간 4.21조 토큰)
샤오미 대 OpenAI 점유율약 3배 더 큼
재편 후 주요 사업자 수~10

수요는 용도별로 고르게 분산되지 않는다. 토큰당 가격 격차가 대규모로 복리 효과를 내는, 사용량이 많고 가격 탄력성이 높은 범주에 집중된다. 챗봇, 고객 서비스 자동화, 코딩 도구, 그리고 멀티스텝 에이전트에 공급되는 검색 증강 생성(RAG) 파이프라인이 그 예다 . 이러한 워크로드는 세션당 수백만 개의 토큰을 생성하는 작업이다. 따라서 미국 주력 모델 대비 4~8배의 출력 가격 차이는 반올림 오차가 아니라 곧바로 라우팅 기본값으로 이어진다. 경제적 논리는 프롬프트가 안정적이고 캐시 친화적인 아키텍처에도 보상을 안긴다. 이는 에이전트 루프가 매 단계마다 비용을 다시 치르는 대신 캐시된 프리픽스를 재사용할 수 있도록 하는 컨텍스트 엔지니어링 원칙과 같다 (video: Robert Ta).

"DeepSeek이 가격 전쟁을 시작했다. 이제 모든 중국 AI 연구소가 뛰어들고 있으며, 경쟁의 초점이 가장 똑똑한 모델 구축에서 최저 비용 서비스 제공으로 이동했다," — 업계 분석 (source: Technology.org, 2026-02).

이 수치를 결론으로 받아들이기 전에 주의할 점이 있다. OpenRouter 점유율은 하나의 어그리게이터를 통해 라우팅된 토큰 양을 측정할 뿐, 엔터프라이즈 매출이나 생산 동등성을 나타내지 않는다. 이는 가격 민감도가 높고 처리량이 많은 트래픽이 어디로 흐르는지를 추적하는 상품화의 선행 지표일 뿐이다. 저렴한 토큰이 동등한 토큰이라는 증거는 아니다.

지속 가능성의 문제: 보조금 기반 확장인가, 수익성 있는 마진인가?

DeepSeek cut to $0.87/M. US equivalents stayed at $15.

지속 가능성 문제는 두 부분으로 나뉜다. 제로에 가까운 요금제가 수익성 있는 운영인가, 아니면 개발자 확보를 위한 보조금인가. 그리고 보조금이 끝날 때 무엇이 재가격화되는가. 솔직히 말하자면, 두 가지 힘이 동시에 작동하고 있다. 바이두는 최신 Ernie를 인하하고 일부 경량 버전을 무료로 제공했으며 , 샤오미는 2026년 5월 27일부터 기존 MiMo-V2.5 고객에게 동일한 가격에 5~8배 많은 사용 크레딧을 제공했다. 이는 마진이 아닌 고객 확보 전략으로 읽히는 행보다 .

반대 신호는 구조적 측면에 있으며, 어떤 프로모션이 끝나도 살아남는 하한선을 설정하기 때문에 중요하다. DeepSeek의 Mixture-of-Experts 설계는 토큰당 2360억 파라미터 중 210억만 활성화하고, KV 캐시를 93.3% 줄이며, 밀집(dense) 전임 모델 대비 최대 생성 처리량을 5.76배 높인다고 보고한다 . 이는 만료일이 있는 할인이 아니라 구조적 단위 경제 이득이다. 그래서 DeepSeek은 V4-Pro의 75% 인하를 롤백하지 않고 영구적으로 유지할 수 있었다 . 실제로 서비스 비용이 낮은 연구소는 낮은 가격을 유지할 수 있지만, 보조금으로 가격을 낮추는 연구소는 그럴 수 없다.

모든 연구소가 버틴 것은 아니었다. 알리바바는 수요가 인프라를 초과하자 2026년 3월 18일 AI 컴퓨팅 가격을 최대 34% 인상했고, 즈푸는 올해 초 API 가격을 83% 올렸다 . 이러한 반전이 핵심 신호다. 인하가 프로모션이었거나 용량 제약에 의한 것이었다면, 가동률이 높아지는 순간 가격이 원상 복귀했다. 한 컨텍스트 엔지니어링 전문가가 빌더의 리스크를 이렇게 표현했다. "가장 저렴한 토큰은 공급자가 당신의 트래픽을 원하는 동안만 저렴하다. 아키텍처는 요금제가 바뀐다는 전제를 깔아야 한다" (video: Robert Ta).

유력한 균형점은 붕괴가 아닌 이분화다. 무료에 가까운 요금제는 온보딩 도구로 존속하고, 고동시성 SLA 보장 용량은 실제 비용을 향해 위쪽으로 재가격화된다. 개발자 입장에서 조기 경보 지표는 헤드라인 출력 요금이 아니라 무료 요금제의 공개 속도 제한이다. 분당 요청 상한 축소, 컨텍스트 한도 하향, 또는 무료 레벨의 새로운 처리량 스로틀에 주목하라. 이러한 변화는 보통 가격 변동에 앞서 나타나며, 해당 연구소가 모델을 확보 단계에서 수익화 단계로 전환하고 있다는 신호다. 여기에 DeepSeek의 캐시 히트 입력 요금인 백만 토큰당 약 $0.003625를 더하면 , 프롬프트가 안정적인 에이전트 설계에 보상을 주며, 합리적인 해석은 구조적 비용 선도자는 낮은 가격을 유지하는 반면, 보조금 기반 요금제는 그 위에 구축하기 전에 먼저 검증해야 한다는 것이다.

품질 동등성 문제: 싼 토큰이 같은 토큰은 아니다

저렴한 토큰은 동등한 토큰이 아닙니다. 토큰당 가격은 비용의 한 차원만 포착할 뿐, 전반적인 적합성을 반영하지 않습니다. 컨텍스트 창 길이, 도구 호출 지원, 동시성 한도, 안전 필터링 동작, 데이터 보관 조건은 중국 AI 업체들 사이에서 충분히 다르기 때문에, 같은 표면 요금의 두 엔드포인트가 실제 운영 경제학에서는 전혀 다른 결과를 낼 수 있습니다. 예를 들어 DeepSeek-V4-Flash는 백만 토큰당 입력 $0.14 / 출력 $0.28 요금과 함께 1M 토큰 컨텍스트 길이를 내세우는 반면 , Baidu의 Qianfan에서 제공하는 ERNIE-Lite-Pro-128K 같은 경량 티어는 컨텍스트와 성능을 낮춰 더 저렴한 가격을 제공합니다 . 토큰 요금만으로는 어떤 것이 실제 워크로드에 맞는지 거의 알 수 없습니다.

벤치마크 검증이 두 번째 간극입니다. 일부 중간 규모 중국 AI 업체들에 대한 독립적인 리더보드 커버리지는 드물고, '5개 업체 동시, 최대 99%'라는 표현은 이미 벤더 서사가 복잡한 현실을 얼마나 압축하는지 보여 줍니다. 99% 수치는 2026년 5월 27일 Xiaomi의 MiMo-V2.5 인하에서 비롯된 것으로, 모든 모델이 아닌 특정 공격적 경쟁사와 경량 티어에 한정됩니다 . 벤더가 인용하는 벤치마크도 같은 방식으로 다루십시오. 수치를 그대로 받아들이는 대신, 고위험 워크로드에 투입하기 전에 서드파티 평가와 교차 검증하십시오.

운영 조건이 세 번째 간극입니다. 지연 시간 프로파일과 가동 시간 SLA는 이들 제공업체에서 일관되게 공개되지 않으며, 이는 지연에 민감하거나 규제를 받는 애플리케이션에서 실질적인 문제입니다. 중국 클라우드의 지리적 위치로 인한 왕복 오버헤드는 어떤 가격표에도 반영되지 않습니다. 동일한 주의가 캐시 경제학에도 적용됩니다. DeepSeek의 캐시 히트 입력 요금인 백만 토큰당 약 $0.003625 는 실제로 프롬프트 구조가 캐시 친화적일 때만 실현됩니다.

실용적인 시사점은 이렇습니다. 일반적인 벤치마크를 믿는 대신 실제 워크로드를 후보 엔드포인트에 직접 돌려 보고, 절감 효과를 추산하기 전에 캐시 요금이 특정 프롬프트에 실제로 적용되는지 확인하십시오. 컨텍스트 엔지니어링 실무자들도 같은 말을 합니다. 표면 요금을 실제 마진으로 전환하는 것은 안정적이고 캐시 정렬된 프롬프트입니다 (video: Robert Ta). 중국 주력 모델들이 출력 토큰 기준으로 GPT-5.4($2.50/$15.00)와 Claude Opus 4.6($5.00/$25.00)보다 4~8배 저렴할 때 , 절감 효과는 마이그레이션 전 일주일간의 측정을 정당화할 만큼 충분히 큽니다. 하지만 측정을 건너뛸 만큼 크지는 않습니다.

자주 묻는 질문

DeepSeek의 V4-Pro 75% 할인은 장기적으로 확정된 건가요?

네. 2026년 5월 22~23일, DeepSeek는 V4-Pro 프로모션 할인을 철회하지 않겠다고 공식 확인하며 영구 적용을 선언했습니다 . 현재 정가는 입력 토큰 100만 개당 약 $0.435, 출력 토큰 100만 개당 $0.87로, 2026년 4월 24일 출시 당시의 $1.74 / $3.48에서 인하된 수준입니다 . 캐시 적중 입력은 100만 토큰당 약 $0.003625로 고시되어 있습니다 . 가격은 예고 없이 변경될 수 있으므로 DeepSeek 공식 요금 페이지에서 최신 요금을 반드시 확인하세요.

2026년 기준 중국 AI 토큰 가격은 미국 AI 업체와 비교하면 어느 정도인가요?

2026년 중반 기준, 중국 주요 모델은 입력 기준 약 2.5~5배, 출력 기준 약 4~8배 저렴합니다 . DeepSeek V4-Pro의 출력 비용은 100만 토큰당 $0.87인 반면, GPT-5.4는 $15.00, Claude Opus 4.6은 $25.00입니다 . 다만 격차가 일정하지는 않습니다. Zhipu의 GLM 5.1(출력 100만 토큰당 약 $4.40)과 Moonshot의 Kimi K2.6(약 $4.00)은 DeepSeek보다 훨씬 높고, 일부 저가 미국 서비스보다도 비쌉니다 .

Xiaomi의 99% 가격 인하가 모든 모델 변형에 적용되나요?

아닙니다. 이번 인하는 2026년 5월 27일부터 MiMo-V2.5 시리즈에 적용되며, "최대 99%"라는 수치는 가장 공격적인 인하 케이스의 상한선일 뿐, 전 변형에 걸친 일률적인 평균이 아닙니다 . 기존 사용자는 동일 요금으로 5~8배 더 많은 크레딧을 지급받기도 했습니다 . 구체적으로는 MiMo V2 Flash 티어가 입력 100만 토큰당 약 $0.09, 출력 100만 토큰당 $0.29 수준에 책정되었습니다 .

중국 AI 토큰 가격은 지속 가능한 건가요, 아니면 일시적인 보조금인가요?

신호가 엇갈립니다. DeepSeek의 Mixture-of-Experts 설계(전체 2,360억 파라미터 중 토큰당 210억만 활성화, KV 캐시 93.3% 축소, V2 논문 기준 생성 처리량 5.76배 향상)는 낮은 추론 가격을 뒷받침하는 실질적인 구조적 비용 우위를 제공합니다 . 그러나 일부 업체의 제로(0)에 가까운 요금은 수익성보다 개발자 확보를 위한 보조금에 가까워 보입니다. Alibaba는 2026년 3월 18일 AI 컴퓨팅 가격을 최대 34% 인상했으며, Zhipu도 경영상 이유로 연초 API 가격을 83% 올린 바 있습니다 . "제로를 향한 경쟁"이라는 표현은 지나친 단순화입니다.

중국 AI 엔드포인트를 선택할 때 토큰 가격 외에 무엇을 살펴봐야 하나요?

저렴한 토큰이 동등한 토큰을 의미하지는 않습니다. 마이그레이션 전에 컨텍스트 윈도우 길이, 도구 호출 지원 여부, 동시 요청 및 속도 제한, 안전 필터 동작 방식, 데이터 레지던시, 가동 시간 SLA를 종합적으로 검토하세요 . 중간 규모 중국 모델의 경우 제3자 검증이 부족하거나 없는 경우가 많으므로, 벤더 수치보다 독립적인 리더보드로 벤치마크를 확인하세요 . 가장 믿을 수 있는 검증 방법은 헤드라인 가격이 아닌, 챗봇·RAG·멀티스텝 에이전트 등 실제 목표 워크로드를 직접 실행해 과제 해결 건당 비용을 측정하는 것입니다.