OpenAI가 GPT-5.6을 출시하면서 조용한 기본값 하나를 넣었습니다. 이 설정 때문에 청구액이 아무 경고 없이 두 배가 될 수 있습니다. 단독 문자열 gpt-5.6은 모델이 아니라 별칭이며, 이 제품군에서 가장 비싼 티어를 가리킵니다.
gpt-5.6이 실제로 가리키는 것, 그리고 예상 청구액이 두 배가 되는 이유
gpt-5.6 별칭은 플래그십 티어인 gpt-5.6-sol로 라우팅됩니다. 따라서 특정 티어를 고정하지 않은 팀은 이미 Sol 요금을 내고 있으며, 응답 페이로드 어디에도 이를 알려주는 표시가 없습니다 . Sol은 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 30달러입니다. 그래서 1k 입력/1k 출력의 캐시 미적용 호출은 약 0.035달러가 들며, 저비용 Luna 티어의 약 0.007달러와 비교하면 동일한 페이로드에서 5배 차이가 납니다 .
숫자 5.6은 세대를 뜻합니다. 티어 이름인 Sol(플래그십), Terra(균형형), Luna(빠르고 저렴함)는 각자 다른 주기로 바뀌므로, 릴리스가 바뀌는 동안 기본값도 사용자가 모르는 사이 달라질 수 있습니다 . GPT-5.6은 2026년 7월 9일 ChatGPT, Codex, GitHub Copilot, OpenAI API 전반에서 정식 제공되기 시작했습니다 .
Sol, Terra, Luna 요금대는 0.007~0.035달러, Artificial Analysis 기준 속도는 69~211 tok/s

세 티어는 깔끔하게 2배씩 가격 차이가 나고, 속도는 그 반대로 움직입니다. 티어가 저렴할수록 생성 속도는 더 빠릅니다. 토큰 100만 개 기준으로 Sol은 입력 5달러 / 출력 30달러, Terra는 2.50달러 / 15달러, Luna는 1달러 / 6달러입니다. 가장 위와 아래의 차이는 5배입니다 . 1k 입력/1k 출력의 캐시 미적용 호출로 보면 대략 Sol 0.035달러, Terra 0.0175달러, Luna 0.007달러입니다 . 월 5,000만 입력 토큰 + 1,000만 출력 토큰으로 키우면 각 티어는 각각 약 550달러, 275달러, 110달러 수준입니다 .
| 티어 | 입력 / 출력(100만 개당) | 1k/1k 호출 | Artificial Analysis: tok/s(Intelligence Index, 순위) |
|---|---|---|---|
| Sol | $5 / $30 | ~$0.035 | 69.3 tok/s (59, #2/188) |
| Terra | $2.50 / $15 | ~$0.0175 | 140.8 tok/s (55, #6/188) |
| Luna | $1 / $6 | ~$0.007 | 211.6 tok/s (51, #15/188) |
처리량은 Artificial Analysis 하네스 기준입니다(API SLA가 아니라 출력 토큰/초). Sol은 69.3 tok/s, Terra는 140.8 tok/s, Luna는 211.6 tok/s로 측정됐습니다 . 이 역전 구조는 의도된 것입니다. Sol이 가장 느린 이유는 추론에 훨씬 더 많은 출력 토큰을 쓰기 때문이며, 출력 토큰은 청구서에서도 비싼 쪽입니다 .
반복되는 프리픽스에서는 캐싱이 격차를 줄입니다. 캐시된 입력은 100만 개당 Sol 0.50달러, Terra 0.25달러, Luna 0.10달러입니다. 다만 캐시 쓰기는 캐시 미적용 입력 요금의 1.25배로 청구되며, GPT-5.6에는 명시적 캐시 중단점과 최소 30분 캐시 수명이 추가됐습니다 . 라우팅 기준으로 삼지 말아야 할 것은 용량입니다. 세 티어 모두 1,050,000토큰 컨텍스트 창, 최대 128K 출력, 2026년 2월 16일 지식 기준일, 그리고 웹 검색, 파일 검색, 코드 인터프리터, 컴퓨터 사용, MCP 등 동일한 Responses API 도구 접근 권한을 공유합니다 . 판단 축은 성능, 비용, 지연 시간, 위험이지 컨텍스트나 모달리티가 아닙니다.
별칭을 명시적으로 바꾸기: gpt-5.6-terra 또는 gpt-5.6-luna로 교체

기본값을 덮어쓰는 방법은 문자열 하나를 바꾸는 것입니다. model 필드에 Sol로 해석되는 단독 gpt-5.6 별칭 대신 gpt-5.6-terra 또는 gpt-5.6-luna를 넣으면 됩니다 . 달라지는 것은 티어 이름뿐입니다. 요청 형태, 컨텍스트 창, 도구 접근 권한은 세 티어 모두 동일합니다. 바뀌는 것은 청구액과 지연 시간 프로필입니다.
gpt-5.6-luna는 약간의 품질 손실을 받아들일 수 있는 고볼륨, 지연 시간 민감 경로에 라우팅하세요. 분류, 추출, 라우팅, 요약, 가드레일 사전 점검, 검색 쿼리 재작성, 초안 작성 등이 여기에 해당합니다 . 문서가 많은 종합 작업은 Luna로 보내지 마세요. MRCR 장문 컨텍스트 회상률이 41.3%까지 떨어지며, 이는 다음 섹션에서 다룹니다.
gpt-5.6-terra를 일반 프로덕션 기본값으로 두세요. 에이전트형 SaaS, 일반적인 코딩, 엔터프라이즈 RAG 문서 QA, 중간 수준의 중요도를 가진 지원 업무에 적합합니다. Agents' Last Exam에서 Terra는 Sol의 52.7% 대비 50.4%를 기록해, 비용은 절반이면서 점수 차이는 약 2~3포인트 안쪽에 머뭅니다 (100만 토큰당 Terra 입력 2.50달러 / 출력 15달러, Sol 입력 5달러 / 출력 30달러).
티어 선택 위에 요청 단위 레버 두 가지를 더 쌓을 수 있습니다. 사용자 대면 경로에서는 일관된 낮은 지연 시간을 위해 service_tier="priority"를 추가하세요. 트래픽이 1M TPM을 넘고 그중 50% 초과가 임의의 15분 창 안에 들어오면 자동으로 Standard로 낮아집니다. 오프라인 평가, 마이그레이션, 대량 보강 작업은 Batch API로 보내면 비용을 50% 낮추고 24시간 내 처리할 수 있습니다. 요청당 최저가를 원한다면 Luna와 함께 쓰세요.
OpenAI의 지연 시간 가이드에 따르면, "출력 생성이 지연 시간의 대부분을 차지합니다. 출력 토큰을 50% 줄이면 지연 시간도 대략 50% 줄어들 수 있고, 체감 대기 시간을 약 1초 수준으로 낮추는 데는 스트리밍이 가장 효과적입니다" (source: Simon Willison, 2026-07).
gpt-5.6-sol, 그리고 max와 ultra 추론 레버는 정확성이 비용보다 훨씬 중요한 곳에만 남겨두세요. 깊은 코딩 에이전트, 보안 분석, 컴퓨터 사용, 장기 연구가 여기에 해당합니다. Sol의 Intelligence Index는 59로 Terra의 55보다 높으며, 이 정량화된 격차를 사기 위해 2배 프리미엄을 내는 것입니다.
Luna의 MRCR 41.3%와 Sol의 심층 사고 추가 비용

Luna의 토큰당 할인은 작업에 긴 컨텍스트 회상이 필요한 순간 사라집니다. MRCR 벤치마크에서 Luna는 Sol의 91.5%, Terra의 89.6%에 비해 겨우 41.3%를 기록합니다. 이는 완만한 절충점이 아니라 분명한 상한선입니다. 긴 컨텍스트에서 대략 40번째 백분위 이후의 정보에 의존하는 경로, 즉 다중 문서 종합, 심층 RAG, 긴 녹취록 요약은 사실을 조용히 놓치게 됩니다. Luna의 표면 가격과 관계없이 이런 작업은 Terra나 Sol로 라우팅하세요.
Luna는 출력도 장황합니다. Artificial Analysis는 Intelligence Index 전반에서 Luna가 1억 3천만 개의 출력 토큰을 생성했다고 기록했습니다. 기준 평균은 6천만이었습니다. 출력은 청구서에서 비싼 절반을 차지하므로, 제한 없는 completion은 $1/$6의 이점을 지워버릴 수 있습니다. Luna를 저가 티어로 보기 전에 출력 상한, 엄격한 구조화 출력 스키마, 스트리밍을 강제하세요.
"The single biggest lever on both latency and cost is output length — cutting output tokens by 50% may cut latency by roughly 50%," — OpenAI latency guidance, summarized by Simon Willison (source: simonwillison.net, 2026-07).
제품군의 최상단에서는 Sol의 추론 레버에도 별도 추가 비용이 붙습니다. max는 더 긴 사고 시간을 사고, ultra는 병렬 서브에이전트 전반으로 작업을 확산합니다. 둘 다 출력 토큰을 가파르게 늘립니다. Sol Ultra는 몇몇 벤치마크 점수를 얻기 위해 단일 에이전트 Sol 대비 대략 3배의 토큰 비용을 추가할 수 있으므로, 정확성이 가장 중대한 작업에만 남겨두세요. 그리고 모든 티어에는 조용한 절벽이 하나 있습니다. 프롬프트가 272K 입력 토큰을 넘으면 전체 요청이 입력 2배, 출력 1.5배로 청구됩니다. 긴 문서나 심층 RAG 호출에서는 반드시 주시하세요.
계속 봐야 할 지표: TTFT, 성공률, 티어별 월 청구액
라우팅은 한 번 정하고 끝나는 결정이 아니므로 계측해야 합니다. 워크로드마다 다섯 가지 신호를 추적하세요. 작업 성공률, 하드 상한 대비 출력 토큰 수, time-to-first-token, 전체 지연 시간, 총 월간 비용입니다. 호출당 가격만 보면 오해하기 쉽습니다. Luna의 장황함(Artificial Analysis는 Intelligence Index 전반에서 평균 6천만 개 대비 1억 3천만 개의 출력 토큰을 측정했습니다 )과 Sol의 추론 오버헤드를 숨기기 때문입니다. 둘 다 청구서의 비싼 출력 측에 반영됩니다.
워크로드를 한 티어 올리는 일은 증거가 있을 때만 하세요. 측정된 성공률이 허용 기준 아래로 떨어지거나, 오류가 사람의 재작업을 유발할 때입니다. 감으로 올리면 안 됩니다. Agents' Last Exam의 격차는 2.3점에 불과합니다(Sol 52.7% vs Terra 50.4%) . 그래서 대부분의 팀에는 Terra가 올바른 기본값입니다. 마지막으로, 프롬프트 캐싱은 반복 prefix에서 입력 비용을 최대 90%까지 줄일 수 있지만, 1.25배의 캐시 쓰기 추가 비용과 30분의 최소 캐시 수명을 감안해 순이익을 계산해야 합니다 . 결론은 이렇습니다. 기본은 Terra로 두고, 별칭은 명시적으로 고정하며, 각 요청이 어디에서 실행될지는 `gpt-5.6` 기본값이 아니라 워크로드별 평가가 결정하게 하세요.
자주 묻는 질문
gpt-5.5에서 gpt-5.6으로 옮기면 요금이 자동으로 오르나요?
그렇지는 않습니다. 별도의 모델명을 붙이지 않은 gpt-5.6 별칭을 넘길 때만 그렇습니다. 이 별칭은 100만 토큰당 입력 $5 / 출력 $30인 gpt-5.6-sol로 해석되며, 1k/1k 호출 기준 약 $0.035입니다. Terra는 GPT-5.5 세대를 기능적으로 대체하도록 만든 모델이며 비용은 대략 절반 수준입니다($2.50 / $15). 비용을 거의 중립적으로 유지하려면 gpt-5.6-terra를 명시적으로 넘기세요.
Sol max나 ultra는 언제 추가 비용을 낼 만한가요?
실패했을 때 바로잡는 비용이 큰, 정확도가 가장 중요한 경로에만 남겨두세요. 깊은 코드 리뷰, 보안 감사, 과학적 평가가 여기에 해당합니다. max는 Sol이 추론할 시간을 더 주고, ultra는 병렬 하위 에이전트로 작업을 분산해 벤치마크 몇 점을 위해 단일 에이전트 Sol 대비 대략 3배의 토큰 비용이 추가될 수 있습니다 (Vellum). 둘 중 어느 것도 전체 기본값으로 설정해서는 안 됩니다.
Luna는 토큰당 가격이 낮은데도 왜 예상보다 비싸질 수 있나요?
출력이 길어지면 할인 효과가 상쇄됩니다. Artificial Analysis는 Luna가 Intelligence Index에서 평균 60M에 비해 130M 출력 토큰을 사용했다고 측정했습니다 (Artificial Analysis). 출력이 청구액에서 비싼 절반을 차지하므로, Luna의 낮은 $1 / $6 요율도 길이에 일부 잠식될 수 있습니다. 출력 길이에 강한 상한을 걸고, 엄격한 구조화 스키마로 반환하게 하며, 스트리밍을 사용하세요.
정확히 무엇이 272K 토큰 과금 절벽을 발생시키나요?
입력이 272K 토큰을 초과하는 단일 요청은 전체 요청에 대해 입력 2배, 출력 1.5배로 청구됩니다. 초과분만이 아닙니다 (OpenAI). 이는 Sol, Terra, Luna에 동일하게 적용되며, 세 모델 모두 1,050,000토큰 컨텍스트 창을 공유합니다. 긴 문서 RAG와 기록을 누적하는 깊은 컨텍스트 에이전트 루프에서 특히 주의하세요.
Terra가 일반 프로덕션 용도로 Sol을 대체해도 충분한가요?
대부분의 워크로드에서는 그렇습니다. Agents' Last Exam에서 격차는 작습니다. Sol 52.7%, Terra 50.4%로, Terra를 기본값으로 삼자는 핵심 근거가 됩니다 (OpenAI). 코딩(Coding Agent Index 80 대 77.4)과 보안(SEC-Bench Pro 71.2% 대 57.7%)에서는 격차가 더 벌어집니다. Sol 요율을 확정하기 전에 실제 워크로드로 평가를 돌려보세요.
이 글이 도움이 되셨다면, 새 글이 올라올 때마다 이메일로 받아보세요.