1.5를 60단어로 요약하면: 한 번에 생성되는 사운드, 1080p, 정지 사진 애니메이션에 집중
Grok Imagine Video 1.5는 xAI의 이미지-투-비디오 모델입니다. 소스 이미지를 넣으면 그 이미지가 첫 번째 프레임이 되고, 텍스트 프롬프트가 움직임을 이끕니다 . 기본 grok-imagine-video 슬러그와 비교해 구체적으로 추가된 것은 두 가지입니다. 별도 단계가 아니라 같은 생성 과정에서 만들어지는 동기화 오디오, 즉 대사, 효과음, 음악과, 기존 모델에는 없는 새로운 1080p 해상도 티어입니다 .
API에서는 세 가지 식별자로 노출됩니다 :
grok-imagine-video-1.5— 안정 aliasgrok-imagine-video-1.5-preview— 모델 페이지에 아직 표시되는 항목grok-imagine-video-1.5-2026-05-30— 날짜가 붙은 스냅샷
xAI는 모델 페이지에 초당 1회 요청 제한을 문서화해 두었습니다 . 2026년 6월 중순 출시 보도들은 1.5를 정식 출시 모델로 설명했지만, -preview alias가 계속 남아 있어 "프리뷰 종료"라는 주장에는 애매함이 있습니다. 문서 슬러그 자체도 그렇게 말하지 않습니다 .
기존 애니메이션 슬러그보다 60~100% 비싼 1.5

업그레이드 비용은 고정 가격으로 문서화되어 있습니다. xAI는 grok-imagine-video-1.5 가격을 초당 $0.08(480p), 초당 $0.14(720p), 초당 $0.25(1080p), 그리고 입력 이미지당 $0.01로 제시합니다 . 기존 grok-imagine-video 슬러그는 더 저렴합니다. 초당 $0.05(480p), 초당 $0.07(720p), 이미지당 $0.002, 비디오 입력은 초당 $0.01입니다 .
따라서 1.5는 480p에서 약 60%, 720p에서 100% 정도 더 비쌉니다. 그리고 기본 모델에는 없는 1080p 티어를 열 수 있는 유일한 슬러그도 1.5입니다 .
| 티어 | grok-imagine-video-1.5 | grok-imagine-video (기본) | 프리미엄 |
|---|---|---|---|
| 480p / 초 | $0.08 | $0.05 | ~60% |
| 720p / 초 | $0.14 | $0.07 | ~100% |
| 1080p / 초 | $0.25 | n/a | 1.5 전용 |
| 이미지 입력 | $0.01 | $0.002 | — |
용량 계획을 세울 때는 초당 과금 모델이라 계산이 쉽습니다. 1.5에서 10초 렌더링은 이미지 입력 비용을 제외하고 $0.80(480p), $1.40(720p), $2.50(1080p)입니다 . 15초짜리 720p 클립은 출력 비용 약 $2.10에 이미지 $0.01이 더해져 총 $2.11 수준입니다 . 워크플로에 1080p나 한 번에 생성되는 오디오가 필요 없다면 기본 슬러그가 여전히 더 저렴한 경로입니다.
25초라는 문구: 재현 가능한 비동기 측정이 아니라 서드파티 설명
속도 이야기는 가격만큼 단단하지 않습니다. 출시 보도에 따르면 소비자용 "Video 1.5 Fast" 변형은 6초짜리 720p 클립을 약 25초에 렌더링하며, 이전 모델의 40초 이상에서 약 40% 줄었다고 합니다 . 이 수치는 공식 xAI 벤치마크가 아니라 기사성 설명에서 나온 것이므로 방향성 정도로 봐야 합니다.
xAI의 API 문서는 다른 시간 감각을 제시합니다. 비디오 생성은 비동기 방식이며, 프롬프트 복잡도, 길이, 해상도, 편집 오버헤드에 따라 달라지고 "일반적으로 최대 몇 분"이 걸린다고 설명합니다 . SDK 폴링 예시는 기본값으로 100ms 간격과 10분 타임아웃을 사용합니다. 30초 미만을 전제로 설계된 구조는 아닙니다 .
가장 깔끔한 정리는 이렇습니다. "25초"는 grok.com의 지연 시간을 줄인 Fast 변형을 가리키고, "몇 분"은 표준 비동기 API 작업을 가리킵니다. 같은 모델이지만 노출되는 표면이 다릅니다. 독립 보도도 경고하듯, 공급사의 속도 수치는 통제된 조건에서 측정되며 TechJack Solutions에 따르면 "not necessarily reflective of real-world performance"입니다.
xAI가 동일한 프롬프트, 길이, 해상도, 큐 상태, 지역 조건에서 1.5와 이전 모델을 비교한 공식 벤치마크는 없습니다. 그런 자료가 나오기 전까지는 API 용량을 제목의 숫자가 아니라 문서화된 "몇 분" 기준으로 잡는 편이 맞습니다.
한 번에 맞춰지는 사운드: 1.5에서 확인되는 가장 구체적인 추가 기능

1.5에서 가장 분명한 기능 업그레이드는 네이티브 동기화 오디오입니다. xAI의 출시 자료에 따르면 대사, 효과음, 주변음, 배경음악이 별도 후처리 단계로 덧붙는 것이 아니라 비디오와 같은 렌더링 과정에서 생성됩니다 . 이 단일 패스 설계가 속도나 가격 주장과는 별개로, 기능 수준에서 1.5를 이전 애니메이션 슬러그와 구분합니다.
xAI는 여기에 더 정성적이고 수치화되지 않은 주장도 함께 붙입니다:
- 개선된 립싱크와 음성 명료도
- 더 나은 물리감과 움직임의 그럴듯함
- 긴 클립 전반에서 더 강한 움직임 일관성
공식 문서에는 이 항목들에 대한 수치나 테스트 방법론이 없습니다 . 한 실무자 가이드는 모드와 무관한 한계를 지적합니다. 복잡한 브랜드 요소, 제품 패키징, 여러 특징이 있는 피사체의 세부 일관성은 카메라가 움직일 때 "shows drift during camera movement"라고 설명합니다 . 오디오 기능은 확인된 것으로 보되, 품질 주장은 공급사 주장으로 봐야 합니다. xAI가 이를 대조해 검증할 수 있는 1.5 기술 보고서, 학습 데이터 공개, 안전성 평가를 공개하지 않았기 때문입니다 .
Arena Elo 점수와 블라인드 테스트 순위의 한계
출시 보도에서는 Video 1.5가 블라인드 테스트에서 Sora 2, Google Veo 3.1, Seedance 2.0, Kling을 제치고 Image-to-Video Arena 리더보드 1위에 올랐다고 전했으며 , 별도 기사들도 이 리더보드 승리를 함께 전했습니다 . 다만 이는 확정 판정이 아니라 방향성을 보여주는 신호로 읽어야 합니다.
Arena 순위는 무작위로 짝지어진 출력물에 대한 블라인드 인간 선호도 투표에 기반합니다. 비교마다 프롬프트, 길이, 해상도가 표준화되어 있지 않고, 인용된 Elo 수치도 출처마다 다릅니다. 각각은 특정 시점의 리더보드 상태를 반영할 뿐입니다. 새 모델 제출물이 들어오면 점수는 바뀌므로, 오늘의 1위도 잠정적입니다.
"Vendor speed and ranking numbers are measured under controlled conditions" — 1.5 출시를 다룬 독립 보도 (source: TechJack Solutions).
통제된 조건에서 독립적으로 재현된 결과는 없으며, xAI도 arena 결과와 대조해 확인할 수 있는 표준화된 공개 벤치마크를 내놓지 않았습니다 . 이 순위는 확정적인 서열이 아니라, 인지된 시각 품질의 한 시점 스냅샷으로 봐야 합니다.
1.5에서 빠진 기능: 텍스트 프롬프트, 레퍼런스, 편집

Grok Imagine Video 1.5가 받는 입력 형태는 정확히 하나입니다. 정지 이미지와 텍스트 프롬프트를 함께 넣고, 그 원본 이미지가 첫 프레임이 됩니다. 텍스트-투-비디오, 레퍼런스-투-비디오, 영상 편집 또는 확장은 지원하지 않습니다. 이는 xAI 모델 페이지에 상시 제약으로 문서화된 내용이며, 일시적인 프리뷰 공백이나 API 특이사항이 아닙니다 .
따라서 라우팅 기준은 명확합니다. 아래 중 하나가 필요하다면 더 넓은 grok-imagine-video 슬러그로 돌아가야 합니다.
- 소스 이미지 없는 프롬프트만으로 생성하기(텍스트-투-비디오)
- 레퍼런스-투-비디오 조건 지정
- 기존 클립 확장 또는 편집
이 기본 모델은 1.5가 포기한 더 넓은 입력 범위를 제공합니다 .
이 축소는 신뢰·안전 팀에도 중요합니다. 2026년 1월, Internet Watch Foundation은 Grok Imagine으로 만들어진 미성년자 성적 이미지가 있다는 다크웹 주장을 언급했고, 이후 xAI는 이미지 생성을 주로 유료 구독자에게 제한했습니다 . 더 빠르고 마찰이 낮은 애니메이션 생성은 사용자 생성 영상을 수집하는 모든 플랫폼에서 대규모 악용 가능성을 키웁니다.
비동기 폴링, 1 rps 제한, 그리고 Priority Processing의 모호함
1.5를 통합한다는 것은 가격뿐 아니라 전달 방식까지 감안해 설계한다는 뜻입니다. 제출은 비동기 방식입니다. 작업을 보내고 xAI SDK를 통해 완료 여부를 폴링하며, 기본값은 100ms 폴링 간격과 10분 타임아웃입니다. 모델 페이지에는 초당 1개 요청 속도 제한이 적혀 있으므로, 동시 작업을 처리하려면 자체 큐 로직이 필요합니다. 기대어 쓸 수 있는 내장 배칭은 없습니다.
도입 전에 특히 주의해야 할 빈틈은 두 가지입니다.
- Priority Processing 적용 여부가 불명확합니다. xAI 문서에는 유료 Priority Processing이 비디오 엔드포인트를 포함하는지에 대해 일관되지 않은 설명이 있습니다. 확인 없이 1.5 작업에 적용된다고 가정하지 마세요.
- 대규모 처리량이 문서화되어 있지 않습니다. 이 슬러그에 대해 동시 부하 상황에서의 공식 지연 시간 수치는 없습니다. 따라서 벤더 수치가 아니라 자체 부하 테스트를 기준으로 용량을 계획해야 합니다.
핵심은 이렇습니다. 1.5는 인패스 오디오와 1080p 티어를 제공하는 대신 60~100%의 프리미엄을 요구하며, 검증되지 않은 우선 처리와 공개되지 않은 스케일링 동작을 지닌 1 rps 비동기 파이프라인을 함께 떠안게 됩니다. 프로덕션을 걸기 전에 실제 큐 환경에서 먼저 프로토타입을 돌려보세요.
자주 묻는 질문
grok-imagine-video-1.5는 텍스트 프롬프트만으로 영상을 만들 수 있나요?
아니요. grok-imagine-video-1.5 슬러그는 이미지-투-비디오 전용입니다. 첫 프레임이 될 정지 이미지를 반드시 제공하고, 움직임을 지시하는 텍스트 프롬프트를 함께 넣어야 합니다 . 프롬프트만으로 생성하기, 레퍼런스-투-비디오, 편집 또는 확장은 1.5에서 지원되지 않습니다. 이런 워크플로에는 여전히 더 넓은 범위의 grok-imagine-video 기본 모델이 필요합니다 .
grok-imagine-video-1.5 가격은 기본 모델과 얼마나 다른가요?
확실히 더 비쌉니다. 1.5의 정가 기준 가격은 480p에서 초당 $0.08, 720p에서 초당 $0.14입니다. 기본 grok-imagine-video 모델의 $0.05 및 $0.07/초와 비교하면 480p에서는 약 60%, 720p에서는 100% 더 높은 수준입니다 . 비용을 지불하고 얻는 독점 기능은 1080p 티어뿐이며, 가격은 초당 $0.25입니다. 이 티어는 기본 모델에서 제공되지 않습니다 .
API로 grok-imagine-video-1.5 작업을 돌리면 실제로 얼마나 걸리나요?
공식 문서는 모호합니다. 생성은 비동기 방식이며 “보통 최대 몇 분까지 걸린다”고 설명하고, 프롬프트 복잡도, 길이, 해상도에 따라 달라진다고 밝힙니다 . 널리 인용되는 6초짜리 720p 클립을 약 25초 만에 만든다는 수치는 grok.com의 소비자용 “Video 1.5 Fast” 변형을 가리키는 것이지, 표준 비동기 API 렌더를 뜻하지 않습니다 . 두 표면을 서로 다른 것으로 보고, 용량을 산정하기 전에 부하 테스트를 먼저 하세요.
Priority Processing은 grok-imagine-video-1.5 작업에도 적용되나요?
분명하지 않습니다. xAI 문서는 유료 Priority Processing이 비디오 엔드포인트까지 포함하는지 일관되게 확인해 주지 않으므로, 우선순위 스케줄링이 1.5 작업에 안정적으로 적용된다고 가정하는 것은 안전하지 않습니다 . 지연 시간 가정이나 SLA를 이를 기준으로 설계하기 전에, 현재 동작을 API에서 직접 확인하세요.
#1 Image-to-Video Arena 순위는 독립적으로 검증된 것인가요?
아니요. Sora 2, Google Veo 3.1, Seedance 2.0, Kling보다 앞섰다는 보고된 1위 순위는 표준화된 프롬프트나 고정된 테스트 조건이 아니라, 아레나 리더보드에서 진행된 블라인드 인간 선호도 투표에서 나온 것입니다 . 인용되는 Elo 수치는 출처마다 다르고 새 모델이 제출되면 계속 변하므로, 이 주장은 재현 가능한 벤치마크라기보다 리더보드 기준의 결과로 읽는 편이 맞습니다 .