Meituan의 LongCat 팀이 오픈소스 말하는 아바타 스택에 조용하지만 의미 있는 업데이트를 내놓았다. 버전 1.5는 오디오 인코더를 교체하고, 샘플링을 8단계로 증류했으며, 더 작은 GPU에도 모델을 올릴 수 있도록 INT8 경로를 추가했다. 내부에서 실제로 무엇이 바뀌었는지, 이제 어떤 플래그를 넘겨야 하는지 정리한다.
LongCat-Video-Avatar 1.5: DMD2 증류, Wav2Vec2 교체, INT8 오프로딩

LongCat-Video-Avatar 1.5는 한 장의 초상 이미지와 오디오 클립을 입력하면 입 모양이 맞는 영상으로 바꿔 주는 오디오 기반 말하는 아바타 생성기다. 머리 움직임, 표정, 신체 동작까지 함께 생성한다. 2026년 5월 21일 공개된 이 모델은 136억 파라미터 규모의 dense LongCat-Video diffusion transformer 위에 얹힌 아바타 헤드다 [베이스 모델, 2025년 10월]. 핵심 변화는 v1.0에서 쓰던 Wav2Vec2 오디오 인코더 v1.0(2025년 12월 16일)를 Whisper-Large-v3로 바꾼 점이다. 팀은 이 변경이 더 부드럽고 자연스러운 입 움직임으로 이어진다고 설명한다.
v1.5 워크플로우를 좌우하는 새 플래그는 세 가지이며, 모두 v1.0에는 없던 것들이다.
| 플래그 | 역할 | 메모 |
|---|---|---|
--use_distill | DMD2 기반 단계 증류를 켜서 생성을 8 NFE로 줄인다 | v1.5에서는 필수다. 생략하면 8단계 경로가 아니라 v1.0의 전체 체인 샘플링 스케줄로 돌아간다 |
--use_int8 | 136억 dense DiT를 INT8로 로드해 VRAM 부담을 낮춘다 | 소비자용 GPU에서 가장 중요한 조절 장치 |
--resolution | 480P 또는 720P 출력을 선택한다 | 1.5에서 새로 추가됨 |
내부적으로는 기술 보고서에서 Cross-Chunk Latent Stitching을 설명한다. 이 방식은 자기회귀 청크 사이에서 불필요한 VAE 디코드/인코드 사이클을 제거해, 재인코딩 오버헤드 없이 몇 분 길이의 영상을 매끄럽게 생성할 수 있게 한다 [arXiv:2605.26486]. 이전 도구들이 청크 경계에서 흔들리거나 끊기던 장문 출력에서는 꽤 중요한 부분이다.
GPU 시간을 쓰기 전에 짚어 둘 점도 있다. Meituan은 508개 이미지-오디오 쌍, 770명의 크라우드소싱 평가자, 13,240건의 판단을 기준으로 HeyGen, Kling Avatar 2.0, OmniHuman-1.5와 비교해 동급 또는 더 나은 결과를 냈다고 주장한다 [사람 평가 벤치마크]. 하지만 이 평가는 전적으로 저자 측에서 통제했고, 승률 형태로 보고됐다. 아직 우월성 주장을 뒷받침하는 독립 리더보드는 없다. 확정된 결과라기보다 공급자 측 근거로 보는 편이 맞다. 이 릴리스를 알린 원본 영상에도 크레딧을 둔다: YouTube walkthrough.
LongCat-Video-Avatar 1.5 환경 준비: PyTorch 2.6.0, CUDA 12.4, FlashAttention-2

설정은 베이스 저장소를 클론하는 것부터 시작한다. 아바타는 LongCat-Video 파운데이션 모델 위에 얹히는 헤드이므로, 먼저 그 모델을 설치한 뒤 아바타 레이어를 추가한다. 다른 작업에 앞서 Python 3.10 가상 환경을 만든다 . 고정된 FlashAttention-2 wheel은 3.11 이상에서 테스트되지 않았고, 이 부분의 버전 차이가 초반 실패의 흔한 원인이다.
설치가 가장 자주 깨지는 의존성은 FlashAttention-2 v2.7.4.post1이며, 이는 필수 요구사항이다 . PyTorch 2.6.0에 맞는 CUDA 12.4용 wheel로 설치해야 한다 . 기본 pip 빌드와 CUDA가 맞지 않는 것이 가장 흔한 설치 오류다. 그런 다음 베이스 모델용 requirements.txt와 아바타 경로용 requirements_avatar.txt를 모두 설치한다. 후자는 librosa를 가져오며 시스템에 ffmpeg가 있다고 가정한다 .
가중치는 huggingface-cli download meituan-longcat/LongCat-Video-Avatar-1.5로 받는다 . DMD2 distill LoRA도 확인해야 한다. Comfy 패키지 형태 기준으로 대략 1.26 GB인 이 파일은 8-NFE 증류 경로에 필요한 별도 아티팩트이며, 선택 사항이 아니다.
레퍼런스 실행은 --context_parallel_size=2와 함께 torchrun --nproc_per_node=2를 사용한다. 즉, 두 개의 GPU를 context-parallel로 쓰는 구성이다 . 단일 GPU 실행은 --use_int8을 추가해 136억 dense 베이스의 VRAM 사용량을 줄이면 가능하다. 다만 공식 문서가 테스트한 구성은 아니므로, 오프로딩 조정은 직접 해야 한다고 보는 편이 좋다.
LongCat-Video-Avatar 1.5로 말하는 아바타 만들기: torchrun, AT2V, DMD2
LongCat-Video-Avatar 1.5에는 네 가지 작업 모드가 있으며, 어떤 모드를 고르느냐에 따라 정체성 보존의 안정성이 달라집니다. AT2V(Audio-Text-to-Video)는 참조 이미지 없이 오디오 트랙과 텍스트 프롬프트만으로 말하는 영상을 생성합니다. ATI2V/AI2V는 인물 사진을 추가하는 방식(Audio-Text-Image 또는 Audio-Image-to-Video)이며, Reference Skip Attention을 거쳐 복사-붙여넣기 같은 흔적이나 정체성 흔들림 없이 얼굴을 안정적으로 유지합니다 . 원본 사진이 있고 일관성이 중요하다면 ATI2V나 AI2V를 우선 선택하세요. 네 번째 모드는 오디오 조건 기반 이어 만들기이며, 아래에서 다룹니다.
단일 화자 AT2V 실행은 다음과 같습니다. 이 스니펫은 검증된 예시이며, 모델을 실제로 실행하지 않고 래핑하는 업스트림 CLI를 그대로 출력합니다.
"""Minimal LongCat-Video-Avatar 1.5 8-step inference demo.
This prints the distilled inference settings and the matching upstream CLI.
Running the real model requires downloading the weights and LongCat-Video repo.
"""
MODEL = "meituan-longcat/LongCat-Video-Avatar-1.5"
def main():
steps = 8
command = [
"torchrun",
"--nproc_per_node=2",
"run_demo_avatar_single_audio_to_video.py",
"--context_parallel_size=2",
"--checkpoint_dir=./weights/LongCat-Video-Avatar-1.5",
"--stage_1=at2v",
"--input_json=assets/avatar/single_example_1.json",
"--use_distill",
"--model_type=avatar-v1.5",
"--use_int8",
]
print(f"{MODEL} uses distilled inference: {steps} steps")
print(" ".join(command))
if __name__ == "__main__":
main()8단계(8-NFE) 증류 경로를 쓰려면 --use_distill와 --model_type avatar-v1.5가 모두 필수입니다 . 공식 문서 기준으로 Audio CFG는 3-5 범위로 설정하세요. 3 미만이면 입 움직임이 부족하고, 5를 넘으면 과장됩니다 .
화자가 두 명이면 run_demo_avatar_multi_audio_to_video.py를 실행합니다. 길이가 같은 클립은 --audio_type para(병렬 병합, 합산)를 쓰고, 길이가 다른 클립은 --audio_type add(무음 패딩을 넣어 순차 배치)를 사용하세요. person1/person2 순서는 위치로 결정됩니다 . 병렬 병합 모드에서는 L-ROPE 기반 오디오-비주얼 바인딩이 공간적으로 화자를 분리해, 두 얼굴 사이에서 목소리와 정체성이 섞이지 않도록 합니다 .
비디오 이어 만들기는 참조 클립과 새 오디오를 입력해 기존 구간을 확장합니다. 여기서는 Cross-Chunk Latent Stitching이 자기회귀 청크 사이의 불필요한 VAE 디코드/인코드 사이클을 제거하므로, 다시 인코딩하지 않아도 경계가 깔끔하게 이어집니다 .
LongCat-Video-Avatar 1.5의 ComfyUI 패키징과 우회 방법

원시 torchrun 경로가 너무 무겁다면, 커뮤니티에서 만든 두 가지 ComfyUI 경로로 LongCat-Video-Avatar 1.5를 감쌀 수 있습니다. 둘 다 Meituan이 관리하는 것은 아닙니다. 전용 smthemex/ComfyUI_LongCat_Avatar 노드는 ComfyUI/custom_nodes에 클론해 사용하며, INT8 DiT, umt5_xxl_fp8_e4m3fn_scaled 텍스트 인코더, Whisper-large-v3 오디오 인코더, LongCat_Avatar_1.5_vae, distill LoRA, Kim_Vocal_2.onnx 보컬 분리기를 가져옵니다. 단일 인물과 2인 시나리오 모두에서 테스트되었습니다 . 두 번째 경로는 Kijai의 ComfyUI-WanVideoWrapper입니다. 이 래퍼의 LongCat model folder에는 31.7 GB 크기의 LongCat-Avatar-15_bf16.safetensors와 1.26 GB distill LoRA가 들어 있습니다.
패키징 변경이 잦다는 점에 주의하세요. 오래된 튜토리얼은 WanVideoWrapper의 longcat_avatar 브랜치를 가리키지만, 현재 v1.5 지원은 main 브랜치로 옮겨졌습니다 . 따라서 가이드를 따라 하기 전에 항상 커밋 날짜를 확인해야 합니다. 라이선스의 경우, MIT terms는 가중치와 코드를 포함하지만 "Meituan" 및 "LongCat" 이름에 대한 상표권과 특허권은 명시적으로 제외합니다 . 모델의 상업적 사용은 허용되지만, 브랜드명 사용은 허용되지 않습니다.
프로덕션 전에 남는 공백은 두 가지입니다. Hugging Face에는 호스팅 추론 제공자가 없습니다. 대략 지난달 1,581회 다운로드와 44개 커뮤니티 Spaces 수준이므로 로컬 GPU가 필수입니다. GPU 없이 쓰는 대안으로는 HeyGen의 720p Photo Avatar 기준 초당 $0.05 옵션이 남습니다. 또한 이 프로젝트에는 동의 절차, 권리 관리, 브랜드 키트 도구가 포함되어 있지 않습니다. 생성된 초상에 대한 거버넌스는 전부 외부에서 직접 구축해야 합니다. 핵심만 말하면, LongCat-Video-Avatar 1.5는 GPU 비용만으로 개방적이고 점검 가능한 다인물 아바타 생성을 제공하지만, 제공되지 않는 모든 안전장치는 직접 책임져야 합니다.
자주 묻는 질문
LongCat-Video-Avatar 1.5를 실행하려면 어떤 GPU가 필요한가요?
기준 구성은 멀티 GPU입니다. 공식 아바타 명령은 torchrun --nproc_per_node=2와 --context_parallel_size=2로 실행됩니다. 기본 모델이 136억 개 파라미터의 dense diffusion transformer이고 Kijai의 bf16 빌드 용량이 약 31.7GB이기 때문에, 현실적인 최소 기준은 24GB 카드 2장 또는 --use_int8을 사용하는 단일 40GB 이상 카드입니다. INT8 양자화와 오프로딩을 쓰면 단일 소비자용 GPU에서도 가능하지만, 공식적으로 테스트된 2-GPU 구성 밖에 있으므로 실행 속도는 더 느리고 수동 튜닝이 필요할 수 있습니다.
LongCat-Video-Avatar v1.0에서 v1.5로 무엇이 달라졌나요?
v1.0은 Wav2Vec2 오디오 인코더와 함께 2025년 12월 16일 공개되었고, v1.5는 2026년 5월 21일에 나왔습니다. 핵심 변화는 다음과 같습니다. 오디오 인코더가 Wav2Vec2에서 Whisper-Large-v3로 바뀌어 입술 움직임이 더 자연스러워졌고, DMD2 기반 step distillation으로 --use_distill 플래그를 통해 추론이 8스텝으로 줄었으며, --use_int8을 통한 INT8 로딩으로 VRAM 사용량을 낮출 수 있게 되었습니다. 또 --resolution으로 480P/720P 출력을 지정할 수 있고, Cross-Chunk Latent Stitching으로 긴 영상의 시간적 안정성이 개선되었습니다.
--use_distill 플래그는 무엇을 하며, v1.5에서 왜 필요한가요?
--use_distill은 diffusion sampling을 8 NFE, 즉 8스텝으로 줄이는 DMD2 distillation LoRA를 활성화합니다. 이 옵션을 쓰지 않으면 v1.5 가중치는 v1.0에서 이어받은 전체 체인 샘플링 스케줄로 돌아가며, 훨씬 느리고 v1.5가 의도한 추론 경로도 아닙니다. 이 플래그 덕분에 distilled 경로가 일반적인 diffusion 스케줄처럼 수십 스텝을 돌지 않고 8스텝으로 끝나므로, 모든 v1.5 아바타 명령에 포함해야 합니다.
LongCat-Video-Avatar는 상업적 사용이 가능한 MIT 라이선스인가요?
예. 가중치, 코드, 기여물은 MIT 라이선스로 배포되며, 모델 자체의 상업적 사용이 허용됩니다. 단, MIT 조건은 "Meituan"과 "LongCat" 명칭에 대한 상표권 및 특허권을 명시적으로 제외합니다. 따라서 이 모델로 상업용 제품을 만들 수는 있지만, 해당 브랜드명을 자신의 이름처럼 사용할 수는 없습니다. 늘 그렇듯이 출시 전에는 실제 배포 방식에 맞춰 라이선스 원문을 확인하세요.
말하는 아바타 용도로 LongCat-Video-Avatar 1.5와 HeyGen은 어떻게 다른가요?
LongCat은 셀프 호스팅 방식이고 MIT 라이선스이며, GPU를 보유하고 나면 영상당 비용이 $0이고, 두 화자 장면과 오디오 조건 기반 영상 이어 만들기를 기본 지원합니다. HeyGen은 바로 사용할 수 있는 SaaS로, 720p Photo Avatar 기준 약 $0.05/sec 가격이며, 영상 기반 Digital Twin마다 동의 영상이 필요하고 프로덕션 거버넌스가 내장되어 있습니다. LongCat에는 그런 도구가 포함되어 있지 않습니다. 동의 워크플로, 권리 관리, 자막, 브랜드 키트가 없습니다. 제어권, 프라이버시, 한계 비용을 중시한다면 LongCat을, 거버넌스와 안정성, 지원을 중시한다면 HeyGen을 선택하세요.
이 글이 도움이 되셨다면, 새 글이 올라올 때마다 이메일로 받아보세요.