DVD-JEPA가 하는 일: 하드코딩된 물리 없이 잠재 공간에서 예측하기
DVD-JEPA는 작은 Joint-Embedding Predictive Architecture(JEPA) 월드 모델로, 고전적인 바운싱 DVD 로고 스크린세이버의 동역학을 전부 표현 공간에서 학습합니다. 명시적인 x/y 좌표도, 손으로 짠 충돌 규칙도, 손실 함수 안의 픽셀 재구성도 없습니다 . 로고가 픽셀상 어디에 있을지를 예측하는 대신, 다음 상태의 임베딩을 예측하고 그 잠재 궤적을 이용해 움직임을 예상합니다. 프로젝트 페이지는 이를 "a world model that dreams a bouncing logo", 그리고 "the rigorous sequel to DVD Dreamer"라고 설명합니다 .
모델이 환경을 이해하는 방식 전체는 32차원 잠재 공간 안에 들어갑니다. 선택형 디코더를 끄면, 이 디코더는 시각화에만 쓰이는데, 그 이해가 32개의 잠재 막대로 직접 드러납니다. 페이지 표현대로라면 "a pure JEPA only speaks in vectors"이기 때문입니다 . 재구성할 프레임 버퍼도 없고, 그 아래에서 돌아가는 물리 엔진도 없습니다. 동역학은 오직 예측된 벡터 안에만 존재합니다.
구체적으로 새로운 지점은 런타임 특성입니다. DVD-JEPA는 CPU에서 대략 10초 만에 학습되고, 브라우저 안에서 전부 클라이언트 측으로 실행된다고 합니다. GPU도, 서버도, 백엔드도 없습니다. 페이지를 열고, 학습되는 모습을 보고, 예측하는 모습을 볼 수 있습니다 . 그래서 검사 비용이 이례적으로 낮습니다. 일반적인 하드웨어의 탭 하나에서 전체 학습 루프를 관찰할 수 있습니다.
먼저 짚어둘 단서가 하나 있습니다. 이 글을 쓰는 시점에서 이 프로젝트는 단일 1차 산출물, 즉 dvd-jepa.vercel.app와 참조된 GitHub 설명 글에 기대고 있으며, 페이지에는 작성자 이름, 라이선스 문자열, 버전 태그, 릴리스 날짜가 보이지 않습니다 . 아키텍처는 검증할 수 있지만, 출처는 아직 검증하기 어렵습니다. 뒤에서 "최초"라는 주장까지 따져볼 때 이 점이 중요해집니다.
가장 작은 JEPA 구성: 각 요소가 맡는 일

최소 JEPA 레시피는 네 부분으로 이루어집니다. 컨텍스트 인코더, EMA 타깃 인코더, 잠재 예측기, 선택형 디코더입니다. DVD-JEPA는 이 네 가지를 모두 미니어처 규모로 구현해, 명시적 좌표나 손으로 짠 물리 규칙 없이 32차원 잠재 공간에서 바운싱 로고의 동역학을 학습합니다 . 각 구성 요소에는 한 가지 역할이 있고, 네 가지 중 세 가지만 손실 함수에 관여합니다.
- 컨텍스트 인코더. 현재 프레임, 즉 로고의 현재 위치를 잠재 벡터로 매핑하고, 이 벡터가 예측기의 입력이 됩니다. 이는 픽셀이 아니라 임베딩으로 표현된, "지금 무슨 일이 일어나고 있는가"에 대한 모델의 해석입니다 .
- EMA 타깃 인코더. 컨텍스트 인코더를 모멘텀 방식으로 업데이트한 복사본으로, 지수 이동 평균을 통해 갱신됩니다. BYOL과 MoCo에서 쓰인 것과 같은 메커니즘입니다. 안정적이면서도 사소하지 않은 예측 타깃을 만들고, 특히 인코더가 모든 것을 상수 벡터로 매핑해 버리는 실패 모드인 표현 붕괴를 막습니다 .
- 잠재 예측기. 컨텍스트 임베딩을 입력으로 받아 다음 잠재 상태를 전부 임베딩 공간 안에서 예측합니다. 픽셀 재구성은 손실에 전혀 들어가지 않습니다. 예측기는 자신이 상상한 임베딩이 실제 다음 프레임에 대한 EMA 타깃의 임베딩과 얼마나 가까운지로 평가됩니다 .
- 선택형 디코더. 시각화에만 사용됩니다. 디코더를 비활성화해도 순수 JEPA 루프는 처음부터 끝까지 계속 실행되며, 32개의 잠재 막대만을 유일한 출력으로 보여줍니다. 페이지 표현대로라면 "only speaks in vectors"인 모델입니다 .
이것은 DVD-JEPA가 새로 발명한 것이 아니라, Yann LeCun이 주장한 표준적인 스택입니다. LeCun은 2022년 포지션 페이퍼에서 "The main idea is to learn to predict in representation space, not in input space,"라고 썼고, DVD-JEPA도 I-JEPA와 V-JEPA와 함께 이 계보를 인용합니다 . 여기서의 기여는 압축입니다. Meta가 오픈소스로 공개한 I-JEPA를 구동하는 것과 같은 컨텍스트 인코더, EMA 타깃, 예측기 루프를 , 인프라 없이 CPU에서 대략 10초 만에 학습될 만큼 줄인 것입니다 . 디코더를 끈 모드는 교육적인 효과가 큽니다. 모델의 이해를 원시 임베딩으로 읽도록 강제하기 때문입니다. 바로 그 점이 다음 질문, 즉 왜 굳이 표현 공간에서 예측해야 하는가를 구체적으로 만들어 줍니다.
JEPA가 픽셀이 아니라 표현 공간에서 예측하는 이유
JEPA가 표현 공간에서 예측하는 이유는 픽셀 공간 예측이 모델에게 표면적인 세부 요소, 즉 정확한 질감, 조명 변화, 압축 아티팩트까지 재구성하도록 강요하기 때문입니다. 이런 요소들은 동역학을 이해하거나 계획을 세우는 데 아무 도움도 되지 않습니다. 이것이 Yann LeCun의 2022년 JEPA 포지션 페이퍼의 핵심 주장입니다. 이 논문은 이 선택을 예산 배분 문제로 설명합니다. 생성형 및 확산 방식 모델은 픽셀 단위 세부 묘사를 재현하는 데 표현 용량을 쓰는 반면, Joint-Embedding Predictive Architecture는 다음 상태의 추상 임베딩을 예측하고 후속 추론에 필요 없는 것은 버립니다 .
DVD-JEPA는 이 절충을 작은 규모에서 구체적으로 보여줍니다. 튀어 다니는 로고 화면 보호기에서 픽셀 예측기는 매 프레임마다 로고의 색과 배경 픽셀 하나하나의 정확한 RGB 값을 추측해야 합니다. 하지만 실제로 알아야 하는 동역학은 훨씬 단순합니다. 32차원 잠재 공간에서는 모델이 프레임마다 픽셀 단위 색을 저장하지 않고도 "로고가 오른쪽 위로 향하고 있으며 곧 가장자리에 부딪힐 것"을 인코딩할 수 있습니다 . 같은 논리는 더 큰 규모에도 적용됩니다. 인터넷 동영상 100만 시간 이상으로 사전학습된 Meta의 V-JEPA 2도 비디오 프레임을 재구성하는 대신 임베딩 공간에서 예측합니다 .
임베딩 예측에는 픽셀 목적함수에는 없는 실패 방식이 하나 있습니다. 예측기와 타깃이 둘 다 상수 벡터로 붕괴하면 예측 오차는 손쉽게 0으로 떨어집니다. 모델은 아무것도 배우지 않았는데 점수만 완벽해지는 셈입니다. JEPA는 EMA(지수 이동 평균) 타깃 인코더로 이 대칭을 깨뜨립니다. BYOL에서 쓰인 것과 같은 모멘텀 타깃 기법입니다. 타깃은 느리게 움직이는 안정적인 0이 아닌 임베딩이고, 예측기는 그것을 따라가야 하지만 완전히 고정해 붙잡을 수는 없습니다 . 이 움직이는 타깃이 잠재 공간을 계속 정보성 있게 유지합니다. DVD-JEPA에서 학습 중 32개의 잠재 막대가 움직이는 모습을 볼 때 직접 드러나는 구성 요소도 바로 이것입니다 .
예측 오차로 이상을 감지하기: 라벨은 필요 없습니다

이 같은 추격 구조 덕분에 DVD-JEPA는 별도 비용 없이 이상 감지기를 얻습니다. 추론 시 예측기는 예상되는 다음 잠재 상태를 출력하고, 그 예측과 실제 타깃 인코더 임베딩 사이의 거리가 놀람 점수가 됩니다. 거리가 크다는 것은 현실이 모델의 예상에서 벗어났다는 뜻입니다 . 이상 라벨은 전혀 쓰이지 않습니다. 유일한 감독 신호는 약 10초짜리 CPU 실행 동안 모델이 보는 정상적인 튀는 궤적의 스트림뿐입니다 .
학습이 수렴하고 나면 정상 물리는 예측하기 쉬워지므로 잠재 예측 오차는 낮게 안정됩니다. 흥미로운 신호는 튀어 오르는 순간에 있습니다:
- 순간이동 — 로고가 예측된 궤적이 도달하지 않은 새 위치로 뛰어가므로 오차가 급격히 커집니다 .
- 색상 교체 — 갑작스러운 외형 변화가 인코더에 의해 예측된 잠재값에서 멀리 떨어진 임베딩으로 매핑됩니다.
- 방향 반전 — 학습된 동역학이 예상하지 못한 속도 뒤집힘입니다.
이는 더 큰 월드 모델에서 자기지도 이상 감지의 기반이 되는 것과 같은 예측 오차 원리를, 브라우저 탭 하나에서 직접 볼 수 있는 형태로 줄인 것입니다. 솔직한 한계도 있습니다. 임계값은 이 결정론적인 장난감 환경에 맞춰 보정되어 있습니다. 정상 동역학으로 학습하고 높은 예측 오차를 표시한다는 메커니즘은 어떤 결정론적 도메인에도 일반화될 수 있지만, 이 모델이 옮겨 쓸 수 있는 물리 지식을 갖고 있는 것은 아닙니다. 다른 환경에 적용하려면 처음부터 다시 학습해야 하며, 이는 DINO-WM과 V-JEPA-2-AC 방식의 잠재 월드 모델에도 적용되는 같은 제약입니다 . 대신 라벨 없는 이상 감지를 만드는 절차가 벤치마크 숫자 뒤에 숨지 않고 완전히 드러난다는 점이 보상입니다.
선행 사례: JEPA-WMs, I-JEPA, EB-JEPA가 이미 있었습니다
DVD-JEPA가 내세우는 "first fully reproducible, open-source JEPA world model"이라는 표현은 공개 기록과 맞지 않습니다. 코드와 가중치를 갖춘 오픈소스 JEPA 구현은 이미 몇 년 전부터 존재했고, 가장 직접적인 반례도 이 패러다임을 만든 같은 연구소에서 나왔습니다. Meta/FAIR의 I-JEPA는 CVPR 2023에서 발표된 이미지 도메인 Joint-Embedding Predictive Architecture로, 공개 코드와 사전학습 가중치를 함께 제공했습니다 . DVD-JEPA보다 적어도 2년 앞섭니다. 문구를 그대로 읽으면, 이 최상급 표현은 근거가 부족합니다.
가장 완성도 높은 최근 반례는 JEPA-WMs입니다. 논문 "What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?"(arXiv:2512.24497, 2025년 12월 표기)와 함께 공개됐습니다 . 재현성 패키지로서는 이례적으로 완성도가 높습니다. PyTorch 코드, 재현된 베이스라인, 평가 코드, 데이터셋이 하나의 저장소에 들어 있고 , Hugging Face의 facebook/jepa-wms 아래에는 사전학습 체크포인트 5개도 올라와 있습니다 . 논문은 이 모델이 내비게이션과 조작 과제에서 DINO-WM 및 V-JEPA-2-AC를 앞섰다고 보고합니다 . DINO-WM 자체도 이미 2024년 11월 arXiv:2411.04983으로, 여섯 개 환경에서 제로샷 플래닝을 수행하는 DINOv2 기반 시각 월드 모델을 오픈소스로 공개한 바 있습니다 .
교육용으로 포크해 배우기 쉬운 JEPA 라이브러리라는 좁은 범주에서는 EB-JEPA(arXiv:2602.03604, 2026년 2월)가 가장 가까운 비교 대상입니다. 게다가 허용적인 Apache-2.0 라이선스로 배포되며, CIFAR-10 probing 정확도 91%, Two Rooms 과제 planning 성공률 97%를 보고합니다 . 코드는 facebookresearch/eb_jepa에 있습니다 .
| 프로젝트 | 첫 공개 시점 | 코드 + 가중치 | 라이선스 |
|---|---|---|---|
| I-JEPA | CVPR 2023 | 있음(image JEPA) | 오픈소스 |
| DINO-WM | 2024년 11월 | 있음(DINOv2 world model) | 오픈소스 |
| JEPA-WMs | 2025년 12월 | 있음(체크포인트 5개 + 데이터셋) | CC-BY-NC 4.0(비상업용) |
| EB-JEPA | 2026년 2월 | 있음(교육용 라이브러리) | Apache-2.0(허용적) |
| DVD-JEPA | 2026년(공개 날짜 없음) | 언급은 있으나 가져올 수 없음 | 명시되지 않음 |
가장 호의적으로 읽으면 여기서 "first"는 "브라우저 안에서 학습까지 되는, 최소 구성의 완전 클라이언트 사이드 JEPA로서는 최초"라는 뜻일 수 있습니다. 이는 실제로 방어 가능한 차이입니다. 위의 아티팩트 중 어느 것도 단일 브라우저 탭에서 약 10초짜리 CPU 학습으로 엔드투엔드 월드 모델을 실행하지는 않기 때문입니다 . 하지만 프로젝트 페이지는 이를 명시하지 않습니다. 그래서 문구는 증거가 뒷받침하는 범위보다 넓게 읽힙니다. 정확한 표현은 이처럼 한정한 버전으로 보는 것이 맞습니다.
JEPA-WMs: 가장 완성도 높은 JEPA 공개물, 다만 비상업용 라이선스
JEPA-WMs는 현재까지 공개된 JEPA 월드 모델 중 가장 완성도 높은 릴리스입니다. PyTorch 코드, 사전학습 가중치, 재현된 베이스라인, 평가 코드, 데이터셋을 하나의 저장소에 묶었고, 논문 "What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?"(arXiv:2512.24497, 2025-12-30, Basile Terver, Tsung-Yen Yang, Jean Ponce, Adrien Bardes, Yann LeCun)과 연결되어 있습니다 . 바로 이 완성도 때문에 DVD-JEPA의 "first fully reproducible"이라는 프레이밍은 JEPA-WMs를 피해서 설명될 수 없습니다. 다만 JEPA-WMs는 제품에 바로 넣을 수 있는 대체재가 아니며, 그 이유는 라이선스에 있습니다.
Hugging Face에는 facebook/jepa-wms 아래 체크포인트 5개가 호스팅되어 있습니다 . 인코더와 해상도 기준으로 깔끔하게 나뉩니다. DROID/RoboCasa 체크포인트는 DINOv3 ViT-L/16 인코더와 predictor depth 12를 사용해 256×256에서 동작하고, Metaworld, Push-T, PointMaze, Wall은 DINOv2 ViT-S/14 인코더와 predictor depth 6을 사용해 224×224에서 동작합니다 .
| 체크포인트 | 인코더 | 해상도 | Predictor depth |
|---|---|---|---|
| jepa_wm_droid (DROID/RoboCasa) | DINOv3 ViT-L/16 | 256×256 | 12 |
| jepa_wm_metaworld | DINOv2 ViT-S/14 | 224×224 | 6 |
| jepa_wm_pusht | DINOv2 ViT-S/14 | 224×224 | 6 |
| jepa_wm_pointmaze | DINOv2 ViT-S/14 | 224×224 | 6 |
| jepa_wm_wall | DINOv2 ViT-S/14 | 224×224 | 6 |
데이터셋 카드는 포함된 데이터의 총량을 11.1GB로 제시합니다. 여기에는 Metaworld의 탁상 과제 42개와 세 개 카메라 시점에서 기록한 Franka Custom 실제 로봇 데이터가 포함됩니다. DROID는 선택적 별도 다운로드로 제공되며, 크기는 8.7TB(스테레오 HD) 또는 5.6TB(비스테레오 HD)입니다 . 논문에 보고된 수치와 직접 비교할 수 있도록, 저장소에는 DINO-WM 베이스라인과 V-JEPA-2-AC 베이스라인(V-JEPA-2 ViT-G/16, predictor depth 24)도 함께 제공됩니다. 논문은 이 모델이 내비게이션과 조작에서 DINO-WM 및 V-JEPA-2-AC를 모두 앞섰다고 보고합니다 .
빌더 입장에서 걸리는 지점은 라이선스입니다. JEPA-WMs는 CC-BY-NC 4.0으로 공개되어 명시적으로 비상업용이며, 데이터셋 접근도 연락처 정보 공유에 동의해야 열립니다 . 그래서 훌륭한 참고 자료이자 연구 베이스라인이지만, 별도 라이선스 없이 상업용 파이프라인에 넣을 수 있는 대상은 아닙니다. DVD-JEPA와의 비교는 양면적입니다. JEPA-WMs는 훨씬 더 완성도 높고 벤치마크도 갖췄지만, 이용 조건은 최소 구성의 허용적 포크 가능 교육 도구보다 재사용을 더 강하게 제한합니다.
DVD-JEPA의 정체: 학습자에게 친절한 프로토타입

DVD-JEPA는 벤치마크 경쟁용 모델이 아니라 교육용 도구로서 가치가 있다. 특히 세 가지를 이해하는 데 실제로 유용하다. JEPA가 픽셀이 아니라 잠재 공간에서 예측하는 이유를 직관적으로 익히고, EMA 타깃 인코더가 재현 가능한 장난감 환경에서 표현 붕괴를 막는 모습을 확인하며, 컨텍스트 인코더, 모멘텀 타깃, 잠재 예측기, 이상 탐지를 포함한 전체 JEPA 루프를 환경 설정 없이 브라우저 탭 하나에서 실행해 볼 수 있다. CPU에서 32차원 잠재 표현을 대상으로 약 10초 만에 학습된다 . 프로젝트 페이지도 이 교훈을 간명하게 설명한다.
"순수한 JEPA는 벡터로만 말한다." — DVD-JEPA project page (source: dvd-jepa.vercel.app)
반대로 DVD-JEPA가 아닌 것은 분명하다. 벤치마크에 올릴 수 있는 로봇 플래닝의 대체재도, 프로덕션용 이상 탐지기도, 재현성 문헌에서 인용할 만한 "최초" 사례도 아니다. 플래닝 워크로드에는 JEPA-WMs가 문서화된 기준선이며, 감사 가능한 수준의 최상급 표현을 뒷받침하기에도 이 페이지의 근거는 부족하다.
실사 관점의 공백도 있다. 프로젝트 페이지에는 저자, 버전, 라이선스 문자열, 릴리스 날짜가 공개되어 있지 않으므로 , 이 작업을 인용하거나 포크해 다른 곳에 넣기 전에는 GitHub 저장소를 확인해야 한다. 출처가 더 명확하면서 비슷한 교육적 가치를 원한다면 EB-JEPA(Apache-2.0, 2026년 2월)도 함께 평가할 만하다. EB-JEPA는 CIFAR-10 프로빙 정확도 91%를 보고하며, 상업적으로도 기반을 삼을 수 있는 허용적 라이선스를 제공한다 . DVD-JEPA는 JEPA 레시피를 가장 빠르게 체감하는 방법으로, EB-JEPA는 실제 프로젝트에 더 안전하게 가져갈 수 있는 버전으로 보는 편이 적절하다.
DVD-JEPA, EB-JEPA, JEPA-WMs: 목적과 범위로 비교하기
어떤 JEPA 결과물이 맞는지는 무엇을 하려는지에 달려 있으며, 대표적인 네 가지 선택지는 목적, 라이선스, 규모에 따라 명확히 나뉜다. 서로를 그대로 대체할 수 있는 관계는 아니다. DVD-JEPA는 브라우저 데모이고, EB-JEPA는 Python 라이브러리이며, JEPA-WMs는 연구 패키지이고, V-JEPA 2는 사전 학습된 파운데이션 모델이다. 가장 큰 주장보다 실제 작업에 맞춰 도구를 고르는 것이 중요하다.
- 설치 없이, Python 환경도 없이, 브라우저 탭 하나에서 JEPA 레시피를 체감하고 싶다면 → DVD-JEPA. 32차원 잠재 표현으로 CPU에서 약 10초 만에 학습되며, 전부 클라이언트 측에서 실행된다 . 인용하거나 포크하거나 이를 바탕으로 무언가를 만들기 전에는 GitHub 저장소에서 저자, 버전, 라이선스를 확인해야 한다.
- 정량 결과가 있고 허용적 라이선스가 붙은 JEPA를 Python ML 파이프라인에 통합하고 싶다면 → EB-JEPA. Apache-2.0 라이선스이며, CIFAR-10 프로빙 정확도 91%를 보고하고, 상업적 작업으로도 가져갈 수 있는 교육용 라이브러리 형태로 제공된다 .
- 연구 맥락에서 최신 로봇 플래닝 기준선을 재현하거나 확장하고 싶다면 → JEPA-WMs. PyTorch 코드, 사전 학습 가중치, 기준선, 데이터셋을 함께 제공하지만, 라이선스는 CC-BY-NC 4.0으로 비상업적 사용만 허용된다 .
- 다운스트림 제로샷 플래닝을 위해 비디오 기반 대규모 사전 학습이 필요하다면 → V-JEPA 2. 100만 시간이 넘는 인터넷 비디오로 사전 학습되었고, 액션 조건부 변형은 라벨 없는 DROID 데이터 62시간 미만으로 제로샷 Franka 플래닝에 도달한다 .
핵심은 이렇다. 오늘 당장 직관을 쌓는 데는 DVD-JEPA를 쓰고, 프로토타입에 허용적 라이선스와 재현 가능한 수치가 필요하면 EB-JEPA를 고르며, 비상업 조건 아래 발표된 기준선을 확장하려면 JEPA-WMs를, 실제 사전 학습 월드 모델이 필요하면 V-JEPA 2를 선택하면 된다. DVD-JEPA 이야기에서 "완전히 재현 가능한 최초"라는 꼬리표만큼은 저장소, 저자, 라이선스가 독립적으로 확인되기 전까지는 보류하는 것이 맞다.
자주 묻는 질문
JEPA란 무엇이며, DVD-JEPA는 Meta의 I-JEPA 및 V-JEPA 2와 어떤 관계가 있나요?
JEPA(Joint-Embedding Predictive Architecture)는 픽셀을 재구성하는 대신 잠재 임베딩 공간에서 다음 상태를 예측하는 자기지도 학습 구조입니다. Meta/FAIR는 대규모 구현체를 공개해 왔습니다. I-JEPA는 이미지용 오픈소스로 공개되었고 , V-JEPA 2는 인터넷 영상 100만 시간 이상으로 사전학습한 10억 매개변수 규모의 비디오 월드 모델입니다 . DVD-JEPA는 같은 4요소 구성, 즉 컨텍스트 인코더, EMA 타깃 인코더, 잠재 예측기, 선택적 디코더를 사용하되, 브라우저 안에서 CPU로 약 10초 만에 학습되는 32차원 소형 규모로 줄인 버전입니다 . Meta의 연구 모델과 경쟁하려는 것이 아니라 교육용 장난감에 가깝습니다.
DVD-JEPA가 실제로 최초의 오픈소스 재현 가능 JEPA 월드 모델인가요?
넓은 의미에서는 아닙니다. I-JEPA는 이미 2023년에 코드와 가중치를 공개했습니다 . JEPA-WMs(arXiv:2512.24497, 2025-12-30 날짜)는 완전한 PyTorch 코드, 사전학습 체크포인트 5개, 재현된 베이스라인을 제공합니다 . EB-JEPA(arXiv:2602.03604, 2026-02-03)는 CIFAR-10 프로빙 정확도 91%를 보고한 Apache-2.0 교육용 라이브러리입니다 . 더 방어 가능한 해석은 좁습니다. DVD-JEPA는 완전히 클라이언트 측에서, 브라우저 안에서 학습되는 JEPA로는 최초일 가능성이 있습니다. 이는 분명 의미 있는 차별점이지만 프로젝트 페이지가 명시적으로 밝히지는 않습니다 .
EMA 타깃 인코더는 무엇을 하며, JEPA에는 왜 필요한가요?
EMA(exponential moving average) 타깃 인코더는 컨텍스트 인코더를 모멘텀 방식으로 업데이트한 복사본입니다. BYOL과 MoCo에서 쓰인 것과 같은 메커니즘입니다 . 이것이 없으면 예측기가 상수 임베딩으로 붕괴할 수 있고, 아무것도 유용하게 배우지 않으면서도 거의 0에 가까운 예측 오류를 쉽게 달성할 수 있습니다. EMA 타깃은 안정적이지만 천천히 움직이는 목표를 제공하므로, 예측기는 퇴화한 지름길로 수렴하는 대신 데이터의 실제 구조를 따라가야 합니다. DVD-JEPA에서는 이 붕괴 방지 단계가 직접 드러나며, 이 점도 참고 구현으로 쓸 만한 이유 중 하나입니다.
DVD-JEPA나 JEPA-WMs를 상업 프로젝트에 사용할 수 있나요?
배포하기 전에 라이선스를 확인해야 합니다. 작성 시점 기준 DVD-JEPA 프로젝트 페이지에는 라이선스 문자열이 표시되어 있지 않으므로, 상업적 사용 전 GitHub 저장소를 확인해야 합니다 . JEPA-WMs는 CC-BY-NC 4.0 라이선스로, 명시적으로 비상업적 사용만 허용하며, 데이터셋 접근도 연락처 정보 제공 뒤에 열립니다 . EB-JEPA는 Apache-2.0 라이선스라 상업적 사용이 가능합니다 . V-JEPA 2는 통합 전에 facebookresearch/vjepa2 저장소에서 라이선스를 확인하세요 .
DVD-JEPA는 라벨이 붙은 이상 데이터 없이 어떻게 이상을 감지하나요?
예측 오류를 신호로 사용합니다. 정상적인 튀는 움직임만으로 학습한 뒤, 예측기는 예상되는 다음 잠재 상태를 출력합니다. 추론 시에는 그 예측 임베딩과 실제 EMA 타깃 출력 사이의 거리가 놀람의 정도를 나타냅니다 . 정상 프레임에서는 오류가 낮게 나오지만, 순간이동, 갑작스러운 방향 반전, 색상 변화 같은 이상 이벤트가 발생하면 오류가 급등합니다. 이 방식은 정상 학습 데이터만 필요하고 라벨이 붙은 부정 예제가 필요 없기 때문에, 일반 하드웨어와 브라우저 탭 하나만으로 비지도 예측 오류 기반 이상 감지를 보여줍니다.