개요
이 노드는 Causal Forcing 또는 Self-Forcing을 사용하는 AR(자동 회귀, Auto-Regressive) 비디오 모델을 위한 이미지-투-비디오 생성 설정을 준비합니다. 시작 이미지를 VAE로 잠재 공간에 인코딩하고 이를 모델의 transformer 옵션에 저장하여, 비디오 샘플링 과정이 디노이징 전에 KV 캐시를 시드할 수 있도록 합니다. 동일한 텍스트-투-비디오 모델 체크포인트를 사용하므로 별도의 이미지-투-비디오 아키텍처가 필요하지 않습니다.입력
참고: 시작 이미지는 인코딩되기 전에 지정된
width 및 height로 크기가 조정됩니다. 잠재 시간 차원은 ((length - 1) // 4) + 1로 계산되며, 잠재 공간 차원은 height / 8 및 width / 8입니다.
출력
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집
Source fingerprint (SHA-256):
984834951b9d5a22aef51c85a5019fd8ba58cdb2d6fff235371ed29f316896d8