Skip to main content
LTXVSeparateAVLatent 노드는 결합된 오디오-비주얼 잠재 표현을 비디오 데이터가 포함된 잠재 표현과 오디오 데이터가 포함된 잠재 표현이라는 두 개의 개별 잠재 표현으로 분할합니다. 이 기능은 LTXV 또는 MiniMax H3와 같은 모든 오디오-비주얼 모델에서 작동합니다. samples 텐서는 첫 번째 차원을 따라 분할되며, 첫 번째 요소는 비디오 잠재 표현이 되고 두 번째 요소는 오디오 잠재 표현이 됩니다. 노이즈 마스크가 존재하는 경우에도 동일한 방식으로 분할됩니다.

입력

참고: 입력 잠재 표현의 samples 텐서는 첫 번째 차원(배치 차원)을 따라 최소 두 개의 요소를 포함해야 합니다. 첫 번째 요소는 비디오 잠재 표현에 사용되고, 두 번째 요소는 오디오 잠재 표현에 사용됩니다. noise_mask가 존재하는 경우 동일한 방식으로 분할됩니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): 22ed38bbc1b5716cee380c35c50455810f79c273f51bbe6a535c9ae33192afe6