입력
참고: 두 입력의 샘플은 중첩 텐서(nested tensor)에서 비디오 및 오디오 스트림의 쌍으로 결합됩니다. 입력 중 하나에
noise_mask가 포함된 경우 출력에는 결합된 마스크가 포함되며, 누락된 마스크는 해당 샘플 모양과 일치하는 모든 값이 1인 마스크로 대체됩니다. 더 짧은 오디오가 채워지는 경우, 채워진 영역은 마스킹되지 않은 상태로 유지되어 모델이 해당 영역을 생성할 수 있습니다. 오디오 잠재 변수를 비디오 잠재 변수에 맞출 수 없는 경우, 예를 들어 두 잠재 변수가 두 개 이상의 차원에서 다르거나 배치 또는 채널 차원에서 다른 경우 노드는 오류를 발생시킵니다.
출력
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집
Source fingerprint (SHA-256):
0231f9db2ce73132d8555fbb33f295b68aa68a0c1c54e4a0c5d2e1f67b5611cb