From e332935ad6e2a979959a51f590ad28426b01a8db Mon Sep 17 00:00:00 2001 From: kijai <40791699+kijai@users.noreply.github.com> Date: Sat, 8 Mar 2025 00:17:01 +0200 Subject: [PATCH] Fix skyreels --- hyvideo/diffusion/pipelines/pipeline_hunyuan_video.py | 5 +++-- 1 file changed, 3 insertions(+), 2 deletions(-) diff --git a/hyvideo/diffusion/pipelines/pipeline_hunyuan_video.py b/hyvideo/diffusion/pipelines/pipeline_hunyuan_video.py index 8921878..c9cb955 100644 --- a/hyvideo/diffusion/pipelines/pipeline_hunyuan_video.py +++ b/hyvideo/diffusion/pipelines/pipeline_hunyuan_video.py @@ -739,8 +739,9 @@ class HunyuanVideoPipeline(DiffusionPipeline): if image_cond_latents is not None and not use_context_schedule: if i2v_condition_type == "latent_concat": latent_image_input = (torch.cat([image_cond_latents] * 2) if cfg_enabled else image_cond_latents) - i2v_mask = torch.cat([i2v_mask] * 2) if cfg_enabled else i2v_mask - latent_image_input = torch.cat([latent_image_input, i2v_mask], dim=1) + if self.transformer.in_channels == 33: + i2v_mask = torch.cat([i2v_mask] * 2) if cfg_enabled else i2v_mask + latent_image_input = torch.cat([latent_image_input, i2v_mask], dim=1) latent_model_input = torch.cat([latent_model_input, latent_image_input], dim=1) if self.transformer.guidance_embed: