diff --git a/requirements.txt b/requirements.txt index 01bcfb8..5c11e82 100644 --- a/requirements.txt +++ b/requirements.txt @@ -1,2 +1,3 @@ accelerate -diffusers \ No newline at end of file +diffusers>=0.28.0 +Pillow \ No newline at end of file diff --git a/stabledelight/controlnetvae.py b/stabledelight/controlnetvae.py index 3903066..0a58931 100644 --- a/stabledelight/controlnetvae.py +++ b/stabledelight/controlnetvae.py @@ -16,7 +16,6 @@ from typing import Any, Dict, List, Optional, Tuple, Union import torch - from diffusers.models.controlnet import ControlNetOutput from diffusers.models import ControlNetModel diff --git a/stabledelight/pipeline_yoso_delight.py b/stabledelight/pipeline_yoso_delight.py index f2bbe33..2d727fe 100644 --- a/stabledelight/pipeline_yoso_delight.py +++ b/stabledelight/pipeline_yoso_delight.py @@ -100,10 +100,6 @@ class YosoDelightPipeline(): Args: vae ([`AutoencoderKL`]): Variational Auto-Encoder (VAE) model to encode and decode images to and from latent representations. - text_encoder ([`~transformers.CLIPTextModel`]): - Frozen text-encoder ([clip-vit-large-patch14](https://huggingface.co/openai/clip-vit-large-patch14)). - tokenizer ([`~transformers.CLIPTokenizer`]): - A `CLIPTokenizer` to tokenize text. unet ([`UNet2DConditionModel`]): A `UNet2DConditionModel` to denoise the encoded image latents. controlnet ([`ControlNetModel`] or `List[ControlNetModel]`):