366 lines
8.4 KiB
YAML
366 lines
8.4 KiB
YAML
NAME: FLUX1.0_DEV
|
|
IS_DEFAULT: False
|
|
DEFAULT_PARAS:
|
|
PARAS:
|
|
RESOLUTIONS: [[1024, 1024]]
|
|
INPUT:
|
|
IMAGE:
|
|
ORIGINAL_SIZE_AS_TUPLE: [1024, 1024]
|
|
TARGET_SIZE_AS_TUPLE: [1024, 1024]
|
|
PROMPT: ""
|
|
NEGATIVE_PROMPT:
|
|
DEFAULT: ""
|
|
VISIBLE: False
|
|
PROMPT_PREFIX: ""
|
|
SAMPLE:
|
|
VALUES: ["flow_eluer"]
|
|
DEFAULT: "flow_eluer"
|
|
SAMPLE_STEPS: 50
|
|
GUIDE_SCALE: 3.5
|
|
GUIDE_RESCALE:
|
|
DEFAULT: 0.0
|
|
VISIBLE: False
|
|
DISCRETIZATION:
|
|
VALUES: []
|
|
DEFAULT:
|
|
VISIBLE: False
|
|
OUTPUT:
|
|
LATENT:
|
|
IMAGES:
|
|
SEED:
|
|
MODULES_PARAS:
|
|
FIRST_STAGE_MODEL:
|
|
FUNCTION:
|
|
-
|
|
NAME: encode
|
|
DTYPE: bfloat16
|
|
INPUT: ["IMAGE"]
|
|
-
|
|
NAME: decode
|
|
DTYPE: bfloat16
|
|
INPUT: ["LATENT"]
|
|
PARAS:
|
|
SCALE_FACTOR: 1.5305
|
|
SHIFT_FACTOR: 0.0609
|
|
SIZE_FACTOR: 8
|
|
DIFFUSION_MODEL:
|
|
FUNCTION:
|
|
-
|
|
NAME: forward
|
|
DTYPE: bfloat16
|
|
INPUT: ["SAMPLE_STEPS", "SAMPLE", "GUIDE_SCALE"]
|
|
COND_STAGE_MODEL:
|
|
FUNCTION:
|
|
-
|
|
NAME: encode
|
|
DTYPE: bfloat16
|
|
INPUT: ["PROMPT"]
|
|
#
|
|
MODEL:
|
|
NAME: LatentDiffusionFlux
|
|
PARAMETERIZATION: rf
|
|
TIMESTEPS: 1000
|
|
MIN_SNR_GAMMA:
|
|
ZERO_TERMINAL_SNR: False
|
|
PRETRAINED_MODEL:
|
|
IGNORE_KEYS: [ ]
|
|
DEFAULT_N_PROMPT:
|
|
USE_EMA: False
|
|
EVAL_EMA: False
|
|
DIFFUSION:
|
|
NAME: DiffusionFluxRF
|
|
PREDICTION_TYPE: raw
|
|
NOISE_SCHEDULER:
|
|
NAME: FlowMatchSigmaScheduler
|
|
WEIGHTING_SCHEME: logit_normal
|
|
SHIFT: 3.0
|
|
LOGIT_MEAN: 0.0
|
|
LOGIT_STD: 1.0
|
|
MODE_SCALE: 1.29
|
|
#
|
|
DIFFUSION_MODEL:
|
|
NAME: Flux
|
|
PRETRAINED_MODEL: ms://AI-ModelScope/FLUX.1-dev@flux1-dev.safetensors
|
|
IN_CHANNELS: 64
|
|
HIDDEN_SIZE: 3072
|
|
NUM_HEADS: 24
|
|
AXES_DIM: [ 16, 56, 56 ]
|
|
THETA: 10000
|
|
VEC_IN_DIM: 768
|
|
GUIDANCE_EMBED: True
|
|
CONTEXT_IN_DIM: 4096
|
|
MLP_RATIO: 4.0
|
|
QKV_BIAS: True
|
|
DEPTH: 19
|
|
DEPTH_SINGLE_BLOCKS: 38
|
|
#
|
|
FIRST_STAGE_MODEL:
|
|
NAME: AutoencoderKLFlux
|
|
EMBED_DIM: 16
|
|
PRETRAINED_MODEL: ms://AI-ModelScope/FLUX.1-dev@ae.safetensors
|
|
IGNORE_KEYS: [ ]
|
|
BATCH_SIZE: 8
|
|
USE_CONV: False
|
|
SCALE_FACTOR: 0.3611
|
|
SHIFT_FACTOR: 0.1159
|
|
#
|
|
ENCODER:
|
|
NAME: Encoder
|
|
USE_CHECKPOINT: True
|
|
CH: 128
|
|
OUT_CH: 3
|
|
NUM_RES_BLOCKS: 2
|
|
IN_CHANNELS: 3
|
|
ATTN_RESOLUTIONS: [ ]
|
|
CH_MULT: [ 1, 2, 4, 4 ]
|
|
Z_CHANNELS: 16
|
|
DOUBLE_Z: True
|
|
DROPOUT: 0.0
|
|
RESAMP_WITH_CONV: True
|
|
#
|
|
DECODER:
|
|
NAME: Decoder
|
|
USE_CHECKPOINT: True
|
|
CH: 128
|
|
OUT_CH: 3
|
|
NUM_RES_BLOCKS: 2
|
|
IN_CHANNELS: 3
|
|
ATTN_RESOLUTIONS: [ ]
|
|
CH_MULT: [ 1, 2, 4, 4 ]
|
|
Z_CHANNELS: 16
|
|
DROPOUT: 0.0
|
|
RESAMP_WITH_CONV: True
|
|
GIVE_PRE_END: False
|
|
TANH_OUT: False
|
|
#
|
|
COND_STAGE_MODEL:
|
|
NAME: T5PlusClipFluxEmbedder
|
|
T5_MODEL:
|
|
NAME: HFEmbedder
|
|
HF_MODEL_CLS: T5EncoderModel
|
|
MODEL_PATH: ms://AI-ModelScope/FLUX.1-dev@text_encoder_2/
|
|
HF_TOKENIZER_CLS: T5Tokenizer
|
|
TOKENIZER_PATH: ms://AI-ModelScope/FLUX.1-dev@tokenizer_2/
|
|
MAX_LENGTH: 512
|
|
OUTPUT_KEY: last_hidden_state
|
|
D_TYPE: bfloat16
|
|
BATCH_INFER: False
|
|
CLEAN: whitespace
|
|
#
|
|
CLIP_MODEL:
|
|
NAME: HFEmbedder
|
|
HF_MODEL_CLS: CLIPTextModel
|
|
MODEL_PATH: ms://AI-ModelScope/FLUX.1-dev@text_encoder/
|
|
HF_TOKENIZER_CLS: CLIPTokenizer
|
|
TOKENIZER_PATH: ms://AI-ModelScope/FLUX.1-dev@tokenizer/
|
|
MAX_LENGTH: 77
|
|
OUTPUT_KEY: pooler_output
|
|
D_TYPE: bfloat16
|
|
BATCH_INFER: True
|
|
CLEAN: whitespace
|
|
#
|
|
MODEL_LOCAL:
|
|
NAME: LatentDiffusionFlux
|
|
PARAMETERIZATION: rf
|
|
TIMESTEPS: 1000
|
|
MIN_SNR_GAMMA:
|
|
ZERO_TERMINAL_SNR: False
|
|
PRETRAINED_MODEL:
|
|
IGNORE_KEYS: [ ]
|
|
DEFAULT_N_PROMPT:
|
|
USE_EMA: False
|
|
EVAL_EMA: False
|
|
DIFFUSION:
|
|
NAME: DiffusionFluxRF
|
|
PREDICTION_TYPE: raw
|
|
NOISE_SCHEDULER:
|
|
NAME: FlowMatchSigmaScheduler
|
|
WEIGHTING_SCHEME: logit_normal
|
|
SHIFT: 3.0
|
|
LOGIT_MEAN: 0.0
|
|
LOGIT_STD: 1.0
|
|
MODE_SCALE: 1.29
|
|
#
|
|
DIFFUSION_MODEL:
|
|
NAME: Flux
|
|
PRETRAINED_MODEL: models/scepter/FLUX.1-dev/flux1-dev.safetensors
|
|
IN_CHANNELS: 64
|
|
HIDDEN_SIZE: 3072
|
|
NUM_HEADS: 24
|
|
AXES_DIM: [ 16, 56, 56 ]
|
|
THETA: 10000
|
|
VEC_IN_DIM: 768
|
|
GUIDANCE_EMBED: True
|
|
CONTEXT_IN_DIM: 4096
|
|
MLP_RATIO: 4.0
|
|
QKV_BIAS: True
|
|
DEPTH: 19
|
|
DEPTH_SINGLE_BLOCKS: 38
|
|
#
|
|
FIRST_STAGE_MODEL:
|
|
NAME: AutoencoderKLFlux
|
|
EMBED_DIM: 16
|
|
PRETRAINED_MODEL: models/scepter/FLUX.1-dev/ae.safetensors
|
|
IGNORE_KEYS: [ ]
|
|
BATCH_SIZE: 8
|
|
USE_CONV: False
|
|
SCALE_FACTOR: 0.3611
|
|
SHIFT_FACTOR: 0.1159
|
|
#
|
|
ENCODER:
|
|
NAME: Encoder
|
|
USE_CHECKPOINT: True
|
|
CH: 128
|
|
OUT_CH: 3
|
|
NUM_RES_BLOCKS: 2
|
|
IN_CHANNELS: 3
|
|
ATTN_RESOLUTIONS: [ ]
|
|
CH_MULT: [ 1, 2, 4, 4 ]
|
|
Z_CHANNELS: 16
|
|
DOUBLE_Z: True
|
|
DROPOUT: 0.0
|
|
RESAMP_WITH_CONV: True
|
|
#
|
|
DECODER:
|
|
NAME: Decoder
|
|
USE_CHECKPOINT: True
|
|
CH: 128
|
|
OUT_CH: 3
|
|
NUM_RES_BLOCKS: 2
|
|
IN_CHANNELS: 3
|
|
ATTN_RESOLUTIONS: [ ]
|
|
CH_MULT: [ 1, 2, 4, 4 ]
|
|
Z_CHANNELS: 16
|
|
DROPOUT: 0.0
|
|
RESAMP_WITH_CONV: True
|
|
GIVE_PRE_END: False
|
|
TANH_OUT: False
|
|
#
|
|
COND_STAGE_MODEL:
|
|
NAME: T5PlusClipFluxEmbedder
|
|
T5_MODEL:
|
|
NAME: HFEmbedder
|
|
HF_MODEL_CLS: T5EncoderModel
|
|
MODEL_PATH: models/scepter/FLUX.1-dev/text_encoder_2/
|
|
HF_TOKENIZER_CLS: T5Tokenizer
|
|
TOKENIZER_PATH: models/scepter/FLUX.1-dev/tokenizer_2/
|
|
MAX_LENGTH: 512
|
|
OUTPUT_KEY: last_hidden_state
|
|
D_TYPE: bfloat16
|
|
BATCH_INFER: False
|
|
CLEAN: whitespace
|
|
#
|
|
CLIP_MODEL:
|
|
NAME: HFEmbedder
|
|
HF_MODEL_CLS: CLIPTextModel
|
|
MODEL_PATH: models/scepter/FLUX.1-dev/text_encoder/
|
|
HF_TOKENIZER_CLS: CLIPTokenizer
|
|
TOKENIZER_PATH: models/scepter/FLUX.1-dev/tokenizer/
|
|
MAX_LENGTH: 77
|
|
OUTPUT_KEY: pooler_output
|
|
D_TYPE: bfloat16
|
|
BATCH_INFER: True
|
|
CLEAN: whitespace
|
|
#
|
|
MODEL_HF:
|
|
NAME: LatentDiffusionFlux
|
|
PARAMETERIZATION: rf
|
|
TIMESTEPS: 1000
|
|
MIN_SNR_GAMMA:
|
|
ZERO_TERMINAL_SNR: False
|
|
PRETRAINED_MODEL:
|
|
IGNORE_KEYS: [ ]
|
|
DEFAULT_N_PROMPT:
|
|
USE_EMA: False
|
|
EVAL_EMA: False
|
|
DIFFUSION:
|
|
NAME: DiffusionFluxRF
|
|
PREDICTION_TYPE: raw
|
|
NOISE_SCHEDULER:
|
|
NAME: FlowMatchSigmaScheduler
|
|
WEIGHTING_SCHEME: logit_normal
|
|
SHIFT: 3.0
|
|
LOGIT_MEAN: 0.0
|
|
LOGIT_STD: 1.0
|
|
MODE_SCALE: 1.29
|
|
#
|
|
DIFFUSION_MODEL:
|
|
NAME: Flux
|
|
PRETRAINED_MODEL: hf://black-forest-labs/FLUX.1-dev@flux1-dev.safetensors
|
|
IN_CHANNELS: 64
|
|
HIDDEN_SIZE: 3072
|
|
NUM_HEADS: 24
|
|
AXES_DIM: [ 16, 56, 56 ]
|
|
THETA: 10000
|
|
VEC_IN_DIM: 768
|
|
GUIDANCE_EMBED: True
|
|
CONTEXT_IN_DIM: 4096
|
|
MLP_RATIO: 4.0
|
|
QKV_BIAS: True
|
|
DEPTH: 19
|
|
DEPTH_SINGLE_BLOCKS: 38
|
|
#
|
|
FIRST_STAGE_MODEL:
|
|
NAME: AutoencoderKLFlux
|
|
EMBED_DIM: 16
|
|
PRETRAINED_MODEL: hf://black-forest-labs/FLUX.1-dev@ae.safetensors
|
|
IGNORE_KEYS: [ ]
|
|
BATCH_SIZE: 8
|
|
USE_CONV: False
|
|
SCALE_FACTOR: 0.3611
|
|
SHIFT_FACTOR: 0.1159
|
|
#
|
|
ENCODER:
|
|
NAME: Encoder
|
|
USE_CHECKPOINT: True
|
|
CH: 128
|
|
OUT_CH: 3
|
|
NUM_RES_BLOCKS: 2
|
|
IN_CHANNELS: 3
|
|
ATTN_RESOLUTIONS: [ ]
|
|
CH_MULT: [ 1, 2, 4, 4 ]
|
|
Z_CHANNELS: 16
|
|
DOUBLE_Z: True
|
|
DROPOUT: 0.0
|
|
RESAMP_WITH_CONV: True
|
|
#
|
|
DECODER:
|
|
NAME: Decoder
|
|
USE_CHECKPOINT: True
|
|
CH: 128
|
|
OUT_CH: 3
|
|
NUM_RES_BLOCKS: 2
|
|
IN_CHANNELS: 3
|
|
ATTN_RESOLUTIONS: [ ]
|
|
CH_MULT: [ 1, 2, 4, 4 ]
|
|
Z_CHANNELS: 16
|
|
DROPOUT: 0.0
|
|
RESAMP_WITH_CONV: True
|
|
GIVE_PRE_END: False
|
|
TANH_OUT: False
|
|
#
|
|
COND_STAGE_MODEL:
|
|
NAME: T5PlusClipFluxEmbedder
|
|
T5_MODEL:
|
|
NAME: HFEmbedder
|
|
HF_MODEL_CLS: T5EncoderModel
|
|
MODEL_PATH: hf://black-forest-labs/FLUX.1-dev@text_encoder_2/
|
|
HF_TOKENIZER_CLS: T5Tokenizer
|
|
TOKENIZER_PATH: hf://black-forest-labs/FLUX.1-dev@tokenizer_2/
|
|
MAX_LENGTH: 512
|
|
OUTPUT_KEY: last_hidden_state
|
|
D_TYPE: bfloat16
|
|
BATCH_INFER: False
|
|
CLEAN: whitespace
|
|
#
|
|
CLIP_MODEL:
|
|
NAME: HFEmbedder
|
|
HF_MODEL_CLS: CLIPTextModel
|
|
MODEL_PATH: hf://black-forest-labs/FLUX.1-dev@text_encoder/
|
|
HF_TOKENIZER_CLS: CLIPTokenizer
|
|
TOKENIZER_PATH: hf://black-forest-labs/FLUX.1-dev@tokenizer/
|
|
MAX_LENGTH: 77
|
|
OUTPUT_KEY: pooler_output
|
|
D_TYPE: bfloat16
|
|
BATCH_INFER: True
|
|
CLEAN: whitespace |