Cleanup the text part of the clip model as redundant as it's not even used

This commit is contained in:
kijai
2025-03-02 01:44:19 +02:00
parent 7593e26457
commit fa3d61cb45
6 changed files with 2 additions and 72 deletions
Binary file not shown.
-15
View File
@@ -1,15 +0,0 @@
{
"bos_token": "<s>",
"cls_token": "<s>",
"eos_token": "</s>",
"mask_token": {
"content": "<mask>",
"lstrip": true,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": "<pad>",
"sep_token": "</s>",
"unk_token": "<unk>"
}
-19
View File
@@ -1,19 +0,0 @@
{
"bos_token": "<s>",
"clean_up_tokenization_spaces": true,
"cls_token": "<s>",
"eos_token": "</s>",
"mask_token": {
"__type": "AddedToken",
"content": "<mask>",
"lstrip": true,
"normalized": true,
"rstrip": false,
"single_word": false
},
"model_max_length": 512,
"pad_token": "<pad>",
"sep_token": "</s>",
"tokenizer_class": "XLMRobertaTokenizer",
"unk_token": "<unk>"
}
@@ -1,15 +0,0 @@
{
"bos_token": "<s>",
"cls_token": "<s>",
"eos_token": "</s>",
"mask_token": {
"content": "<mask>",
"lstrip": true,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": "<pad>",
"sep_token": "</s>",
"unk_token": "<unk>"
}
+1 -3
View File
@@ -641,13 +641,11 @@ class LoadWanVideoClipTextEncoder:
text_encoder_load_device = device if load_device == "main_device" else offload_device
tokenizer_path = os.path.join(script_directory, "configs", "clip")
dtype = {"bf16": torch.bfloat16, "fp16": torch.float16, "fp32": torch.float32}[precision]
model_path = folder_paths.get_full_path("text_encoders", model_name)
sd = load_torch_file(model_path, safe_load=True)
clip_model = CLIPModel(dtype=dtype, device=device, state_dict=sd, tokenizer_path=tokenizer_path)
clip_model = CLIPModel(dtype=dtype, device=device, state_dict=sd)
clip_model.model.to(text_encoder_load_device)
del sd
+1 -20
View File
@@ -393,17 +393,6 @@ class XLMRobertaCLIP(nn.Module):
proj_dropout=proj_dropout,
embedding_dropout=embedding_dropout,
norm_eps=norm_eps)
# self.textual = XLMRobertaWithHead(
# vocab_size=vocab_size,
# max_seq_len=max_text_len,
# type_size=type_size,
# pad_id=pad_id,
# dim=text_dim,
# out_dim=embed_dim,
# num_heads=text_heads,
# num_layers=text_layers,
# post_norm=text_post_norm,
# dropout=text_dropout)
self.log_scale = nn.Parameter(math.log(1 / 0.07) * torch.ones([]))
def forward(self, imgs, txt_ids):
@@ -503,10 +492,9 @@ def clip_xlm_roberta_vit_h_14(
class CLIPModel:
def __init__(self, dtype, device, state_dict, tokenizer_path):
def __init__(self, dtype, device, state_dict):
self.dtype = dtype
self.device = device
self.tokenizer_path = tokenizer_path
# init model
with init_empty_weights():
@@ -521,13 +509,6 @@ class CLIPModel:
for name, param in self.model.named_parameters():
set_module_tensor_to_device(self.model, name, device=device, dtype=dtype, value=state_dict[name])
#self.model.load_state_dict(state_dict)
# init tokenizer
self.tokenizer = HuggingfaceTokenizer(
name=tokenizer_path,
seq_len=self.model.max_text_len - 2,
clean='whitespace')
def visual(self, image):
# forward