Cleanup the text part of the clip model as redundant as it's not even used
This commit is contained in:
Binary file not shown.
@@ -1,15 +0,0 @@
|
||||
{
|
||||
"bos_token": "<s>",
|
||||
"cls_token": "<s>",
|
||||
"eos_token": "</s>",
|
||||
"mask_token": {
|
||||
"content": "<mask>",
|
||||
"lstrip": true,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"pad_token": "<pad>",
|
||||
"sep_token": "</s>",
|
||||
"unk_token": "<unk>"
|
||||
}
|
||||
@@ -1,19 +0,0 @@
|
||||
{
|
||||
"bos_token": "<s>",
|
||||
"clean_up_tokenization_spaces": true,
|
||||
"cls_token": "<s>",
|
||||
"eos_token": "</s>",
|
||||
"mask_token": {
|
||||
"__type": "AddedToken",
|
||||
"content": "<mask>",
|
||||
"lstrip": true,
|
||||
"normalized": true,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"model_max_length": 512,
|
||||
"pad_token": "<pad>",
|
||||
"sep_token": "</s>",
|
||||
"tokenizer_class": "XLMRobertaTokenizer",
|
||||
"unk_token": "<unk>"
|
||||
}
|
||||
@@ -1,15 +0,0 @@
|
||||
{
|
||||
"bos_token": "<s>",
|
||||
"cls_token": "<s>",
|
||||
"eos_token": "</s>",
|
||||
"mask_token": {
|
||||
"content": "<mask>",
|
||||
"lstrip": true,
|
||||
"normalized": false,
|
||||
"rstrip": false,
|
||||
"single_word": false
|
||||
},
|
||||
"pad_token": "<pad>",
|
||||
"sep_token": "</s>",
|
||||
"unk_token": "<unk>"
|
||||
}
|
||||
@@ -641,13 +641,11 @@ class LoadWanVideoClipTextEncoder:
|
||||
|
||||
text_encoder_load_device = device if load_device == "main_device" else offload_device
|
||||
|
||||
tokenizer_path = os.path.join(script_directory, "configs", "clip")
|
||||
|
||||
dtype = {"bf16": torch.bfloat16, "fp16": torch.float16, "fp32": torch.float32}[precision]
|
||||
|
||||
model_path = folder_paths.get_full_path("text_encoders", model_name)
|
||||
sd = load_torch_file(model_path, safe_load=True)
|
||||
clip_model = CLIPModel(dtype=dtype, device=device, state_dict=sd, tokenizer_path=tokenizer_path)
|
||||
clip_model = CLIPModel(dtype=dtype, device=device, state_dict=sd)
|
||||
clip_model.model.to(text_encoder_load_device)
|
||||
del sd
|
||||
|
||||
|
||||
@@ -393,17 +393,6 @@ class XLMRobertaCLIP(nn.Module):
|
||||
proj_dropout=proj_dropout,
|
||||
embedding_dropout=embedding_dropout,
|
||||
norm_eps=norm_eps)
|
||||
# self.textual = XLMRobertaWithHead(
|
||||
# vocab_size=vocab_size,
|
||||
# max_seq_len=max_text_len,
|
||||
# type_size=type_size,
|
||||
# pad_id=pad_id,
|
||||
# dim=text_dim,
|
||||
# out_dim=embed_dim,
|
||||
# num_heads=text_heads,
|
||||
# num_layers=text_layers,
|
||||
# post_norm=text_post_norm,
|
||||
# dropout=text_dropout)
|
||||
self.log_scale = nn.Parameter(math.log(1 / 0.07) * torch.ones([]))
|
||||
|
||||
def forward(self, imgs, txt_ids):
|
||||
@@ -503,10 +492,9 @@ def clip_xlm_roberta_vit_h_14(
|
||||
|
||||
class CLIPModel:
|
||||
|
||||
def __init__(self, dtype, device, state_dict, tokenizer_path):
|
||||
def __init__(self, dtype, device, state_dict):
|
||||
self.dtype = dtype
|
||||
self.device = device
|
||||
self.tokenizer_path = tokenizer_path
|
||||
|
||||
# init model
|
||||
with init_empty_weights():
|
||||
@@ -521,13 +509,6 @@ class CLIPModel:
|
||||
|
||||
for name, param in self.model.named_parameters():
|
||||
set_module_tensor_to_device(self.model, name, device=device, dtype=dtype, value=state_dict[name])
|
||||
#self.model.load_state_dict(state_dict)
|
||||
|
||||
# init tokenizer
|
||||
self.tokenizer = HuggingfaceTokenizer(
|
||||
name=tokenizer_path,
|
||||
seq_len=self.model.max_text_len - 2,
|
||||
clean='whitespace')
|
||||
|
||||
def visual(self, image):
|
||||
# forward
|
||||
|
||||
Reference in New Issue
Block a user