From e5ef9752a7e846b232fc05fd993327a2e870a788 Mon Sep 17 00:00:00 2001 From: kijai <40791699+kijai@users.noreply.github.com> Date: Mon, 8 Sep 2025 18:54:29 +0300 Subject: [PATCH] Fix fp8_fast when not using loras --- fp8_optimization.py | 3 +-- 1 file changed, 1 insertion(+), 2 deletions(-) diff --git a/fp8_optimization.py b/fp8_optimization.py index 33d6f60..217ab86 100644 --- a/fp8_optimization.py +++ b/fp8_optimization.py @@ -56,8 +56,7 @@ def convert_fp8_linear(module, base_dtype, params_to_keep={}, scale_weight_keys= if scale_weight_keys is not None: scale_key = f"{name}.scale_weight" if scale_key in scale_weight_keys: - print("Setting scale_weight for", name) - setattr(submodule, "scale_weight", scale_weight_keys[scale_key]) + setattr(submodule, "scale_weight", scale_weight_keys[scale_key].float()) original_forward = submodule.forward setattr(submodule, "original_forward", original_forward) setattr(submodule, "forward", lambda input, m=submodule: fp8_linear_forward(m, base_dtype, input))