From f3136dd20cea08bed773a29b722874f5d91c5faa Mon Sep 17 00:00:00 2001 From: Adrien Toupet Date: Fri, 12 Dec 2025 11:05:31 -0500 Subject: [PATCH] Fix GGUF dequantization shape error on MPS (#403) Skip GGUF quantized buffers in _force_nadit_precision - these must remain in packed format for on-the-fly dequantization during inference. --- src/optimization/compatibility.py | 5 ++++- 1 file changed, 4 insertions(+), 1 deletion(-) diff --git a/src/optimization/compatibility.py b/src/optimization/compatibility.py index cb386c8..09463c3 100644 --- a/src/optimization/compatibility.py +++ b/src/optimization/compatibility.py @@ -826,8 +826,11 @@ class CompatibleDiT(torch.nn.Module): param.data = param.data.to(target_dtype) converted_count += 1 - # Also convert buffers + # Also convert buffers (skip GGUF quantized buffers - they have tensor_type attribute) for name, buffer in self.dit_model.named_buffers(): + # Skip GGUF quantized buffers - these must stay in packed format for on-the-fly dequantization + if hasattr(buffer, 'tensor_type'): + continue if buffer.dtype != target_dtype: if buffer.device.type == "mps": temp_cpu = buffer.data.to("cpu")