Reddit r/LocalLLaMASeptember 24, 2026
vulkan: int8 coopmat1 matmul implementation for AMD RDNA3 and RDNA4 (… · ggml-org/llama.cpp@70c4e15
Excerpt
This has made a massive improvement in performance on my 7900XTX before: | model | size | params | backend | ngl | n_ubatch | fa | test | t/s | | ------------------------------ | ---------: | ---------: | ---------- | --: | -------: | --: | --------------: | -------------------: | | gemma4 26B.A4B Q4_0 | 13.26 GiB | 25.23 B | Vulkan | -1 | 1024 | 1 | pp512 | 3410.53 ± 22.72 | | gemma4 26B.A4B Q4_0 | 13.26 GiB | 25.23 B | Vulkan | -1 | 1024 | 1 | tg128 | 135.64 ± 0.80 | | gemma4 26B.A4B Q4_0 | 13