arXiv cs.LGOctober 7, 2026
AlignQuant: Tile-Aligned Mixed-Precision Quantization for Efficient LLM Generation
Excerpt
arXiv:2610.07457v1 Announce Type: new Abstract: Fine-grained mixed-precision quantization promises efficient large language model inference, but local precision choices can conflict with regular GPU storage and computation units. This precision-boundary mismatch limits the translation of compression into practical acceleration. We introduce AlignQuant, a post-training quantization method that uses GPU-compatible two-dimensional weight tiles as the common unit of precision allocation, compact sto