TL;DR
Post-training quantization (PTQ) can lead to significant accuracy loss when converting models to low-bit weights. Quantization-aware training (QAT) integrates quantization into the training process, helping to recover accuracy.
✦ Why It Matters
Engineers can leverage QAT to maintain model accuracy while reducing computational resource requirements.
Key Takeaways
How It Works
The proposed geometric framework visualizes model training as navigating a low-loss river within a valley. When quantization grids are misaligned with the basin's width, PTQ can lead to high-loss quantized points.
QAT addresses this by evaluating gradients at quantized weights, which helps steer updates back into the low-loss basin, effectively recovering accuracy.
Related