Reduzierung der numerischen Genauigkeit von Modellgewichten, um Speicher- und Inferenzkosten zu senken.