Clicked Gallery

Was ist Quantisierung?

Markiert in einem echten Engineering-Dokument. Erklärt von Clicked.

Im Satz verwendet

Engineering Notes · AI Systems

The 4-bit quantization cut memory use enough to run the model on a single consumer GPU.

Der Leser markierte ein Wort in der Dokumentation. Clicked erklärte den Fachbegriff „quantization“ ganz einfach:

In drei Stufen erklärt

Gleiche Fakten, anderer Vibe — Slang-Modus 😎

Die Clicked-Methode

●○○

Overview

Quantisierung schrumpft ein KI-Modell, indem sie seine Zahlen mit geringerer Genauigkeit speichert. Jede Zahl braucht weniger Speicher, das Modell läuft also auf kleinerer, billigerer Hardware. Gut gemacht, sinkt die Qualität kaum.
●○○

Overview

Quantisierung heißt, das Modell auf Diät setzen: gleiches Hirn, Zahlen schlampiger gespeichert. Halber oder viertel Speicher, und es merkt es kaum. 😎

Die Kurzfassung — oft reicht sie schon.

●●○

Detail

Ein Modell besteht aus Milliarden Zahlen, den Gewichten, normalerweise mit 16 Bit pro Stück gespeichert. Quantisierung codiert sie auf 8 oder 4 Bit um, ein Modell mit 70 Milliarden Gewichten fällt so von rund 140 Gigabyte auf etwa 35 bei 4 Bit. Die volle Version passt nicht einmal auf eine Rechenzentrums-GPU, während die geschrumpfte auf eine einzige High-End-Consumer-Grafikkarte passt. Der Trick funktioniert, weil sich Gewichte in engen Bereichen ballen, eine gut gewählte grobe Skala verliert also wenig: Benchmark-Werte sinken bei 8 Bit typischerweise um wenige Prozent und bleiben bei 4 brauchbar. Darunter wird es holprig, und 2-Bit-Versionen sind oft spürbar schlechter. Meist steigt sogar die Geschwindigkeit: Das Langsame am Betrieb eines Modells ist das Holen all dieser Zahlen aus dem Speicher, und kleinere Zahlen bedeuten weniger zu holen. Das ist der Hauptgrund, warum lokale KI überhaupt existiert und Leute die Spitzenmodelle von gestern auf Gaming-Hardware betreiben.
●●○

Detail

Ein Modell ist nur Milliarden Zahlen, und ab Werk verbrennen die 16 Bit pro Zahl. Codier auf 4 Bit um und ein 70B-Modell schrumpft von rund 140 GB auf etwa 35, das ist die Linie zwischen nicht auf eine Rechenzentrums-GPU passen und auf dem Gaming-Rechner laufen. Die Zahlen drängeln sich sowieso in engen Bereichen, grobes Runden kostet also erstaunlich wenig: ein paar Prozent in Benchmarks bei 8 Bit, bei 4 immer noch solide. Presse auf 2 Bit und die Räder fangen an zu eiern. Bonus: Es läuft meist schneller, denn langsam ist das Holen der Zahlen, nicht das Rechnen. Dieser eine Trick ist im Grunde der Grund, warum lokale KI ein Hobby ist und keine Fantasie. 😎

Mehr? Ein Klick geht tiefer.

●●●

Analogy

Ein Foto zum Versenden verkleinern. Die Originaldatei ist riesig; mit geringerer Qualität gespeichert schrumpft sie auf ein Zehntel, und auf dem Handybildschirm merkt niemand etwas. Zoomst du weit genug hinein, findest du die Schlieren, doch für den Alltag erfüllt das Bild seinen Zweck.
●●●

Analogy

MP3s. Niemand speichert Alben als rohe Studiodateien; du behältst ein Zehntel der Daten und deine Ohrhörer merken keinen Unterschied. Audiophile schwören, sie hören den Verlust, Blindtests sagen kaum, und derweil passt die ganze Sammlung in die Hosentasche.

Neues Konzept? Ein Alltagsbeispiel macht’s greifbar — neue Analogien auf Knopfdruck.

KI-Erklärungen können Fehler enthalten · Keine professionelle Beratung

Formale Definition — Derselbe Begriff, wie er sonst erklärt wird

Quantisierung bildet Modellparameter von höherpräzisen Gleitkommadarstellungen auf Formate geringerer Bitbreite ab und reduziert Speicherbedarf und Bandbreitenanforderungen bei der Inferenz. Post-Training-Quantisierung und quantisierungsbewusstes Training tauschen Implementierungsaufwand gegen Genauigkeitserhalt, mit meist moderater Verschlechterung bei 8 Bit und zunehmend erheblicher unterhalb von 4 Bit.

Soll Clicked Begriffe wie „quantization“ direkt in deinem Browser erklären – auch in PDFs?

Zu Chrome hinzufügen — Kostenlos

50 kostenlose Erklärungen · Keine Kreditkarte nötig