Clicked Gallery

Was ist Inferenz (in der KI)?

Markiert in einem echten Engineering-Dokument. Erklärt von Clicked.

Im Satz verwendet

Engineering Notes · AI Systems

The chipmaker's newest processors target inference rather than training, where the volume is.

Der Leser markierte ein Wort in der Dokumentation. Clicked erklärte den Fachbegriff „inference“ ganz einfach:

In drei Stufen erklärt

Gleiche Fakten, anderer Vibe — Slang-Modus 😎

Die Clicked-Methode

●○○

Overview

Inferenz ist ein KI-Modell bei seiner eigentlichen Arbeit: Deine Frage geht hinein, eine Antwort kommt heraus, mit dem, was das Training ihm beigebracht hat. Training ist der einmalige Bau; Inferenz ist jede Nutzung danach. Klingt nach der billigen Hälfte, und pro Antwort ist sie das auch, nur läuft sie milliardenfach am Tag.
●○○

Overview

Inferenz ist das Modell bei der eigentlichen Arbeit: Frage rein, Antwort raus, mit Reglern, die das Training längst eingestellt hat. Training ist der eine riesige Bau; Inferenz ist jede einzelne Nutzung danach. Eine Antwort kostet Cent-Bruchteile, aber mal Milliarden, und genau da geht das Geld hin. 😎

Die Kurzfassung — oft reicht sie schon.

●●○

Detail

Inferenz ist alles, was zwischen deiner Frage und der Antwort passiert, und sie ist eine völlig andere Arbeit als das Training. Das Training passiert einmal und verbrennt über Wochen enorme Rechenleistung, um die inneren Regler des Modells einzustellen. Die Inferenz lässt diese fertig eingestellten Regler über eine neue Eingabe laufen: Zahlen fließen durch, eine Antwort kommt heraus, und im Modell ändert sich nichts. Deshalb kostet eine einzelne Antwort einen Bruchteil eines Cents, während das Training desselben Modells Millionen kostete. Der Haken ist die Menge, denn ein beliebter Assistent beantwortet Milliarden Fragen, und ein Bruchteil eines Cents mal Milliarden landet am Ende auf der Stromrechnung. Diese Rechnung erklärt, warum die Branche so hart daran arbeitet, Modelle mit Quantisierung und Destillation zu schrumpfen, und warum Chiphersteller inzwischen Prozessoren für die Inferenz statt für das Training entwerfen.
●●○

Detail

Training ist der Berg, den du einmal besteigst. Inferenz ist jeder Schritt danach: Deine Frage geht rein, Zahlen rasen durch das fertig getunte Modell, eine Antwort kommt raus, und drinnen ändert sich nichts, weshalb eine Antwort einen Bruchteil eines Cents kostet. Harmlos, bis du multiplizierst, denn ein beliebter Assistent bearbeitet Milliarden Fragen, und Cent-Bruchteile mal Milliarden sind eine echte Stromrechnung mit echten Chips dahinter. Also schwitzt die ganze Branche über der Inferenz, schrumpft Modelle mit Quantisierung und Destillation, und Chiphersteller liefern längst Silizium, das für Inferenz statt für Training gebaut ist. Das Training macht die Schlagzeilen; die Inferenz macht die Rechnung. 😎

Mehr? Ein Klick geht tiefer.

●●●

Analogy

Für eine Prüfung lernen gegen die Prüfung schreiben. Das Lernen ist anstrengend, teuer und passiert einmal; die Prüfung sind zwei Stunden, in denen du nutzt, was du schon kannst, ganz ohne neues Lernen. Ein Student in einer Prüfung ist neben dem Lernen belanglos. Aber lass dieselbe Prüfung täglich von fünfzigtausend Studenten schreiben, und es ist der Prüfungssaal, nicht das Lernen, der das Budget sprengt.
●●●

Analogy

Fahren lernen gegen zur Arbeit fahren. Die Fahrstunden, die Prüfungen, das erste furchteinflößende Einparken: teuer, anstrengend, vorbei. Der Arbeitsweg nutzt einfach, was du schon kannst, und verbrennt etwas Benzin. Fahr den Weg zehn Jahre lang zweimal täglich, und das Benzin überholt die Fahrstunden ganz leise.

Neues Konzept? Ein Alltagsbeispiel macht’s greifbar — neue Analogien auf Knopfdruck.

KI-Erklärungen können Fehler enthalten · Keine professionelle Beratung

Formale Definition — Derselbe Begriff, wie er sonst erklärt wird

Inferenz bezeichnet die Ausführung eines trainierten Modells auf einer neuen Eingabe zur Erzeugung einer Ausgabe, im Unterschied zum Training, das die Parameter des Modells bestimmt. Die Inferenz aktualisiert keine Parameter, wiederholt sich jedoch bei jeder Anfrage, wodurch ihre aggregierte Rechenlast, Latenz und Energie zum dominierenden Betriebskostenfaktor produktiver Systeme werden und Optimierungen wie Quantisierung, Destillation und inferenzspezialisierte Hardware motivieren.

Soll Clicked Begriffe wie „inference“ direkt in deinem Browser erklären – auch in PDFs?

Zu Chrome hinzufügen — Kostenlos

50 kostenlose Erklärungen · Keine Kreditkarte nötig