Clicked Gallery

Was ist ein Transformer (in der KI)?

Markiert in einem echten Engineering-Dokument. Erklärt von Clicked.

Im Satz verwendet

Engineering Notes · AI Systems

The paper proposes a leaner transformer that cuts training costs by nearly a third.

Der Leser markierte ein Wort in der Dokumentation. Clicked erklärte den Fachbegriff „transformer“ ganz einfach:

In drei Stufen erklärt

Gleiche Fakten, anderer Vibe — Slang-Modus 😎

Die Clicked-Methode

●○○

Overview

Der Transformer ist das Design hinter fast der gesamten modernen KI, das T in GPT, und sein Durchbruch ist, alles auf einmal zu lesen statt Wort für Wort. Das gelingt durch Attention: Jedes Wort betrachtet gleichzeitig alle anderen und gewichtet, welche für seine Bedeutung zählen. Diese eine Änderung machte die heutigen Riesenmodelle möglich.
●○○

Overview

Der Transformer ist der Bauplan unter praktisch jeder modernen KI, das T in GPT. Sein einer großer Trick: Jedes Wort schaut gleichzeitig auf alle anderen und gewichtet, was zählt, also liest das Modell alles auf einmal statt der Reihe nach. Genau das ließ die KI riesig werden. 😎

Die Kurzfassung — oft reicht sie schon.

●●○

Detail

Der Transformer ist ein neuronales Netzdesign, dessen ganzer Vorteil darin liegt, alles auf einmal zu lesen. Frühere Designs lasen Wort für Wort mit verblassender Erinnerung: lange Passagen wurden unscharf, und nichts war berechenbar, bevor das vorige Wort fertig war. Das 2017er-Paper Attention Is All You Need löste beides auf einmal. Sein Attention-Mechanismus lässt jedes Token, grob jedes Wortstück, direkt auf alle anderen blicken und bewerten, wie sehr sie zählen. Im Satz "der Hund jagte seinen Schwanz" ist Attention das, was das Wort "seinen" den Hund über den Satz hinweg finden lässt, ganz ohne Erinnerungskette. Jede Schicht nutzt diese Bewertungen, um zu schärfen, was jedes Wort in seinem Kontext bedeutet, und viele gestapelte Schichten machen aus rohen Wörtern verstandene Bedeutung. Das parallele Lesen erklärt auch die Größenexplosion: Da kein Wort auf ein anderes wartet, verteilt sich das Training auf tausende Chips, und erst das machte Internet-Maßstab praktikabel. Der Preis von Jeder-schaut-auf-jeden: Die Arbeit wächst steil mit der Textlänge, weshalb jedes Modell ein Kontextfenster hat, eine harte Obergrenze des auf einmal Betrachtbaren.
●●○

Detail

Ein Trick, gewaltige Folgen: alles auf einmal lesen statt Wort für Wort. Die alten Modelle waren Flüsterketten, jedes Wort wartete auf das letzte, während die Erinnerung leckte, also kamen lange Dokumente vorn verschwommen an. Dann erschien 2017 Attention Is All You Need, ein Angeber-Titel, der tatsächlich lieferte. Jedes Token darf jedes andere direkt anstarren und bewerten, wer ihm wichtig ist, also findet im Satz "der Hund jagte seinen Schwanz" das Wort "seinen" den Hund quer durch den Satz, keine Kette, kein Leck. Jede Schicht schärft diese Bewertungen, und genug gestapelte Schichten bringen das Modell vom Buchstabieren zum Verstehen. Nebenwirkung eins: Nichts wartet auf irgendwas, also verteilt sich das Training auf tausende Chips, daher Modelle, die das ganze Internet gefüttert bekamen. Nebenwirkung zwei: Jeder-starrt-auf-jeden wird mit wachsendem Text schnell teuer, weshalb dein Modell buchstäblich am Kontextfenster schlappmacht. 😎

Mehr? Ein Klick geht tiefer.

●●●

Analogy

Zwei Arten, wie ein Ermittlerteam eine Akte bearbeitet. Die alte: Ein Ermittler liest sie von vorn bis hinten vor, alle verlassen sich auf die Erinnerung an das Vorherige, und die Details von Seite zwei sind auf Seite neunzig verschwommen. Die Transformer-Art: Alle Seiten hängen gleichzeitig an der Korkwand, und zwischen verwandten Hinweisen sind Fäden gespannt, dieses Alibi zu jenem Zeitstempel, der Name auf Seite neunzig zum Zeugen auf Seite zwei. Die Bedeutung entsteht aus den Fäden, und keine Seite verschwimmt, nur weil sie früh kam.
●●●

Analogy

Eine Reise per Sprachnachrichten-Kette planen gegen einen Gruppenchat. Kette: Jeder Freund hört nur die Nacherzählung des vorigen, und beim achten Anruf ist der Hotelname zermatscht und die Daten sind Fiktion. Gruppenchat: Jede neue Nachricht kann hochscrollen und jede frühere direkt lesen, genau die zitieren, die zählt, und den Rest ignorieren, also zermatscht die Kette nichts mehr. Der eine Preis: Je länger der Chat, desto mehr Scrollen kostet jede einzelne Antwort.

Neues Konzept? Ein Alltagsbeispiel macht’s greifbar — neue Analogien auf Knopfdruck.

KI-Erklärungen können Fehler enthalten · Keine professionelle Beratung

Formale Definition — Derselbe Begriff, wie er sonst erklärt wird

Der Transformer ist eine auf Self-Attention basierende neuronale Netzarchitektur, in der jedes Token gewichtete Relevanzen über alle anderen Tokens der Eingabe berechnet, was parallele Sequenzverarbeitung ohne Rekurrenz erlaubt. 2017 von Vaswani et al. eingeführt, bildet er die Grundlage moderner großer Sprachmodelle; die quadratischen Attention-Kosten motivieren feste Kontextfenster und Forschung an effizienten Varianten.

Soll Clicked Begriffe wie „transformer“ direkt in deinem Browser erklären – auch in PDFs?

Zu Chrome hinzufügen — Kostenlos

50 kostenlose Erklärungen · Keine Kreditkarte nötig