Technik

Attention-Mechanismus

Der Attention-Mechanismus ist das Kernprinzip des Transformer-Modells: Das Modell lernt, welche Teile des Inputs für die Vorhersage des nächsten Tokens besonders relevant sind. Bei einem langen Text "achtet" das Modell auf die wichtigsten Wörter und Sätze, unabhängig von deren Position. Dies ermöglicht das Verständnis langer Texte und Zusammenhänge, die weit auseinander liegen.

Was ist der Attention-Mechanismus?

Der Attention-Mechanismus ist das mathematische Kernprinzip moderner Sprachmodelle und die zentrale Innovation der Transformer-Architektur, die 2017 im berühmten Paper „Attention Is All You Need" vorgestellt wurde. Die Grundidee: Statt einen Text stur Wort für Wort zu verarbeiten, lernt das Modell, welche Teile der Eingabe für die aktuelle Vorhersage besonders relevant sind – es „achtet" gezielt auf die wichtigen Stellen, unabhängig davon, wie weit sie im Text auseinanderliegen.

Wie funktioniert Attention?

Bei der sogenannten Self-Attention vergleicht das Modell jedes Token mit allen anderen Tokens der Eingabe. Vereinfacht läuft das in drei Schritten ab:

  • Jedes Token wird in drei Vektoren übersetzt: Query (wonach suche ich?), Key (was biete ich an?) und Value (welche Information trage ich?).
  • Das Modell berechnet, wie stark die Query eines Tokens zu den Keys aller anderen Tokens passt. Daraus entstehen Attention-Gewichte – hohe Gewichte bedeuten hohe Relevanz.
  • Die Values werden entsprechend dieser Gewichte gemischt: Das Token „sieht" vor allem die Informationen der für es relevanten Tokens.
  • Im Satz „Die Katze, die gestern auf dem Dach saß, miaute laut" kann das Modell so erkennen, dass sich „miaute" auf „Katze" bezieht – obwohl mehrere Wörter dazwischen liegen. Moderne Modelle nutzen Multi-Head Attention: Viele parallele Attention-„Köpfe" achten gleichzeitig auf unterschiedliche Aspekte wie Grammatik, Bedeutung oder Bezüge.

    Warum ist Attention so wichtig?

    Vor dem Attention-Mechanismus verarbeiteten rekurrente Netze (RNNs, LSTMs) Text sequenziell – Informationen vom Satzanfang „verblassten" bis zum Satzende. Attention löste dieses Problem gleich doppelt:

  • Lange Abhängigkeiten: Zusammenhänge über tausende Tokens hinweg bleiben erfassbar – die Grundlage für große Kontextfenster.
  • Parallelisierbarkeit: Alle Tokens können gleichzeitig verarbeitet werden, was Training auf GPUs erst effizient macht und das Skalieren zu heutigen Großmodellen ermöglichte.

Grenzen und Weiterentwicklungen

Klassische Self-Attention hat quadratischen Aufwand: Doppelt so langer Text bedeutet viermal so viel Rechenarbeit. Deshalb wurden effizientere Varianten entwickelt, etwa Flash Attention (optimierte Berechnung auf GPUs), Sliding-Window-Attention (jedes Token sieht nur eine Umgebung) oder Grouped-Query-Attention, die Speicherbedarf bei der Inferenz reduziert. Solche Techniken machen die heutigen Kontextfenster von Hunderttausenden Tokens überhaupt erst praktikabel und bezahlbar.

Passende KI-Tools

Diese KI-Tools stehen in direktem Zusammenhang mit dem Begriff Attention-Mechanismus: