Informatik KI – Transformer und Attention
Karteikarten zum Thema „Informatik“ · 15 Karten · von atrio. Beispiele: Was berechnet der Scaled Dot-Product Attention? · Warum wird im Attention der Skalar …
Karten
15 KartenWas berechnet der Scaled Dot-Product Attention?
Rückseite
Attention(Q,K,V) = softmax(Q·K^T/√d_k)·V. Queries werden mit Keys verglichen, gewichtete Values summiert.
Warum wird im Attention der Skalar 1/√d_k verwendet?
Rückseite
Verhindert zu große Skalarprodukte bei hoher Dimensionszahl d_k, die Softmax in Sättigungsbereiche drücken und Gradienten verschwinden lassen.
Was ist der Unterschied zwischen Self-Attention und Cross-Attention?
Rückseite
Self-Attention: Q,K,V stammen aus derselben Sequenz. Cross-Attention: Q aus Decoder, K,V aus Encoder-Ausgabe.
Wie funktioniert Multi-Head-Attention?
Rückseite
Projektion von Q,K,V in h verschiedene Teilräume, parallele Attention-Berechnung, Konkatenation und finale lineare Projektion.
Welche Rolle spielt Positional Encoding im Transformer?
Rückseite
Fügt Positionsinformation hinzu, da Attention selbst permutationseinvariant ist. Meist sinusförmige Funktionen oder lernbare Embeddings.
Was passiert im Feed-Forward-Netzwerk jedes Transformer-Layers?
Rückseite
Zwei lineare Transformationen mit ReLU/GELU-Aktivierung dazwischen. Wird positionsweise unabhängig auf jedes Token angewendet.
Wozu dienen Residual Connections und Layer Normalization?
Rückseite
Residuals ermöglichen Gradientenfluss in tiefen Netzen. LayerNorm stabilisiert Aktivierungen über Feature-Dimension pro Token.
Wie unterscheidet sich BERT-Encoder von GPT-Decoder?
Rückseite
BERT nutzt bidirektionale Self-Attention (voller Kontext). GPT nutzt kausale Masked Self-Attention (nur vergangene Tokens).
Was bewirkt die kausale Maske im Decoder-Self-Attention?
Rückseite
Setzt Attention-Scores zukünftiger Positionen auf -∞ vor Softmax, sodass Tokens nur auf vorherige Positionen attendieren können.
Wie viele Parameter hat ein Transformer-Block ca. bei d_model=512, h=8, d_ff=2048?
Rückseite
Rund 3,1 Mio. Parameter: Q,K,V-Projektionen (3×512²), Output-Projektion (512²), zwei FFN-Layer (2×512×2048 + 2048×512).
Was ist der Zweck von Masked Language Modeling bei BERT?
Rückseite
Zufällige 15% Tokens werden maskiert; Modell muss sie aus bidirektionalem Kontext vorhersagen. Erlernt tiefe bidirektionale Repräsentationen.
Wie generiert GPT Text autoregressiv?
Rückseite
Bei jedem Schritt wird nächster Token aus Distribution über Vokabular gesampelt, an Input angehängt, nächster Forward-Pass ausgeführt.
Was versteht man unter Attention-Heads als 'spezialisierte Rollen'?
Rückseite
Verschiedene Heads lernen unterschiedliche Relationen: syntaktische Abhängigkeiten, Korreferenzauflösung, Positionsmuster etc.
Warum skaliert Attention quadratisch mit Sequenzlänge?
Rückseite
Attention-Matrix ist n×n für n Tokens. Speicher und Rechenaufwand wachsen mit O(n²), was lange Sequenzen limitiert.
Nenne zwei Methoden zur Reduktion der quadratischen Attention-Komplexität.
Rückseite
Sparse Attention (z. B. Longformer), Lineare Attention (Kernel-Trick), Flash Attention (IO-bewusst), oder State-Space-Modelle (Mamba).