Informatik KI – Sprachmodelle und Tokenisierung
Karteikarten zum Thema „Informatik“ · 15 Karten · von atrio. Beispiele: Was ist ein Large Language Model (LLM)? · Welche Funktion hat die Tokenisierung in LLMs?
Karten
15 KartenWas ist ein Large Language Model (LLM)?
Rückseite
Ein neuronales Netz, das auf riesigen Textkorpora trainiert wurde, um die Wahrscheinlichkeitsverteilung des nächsten Tokens vorherzusagen.
Welche Funktion hat die Tokenisierung in LLMs?
Rückseite
Sie zerlegt Rohtext in diskrete Einheiten (Tokens), die dem Modell als numerische IDs zur Verarbeitung dienen.
Wie funktioniert Byte Pair Encoding (BPE) bei der Tokenisierung?
Rückseite
BPE fusioniert iterativ die häufigsten Zeichenpaare zu neuen Tokens, bis eine vordefinierte Vokabulargröße erreicht ist.
Was ist der Unterschied zwischen Word-Level und Subword-Tokenisierung?
Rückseite
Word-Level nutzt ganze Wörter als Tokens, Subword (z. B. BPE) zerlegt seltene Wörter in bekannte Teilstücke – robuster bei OOV-Wörtern.
Welche Kernkomponenten hat die Transformer-Architektur?
Rückseite
Encoder-Decoder-Struktur mit Self-Attention, Feed-Forward-Layern, Residual Connections, Layer Normalization und Positional Encoding.
Wie berechnet Self-Attention die Relevanz zwischen Tokens?
Rückseite
Durch Skalarprodukt von Query- und Key-Vektoren, skaliert durch Wurzeldimension, dann Softmax für Attention-Weights, angewendet auf Value-Vektoren.
Wozu dient Multi-Head Attention im Transformer?
Rückseite
Parallele Attention-Köpfe erfassen unterschiedliche Beziehungstypen (z. B. syntaktisch, semantisch) zwischen Token-Positionen simultan.
Warum ist Positional Encoding in Transformern notwendig?
Rückseite
Self-Attention ist permutationseinvariant – Positional Encoding injiziert Positionsinformation via sinusförmige Funktionen oder lernbare Embeddings.
Was sind Token Embeddings in LLMs?
Rückseite
Dichte Vektorrepräsentationen jedes Tokens, die semantische Ähnlichkeiten im hochdimensionalen Raum abbilden und während des Trainings gelernt werden.
Welches Trainingsziel verfolgen autoregressive Sprachmodelle wie GPT?
Rückseite
Next-Token-Prediction: Minimierung der Kreuzentropie zwischen vorhergesagter und tatsächlicher Wahrscheinlichkeitsverteilung des nachfolgenden Tokens.
Was begrenzt die Context Window eines Sprachmodells?
Rückseite
Die maximale Sequenzlänge, die das Positional Encoding und die Attention-Matrix (quadratischer Speicherbedarf) verarbeiten können.
Wie beeinflussen Temperature und Top-p das Sampling-Verhalten?
Rückseite
Temperature skaliert Logits vor Softmax (höher = diverser), Top-p (Nucleus Sampling) schneidet das Wahrscheinlichkeitsschwanz ab, kumulativ bis Schwelle p.
Unterscheide Pre-Training und Fine-Tuning bei LLMs.
Rückseite
Pre-Training: selbstüberwacht auf riesigen Korpora (Next-Token-Prediction). Fine-Tuning: überwacht auf spezifischen Tasks/Daten mit Anweisungsdaten (Instruction Tuning).
Was verursacht Halluzinationen in Sprachmodellen?
Rückseite
Modell generiert plausibel klingende, aber faktisch falsche Inhalte durch probabilistisches Sampling ohne Wissensabgleich – oft bei Wissenslücken oder mehrdeutigen Prompts.
Nenne drei Techniken des Prompt Engineerings für bessere LLM-Ergebnisse.
Rückseite
Few-Shot-Beispiele geben, Chain-of-Thought-Aufforderung (Schritt-für-Schritt-Denken), Rollenzuweisung (z. B. 'Agieren als Experte für...').