Zur Community

Informatik KI – Sprachmodelle und Tokenisierung

15 KartenInformatikatrio02.10.2026Nur mit Link

Karteikarten zum Thema „Informatik“ · 15 Karten · von atrio. Beispiele: Was ist ein Large Language Model (LLM)? · Welche Funktion hat die Tokenisierung in LLMs?

Karten

15 Karten
STANDARD

Was ist ein Large Language Model (LLM)?

Rückseite

Ein neuronales Netz, das auf riesigen Textkorpora trainiert wurde, um die Wahrscheinlichkeitsverteilung des nächsten Tokens vorherzusagen.

STANDARD

Welche Funktion hat die Tokenisierung in LLMs?

Rückseite

Sie zerlegt Rohtext in diskrete Einheiten (Tokens), die dem Modell als numerische IDs zur Verarbeitung dienen.

STANDARD

Wie funktioniert Byte Pair Encoding (BPE) bei der Tokenisierung?

Rückseite

BPE fusioniert iterativ die häufigsten Zeichenpaare zu neuen Tokens, bis eine vordefinierte Vokabulargröße erreicht ist.

STANDARD

Was ist der Unterschied zwischen Word-Level und Subword-Tokenisierung?

Rückseite

Word-Level nutzt ganze Wörter als Tokens, Subword (z. B. BPE) zerlegt seltene Wörter in bekannte Teilstücke – robuster bei OOV-Wörtern.

STANDARD

Welche Kernkomponenten hat die Transformer-Architektur?

Rückseite

Encoder-Decoder-Struktur mit Self-Attention, Feed-Forward-Layern, Residual Connections, Layer Normalization und Positional Encoding.

STANDARD

Wie berechnet Self-Attention die Relevanz zwischen Tokens?

Rückseite

Durch Skalarprodukt von Query- und Key-Vektoren, skaliert durch Wurzeldimension, dann Softmax für Attention-Weights, angewendet auf Value-Vektoren.

STANDARD

Wozu dient Multi-Head Attention im Transformer?

Rückseite

Parallele Attention-Köpfe erfassen unterschiedliche Beziehungstypen (z. B. syntaktisch, semantisch) zwischen Token-Positionen simultan.

STANDARD

Warum ist Positional Encoding in Transformern notwendig?

Rückseite

Self-Attention ist permutationseinvariant – Positional Encoding injiziert Positionsinformation via sinusförmige Funktionen oder lernbare Embeddings.

STANDARD

Was sind Token Embeddings in LLMs?

Rückseite

Dichte Vektorrepräsentationen jedes Tokens, die semantische Ähnlichkeiten im hochdimensionalen Raum abbilden und während des Trainings gelernt werden.

STANDARD

Welches Trainingsziel verfolgen autoregressive Sprachmodelle wie GPT?

Rückseite

Next-Token-Prediction: Minimierung der Kreuzentropie zwischen vorhergesagter und tatsächlicher Wahrscheinlichkeitsverteilung des nachfolgenden Tokens.

STANDARD

Was begrenzt die Context Window eines Sprachmodells?

Rückseite

Die maximale Sequenzlänge, die das Positional Encoding und die Attention-Matrix (quadratischer Speicherbedarf) verarbeiten können.

STANDARD

Wie beeinflussen Temperature und Top-p das Sampling-Verhalten?

Rückseite

Temperature skaliert Logits vor Softmax (höher = diverser), Top-p (Nucleus Sampling) schneidet das Wahrscheinlichkeitsschwanz ab, kumulativ bis Schwelle p.

STANDARD

Unterscheide Pre-Training und Fine-Tuning bei LLMs.

Rückseite

Pre-Training: selbstüberwacht auf riesigen Korpora (Next-Token-Prediction). Fine-Tuning: überwacht auf spezifischen Tasks/Daten mit Anweisungsdaten (Instruction Tuning).

STANDARD

Was verursacht Halluzinationen in Sprachmodellen?

Rückseite

Modell generiert plausibel klingende, aber faktisch falsche Inhalte durch probabilistisches Sampling ohne Wissensabgleich – oft bei Wissenslücken oder mehrdeutigen Prompts.

STANDARD

Nenne drei Techniken des Prompt Engineerings für bessere LLM-Ergebnisse.

Rückseite

Few-Shot-Beispiele geben, Chain-of-Thought-Aufforderung (Schritt-für-Schritt-Denken), Rollenzuweisung (z. B. 'Agieren als Experte für...').

Lerne diese Karten mit Spaced Repetition

Kopiere das Deck kostenlos in deine Bibliothek und starte den Lernmodus mit dem FSRS-5 Algorithmus.