Informatik15 kostenlose LernkartenZuletzt aktualisiert: 02.10.2026

Informatik KI – Transformer und Attention

Transformer-Modelle dominieren moderne NLP und generative KI. Nach diesen Karten kennst du den Attention-Mechanismus mathematisch, verstehst Positional Encoding und kannst Encoder-Decoder-Struktur von BERT und GPT unterscheiden.

15 Karten • kostenlos • ohne KreditkarteAlle Karten ansehen

So lernst du interaktiv in der Atrio-App

Lernziele

Was du in dieser Lektion lernst

  • Was berechnet der Scaled Dot-Product Attention?
  • Warum wird im Attention der Skalar 1/√d_k verwendet?
  • Was ist der Unterschied zwischen Self-Attention und Cross-Attention?
  • Wie funktioniert Multi-Head-Attention?

Lerntipp

Berechne Attention-Scores für ein 3-Wort-Beispiel manuell: Q·K^T, Skalierung, Softmax – so wird die Gewichtung intuitiv verständlich.

Hinweis: Der Inhalt dieser Seite wurde mit einem KI-Modell erzeugt und nicht von Fachmenschen geprüft. Nutze die Karten als Lernhilfe und gleiche medizinische oder rechtliche Aussagen mit deinen Unterlagen ab.

Karteikarten

Alle 15 Lernkarten

Tippe auf eine Karte, um die Antwort aufzudecken

Häufige Fragen

Die wichtigsten Fragen zu Informatik KI – Transformer und Attention

Was berechnet der Scaled Dot-Product Attention?
Attention(Q,K,V) = softmax(Q·K^T/√d_k)·V. Queries werden mit Keys verglichen, gewichtete Values summiert.
Warum wird im Attention der Skalar 1/√d_k verwendet?
Verhindert zu große Skalarprodukte bei hoher Dimensionszahl d_k, die Softmax in Sättigungsbereiche drücken und Gradienten verschwinden lassen.
Was ist der Unterschied zwischen Self-Attention und Cross-Attention?
Self-Attention: Q,K,V stammen aus derselben Sequenz. Cross-Attention: Q aus Decoder, K,V aus Encoder-Ausgabe.
Wie funktioniert Multi-Head-Attention?
Projektion von Q,K,V in h verschiedene Teilräume, parallele Attention-Berechnung, Konkatenation und finale lineare Projektion.
Welche Rolle spielt Positional Encoding im Transformer?
Fügt Positionsinformation hinzu, da Attention selbst permutationseinvariant ist. Meist sinusförmige Funktionen oder lernbare Embeddings.

Warum Atrio?

FSRS-5 Spaced Repetition
Der Algorithmus plant jede Wiederholung anhand deiner eigenen Lernhistorie und stellt Karten kurz bevor du sie vergisst – das reduziert unnötige Wiederholungen.
KI-Import
Notizen, Skripte und PDFs in Sekunden in Lernkarten verwandeln – genau wie diese Seite automatisch entsteht.
Prüfungsplanung
Termine hinterlegen und Atrio berechnet rückwärts, wie viele Karten du pro Tag lernen musst – ohne Stress.

Interaktiv lernen

Diese 15 Karten jetzt interaktiv in der Atrio-App lernen

Atrio zeigt dir jede Karte dann, wenn du sie fast vergessen hättest – damit bleibt genau das hängen, was du lernst.

Starter-Plan kostenlos – keine Kreditkarte erforderlich.