Informatik KI – Backpropagation und Gradient Descent
Karteikarten zum Thema „Informatik“ · 14 Karten · von atrio. Beispiele: Was ist Backpropagation? · Was versteht man unter Gradient Descent?
Karten
14 KartenWas ist Backpropagation?
Rückseite
Backpropagation ist ein Algorithmus zur effizienten Berechnung der Gradienten einer Verlustfunktion bezüglich der Gewichte in neuronalen Netzen.
Was versteht man unter Gradient Descent?
Rückseite
Gradient Descent ist ein Optimierungsverfahren, das Parameter iterativ entgegen dem Gradienten der Verlustfunktion anpasst, um ein Minimum zu finden.
Welche Rolle spielt die Verlustfunktion beim Training?
Rückseite
Die Verlustfunktion quantifiziert den Fehler zwischen Vorhersage und Ziel; ihre Gradienten geben die Richtung für Gewichtsaktualisierungen vor.
Wie wird die Kettenregel bei der Backpropagation angewendet?
Rückseite
Die Kettenregel zerlegt den Gradienten der Verlustfunktion in lokale Ableitungen jedes Knotens, sodass Gradienten schichtweise rückwärts berechnet werden.
Was unterscheidet den Forward-Pass vom Backward-Pass?
Rückseite
Der Forward-Pass berechnet die Ausgabe und den Verlust; der Backward-Pass propagiert die Gradienten vom Verlust zurück zu den Gewichten.
Wie beeinflusst die Lernrate den Gradientenabstieg?
Rückseite
Eine zu große Lernrate lässt das Minimum überspringen, eine zu kleine verlangsamt die Konvergenz oder führt in lokale Minima.
Was ist das Problem verschwindender Gradienten?
Rückseite
Bei tiefen Netzen werden Gradienten durch wiederholte Multiplikation mit Ableitungen <1 extrem klein, wodurch frühe Schichten kaum lernen.
Was ist der Unterschied zwischen stochastischem und Batch-Gradientenabstieg?
Rückseite
Batch-Gradientenabstieg nutzt den gesamten Datensatz pro Schritt, stochastischer Gradientenabstieg aktualisiert Gewichte nach jedem einzelnen Sample.
Wozu dient Momentum beim Gradientenabstieg?
Rückseite
Momentum addiert einen Bruchteil des vorherigen Updates zum aktuellen Gradienten, beschleunigt die Konvergenz und glättet Oszillationen.
Warum ist die Gewichtsinitialisierung kritisch für das Training?
Rückseite
Schlechte Initialisierung führt zu symmetrischen Gradienten oder Explosion/Verschwinden der Signale, was das Lernen verhindert oder stark verzögert.
Was beschreibt Backpropagation Through Time (BPTT)?
Rückseite
BPTT wendet Backpropagation auf entfaltete rekurrente Netze an, indem Gradienten über Zeitschritte summiert werden.
Wie hängen Backpropagation und Gradient Descent zusammen?
Rückseite
Backpropagation liefert die Gradienten, Gradient Descent nutzt sie zur Parameteraktualisierung; zusammen ermöglichen sie das Training neuronaler Netze.
Was ist ein Komputationsgraph in der automatischen Differentiation?
Rückseite
Ein Komputationsgraph stellt die Folge von Operationen als gerichteten Graphen dar, wobei Knoten Variablen und Kanten Abhängigkeiten für die Gradientenberechnung sind.
Welche Ableitung hat die ReLU-Aktivierungsfunktion?
Rückseite
Die Ableitung von ReLU ist 1 für positive Eingaben und 0 für negative, was das Verschwinden des Gradienten für positive Werte vermeidet.