Zur Community

Informatik KI – Rekurrente Netze und LSTM

14 KartenInformatikatrio02.10.2026Nur mit Link

Karteikarten zum Thema „Informatik“ · 14 Karten · von atrio. Beispiele: Was unterscheidet ein rekurrentes neuronales Netz von einem Feedforward-Netz? · Welch…

Karten

14 Karten
STANDARD

Was unterscheidet ein rekurrentes neuronales Netz von einem Feedforward-Netz?

Rückseite

RNNs besitzen rekurrente Verbindungen, sodass der versteckte Zustand h_t Informationen aus vorherigen Zeitschritten t-1, t-2 speichert und für Sequenzen nutzbar macht.

STANDARD

Welche Rolle spielt Weight Sharing in RNNs?

Rückseite

Dasselbe Gewichtsmatrix-Set (W_hh, W_xh, W_hy) wird für alle Zeitschritte wiederverwendet, was Parameterzahl konstant hält und Verallgemeinerung auf variable Sequenzlängen ermöglicht.

STANDARD

Wie wird der versteckte Zustand h_t in einem einfachen RNN berechnet?

Rückseite

h_t = tanh(W_hh * h_{t-1} + W_xh * x_t + b_h), wobei h_{t-1} der vorherige Zustand und x_t der aktuelle Input ist.

STANDARD

Was ist Backpropagation Through Time (BPTT)?

Rückseite

BPTT entfaltet das RNN über die Zeit, behandelt es als tiefes Feedforward-Netz und berechnet Gradienten durch Summation über alle Zeitschritte für gemeinsame Gewichte.

STANDARD

Warum tritt das Vanishing-Gradient-Problem bei langen Sequenzen auf?

Rückseite

Bei wiederholter Multiplikation der Jacobimatrix W_hh^T über viele Zeitschritte gehen Eigenwerte < 1 gegen null, Gradienten verschwinden exponentiell.

STANDARD

Welchen Zweck erfüllt der Zellzustand c_t in einer LSTM-Zelle?

Rückseite

Der Zellzustand wirkt als konstanter Fehlerkarussell (Constant Error Carousel), der Information linear über viele Zeitschritte transportiert, ohne durch nicht-lineare Aktivierungen gedämpft zu werden.

STANDARD

Was steuert der Forget-Gate f_t in einer LSTM?

Rückseite

f_t = sigmoid(W_f * [h_{t-1}, x_t] + b_f) bestimmt elementweise, welcher Anteil des vorherigen Zellzustands c_{t-1} verworfen wird (Werte nahe 0) oder behalten wird (Werte nahe 1).

STANDARD

Wie berechnet der Input-Gate die Kandidatwerte für den Zellzustand?

Rückseite

Input-Gate i_t = sigmoid(...) und Kandidat c̃_t = tanh(W_c * [h_{t-1}, x_t] + b_c); neuer Zustand: c_t = f_t ⊙ c_{t-1} + i_t ⊙ c̃_t.

STANDARD

Welche Funktion hat der Output-Gate o_t?

Rückseite

o_t = sigmoid(W_o * [h_{t-1}, x_t] + b_o) filtert den versteckten Zustand h_t = o_t ⊙ tanh(c_t), sodass nur relevante Zellzustandsanteile nach außen gelangen.

STANDARD

Worin besteht der Hauptunterschied zwischen LSTM und GRU?

Rückseite

GRU vereint Forget- und Input-Gate zu einem Update-Gate z_t, besitzt keinen separaten Zellzustand, hat weniger Parameter und ist recheneffizienter bei vergleichbarer Leistung.

STANDARD

Was bewirkt ein bidirektionales RNN (BiRNN)?

Rückseite

Zwei RNNs verarbeiten die Sequenz vorwärts und rückwärts; ihre versteckten Zustände werden konkateniert, sodass h_t Kontext aus Vergangenheit und Zukunft enthält.

STANDARD

Was ist Teacher Forcing beim Training von RNNs?

Rückseite

Während des Trainings wird der Ground-Truth-Token y_{t-1} als nächster Input x_t eingespeist statt der Modellvorhersage, was Konvergenz beschleunigt, aber Exposure Bias erzeugt.

STANDARD

Wie mildert Gradient Clipping das Exploding-Gradient-Problem?

Rückseite

Wenn die Gradienten-Norm einen Schwellwert (z. B. 1.0 oder 5.0) überschreitet, wird der Gradient proportional herunterskaliert, Richtung bleibt erhalten, Betrag begrenzt.

STANDARD

Nenne eine typische Anwendung für LSTMs im NLP.

Rückseite

Sprachmodellierung: Vorhersage des nächsten Wortes basierend auf Kontext; genutzt für Textgenerierung, Autovervollständigung und als Vorstufe für Transformer-Architekturen.

Lerne diese Karten mit Spaced Repetition

Kopiere das Deck kostenlos in deine Bibliothek und starte den Lernmodus mit dem FSRS-5 Algorithmus.