Zur Community

Informatik KI – Reinforcement Learning

13 KartenInformatikatrio02.10.2026Nur mit Link

Karteikarten zum Thema „Informatik“ · 13 Karten · von atrio. Beispiele: Was ist Reinforcement Learning? · Welche drei Hauptkomponenten bilden ein RL-Problem?

Karten

13 Karten
STANDARD

Was ist Reinforcement Learning?

Rückseite

Ein Teilbereich des maschinellen Lernens, bei dem ein Agent durch Interaktion mit einer Umgebung eine Strategie lernt, um kumulative Belohnungen zu maximieren.

STANDARD

Welche drei Hauptkomponenten bilden ein RL-Problem?

Rückseite

Agent, Umgebung (Environment) und Belohnungssignal (Reward). Der Agent beobachtet Zustände, wählt Aktionen und erhält Belohnungen.

STANDARD

Was beschreibt die Policy (Strategie) in RL?

Rückseite

Eine Abbildung von Zuständen auf Aktionen, die deterministisch oder stochastisch sein kann und das Verhalten des Agenten festlegt.

STANDARD

Was ist der Unterschied zwischen Value-Function und Q-Function?

Rückseite

Die State-Value-Function V(s) bewertet den erwarteten Return ab Zustand s; die Action-Value-Function Q(s,a) bewertet den Return nach Aktion a in Zustand s.

STANDARD

Welche Gleichung drückt die Bellman-Optimalität für Q-Werte aus?

Rückseite

Q*(s,a) = E[r + γ max_a' Q*(s',a') | s,a]. Sie definiert den optimalen Q-Wert als unmittelbare Belohnung plus diskontierten maximalen Folge-Q-Wert.

STANDARD

Was bedeutet Exploration vs. Exploitation im RL?

Rückseite

Exploration testet neue Aktionen zur Wissensgewinnung, Exploitation nutzt bekannte beste Aktionen. Ein Gleichgewicht (z. B. ε-greedy) ist essenziell für Konvergenz.

STANDARD

Wie funktioniert der Q-Learning-Algorithmus grob?

Rückseite

Ein off-policy TD-Control-Algorithmus, der Q-Werte iterativ aktualisiert: Q(s,a) ← Q(s,a) + α[r + γ max_a' Q(s',a') - Q(s,a)], ohne die Policy zu befolgen.

STANDARD

Welches Problem löst Experience Replay bei Deep Q-Networks (DQN)?

Rückseite

Es bricht Korrelationen zwischen aufeinanderfolgenden Samples auf und stabilisiert das Training, indem Übergänge zufällig aus einem Replay-Buffer gezogen werden.

STANDARD

Was ist der Zweck eines Target Networks im DQN?

Rückseite

Ein separates, langsam aktualisiertes Netzwerk liefert stabile Target-Q-Werte für den Loss, wodurch Oszillationen und Divergenz beim Training reduziert werden.

STANDARD

Was unterscheidet On-Policy von Off-Policy Lernen?

Rückseite

On-Policy (z. B. SARSA) bewertet die aktuelle Verhaltens-Policy; Off-Policy (z. B. Q-Learning) lernt aus Daten einer anderen Policy, was Datenwiederverwendung erlaubt.

STANDARD

Was versteht man unter dem Credit Assignment Problem?

Rückseite

Die Schwierigkeit, einer vergangenen Aktion die Verantwortung für eine spätere Belohnung zuzuordnen, besonders bei verzögerten Belohnungen in langen Episoden.

STANDARD

Welche Rolle spielt der Diskontfaktor γ (Gamma)?

Rückseite

Er bestimmt die Gewichtung zukünftiger Belohnungen: γ=0 bewertet nur unmittelbare Belohnung, γ≈1 berücksichtigt langfristige Returns, muss aber <1 für Konvergenz sein.

STANDARD

Was ist der Unterschied zwischen model-based und model-free RL?

Rückseite

Model-based RL lernt ein Übergangsmodell der Umgebung für Planung; model-free RL lernt direkt Policy oder Value-Funktionen ohne explizites Umgebungsmodell.

Lerne diese Karten mit Spaced Repetition

Kopiere das Deck kostenlos in deine Bibliothek und starte den Lernmodus mit dem FSRS-5 Algorithmus.