Informatik KI – Reinforcement Learning
Karteikarten zum Thema „Informatik“ · 13 Karten · von atrio. Beispiele: Was ist Reinforcement Learning? · Welche drei Hauptkomponenten bilden ein RL-Problem?
Karten
13 KartenWas ist Reinforcement Learning?
Rückseite
Ein Teilbereich des maschinellen Lernens, bei dem ein Agent durch Interaktion mit einer Umgebung eine Strategie lernt, um kumulative Belohnungen zu maximieren.
Welche drei Hauptkomponenten bilden ein RL-Problem?
Rückseite
Agent, Umgebung (Environment) und Belohnungssignal (Reward). Der Agent beobachtet Zustände, wählt Aktionen und erhält Belohnungen.
Was beschreibt die Policy (Strategie) in RL?
Rückseite
Eine Abbildung von Zuständen auf Aktionen, die deterministisch oder stochastisch sein kann und das Verhalten des Agenten festlegt.
Was ist der Unterschied zwischen Value-Function und Q-Function?
Rückseite
Die State-Value-Function V(s) bewertet den erwarteten Return ab Zustand s; die Action-Value-Function Q(s,a) bewertet den Return nach Aktion a in Zustand s.
Welche Gleichung drückt die Bellman-Optimalität für Q-Werte aus?
Rückseite
Q*(s,a) = E[r + γ max_a' Q*(s',a') | s,a]. Sie definiert den optimalen Q-Wert als unmittelbare Belohnung plus diskontierten maximalen Folge-Q-Wert.
Was bedeutet Exploration vs. Exploitation im RL?
Rückseite
Exploration testet neue Aktionen zur Wissensgewinnung, Exploitation nutzt bekannte beste Aktionen. Ein Gleichgewicht (z. B. ε-greedy) ist essenziell für Konvergenz.
Wie funktioniert der Q-Learning-Algorithmus grob?
Rückseite
Ein off-policy TD-Control-Algorithmus, der Q-Werte iterativ aktualisiert: Q(s,a) ← Q(s,a) + α[r + γ max_a' Q(s',a') - Q(s,a)], ohne die Policy zu befolgen.
Welches Problem löst Experience Replay bei Deep Q-Networks (DQN)?
Rückseite
Es bricht Korrelationen zwischen aufeinanderfolgenden Samples auf und stabilisiert das Training, indem Übergänge zufällig aus einem Replay-Buffer gezogen werden.
Was ist der Zweck eines Target Networks im DQN?
Rückseite
Ein separates, langsam aktualisiertes Netzwerk liefert stabile Target-Q-Werte für den Loss, wodurch Oszillationen und Divergenz beim Training reduziert werden.
Was unterscheidet On-Policy von Off-Policy Lernen?
Rückseite
On-Policy (z. B. SARSA) bewertet die aktuelle Verhaltens-Policy; Off-Policy (z. B. Q-Learning) lernt aus Daten einer anderen Policy, was Datenwiederverwendung erlaubt.
Was versteht man unter dem Credit Assignment Problem?
Rückseite
Die Schwierigkeit, einer vergangenen Aktion die Verantwortung für eine spätere Belohnung zuzuordnen, besonders bei verzögerten Belohnungen in langen Episoden.
Welche Rolle spielt der Diskontfaktor γ (Gamma)?
Rückseite
Er bestimmt die Gewichtung zukünftiger Belohnungen: γ=0 bewertet nur unmittelbare Belohnung, γ≈1 berücksichtigt langfristige Returns, muss aber <1 für Konvergenz sein.
Was ist der Unterschied zwischen model-based und model-free RL?
Rückseite
Model-based RL lernt ein Übergangsmodell der Umgebung für Planung; model-free RL lernt direkt Policy oder Value-Funktionen ohne explizites Umgebungsmodell.