Informatik KI – Reinforcement Learning
Reinforcement Learning ist zentral für moderne KI-Systeme wie autonomes Fahren oder Spiel-KIs. Nach dem Lernen dieser Karten kennst du die Kernkonzepte wie Agent-Umgebung-Interaktion, Belohnungsfunktionen, Value-Functions und grundlegende Algorithmen wie Q-Learning. Du kannst dann RL-Probleme modellieren und passende Lösungsansätze wählen.
Lernziele
Was du in dieser Lektion lernst
- Was ist Reinforcement Learning?
- Welche drei Hauptkomponenten bilden ein RL-Problem?
- Was beschreibt die Policy (Strategie) in RL?
- Was ist der Unterschied zwischen Value-Function und Q-Function?
Lerntipp
Beim Lernen von RL hilft es, einfache Gridworld-Beispiele manuell durchzurechnen – so verstehst du, wie Q-Werte durch Bellman-Gleichungen propagieren.
Hinweis: Der Inhalt dieser Seite wurde mit einem KI-Modell erzeugt und nicht von Fachmenschen geprüft. Nutze die Karten als Lernhilfe und gleiche medizinische oder rechtliche Aussagen mit deinen Unterlagen ab.
Karteikarten
Alle 13 Lernkarten
Tippe auf eine Karte, um die Antwort aufzudecken
Häufige Fragen
Die wichtigsten Fragen zu Informatik KI – Reinforcement Learning
- Was ist Reinforcement Learning?
- Ein Teilbereich des maschinellen Lernens, bei dem ein Agent durch Interaktion mit einer Umgebung eine Strategie lernt, um kumulative Belohnungen zu maximieren.
- Welche drei Hauptkomponenten bilden ein RL-Problem?
- Agent, Umgebung (Environment) und Belohnungssignal (Reward). Der Agent beobachtet Zustände, wählt Aktionen und erhält Belohnungen.
- Was beschreibt die Policy (Strategie) in RL?
- Eine Abbildung von Zuständen auf Aktionen, die deterministisch oder stochastisch sein kann und das Verhalten des Agenten festlegt.
- Was ist der Unterschied zwischen Value-Function und Q-Function?
- Die State-Value-Function V(s) bewertet den erwarteten Return ab Zustand s; die Action-Value-Function Q(s,a) bewertet den Return nach Aktion a in Zustand s.
- Welche Gleichung drückt die Bellman-Optimalität für Q-Werte aus?
- Q*(s,a) = E[r + γ max_a' Q*(s',a') | s,a]. Sie definiert den optimalen Q-Wert als unmittelbare Belohnung plus diskontierten maximalen Folge-Q-Wert.
Warum Atrio?
- FSRS-5 Spaced Repetition
- Der Algorithmus plant jede Wiederholung anhand deiner eigenen Lernhistorie und stellt Karten kurz bevor du sie vergisst – das reduziert unnötige Wiederholungen.
- KI-Import
- Notizen, Skripte und PDFs in Sekunden in Lernkarten verwandeln – genau wie diese Seite automatisch entsteht.
- Prüfungsplanung
- Termine hinterlegen und Atrio berechnet rückwärts, wie viele Karten du pro Tag lernen musst – ohne Stress.
Interaktiv lernen
Diese 13 Karten jetzt interaktiv in der Atrio-App lernen
Atrio zeigt dir jede Karte dann, wenn du sie fast vergessen hättest – damit bleibt genau das hängen, was du lernst.
Starter-Plan kostenlos – keine Kreditkarte erforderlich.