Informatik KI – Entscheidungsbäume und Random Forest
Karteikarten zum Thema „Informatik“ · 14 Karten · von atrio. Beispiele: Was ist ein Entscheidungsbaum im Machine Learning? · Welche Splitting-Kriterien nutzt…
Karten
14 KartenWas ist ein Entscheidungsbaum im Machine Learning?
Rückseite
Ein Entscheidungsbaum ist ein hierarchisches Modell, das Daten durch rekursive binäre Splits basierend auf Merkmalswerten in homogene Teilmengen unterteilt.
Welche Splitting-Kriterien nutzt ein Entscheidungsbaum bei Klassifikation?
Rückseite
Bei Klassifikation werden Gini-Impurität und Entropie (Informationsgewinn) als Splitting-Kriterien verwendet, um die Reinheit der Kindknoten zu maximieren.
Wie erfolgt das Splitting bei Regressionsbäumen?
Rückseite
Regressionsbäume minimieren den mittleren quadratischen Fehler (MSE) oder mittleren absoluten Fehler (MAE) in den resultierenden Kindknoten als Splitting-Kriterium.
Warum neigen tiefe Entscheidungsbäume zu Overfitting?
Rückseite
Tiefe Bäume memorieren Trainingsdaten bis auf Blatt-Ebene, erfassen Rauschen statt Muster und generalisieren schlecht auf unbekannte Testdaten.
Was bewirkt Pruning bei Entscheidungsbäumen?
Rückseite
Pruning entfernt verzweigte Knoten, die die Validierungsleistung nicht verbessern – Pre-Pruning stoppt früh, Post-Pruning kürzt nachträglich.
Was ist das Prinzip von Bagging bei Random Forests?
Rückseite
Bagging trainiert viele Entscheidungsbäume auf Bootstrap-Stichproben der Trainingsdaten und mittelt deren Vorhersagen zur Varianzreduktion.
Wie unterscheidet sich Random Forest von einem einzelnen Entscheidungsbaum?
Rückseite
Random Forest kombiniert Bagging mit zufälliger Merkmalsauswahl pro Split (Feature Subsampling), was Korrelation zwischen Bäumen reduziert und Varianz weiter senkt.
Welche Rolle spielt max_features im Random Forest?
Rückseite
max_features begrenzt die Anzahl zufällig gewählter Merkmale pro Split (typischerweise √p bei Klassifikation), was Baum-Korrelation verringert und Generalisierung verbessert.
Was ist der Out-of-Bag-Error beim Random Forest?
Rückseite
Der OOB-Error nutzt die ~37 % nicht in der Bootstrap-Stichprobe enthaltenen Samples pro Baum als interne Validierung ohne separaten Testdatensatz.
Wie wird Feature Importance im Random Forest berechnet?
Rückseite
Mean Decrease Impurity summiert die gewichtete Impuritätsreduktion über alle Splits eines Merkmals across all Bäume – höherer Wert bedeutet wichtigere Features.
Welchen Effekt hat der Hyperparameter n_estimators?
Rückseite
n_estimators legt die Anzahl der Bäume im Ensemble fest – mehr Bäume reduzieren Varianz bis zur Sättigung, erhöhen aber Rechenzeit linear.
Wie beeinflusst max_depth die Random-Forest-Leistung?
Rückseite
max_depth begrenzt die Tiefe einzelner Bäume – niedrige Werte verhindern Overfitting, zu hohe Werte erhöhen Korrelation zwischen Bäumen und Rechenaufwand.
Was ist der Hauptvorteil von Random Forest gegenüber einzelnen Bäumen?
Rückseite
Random Forests erreichen durch Ensemble-Averaging und Feature-Subsampling deutlich bessere Generalisierung und Robustheit gegen Ausreißer bei vergleichbarer Einfachheit.
Wann sind Random Forests gegenüber Gradient Boosting nachteilig?
Rückseite
Random Forests sind schwerer interpretierbar als einzelne Bäume, trainieren langsamer bei großen Datensätzen und erreichen oft geringere Peak-Performance als optimiertes Boosting.