Informatik KI – Neuronale Netze und Aktivierungen
Karteikarten zum Thema „Informatik“ · 15 Karten · von atrio. Beispiele: Was ist ein künstliches Neuron mathematisch? · Welche drei Schicht-Typen hat ein Stan…
Karten
15 KartenWas ist ein künstliches Neuron mathematisch?
Rückseite
Eine Funktion, die gewichtete Eingaben summiert, einen Bias addiert und das Ergebnis durch eine nichtlineare Aktivierungsfunktion schickt.
Welche drei Schicht-Typen hat ein Standard-Feedforward-Netz?
Rückseite
Input-Layer (Eingaben), Hidden-Layer(s) (versteckte Schichten), Output-Layer (Vorhersagen).
Was passiert beim Forward Pass?
Rückseite
Eingaben werden schichtweise durch Gewichte, Bias und Aktivierungen propagiert bis zur Ausgabe – ohne Parameteraktualisierung.
Wozu dient die Aktivierungsfunktion im Neuron?
Rückseite
Sie führt Nichtlinearität ein, damit das Netz komplexe Funktionen approximieren kann; ohne sie bliebe das Modell linear.
Wie lautet die ReLU-Funktion und ihre Ableitung?
Rückseite
ReLU(x) = max(0, x); Ableitung: 1 für x > 0, sonst 0 (subgradient at 0).
Was ist das Vanishing-Gradient-Problem bei Sigmoid/Tanh?
Rückseite
Ableitungen werden bei großen/smallten Werten extrem klein, sodass Gradienten in tiefen Netzen gegen null verschwinden und Training stockt.
Wie unterscheidet sich Leaky ReLU von ReLU?
Rückseite
Leaky ReLU hat für x < 0 eine kleine positive Steigung (z. B. 0,01), verhindert tote Neuronen und mildert Vanishing Gradients.
Wann nutzt man Softmax als Output-Aktivierung?
Rückseite
Bei multiklassiger Klassifikation: wandelt Logits in Wahrscheinlichkeitsverteilung über Klassen um (Summe = 1).
Was berechnet die Backpropagation?
Rückseite
Den Gradienten der Verlustfunktion nach jedem Gewicht (∂L/∂w) mittels Kettenregel – Basis für Parameterupdates.
Welche Rolle spielt die Kettenregel bei Backpropagation?
Rückseite
Sie zerlegt ∂L/∂w in Produkt lokaler Ableitungen pro Schicht: Ausgabe → Hidden → Input, ermöglicht effizientes Rechnen.
Was ist der Unterschied zwischen MSE und Cross-Entropy Loss?
Rückseite
MSE (quadratischer Fehler) für Regression; Cross-Entropy für Klassifikation – bestraft falsche Klassenwahrscheinlichkeiten stärker.
Wie aktualisiert SGD die Gewichte?
Rückseite
w_new = w_old - η * ∇L(w); η ist Lernrate, ∇L der Gradient – stochastisch durch Mini-Batches approximiert.
Was verbessert Adam gegenüber SGD?
Rückseite
Adaptive Lernraten pro Parameter (1. & 2. Momentenschätzung), Bias-Korrektur, schnelleres Konvergieren bei rauschen Gradienten.
Warum initialisiert man Gewichte nicht alle mit null?
Rückseite
Symmetriebruch: alle Neuronen eines Layers würden identische Gradienten erhalten, lernen dasselbe – Netz degeneriert.
Was bewirkt Batch Normalization im Hidden Layer?
Rückseite
Normalisiert Layer-Eingaben auf Mittelwert 0, Varianz 1 pro Mini-Batch; stabilisiert Training, erlaubt höhere Lernraten.