Vorlesung 7: Neuronale Netze

Block: Wie Lernen funktioniert. Zielgruppe: interessierte Erwachsene. Diese Vorlesung führt in die Grundideen künstlicher neuronaler Netze, erklärt, warum sie sich am Gehirn orientieren, wie ein künstliches Neuron Informationen verarbeitet, warum tiefe Netze aus vielen Schichten bestehen und welche Aufgaben besonders geeignet sind.

Einführung und Kontext

Neuronale Netze sind eine Klasse von Modellen des maschinellen Lernens, die aus vielen miteinander verknüpften Recheneinheiten bestehen. Die Modelle sind historisch vom Aufbau biologischer Nervensysteme inspiriert, verwenden aber stark vereinfachte Bausteine und mathematische Lernverfahren. Die grundlegende Idee ist, dass durch das Zusammenspiel vieler einfacher Verarbeitungseinheiten komplexe Eingabe–Ausgabe-Beziehungen erlernt werden können. Wichtige moderne Lehrbücher und Übersichten fassen Grundlagen und Prinzipien systematisch zusammen (vgl. Goodfellow, Bengio & Courville 2016; Michael Nielsen 2015) [1][2].

Teil 1 (20 Minuten): Grundverständnis mit Analogien und Beispielen

Ziel: Verständliche Grundvorstellung vermitteln.

Eine geeignete Analogie ist die einer Jury, die aus vielen Mitgliedern besteht: Jedes Mitglied (ein künstliches Neuron) betrachtet die Beweise (Eingaben), gewichtet verschiedene Argumente unterschiedlich (Gewichte) und gibt ein Urteil ab (Ausgabe). Einzelne Jurymitglieder sind einfach, aber die kollektive Entscheidung kann sehr differenziert sein. In einem neuronalen Netz werden Eingaben in Form von Zahlen (zum Beispiel Pixelwerte eines Bildes) an viele Neuronen weitergereicht. Jedes Neuron bildet eine gewichtete Summe seiner Eingaben, addiert einen Verschiebungswert (Bias) und wendet eine nichtlineare Funktion an, die entscheidet, wie stark es "feuert" oder welche Ausgabe es liefert. Diese nichtlineare Transformation ist entscheidend: ohne Nichtlinearität wäre eine Kaskade von Schichten nur eine lineare Abbildung und könnte keine komplexen Muster darstellen (vgl. Nielsen 2015; Goodfellow et al. 2016) [2][1].

Als konkretes Beispiel kann man sich Bilderkennung vorstellen. In frühen Schichten lernen Neuronen einfache Orientierungsmuster oder Kanten, weiter innen entstehen Kombinationen dieser Merkmale zu Texturen oder Ecken, und in sehr tiefen Schichten finden sich abstraktere Merkmale wie Teilen eines Objekts. Die am Anfang sichtbare Struktur dieser Hierarchie wurde in der Praxis wiederholt beobachtet und ist ein Grund, warum mehrschichtige Netze (deep networks) so mächtig sind (vgl. Stanford CS231n) [3].

Zu beachten ist, dass die biologische Analogie nicht wörtlich zu nehmen ist. Biologische Neuronen, Synapsen und Lernmechanismen sind deutlich komplexer als die mathematischen Modelle. Die Inspiration ist funktional: Prinzipien wie lokale Verarbeitung, Verknüpfungen mit veränderbarer Stärke und hierarchische Verarbeitung dienten als Vorbild, nicht als direkte Abbildung physiologischer Details (vgl. Britannica zu Hebbs Regel und Einführungen) [8][9].

Teil 2 (20 Minuten): Fachbegriffe und Funktionsweise

Ziel: Wichtige Begriffe sauber einführen und die Lernmechanik erklären.

Ein künstliches Neuron wird oft als Perzeptron bezeichnet, wenn es eine einfache Schwellenfunktion verwendet; historische Einführungen finden sich unter dem Begriff „Perceptron“ (vgl. Britannica) [9]. Im allgemeinen Sprachgebrauch bezeichnet man als künstliches Neuron eine Einheit, die eine gewichtete Summe ihrer Eingaben x durchführt, einen Bias b addiert und eine Aktivierungsfunktion f anwendet, so dass die Ausgabe y = f(w·x + b) lautet. Typische Aktivierungsfunktionen sind sigmoide Funktionen, hyperbolische Tangens und heute sehr häufig die sogenannte ReLU (rectified linear unit), weil sie praktische Vorteile beim Training großer Netze bietet (vgl. Goodfellow et al. 2016) [1].

Netze werden nach ihrer Architektur unterschieden: Feedforward-Netze leiten Informationen nur vorwärts, während rekurrente Netze Rückkopplungen haben und für zeitlich geordnete Daten geeignet sind. Spezielle Schichten wie Faltungsschichten (Convolutional Layers) nutzen lokale Verbindungsmuster und gemeinsame Gewichte, was sie besonders effizient für Bilddaten macht; dies ist formal und praktisch in Kursunterlagen zu Convolutional Neural Networks beschrieben (vgl. Stanford CS231n) [3].

Das eigentliche Lernen erfolgt durch die Anpassung der Gewichte, sodass ein vordefiniertes Ziel erreicht wird. Man definiert eine Verlustfunktion, die misst, wie weit die aktuellen Ausgaben von den gewünschten Ausgaben abweichen. Mittels Gradientenverfahren wird die Ableitung der Verlustfunktion bezüglich der Gewichte berechnet und die Gewichte in Richtung negativen Gradienten verschoben. Die effiziente Berechnung dieser Ableitungen in Netzwerken mit vielen Schichten erfolgt durch den Algorithmus der Rückpropagation (backpropagation), dessen Funktionsweise und mathematische Grundlage ausführlich dargestellt sind (vgl. Goodfellow et al. 2016; Nielsen 2015) [1][2].

Warum viele Schichten? Formal gibt es Aussagen dazu, dass Netzwerke mit mehr Schichten bestimmte Funktionen sparsamer (mit weniger Parametern) darstellen können als sehr breite, aber flache Netzwerke. Praktisch ermöglichen mehrere Schichten die schrittweise Bildung abstrakter Repräsentationen: Jede Schicht extrahiert Merkmale aus der Darstellung der vorherigen Schicht. Theoretische und empirische Arbeiten argumentieren, dass Tiefe günstige Strukturen für das Erlernen von komplexen Funktionen schafft, auch wenn ein flaches Modell dieselben Funktionen mathematisch darstellen könnte, aber oft mit höherem Aufwand (vgl. Goodfellow et al. 2016) [1].

Wichtige Begriffe, die Sie hier einordnen sollten, sind: Gewichte, Bias, Aktivierungsfunktion, Schicht, Vorwärtsdurchlauf, Verlustfunktion, Gradientenabstieg, Rückpropagation, Regularisierung (Maßnahmen gegen Überanpassung) und spezielle Schichttypen wie Convolutional oder Attention-Mechanismen. Moderne Architekturen erweitern diese Grundbausteine, beispielsweise durch Selbstaufmerksamkeit (attention), wie in der Veröffentlichungen „Attention is All You Need“ beschrieben, die für viele Aufgaben der Sprachverarbeitung relevant geworden sind (vgl. Vaswani et al. 2017) [6].

Teil 3 (10 Minuten): Anwendungen, Grenzen und Denkaufgaben

Ziel: Konkrete Anwendungen zeigen, Grenzen nennen und kurze Aufgaben zur Vertiefung geben.

Neuronale Netze haben sich in einer Reihe von Aufgaben als besonders geeignet erwiesen. Convolutional Neural Networks sind in der Bildverarbeitung und Objekterkennung erfolgreich angewendet worden; ein historisch bedeutsamer Meilenstein war der Einsatz tiefer Faltungsnetze für den ImageNet-Wettbewerb, der demonstrierte, dass tiefe Netze stark bessere Ergebnisse für große Bildklassifizierungsaufgaben erzielen können (vgl. Krizhevsky, Sutskever & Hinton 2012) [4]. Für sequenzielle Daten und Spielsteuerung haben Kombinationen aus tiefen Netzen und Optimierungsverfahren zur Entdeckung leistungsfähiger Strategien geführt; ein bekanntes Beispiel ist die Kombination von Deep Learning und Reinforcement Learning zur Steuerung von Agenten, die auf Atari-Spielen menschliche Leistungsniveaus erreichen konnten (vgl. Mnih et al. 2015) [5]. In der Sprachverarbeitung haben Transformer-Modelle mit Attention-Mechanismen große Fortschritte erzielt (vgl. Vaswani et al. 2017) [6].

Gleichzeitig gibt es deutliche Grenzen. Neuronale Netze benötigen oft große Mengen gelabelter Daten oder aufwändige Trainingsverfahren, und sie sind anfällig für Überanpassung an Trainingsdaten. Ein weiteres praktisches Problem sind sogenannte adversariale Beispiele: kleine, gezielte Änderungen an Eingaben können Modelle fehlleiten, was auf strukturelle Schwächen hinweist und ein aktives Forschungsfeld darstellt (vgl. Goodfellow, Shlens & Szegedy 2014) [7]. Außerdem handelt es sich bei vielen aktuellen Architekturen um statistische Musterfolger: Tieferes Verständnis von Kausalität, robustem Allgemeinwissen oder erklärbaren Schlussfolgerungen ist nicht automatisch gegeben. Die Wissenschaft über biologische Lernmechanismen ist ebenfalls unvollständig; die Einfachheit künstlicher Neuronen steht im Kontrast zu der Komplexität biologischer Synapsen und Netzwerke, weshalb direkte Rückschlüsse auf das Gehirn mit Vorsicht zu sehen sind (vgl. Britannica zu Hebb und zu Perceptron; Goodfellow et al. 2016) [8][9][1].

Zur Festigung schlage ich drei kurze Denkaufgaben vor: (1) Überlegen Sie, welche Vorverarbeitungsschritte sinnvoll sind, wenn Sie ein Netz zur Klassifikation handgeschriebener Ziffern entwerfen (z. B. Skalierung, Normalisierung, Datenaugmentation). (2) Diskutieren Sie, welche Vor- und Nachteile lokale Verbindungen und gemeinsame Gewichte in Faltungsschichten gegenüber vollständig verbundenen Schichten haben. (3) Beurteilen Sie, welche Konsequenzen adversariale Beispiele für sicherheitskritische Anwendungen haben und welche Maßnahmen (z. B. Robustheitsprüfungen, Ensemble-Methoden, Regularisierung) getroffen werden können. Zu allen drei Punkten existieren umfangreiche praktische und theoretische Literaturstellen; ein Einstieg finden Sie in den genannten Lehrbüchern und Kursunterlagen [1][2][3][7].

Abschluss

Zusammenfassend bieten neuronale Netze eine flexible, leistungsfähige Klasse von Modellen, die durch einfache Recheneinheiten und lernbare Verbindungen komplexe Aufgaben lösen können. Die biologische Inspiration liefert nützliche Konzepte, doch die mathematischen Modelle sind stark abstrahiert. Tiefe Architekturen ermöglichen hierarchische Repräsentationen, was viele praktische Erfolge erklärt, zugleich bestehen Herausforderungen bezüglich Datenbedarf, Robustheit und erklärbarer Generalisierung. Die genannten Quellen liefern sowohl die intuitive als auch die formale Grundlage und weisen auf aktuelle Forschungsfragen hin (vgl. insbesondere Goodfellow et al. 2016; Nielsen 2015; Stanford CS231n) [1][2][3].