Deep Learning

Vorlesung 8 der Reihe "Wie Lernen funktioniert" (Kursthema: KI). Zielgruppe: interessierte Erwachsene. Stil: sachlich, verständlich.

Aufbau: Teil 1 (ca. 20 Minuten) — verständliche Einführung mit Analogien und Beispielen; Teil 2 (ca. 20 Minuten) — fachliche Vertiefung und Begriffsdefinitionen; Teil 3 (ca. 10 Minuten) — Anwendungen, Grenzen und Denkaufgaben.

Teil 1 — Was ist Deep Learning und warum viele Schichten oft besser sind (20 Minuten)

Deep Learning bezeichnet eine Klasse von maschinellen Lernverfahren, die mit sogenannten künstlichen neuronalen Netzen arbeiten, bei denen Informationen in mehreren hintereinander geschalteten Schichten verarbeitet werden. Statt nur eine einzelne Transformation von Eingabe zu Ausgabe zu lernen, erwirbt ein tiefes Netzwerk viele aufeinanderfolgende Repräsentationen der Daten. Der Begriff "tief" bezieht sich dabei auf die Anzahl dieser Schichten; moderne Modelle reichen von einigen Dutzend bis zu mehreren Hundert Schichten in speziellen Architekturen (siehe Übersicht in LeCun et al., 2015).

Eine eingängige Analogie: Stellen Sie sich die Verarbeitung eines Fotos wie eine Produktionsstraße in einer Fabrik vor. In der ersten Station wird grob gereinigt (z. B. Kanten und einfache Muster erkannt), in der nächsten Station werden Teile zusammengesetzt (z. B. Formen und Ecken), später entstehen komplexere Baugruppen (z. B. Augen oder Reifen) und am Ende wird ein fertiges Produkt identifiziert (z. B. "Hund" oder "Auto"). Viele Schichten erlauben es, einfache Merkmale schrittweise zu immer komplexeren Merkmalen zu kombinieren. Forschungsarbeiten und Lehrbücher beschreiben dieses Prinzip als Hierarchie von Repräsentationen, die durch Tiefe leichter zu lernen sind als durch eine extrem breite, flache Struktur (Bengio et al. / Goodfellow et al.; siehe auch Eldan & Shamir, 2016).

Warum sind tiefe Netze praktisch erfolgreich? Zwei schlagende Gründe lassen sich zusammenfassen: (1) Tiefe ermöglicht die Bildung zusammensetzbarer, hierarchischer Merkmale; viele reale Aufgaben (insbesondere in Wahrnehmung: Bilder, Audio, Sprache) sind von Natur aus hierarchisch. (2) Durch Fortschritte in Rechenleistung (insbesondere GPUs), in Architekturen (z. B. Faltungsnetze für Bilder) und in Trainingsmethoden wurden tiefe Modelle trainierbar und effizient einsetzbar (LeCun et al., 2015; Goodfellow et al., 2016).

Konkretes Beispiel: Bildklassifikation. Der Durchbruch des Systems AlexNet 2012 zeigte, dass tiefe Faltungsnetze auf dem großen Datensatz ImageNet eine deutlich bessere Genauigkeit erreichen können als frühere flachere Ansätze; der Erfolg hing eng mit Verarbeitungsarchitektur, verfügbaren Datenmengen und Rechenressourcen zusammen (Krizhevsky et al., 2012; Deng et al., 2009).

Wichtig zu verstehen ist außerdem der Unterschied zwischen theoretischer Möglichkeit und praktischer Effizienz: Klassische Resultate wie das "Universelle Approximations-theorem" (Hornik et al., 1989) zeigen, dass eine einzelne versteckte Schicht unter bestimmten Bedingungen jede Funktion approximieren kann. Praktisch zeigt Forschung aber, dass für viele relevante Klassen von Funktionen deutlich weniger Parameter nötig sind, wenn man Tiefe verwendet — tiefe Netze sind also oft "effizienter" in Parameterzahl und Trainingsaufwand als sehr breite flache Netze (Eldan & Shamir, 2016; Telgarsky u.a., Quellen siehe Literatur).

Abschließend zu diesem Abschnitt: Deep Learning ist keine magische Schwarzbox, sondern ein konkret beschreibbares Verfahren, dessen Vorteile für viele Praxisprobleme durch Forschungsergebnisse und Erfolgsbeispiele (Bild- und Spracherkennung, siehe Krizhevsky et al. und Hinton et al.) belegt sind. Gleichzeitig gilt: Tiefe hilft häufig, weil viele reale Probleme eine mehrstufige, zusammensetzbare Struktur haben — das ist heute ein wissenschaftlicher Konsens unter Forschenden in diesem Feld (LeCun et al., 2015).

Teil 2 — Fachbegriffe, Mechanik und formale Erklärungen (20 Minuten)

In diesem Abschnitt werden zentrale Begriffe eingeführt und präzisiert, damit die Aussagen aus Teil 1 technisch eingeordnet werden können.

Neuron, Schicht, Gewichte: Ein künstliches Neuron berechnet aus seinen Eingängen eine gewichtete Summe, wendet eine Aktivierungsfunktion an und gibt ein Signal weiter. Eine Schicht besteht aus vielen solchen Neuronen; ein Netzwerk setzt mehrere Schichten hintereinander. Die lernbaren Parameter sind die Gewichte und ggf. Bias-Terme, die während des Trainings anhand eines Fehlermaßes angepasst werden (Goodfellow et al., 2016).

Tiefe vs. Breite: "Tiefe" ist die Anzahl der nichtlinearen Schichten zwischen Eingabe und Ausgabe. "Breite" bezeichnet die Anzahl der Neuronen pro Schicht. Theoretische Arbeiten zeigen, dass Tiefe die Klasse der effizient darstellbaren Funktionen erheblich erweitert: Für bestimmte Aufgaben benötigt ein flaches Netzwerk exponentiell mehr Neuronen als ein vergleichbar tiefes Netzwerk (Eldan & Shamir, 2016; Telgarsky, s. Literatur). Diese Resultate begründen formal, warum Tiefe in vielen Fällen vorteilhaft ist.

Backpropagation und Optimierung: Das Training tiefer Netze basiert typischerweise auf dem Gradientenverfahren: Man definiert eine Verlustfunktion (z. B. Kreuzentropie bei Klassifikation), berechnet den Gradienten der Fehlerfunktion bezüglich aller Gewichte durch Rückwärtsausbreitung (Backpropagation) und aktualisiert die Gewichte iterativ mit Optimierern wie Stochastic Gradient Descent (SGD) oder dessen Varianten. Praktisch ist die Optimierung nicht konvex, weshalb Trainingsdynamiken, Lernraten, Regularisierung und Initialisierung kritisch sind (Goodfellow et al., 2016).

Überanpassung, Kapazität und Regularisierung: Tiefe Modelle haben oft viele frei einstellbare Parameter und damit hohe Kapazität. Ohne geeignete Datenmengen oder Regularisierung können sie Trainingsdaten "auswendig lernen" (Overfitting). Klassische Konzepte wie Bias–Variance-Tradeoff sind nach wie vor relevant; moderne Netzwerke nutzen Regularisierungsverfahren (z. B. Dropout) und große Datenmengen, um Generalisierung in der Praxis zu erreichen (Hastie et al., 2009; Srivastava et al., 2014; Zhang et al., 2017).

Warum große Datenmengen? Zwei eng verbundene Gründe: (1) hohe Modellkapazität — viele Parameter benötigen viele Beispiele, um verlässliche Schätzungen zu ermöglichen; (2) Vielfalt der Situationen — realistische Probleme weisen große Variation (Hintergründe, Beleuchtung, Sprechweisen), die ein Modell sehen muss, um robust zu werden. Empirische Evidenz stammt aus vielen Bereichen: der Erfolg auf ImageNet beruhte nicht nur auf Architekturverbesserungen, sondern auch auf der Verfügbarkeit eines großen, diversifizierten Datensatzes (Deng et al., 2009; Krizhevsky et al., 2012). Zugleich zeigt Forschung, dass Netze in der Lage sind, sogar zufällige Labels zu memorieren, wenn dies möglich ist; Generalisierung ist also kein automatischer Nebeneffekt des Trainings, sondern erfordert reale Struktur in den Daten und passende Trainingsverfahren (Zhang et al., 2017).

Spezielle Architekturen und ihre Stärken: Für Bilder haben Faltungsnetzwerke (Convolutional Neural Networks, CNNs) die Eigenschaft, räumliche Lokalität und Translationinvarianz auszunutzen; für zeitliche oder sequenzielle Daten dienen Rekurrente Netze und seit einigen Jahren Transformermodelle mit Aufmerksamkeitsmechanismen für Sprache und Text (LeCun et al., 2015; Vaswani et al., 2017). Architekturwahl ist oft entscheidend, weil sie Strukturannahmen über die Daten formalisiert und so Lernaufwand und Datenbedarf reduziert.

Grenzen der theoretischen Erklärung: Obwohl es heute viele Resultate über Ausdrucksfähigkeit und Lernverhalten gibt, sind einige tiefergehende Phänomene noch aktiv erforscht. Beispiele sind die genauen Bedingungen, unter denen tiefe Netze generalisieren, warum bestimmte Optimierer besser empirisch funktionieren und wie Architektur, Daten und Optimierung zusammenspielen (Goodfellow et al.; Zhang et al., 2017). Zu diesen Punkten existieren wissenschaftliche Arbeiten, aber kein vollständiger, allgemein akzeptierter Theoriekanon — das Feld entwickelt sich weiter.

Teil 3 — Anwendungen, Grenzen und Denkaufgaben (10 Minuten)

Praktische Anwendungen: Deep Learning hat in mehreren Bereichen deutliche Fortschritte ermöglicht, vor allem dort, wo große Mengen strukturierter sensorischer Daten vorliegen.

Beispiele:

• Bildverarbeitung und Computer Vision: Klassifikation, Objekterkennung, Segmentierung. Der ImageNet-Erfolg und nachfolgende Architekturen haben hier weite Teile der Forschung und Anwendung dominiert (Deng et al., 2009; Krizhevsky et al., 2012).

• Spracherkennung und Audioverarbeitung: Tiefe akustische Modelle verbesserten die Erkennung deutlich gegenüber früheren GMM-HMM-Modellen und sind heute Standardkomponenten in Spracherkennungssystemen (Hinton et al., 2012).

• Natürliche Sprache: Sequenz-zu-Sequenz-Modelle und Transformer-Architekturen ermöglichten bedeutende Fortschritte bei maschineller Übersetzung, Frage-Antwort-Systemen und Textgenerierung (Sutskever et al.; Vaswani et al.).

Wesentliche Grenzen und offene Probleme:

• Daten- und Rechenintensität: Viele Erfolge hängen an großen, häufig gelabelten Datensätzen und erheblicher Rechenleistung; in Datenarmen Domänen sind tiefe Ansätze oft weniger effizient. Forschungsmethoden wie Transfer Learning und selbstüberwachtes Lernen verringern diesen Bedarf teilweise, sind aber kein allgemeiner Ersatz (Bengio et al., 2013).

• Robustheit und Verschiebung der Eingabeverteilung: Modelle können empfindlich auf kleine, gezielte Störungen reagieren (adversariale Beispiele) und versagen manchmal bei Verteilungssprüngen, d.h. wenn Testdaten systematisch anders sind als Trainingsdaten (Szegedy et al., 2013; Goodfellow et al., 2015). Solche Eigenschaften sind Gegenstand intensiver Forschung.

• Interpretierbarkeit: Tiefe Netze liefern oft gute Vorhersagen, doch die Erklärung, warum genau eine einzelne Vorhersage getroffen wurde, ist schwierig. Dies erschwert Vertrauen, Fehlersuche und Verantwortlichkeit in kritischen Anwendungen (Lipton, 2016).

• Kausales und abstraktes Denken: Deep-Learning-Modelle sind stark in der Mustererkennung, aber weniger gut nachgewiesen darin, kausale Zusammenhänge zu identifizieren oder abstrakte, symbolische Manipulationen zuverlässig zu beherrschen. Forschungsrichtungen zur Einbindung kausaler Modelle oder kombinierter symbolisch-statistischer Methoden sind aktiv (Goodfellow et al.; Forschungsliteratur hierzu ist noch wachsend).

Kleine Denkaufgaben zur Vertiefung (zum Selbst- oder Gruppenstudium):

1) Nehmen Sie zwei Funktionen: eine, die aus lokalen Merkmalen zusammengesetzt ist (z. B. Linien → Ecken → Formen → Objekt), und eine, die global zufällig wirkt. Überlegen Sie, warum ein tiefes, hierarchisches Modell bei der ersten Aufgabe deutlich weniger Parameter benötigen dürfte als ein flaches Modell; welche Eigenschaften der Funktion machen Tiefe effizient?

2) Bilden Sie eine Hypothese, wie sich ein Modell verhalten würde, wenn es auf Daten mit systematischen Änderungen im Test gesetzt wird (z. B. veränderte Beleuchtung, andere Hintergründe): Welche Maßnahmen (Architektur, Datenaugmentation, Transfer Learning) würden Sie ergreifen, um Robustheit zu verbessern, und warum?

3) Diskutieren Sie kurz, welche Folgen mangelnde Interpretierbarkeit in zwei konkreten Anwendungsfeldern (z. B. medizinische Diagnostik, Kreditentscheidung) haben kann. Welche ergänzenden Maßnahmen (z. B. explizite Erklärungssysteme, menschliche Überprüfung) wären sinnvoll?

Bei allen offenen Fragen ist wichtig zu betonen: Die beschriebene Forschung ist aktiv und viele der genannten Grenzen werden derzeit adressiert. Es handelt sich also um gegenwärtige Grenzen, nicht um prinzipielle Unüberwindlichkeiten. Dennoch sind Vorsicht bei Anwendung und klare Kommunikation über Unsicherheiten zwingend erforderlich (LeCun et al., 2015; Lipton, 2016).