Um genau zu verstehen, wie eine K.I. lernt, müssen wir den Blick weg von "Sprache" und hin zu reiner Mathematik lenken. Eine K.I. versteht keine Wörter oder Bilder; sie versteht nur Zahlen und Wahrscheinlichkeiten.
Das Lernen einer K.I. ist im Kern ein
Optimierungsproblem. Das Ziel ist es, die Stellschrauben eines riesigen mathematischen Netzwerks so einzustellen, dass bei einer bestimmten Eingabe (z. B. ein Bild einer Katze) am Ende das richtige Ergebnis (z. B. die Zahl 1 für Katze) herauskommt.
Hier ist der exakte, mathematische Ablauf, der sich bei jedem einzelnen Trainingsschritt (einer
Iteration) millionenfach wiederholt:
Die 4 Schritte eines Trainingsschritts (Mathematisch)
Ein Neuronales Netz besteht aus Schichten von "Neuronen". Diese Neuronen sind über
Gewichte (w für
weights) miteinander verbunden und besitzen mathematische Schwellenwerte, die
Biases (b). Das Training verändert ausschließlich diese Gewichte und Biases.
1. Der Vorwärtslauf (Forward Propagation)
Die Eingangsdaten (z. B. die Pixelwerte eines Bildes) werden in Zahlen umgewandelt und in die erste Schicht des Netzwerks eingespeist.
- Jedes Neuron berechnet eine einfache Formel: Es multipliziert die Eingangswerte mit seinen aktuellen Gewichten, addiert den Bias und jagt das Ergebnis durch eine Aktivierungsfunktion (eine Formel, die entscheidet, wie stark das Neuron "feuert").
- Die Daten fließen von Schicht zu Schicht, bis ganz am Ende ein Ausgabewert (eine Vorhersage) steht.
- Beispiel: Das Netz bekommt ein Katzenbild. Nach dem Vorwärtslauf sagt die Ausgabe: 70% Wahrscheinlichkeit für "Hund", 30% für "Katze".
2. Die Fehlermessung (Die Loss-Funktion)
Das System weiß nun, was es geraten hat, und vergleicht das Ergebnis mit der Realität (dem
Label). Dafür nutzt man eine mathematische Funktion namens
Loss-Funktion (Verlustfunktion).
- Sie berechnet den exakten Abstand zwischen der falschen Vorhersage und der perfekten Wahrheit.
- Je größer der Fehler der K.I., desto höher ist der berechnete "Loss"-Wert. Das Ziel des gesamten Trainings ist es, diesen Wert so nah wie möglich an Null zu bringen.
3. Der Rückwärtslauf (Backpropagation) – Das Herzstück
Jetzt muss das Netz herausfinden,
welche der Millionen Gewichte Schuld an dem Fehler waren. Hier kommt die
Differenzialrechnung (Ableitungen) ins Spiel.
- Der Algorithmus wandert rückwärts vom Ausgang (dem Fehler) durch das Netzwerk bis zum Eingang.
- Mithilfe der Kettenregel berechnet er für jedes einzelne Gewicht den sogenannten Gradienten. Der Gradient zeigt an: Wenn ich dieses spezifische Gewicht minimal verändere, steigt oder sinkt dann der Gesamtfehler?
- Man bestimmt damit die Steigung der Fehlerkurve.
4. Die Anpassung (Der Gradientenabstieg)
Ein Optimierungs-Algorithmus (wie
Gradient Descent oder
Adam) nimmt nun die berechneten Gradienten und passt alle Gewichte im Netzwerk an.
- Die Gewichte werden entgegen der Richtung des Fehlers verändert – das System geht mathematisch gesehen "den Hügel des Fehlers hinab" (daher Gradientenabstieg).
- Wie groß dieser Schritt ist, bestimmt die Lernrate (Learning Rate). Ist sie zu hoch, springt die K.I. über das Ziel hinaus. Ist sie zu niedrig, dauert das Training Wochen.
Ein konkretes Zahlenbeispiel (Stark vereinfacht)
Stell dir vor, eine Mini-K.I. soll aus der Größe eines Hauses den Preis berechnen. Aktuell nutzt sie die Formel: Preis = Größe × w.
Das aktuelle Gewicht w steht zufällig auf
2.000.
- Forward: Ein Haus mit 100 qm wird eingegeben. Die K.I. rechnet: 100 × 2.000 = 200.000 €.
- Loss: Das Haus kostet in Wahrheit aber 300.000 €. Der Fehler beträgt also +100.000 €.
- Backpropagation: Die Ableitung der Formel zeigt dem System: "Wenn du w erhöhst, wird das Ergebnis größer und der Fehler kleiner." Der Gradient für dieses Gewicht ist also positiv.
- Anpassung: Der Optimierer korrigiert w leicht nach oben, z. B. von 2.000 auf 2.200.
Bei der nächsten Iteration (beim nächsten Haus) ist die Vorhersage schon ein Stück näher an der Realität.
Warum dauert das so lange und braucht Supercomputer?
Moderne K.I.-Modelle wie GPT-4 haben nicht nur ein Gewicht, sondern
Hunderte Milliarden (oder Billionen) dieser mathematischen Parameter.
Bei jedem einzelnen Trainingsschritt müssen für
jeden dieser Billionen Parameter die Vorwärtsrechnung, die Ableitung (Backpropagation) und die Anpassung berechnet werden – und das für Datensätze, die aus Billionen von Wörtern oder Bildern bestehen. Deshalb benötigt man riesige Cluster aus tausenden Grafikkarten (GPUs), die diese Matrix-Multiplikationen parallel in Millisekunden ausführen können.
.....
Schauen wir uns die mathematische Struktur genauer an. Ein Neuronales Netz besteht aus Schichten von Neuronen. Jedes einzelne Neuron ist im Grunde eine winzige Rechenmaschine, die zwei Dinge tut:
Gewichtete Summe berechnen und eine
Aktivierungsfunktion anwenden.
Hier siehst du, wie ein solches Netzwerk aufgebaut ist und wie ein einzelnes künstliches Neuron im Detail rechnet:
1. Die Architektur: Schichten (Layer)
Ein tiefes neuronales Netz (
Deep Learning) teilt die Arbeit in mindestens drei Arten von Schichten auf:
- Eingabeschicht (Input Layer): Hier fließen die Rohdaten hinein (z. B. 784 Neuronen für die Pixel eines \(28 \times 28\) großen Bildes).
- Verborgene Schichten (Hidden Layer): Hier findet die eigentliche Magie statt. Ein tiefes Netz hat oft dutzende oder hunderte dieser Schichten. Die ersten Schichten erkennen grobe Muster (Kanten, Linien), tiefere Schichten erkennen komplexe Formen (Augen, Ohren) und die letzten Schichten erkennen ganze Objekte (Katze).
- Ausgabeschicht (Output Layer): Liefert das finale Ergebnis (z. B. die Wahrscheinlichkeiten für die Klassen "Katze", "Hund" oder "Auto").
Jedes Neuron einer Schicht ist mit den Neuronen der nächsten Schicht verbunden. Diese Verbindungslinien besitzen die
Gewichte (\(w\)).
2. Das Innenleben eines Neurons: Die mathematische Formel
Ein einzelnes Neuron erhält Werte (\(x_1, x_2, x_3\)) von den vorherigen Neuronen. Es führt nun exakt zwei Rechenschritte aus:
Schritt A: Die gewichtete Summe (\(z\))
Das Neuron multipliziert jeden Eingangswert mit dem jeweiligen Gewicht der Verbindung und addiert ganz am Ende einen festen Schwellenwert, den
Bias (\(b\)):
\(z=(x_{1}\cdot w_{1})+(x_{2}\cdot w_{2})+(x_{3}\cdot w_{3})+b\)
Schritt B: Die Aktivierungsfunktion \(f(z)\)
Würde man nur Schritt A ausführen, wäre das gesamte Netzwerk nur eine riesige, lineare Gleichung. Es könnte niemals komplexe, geschwungene oder verschachtelte Muster lernen.
Deshalb schickt das Neuron den Wert \(z\) durch eine
Aktivierungsfunktion. Sie bringt eine "Nicht-Linearität" ins Spiel – sie entscheidet, wie stark das Signal an die nächste Schicht weitergeleitet wird (analog zum biologischen Vorbild im Gehirn, das "feuert" oder nicht).
Die zwei wichtigsten Aktivierungsfunktionen
Je nachdem, was das Netz lernen soll, nutzen Entwickler unterschiedliche Funktionen:
1. Die ReLU-Funktion (Rectified Linear Unit)
Sie ist der absolute Standard in modernen K.I.-Systemen (auch in Sprachmodellen), weil sie extrem schnell zu berechnen ist.
- Die Logik: Wenn das Ergebnis \(z\) negativ oder Null ist, blockiert das Neuron vollständig (Ausgabe = 0). Wenn \(z\) positiv ist, leitet es den Wert exakt so weiter.
- Formel: \(f(z) = \max(0, z)\)
2. Die Sigmoid-Funktion
Sie wurde früher häufig genutzt und wird heute vor allem in der letzten Schicht verwendet, wenn man eine exakte Wahrscheinlichkeit braucht.
- Die Logik: Sie quetscht jeden beliebigen Wert stufenlos in einen Bereich zwischen exakt 0 und 1. Ein hoher Wert wird zu fast 1 (100% Aktivierung), ein extrem negativer Wert zu fast 0.
- Formel: \(f(z) = \frac{1}{1 + e^{-z}}\)
Zusammenfassung: Wie das Lernen physikalisch abläuft
Wenn die K.I. trainiert, schraubt der Optimierungsalgorithmus (wie oben beschrieben) über die Backpropagation ausschließlich an den
Gewichten (\(w\)) und den
Biases (\(b\)) jedes einzelnen Neurons.
Durch das Ändern dieser Zahlenwerte verändern sich die Aktivierungsmuster im gesamten Netz. Das Training sorgt dafür, dass bei einem Katzenbild genau die Pfade im Netz "aufleuchten" und feuern, die am Ende das Ausgabeneuron für "Katze" aktivieren