Reifegrad: Verfügbar

  • Neuronale Netze und Deep Learning

    Ein künstliches neuronales Netz verarbeitet Zahlen durch mehrere miteinander verbundene Schichten. Beim Training werden die Verbindungsgewichte so angepasst, dass das Netz eine Aufgabe zunehmend besser löst.

    Einfach erklärt

    Ein neuronales Netz besteht aus vielen kleinen Rechenschritten. Jede Schicht nimmt Zahlen entgegen, gewichtet sie, wendet eine nichtlineare Funktion an und gibt neue Zahlen an die nächste Schicht weiter.

    „Deep Learning“ bedeutet, dass ein Netz viele Verarbeitungsschichten besitzt. Dadurch kann es aus Rohdaten schrittweise komplexere Merkmale bilden – bei Bildern zum Beispiel von Kanten über Formen bis zu ganzen Objekten.

    Anschauliches Beispiel

    Eine Bilderkennung erhält Pixelwerte. Frühe Schichten reagieren auf einfache Kontraste und Kanten. Spätere Schichten kombinieren diese Signale zu Texturen, Formen und schließlich zu Merkmalen, die für die gesuchte Kategorie relevant sind.

    Fortgeschrittene Erklärung

    Die Recheneinheiten werden üblicherweise als lineare Transformationen mit anschließender Aktivierungsfunktion umgesetzt. Beim Vorwärtslauf entsteht eine Ausgabe. Eine Verlustfunktion misst die Abweichung vom Ziel. Durch Backpropagation werden Gradienten für die Parameter berechnet und von einem Optimierer aktualisiert.

    Unterschiedliche Architekturen sind auf unterschiedliche Datenstrukturen zugeschnitten. Faltungsnetze wurden für räumliche Daten populär, rekurrente Netze für Sequenzen und Transformer für lange Abhängigkeiten sowie stark parallelisierbare Verarbeitung.

    Expertenwissen

    Tiefe Netze lernen hierarchische Repräsentationen. Ihre Ausdrucksstärke entsteht aus der Verkettung vieler affiner Transformationen und Nichtlinearitäten. Entscheidend sind nicht nur Tiefe und Parameterzahl, sondern auch Daten, Optimierungsverfahren, Regularisierung, Normierung, Architektur und Rechenbudget.

    Die internen Repräsentationen sind verteilt: Ein einzelner Parameter entspricht meist keinem klar benennbaren Wissensteil. Interpretierbarkeit und robuste Kausalität bleiben deshalb anspruchsvoll.

    Möglichkeiten und Grenzen

    • Neuronale Netze sind besonders leistungsfähig bei Bildern, Sprache, Text, Audio und komplexen Sensordaten.
    • Sie benötigen häufig große Datenmengen und erhebliche Rechenleistung.
    • Sie können empfindlich auf Datenverschiebungen und manipulierte Eingaben reagieren.
    • Ihre Entscheidungen sind oft schwer vollständig nachzuvollziehen.

    Quellen

  • AlphaFold: Proteinstrukturen mit KI vorhersagen

    AlphaFold ist ein KI-System von Google DeepMind zur Vorhersage dreidimensionaler Proteinstrukturen. Die Vorhersagen ersetzen Experimente nicht, machen aber für sehr viele Proteine schnell nutzbare Strukturmodelle verfügbar.

    Einfach erklärt

    Proteine bestehen aus Ketten von Aminosäuren, die sich zu komplexen dreidimensionalen Formen falten. Diese Form beeinflusst, wie ein Protein funktioniert.

    AlphaFold berechnet aus der Aminosäuresequenz eine wahrscheinliche räumliche Struktur und gibt zusätzlich Vertrauenswerte aus. Forschende können damit Hypothesen schneller bilden und Experimente gezielter planen.

    Wissenschaftlicher Hintergrund

    AlphaFold 2 kombiniert Informationen aus multiplen Sequenzalignments mit einer speziell entwickelten neuronalen Architektur. Das System verarbeitet evolutionäre Beziehungen und geometrische Constraints und erzeugt atomare Strukturvorhersagen.

    Die Nature-Publikation von 2021 beschreibt eine stark verbesserte Genauigkeit und Ergebnisse im CASP14-Wettbewerb. Über die AlphaFold Protein Structure Database wurden Vorhersagen für sehr große Teile der bekannten Proteinwelt öffentlich zugänglich gemacht.

    Ergebnisse

    • Regelmäßig hohe Genauigkeit für viele einzelne Proteindomänen.
    • Öffentlich zugängliche Strukturvorhersagen für mehr als 200 Millionen Proteine.
    • Breite Nutzung in Biologie, Medizin, Enzymforschung und Wirkstoffentwicklung.
    • Vertrauensmaße helfen dabei, zuverlässige und unsichere Bereiche zu unterscheiden.

    Bedeutung und mögliche Anwendungen

    Strukturvorhersagen können die Planung von Experimenten, die Interpretation genetischer Varianten, die Untersuchung von Krankheitserregern und die Suche nach Wirkstoffzielen unterstützen. Sie beschleunigen Forschung, liefern aber keine vollständige Beschreibung der Dynamik und Funktion eines Proteins.

    Grenzen und offene Fragen

    • Eine Vorhersage ist kein experimenteller Nachweis.
    • Flexible, ungeordnete oder kontextabhängige Regionen bleiben schwierig.
    • Proteinbewegungen, zelluläre Umgebung und viele Wechselwirkungen werden nicht vollständig durch eine einzelne statische Struktur erfasst.
    • Für medizinische Anwendungen sind zusätzliche experimentelle und klinische Prüfungen erforderlich.

    Publikationen und Originalquellen

    Die zentrale technische Veröffentlichung erschien 2021 in Nature. Die offizielle DeepMind-Seite und die AlphaFold-Datenbank dokumentieren Zugang, Weiterentwicklungen und Anwendungsfälle.

    Quellen

  • Transformer

    Eine neuronale Netzwerkarchitektur, die Sequenzen hauptsächlich mit Attention-Mechanismen verarbeitet.

    Einfach erklärt

    Eine neuronale Netzwerkarchitektur, die Sequenzen hauptsächlich mit Attention-Mechanismen verarbeitet.

    Beispiel

    Das Modell kann Beziehungen zwischen weit auseinanderliegenden Wörtern eines Satzes berücksichtigen.

    Technische Bedeutung

    Transformer kombinieren Multi-Head Attention, Feedforward-Netze, Residualverbindungen, Normalisierung und Positionsinformation.

    Verwandte Begriffe

    Attention, LLM, Token

    Quellen

  • Generative KI

    Generative KI berechnet neue Inhalte, die zu einer Eingabe und zu den im Training gelernten Mustern passen. Sie ruft dabei nicht einfach einen fertigen Text oder ein fertiges Bild aus einer Datenbank ab.

    Einfach erklärt

    Ein generatives Modell lernt, wie bestimmte Daten typischerweise aufgebaut sind. Ein Sprachmodell lernt Muster in Texten. Ein Bildmodell lernt statistische Zusammenhänge zwischen Bildinhalten und Beschreibungen. Aus einer neuen Anweisung erzeugt es dann eine neue Ausgabe.

    Das Ergebnis kann originell wirken, bleibt aber eine mathematisch erzeugte Kombination gelernter Strukturen. Es besitzt keine automatische Garantie für Wahrheit, Urheberrechtsfreiheit oder Eignung.

    Anschauliches Beispiel

    Bei der Eingabe „eine technische Zeichnung eines freundlichen Haushaltsroboters“ erzeugt ein Bildmodell keine Fotografie aus einem Archiv. Es startet je nach Modelltyp mit Rauschen oder einer latenten Repräsentation und formt daraus schrittweise ein Bild, das zur Beschreibung passt.

    Fortgeschrittene Erklärung

    Zu generativen Modellklassen gehören autoregressive Modelle, Diffusionsmodelle, Variational Autoencoder und Generative Adversarial Networks. Autoregressive Sprachmodelle erzeugen Sequenzen schrittweise. Diffusionsmodelle lernen, Rauschen zu entfernen und daraus strukturierte Daten zu rekonstruieren.

    Die Ausgabe wird durch Eingabe, Kontext, Sampling-Verfahren, Modellparameter und Sicherheitsmechanismen beeinflusst. Unterschiedliche Einstellungen können bei derselben Eingabe unterschiedliche Ergebnisse erzeugen.

    Expertenwissen

    Generative Modelle approximieren eine Datenverteilung oder eine bedingte Verteilung. Beim Sampling werden neue Beispiele aus dieser gelernten Verteilung erzeugt. Bei Foundation Models wird ein breit trainiertes Basismodell für viele Aufgaben genutzt und durch Prompting, Fine-Tuning, Retrieval oder Werkzeuge angepasst.

    NIST beschreibt für generative KI unter anderem Risiken wie Konfabulationen, Datenschutzverletzungen, schädliche Verzerrungen, Informationsintegrität, Sicherheitsprobleme und problematische Mensch-System-Konfigurationen.

    Möglichkeiten und Grenzen

    • Erzeugung und Bearbeitung von Text, Bild, Audio, Video, 3D und Code.
    • Schnelle Variantenbildung, Entwürfe und Unterstützung kreativer Prozesse.
    • Ausgaben können sachlich falsch, verzerrt oder rechtlich problematisch sein.
    • Vertrauliche Daten dürfen nicht ungeprüft an externe Dienste übermittelt werden.
    • Qualitätskontrolle und Quellenprüfung bleiben erforderlich.

    Quellen

  • Algorithmus

    Eine endliche, eindeutig beschriebene Folge von Verarbeitungsschritten zur Lösung einer Aufgabe.

    Einfach erklärt

    Eine endliche, eindeutig beschriebene Folge von Verarbeitungsschritten zur Lösung einer Aufgabe.

    Beispiel

    Ein Kochrezept ist eine anschauliche Analogie: Aus Zutaten und klaren Schritten entsteht ein Ergebnis.

    Technische Bedeutung

    In KI-Systemen können Algorithmen Daten aufbereiten, Modelle trainieren, Suchräume durchsuchen oder Ausgaben erzeugen.

    Verwandte Begriffe

    Maschinelles Lernen, Training, Modell

    Quellen

  • Große Sprachmodelle (LLMs)

    Ein Large Language Model erzeugt Sprache, indem es aus dem bisherigen Kontext Wahrscheinlichkeiten für die nächsten Token berechnet. Seine flüssige Sprache ist kein Beweis für gesichertes Wissen oder menschliches Verständnis.

    Einfach erklärt

    Ein Sprachmodell erhält einen Text und berechnet, welche Textteile wahrscheinlich folgen. Dieser Vorgang wird wiederholt, bis eine Antwort entstanden ist.

    Durch sehr umfangreiches Training kann das Modell Grammatik, Stil, Faktenmuster und viele Aufgabenformen abbilden. Es besitzt aber kein eingebautes Wahrheitsprüfsystem. Es kann überzeugend formulieren und trotzdem falsch liegen.

    Anschauliches Beispiel

    Nach dem Satz „Die Hauptstadt von Frankreich ist“ erhält das Token „Paris“ eine sehr hohe Wahrscheinlichkeit. Bei offenen Fragen gibt es viele mögliche Fortsetzungen. Das Modell wählt abhängig von seinen Einstellungen eine davon aus.

    Fortgeschrittene Erklärung

    LLMs sind meist Transformer-basierte Foundation Models. Sie werden zunächst auf großen Text- und Codedatensätzen vortrainiert. Danach können weitere Trainingsschritte folgen, etwa Instruction Tuning oder Präferenzoptimierung, damit das Modell Anweisungen besser befolgt.

    Der Kontext umfasst die aktuelle Eingabe und gegebenenfalls vorherige Nachrichten oder eingefügte Dokumente. Informationen außerhalb des Kontextes stammen aus den gelernten Parametern oder aus angebundenen Werkzeugen wie Suche und Retrieval.

    Expertenwissen

    Autoregressive LLMs modellieren eine Sequenzwahrscheinlichkeit als Produkt bedingter Wahrscheinlichkeiten. Die Transformer-Architektur berechnet kontextabhängige Repräsentationen mit Attention. Beim Training wird häufig die Vorhersage verdeckter oder nächster Token optimiert.

    Skalierung verbessert viele Fähigkeiten, beseitigt aber grundlegende Probleme nicht automatisch. Kalibrierung, Datenherkunft, Evaluierung, Systemprompt, Sampling und externe Werkzeuge beeinflussen Zuverlässigkeit und Verhalten.

    Möglichkeiten und Grenzen

    • Texterzeugung, Zusammenfassung, Übersetzung, Klassifikation, Code und dialogische Unterstützung.
    • Kann mit Dokumenten, Suchsystemen und Programmierschnittstellen verbunden werden.
    • Kennt nicht automatisch den aktuellen Stand und kann Quellen erfinden.
    • Kann Anweisungen missverstehen oder widersprüchliche Ziele verfolgen.
    • Vertrauliche und kritische Inhalte erfordern kontrollierte Prozesse.

    Quellen

  • Attention

    Ein Mechanismus, der berechnet, welche Teile einer Eingabe für die Verarbeitung anderer Teile besonders relevant sind.

    Einfach erklärt

    Ein Mechanismus, der berechnet, welche Teile einer Eingabe für die Verarbeitung anderer Teile besonders relevant sind.

    Beispiel

    In einem Satz kann ein Pronomen auf ein weit entferntes Substantiv verweisen. Attention hilft dem Modell, diese Beziehung zu gewichten.

    Technische Bedeutung

    Transformer verwenden Query-, Key- und Value-Repräsentationen, um gewichtete Kombinationen von Informationen zu berechnen.

    Verwandte Begriffe

    Transformer, Kontextfenster, Token

    Quellen

  • Transformer und Attention

    Ein Transformer bewertet, welche Teile einer Eingabe für andere Teile besonders wichtig sind. Dieser Attention-Mechanismus ermöglicht kontextabhängige Repräsentationen und eine stark parallelisierbare Verarbeitung.

    Einfach erklärt

    In einem Satz hängt die Bedeutung eines Wortes von anderen Wörtern ab. Attention berechnet, auf welche Stellen das Modell bei der Verarbeitung besonders achten sollte.

    Bei „Die Bank am Fluss“ und „die Bank überweist Geld“ erhält das Wort „Bank“ durch den umgebenden Kontext unterschiedliche Repräsentationen.

    Anschauliches Beispiel

    Bei der Übersetzung eines langen Satzes kann ein Transformer für jedes Wort Beziehungen zu allen relevanten Wörtern berechnen. Dadurch muss Information nicht nur Schritt für Schritt durch eine lange Kette weitergereicht werden.

    Fortgeschrittene Erklärung

    Self-Attention erzeugt aus Eingaberepräsentationen Query-, Key- und Value-Vektoren. Ähnlichkeiten zwischen Queries und Keys bestimmen Gewichte, mit denen Values kombiniert werden. Multi-Head Attention berechnet mehrere solcher Beziehungsmuster parallel.

    Positionsinformationen müssen zusätzlich eingebracht werden, weil reine Attention keine natürliche Reihenfolge kennt. Feedforward-Schichten, Residualverbindungen und Normalisierung ergänzen die Architektur.

    Expertenwissen

    Die skalierte Dot-Product-Attention berechnet softmax(QKᵀ/√d)V. Die quadratische Abhängigkeit von der Sequenzlänge ist bei langen Kontexten ein wesentlicher Ressourcenfaktor. Zahlreiche spätere Varianten optimieren Speicher, Rechenaufwand, Positionskodierung und den Umgang mit langen Sequenzen.

    Der ursprüngliche Transformer wurde für maschinelle Übersetzung vorgestellt. Seine Architektur wurde anschließend auf Sprachmodelle, Vision, Audio, Biologie, Robotik und multimodale Systeme übertragen.

    Möglichkeiten und Grenzen

    • Effiziente parallele Verarbeitung während des Trainings.
    • Gute Modellierung weiter Abhängigkeiten in Sequenzen.
    • Hoher Speicher- und Rechenbedarf bei langen Kontexten.
    • Attention-Gewichte sind nicht automatisch eine vollständige Erklärung einer Modellentscheidung.

    Quellen

  • Embedding

    Eine numerische Vektorrepräsentation von Text, Bildern oder anderen Daten, in der ähnliche Inhalte häufig nahe beieinander liegen.

    Einfach erklärt

    Eine numerische Vektorrepräsentation von Text, Bildern oder anderen Daten, in der ähnliche Inhalte häufig nahe beieinander liegen.

    Beispiel

    Eine semantische Suche kann „Passwort zurücksetzen“ finden, obwohl nach „Zugangsdaten ändern“ gesucht wurde.

    Technische Bedeutung

    Embeddings werden durch trainierte Modelle erzeugt und mit Distanz- oder Ähnlichkeitsmaßen verglichen.

    Verwandte Begriffe

    Vektorsuche, RAG, Token

    Quellen

  • Token, Kontextfenster und Wahrscheinlichkeiten

    Ein Sprachmodell liest keine Wörter wie ein Mensch. Es zerlegt Text in Token und berechnet für mögliche Fortsetzungen Wahrscheinlichkeiten. Das Kontextfenster bestimmt, welche Token gleichzeitig berücksichtigt werden.

    Einfach erklärt

    Token können ganze Wörter, Wortteile, Satzzeichen oder Zeichenfolgen sein. Häufige Wörter bestehen oft aus wenigen Token, seltene Wörter aus mehreren.

    Das Kontextfenster ist der begrenzte Arbeitsbereich des Modells. Enthält ein Gespräch mehr Token als verarbeitet werden können, müssen ältere Teile gekürzt, zusammengefasst oder anderweitig gespeichert werden.

    Anschauliches Beispiel

    Das deutsche Kompositum „Datenschutzfolgenabschätzung“ kann in mehrere Token zerlegt werden. Für das Modell ist deshalb die Anzahl der Wörter nicht identisch mit der Anzahl der verarbeiteten Einheiten.

    Fortgeschrittene Erklärung

    Tokenizer ordnen Textstücken numerische IDs zu. Das Modell wandelt diese IDs in Vektorrepräsentationen um. Für die nächste Position entsteht eine Wahrscheinlichkeitsverteilung über das Vokabular.

    Sampling-Parameter beeinflussen, wie vorhersehbar oder vielfältig eine Ausgabe wird. Eine niedrigere Zufälligkeit kann Antworten konsistenter machen, garantiert aber keine sachliche Richtigkeit.

    Expertenwissen

    Tokenisierung ist ein Kompromiss zwischen Vokabulargröße und Sequenzlänge. Verfahren wie Byte Pair Encoding oder verwandte Subword-Methoden können unbekannte Wörter aus kleineren Einheiten zusammensetzen.

    Die nutzbare Kontextlänge ist nicht mit einem perfekten Langzeitgedächtnis gleichzusetzen. Auch innerhalb des technischen Limits können relevante Informationen übersehen, schwächer gewichtet oder durch konkurrierenden Kontext verdrängt werden.

    Möglichkeiten und Grenzen

    • Lange Kontexte ermöglichen die Analyse umfangreicher Dokumente und Dialoge.
    • Mehr Kontext erhöht Kosten und kann neue Ablenkungen erzeugen.
    • Tokenlimits unterscheiden sich je nach Modell und Produkt.
    • Ein großer Kontext ersetzt keine strukturierte Dokumentensuche oder Qualitätskontrolle.

    Quellen