Medium oder Format: Code

  • KI für Entwickler: vom Sprachmodell zum Agenten

    Der Lernpfad ordnet die wichtigsten Bausteine moderner KI-Anwendungen ein und führt von Sprachmodellen und Embeddings zu RAG, Werkzeugnutzung, MCP und Agenten.

    Für wen ist dieser Lernpfad?

    Für Entwickler und technisch Interessierte mit grundlegender Programmiererfahrung.

    Lernschritte

    1. Programmcode verstehen und prüfen
      KI als Assistenz für Erklärung, Review und Tests einsetzen.
    2. Große Sprachmodelle
      Modellverhalten, Kontext und probabilistische Ausgabe einordnen.
    3. Embeddings und Vektorsuche
      Semantische Repräsentationen und Ähnlichkeitssuche verstehen.
    4. Retrieval-Augmented Generation
      Modelle mit kontrolliert ausgewählten Wissensquellen verbinden.
    5. Tool Use und Function Calling
      Strukturierte Werkzeugaufrufe planen und validieren.
    6. Model Context Protocol
      Standardisierte Verbindungen zu Werkzeugen und Datenquellen einordnen.
    7. KI-Agenten
      Planung, Aktionen, Beobachtung und Kontrolle zusammensetzen.
    8. Prompt Injection
      Angriffe über fremde Inhalte und unzuverlässige Instruktionen abwehren.

    Was du danach kannst

    • zentrale Architekturbausteine moderner KI-Anwendungen erklären
    • RAG, Tool Use und Agenten voneinander abgrenzen
    • kritische Ein- und Ausgaben validieren
    • Sicherheitsgrenzen und menschliche Freigaben einplanen

    Hinweise zur Nutzung

    Für produktive Systeme sind zusätzlich anwendungsspezifische Tests, Protokollierung, Berechtigungen und Sicherheitsprüfungen erforderlich.

    Grundlagen für die Lernstruktur

  • Prompt Injection: Wenn fremde Inhalte die KI steuern

    Sprachmodelle trennen Befehle und Daten nicht zuverlässig wie klassische Programme. Ein Agent kann deshalb eine bösartige Anweisung aus einem Dokument übernehmen und anschließend Daten preisgeben oder ein Werkzeug falsch verwenden.

    Direkte und indirekte Injection

    Direkte Angriffe stehen in der Nutzereingabe. Indirekte Angriffe liegen in externen Inhalten wie Webseiten, E-Mails, PDFs, Bildern oder Datenbankeinträgen, die das System verarbeitet.

    Mögliche Folgen

    • Umgehung interner Regeln
    • Offenlegung vertraulicher Informationen
    • Manipulation einer Zusammenfassung oder Entscheidung
    • Missbrauch verbundener Werkzeuge
    • Versteckte Weiterleitung zu schädlichen Inhalten

    Schutzmaßnahmen

    • Externe Inhalte grundsätzlich als nicht vertrauenswürdige Daten behandeln
    • Werkzeugrechte minimieren
    • Kritische Aktionen separat bestätigen
    • Ausgaben und Parameter technisch validieren
    • Geheimnisse nicht in den Modellkontext geben
    • Protokollierung und Tests mit Angriffsmustern

    Keine vollständige Textfilter-Lösung

    Prompt Injection lässt sich nicht allein durch eine Liste verbotener Wörter zuverlässig verhindern. Die Systemarchitektur muss mögliche Fehlentscheidungen begrenzen.

    Quellen und Rechtsstand

    Prüfstand: 28.07.2026. Rechtliche Beiträge dienen der allgemeinen Information und ersetzen keine Rechtsberatung.

  • KI-Agenten sicher einsetzen: Rechte, Freigaben und Protokolle

    Die wichtigste Sicherheitsregel lautet: Ein Agent erhält nur die Rechte, Daten und Werkzeuge, die für die konkrete Aufgabe notwendig sind. Kritische oder irreversible Aktionen werden nicht allein aufgrund einer Modellausgabe ausgeführt.

    Mindestmaßnahmen

    • Getrenntes Benutzerkonto mit minimalen Rechten
    • Lesen und Schreiben getrennt freigeben
    • Bestätigung vor Versand, Löschung, Kauf oder Veröffentlichung
    • Grenzen für Kosten, Laufzeit und Anzahl von Aktionen
    • Vollständige Protokolle und nachvollziehbare Werkzeugaufrufe
    • Sicherer Abbruch und Übergabe an einen Menschen

    Externe Inhalte

    Webseiten, E-Mails und Dokumente können versteckte Anweisungen enthalten. Der Agent darf sie nicht als gleichrangig mit den vom Betreiber festgelegten Regeln behandeln.

    Testen

    Vor produktivem Einsatz mit Testkonten, künstlichen Daten, Angriffsszenarien und absichtlich widersprüchlichen Eingaben prüfen.

    Private Nutzung

    Auch ein privater Assistent sollte nicht uneingeschränkt auf Passwortspeicher, Bankkonten, private Nachrichten und alle Dateien zugleich zugreifen.

    Quellen und Rechtsstand

    Prüfstand: 28.07.2026. Rechtliche Beiträge dienen der allgemeinen Information und ersetzen keine Rechtsberatung.

  • API-Schlüssel, Passwörter und Geschäftsgeheimnisse vor KI-Systemen schützen

    KI-Systeme verarbeiten häufig Inhalte über mehrere Komponenten: Benutzeroberfläche, Modellanbieter, Protokollierung, Erweiterungen und verbundene Werkzeuge. Ein versehentlich eingegebenes Geheimnis kann dadurch an mehr Stellen landen als erwartet.

    Technische Regeln

    • Schlüssel über Secret-Manager und Umgebungsvariablen bereitstellen
    • Protokolle und Fehlerberichte auf sensible Daten prüfen
    • Berechtigungen und Gültigkeitsdauer von Schlüsseln begrenzen
    • Regelmäßig rotieren und bei Verdacht sofort sperren
    • Testdaten statt Produktivdaten verwenden

    Für Prompts

    Nur Platzhalter wie KUNDENNUMMER oder API_KEY verwenden. Das Modell muss den echten Wert für die meisten Erklär-, Schreib- oder Programmieraufgaben nicht kennen.

    Bei einem Vorfall

    • Schlüssel widerrufen oder rotieren
    • Betroffene Protokolle und Dienste identifizieren
    • Zugriffe prüfen
    • Mögliche Datenverletzung nach den geltenden Prozessen bewerten

    Quellen und Rechtsstand

    Prüfstand: 28.07.2026. Rechtliche Beiträge dienen der allgemeinen Information und ersetzen keine Rechtsberatung.

  • KI-Lieferkette: Modelle, Daten, Erweiterungen und Abhängigkeiten prüfen

    Neben dem Modell selbst gehören Datenquellen, Bibliotheken, Modellgewichte, APIs, Plugins, Browser-Erweiterungen und Hosting zur Sicherheits- und Vertrauenskette. Eine bekannte Benutzeroberfläche sagt wenig darüber aus, welche Komponenten im Hintergrund beteiligt sind.

    Inventar führen

    • Verwendete Modelle und Versionen
    • Anbieter, Hosting und Datenregion
    • Bibliotheken, Container und Erweiterungen
    • Datenquellen und Vektordatenbanken
    • Werkzeuge, APIs und Berechtigungen

    Prüfung vor Einsatz

    • Herkunft und Integrität von Dateien
    • Lizenz und Nutzungsbedingungen
    • Aktualisierungs- und Sicherheitsprozess des Anbieters
    • Bekannte Schwachstellen und Abhängigkeiten
    • Möglichkeiten zum Austausch oder Abschalten einzelner Komponenten

    Änderungen beobachten

    Ein Cloud-Dienst kann Modell, Filter oder Unterauftragnehmer ändern. Kritische Systeme benötigen deshalb Versionskontrolle, Abnahmetests und einen dokumentierten Änderungsprozess.

    Quellen und Rechtsstand

    Prüfstand: 28.07.2026. Rechtliche Beiträge dienen der allgemeinen Information und ersetzen keine Rechtsberatung.

  • KI-Benchmarks und Evaluationen

    Benchmarks vergleichen Modelle unter festgelegten Bedingungen. Praktische Evaluationen müssen zusätzlich reale Aufgaben, Daten, Fehlerfolgen, Kosten und menschliche Kontrolle abbilden. Besonders agentische Systeme benötigen mehrstufige Tests in einer realistischen Umgebung.

    Einfach erklärt

    Ein Benchmark ist eine standardisierte Prüfung. Ein gutes Ergebnis dort bedeutet nicht automatisch, dass das Modell in deinem Arbeitsablauf ebenso gut funktioniert.

    Arten von Evaluationen

    • Wissens- und Verständnisfragen
    • Code- und Mathematikaufgaben
    • Faktentreue und Quellenbindung
    • Bild-, Audio- oder Videoverständnis
    • Sicherheitstests und Red Teaming
    • End-to-End-Aufgaben mit Werkzeugen

    Warum Ergebnisse schwanken

    • Prompt und Systemanweisung beeinflussen das Ergebnis
    • Modelle und Dienste werden laufend aktualisiert
    • Bewertungsmodelle können eigene Verzerrungen besitzen
    • Trainingsdaten können Testaufgaben enthalten
    • Zufälligkeit und Werkzeugfehler verändern einzelne Läufe

    Praxisnahe Evaluation

    1. Repräsentative Aufgaben aus dem eigenen Betrieb sammeln
    2. Erwartete Ausgabe und Fehlerklassen definieren
    3. Mehrere Durchläufe und schwierige Randfälle testen
    4. Qualität, Zeit, Kosten und Sicherheitsvorfälle messen
    5. Ergebnisse regelmäßig nach Modellupdates wiederholen

    Agenten testen

    Bei Agenten zählt nicht nur die Endantwort. Auch Werkzeugwahl, Zwischenzustände, Berechtigungen, Abbruchverhalten und die Fähigkeit zur Übergabe an Menschen müssen geprüft werden.

    Primärquellen

  • Lokale KI und Quantisierung

    Bei lokaler KI laufen Modell und Daten auf dem eigenen Gerät oder einer selbst kontrollierten Infrastruktur. Quantisierung reduziert Speicherbedarf und Rechenaufwand, kann aber Qualität oder Geschwindigkeit je nach Modell, Hardware und Verfahren unterschiedlich beeinflussen.

    Einfach erklärt

    Ein großes Modell speichert sehr viele Zahlen. Werden diese Zahlen mit weniger Stellen gespeichert, benötigt das Modell weniger Speicher. Das ähnelt einer komprimierten Darstellung, bei der möglichst wenig nutzbare Genauigkeit verloren gehen soll.

    Vorteile lokaler Ausführung

    • Daten müssen nicht zwangsläufig an einen externen Dienst übertragen werden
    • Feste Kosten statt nutzungsabhängiger API-Gebühren können möglich sein
    • Offline-Betrieb und geringe Netzwerklatenz
    • Eigene Kontrolle über Version und Konfiguration

    Typische Präzisionen

    • FP32: hohe Genauigkeit, hoher Speicherbedarf
    • FP16 oder BF16: verbreitet für moderne Beschleuniger
    • INT8: deutlich kleiner, häufig mit geringer Qualitätseinbuße
    • INT4 und darunter: starke Kompression mit höherem Abstimmungsbedarf

    Grenzen

    • Lokale Verarbeitung ist nicht automatisch datenschutzkonform
    • Hardware, Stromverbrauch und Wartung bleiben erforderlich
    • Sehr große Modelle passen auch quantisiert nicht auf jedes Gerät
    • Manche Aufgaben verlieren durch starke Quantisierung messbar an Qualität

    Auswahlkriterien

    • Aufgabe und benötigte Modellqualität
    • Verfügbarer RAM oder Grafikspeicher
    • Unterstützung der konkreten CPU, GPU oder NPU
    • Lizenz und erlaubte Nutzung
    • Update- und Sicherheitskonzept

    Primärquellen

  • Mixture-of-Experts-Modelle (MoE)

    Ein Mixture-of-Experts-Modell enthält mehrere sogenannte Experten. Ein Router entscheidet für jedes Token, welche Experten berechnet werden. Dadurch kann ein Modell sehr viele Parameter besitzen, ohne bei jeder Eingabe alle Parameter zu verwenden.

    Einfach erklärt

    Statt jede Frage an die gesamte Mannschaft zu geben, verteilt ein Router einzelne Aufgaben an wenige passende Spezialisten.

    Technische Grundidee

    • Mehrere Feed-Forward-Netze dienen als Experten
    • Ein Routing-Netz berechnet Auswahlgewichte
    • Nur die ausgewählten Experten verarbeiten das jeweilige Token
    • Die Ergebnisse werden gewichtet zusammengeführt

    Vorteile

    • Hohe Modellkapazität bei begrenztem Rechenaufwand pro Token
    • Spezialisierung verschiedener Experten kann entstehen
    • Skalierung auf sehr große Parameterzahlen

    Herausforderungen

    • Ungleichmäßige Auslastung einzelner Experten
    • Hoher Kommunikationsaufwand über mehrere Beschleuniger
    • Komplexere Bereitstellung und Optimierung
    • Gesamtparameterzahl ist nicht direkt mit aktiv genutzten Parametern vergleichbar

    Einordnung

    MoE ist eine Architekturentscheidung und kein Beleg für bessere Qualität. Vergleichbar sind Modelle nur über konkrete Aufgaben, aktive Rechenkosten, Speicherbedarf und unabhängige Evaluationen.

    Primärquellen

  • AlphaEvolve: Algorithmen durch evolutionäre Codesuche

    AlphaEvolve sucht nach Programmen, die ein klar messbares Ziel verbessern. Kandidaten werden automatisch ausgeführt und bewertet; erfolgreiche Varianten dienen als Ausgangspunkt für weitere Vorschläge. Ergebnisse sind besonders belastbar, wenn die Bewertungsfunktion die Aufgabe vollständig abbildet.

    Forschungsfrage

    Können Sprachmodelle nicht nur Code schreiben, sondern durch wiederholte, automatisch bewertete Variation neue und effizientere Algorithmen entdecken?

    Ansatz

    • Mehrere Sprachmodelle schlagen Programmvarianten vor
    • Automatische Evaluatoren messen Korrektheit oder Leistung
    • Eine evolutionäre Datenbank wählt vielversprechende Kandidaten
    • Neue Generationen verändern und kombinieren erfolgreiche Programme

    Berichtete Anwendungen

    • Optimierung von Rechenzentrums- und Planungsalgorithmen
    • Beiträge zu Chipdesign und KI-Training
    • Neue Varianten für Matrixmultiplikation
    • Suche nach Lösungen mathematischer Probleme

    Warum das überprüfbarer ist

    Die Ausgabe besteht aus ausführbarem Code. Dieser kann mit Tests, Benchmarks oder mathematischen Prüfungen bewertet werden. Das reduziert, aber beseitigt nicht die Gefahr einer unvollständigen Bewertungsfunktion.

    Grenzen

    • Die Aufgabe benötigt eine verlässliche maschinelle Bewertungsfunktion
    • Optimierung kann unbeabsichtigte Lücken im Messverfahren ausnutzen
    • Entdeckter Code muss von Fachleuten verstanden, getestet und abgesichert werden

    Status

    Aktives Forschungssystem; konkrete Zugänglichkeit und Einsatzbereiche sind begrenzt und können sich ändern.

    Primärquellen

  • FunSearch: Programme als mathematische Entdeckungen

    FunSearch erzeugt Programme, deren Qualität objektiv berechnet werden kann. Auf diese Weise wurden neue Konstruktionen für das Cap-Set-Problem und Heuristiken für Online-Bin-Packing gefunden. Die Methode funktioniert nur bei Problemen, die sinnvoll als Programm und Bewertung formuliert werden können.

    Forschungsfrage

    Kann ein Sprachmodell durch automatische Prüfung zu neuen, menschlich interpretierbaren Lösungen in Mathematik und Informatik beitragen?

    Ansatz

    • Ein Ausgangsprogramm und eine Bewertungsfunktion definieren das Problem
    • Das Sprachmodell verändert ausgewählte Programme
    • Jede Variante wird ausgeführt und bewertet
    • Gute und unterschiedliche Lösungen fließen in neue Generationen ein

    Veröffentlichte Ergebnisse

    • Neue große Cap Sets in bestimmten Dimensionen
    • Verbesserte Heuristiken für das Online-Bin-Packing
    • Ausgabe als kompakte Programme, die von Forschenden analysiert werden können

    Bedeutung

    Die Kombination aus generativer Suche und strenger automatischer Bewertung zeigt einen Weg, wie Sprachmodelle über bloße Textvorschläge hinaus zu überprüfbaren Resultaten beitragen können.

    Grenzen

    • Nicht jedes Forschungsproblem besitzt eine vollständige Bewertungsfunktion
    • Eine hohe Punktzahl kann Nebenbedingungen übersehen
    • Mathematische Interpretation und formale Prüfung bleiben erforderlich

    Primärquellen