Thema: Agenten

  • Prompt Injection: Wenn fremde Inhalte die KI steuern

    Sprachmodelle trennen Befehle und Daten nicht zuverlässig wie klassische Programme. Ein Agent kann deshalb eine bösartige Anweisung aus einem Dokument übernehmen und anschließend Daten preisgeben oder ein Werkzeug falsch verwenden.

    Direkte und indirekte Injection

    Direkte Angriffe stehen in der Nutzereingabe. Indirekte Angriffe liegen in externen Inhalten wie Webseiten, E-Mails, PDFs, Bildern oder Datenbankeinträgen, die das System verarbeitet.

    Mögliche Folgen

    • Umgehung interner Regeln
    • Offenlegung vertraulicher Informationen
    • Manipulation einer Zusammenfassung oder Entscheidung
    • Missbrauch verbundener Werkzeuge
    • Versteckte Weiterleitung zu schädlichen Inhalten

    Schutzmaßnahmen

    • Externe Inhalte grundsätzlich als nicht vertrauenswürdige Daten behandeln
    • Werkzeugrechte minimieren
    • Kritische Aktionen separat bestätigen
    • Ausgaben und Parameter technisch validieren
    • Geheimnisse nicht in den Modellkontext geben
    • Protokollierung und Tests mit Angriffsmustern

    Keine vollständige Textfilter-Lösung

    Prompt Injection lässt sich nicht allein durch eine Liste verbotener Wörter zuverlässig verhindern. Die Systemarchitektur muss mögliche Fehlentscheidungen begrenzen.

    Quellen und Rechtsstand

    Prüfstand: 28.07.2026. Rechtliche Beiträge dienen der allgemeinen Information und ersetzen keine Rechtsberatung.

  • KI-Agenten sicher einsetzen: Rechte, Freigaben und Protokolle

    Die wichtigste Sicherheitsregel lautet: Ein Agent erhält nur die Rechte, Daten und Werkzeuge, die für die konkrete Aufgabe notwendig sind. Kritische oder irreversible Aktionen werden nicht allein aufgrund einer Modellausgabe ausgeführt.

    Mindestmaßnahmen

    • Getrenntes Benutzerkonto mit minimalen Rechten
    • Lesen und Schreiben getrennt freigeben
    • Bestätigung vor Versand, Löschung, Kauf oder Veröffentlichung
    • Grenzen für Kosten, Laufzeit und Anzahl von Aktionen
    • Vollständige Protokolle und nachvollziehbare Werkzeugaufrufe
    • Sicherer Abbruch und Übergabe an einen Menschen

    Externe Inhalte

    Webseiten, E-Mails und Dokumente können versteckte Anweisungen enthalten. Der Agent darf sie nicht als gleichrangig mit den vom Betreiber festgelegten Regeln behandeln.

    Testen

    Vor produktivem Einsatz mit Testkonten, künstlichen Daten, Angriffsszenarien und absichtlich widersprüchlichen Eingaben prüfen.

    Private Nutzung

    Auch ein privater Assistent sollte nicht uneingeschränkt auf Passwortspeicher, Bankkonten, private Nachrichten und alle Dateien zugleich zugreifen.

    Quellen und Rechtsstand

    Prüfstand: 28.07.2026. Rechtliche Beiträge dienen der allgemeinen Information und ersetzen keine Rechtsberatung.

  • AlphaEvolve: Algorithmen durch evolutionäre Codesuche

    AlphaEvolve sucht nach Programmen, die ein klar messbares Ziel verbessern. Kandidaten werden automatisch ausgeführt und bewertet; erfolgreiche Varianten dienen als Ausgangspunkt für weitere Vorschläge. Ergebnisse sind besonders belastbar, wenn die Bewertungsfunktion die Aufgabe vollständig abbildet.

    Forschungsfrage

    Können Sprachmodelle nicht nur Code schreiben, sondern durch wiederholte, automatisch bewertete Variation neue und effizientere Algorithmen entdecken?

    Ansatz

    • Mehrere Sprachmodelle schlagen Programmvarianten vor
    • Automatische Evaluatoren messen Korrektheit oder Leistung
    • Eine evolutionäre Datenbank wählt vielversprechende Kandidaten
    • Neue Generationen verändern und kombinieren erfolgreiche Programme

    Berichtete Anwendungen

    • Optimierung von Rechenzentrums- und Planungsalgorithmen
    • Beiträge zu Chipdesign und KI-Training
    • Neue Varianten für Matrixmultiplikation
    • Suche nach Lösungen mathematischer Probleme

    Warum das überprüfbarer ist

    Die Ausgabe besteht aus ausführbarem Code. Dieser kann mit Tests, Benchmarks oder mathematischen Prüfungen bewertet werden. Das reduziert, aber beseitigt nicht die Gefahr einer unvollständigen Bewertungsfunktion.

    Grenzen

    • Die Aufgabe benötigt eine verlässliche maschinelle Bewertungsfunktion
    • Optimierung kann unbeabsichtigte Lücken im Messverfahren ausnutzen
    • Entdeckter Code muss von Fachleuten verstanden, getestet und abgesichert werden

    Status

    Aktives Forschungssystem; konkrete Zugänglichkeit und Einsatzbereiche sind begrenzt und können sich ändern.

    Primärquellen

  • Model Context Protocol (MCP)

    Das Model Context Protocol beschreibt eine gemeinsame Schnittstelle, über die KI-Clients externe Server mit Werkzeugen, Ressourcen und Vorlagen ansprechen können. Es reduziert individuelle Integrationen, ersetzt aber weder Berechtigungen noch Sicherheitsprüfungen.

    Einfach erklärt

    MCP ähnelt einem einheitlichen Anschluss: Eine KI-Anwendung kann kompatible Datenquellen und Werkzeuge anbinden, ohne für jede Kombination eine vollständig neue Schnittstelle zu entwickeln.

    Bausteine

    • Host: die KI-Anwendung, in der der Nutzer arbeitet
    • Client: verwaltet die Verbindung zu einem MCP-Server
    • Server: stellt Werkzeuge, Ressourcen oder Prompts bereit
    • Transport: überträgt strukturierte Nachrichten zwischen den Komponenten

    Mögliche Anwendungen

    • Dokumentensuche in internen Beständen
    • Zugriff auf Entwicklungswerkzeuge
    • Verbindung zu Datenbanken und Geschäftssystemen
    • Standardisierte Bereitstellung eigener Werkzeuge

    Sicherheitsgrenzen

    • Ein MCP-Server erhält nur ausdrücklich konfigurierte Rechte
    • Werkzeugbeschreibungen und Ergebnisse können manipuliert sein
    • Lokale Server sind nicht automatisch vertrauenswürdig
    • Geheimnisse und Zugangsdaten gehören in sichere Konfigurationen
    • Schreibende Aktionen benötigen klare Bestätigung und Protokollierung

    Einordnung

    MCP löst primär das Integrationsproblem. Ob ein angeschlossenes Werkzeug fachlich korrekt, datenschutzkonform und sicher ist, muss separat beurteilt werden.

    Primärquellen

  • Computer Use: KI bedient grafische Oberflächen

    Computersteuernde Agenten können Software bedienen, für die keine geeignete Programmierschnittstelle vorhanden ist. Sie sehen jedoch nur eine Darstellung der Oberfläche und können Schaltflächen, Zustände oder Warnungen falsch interpretieren. Deshalb sind isolierte Umgebungen und Bestätigungen besonders wichtig.

    Einfach erklärt

    Das System erhält regelmäßig ein Bildschirmbild. Es entscheidet, wohin geklickt oder welcher Text eingegeben werden soll. Danach sieht es den neuen Zustand und setzt die Aufgabe fort.

    Geeignete Aufgaben

    • Daten zwischen älteren Programmen übertragen
    • Formulare mit überprüften Angaben ausfüllen
    • Wiederkehrende Klickfolgen in Testumgebungen ausführen
    • Softwaretests aus Sicht eines Benutzers unterstützen

    Warum APIs vorzuziehen sind

    Eine API liefert klar strukturierte Zustände und Befehle. Grafische Oberflächen verändern sich, enthalten Werbung oder uneindeutige Elemente und sind deshalb fehleranfälliger. Computer Use ist meist eine Ausweichlösung.

    Besondere Risiken

    • Prompt Injection durch Inhalte auf Webseiten oder in Dokumenten
    • Klick auf falsche oder täuschend gestaltete Elemente
    • Übertragung vertraulicher Daten in fremde Felder
    • Unbeabsichtigte Käufe, Veröffentlichungen oder Löschungen
    • Schwierige Wiederherstellung nach einer Fehlaktion

    Schutzmaßnahmen

    • Virtuelle oder isolierte Umgebung verwenden
    • Zugriff auf notwendige Websites und Programme begrenzen
    • Zahlungen, Versand und Löschen immer bestätigen lassen
    • Passwörter nicht sichtbar in den Arbeitsbereich legen
    • Screenshots und Aktionen revisionssicher protokollieren

    Primärquellen

  • Vision-Language-Action-Modelle (VLA)

    Ein Vision-Language-Action-Modell verarbeitet Bilder oder Kameradaten und eine sprachliche Anweisung. Seine Ausgabe beschreibt nicht nur Text, sondern Aktionen für einen Roboter. Damit wird multimodales Lernen auf die physische Welt erweitert.

    Einfach erklärt

    Ein VLA-Modell kann sehen, eine Anweisung verstehen und daraus eine Bewegung ableiten, etwa einen Gegenstand greifen oder sortieren.

    Funktionsweise

    • Kameras liefern visuelle Beobachtungen
    • Sprache beschreibt Ziel oder Aufgabe
    • Das Modell verbindet Objekte, räumliche Beziehungen und mögliche Handlungen
    • Aktionsausgaben werden in Steuerbefehle des Roboters übersetzt
    • Neue Kameradaten ermöglichen laufende Korrekturen

    Warum Webdaten helfen können

    Modelle können visuelle und sprachliche Begriffe aus großen Bild-Text-Datensätzen lernen. Für sichere Bewegungen benötigen sie zusätzlich Roboteraktionen, Sensordaten und Training in kontrollierten Umgebungen.

    Möglichkeiten

    • Allgemeinere Roboteranweisungen in natürlicher Sprache
    • Übertragung gelernter Konzepte auf neue Objekte
    • Planung mehrstufiger Manipulationsaufgaben
    • Lokale Ausführung mit geringer Latenz bei spezialisierten Modellen

    Grenzen und Sicherheit

    • Demonstrationen zeigen keine garantierte Zuverlässigkeit
    • Physische Fehler können Menschen oder Gegenstände gefährden
    • Unbekannte Umgebungen und verdeckte Objekte bleiben schwierig
    • Not-Aus, Geschwindigkeitsgrenzen und räumliche Schutzbereiche sind erforderlich

    Primärquellen

  • KI-Benchmarks und Evaluationen

    Benchmarks vergleichen Modelle unter festgelegten Bedingungen. Praktische Evaluationen müssen zusätzlich reale Aufgaben, Daten, Fehlerfolgen, Kosten und menschliche Kontrolle abbilden. Besonders agentische Systeme benötigen mehrstufige Tests in einer realistischen Umgebung.

    Einfach erklärt

    Ein Benchmark ist eine standardisierte Prüfung. Ein gutes Ergebnis dort bedeutet nicht automatisch, dass das Modell in deinem Arbeitsablauf ebenso gut funktioniert.

    Arten von Evaluationen

    • Wissens- und Verständnisfragen
    • Code- und Mathematikaufgaben
    • Faktentreue und Quellenbindung
    • Bild-, Audio- oder Videoverständnis
    • Sicherheitstests und Red Teaming
    • End-to-End-Aufgaben mit Werkzeugen

    Warum Ergebnisse schwanken

    • Prompt und Systemanweisung beeinflussen das Ergebnis
    • Modelle und Dienste werden laufend aktualisiert
    • Bewertungsmodelle können eigene Verzerrungen besitzen
    • Trainingsdaten können Testaufgaben enthalten
    • Zufälligkeit und Werkzeugfehler verändern einzelne Läufe

    Praxisnahe Evaluation

    1. Repräsentative Aufgaben aus dem eigenen Betrieb sammeln
    2. Erwartete Ausgabe und Fehlerklassen definieren
    3. Mehrere Durchläufe und schwierige Randfälle testen
    4. Qualität, Zeit, Kosten und Sicherheitsvorfälle messen
    5. Ergebnisse regelmäßig nach Modellupdates wiederholen

    Agenten testen

    Bei Agenten zählt nicht nur die Endantwort. Auch Werkzeugwahl, Zwischenzustände, Berechtigungen, Abbruchverhalten und die Fähigkeit zur Übergabe an Menschen müssen geprüft werden.

    Primärquellen

  • KI-Agenten: planen, handeln und Ergebnisse prüfen

    Ein KI-Agent beantwortet nicht nur eine einzelne Eingabe. Er kann ein Ziel in Schritte zerlegen, Werkzeuge aufrufen, Zwischenergebnisse auswerten und seinen Plan anpassen. Autonomie bedeutet dabei nicht Zuverlässigkeit: Berechtigungen, Grenzen und menschliche Kontrolle bleiben entscheidend.

    Einfach erklärt

    Ein Chatbot liefert gewöhnlich eine Antwort. Ein Agent versucht dagegen, eine Aufgabe über mehrere Schritte zu erledigen. Er kann beispielsweise Informationen suchen, eine Datei bearbeiten und danach prüfen, ob das Ergebnis zum Ziel passt.

    Typischer Ablauf

    1. Ziel und verfügbare Werkzeuge erfassen
    2. Nächsten sinnvollen Schritt auswählen
    3. Werkzeug ausführen und Ergebnis zurücklesen
    4. Plan anhand des Ergebnisses anpassen
    5. Bei Unsicherheit nachfragen oder an einen Menschen übergeben

    Fortgeschritten

    Agentische Systeme bestehen häufig aus einem Sprachmodell, einem Orchestrierungsprogramm, Werkzeugdefinitionen, einem Arbeitsgedächtnis und Regeln für Abbruch oder Freigabe. In der Forschung verbindet ReAct sprachliches Schlussfolgern mit Aktionen in einer Umgebung.

    Was Agenten gut können

    • Mehrstufige Recherche mit klaren Quellenregeln
    • Wiederholbare Bearbeitung vieler ähnlicher Dateien
    • Softwareentwicklung mit Tests und Versionskontrolle
    • Koordination klar definierter Geschäftsprozesse

    Grenzen und Risiken

    • Fehler können sich über mehrere Schritte fortpflanzen
    • Werkzeuge können reale Daten verändern oder Kosten verursachen
    • Unklare Ziele führen zu unnötigen oder falschen Aktionen
    • Lange Aufgaben benötigen Zustandskontrolle, Protokolle und Abbruchkriterien

    Sichere Gestaltung

    • Nur notwendige Berechtigungen vergeben
    • Kritische Aktionen bestätigen lassen
    • Eingaben und Werkzeugergebnisse validieren
    • Jeden Schritt protokollieren
    • Klare Übergabe an Menschen vorsehen

    Primärquellen

  • Workflows und Agenten: der wichtige Unterschied

    Nicht jede Automatisierung braucht einen autonomen Agenten. Vorhersehbare Aufgaben sind mit festen Workflows oft günstiger, kontrollierbarer und leichter zu testen. Agenten sind vor allem dann sinnvoll, wenn der Lösungsweg nicht vollständig im Voraus festgelegt werden kann.

    Einfach erklärt

    Ein Workflow ist wie ein Rezept mit festen Schritten. Ein Agent ist eher wie eine Fachkraft, die ein Ziel erhält und innerhalb vorgegebener Grenzen entscheidet, welche Schritte nötig sind.

    Typische Workflow-Muster

    • Nacheinander ausgeführte Schritte
    • Verzweigung nach festen Regeln
    • Mehrere Modelle arbeiten parallel
    • Eine Instanz bewertet das Ergebnis einer anderen
    • Menschliche Freigabe an definierten Punkten

    Wann ein Workflow genügt

    • Eingaben und Ausgaben sind klar definiert
    • Der Prozess ändert sich selten
    • Fehler müssen leicht nachvollziehbar sein
    • Rechtliche oder finanzielle Risiken verlangen feste Kontrollen

    Wann ein Agent sinnvoll sein kann

    • Die Aufgabe erfordert flexible Recherche
    • Unterschiedliche Werkzeuge müssen situationsabhängig kombiniert werden
    • Zwischenergebnisse verändern den weiteren Lösungsweg
    • Es gibt eine messbare Erfolgsbedingung und sichere Grenzen

    Praxisregel

    Zuerst den einfachsten kontrollierbaren Workflow bauen. Agentische Entscheidungen nur dort ergänzen, wo feste Regeln den tatsächlichen Varianten nicht gerecht werden.

    Primärquellen

  • Tool Use und Function Calling

    Beim Function Calling führt das Modell nicht selbstständig eine Datenbankabfrage oder Bestellung aus. Es erzeugt einen strukturierten Aufruf mit Werkzeugname und Argumenten. Die umgebende Software prüft diese Angaben, führt die Funktion aus und gibt das Ergebnis an das Modell zurück.

    Einfach erklärt

    Das Modell erhält eine Liste erlaubter Werkzeuge. Statt eine Antwort zu erfinden, kann es beispielsweise anfordern: „Wetterdaten für Berlin abrufen“. Das Programm entscheidet, ob der Aufruf zulässig ist, und liefert die echten Daten zurück.

    Technischer Ablauf

    1. Entwickler beschreibt Werkzeug, Parameter und Datentypen
    2. Modell erzeugt einen strukturierten Aufruf
    3. Anwendung validiert Berechtigung und Argumente
    4. Server führt die eigentliche Funktion aus
    5. Ergebnis wird als Werkzeugresultat an das Modell zurückgegeben
    6. Modell formuliert daraus die Antwort

    Vorteile

    • Aktuelle oder interne Daten können eingebunden werden
    • Ausgaben lassen sich durch Schemas besser strukturieren
    • Reale Aktionen werden vom Anwendungscode kontrolliert
    • Ein Modell kann mehrere spezialisierte Systeme koordinieren

    Sicherheitsregeln

    • Argumente niemals ungeprüft ausführen
    • Schreibende und löschende Funktionen besonders schützen
    • Zugriffsrechte pro Nutzer und Vorgang prüfen
    • Werkzeugergebnisse als nicht vertrauenswürdige Eingabe behandeln
    • Zeitlimits, Kostenlimits und Protokollierung einsetzen

    Abgrenzung

    Tool Use ist ein Baustein. Erst eine Schleife aus Planung, Werkzeugaufruf, Beobachtung und Anpassung macht daraus ein agentisches System.

    Primärquellen