Medium oder Format: Code

  • FunSearch: Programme als mathematische Entdeckungen

    FunSearch erzeugt Programme, deren Qualität objektiv berechnet werden kann. Auf diese Weise wurden neue Konstruktionen für das Cap-Set-Problem und Heuristiken für Online-Bin-Packing gefunden. Die Methode funktioniert nur bei Problemen, die sinnvoll als Programm und Bewertung formuliert werden können.

    Forschungsfrage

    Kann ein Sprachmodell durch automatische Prüfung zu neuen, menschlich interpretierbaren Lösungen in Mathematik und Informatik beitragen?

    Ansatz

    • Ein Ausgangsprogramm und eine Bewertungsfunktion definieren das Problem
    • Das Sprachmodell verändert ausgewählte Programme
    • Jede Variante wird ausgeführt und bewertet
    • Gute und unterschiedliche Lösungen fließen in neue Generationen ein

    Veröffentlichte Ergebnisse

    • Neue große Cap Sets in bestimmten Dimensionen
    • Verbesserte Heuristiken für das Online-Bin-Packing
    • Ausgabe als kompakte Programme, die von Forschenden analysiert werden können

    Bedeutung

    Die Kombination aus generativer Suche und strenger automatischer Bewertung zeigt einen Weg, wie Sprachmodelle über bloße Textvorschläge hinaus zu überprüfbaren Resultaten beitragen können.

    Grenzen

    • Nicht jedes Forschungsproblem besitzt eine vollständige Bewertungsfunktion
    • Eine hohe Punktzahl kann Nebenbedingungen übersehen
    • Mathematische Interpretation und formale Prüfung bleiben erforderlich

    Primärquellen

  • AlphaGeometry: Geometriebeweise ohne menschliche Demonstrationen

    Das System erzeugt Hilfskonstruktionen und prüft geometrische Folgerungen symbolisch. In einem Testset löste es 25 von 30 ausgewählten Olympiade-Aufgaben innerhalb der vorgegebenen Zeitbedingungen. Der Vergleich betrifft einen begrenzten Bereich formaler Geometrie und keine allgemeine mathematische Intelligenz.

    Forschungsfrage

    Wie können kreative geometrische Konstruktionen mit streng überprüfbaren Beweisschritten verbunden werden?

    Ansatz

    Ein neuronales Modell schlägt zusätzliche Punkte, Linien oder Kreise vor. Eine symbolische Engine leitet daraus formal gültige Aussagen ab und sucht einen vollständigen Beweis.

    Veröffentlichte Ergebnisse

    • 25 von 30 Aufgaben des IMO-AG-30-Testsets gelöst
    • Vorheriger Vergleichsansatz löste 10 Aufgaben
    • Beweise wurden in symbolisch nachvollziehbarer Form erzeugt

    Bedeutung

    • Verbindung generativer Vorschläge mit formaler Verifikation
    • Synthetische Trainingsdaten statt menschlicher Lösungsdemonstrationen
    • Forschung zu maschinellem Theorembeweisen und mathematischen Assistenzsystemen

    Grenzen

    • Spezialisiert auf euklidische Olympiade-Geometrie
    • Testset und Vergleich erlauben keine Aussage über gesamte Mathematik
    • Formale Übersetzung und geeignete Werkzeuge bleiben für andere Gebiete schwierig

    Primärquellen

  • Workflows und Agenten: der wichtige Unterschied

    Nicht jede Automatisierung braucht einen autonomen Agenten. Vorhersehbare Aufgaben sind mit festen Workflows oft günstiger, kontrollierbarer und leichter zu testen. Agenten sind vor allem dann sinnvoll, wenn der Lösungsweg nicht vollständig im Voraus festgelegt werden kann.

    Einfach erklärt

    Ein Workflow ist wie ein Rezept mit festen Schritten. Ein Agent ist eher wie eine Fachkraft, die ein Ziel erhält und innerhalb vorgegebener Grenzen entscheidet, welche Schritte nötig sind.

    Typische Workflow-Muster

    • Nacheinander ausgeführte Schritte
    • Verzweigung nach festen Regeln
    • Mehrere Modelle arbeiten parallel
    • Eine Instanz bewertet das Ergebnis einer anderen
    • Menschliche Freigabe an definierten Punkten

    Wann ein Workflow genügt

    • Eingaben und Ausgaben sind klar definiert
    • Der Prozess ändert sich selten
    • Fehler müssen leicht nachvollziehbar sein
    • Rechtliche oder finanzielle Risiken verlangen feste Kontrollen

    Wann ein Agent sinnvoll sein kann

    • Die Aufgabe erfordert flexible Recherche
    • Unterschiedliche Werkzeuge müssen situationsabhängig kombiniert werden
    • Zwischenergebnisse verändern den weiteren Lösungsweg
    • Es gibt eine messbare Erfolgsbedingung und sichere Grenzen

    Praxisregel

    Zuerst den einfachsten kontrollierbaren Workflow bauen. Agentische Entscheidungen nur dort ergänzen, wo feste Regeln den tatsächlichen Varianten nicht gerecht werden.

    Primärquellen

  • Tool Use und Function Calling

    Beim Function Calling führt das Modell nicht selbstständig eine Datenbankabfrage oder Bestellung aus. Es erzeugt einen strukturierten Aufruf mit Werkzeugname und Argumenten. Die umgebende Software prüft diese Angaben, führt die Funktion aus und gibt das Ergebnis an das Modell zurück.

    Einfach erklärt

    Das Modell erhält eine Liste erlaubter Werkzeuge. Statt eine Antwort zu erfinden, kann es beispielsweise anfordern: „Wetterdaten für Berlin abrufen“. Das Programm entscheidet, ob der Aufruf zulässig ist, und liefert die echten Daten zurück.

    Technischer Ablauf

    1. Entwickler beschreibt Werkzeug, Parameter und Datentypen
    2. Modell erzeugt einen strukturierten Aufruf
    3. Anwendung validiert Berechtigung und Argumente
    4. Server führt die eigentliche Funktion aus
    5. Ergebnis wird als Werkzeugresultat an das Modell zurückgegeben
    6. Modell formuliert daraus die Antwort

    Vorteile

    • Aktuelle oder interne Daten können eingebunden werden
    • Ausgaben lassen sich durch Schemas besser strukturieren
    • Reale Aktionen werden vom Anwendungscode kontrolliert
    • Ein Modell kann mehrere spezialisierte Systeme koordinieren

    Sicherheitsregeln

    • Argumente niemals ungeprüft ausführen
    • Schreibende und löschende Funktionen besonders schützen
    • Zugriffsrechte pro Nutzer und Vorgang prüfen
    • Werkzeugergebnisse als nicht vertrauenswürdige Eingabe behandeln
    • Zeitlimits, Kostenlimits und Protokollierung einsetzen

    Abgrenzung

    Tool Use ist ein Baustein. Erst eine Schleife aus Planung, Werkzeugaufruf, Beobachtung und Anpassung macht daraus ein agentisches System.

    Primärquellen

  • KI-Agenten: planen, handeln und Ergebnisse prüfen

    Ein KI-Agent beantwortet nicht nur eine einzelne Eingabe. Er kann ein Ziel in Schritte zerlegen, Werkzeuge aufrufen, Zwischenergebnisse auswerten und seinen Plan anpassen. Autonomie bedeutet dabei nicht Zuverlässigkeit: Berechtigungen, Grenzen und menschliche Kontrolle bleiben entscheidend.

    Einfach erklärt

    Ein Chatbot liefert gewöhnlich eine Antwort. Ein Agent versucht dagegen, eine Aufgabe über mehrere Schritte zu erledigen. Er kann beispielsweise Informationen suchen, eine Datei bearbeiten und danach prüfen, ob das Ergebnis zum Ziel passt.

    Typischer Ablauf

    1. Ziel und verfügbare Werkzeuge erfassen
    2. Nächsten sinnvollen Schritt auswählen
    3. Werkzeug ausführen und Ergebnis zurücklesen
    4. Plan anhand des Ergebnisses anpassen
    5. Bei Unsicherheit nachfragen oder an einen Menschen übergeben

    Fortgeschritten

    Agentische Systeme bestehen häufig aus einem Sprachmodell, einem Orchestrierungsprogramm, Werkzeugdefinitionen, einem Arbeitsgedächtnis und Regeln für Abbruch oder Freigabe. In der Forschung verbindet ReAct sprachliches Schlussfolgern mit Aktionen in einer Umgebung.

    Was Agenten gut können

    • Mehrstufige Recherche mit klaren Quellenregeln
    • Wiederholbare Bearbeitung vieler ähnlicher Dateien
    • Softwareentwicklung mit Tests und Versionskontrolle
    • Koordination klar definierter Geschäftsprozesse

    Grenzen und Risiken

    • Fehler können sich über mehrere Schritte fortpflanzen
    • Werkzeuge können reale Daten verändern oder Kosten verursachen
    • Unklare Ziele führen zu unnötigen oder falschen Aktionen
    • Lange Aufgaben benötigen Zustandskontrolle, Protokolle und Abbruchkriterien

    Sichere Gestaltung

    • Nur notwendige Berechtigungen vergeben
    • Kritische Aktionen bestätigen lassen
    • Eingaben und Werkzeugergebnisse validieren
    • Jeden Schritt protokollieren
    • Klare Übergabe an Menschen vorsehen

    Primärquellen

  • Wiederkehrende Büroprozesse automatisieren

    Automatisierung sollte schrittweise erfolgen: erst lesen und vorschlagen, dann mit Freigabe handeln. Berechtigungen, Protokolle und Rückfallwege sind zentral.

    Geeignet für

    • E-Mail-Verarbeitung
    • Dokumentenablage
    • Berichtserstellung
    • Aufgabenverteilung

    Voraussetzungen

    Stabiler Prozess, definierte Eingaben und Ausgaben, minimale Berechtigungen sowie ein menschlicher Freigabepunkt.

    Vorgehensweise

    1. Prozess und Fehlerfolgen dokumentieren.
    2. Einen kleinen, reversiblen Teil auswählen.
    3. Zunächst nur Vorschläge erzeugen lassen.
    4. Prüfregeln, Protokollierung und Freigaben einbauen.
    5. Leistung überwachen und Berechtigungen regelmäßig prüfen.

    Beispiel

    Eingehende Berichte werden klassifiziert, einem Projekt zugeordnet und als Entwurf für eine Zusammenfassung vorbereitet.

    Qualitätskontrolle

    • Schreibende Aktionen nur mit klarer Freigabe zulassen.
    • Jede Aktion protokollieren.
    • Fehler- und Abbruchpfad testen.

    Grenzen und Risiken

    • Prompt Injection und fehlerhafte Klassifikation können Folgeaktionen auslösen.
    • Zu weitreichende Berechtigungen erhöhen den möglichen Schaden.

    Passende Tools und Modelle

    Workflow-Automation, Agentensysteme, RAG und Unternehmenssoftware mit Schnittstellen.

    Quellen und Leitlinien

  • ChatGPT

    ChatGPT ist ein KI-Dienst von OpenAI. Er verbindet dialogbasierte Textarbeit mit multimodalen Funktionen und kann – abhängig von der verfügbaren Produktversion – Dateien, Bilder und Sprache verarbeiten sowie Werkzeuge und agentische Abläufe nutzen.

    Funktionen

    • Fragen beantworten, Inhalte erklären, zusammenfassen und überarbeiten.
    • Dateien und Bilder analysieren sowie strukturierte Ergebnisse erzeugen.
    • Bilder erstellen und bearbeiten; Sprachdialoge und weitere multimodale Funktionen nutzen.
    • Je nach Produktversion recherchieren, Werkzeuge verwenden und mehrstufige Aufgaben bearbeiten.

    Stärken

    • Breites Aufgabenspektrum für Alltag, Lernen, Büro, Kreativität und Entwicklung.
    • Niedrige Einstiegshürde durch natürliche Sprache.
    • Verknüpfung verschiedener Medien und Arbeitsweisen in einer Oberfläche.

    Grenzen

    • Antworten können trotz überzeugender Formulierungen sachlich falsch oder unvollständig sein.
    • Aktuelle Funktionen, Modelle und Nutzungslimits ändern sich regelmäßig.
    • Folgenreiche Entscheidungen erfordern externe Quellen und fachliche Prüfung.

    Datenschutz und Nutzung

    Vertrauliche oder personenbezogene Informationen sollten nur entsprechend den gewählten Kontoeinstellungen, Vertragsbedingungen und internen Datenschutzregeln verarbeitet werden. Für Unternehmen sind die jeweils geltenden Produkt- und Datenkontrollen zu prüfen.

    Preismodell und Verfügbarkeit

    ChatGPT wird in verschiedenen Tarifen angeboten. Modelle, Werkzeuge, Limits und regionale Verfügbarkeit unterscheiden sich. Maßgeblich sind die aktuellen offiziellen Produkt- und Versionshinweise.

    Offizielle Quellen

  • Claude

    Claude ist der dialogbasierte KI-Dienst von Anthropic. Er wird für Schreiben, Analyse, Programmierung, umfangreiche Dokumente und – abhängig von Produkt und Tarif – Werkzeugnutzung sowie agentische Arbeitsabläufe eingesetzt.

    Funktionen

    • Texte analysieren, entwerfen, überarbeiten und strukturieren.
    • Dokumente und umfangreiche Kontexte bearbeiten.
    • Code erklären, erzeugen und in Entwicklungsumgebungen unterstützen.
    • Je nach Produktversion Werkzeuge, Computersteuerung und länger laufende Aufgaben nutzen.

    Stärken

    • Ausführliche Text- und Dokumentarbeit.
    • Starke Ausrichtung auf Analyse, Programmierung und professionelle Arbeitsabläufe.
    • API und Integrationen für eigene Anwendungen.

    Grenzen

    • Auch Claude kann halluzinieren und Quellen falsch einordnen.
    • Funktionsumfang und Modellzugang unterscheiden sich nach Tarif und Plattform.
    • Werkzeug- oder Computeraktionen benötigen Kontrolle und klare Berechtigungsgrenzen.

    Datenschutz und Nutzung

    Vor der Verarbeitung interner Dokumente sind die jeweils geltenden Datenbedingungen, Aufbewahrungseinstellungen und Unternehmensoptionen zu prüfen.

    Preismodell und Verfügbarkeit

    Claude ist als Web- und Mobilanwendung sowie über APIs und ausgewählte Cloud-Plattformen verfügbar. Tarife, Modelle und Limits ändern sich; maßgeblich sind die offiziellen Produktinformationen.

    Offizielle Quellen

  • GitHub Copilot

    GitHub Copilot ist ein KI-gestützter Entwicklungsdienst. Er unterstützt beim Verstehen, Schreiben, Ändern und Prüfen von Code und kann je nach Produktstufe Aufgaben agentisch in Entwicklungsumgebungen oder auf GitHub bearbeiten.

    Funktionen

    • Codevervollständigung und Vorschläge für nächste Änderungen.
    • Chat und Erklärungen im Kontext eines Projekts.
    • Agentenmodus für Änderungen über mehrere Dateien, Tests und Validierung.
    • Code-Review, CLI-Unterstützung und asynchrone Aufgaben auf GitHub – abhängig vom Tarif.

    Stärken

    • Direkte Einbindung in verbreitete Entwicklungswerkzeuge.
    • Nutzung des vorhandenen Projektkontexts.
    • Unterstützung vom Entwurf bis zu Tests und Review.

    Grenzen

    • Generierter Code kann Fehler, Sicherheitsprobleme oder ungeeignete Abhängigkeiten enthalten.
    • Ergebnisse müssen getestet und von Entwicklern geprüft werden.
    • Funktionen, Modellwahl und Kontingente hängen vom Tarif ab.

    Datenschutz und Nutzung

    Organisationen sollten Ausschlussregeln, Richtlinien, Datenkontrollen und Rechte für Repository-Zugriffe festlegen.

    Preismodell und Verfügbarkeit

    GitHub Copilot wird in mehreren Tarifen für Einzelpersonen und Organisationen angeboten. Der genaue Funktionsumfang ist der aktuellen Tarifübersicht zu entnehmen.

    Offizielle Quellen

  • GPT-Modellfamilie

    Die GPT-Modellfamilie umfasst generative Modelle von OpenAI für Text, visuelle Eingaben, Programmierung, Reasoning und Werkzeugnutzung. Der konkrete Modellkatalog wird laufend aktualisiert; für technische Entscheidungen ist deshalb die offizielle Modellübersicht maßgeblich.

    Modelltyp und Fähigkeiten

    • Transformer-basierte generative Modelle für Text und weitere Modalitäten.
    • Unterstützung für mehrsprachige Aufgaben, visuelle Eingaben, Code und strukturierte Ausgaben – modellabhängig.
    • Werkzeugaufrufe, agentische Abläufe und unterschiedliche Reasoning-Stufen in aktuellen Modelllinien.

    Technische Einordnung

    GPT-Modelle erzeugen Ausgaben tokenweise auf Grundlage gelernter Wahrscheinlichkeitsverteilungen. Moderne Varianten kombinieren Vortraining, Nachtraining, Sicherheitsverfahren, Werkzeugnutzung und zusätzliche Laufzeitberechnung für komplexe Aufgaben.

    Verfügbarkeit und Zugang

    Der Zugang erfolgt über ChatGPT sowie über OpenAIs API. Modellnamen, Kontextgrößen, Preise und Endpunkte verändern sich; produktive Systeme sollten auf die offizielle Modellliste und Migrationshinweise abgestimmt werden.

    Benchmarks und Grenzen

    Benchmarks zeigen nur Ausschnitte der Leistung. Modelle können halluzinieren, bei ungewöhnlichen Verteilungen versagen und in agentischen Abläufen falsche Aktionen planen. Evaluationen müssen den realen Einsatzzweck, Kosten, Latenz und Sicherheitsanforderungen abbilden.

    Offizielle Quellen