FunSearch erzeugt Programme, deren Qualität objektiv berechnet werden kann. Auf diese Weise wurden neue Konstruktionen für das Cap-Set-Problem und Heuristiken für Online-Bin-Packing gefunden. Die Methode funktioniert nur bei Problemen, die sinnvoll als Programm und Bewertung formuliert werden können.
Forschungsfrage
Kann ein Sprachmodell durch automatische Prüfung zu neuen, menschlich interpretierbaren Lösungen in Mathematik und Informatik beitragen?
Ansatz
- Ein Ausgangsprogramm und eine Bewertungsfunktion definieren das Problem
- Das Sprachmodell verändert ausgewählte Programme
- Jede Variante wird ausgeführt und bewertet
- Gute und unterschiedliche Lösungen fließen in neue Generationen ein
Veröffentlichte Ergebnisse
- Neue große Cap Sets in bestimmten Dimensionen
- Verbesserte Heuristiken für das Online-Bin-Packing
- Ausgabe als kompakte Programme, die von Forschenden analysiert werden können
Bedeutung
Die Kombination aus generativer Suche und strenger automatischer Bewertung zeigt einen Weg, wie Sprachmodelle über bloße Textvorschläge hinaus zu überprüfbaren Resultaten beitragen können.
Grenzen
- Nicht jedes Forschungsproblem besitzt eine vollständige Bewertungsfunktion
- Eine hohe Punktzahl kann Nebenbedingungen übersehen
- Mathematische Interpretation und formale Prüfung bleiben erforderlich