AlphaEvolve sucht nach Programmen, die ein klar messbares Ziel verbessern. Kandidaten werden automatisch ausgeführt und bewertet; erfolgreiche Varianten dienen als Ausgangspunkt für weitere Vorschläge. Ergebnisse sind besonders belastbar, wenn die Bewertungsfunktion die Aufgabe vollständig abbildet.
Forschungsfrage
Können Sprachmodelle nicht nur Code schreiben, sondern durch wiederholte, automatisch bewertete Variation neue und effizientere Algorithmen entdecken?
Ansatz
- Mehrere Sprachmodelle schlagen Programmvarianten vor
- Automatische Evaluatoren messen Korrektheit oder Leistung
- Eine evolutionäre Datenbank wählt vielversprechende Kandidaten
- Neue Generationen verändern und kombinieren erfolgreiche Programme
Berichtete Anwendungen
- Optimierung von Rechenzentrums- und Planungsalgorithmen
- Beiträge zu Chipdesign und KI-Training
- Neue Varianten für Matrixmultiplikation
- Suche nach Lösungen mathematischer Probleme
Warum das überprüfbarer ist
Die Ausgabe besteht aus ausführbarem Code. Dieser kann mit Tests, Benchmarks oder mathematischen Prüfungen bewertet werden. Das reduziert, aber beseitigt nicht die Gefahr einer unvollständigen Bewertungsfunktion.
Grenzen
- Die Aufgabe benötigt eine verlässliche maschinelle Bewertungsfunktion
- Optimierung kann unbeabsichtigte Lücken im Messverfahren ausnutzen
- Entdeckter Code muss von Fachleuten verstanden, getestet und abgesichert werden
Status
Aktives Forschungssystem; konkrete Zugänglichkeit und Einsatzbereiche sind begrenzt und können sich ändern.