Veröffentlicht am 8. Juni 2026
Konzipiert von Mathematikforschenden für Mathematikforschende brachte dieser praxisorientierte Workshop die Teilnehmenden zusammen, um gemeinsam Benchmarks auf Forschungsniveau zu entwickeln. Ziel war es, die Fähigkeiten und Grenzen der sich rasant weiterentwickelnden KI-Modelle für mathematisches Denken zu untersuchen.
Das Programm kombinierte praktische Einheiten zu Prompting und Benchmark-Design mit kollaborativen Arbeitsgruppen. Die Teilnehmenden formulierten, verfeinerten und testeten mathematische Probleme auf Forschungsniveau. Darüber hinaus diskutierten sie den aktuellen Stand der KI in der Mathematik und gingen der Frage nach, was eine Aufgabe für heutige Modelle tatsächlich herausfordernd macht.
Im Mittelpunkt des Projekts stand die interaktive Plattform Science Bench, die zur Erstellung eines Datensatzes von mathematischen Fragestellungen auf Forschungsniveau anhand bekannter Lösungen genutzt wurde.
Die Forschenden evaluierten 100 Benchmark-Aufgaben in einem dreistufigen Verfahren. Nachdem in der ersten Phase fünf moderne Sprachmodelle die Aufgaben bearbeitet hatten, blieben 41 Fragen ungelöst. Nach weiteren 20 Durchläufen mit den drei leistungsstärksten Modellen in der zweiten Phase reduzierte sich diese Zahl auf 16. In der dritten und letzten Phase wurden zwei sogenannte „Deep-Think“-Modelle jeweils dreimal getestet. Am Ende blieben nur noch zwei Aufgaben ungelöst.
Um die Ergebnisse einer breiteren Öffentlichkeit zugänglich zu machen, veröffentlichten die Projektleitenden die Resultate in einem aktuellen arXiv-Artikel. Die Studie basiert maßgeblich auf den Beiträgen der 35 Teilnehmenden der Benchmark-Konferenz sowie der Arbeit von 14 externen Forschenden.
Die Ergebnisse beweisen, dass die Fähigkeiten großer Sprachmodelle im mathematischen Denken immer beeindruckender werden.
Max-Planck-Institut für Mathematik in den Naturwissenschaften
E-Mail
Ruhr-Universität Bochum
E-Mail
Max Planck Institute for Mathematics in the Sciences
E-Mail
Benchmarks in Leipzig - veröffentlicht auf arXiv
Science Bench Plattform - konzipiert von Christian Stump
Benchmarks in Leipzig - Konferenz Website