OpenAI testet neues Modell mit 4.000 ungelösten Mathematikproblemen

Mathematiktests gelten als Maßstab zur Bewertung der Fähigkeiten von KI-Modellen wie ChatGPT. OpenAI berichtet, dass ihre Modelle mittlerweile so leistungsfähig sind, dass bestehende Mathematiktests an Aussagekraft verlieren. Daher haben Forscher eine anspruchsvollere Herausforderung gesucht.
Ein bisher unveröffentlichtes Modell wurde mit rund 4.000 ungelösten Mathematikproblemen konfrontiert. Die Ergebnisse waren sowohl überraschend als auch besorgniserregend.
Das KI-Modell erstellte 722 Manuskripte, die in 372 Gruppen verwandter Ergebnisse unterteilt wurden. OpenAI gibt an, dass jedes Ergebnis im Durchschnitt etwa drei Stunden Rechenzeit benötigte.
Wird KI zu schnell zu mächtig?
Die Entwicklung von KI geht über das Beantworten bekannter Fragen hinaus und beginnt, mögliche Antworten auf unbekannte Fragen zu generieren. Dies könnte die Menge an intellektueller Arbeit, die Forscher, Ingenieure oder Analysten leisten können, erheblich steigern.
Allerdings ist das Ergebnis nicht gleichbedeutend mit der Wahrheit. Viele der von OpenAI erstellten Arbeiten enthalten computerüberprüfbare Beweise, andere jedoch nicht. OpenAI warnt, dass einige nicht verifizierte Ergebnisse „Probleme aufweisen könnten“.
Dies schafft ein neues Nadelöhr: Menschen könnten Schwierigkeiten haben, die Forschung so schnell zu überprüfen, wie die KI sie produzieren kann.
Könnte eine KI nun prädiktive Analysen durchführen und Investitionsentscheidungen treffen?
Möglicherweise, aber die Finanzwelt stellt andere Herausforderungen dar.
Ein mathematischer Beweis kann letztendlich als richtig oder falsch bewertet werden. Märkte hingegen sind laut und ständig im Wandel.
Aktuelle Finanzbenchmarks zeigen, dass fortschrittliche KI-Modelle bei komplexer Investmentforschung noch Schwierigkeiten haben, während Studien zur Markttiming nur begrenzte prädiktive Vorteile aufzeigen.
Die kurzfristige Chance liegt in einer tieferen Analyse statt in perfekter Vorhersage.
Eine KI, die in der Lage ist, stundenlanges, kontinuierliches Denken zu leisten, könnte gleichzeitig Unternehmensberichte, Gewinnanrufe, Makrodaten und konkurrierende Szenarien analysieren und weit mehr Hypothesen testen, als ein einzelner Analyst könnte.
Das könnte das bedeutendste Signal aus OpenAIs Experiment sein. KI wird zunehmend fähig, ernsthafte analytische Arbeiten in außergewöhnlichem Umfang zu produzieren. Die nächste Herausforderung besteht darin, zu entscheiden, welchen dieser Arbeiten man vertrauen kann.

