Testy matematyczne były podstawową metodą sprawdzania możliwości modeli AI, takich jak ChatGPT czy Claude. OpenAI twierdzi, że jego modele radzą sobie już tak dobrze, że dotychczasowe testy matematyczne tracą sens. Badacze postanowili więc sprawdzić coś trudniejszego.
Podali niezaprezentowanemu jeszcze modelowi około 4000 nierozwiązanych problemów matematycznych. Wyniki okazały się zaskakujące i niepokojące.
AI wygenerowała 722 manuskrypty, pogrupowane w 372 rodziny powiązanych wyników. OpenAI informuje, że każdy z wyników wymagał średnio około trzech godzin rozumowania obliczeniowego.
„Przed społecznością matematyków naprawdę ekscytujące dni!”
Czy AI staje się zbyt potężna zbyt szybko?
To jest szerszy temat. Frontier AI zaczyna wychodzić poza odpowiadanie na znane pytania i wkracza w generowanie propozycji odpowiedzi na nieznane kwestie.
To może znacząco zwiększyć zakres pracy intelektualnej, którą mogą wykonać badacze, inżynierowie i analitycy.
Jednak wynik to nie prawda. Wiele prac OpenAI ma możliwe do sprawdzenia komputerowo dowody Lean. Inne ich nie posiadają. OpenAI ostrzega, że niezweryfikowane wyniki „mogą zawierać błędy”.
To tworzy nowy wąskie gardło: ludzie mogą nie nadążać z weryfikacją wyników równie szybko, jak AI je produkuje.
Czy AI mogłaby teraz przeprowadzić analizę predykcyjną i podejmować decyzje inwestycyjne?
To możliwe, ale finanse są trudniejsze w inny sposób.
Dowód matematyczny można ostatecznie uznać za prawdziwy lub fałszywy. Rynki są zmienne i ciągle się zmieniają.
Najświeższe testy finansowe wciąż pokazują, że zaawansowana AI ma problemy z bardzo złożonymi analizami inwestycyjnymi, a badania nad wyczuciem momentu rynkowego dają ograniczone możliwości predykcyjne.
Najbliższą szansą jest pogłębiona analiza, a nie perfekcyjne przewidywanie.
AI, potrafiąca rozumować przez wiele godzin, może równocześnie badać zgłoszenia giełdowe, telekonferencje wynikowe, dane makro i konkurencyjne scenariusze, a następnie testować dużo więcej hipotez niż jeden analityk.
To może być najważniejszy sygnał z eksperymentu OpenAI. AI zaczyna generować zaawansowane analizy w bezprecedensowej skali. Kolejnym wyzwaniem będzie wybór, którym warto zaufać.









