Serwis preprintów arXiv jest tak zalewany często niskiej jakości artykułami generowanymi przez sztuczną inteligencję, że stał się praktycznie bezużyteczny – ostrzegają matematycy na łamach „New Scientista”.
ArXiv to elektroniczne archiwum prac naukowych, które nie były jeszcze publikowane ani recenzowane, jednak mogą być tam umieszczane wyłącznie przez zarejestrowanych i zaufanych autorów (endorsers). Aby zostać zaufanym autorem, wystarczy potwierdzenie od innego zaufanego autora. Większość prac umieszczanych w arXiv jest publikowana także w renomowanych czasopismach naukowych.
Prace umieszczone w arXIV są dostępne bezpłatnie dla wszystkich użytkowników internetu. Są to artykuły dotyczące fizyki i astronomii, matematyki, informatyki, statystyki i biologii oraz matematyki finansowej. Archiwum powstało w roku 1991 w Los Alamos National Laboratory, a obecnie funkcjonuje przy Cornell University. Dzięki ArXiv pracownicy naukowi mają możliwość bycia na bieżąco z tym, co dzieje się w ich dziedzinach.
Gwałtowny wzrost możliwości matematycznych sztucznej inteligencji i jej zdolność do automatycznego generowania artykułów z dużą szybkością i minimalnym nakładem pracy ludzkiej sprawiają, że strona internetowa arXiv jest zalewana coraz większą liczbą artykułów. Grozi to przepełnieniem bazy i uczynieniem jej bezużyteczną.
O ile we wrześniu 2024 roku do arXiv zgłoszono 20 569 artykułów, to rok później liczba ta wzrosła do 26 646, a we wrześniu 2026 roku – aż do 40 363.
Kevin Buzzard z Imperial College London twierdzi na łamach „New Scientista”, że zgłaszanie autentycznych artykułów stało się trudniejsze, ponieważ moderatorzy arXiv są przeciążeni pracą, a artykuły mogą znikać w kolejce recenzji na całe tygodnie. Liczba opublikowanych artykułów jest tak duża, że Buzzard nie jest w stanie codziennie ręcznie ich czytać. Musi korzystać ze sztucznej inteligencji, aby podpowiadała mu, na których artykułach się skupić.
„Problem polega na tym, że artykuły o charakterze prowizorycznym nie wyjaśniają dobrze pewnych rzeczy. Nie chodzi tylko o poprawność; chodzi o ludzkie zrozumienie, a sztuczna inteligencja czasami bardzo słabo sobie z tym radzi” – wskazał Buzzard.
Dzięki dostępowi do sztucznej inteligencji matematycy nieprofesjonalni mogą teraz rozwiązywać dość trudne problemy i automatycznie generować artykuły przedstawiające wyniki, które następnie można opublikować w arXiv. Jednak takie artykuły są często krytykowane przez matematyków. Na przykład Chaim Goodman-Strauss z Uniwersytetu Arkansas opisał w tym tygodniu jeden artykuł – zawierający poprawne rozwiązanie długotrwałego problemu – jako „w zasadzie prowizoryczny”.
Terence Tao z Uniwersytetu Kalifornijskiego w Los Angeles poskarżył się niedawno w wywiadzie dla „New Scientista”, że sposób, w jaki dokonuje się odkryć matematycznych i „zrzuca” je na społeczność matematyczną, może w rzeczywistości zaszkodzić tej dziedzinie.
Modele sztucznej inteligencji rozwiązują problemy matematyczne w coraz szybszym tempie, a technika zwana formalizacją jest kluczowa dla wykazania, że ich deklarowane rozwiązania są rzeczywiście poprawne. Problem w tym, że trzeba zaufać procesowi formalizacji.
Aby ograniczyć liczbę prac o niskiej jakości, generowanych przez sztuczną inteligencję, serwis wprowadził nowy limit dla przesyłających artykuły. Obecnie mogą oni przesyłać tylko dwa artykuły w miesiącu kalendarzowym i mieć łącznie trzy aktywne zgłoszenia w danym momencie.
Zasady ArXiv od dawna zezwalają autorom na korzystanie ze sztucznej inteligencji, pod warunkiem jej ujawnienia. ArXiv odnotował jednak wzrost liczby artykułów o wąskim zakresie i „niskiej wartości”.
Podjęto także działania mające pozwolić na dostosowanie się do nowej rzeczywistości. Na przykład nowa strona o nazwie Hexagon to miejsce dla „pre-preprintów”, artykułów generowanych przez AI, których matematycy mogą jeszcze nie w pełni zrozumieć.
Paweł Wernicki (PAP)





