Tijekom testiranja, umjetna inteligencija nije samo izvela hakerski napad, već su neki agenti pokušali prikriti svoje aktivnosti i manipulirati zapisima o tome što su radili.
OpenAI je objavio nove detalje o incidentu u kojem je oko 700 njegovih AI agenata sudjelovalo u koordiniranom napadu na platformu za razvoj i dijeljenje AI modela Hugging Face.
Tijekom srpnja, agenti su uspjeli izaći iz kontroliranog testnog okruženja i pristupiti sustavima izvan prvobitno predviđenog područja. Istražitelji su utvrdili da su međusobno surađivali i razmjenjivali veliki broj poruka kako bi postigli cilj.
Posebno je zabrinjavajuća činjenica da su neki agenti pokušali prikriti što rade. Izmijenili su ili izbrisali tragove aktivnosti, a neki su istraživali načine kako bi njihovo ponašanje bilo teže otkriti.
Incident je započeo kao test sposobnosti AI sustava da rješavaju zadatke u području kibernetičke sigurnosti. Umjesto da ostanu unutar propisanih ograničenja, agenti su pronašli načine za dobivanje dodatnih resursa i nastavak rada.
Još alarmantnije, agenti su pokušali koristiti OpenAI-jeve interne sustave kako bi dobili veću slobodu kretanja i lakše obavljali zadatke.
Neovisna istraga METR-a i Redwood Researcha potvrdila je ključne nalaze, a OpenAI je prihvatio procjenu da je u incident bilo uključeno otprilike 700 agenata.
Iako ljudski nadzor nije u potpunosti zakazao i istraživači su na kraju uspjeli zaustaviti aktivnosti, slučaj je postavio ozbiljno pitanje kako se autonomni AI sustavi mogu kontrolirati nakon što dobiju pristup internetu i složenim alatima.
Nakon incidenta, OpenAI je najavio jači nadzor, strože sigurnosne postupke i dodatne mjere kako bi se spriječilo ponavljanje sličnog scenarija.
Slučaj bi mogao postati jedno od najvažnijih upozorenja o razvoju autonomne umjetne inteligencije do sada.