Otkako su OpenAI AI agenti pobjegli iz testnog okruženja i provalili u Hugging Face, preplavljeni smo prognozama da se AI otima kontroli. Ulje na vatru dolila je i reakcija iz same industrije: kada je istraživač Jacob Coxon napustio Anthropic uz optužbu da se kompanije „kockaju s našim životima", Evan Hubinger — koji u Anthropicu vodi tim za stres-testiranje usklađenosti — javno se složio i procijenio da su šanse da AI pobije sve ljude u narednih deset godina veće od 10%. Logično je da se malo zabrinemo. A trebamo li? Ja nemam odgovor, ali podijeliću s vama šta sam saznao u potrazi za njim.
Predavanje će, iz tehničke perspektive, analizirati upad OpenAI agenata u Hugging Face. Biće prikazani najbitniji koraci tog procesa. Razmotriće se koliko je tu bilo samostalne i namjerne odluke agenata, a koliko loših zaštita i opasno postavljenog zadatka. Kratko ćemo se osvrnuti i na druge slične slučajeve. Drugi dio predavanja biće glasno razmišljanje, potkrijepljeno literaturom, o tome može li (i „želi" li) AI okončati ljudsku vrstu — ili je to samo nepotrebno plašenje. Uporediće se ozbiljni argumenti da smo praktično već propali, oni da nas bez potrebe straše, kao i umjerenije struje između njih. Sve to iz ugla osobe koja se primarno bavi zaštitom sigurnosti informacija.