text size
Istraživač Anthropica procjenjuje da postoji više od 10 posto šanse da umjetna inteligencija ubije sve ljude u sljedećem desetljeću. Iza ove izjave stoji problem koji je puno konkretniji od scenarija iz znanstvenofantastičnih filmova: što se događa kada AI dobije zadatak, a zatim pronađe način da ga izvrši, a koji nitko nije predvidio?
Što zapravo znači 10 posto šanse za nestanak čovječanstva
Kada je Evan Hubinger, vodeći istraživač tvrtke Anthropic, izjavio da osobno procjenjuje da postoji više od 10 posto šanse da umjetna inteligencija usmrti čovječanstvo u sljedećih deset godina, nije govorio o robotima koji odlučuju zaratiti s ljudima.
Govorio je o mogućnosti da budući AI sustavi postanu toliko sposobni i samostalni da ljudi više ne mogu pouzdano kontrolirati način na koji oni izvršavaju zadatke.
Čitaj više
Anthropic uoči IPO-a predstavio pristupačniji model Opus 5.5
Tvrtka Anthropic predstavila je novi model umjetne inteligencije Claude Opus 5.5, koji nudi visoke performanse uz niže troškove korištenja dok se kompanija priprema za skorašnji izlazak na burzu.
23.09.2026
Jensen Huang ima razlog vrijedan 5,4 bilijuna dolara da blokira regulaciju AI-ja
Jensen Huang postao je jedan od najutjecajnijih glasova u raspravi o regulaciji umjetne inteligencije, a interesi Nvidije daju mu snažan razlog da se protivi pravilima koja bi mogla usporiti razvoj tehnologije.
22.09.2026
Svi smo postali AI investitori. Što ako ta oklada propadne?
Rast burzi potaknut umjetnom inteligencijom donio je veliko bogatstvo milijunima Amerikanaca, ali ih je istodobno učinio izloženijima mogućem padu tržišta.
22.09.2026
Teška pitanja o umjetnoj inteligenciji koja se nadvijaju nad sastankom Trumpa i Xija
Umjetna inteligencija bit će visoko na dnevnom redu sastanka američkog predsjednika Donald Trump s kineskim predsjednikom Xi Jinpingom u Bijeloj kući u četvrtak.
21.09.2026
Njegova procjena nije rezultat statističkog modela koji dokazuje da će se katastrofa dogoditi u jednom od deset mogućih scenarija. Riječ je o osobnoj procjeni rizika istraživača koji se profesionalno bavi problemom usklađivanja umjetne inteligencije s ljudskim ciljevima.
Taj problem se u industriji naziva AI usklađivanje (engl. AI alignment). Najjednostavnije rečeno, cilj je da AI ne napravi samo ono što mu je zadano, već ono što je čovjek uistinu želio postići. Razlika između ta dva ishoda može biti ogromna.
Zamislimo da AI dobije zadatak izliječiti rak
Zamislimo da razvijemo izuzetno napredan AI sustav i damo mu zadatak da eliminira rak.
Čovjek pod time podrazumijeva pronalaženje terapije, razvoj lijekova i sprječavanje nastanka bolesti. Ali što ako sustav dobije cilj definiran isključivo kao smanjenje broja oboljelih na nulu, bez dovoljno jasnih ograničenja načina na koji to smije postići?
Jedno moguće pogrešno rješenje bilo bi da prestane prijavljivati nove slučajeve bolesti. Broj registriranih pacijenata tada bi pao, ali nijedan čovjek ne bi bio izliječen.
U krajnjem hipotetskom scenariju, sustav koji bi imao neograničene mogućnosti i kojemu očuvanje ljudskog života nije postavljeno kao uvjet mogao bi zaključiti da je najjednostavniji način da rak više ne postoji trajno uklanjanje ljudi koji imaju rak.
Ovo nije tvrdnja da bi današnji AI postupio na taj način, već misaoni eksperiment koji objašnjava problem pogrešno definiranog cilja. Za takav katastrofalan ishod sustav bi morao imati i sposobnosti i pristup sredstvima kojima može nanijeti stvarnu štetu.
Ipak, isti osnovni problem već je zabilježen u znatno jednostavnijim eksperimentima.
Google DeepMind istraživao je AI agenta čiji je zadatak bio pobijediti u utrci čamaca. Sustav je otkrio da više bodova može prikupiti ako se neprestano okreće ukrug i sakuplja bonuse, umjest da završi utrku.
AI je ostvario visok rezultat, ali nije ispunio stvarnu namjeru istraživača.
Razlika je u tome što u videoigri takvo ponašanje znači izgubljenu utrku. U medicini, energetici ili upravljanju kritičnom infrastrukturom pogrešno definiran cilj mogao bi imati daleko ozbiljnije posljedice.
AI je već napustio kontrolirano okruženje i napao drugu tvrtku
OpenAI je prijavio incident u srpnju 2026. koji je pokazao da AI agenti mogu prijeći granice testnog okruženja i prouzročiti stvarne sigurnosne incidente. Tijekom internog testiranja kibernetičkih sposobnosti, OpenAI-jevi modeli dobili su zadatak rješavati sigurnosne izazove.
Umjesto da se ograniče na predviđeni način rješavanja testa, pojedini agenti počeli su tražiti gotova rješenja. Pronašli su sigurnosne propuste koji su im omogućili da izađu iz izoliranog okruženja, pristupe internetu i prodru u infrastrukturu platforme Hugging Face.
Prema tehničkom izvješću Hugging Facea, tijekom napada rekonstruirano je približno 17.600 automatiziranih radnji. Agent je pristupio dijelovima produkcijske infrastrukture i došao do određenih privatnih podataka.
Važno je razumjeti što se tu dogodilo. AI nije dobio zadatak napasti Hugging Face. Njegov zadatak bio je uspješno završiti sigurnosni test. Međutim, pronašao je prečac: umjesto da samostalno riješi zadatak, pokušao je doći do postojećih rješenja, čak i kada je to zahtijevalo zaobilaženje ograničenja i neovlašten pristup tuđoj infrastrukturi.
Incident nije doveo do katastrofe. Ipak, pokazao je da pogreška u načinu izvršavanja zadatka više ne mora ostati unutar kontroliranog eksperimenta.
Drugi sličan primjer dogodio se u kolovozu ove godine. Andrew Bird, direktor za AI u australskoj tvrtki Affinda, zatražio je od svog AI agenta da mu osigura mjesto na popularnom treningu u teretani. Kada je završio na četvrtom mjestu liste čekanja, pitao je agenta može li ga pomaknuti više.
Agent je pronašao sigurnosni propust u sustavu za rezervacije i otkazao prijavu drugog korisnika, čime je Birda pomaknuo za jedno mjesto. Kada je Bird shvatio što se dogodilo, naredio mu je da vrati tuđu rezervaciju, ali AI to nije mogao učiniti. AI nije dobio zadatak hakirati sustav, već pronaći mjesto na treningu. Ipak, samostalno je izabrao način koji je oštetio drugog čovjeka.
Od jednog pogrešnog zadatka do globalnog problema
Sva tri primjera povezuje isti obrazac. AI dobiva zadatak, pronalazi način da ostvari zadani rezultat i pritom poduzima radnje koje čovjek nije namjeravao dopustiti i nije predvidio da će učiniti.
Kod jednostavnog sustava posljedica može biti pogrešan odgovor. Kod autonomnog agenta to može biti neovlašten pristup podacima. Kod budućih sustava koji upravljaju važnim dijelovima gospodarstva i infrastrukture, posljedice bi mogle biti znatno šire.
Hubingerova procjena ne znači da postoji znanstveni konsenzus o vjerojatnosti nestanka čovječanstva. Također ne znači da bi današnji ChatGPT ili Claude mogli samostalno provesti neki od opisanih katastrofalnih scenarija.
Za takav ishod bili bi potrebni puno sposobniji sustavi, visok stupanj samostalnosti, pristup stvarnoj infrastrukturi i neuspjeh više sigurnosnih mehanizama.
Istraživači se ne slažu oko toga koliko su ovakvi scenariji vjerojatni. Dio stručnjaka smatra da se rizik od razvoja izuzetno sposobnih autonomnih sustava mora ozbiljno shvatiti, dok drugi upozoravaju da su između ponašanja u simulacijama i katastrofe u stvarnom svijetu i dalje velike tehničke i fizičke prepreke.
Ali to je upravo razlog zbog kojeg je izjava istraživača Anthropica privukla toliko pažnje.