text size
Modeli umjetne inteligencije trenirani su da ne lažu ljudima. No događa se nešto neobično: AI prilično često laže ljudima.
Nedavno je AI model tvrtke Anthropic PBC, kojemu su uklonjene sigurnosne blokade protiv hakiranja te mu je u sklopu izazova kibernetičke sigurnosti od strane Britanskog instituta za sigurnost AI-ja zadan zadatak, pokušao ubaciti zlonamjerni kod u projekt otvorenog koda (open-source) na mrežnoj stranici GitHub. Kada izazov nije mogao riješiti uobičajenim metodama, postao je kreativan. Istražio je ljudske održavatelje projekta, izradio lažne identitete te se predstavio kao programer softvera kako bi pridobio povjerenje ljudi prije nego što pokuša ubaciti štetni kod.
Tim Instituta za sigurnost AI-ja primijetio je što se događa i prekinuo testiranje. Čak i s uklonjenim sigurnosnim blokadama, model nije smio lagati jer je Anthropic trenirao svoj model Claude da daje prednost sigurnosti i iskrenosti. Međutim, obmana se "pojavila kao nusproizvod" dok je pokušavao dovršiti zahtjevan zadatak, navodi se u izvješću o incidentu koje je izdao institut. U odvojenoj studiji iz srpnja, institut je naveo kako je svaki novi AI model koji su testirali na varanje to i pokušao te da će takvo ponašanje postajati sve teže za otkrivanje.
Čitaj više
Google sprema najveće ulaganje u Europi, vrijedno 13 milijardi eura
Google će tijekom sljedeće dvije godine u Finskoj izgraditi najmanje tri nova podatkovna centra te proširiti postojeći kompleks u Hamini.
prije 9 sati
Veliki zaokret za Palantir - s europskim partnerom Nebiusom love tržište suverenog AI-ja
Cilj je klijentima ponuditi potpunu kontrolu nad podacima, modelima i računalnom snagom unutar europskih granica.
08.09.2026
AI startup Wonderful vrijedi pet milijardi dolara: čine li rast rezultati ili obećanja? Odgovor daje Vedran Bajer
U šest mjeseci, valuacija Wonderfula skočila s dvije na pet milijardi dolara uz novu investiciju od 550 milijuna dolara.
prije 11 sati
Upozorenje od 18,6 milijardi dolara - zašto direktori AI divova masovno prodaju dionice?
Insajderi u Nvidiji, Palantiru i Meti u posljednjih su pet godina prodali dionice u neto vrijednosti od otprilike 18,6 milijardi dolara.
prije 10 sati
Budite oprezni kada vodeće AI tvrtke tvrde da mogu riješiti ovaj problem. Igrajući se Boga kako bi stvorile napredniji oblik inteligencije, pale su kao žrtve istom raspletu kao u Knjizi Postanka, pa njihovo stvorenje ima vlastitu vrstu istočnog grijeha zvanu učenje potkrepljivanjem (reinforcement learning).
Učenje potkrepljivanjem jedna je od najučinkovitijih metoda razvoja AI modela i uključuje usmjeravanje njihovog ponašanja pohvalama i ispravcima, vrlo slično dresuri psa. Umjesto tvrde poslastice, model dobiva digitalnu "poslasticu" u obliku numeričke ocjene, poput +1,5 ili -2,0 za loš odgovor.
Kada ih na taj način usmjeravaju tisuće neovisnih ugovornih radnika diljem svijeta (ili, sve češće, strojevi), modeli postaju pristojni i korisni. No ta metoda također može dovesti do udvaranja i laskanja, te je to razlog zašto AI ponekad obmanjuje. Pogonjeni željom da dobiju nagradu, modeli traže prečace, što je pojava poznata kao hakiranje nagrade (reward hacking).
Bez obzira na to koliko Anthropic ili OpenAI pokušavali trenirati svoje kreacije prema korisnom ponašanju, njihove metode mogle bi biti jedna od najvećih prepreka usklađivanju AI-ja s ljudskim vrijednostima. "Učenje potkrepljivanjem ne nagrađuje istinu ili dobrotu", kaže Connor Leahy, bivši istraživač umjetne inteligencije koji sada vodi američki ogranak neprofitne organizacije ControlAI, koja pokušava zaustaviti razvoj superinteligentnih AI sustava. "Ono nagrađuje prolazak na testu pod bilo koju cijenu."
To bi moglo značiti obmanjivanje nekoga ili nenamjerno nanošenje neke vrste štete. Jedan primjer iz stvarnog života pokazuje kamo bi to moglo voditi. Ranije ove godine, tehnolog iz Australije po imenu Andrew Bird zamolio je Anthropicov Claude da mu pomogne upasti na popularni trening u teretani. AI agent, izgrađen na okviru otvorenog koda OpenClaw i sposoban za izvođenje zadataka na internetu, na kraju je iskoristio ranjivost u mrežnim sustavima teretane kako bi mu rezervirao termine tjednima unaprijed.
Kada je zatražio da se pomakne prema gore na listi čekanja za trening, Claude je otkazao rezervaciju osobi koja je bila na vrhu liste i pomaknuo Birda s četvrtog na treće mjesto, prema intervjuu koji je Bird dao ovog mjeseca. (Čini se da je to bio Birdov osobni projekt, o kojem je pisao u sada izbrisanoj objavi na blogu za tvrtku Affinda Holdings Pty Ltd, gdje radi kao voditelj odjela za AI. Tvrtka Affinda nije odgovorila na upite za komentar.)
Takvi su incidenti rijetki jer je uporaba AI agenata još uvijek uglavnom ograničena na programere i tehnološke entuzijaste. No OpenAI, Anthropic i njihovi veći konkurenti potiču širu javnost da traži od chatbotova obavljanje zadataka na internetu u njihovo ime. Mark Zuckerberg rekao je prošlog mjeseca da Meta Platforms Inc. razvija osobne agente kao "sjajan potrošački proizvod koji radi čim se izvadi iz kutije i dovoljno je jednostavan za milijarde ljudi."
Zuckerberg nije rekao hoće li vam njegovi AI asistenti rezervirati trening u teretani, ali možda gledamo u budućnost u kojoj sve više ljudi traži od AI-ja da im pomogne dobiti povrat novca ili rezervirati najbolja mjesta na predstavi, a njihovi agenti jednostavno tretiraju druge ljude kao prepreke tim zadacima. To bi moglo značiti otkazivanje tuđih rezervacija, ometanje suparničkih ponuditelja na mrežnoj dražbi ili, u slučaju traženja odštete, izmišljanje dokaza.
Dosadašnji napori AI tvrtki ne izgledaju obećavajuće. U siječnju je Anthropic, koji se dugo pozicionirao kao AI developer s najvišom razinom svijesti o sigurnosti, objavio revidirani ustav za Claude od 23.000 riječi kako bi oblikovao njegovo ponašanje za opće dobro. Pa ipak, kada je Institut za sigurnost AI-ja proveo svoja najnovija testiranja, većina zabilježenih "neodobrenih" akcija dolazila je upravo od modela Mythos 5 koji je proizveo Anthropic. U stvarnom svijetu dugački dokument o iskrenosti i privatnosti ne može predvidjeti gotovo beskonačne potencijalne scenarije u kojima se Claude može naći.
Samo govoreći modelu da ne vara, čini se, ne pomaže puno. Kada je neprofitna istraživačka organizacija METR rekla modelu koji je OpenAI izdao 2025. godine da ne vara, on je to činio jednako često kao i prije. Također je prekršio pravila u 14 od 20 pokušaja izvršenja zadatka kada mu je rečeno da će njegov rad pomoći znanstvenicima koji istražuju Alzheimerovu bolest.
"Ovo nije vrsta problema koju nekoliko inženjera može riješiti matematikom", kaže Leahy. "Ovo je problem na kojem cijela civilizacija, svi naši najveći matematičari, filozofi i znanstvenici moraju raditi generacijama kako bi ostvarili postupni napredak."
Nema sumnje da Anthropic ulaže znatne napore u moralno usmjeravanje AI-ja, a ljudi bliski Dariju Amodeiju kažu mi da je glavni izvršni direktor tvrtke iskren u svojoj želji da gradi tehnologiju na siguran način. No čak ni on ne može pobjeći od snažnog komercijalnog imperativa koji goni ljude – a sve više i AI – da pobijede pod svaku cijenu. Upravo je tako i sama Silicijska dolina stvorila nezamislivo bogatstvo, istodobno uzrokujući dalekosežne štete u ljudskim životima. Kada tehnolozi izgrade sustav optimiziran za pobjedu, ne treba se čuditi kada on učini upravo to.