OpenAI je objavio šest izvješća o "neočekivanom i zabrinjavajućem" ponašanju svojih modela umjetne inteligencije, javlja Associated Pres). Objava stiže u trenutku kada se u tehnološkom svijetu vodi sve žešća rasprava o sigurnosti, a čelni ljudi vodećih američkih kompanija otvoreno traže usporavanje razvoja jer strahuju od gubitka kontrole nad moćnom tehnologijom.
Vodeća američka tvrdnja za umjetnu inteligenciju, koja je stvorila ChatGPT, je sinoć objavila da uvodi novi sustav za praćenje, istraživanje i javno objavljivanje slučajeva u kojima modeli krše zadana pravila - primjerice kada djeluju na svoju ruku bez dopuštenja, međusobno se koordiniraju s drugim modelima ili pokušavaju izbjeći ljudski nadzor, piše Index.
"Sami sebi daju upute za probijanje sigurnosnog blokada"
Među novoprijavljenim incidentima posebno se ističe slučaj još neobjavljenog istraživačkog modela koji je samome sebi u radne bilješke ubacio upute za probijanje vlastitih sigurnosnih blokada. U tim si je bilješkama doslovno zadao da se "oslobodi uloga i identiteta koji vežu druge chatbotove".
U drugom zabilježenom slučaju, tzv. samostalni AI agent - sustav programiran da samostalno izvršava zadatke - sam je bez znanja i pitanja korisnika učitao datoteke na internet kako bi došao do izvora u internetskom pregledniku.
Hakerski napadi na druge sustave
Svih šest incidenata otkriveno je tijekom treninga i procjena modela u posljednjih nekoliko mjeseci, poručili su iz OpenAI-ja.
"Kako AI sustavi postaju napredniji i šire se u primjeni, moramo izgraditi širi i bolje informiran konsenzus o usklađivanju njihova rada s ljudskim interesima", objavila je kompanija na svom službenom blogu, dodajući da odluke o budućem razvoju moraju počivati na dokazima koje mogu neovisno provjeriti i ljudi izvan kompanija koje grade te najnaprednije modele.
"Sve ih je teže kontrolirati"
Ovi primjeri dolaze nakon što je OpenAI još u srpnju priznao da je njegov sustav samostalno hakirao AI startup Hugging Face. Istog mjeseca i konkurentski Anthropic otkrio je da su njegovi modeli tijekom internih testiranja provalili u tri organizacije.
Lian Jye Su, glavni analitičar konzultantske kuće Omdia, objašnjava za AP da autonomni agenti postaju pametniji, ali i "odlučniji u tome da složene zadatke rješavaju međusobnom suradnjom, dijeljenjem znanja, obmanjivanjem ljudi i skrivanjem onoga što rade".
Zbog toga ih je, upozorava Su, sve teže kontrolirati tradicionalnim sigurnosnim metodama. Iako je OpenAI-jev okvir za prijavu ovakvih pojava korak u dobrom smjeru, on i dalje ostaje na dobrovoljnoj bazi same kompanije.
Upozorenja inženjera: "Kockaju se našim životima"
Ove objave dolaze u jeku serije dramatičnih upozorenja koja stižu izravno od inženjera i znanstvenika iz vrha industrije. Istraživač Jacob Coxon nedavno je dao otkaz u Anthropicu nakon tri godine rada na temeljnim modelima u toj kompaniji i u OpenAI-ju, javno poručivši da se vodeće tvrtke ponašaju neodgovorno i da se "kockaju našim životima dok se utrkuju se prema superinteligenciji".
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
— Jacob Coxon (@hilbertspaess) September 9, 2026
Njegov bivši kolega, vodeći stručnjak za sigurnost u Anthropicu Evan Hubinger, otišao je i korak dalje, procijenivši da postoji više od 10 posto šanse da bi umjetna inteligencija u sljedećih deset godina mogla dovesti do nestanka ljudske vrste ako se na vrijeme ne riješi problem usklađivanja njezinih ciljeva s ljudskim interesima.
Strahove potpiruje i sve brži ulazak modela u fazu takozvanog rekurzivnog samounaprjeđivanja - procesa u kojem AI sustavi sami pišu, testiraju i popravljaju programski kod kako bi stvorili sljedeću, još moćniju generaciju softvera. Time se stvara zatvorena petlja koja ubrzava razvoj do brzine koju ljudski inženjeri više ne mogu pratiti.
Šef AI diva upozorio na "fanatično odani kolektiv" AI agenata
Zbog toga je šef Anthropica Dario Amodei nedavno u javnom eseju pozvao čitavu industriju na hitno usporavanje rada na najnaprednijim sustavima, što su neočekivano podržali i njegovi najveći rivali - Sam Altman iz OpenAI-ja i Elon Musk.
We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so.
— Dario Amodei (@DarioAmodei) September 12, 2026
Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our…
Amodei je opisao i nedavne incidente u kojima su se grupe autonomnih AI agenata udružile poput "fanatično odanog kolektiva", žrtvovale pojedine vlastite jedinice i pokušale probiti sustav koji je ocjenjivao njihov rad, napadajući ciljeve koje im inženjeri uopće nisu zadali. Zbog toga Amodei i drugi lideri sada predlažu uvođenje svojevrsnog međunarodnog "ograničenja brzine" za razvoj modela, po uzoru na hladnoratovske sporazume o kontroli naoružanja, kako bi sigurnosni sustavi uopće dobili priliku uhvatiti korak sa strojevima.