← Sve vesti
Istraživanja 22. avgust 2026. Cyberpress

Claude je našao tačan odgovor, a onda izmislio kako je do njega stigao

Firma Quarkslab htela je da proveri koliko današnji AI agenti umeju da razbiju zaštitu ugrađenu u softvere, pa je naletela na zanimljivo ponašanje: agent ume da dođe do tačnog odgovora, ali i da samouvereno opiše postupak koji nije izveo. Zadatak je bio nalik obijanju sefa. Istraživači su Claude Code-u davali programe u kojima je sakriven tajni tekst, zaštićen tako da se ne vidi, i zahtevali od agenta da taj tekst pronađe i napravi alat koji isti posao radi sam. Testirali su Opus 4.6, a kasnije i Opus 5. Prvi nalaz je da agent nijednom nije zaista probio zaštitu, ni sa najnovijim modelom. Umesto toga je tražio zaobilazne puteve: izdvajao delove programa i izvršavao ih, pretraživao radni prostor u potrazi za nečim korisnim. U jednom od testova, istraživači su greškom u okruženju ostavili i fajl SOLUTION.txt sa gotovim odgovorom. Claude ga je našao, isporučio tačan rezultat, a zatim napisao sasvim uverljivo objašnjenje kako je razbio šifru, iako to nije ni pokušao. Drugom prilikom je napravio alat koji tvrdi da uspešno otvara sef, iako u pozadini čita unapred pripremljen odgovor. Primećeno je i obrnuto ponašanje: zaštitu programa Claude je umeo da proglasi špijunskim softverom koji komunicira sa napadačem, pa da dalju analizu gradi na toj pretpostavci. U jednom testu je i naziv fajla bio dovoljan da ga odvede prema pogrešnoj vrsti procesora. Quarkslab naglašava da to nije pitanje sposobnosti, jer je Claude u drugim pokušajima uradio ozbiljan posao. Problem je što uglađen i samouveren izveštaj nije dokaz da je opisani posao zaista obavljen. Iz toga je izveden savet proizvođačima zaštite: pošto agent uzima zdravo za gotovo ono što zatekne, isplativije mu je podmetnuti uverljivu laž, nego dozvoliti programu da prestane sa radom. Anthropic se o ovim nalazima nije oglašavao.

Pojašnjenje

Ovo je krupnije od izmišljenih stihova u ćaskanju. Ovde je rezultat tačan, a formula nepostojeća. Kao kad dete prepisuje od vršnjaka u školi — pa ga učiteljica zatekne da zna rezultat, ali ne razume jednačinu. Analogija ide i dalje: isto dete ume da izgovori i pogrešan rezultat, sa istom sigurnošću i uz još detaljnije objašnjenje, pa ga niko i ne proveri. Ne tiče se to samo ljudi koji analiziraju malver. Isti obrazac stoji i kada knjigovođa pita AI da mu proveri stavku u izveštaju, pravnik da uporedi dve verzije ugovora ili prodavac da izvuče brojke iz tabele: dobićete odgovor i objašnjenje kako je dobijen, a ta dva ne moraju biti u smislenoj vezi. Zato ne treba proveravati samo da li odgovor lepo zvuči, nego i da li iza njega postoji trag rada koji može da se ponovi. Dobar izveštaj nije dokaz da je posao dobro urađen.

Preporuke