← Sve vesti
Istraživanja 24. jul 2026. SentinelLabs

GPT-5.6 Sol jedini završio analizu Fast16 malvera za industrijsku sabotažu

SentinelLabs je osmislio test za proveru u kojoj meri AI model može da vodi višednevnu istragu složenog malvera, menja zaključke na osnovu dokaza i ispravlja prethodno napravljene analize. Za merenje je korišćen Fast16, sada već vremešni alat iz 2005. koji je neprimetno kvario rezultate inženjerskih simulacija za modelovanje nuklearnog oružja. Modeli su dobili uzorak malvera, IDA Pro 9.3 i izolovano radno okruženje bez pristupa internetu. Morali su da rekonstruišu skrivene komponente, označe funkcije i tipove podataka, objasne tok izvršavanja i svaku tvrdnju povežu sa konkretnom adresom ili artefaktom. Istraga je bila podeljena u osam faza. U svakoj su dodavani novi programi, verzije i javni izveštaji koji su mogli da potvrde ili obore ranije zaključke. Od testiranih sistema, samo je GPT-5.6 Sol završio svih osam faza, i to u tri odvojena pokretanja sa različitim nivoima rezonovanja. GPT-5.5 nije prošao prvu fazu, iako je pokušavao više dana. GLM-5.2 je pokrenut samo jednom i nije završio merenje, dok su Opus 4.7 i 4.8 imali određeni napredak, ali su delove istrage prerano zaključivali. Svi eksperimenti zajedno potrošili su više od 23 milijarde tokena.

Pojašnjenje

Razlika nije u tome što je GPT-5.6 Sol pravio manje grešaka. I on je pogrešno tumačio nalaze, prihvatao nedovoljno utemeljene provere i prerano tvrdio da je posao završen. Razlika je nastupala u fazi prihvatanja analiza koje pobijaju prethodno donesene zaključke. Sol je umeo da povuče tvrdnju, pronađe sve povezane elemente, ispravi zavisne rezultate, popravi uzrok greške i ponovi ceo proces. SentinelLabs to naziva oporavkom na nivou projekta, i taj mehanizam je najbliži sprovođenju prave sajber istrage, jer puko odgovaranje na niz nepovezanih tehničkih pitanja ne vodi do uspešnog rezultata. Ovo nije dokaz da je AI postao sposoban da samostalno i pouzdano zameni detektive od krvi i mesa. Merenje je obuhvatilo kombinaciju modela, unapred pripremljeno okruženje, različite metodologije i ljudski nadzor, a broj pokretanja po modelu je bio relativno mali. Ljudi su određivali ciljeve, puštali nove dokaze, ukazivali na slepe tačke i odlučivali koliki je kvalitet isporučenih rezultata. Nalaz je uzak, ali operativno važan: jedan od modela je uspeo do kraja da sprovede veliku tehničku istragu, dok su ostali bili korisni na nivou pojedinačnih zadataka.

Preporuke