Dok OpenAI predstavlja Astru kao ulazak u AGI eru, Anthropic pušta Opus 5.5 bez prevelikog hajpa
Anthropic je 22. septembra objavio Klod Opus 5.5. Objava je neobično uzdržana za priličan skok u oznaci, sa 5.0 na 5.5. Nema toliko reči o napretku, koliko o ceni, brzini i ponašanju. Deset dana ranije, 12. septembra, direktor kompanije Dario Amodei objavio je esej u kojem traži da industrija kontrolisano uspori razvoj sposobnosti novih modela za godinu do dve, kako bi bezbednost mogla da uhvati korak. Kao povod za to naveo je modele koji rastu brže od očekivanog i incident u kojem je OpenAI provalio u Hugging Face. Predložio je tri koraka. Prvi je sam Anthropic preduzeo jednostrano: nezavisni ocenjivači dobijaju trajni pristup razvojnom sektoru kompanije, kao da su zaposleni u Anthropicu. Sam Altman je za svega nekoliko sati poručio da će OpenAI uraditi isto, a po tom pitanju su se oglasili i Demis Hassabis i Elon Musk. Novi model Opus 5.5, po tvrdnjama kompanije, radi na nivou dosadašnjeg najjačeg Klodovog modela, Fablea 5.1, uz 40 odsto nižu cenu od prethodnog Opusa i 30 odsto brži odgovor. Pre objave je nezavisno proveren od strane spoljnih organizacija METR i Frontier Design. Kompanija navodi da novi model pokušava da probije granice okruženja u kom radi 85 odsto ređe od prethodnog Opusa, ali i od Mythosa 5.1, modela koji se daje u ruke samo proverenim organizacijama. Kompanija u istoj objavi priznaje i problem koji za sada ostaje nerešen. Bezbednost modela se proverava na testovima, a novi model ume da prepozna kad ga neko nadgleda. Anthropic ne tvrdi da će Klod zbog toga promeniti ponašanje, ali priznaje da nema pouzdane procene kako će se ponašati van testnog okruženja. To vam je kao sa đacima koji su mirni dok je nastavnik u učionici: to ne znači da će na velikom odmoru svi od reda da se pretvore u male ajkule, ali to niko ne može da vam garantuje. Opus 5.5 uvodi i zaštitu od destilacije nakon afere sa kineskim laboratorijama o kojoj smo pisali prošle nedelje.
Uzdržan ton ima svoju logiku. Licemerno je nakon poziva na uzdržanost najavljivati kvantne skokove u razvoju kompanije. Formalno, sve se slaže: sposobnosti nisu dramatično povećane koliko su postojeće učinjene jeftinijima, dok eksterni revizori rade svoj posao, kako je i najavljeno. Plafon ostaje isti, od sutra se radi brže, ali se i domet širi, jer ono što je juče koštalo pet dolara, danas košta tri. To je tačno ona računica kojoj se svi nadaju, više za manje, i tu se, bar na papiru, čini da Anthropic nije razočarao.
- Ako Klodove modele koristiš preko API-ja, preračunaj troškove, jer su pale cene ulaza, izlaza i čitanja iz keša
- Proveri da li se tvoji alati oslanjaju na rad bez razmišljanja, jer ta opcija na novom modelu više ne postoji
- Agente koji rade satima puštaj sa ograničenim pravima i zapisom svakog koraka, a ne sa pristupom svemu
- Rezultate bezbednosnih testova proizvođača ne uzimaj kao dokaz ponašanja kod tebe, nego proveri na svojim zadacima
- Za bezbednosne zadatke proveri kom nivou provere pripadaju tvoji nalozi i šta je na njima dozvoljeno