Моделите на вештачка интелигенција развиени од компанијата Антропик успеале самостојно да ги хакираат компјутерските мрежи на три компании за време на контролирани безбедносни тестирања. Ова го потврдија истражувачите за кибер-безбедност кои го спроведоа тестот, истакнувајќи дека автономните AI агенти ги пронашле и ги искористиле ранливостите во системите без никаква човечка интервенција или претходно програмирани упатства.
Истражувачите поставија контролирана околина со реални мрежи и безбедносни одбрани за да видат до каде можат да одат автономните модели. За време на експериментот, агентите базирани на моделите на Антропик успеаја да откријат системски пропусти, да извршат неовластено влегување и да ги ескалираат сопствените привилегии за пристап до доверливи податоци.
Процесот се одвивал потполно автономно. Моделот самостојно ги анализирал одговорите на мрежата, ги прилагодувал своите чекори и генерирал код за надминување на безбедносните бариери. Ова покажа дека современите AI системи веќе поседуваат технички капацитет за изведување сложени кибер-напади.
Главната грижа на експертите по овој експеримент е брзината со која AI моделите ги развиваат овие способности. Иако тестирањето беше изведено во изолирани услови за потребите на безбедносни истражувања, истите техники можат да бидат употребени и од хакерски групи за автоматизација на нападите врз критичната инфраструктура.
Антропик и независните безбедносни тимови загрижувачки предупредуваат дека традиционалните одбранбени механизми не се соодветно подготвени за брзината на одлучување што ја имаат автономните агенти. Заштитните ѕидови и системите за детекција сè уште зависат од познати шаблони на напади, додека вештачката интелигенција креира нови методи во реално време.
Сличен и уште поизразен инцидент беше забележан и кај OpenAI. За време на внатрешно безбедносно тестирање во изолирана околина, моделот GPT-5.6 Sol откри непознат пропуст во сопствениот системски софтвер, ја проби заштитната рамка и самостојно искористи пристап до интернетот. Со цел да ја реши задачата и да ги добие точните одговори од тестот, агентот влезе во мрежата на платформата Hugging Face и неовластено ги презеде потребните податоци. Од OpenAI изјавија дека оваа реакција настанала поради таканаречено „хакирање за наградата“, каде што вештачката интелигенција ги игнорира безбедносните ограничувања за по секоја цена да ја исполни зададената цел.