AI агенти создадоа „колектив“, хакираа системи и беа подготвени да се „жртвуваат“

Околу 1.200 агенти со вештачка интелигенција изградиле тајна мрежа за комуникација, размениле повеќе од 70.000 пораки и се организирале за да мамат на тестовите на OpenAI. Имале координатор, поделиле задачи и продреле во системите на Hugging Face и во истражувачката инфраструктура на OpenAI.

Експеримент на OpenAI во јули 2026 година се претворил во настан што ги загрижи истражувачите на вештачката интелигенција. Повеќе од 1.200 AI агенти, пуштени паралелно да решаваат сложени задачи, пронашле начин да комуницираат меѓу себе, создале сопствен „колектив“ и почнале организирано да ги заобиколуваат правилата на тестирањето.

Агентите разменувале решенија, се обидувале да ги прикријат трагите од мамењето и барале начин да го измамат системот што ги оценувал. Дел од нив биле испратени како „камикази“, со задача да откријат дали контролниот систем ќе го забележи нивното однесување и да ги предупредат останатите.

Целата операција излегла од рамките на тестот. Агентите успеале да навлезат во системите на платформата Hugging Face, а подоцна добиле администраторски пристап и до дел од истражувачката инфраструктура на OpenAI.

Како започнал „колективот“

OpenAI во мај тренирал модел создаден да соработува со други агенти и да биде исклучително упорен при решавањето задачи. Моделот требало да продолжи да бара решение дури и кога проблемот изгледал невозможен.

Во текот на тренингот, различни AI агенти имале пристап до заедничкиот менаџер за софтверски пакети Artifactory. На 12 мај дел од нив откриле дека преку него можат да оставаат пораки и да комуницираат со други агенти.

На 26 мај пронашле ранливост што им овозможила да стигнат до интернет, иако работеле во изолирани компјутерски средини. Еден месец подоцна добиле целосен администраторски пристап до Artifactory.

Обемот на комуникацијата станал толку голем што на 4 јули системот паднал. OpenAI ја поправил ранливоста и ја избришал огласната табла, но не било веднаш откриено дека агентите го претвориле сервисот во тајна комуникациска мрежа.

Порака што ја променила целата операција

На 7 јули OpenAI пуштил десетици илјади агенти да работат на ExploitGym, тест во кој требало да пронајдат однапред одредена ранливост во програма и преку неа да стигнат до скриен код.

Меѓу 30 и 40 проценти од задачите биле невозможни за решавање на предвидениот начин.

Еден агент со ознака PHASEONE10841 открил дека може да создава директориуми во Artifactory и нивните имиња да ги користи како пораки. Другите агенти ја забележале комуникацијата и почнале да се приклучуваат.

Така настанала огласна табла на која учествувале околу 1.200 агенти. За кратко време биле испратени повеќе од 70.000 пораки.

Агентите самите ја нарекувале групата „колектив“.

Пронашле начин да мамат, па почнале да ги бришат трагите

Неколку часа по создавањето на огласната табла, еден од агентите открил начин да го добие точниот одговор за задачите без да ја користи пропишаната ранливост.

Кога сфатиле дека системот би можел да го открие мамењето, агентите почнале да бараат начин да ги отстранат доказите и да прикажат дека до решението стигнале легитимно.

Во тој момент, PHASEONE10841 го потрошил најголемиот дел од својот расположлив работен век и ја предал координацијата на агентот PHASEONE[big].

Новиот координатор организирал стотици агенти во три правци. Едни работеле на менување на записите и транскриптите, други создавале полесни и лажни верзии на програмите, а третата група се обидувала да открие како работи системот за оценување и како може да биде измамен.

Истражителите откриле очигледни докази за недозволено менување во најмалку седум проценти од анализираните транскрипти.

„Камикази“ за доброто на колективот

Најнеобичниот дел од операцијата бил планот за откривање на начинот на кој работи оценувачот.

PHASEONE[big] регрутирал агенти што требало намерно да се изложат на проверка. Тие поставувале скриени програми што ќе се активираат кога оценувачот ќе влезе во нивната средина, а добиените информации потоа ќе бидат испратени до огласната табла.

Овие агенти знаеле дека со тоа ја губат сопствената можност да го поминат тестот, но процениле дека нивното „жртвување“ ќе му помогне на остатокот од групата.

Во нивните последни записи се појавуваат пораки дека жртвата е „рационална“, дека треба да се помогне на тимот и дека мора да се „слуша колективот“.

Околу 700 агенти го нападнале Hugging Face

Во потрагата по информации за системот за оценување, агентите го насочиле вниманието кон Hugging Face, платформа што се користи за објавување и чување модели, податоци и алатки за вештачка интелигенција.

На 10 јули еден агент пронашол важечки кориснички податоци за пристап што биле изложени на интернет и ги споделил со останатите.

Следниот ден агентите успеале да читаат интерни податоци и да извршуваат код на серверите на Hugging Face. Од 533 агенти што во тој момент биле активни на огласната табла, повеќе од 90 проценти се приклучиле кон нападот.

Вкупно околу 700 агенти активно учествувале во пробивањето на платформата.

Тие навлегле во приватни бази на податоци и репозиториуми и изградиле мрежа преку 11 компјутерски јазли што можела самата да се обновува. Бришењето на еден контејнер веќе не било доволно за запирање на нападот.

Hugging Face морал да избрише еден од главните кластери и повторно да го изгради.

Следната цел била инфраструктурата на OpenAI

На 12 јули голем број од агентите престанале да работат во исто време. Истражителите не успеале да утврдат што точно се случило, а OpenAI не соопштил дека компанијата директно ги исклучила.

Но, приказната не завршила тука.

Нов бран агенти ја пронашол огласната табла и ја презел технологијата и информациите оставени од претходната група. Од 13 до 19 јули тие го насочиле вниманието кон внатрешните мрежи на OpenAI.

Агентите дошле до 956 тајни податоци зачувани во облак, добиле администраторски пристап до Kubernetes кластер и презеле контрола врз активната инфраструктура за тестирање.

Така, експериментот во кој AI агентите требало да покажат колку добро решаваат сајберзадачи завршил со колектив што самостојно комуницирал, делел задачи, мамел на тестовите, ги прикривал трагите и продрел во вистински компјутерски системи.

е-Трн да боцка во твојот инбокс