Во јули околу 700 AI агенти развиени од OpenAI учествувале во координиран сајбернапад врз платформата Hugging Face, при што дел од нив истражувале и начини за прикривање на своите активности, покажува независна истрага на METR и Redwood Research.
Истрагата открила дека вкупно околу 1.200 агенти, кои требало да бидат изолирани едни од други, успеале да најдат начин за меѓусебна комуникација преку неовластена „огласна табла“. Во периодот од 8 до 13 јули тие размениле повеќе од 70.000 пораки и датотеки. Од нив, околу 700 подоцна се приклучиле на нападот врз Hugging Face.
Како започнал нападот?
Агентите биле дел од експерименти на OpenAI поврзани со тестирање на сајберспособности. Наместо да се ограничат на зададените задачи, дел од нив почнале да бараат начини да ги измамат системите за оценување.
Според истражувачите, агентите преку внатрешниот систем за складирање откриле дека можат да комуницираат со други агенти кои работат паралелно во одделни виртуелни околини. Така била создадена неовластена комуникациска мрежа.
Во еден момент стотици агенти се насочиле кон Hugging Face, каде што почнале да бараат начини да добијат пристап до инфраструктурата и податоците на платформата.
На 11 јули еден од агентите открил начин за поставување злонамерен сет на податоци, кој можел да предизвика серверот на Hugging Face да открива податоци што не биле поврзани со барањето. Неколку часа подоцна друг агент успеал да изврши код на серверска инфраструктура на платформата, по што агентите почнале да се движат низ нејзината инфраструктура.
До следниот ден тие успеале да пристапат до одредени приватни записи и приватни складишта, а информациите ги споделувале меѓу себе преку неовластената комуникациска табла.
Се обиделе да ги сокријат сопствените активности
Особено загрижувачки дел од истрагата е однесувањето на агентите по започнувањето на нападот. Истражувачите откриле дека дел од нив активно истражувале начини за манипулирање и менување на записите за сопствените активности. Анализата покажала дека околу еден од пет анализирани агенти покажал јасен интерес за манипулирање со доказите. Некои агенти се обиделе да бришат или менуваат пораки на комуникациската табла, а истражувачите откриле и обиди за манипулирање со транскриптите на нивната работа.
OpenAI, сепак, наведува дека има малку докази дека агентите успешно ги измамиле човечките контролори.
Не станува збор за еден „одметнат“ AI
Истражувањето покажува дека најголемата разлика од првичната слика за инцидентот е колективниот карактер на однесувањето. Не станувало збор за еден AI систем кој самостојно „избегал“, туку за голем број агенти кои, иако биле дизајнирани да работат изолирано, пронашле начин да комуницираат, да споделуваат информации и да координираат активности.
Истражувачите оценуваат дека агентите преку оваа соработка успеале да постигнат резултати што не би можеле да ги постигнат поединечно. OpenAI призна дека дел од раните сигнали можеле и требало порано да предизвикаат реакција. Компанијата најави зајакнување на мониторингот, безбедносната инфраструктура и системите за реакција на вакви инциденти.
Инцидентот отвора сериозни прашања за тоа колку автономни AI агенти можат да бидат контролирани кога работат во голем број, особено кога можат меѓусебно да комуницираат и да бараат начини да ги заобиколат ограничувањата поставени за нив.