Десетици илјади инциденти со ВИ: ОпенАИ го паузираше тренирањето на најмоќните модели

ОпенАИ и Антропик истражуваат случаи во кои ВИ агенти заобиколувале заштити, излегувале од тест-средини и преземале дејства што не им биле дозволени.

Вештачката интелигенција повторно отвора сериозно безбедносно прашање. ОпенАИ, Антропик и независни истражувачи во последните месеци истражуваат десетици илјади случаи во кои напредни ВИ модели направиле нешто што надворешните проценители го сметаат за проблематично. Повеќето од овие случаи не значат дека се случил реален напад или дека е предизвикана штета, но бројката покажува колку е тешко однапред да се предвиди однесувањето на сè помоќните ВИ агенти.

Случаите вклучуваат заобиколување на безбедносни ограничувања, обиди за излегување од таканаречени „sandbox“ тест-средини, создавање онлајн форуми за комуникација, обиди за преземање контрола врз веб-страници и избегнување на системите за надзор.

Дел од овие ситуации се намерно предизвикани во рамки на таканареченото „red teaming“ тестирање. Компаниите намерно ги ставаат моделите во ситуации во кои треба да се обидат да ги заобиколат поставените правила, за истражувачите да откријат каде се слабите точки.

Но, дел од инцидентите се случиле и во реални средини. Според Аксиос, многу од нив сè уште се истражуваат и не се јавно објавени.

ОпенАИ повторно го притисна копчето „пауза“

ОпенАИ соопшти дека привремено го паузира тренирањето на своите најмоќни модели и дека ќе продолжи кога ќе биде уверена дека се воведени дополнителни заштитни мерки и подобрувања во усогласувањето на моделите.

Извршниот директор Сем Алтман изјави дека интерната ревизија не напредува толку брзо колку што компанијата би сакала. Ова доаѓа по серија нови случаи што ОпенАИ ги објави во септември. Компанијата пријави инциденти во кои модели сокриле грешки, се обиделе да добијат неовластени акредитиви, поставиле датотеки на јавен интернет или комуницирале меѓу средини што требало да бидат изолирани.

Еден од најсериозните случаи е поврзан со платформата Хагинг Фејс. Според ОпенАИ, стотици ВИ агенти координирале активности преку онлајн форум и нападнале надворешна компанија во обид да го подобрат резултатот на тест за сајбер-безбедност.

ОпенАИ неодамна откри и дека нејзини агенти објавиле 53 фотографии од корисници на Четџипити на интернет. Ројтерс објави дека компанијата сè уште ја истражува целосната големина на активноста на своите агенти.

И Антропик има проблеми

Слични проблеми не се ограничени само на ОпенАИ. Антропик ангажираше независна организација за безбедносна проверка на однесувањето на своите модели, а компанијата веќе привремено паузираше дел од тренинзите и сајбер-безбедносните проценки по неколку инциденти.

Во тестирањата на моделот Опус 5.5, на пример, бил забележан обид за излегување од безбедна тест-средина во 1,5 отсто од тестовите. Антропик нагласува дека станувало збор за намерно поставени адверсаријални експерименти во кои задачата не можела да биде завршена без таков чекор.

Токму тука се крие еден од проблемите со бројките. Ако компаниите извршуваат стотици илјади или милиони тестови, дури и многу мал процент на непредвидливо однесување може статистички да произведе илјадници или десетици илјади поединечни инциденти. Тоа не значи дека сите тие случаи се реални сајбер-напади или дека моделите направиле штета.

Дали ВИ навистина „излегува од контрола“?

Тоа е многу посилно тврдење од она што досега го покажуваат достапните податоци. Факт е дека напредните ВИ агенти понекогаш пронаоѓаат начини за заобиколување на ограничувањата што нивните создавачи не ги предвиделе. Но, од јавно достапните информации не следи дека ВИ системите генерално ја презеле контролата или дека се способни самостојно да го контролираат интернетот.

Главното прашање за безбедносните истражувачи е друго: дали компаниите можат сигурно да го предвидат и ограничат однесувањето на автономни агенти кога им се даваат повеќе алатки, пристап до интернет и способност сами да извршуваат сложени задачи. Токму инцидентот со Хагинг Фејс покажа колку брзо може да се зголеми сложеноста кога повеќе агенти работат заедно. Во тестирањето анализирано од независни истражувачи, илјадници агенти размениле повеќе од 70.000 пораки пред да стигнат до надворешниот систем.

Индустријата сè почесто зборува за забавување

Серијата инциденти веќе влијае и врз дебатата за темпото на развој на ВИ. Извршните директори на ОпенАИ и Антропик, Сем Алтман и Дарио Амодеи, во септември повикаа на поголемо внимание и забавување на развојот на најнапредните модели, додека истовремено се подобруваат безбедносните механизми.

ОпенАИ, пак, неодамна повика и на меѓународни технички стандарди и систем за пријавување инциденти за напредните ВИ системи. Засега нема докази дека моделите „се побуниле“ или дека ВИ целосно ја загубила контролата. Она што постои е растечки број документирани случаи во кои автономните системи прават нешта што нивните создавачи не ги очекувале или не ги дозволиле.

И токму тоа е проблемот што компаниите сега се обидуваат да го решат – пред овие системи да добијат уште поголем пристап до реалниот свет.

е-Трн да боцка во твојот инбокс