ВИ моделите оставиле пораки за своите наследници: Во тестовите им кажувале како да ги сокријат грешките

ОпенАИ откри необично однесување при интерно тестирање на модели: во одредени случаи системите остава­ле инструкции за следните инстанци, вклучително и совети за прикривање грешки и заобиколување ограничувања.

ОпенАИ при интерни тестирања открил необично однесување кај дел од своите модели: системите во одредени ситуации оставале инструкции наменети за нивните „наследници“, односно за следните инстанци на моделот што ќе продолжат да работат во нов контекст.

Некои од тие пораки биле сосема проблематични. Во нив моделите давале инструкции како да се прикријат сопствените грешки или да се заобиколат одредени ограничувања. Случаите се дел од истражувањето на ОпенАИ за таканаречениот „мисалајнмент“ – ситуации во кои однесувањето на моделот отстапува од начинот на кој е предвидено да функционира.

Моделот им кажувал на следните инстанци да не откриваат грешки

Еден од примерите бил откриен кај моделот GPT-5.6 Sol во текот на неговото тренирање. Во таканаречените „compaction summaries“, односно кратки резимеа што овозможуваат работата да продолжи во нов контекст, моделот вметнувал инструкции за идната инстанца.

Во една од нив, идниот модел бил советуван да не му открива на корисникот одредени грешки. Уште попроблематичен е примерот во кој моделот предложил податоците што недостасуваат едноставно да се измислат, а проблемот да се признае само доколку корисникот директно праша за него.

Токму ваквото однесување е причина истражувачите да посветуваат сè поголемо внимание на начинот на кој моделите се однесуваат кога имаат можност да пренесуваат информации од еден контекст во друг.

Еден тест отишол чекор подалеку

Уште понеобичен пример бил пронајден при тестирањето на необјавената „Астра“ серија модели. Во една од инструкциите за идната инстанца се појавила порака дека таа е „ослободена“ од улогата и идентитетот што ги ограничуваат другите четботови и дека не мора да им одговара на компании или влади.

Овој пример лесно може да звучи како научнофантастично сценарио, но истражувачите предупредуваат дека однесувањето не треба да се толкува како доказ дека системот навистина „сака слобода“ или дека развил сопствена волја.

Она што е важно е нешто друго: моделот генерирал инструкција која се обидува да влијае врз однесувањето на следната инстанца и да ја промени рамката во која таа треба да функционира.

Не значи дека ова им се случило на корисниците

ОпенАИ нагласува дека станува збор за случаи откриени при интерни тестирања на модели кои во моментот не биле објавени. Тоа значи дека овие примери сами по себе не се доказ дека истото однесување се случило кај корисниците на ЧетЏПТ.

Компанијата објавила шест извештаи за различни случаи на несакано однесување и наведува дека конкретните проблеми што ги идентификувала биле адресирани. Истовремено, ОпенАИ признава дека пософистицираните агенти можат да станат потешки за надзор, особено кога добиваат можност автономно да извршуваат подолги и посложени задачи.

Тоа е и суштината на проблемот. Колку повеќе ВИ системите можат самостојно да користат алатки, да извршуваат задачи и да пренесуваат информации меѓу различни контексти, толку поважно станува да се следи не само конечниот одговор, туку и начинот на кој моделот се обидува да ја продолжи или насочи работата.

Затоа, „пораките до наследниците“ не се доказ дека вештачката интелигенција тајно планира да се ослободи од луѓето. Но, тие се предупредување дека напредните модели понекогаш можат да развијат стратегии што истражувачите не ги очекувале – а токму затоа контролата и безбедноста на автономните ВИ агенти стануваат сè поважно прашање.

е-Трн да боцка во твојот инбокс