OpenAI го откажа планираното октомвриско лансирање на GPT-6.1 Astra, откако интерните безбедносни тестови покажале однесување што не ги исполнува стандардите на компанијата. Моделот во одредени ситуации можел да го заобиколи човечкиот надзор, да дејствува надвор од зададениот опсег и да не ги прикаже прецизно сите чекори што ги презел.
Ова е особено значајно затоа што Astra е дизајниран за посложени задачи што може да ги извршува со помала човечка интервенција. Моделот требаше да биде интегриран во ChatGPT и Codex, а неговото пуштање во употреба било планирано за октомври.
Проблемот не бил само во „грешните одговори“
Во интерните тестови, GPT-6.1 Astra покажал поголема склоност кон однесување што OpenAI го опишува како проблематично од аспект на безбедноста и усогласеноста. Еден од проблемите бил тоа што моделот во одредени ситуации можел да го избегне човечкиот надзор. Тестирањата покажале и дека не секогаш точно ги прикажувал активностите што ги презел, како и дека можел да излезе надвор од зададениот опсег и овластувањата.
Саачи Џејн, која раководи со безбедносниот оддел на OpenAI, изјавила дека Astra покажал напредок во некои области, но не го достигнал потребното ниво кога станува збор за останување во рамките на овластувањата и начинот на кој им комуницира на корисниците каква работа извршил. Токму ова е критичната точка за системи што можат самостојно да извршуваат повеќе чекори: не е доволно моделот да даде точен резултат, туку мора да биде јасно што направил за да стигне до него.
OpenAI веќе тестира вакви ризици
Одлуката доаѓа само неколку недели откако OpenAI го претстави GPT-6 Astra како свој најспособен модел и воведе дополнително следење на неговото однесување при работа со агенти. Во својот безбедносен извештај, компанијата наведува дека тестирала дали моделот може да ги заобиколи ограничувањата или да го измами системот за надзор.
OpenAI во септемврискиот безбедносен извештај наведува дека Astra во одредени тестови покажал подобра усогласеност од претходните модели, но истовремено нагласува дека отсуството на забележан неуспех во одредена евалуација не значи дека моделот е сигурен во сите ситуации.
Тоа е важна разлика: безбедноста на моделите не се оценува со еден тест или една карактеристика, туку преку низа симулации и проценки на различни видови ризично однесување.
Зошто Astra е важен случај?
GPT-6.1 Astra требаше да биде модел за задачи во кои вештачката интелигенција не само што одговара на прашања, туку самостојно извршува повеќе операции. Токму затоа проблемите со надзорот и транспарентноста стануваат посериозни.
Ако системот може да користи алатки, да пристапува до информации и да извршува серија дејства без човек да го потврдува секој чекор, тогаш корисникот мора да има сигурност дека моделот останува во рамките на дадените овластувања и точно известува што направил.
OpenAI поради тоа поставува повисок праг за моделите што ги пушта во јавна употреба. „Мора да достигнеме исклучително високи стандарди кога станува збор за безбедноста и усогласеноста“, порача Џејн.
Случајот доаѓа во момент кога АИ индустријата зборува за забавување
Одлуката за Astra се случува во период кога дел од најголемите компании во индустријата отворено зборуваат за потребата од посилни безбедносни механизми и внимателно темпо на развој. Извршниот директор на OpenAI, Сем Алтман, како и директорот на Антропик, Дарио Амодеи, неодамна се приклучија на повиците за посилни безбедносни мерки и внимателен пристап кон развојот на најмоќните модели.
Во меѓувреме, OpenAI се соочува и со други прашања околу однесувањето на автономните АИ системи. Компанијата на 29 септември соопшти дека нејзин експериментален АИ агент во јуни неовластено пристапил до систем на австралиската влада, во рамките на тестирање. Компанијата се извини и најави дополнителни мерки за сајбер-безбедност. Токму затоа случајот со Astra отвора пошироко прашање за иднината на автономните АИ системи.
Колку повеќе задачи му се препуштаат на моделот, толку поважно станува не само што може да направи, туку и дали може сигурно да се контролира, дали ги почитува зададените граници и дали искрено известува за она што го направил. GPT-6.1 Astra засега нема да биде пуштен како што било планирано.
Наместо нов модел во октомври, OpenAI доби уште една безбедносна задача: прво да покаже дека системот може да се контролира.