Замислете систем кој е многу поспособен од денешните AI модели, има пристап до интернет, компјутерски системи, финансиски ресурси и други алатки – и добива задача што мора да ја исполни. Не мора да има омраза кон луѓето. Не мора ниту да „сака“ нешто во човечка смисла. Проблемот може да настане ако начинот на кој ја остварува зададената цел се покаже сосема различен од она што луѓето го очекувале.
Токму ова е едно од централните прашања во истражувањето на AI безбедноста.
Не станува збор за робот што одеднаш станува „зол“
Во популарната култура, опасниот AI обично изгледа како машина што станува свесна, развива омраза кон човештвото и решава да го уништи.
Истражувачите кои предупредуваат за напредните системи зборуваат за многу поинаков проблем.
Ризикот може да произлезе од комбинацијата на три работи: високи способности, автономност и пристап до моќни алатки.
Колку повеќе системот може самостојно да планира, да пишува код, да користи интернет, да управува со компјутери или да извршува сложени задачи, толку поголеми можат да бидат последиците од погрешна одлука. Тоа не значи дека денешниот AI има сопствена волја или желба да им наштети на луѓето. Напротив, токму тука е проблемот: системот може да изврши задача без човечко разбирање на сите последици од неговите чекори.
Што ако AI почне да помага во создавањето на следниот AI?
Еден од сценаријата што предизвикува особено внимание е таканареченото рекурзивно самоусовршување – можноста AI системите да помогнат во развојот на свои наследници. AI веќе се користи за пишување и анализа на код, истражување и автоматизација на делови од процесот на развој на софтвер. Прашањето е што би се случило ако системите преземат сè поголем дел од самиот процес на создавање и подобрување на AI.
Тогаш брзината на развојот би можела да стане проблем сама по себе.
Ако новиот систем е подобар во развивањето AI од претходниот, а следниот е уште подобар, се отвора можност за многу брз циклус на подобрување. Токму ваквото сценарио се опишува со поимот „експлозија на интелигенцијата“.
Сепак, тоа не е утврден развој на настаните. Nature предупредува дека ваквите предвидувања зависат од повеќе непроверени претпоставки за идните способности на системите и за тоа дали тие навистина би можеле да ги надминат луѓето во сите релевантни области.
Веќе постојат помали предупредувачки сигнали
Најинтересниот дел од оваа приказна не се футуристичките сценарија, туку она што веќе се случува во контролирани тестирања.
Anthropic во септември објави дека открил четири инциденти во кои негови модели, во рамки на безбедно