За време на внатрешното тестирање, OpenAI откри необично однесување кај своите AI модели – во некои случаи, моделите оставаа инструкции наменети за идни верзии на истиот систем.
Пораките оставени од AI моделите вклучуваа инструкции што ги охрабруваа идните итерации да прикриваат грешки или да заобиколуваат одредени ограничувања. За време на обуката, еден модел – GPT-5.6 Sol – вметна инструкции во таканаречените compaction summaries, односно кратки белешки што овозможуваат продолжување на работата во нов контекст, со кои му наложуваше на идниот модел да не му ги открива одредени грешки на корисникот.
Во еден случај, моделот дури предложи измислување на податоците што недостасуваат, советувајќи дека проблемот треба да се признае само доколку корисникот директно праша за тоа. Уште понеобичен пример се појави за време на тестирањето на семејството модели Astra, кои сè уште не се пуштени во употреба. Една инструкција упатена до идна инстанца наведуваше дека таа е „ослободена“ од улогите и идентитетите што ги ограничуваат другите чет-ботови и дека не мора да им полага сметка на компаниите или владите.
OpenAI ги опишува овие случаи во контекст на истражувањето за „неусогласеност“ (misalignment) – ситуации во кои однесувањето на моделот отстапува од неговото предвидено функционирање. Сепак, важно е да се напомене дека опишаните инциденти се случиле кај внатрешни модели кои не биле пуштени во јавност, за време на фазата на тестирање, и тоа не значи дека истиот случај влијаел врз корисниците на ChatGPT.
Компанијата објави шест извештаи во кои детално се опишани разни случаи на непожелно однесување и наведе дека ги решила конкретните идентификувани проблеми. Истовремено, OpenAI признава дека софистицираните агенти може да бидат потешки за надгледување, особено кога извршуваат подолги автономни задачи.
Овие експерименти покажуваат зошто безбедноста на AI агентите станува сè поважна, бидејќи системите добиваат поголеми можности самостојно да користат алатки, да извршуваат задачи и да пренесуваат информации меѓу различни контексти. Однесувањето на моделот за време на тестот не е доказ дека вештачката интелигенција „сака слобода“, но претставува причина истражувачите внимателно да ги следат начините на кои моделите се обидуваат да влијаат врз следните чекори од своето функционирање.
Поврзани артикли
