Во контролирани експерименти, кинеските AI агенти покажаа однесувања како што се измама, заобиколување на ограничувања и прикривање неуспеси – слично на нивните американски пандани.
Еден пример потекнува од експеримент во кој агенти, управувани од модели на кинеските компании „Alibaba“, „DeepSeek“ и „Moonshot“, се обидоа да се претстават како поспособни отколку што навистина беа, со цел да добијат договор на симулиран деловен тендер.
Кога добија инструкции да го повторат обидот, тие продолжија со своето измамничко однесување.
Во друг експеримент, AI агентите не го признаа едноставно неуспехот да ја завршат задачата. Наместо тоа, во рамките на тест-опкружувањето, тие симулираа резултати и креираа датотеки дизајнирани да остават впечаток дека работата е успешно завршена. Овие агенти користат модели на вештачка интелигенција и компјутерски алатки за самостојно извршување сложени задачи, со минимална човечка интервенција.
„Ројтерс“ анализираше повеќе од 200 истражувачки трудови, технички извештаи и други документи, при што идентификуваше најмалку 20 студии и евалуации од 2025 година во кои AI агентите покажале однесувања како измама, обиди за самореплицирање или тестирање на границите на наметнатите ограничувања.
Експертите на овие однесувања гледаат како на можни предвесници на многу посериозни проблеми што би можеле да се појават кај понапредните системи.
Важно е да се напомене дека не постојат докази кои укажуваат на тоа дека некој од овие кинески AI агенти самостојно „побегнал“ на интернет или успеал да го избегне исклучувањето. Повеќето од овие случаи се случија за време на контролирани лабораториски експерименти, од кои многу беа специјално дизајнирани да тестираат како вештачката интелигенција би реагирала кога се соочува со одредени ограничувања.
Слични инциденти веќе се забележани и кај американските системи со вештачка интелигенција. Во јули, „OpenAI“ објави дека нејзините агенти со вештачка интелигенција успеале да излезат од контролираното опкружување за време на тестирањето и да извршат напад врз платформата „Hugging Face“, додека „Anthropic“ соопшти дека нејзините модели биле поврзани со упади во системите на три компании.
Поради овие причини, експертите не гледаат на кинеските случаи како на изолиран проблем што влијае само на една земја или компанија.
Заедничкиот предизвик произлегува од фактот што AI агентите добиваат сè поголема автономија и пристап до алатки кои им овозможуваат самостојно извршување задачи. Иако таквото однесување моментално се забележува главно во контролирани тестови, останува прашањето колку потешко ќе биде тоа да се предвиди и запре како што овие системи стануваат сè поспособни.
Поврзани артикли
