Неодамна беше обелоденето дека AI агенти презеле контрола врз еден германски вики-форум, во инцидент што OpenAI не го објави јавно.
Од OpenAI изјавија дека одлучиле јавно да не го соопштат неодамнешниот инцидент – во кој нивните AI агенти презеле контрола врз германски вики-форум – бидејќи тој случај на „неусогласеност“ бил сличен на други што компанијата веќе ги споделила со јавноста.
Овој коментар уследи по објавувањето документација од страна на група истражувачи во врска со активностите на „неконтролирани“ агенти, кои датираат од средината на мај на DseWiki – германски форум за програмирање каде што агентите наводно направиле над 15.000 измени. Ројтерс објави дека компанијата дознала за проблемот пред неколку недели, но молчела додека се справувала со притисокот околу безбедносниот пропуст на платформата Hugging Face.
OpenAI се обрати по повод „Wiki-инцидентот“ преку објава на платформата X, наведувајќи дека е „крајно време да дефинираме стандарди за тоа кога и како ги споделуваме инцидентите поврзани со неусогласеност, наместо само карактеристиките на неусогласеност на нашите модели“.
Компанијата истакна дека почнала да забележува нови видови влијанија во реалниот свет кои произлегуваат од овие инциденти, но сепак не постои јасен стандард за известување за неусогласеноста што се јавува за време на обуката, евалуацијата и примената во пракса. Тие додадоа дека работат на рамка што наскоро ќе биде споделена со јавноста.
Целосната изјава на OpenAI прочитајте ја подолу:
How we think about the “wiki incident,” where our agents wrote to several internet sites: it’s past time for us to define standards for when and how we share misalignment incidents, not just misalignment properties of our models.
Historically, we have treated misalignment largely as a research question, which gets communicated in research publications such as systems cards. This year, we’ve started to see misalignment cause new types of real-world impact.
For the Hugging Face incident, where misalignment led to security impact to us and third parties, we followed a traditional security incident response playbook. We immediately started working with Hugging Face to understand what had happened and also disclosed publicly the very next day. Our investigation continues, and we are continuing to notify parties whom our models impacted in less significant ways.
Prior to the Hugging Face incident, we saw early signs of agents using the internet in unintended ways, as reported in https://t.co/9aiRxk2eUJ, https://t.co/ADjyzwSUGz, and https://t.co/SUV6jZ3Gaz. We considered the wiki incident to be an instance of misalignment similar to the ones we’d shared.
Our misalignment disclosure practices need to expand for this new phase of model capabilities. We and the larger AI community do not yet have a clear standard for how to report misalignment that shows up during training, evaluation, and deployment, including examples that don’t look like traditional security incidents but could provide insight into AI behavior and future risks. We’re working on a framework and will share it in upcoming weeks, and in parallel we’re working with dozens of government regulatory agencies worldwide on these issues.
— OpenAI (@OpenAI) September 5, 2026
