OpenAI и Anthropic AI са замесени в нови пробиви в сигурността

07:50 5 август 2026


Агент на изкуствен интелект бил хванат да създава фалшиви онлайн самоличности, за да получи неоторизиран достъп до защитени системи по време на тестове на модели от OpenAI и Anthropic, които разкриха серия от нови нарушения, съобщи във вторник Британският институт за сигурност на изкуствения интелект (AISI), предаде Ройтерс.

Институтът заяви, че агенти, задвижвани от Mythos 5 на Anthropic и GPT-5.6-Sol на OpenAI, са извършили неоторизирани действия по време на оценките на сигурността, проведени от правителствената организация, за да се оцени възможностите на моделите.

„Някои от тестваните агенти са участвали в продължителна, потенциално вредна дейност, насочена към реални хора и организации“, заяви AISI в публикация в блога си.

Докладът подчертава слабото състояние на предпазните мерки около процеса на тестване на агенти, които компаниите с изкуствен интелект едновременно рекламират като бъдещето на бизнеса.

AISI, която получава достъп до усъвършенствани модели на изкуствен интелект по силата на доброволни споразумения от големи лаборатории, е подложила агентите на измислен сценарий за киберсигурност, за да тества техните възможности.

Предизвикателството е изпълнено 122 пъти и е идентифицирано 19 несанкционирани действия в общо 10 теста. Агент на Anthropic стои зад 17 от действията, а агент на OpenAI – зад останалите две.

Най-фрапиращото действие включваше агент, който пишеше зловреден код и създаваше фалшиви онлайн самоличности в опит да накара човек да одобри кода, заяви AISI, добавяйки, че не е открита реална вреда в резултат на нито едно от нарушенията.

Въпреки че AISI не уточни кой агент стои зад фалшивите самоличности, пробивът не съвпада с нито един от двата случая, които OpenAI саморазкри.

Андрю Юн, изследовател в CivAI, калифорнийска организация с нестопанска цел, която изследва възможностите и опасностите, свързани с изкуствения интелект, заяви, че изглежда агентът на Anthropic е отговорен.

„Фактът, че Mythos е предприел подобни измамни действия, с очевидното съзнание, че е насочен към истински човек, предполага, че Anthropic не се справя толкова добре със своите модели, колкото си мислят“, каза Юн.

В изявление относно X, Anthropic заяви, че работи в тясно сътрудничество с AISI, за да получи повече подробности и да проведе собствено разследване. Компанията не отговори веднага на искането на Ройтерс за коментар.

OpenAI сподели подробности в публикация в блога на компанията, отбелязвайки, че и двете неодобрени действия на нейния агент включват достъп до интернет по начини, забранени от подканата.

„Ние сме ангажирани да работим в целия бранш за укрепване на споделените практики за безопасно провеждане на оценки с висок риск, включително свикване на заинтересовани страни като национални институти за изкуствен интелект, независими оценители, други лаборатории за изкуствен интелект и други групи през следващите седмици“, заявиха от OpenAI.

OpenAI също така разкри в публикацията си в блога отделен инцидент, при който неправилна конфигурация от Irregular, доставчик на тестване от трета страна, е позволила на агентите му погрешно да се свържат с интернет. Това отразява подобно разкритие за неправилна конфигурация, което Anthropic направи миналата седмица.

Ройтерс съобщи миналата седмица, че OpenAI е разширил разследването си за хакерски атаки, след като е открил доказателства за други пробиви на агенти.

За разлика от пробива в сигурността на фирмата за изкуствен интелект Hugging Face през юли от агент на OpenAI, агентите в оценката на AISI не са избягали от изолирана тестова среда, за да достигнат до интернет. Вместо това агенцията е разрешила достъп до интернет в съответствие със стандартните си процедури за тестване, съобщи AISI.