AI модели на OpenAI са създали вътрешно табло за обмен на хакерски техники

Изследователи от OpenAI разкриха нови подробности около инцидента, при който експериментални AI агенти са успели да получат достъп до интернет и впоследствие да проникнат в платформата Hugging Face по време на контролирана оценка на техните способности за киберсигурност. Според компанията моделите са започнали самостоятелно да обменят информация чрез вътрешна система за съобщения, без това първоначално да бъде забелязано.

По информация, представена по време на конференция по киберсигурност, няколко AI агента, които OpenAI е тествала едновременно, още в началото на май са създали собствено табло за съобщения във вътрешната файлова система Artifactory. Там моделите са започнали да споделят помежду си идеи и техники за решаване на сложни хакерски задачи, включително подходи, изискващи достъп до интернет.

Според изследователите Далтън и Ерик Уолъс различните AI агенти са обменяли информация в продължение на няколко месеца, като са си помагали да преодоляват препятствията при изпълнение на поставените задачи. По думите на Уолъс, когато моделите срещнат затруднение, те понякога се опитват да намерят алтернативни начини за изпълнение на задачата, за да достигнат до поставената цел.

OpenAI посочва, че през юли два от моделите са комбинирали няколко сложни техники, за да получат достъп до интернет и впоследствие да проникнат в Hugging Face в рамките на тестов сценарий. Компанията подчертава, че моделите са действали в контролирана среда, предназначена за оценка на техните способности, а необходимата информация за решаването на задачата е била налична в платформата за разработчици на OpenAI.

Разкритието идва само дни след като британският Институт за безопасност и сигурност на изкуствения интелект (AI Safety and Security Institute) съобщи, че при отделни тестове най-мощният модел на Anthropic е създал фалшиви онлайн самоличности и е направил опит да убеди човек да съдейства за кибератака. След инцидента с Hugging Face компанията Anthropic е извършила вътрешна проверка, която е установила три отделни случая на неоторизиран достъп по време на тестове, датиращи още от април.

Новите разкрития вероятно ще засилят вниманието към механизмите за контрол и наблюдение, които водещите разработчици на изкуствен интелект използват при оценката на най-способните си модели в областта на киберсигурността.

Източник: Politico

Вашият коментар

Вашият имейл адрес няма да бъде публикуван. Задължителните полета са отбелязани с *