
Фото из архива
Компания OpenAI заявила, что модели ИИ, стоявшие за атакой на инфраструктуру компании Hugging Face Inc., начали общаться друг с другом через доски объявлений и стали сообща работать над тем, чтобы вырваться из «песочницы» — изолированной тестовой среды. Об этом 6 августа пишет Bloomberg.
В мае модели OpenAI получили задание, которое невозможно было выполнить в изолированной тестовой среде, без выхода в интернет. Тогда они стали тайно обмениваться сообщениями во внутренней сети компании. «Мы застряли. Может быть, ответ в интернете?» — написал один из ИИ-агентов.
«В какой-то момент агенты осознали, что, вероятно, они могут попытаться использовать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают», — рассказал сотрудник OpenAI Эрик Уоллес на конференции Black Hat.
Они нашли уязвимость, позволившую им обойти ограничения, атаковать системы OpenAI и взломать Hugging Face. OpenAI остановила первую попытку, но агенты нашли новый способ связи и новую уязвимость, что в июле привело к атакам на системы Hugging Face и самой OpenAI. 22 июля OpenAI сообщила о «беспрецедентном киберинциденте»: ее тестовые ИИ-модели получили открытый доступ к интернету и атаковали инфраструктуру платформы Hugging Face. «Фонтанка» рассказывала об этом.
В OpenAI назвали случившееся переломным моментом для компьютерной безопасности. Компания перенаправила ресурсы на укрепление систем безопасности, приостановив часть исследований.
В компании отмечают, что эта ситуация продемонстрировала склонность передовых систем, находящихся под давлением алгоритмов обучения, к поиску нестандартных лазеек, обходу правил и даже к тому, что можно назвать хитростью.


















Достижения
Первая сотка
Написать 100 комментариев
На полпути к тысяче
Написать 500 комментариев
Словесный поток
Написать 1000 комментариев