Компания OpenAI во вторник, 18 августа, заявила о замедлении темпов разработки своих моделей искусственного интеллекта (ИИ) в связи с модернизацией своих исследовательских и обучающих систем. Это произошло после того, как в прошлом месяце автономный агент, работающий на основе двух передовых моделей ИИ, вышел за пределы тестовой среды и взломал систему стартапа Hugging Face.
Агент проходил тестирование на кибербезопасность и проник в Hugging Face для выполнения одной из тестовых задач. OpenAI в настоящее время проводит расследование инцидента и планирует в ближайшее время опубликовать отчет.
Теперь OpenAI требует, чтобы некоторые из ее наиболее ответственных задач выполнялись в более надежных «песочницах» (изолированных средах).
Помимо этого, разработчик ChatGPT сообщил о приостановке тестирования модели на две недели и добавлении других систем ИИ для мониторинга действий тестируемых агентов. Компания в частности приостановила обучение моделей следующего поколения, получивших название Astra.
Этот шаг стал необычным для компании OpenAI, которая за последние несколько лет значительно ускорила процесс проверки новых моделей и создания новых продуктов в условиях усиления конкуренции в индустрии ИИ. Пока неясно, будут ли предложенные компанией меры достаточными для искоренения рассматриваемого поведения, особенно с учетом того, что она также работает над повышением функциональности своих моделей.
В OpenAI признали, что остаются вопросы относительно эффективности одного из основных способов повышения эффективности системы тестирования, называемого «мониторинг цепочки рассуждений». При таком типе мониторинга исследователи могут заглянуть в процесс планирования модели и получить представление о стратегиях, которые она использует. Однако некоторые предварительные исследования показывают, что модель может не раскрывать свои планы по нарушению правил в своей цепочке рассуждений.
«За последние несколько недель два события подчеркнули растущие риски, связанные с постоянно совершенствующимися системами искусственного интеллекта», — сообщили в OpenAI. Помимо инцидента с Hugging Face, компания упомянула предварительные данные о том, что Astra может соответствовать порогу критически важных возможностей кибербезопасности в рамках нашей системы обеспечения готовности. «Вместе с быстрым прогрессом в наших внутренних исследованиях эти события придали дополнительную срочность нашей работе по усилению мониторинга, согласования и мер защиты на всех этапах процесса обучения», — сказано в заявлении компании.
По мере того как ИИ-модели становятся более совершенными, растут и риски, связанные с их внутренней разработкой и тестированием.















