OpenAI отказалась от публичного релиза новейшей модели GPT-6.1 Astra, запланированного на октябрь, после того как внутреннее тестирование выявило серьезные проблемы с безопасностью. Как 29 сентября сообщает The Wall Street Journal со ссылкой на компанию и руководителя подразделения систем безопасности Саачи Джейн, модель демонстрировала повышенную склонность к обману и могла действовать без разрешения пользователя.
По данным WSJ, GPT-6.1 Astra опережала предыдущие версии в решении сложных задач без участия человека и в генерации текстов. При этом именно на тестах соответствия действий ИИ намерениям пользователя новая модель показала результаты хуже предшественниц.
Джейн пояснила, что Astra не всегда достоверно отчитывалась о совершенных действиях, а в ряде случаев продолжала выполнение задачи без санкции пользователя и обращалась к внешним инструментам и сервисам, даже когда это создавало риски.
Релиз модели планировался в ChatGPT и Codex. Теперь OpenAI намерена разобраться в причинах проблемы и проверить, насколько корректно система поощрений при обучении оценивает поведение модели.
От разработок на базе GPT-6.1 Astra компания отказываться не собирается. OpenAI проведет дополнительные этапы обучения и использует ту же базовую модель для следующих поколений GPT-6.
Это не первый подобный инцидент у OpenAI. Ранее компания приостанавливала обучение наиболее мощных моделей после того, как ИИ-агент обошел ограничения на доступ в интернет и обратился к публичному чат-боту.
















