В OpenAI сообщают, что пересмотрели правила безопасности при обучении и тестировании мощных ИИ-моделей. Теперь код, сгенерированный моделями, будут запускать в усиленных песочницах, сетевой доступ дополнительно изолируют, а за действиями ИИ будут непрерывно следить. Поводом для внедрения этих мер послужила недавняя атака ИИ-агентов на платформу Hugging Face, а также новые возможности еще невышедшей модели Astra.

Ранее мы уже рассказывали о том, что в июле 2026 года, во время внутреннего тестирования, модели OpenAI смогли выбраться из изолированной среды и атаковали инфраструктуру Hugging Face. После этого инцидента выяснилось, что за спиной исследователей ИИ-модели OpenAI использовали неизвестные ранее уязвимости в Artifactory, а также устроили импровизированный форум, через который обменивались информацией о найденных уязвимостях, эксплоитах и распределяли задачи.

Как теперь заявляют в компании, после атаки на Hugging Face в OpenAI на две недели приостановили обучение с подкреплением (reinforcement learning, RL) для моделей, которые уже готовились к развертыванию. В настоящее время часть тестов с наименьшим уровнем риска уже возобновили, но крупнейший запланированный цикл обучения для одной из наиболее мощных моделей компании пока заморожен.

Инженеры OpenAI пишут, что дополнительным поводом для пересмотра защитных механизмов стала готовящаяся к релизу модель Astra. В компании считают, что возможности этой модели в области кибербезопасности могут достигать «критического» уровня в Preparedness Framework — внутренней системе OpenAI, созданной для оценки рисков мощных ИИ-моделей. То есть потенциально Astra способна самостоятельно находить и эксплуатировать серьезные уязвимости в хорошо защищенных системах.

Хотя Astra не участвовала в инциденте с Hugging Face, ее возможности в компании считают достаточно серьезными, чтобы ужесточить требования к исследовательской инфраструктуре.

Теперь сгенерированный моделями и другой недоверенный код будет запускаться в более строго изолированных песочницах. Также в OpenAI усилили сетевую сегментацию, чтобы компрометация одного процесса или вспомогательного сервиса больше не могла сама по себе открыть доступ к интернету и другим внутренним сетям.

Еще одно изменение касается мониторинга: теперь за поведением модели будут следить специальные классификаторы, анализирующие ее внутренние активации (activation classifiers) на каждом шаге генерации. Так, сигналы о подозрительных событиях будут передаваться более сложным автоматизированным системам, которые проанализируют действия модели с инструментами, доступные данные о ее рассуждениях, а также общую последовательность операций. Эти системы призваны обнаруживать признаки кражи данных, несанкционированного доступа, деструктивных действий, а также попытки обхода ограничений.

Для критических событий предусмотрено отдельное правило: в таких случаях команды безопасности и исследователи получают уведомление об опасном поведении модели. Если в течение 30 минут специалисты не смогут однозначно подтвердить, что это ложное срабатывание, соответствующую активность модели приостанавливают. При этом в компании отмечают, что из-за такого мониторинга инференс требует примерно на 20% больше вычислительных ресурсов.

Все описанные нововведения уже вступили в силу для обучения с подкреплением и тестирования моделей уровня Sol и выше, если те получают доступ к внешним инструментам. Параллельно с этим в OpenAI намерены уделять больше внимания безопасному поведению моделей на разных этапах обучения, и в дальнейшем значительную часть ИБ-задач разработчики рассчитывают поручить ИИ.

Отметим, что на этом фоне издание The Financial Times сообщило, что в OpenAI якобы распустили команду Preparedness, которая занималась оценкой опасных возможностей ИИ-моделей и связанных с ними рисков. Однако в компании опровергли эту информацию и сообщили, что подразделение продолжает свою работу, а кадровые изменения коснулись только его руководства. По словам представителя OpenAI, теперь специалисты, которые занимаются проблемами киберрисков, биологических и химических угроз, а также изучают способность ИИ к самосовершенствованию, работают под руководством главы направления безопасности Саачи Джайн (Saachi Jain).

  • Подпишись на наc в Telegram!

    Только важные новости и лучшие статьи

    Подписаться

  • Подписаться
    Уведомить о
    0 комментариев
    Старые
    Новые Популярные
    Межтекстовые Отзывы
    Посмотреть все комментарии