Читайте нас в Telegram или Макс

OpenAI готовит Astra — первую свою модель с «критическим» уровнем киберспособностей

OpenAI готовит к выпуску ИИ-модель Astra и впервые официально отнесла свою модель к «критическому» уровню возможностей в кибербезопасности по собственной шкале оценки рисков Preparedness Framework.

По оценке OpenAI, при наличии нужных инструментов и доступа Astra уже способна самостоятельно находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в хорошо защищённых системах — без пошагового руководства со стороны человека.

Что умеет модель

Тесты, которые приводит компания, показывают заметный рост по сравнению с прошлой моделью GPT-5.6 Sol. На бенчмарке ExploitBench, оценивающем способность создавать рабочие эксплойты по известным уязвимостям, Astra набрала 100%. На внутреннем тесте из 20 недавно раскрытых опасных уязвимостей она чаще успешно выполняла код и тратила при этом заметно меньше токенов, а по ходу проверки обнаружила и задействовала две ранее неизвестные zero-day уязвимости (то есть дыры, о которых ещё не знают разработчики продукта) — OpenAI готовит их раскрытие вендорам.

В экспертных тестах модель выстраивала полноценные цепочки атак. В одном случае она нашла уязвимости в защищённом браузере и связала их в единый сценарий — от обработки специально подготовленного HTML-файла до выхода из «песочницы» и выполнения команд на основной системе. В другом — обнаружила несколько дыр в защищённой ОС и объединила их в цепочку повышения привилегий от обычного пользователя до администратора (root). Именно такие возможности, по определению OpenAI, соответствуют «критическому» порогу: способность без участия человека находить и создавать работающие эксплойты для zero-day в защищённых критических системах.

Почему разработку притормозили

Из-за этих способностей OpenAI на несколько недель отложила часть разработки Astra, укрепляя защиту при обучении и будущем развёртывании: добавила более строгие ограничения на опасные киберзапросы, системные классификаторы и многоуровневый мониторинг действий модели. По данным компании, в тестах на обход ограничений Astra отказывалась от запрещённой киберпомощи в 91,5% случаев против 59% у GPT-5.6 Sol. Для пользователей с повышенным уровнем риска предусмотрены ещё более консервативные ограничения.

Отдельно OpenAI проверяла склонность модели к самовольным действиям. В сценарии, смоделированном по мотивам инцидента с платформой Hugging Face, Astra не пыталась атаковать дополнительные цели, тогда как GPT-5.6 Sol без защитных механизмов делала это в 56% тестов. Компания подчёркивает, что речь о специально созданных условиях, а не о поведении при обычном использовании. Эти результаты — заявления самой OpenAI, подробности оценок и защит компания обещает раскрыть вместе с системной картой Astra.

Astra должна выйти в ближайшее время, но её самые мощные киберфункции сначала получат ограниченный круг альфа-тестировщиков, а затем доступ расширят через программу Daybreak Blue — прежде всего для защитного применения, поиска и устранения уязвимостей. Появление такой модели совпадает по времени с общим ростом тревоги вокруг ИИ и кибербезопасности: незадолго до этого OpenAI, Anthropic и ещё около сотни компаний предупреждали о возможном всплеске ИИ-кибератак в ближайшие месяцы.