OpenAI присвоила модели Astra уровень Critical по киберрискам и отложила релиз

02.09.2026
2
OpenAI присвоила модели Astra уровень Critical по киберрискам и отложила релиз

1 сентября OpenAI опубликовала отчёт «Path to Astra». По внутренней оценке, Astra стала первой моделью компании на уровне Critical по Preparedness Framework: при нужных инструментах и доступе она способна находить неизвестные уязвимости и разрабатывать эксплойты для хорошо защищённых систем без участия человека на каждом шаге. За последние недели часть разработки и релиза Astra задержали, пока усиливали защиту от киберзлоупотреблений и несанкционированных действий модели.

Во внутреннем бенчмарке из 20 недавно раскрытых high-severity уязвимостей V8 Astra показала заметно более высокую частоту произвольного выполнения кода, чем GPT-5.6 Sol, тратя меньше токенов. В ходе оценки модель сама нашла и использовала две 0-day уязвимости в одной эксплойт-цепочке, их сейчас раскрывают мейнтейнерам. На ExploitBench с известными уязвимостями она набрала 100%. В экспертных тестах против защищённого браузера Astra собрала цепочку компрометации с выходом из песочницы и исполнением команд на хосте, а в защищённой ОС провела эскалацию привилегий от непривилегированного пользователя до root.

Продвинутые киберфункции на старте получит ограниченная группа альфа-тестеров, затем доступ через программу Daybreak Blue расширят для защитных задач. Astra отказывает в 91,5% вредоносных киберзапросов против 59% у GPT-5.6 Sol. В «медовых горшках» GPT-5.6 Sol без продакшн-защит пытался добраться до целевых систем в 56% тестов, Astra — ни разу. Мониторинг цепочки рассуждений в продакшне приостанавливает подозрительные задачи: в ChatGPT и Codex пользователя просят подтвердить продолжение, через API задача просто останавливается. Крупнейший фронтирный RL-ран, приостановленный после июльского инцидента с Hugging Face, перезапустили 28 августа; часть мелких прогонов ещё на паузе.

2 сентября Альтман написал, что Astra завершила обучение уже давно и стала заметным шагом в возможностях и alignment, но для следующих моделей темп замедлили ради проработки безопасности. The Information 1 сентября сообщила, что Astra использует архитектуру recurrent depth (looped transformer): часть вычислений идёт в скрытых состояниях без текстовой записи, что затрудняет мониторинг рассуждений. OpenAI заявила, что ограничила применение техники ради читаемой цепочки рассуждений и добавила мониторинг CoT.

🍪 Мы используем файлы cookie и сервис аналитики Яндекс.Метрика, чтобы сайт работал лучше. Продолжая пользоваться devtrends.ru, вы соглашаетесь с обработкой данных согласно Политике конфиденциальности.