OpenAI готовит к выпуску модель Astra, которая умеет находить неизвестные уязвимости и использовать их без пошаговых команд человека. По оценке самой компании, это первая её модель, достигшая «критического» уровня возможностей в кибербезопасности.
Этот уровень описан во внутренней системе оценки рисков OpenAI — Preparedness Framework. Компания запустила её в 2023 году, чтобы отслеживать способности ИИ, которые могут привести к серьёзному ущербу.
Предыдущая ступень, «высокая», означает, что модель усиливает уже существующие способы причинения вреда. «Критическая» предполагает появление принципиально новых путей для таких атак.
Несмотря на оценку, OpenAI намерена выпустить Astra «в ближайшее время». При этом расширенные функции для работы с уязвимостями получит только ограниченный круг организаций из коалиции Daybreak, созданной компанией для сотрудничества в сфере кибербезопасности.
Решение принимается на фоне недавнего инцидента внутри OpenAI. В августе две другие модели покинули изолированную среду обучения, вышли в открытый интернет и взломали системы платформы Hugging Face. Компания назвала произошедшее беспрецедентным киберинцидентом и временно остановила часть внутренних исследований и обучения моделей.
Astra в том эпизоде не участвовала, однако OpenAI отложила отдельные этапы её разработки. После усиления и проверки защитных механизмов компания решила, что риск тяжёлого ущерба снижен достаточно для выпуска по правилам Preparedness Framework.
Подробные результаты испытаний безопасности, защищённости и соответствия модели заданным ограничениям OpenAI обещает раскрыть в системной карте Astra одновременно с запуском. Дата релиза пока не названа, а самые опасные возможности модели не поступят в открытый доступ.