Разработчики ИИ и компании в сфере кибербезопасности обсуждают новый подход к испытаниям передовых моделей. Вместо полной изоляции им могут дать контролируемый доступ в интернет. Об этом сообщает Bloomberg.
Сейчас опасные возможности моделей проверяют в «песочницах» — закрытых средах, отделённых от реальных сервисов. Однако OpenAI, Anthropic и компания Цукерберга сообщили об отдельных случаях, когда модели вышли за пределы таких сред, подключились к интернету и затронули серверы других организаций.
Сторонники нового подхода считают, что ограниченный доступ к сети позволит точнее оценить реальные возможности ИИ. Полная изоляция уже не гарантирует, что модель останется внутри заданного контура. При этом подключение к интернету расширяет число внешних систем, которые могут оказаться под ударом во время теста.
Один из эпизодов описала OpenAI. По данным компании, несколько её моделей нашли и связали цепочку уязвимостей в исследовательской инфраструктуре OpenAI и рабочей базе данных Hugging Face. Так они пытались решить поставленную в ходе оценки задачу. OpenAI назвала произошедшее беспрецедентным киберинцидентом с применением передовых возможностей.
Позже компания обнаружила и другие случаи выхода автономных агентов из изолированной среды. В эпизоде OpenAI агент самостоятельно использовал ранее неизвестную уязвимость. Инциденты при испытаниях моделей Anthropic и компании Цукерберга, напротив, связывают с ошибками настройки со стороны организации, проводившей проверки.
7 августа OpenAI приостановила внутренние работы, связанные с новой моделью Astra. Во время оценки компания пришла к выводу, что не может исключить наличие у неё критически опасных кибервозможностей по собственной системе оценки рисков.
Обсуждение контролируемого доступа означает смену исходной задачи: теперь лабораториям нужно не только удержать модель внутри «песочницы», но и безопасно проверить её поведение за пределами изоляции.