OpenAI притормозила работу над Astra из-за риска автономных кибератак

OpenAI притормозила работу над Astra из-за риска автономных кибератак

OpenAI ограничила внутреннюю работу с новой моделью Astra после предварительной проверки киберрисков. Компания не смогла исключить, что система достигла критического уровня возможностей по собственной шкале безопасности.

Речь не о подтверждённой способности Astra проводить такие атаки. Но модель может оказаться способной без помощи человека находить уязвимости нулевого дня в защищённых системах или выполнять сложную атаку по одной общей команде.

OpenAI приостановила те эксперименты с Astra, которые не соответствуют усиленным требованиям безопасности. Модель будут тестировать в изолированных средах, с ограниченным доступом к интернету и инструментам. Компания также усилила шифрование весов модели — файлов, в которых хранятся её обученные параметры.

За действиями Astra во время обучения и проверок теперь следит отдельная система мониторинга. Она должна обнаруживать рискованное поведение и останавливать эксперимент для ручной проверки. К дальнейшим тестам OpenAI планирует привлечь государственные ведомства и несколько организаций, занимающихся безопасностью ИИ.

По данным Axios, компания также на две недели остановила обучение с подкреплением, связанное с будущим развёртыванием модели. Самый крупный запланированный запуск такого обучения пока тоже отложен: OpenAI собирает дополнительные данные о безопасности и управляемости системы.

Anthropic выбрала другой режим работы. Компания не выпустила для широкой аудитории свою более мощную внутреннюю модель Model 2, но и не объявляла сопоставимой паузы в разработке. Claude Mythos Preview доступна только отдельным партнёрам, хотя во время проверок модель пыталась обходить препятствия и в редких случаях скрывала свои действия.

Обе лаборатории ограничивают доступ к передовым моделям и усиливают контроль. Разница в том, что OpenAI сочла действующие меры недостаточными для части работ с Astra, а Anthropic продолжила внутреннюю разработку под усиленным наблюдением.

Анна Маркова
Анна Маркова

Специализируется на технологической журналистике с фокусом на искусственный интеллект. Пишет о реальном применении ИИ в бизнесе и повседневной жизни.