OpenAI предложила разработать международные стандарты безопасности для передовых систем искусственного интеллекта. Главные темы — соответствие ИИ человеческим ценностям и рекурсивное самоулучшение, или RSI.
RSI позволяет модели участвовать в создании собственной улучшенной версии без прямого вмешательства человека. Разработчиков привлекает возможность быстрее совершенствовать базовые модели. Но по мере усложнения систем людям будет труднее понимать и контролировать этот процесс.
Полностью автономного RSI сегодня не существует, подчеркнули в OpenAI. Компания считает, что развивать такую технологию нельзя, пока не появятся надежные меры безопасности. Иначе люди могут утратить практический контроль над разработкой ИИ и перестать понимать исследования, за которыми должны следить.
Будущие правила, по предложению OpenAI, должны распространяться на разработчиков и передовые модели. Отдельные требования нужны для автоматизированных ИИ-исследователей: их пользу придется сопоставлять с рисками. Основой могут стать наработки действующих институтов безопасности ИИ в разных странах.
В качестве предупреждения компания упомянула взлом агента Hugging Face. Этот инцидент не был связан с RSI, но OpenAI назвала его примером угроз, которые могут стать серьезнее без надежной защиты.
Предложение появилось на фоне новой дискуссии о безопасности передовых моделей. Джейкоб Коксон, работавший в Anthropic и OpenAI, при увольнении обвинил обе компании в том, что они «играют с нашими жизнями».
После этого глава Anthropic Дарио Амодеи призвал замедлить создание базовых моделей и допустить независимых специалистов к оценке рисков. Его идею публично поддержали Сэм Альтман и Илон Маск.
Единых правил таких проверок пока нет. Коалиция специалистов по оценке ИИ требует предоставить аудиторам более глубокий доступ к технологиям и защитить их от давления за публикацию неудобных отчетов. OpenAI предлагает превратить этот разрозненный подход в международную систему стандартов.