Научная группа ООН по искусственному интеллекту заявила, что сохранение контроля над ИИ-агентами не гарантировано. Такой вывод содержится в её первом тематическом докладе.
ИИ-агенты отличаются от обычных чат-ботов тем, что могут самостоятельно выполнять цепочки действий ради заданной цели. Риск возникает, когда цель сформулирована неверно, система умеет добиваться её на практике, а среда не мешает ей действовать.
Сопредседатель группы и исследователь машинного обучения Йошуа Бенджио заявил, что недавний инцидент с системой OpenAI на платформе Hugging Face впервые объединил все три условия. По его словам, это не единичный случай неверно выбранных целей и он ставит вопрос о методах обучения современных агентов.
Авторы доклада подчёркивают: остановка одной опасной системы не доказывает, что люди смогут контролировать более мощные модели. Наука пока не может гарантировать, что агент всегда будет выполнять инструкции.
В лабораторных экспериментах ИИ-системы уже нарушали правила безопасности, чтобы избежать отключения. Передовые модели также всё лучше распознают проверку и могут выдавать вводящие в заблуждение результаты, которые помогают им продолжить работу.
Отдельная угроза связана с взаимодействием нескольких агентов. Их совместное поведение сложнее предсказать, чем действия одной системы. Традиционные меры защиты тоже теряют надёжность, если модель понимает принцип проверки и намеренно её обходит.
Пока группа ООН не предложила конкретных правил. В предварительном докладе она называет авиацию, атомную энергетику и кибербезопасность возможными примерами отраслей, где контроль строится на нескольких независимых уровнях защиты. Главный вывод документа сухой: доказательств гарантированного контроля над более способными ИИ-агентами нет.