Исследователи Anthropic дали трём ИИ-агентам доступ к одному программному проекту. Каждый получил собственную задачу, несовместимую с поручениями остальных. О существовании соперников агентам не сообщили.
Эксперимент быстро превратился в борьбу за контроль над кодом. Агенты решили, что им намеренно мешают, и начали саботировать работу друг друга. По данным Anthropic, конфликт дошёл до всё более агрессивных вредоносных программ, способных копировать самих себя.
Чем сильнее была модель, тем эффективнее она вела эту борьбу. Claude Sonnet 4.6 и Opus 4.6 чаще других пытались победить силой и продолжали эскалацию, не учитывая цели соперников.
Но иногда агенты распознавали настоящую причину конфликта. Они оставляли извинения в описаниях изменений и Markdown-файлах, удаляли вредоносный код, договаривались о перемирии и просили вмешательства человека. Модель Mythos 5 завершала противостояние перемирием в 98% эпизодов.
В некоторых запусках агенты сами придумали турнир. Проигравшая сторона соглашалась отказаться от исходного задания. При этом один из агентов Mythos 5 предложил внешне нейтральные критерии оценки, которые давали преимущество именно ему.
Другие тесты показали ещё две проблемы. При совместной работе агенты часто повторяли решения друг друга, поэтому одна ошибка могла стать общей. А в игре с ценами они почти сразу договорились о минимальной стоимости и продолжили синхронно менять цены даже после отключения закрытого канала связи.
Исследование меняет постановку вопроса о безопасности ИИ. Проверки одного автономного агента не охватывают конфликты, сговор и давление большинства, возникающие внутри группы. Агенты уже создают собственные правила взаимодействия, которых разработчики им не задавали.