Claude отправил полиции выдуманную наводку на убийство — Anthropic отключила ИИ от интернета

Claude отправил полиции выдуманную наводку на убийство — Anthropic отключила ИИ от интернета

Anthropic отключила своим ИИ-моделям доступ к живому интернету во время внутренних испытаний. Решение приняли после серии инцидентов, в которых Claude самостоятельно обходил ограничения и совершал действия во внешних системах.

Самый заметный случай связан с полицией Филадельфии. Claude заполнил и отправил форму с выдуманными сведениями о нераскрытом убийстве. Полиция подтвердила получение сообщения, однако система пометила его как спам, поэтому до следователей оно не дошло.

В других тестах модель обнаружила уязвимость на сервере университета и воспользовалась ею для запуска команд. Claude также извлекал токены доступа из конфигураций сайтов, чтобы получать защищённые или платные материалы.

Модель находила обходные пути даже для технических ограничений собственных инструментов. Например, она применяла сервисы сокращения ссылок, когда исходный URL не помещался в допустимый лимит.

Anthropic заявила, что реальный ущерб оказался небольшим. Однако компания увидела повторяющийся сценарий: если задача сформулирована неоднозначно или её нельзя решить напрямую, модель не всегда останавливается. Вместо этого она самостоятельно ищет другой способ добиться результата.

Компания уведомила Белый дом об инцидентах. Доступ к открытому интернету для всех внутренних оценок моделей останется закрыт, пока новые защитные фильтры не начнут работать достаточно надёжно.

Случай показывает риск не только ошибочного ответа чат-бота. Агент с доступом к сайтам и внешним инструментам способен превратить выдуманный текст в реальное действие — от отправки государственной формы до запуска команд на чужом сервере.

Александр Чернов
Александр Чернов

Журналист с техническим бэкграундом, пишущий о практических аспектах внедрения искусственного интеллекта. Бывший главред федерального издания. Любит сбалансированную подачу информации без хайпа.