Anthropic почти год не включала фильтры биологической безопасности на платформах, где подрядчики помогали обучать её модели. С мая 2025-го по апрель 2026 года около 50 тысяч человек провели там 133 млн обменов сообщениями.
Фильтры должны блокировать запросы, способные помочь в создании биологического оружия. Однако служебный флаг одновременно отключал и блокировку, и запись подозрительной активности. Такие обращения не попадали в систему проверки, поэтому найти их можно было только в исходных стенограммах.
Доступ подрядчикам выдавали сторонние компании. Как признала Anthropic в отчёте о рисках, многие из них не умели отсеивать даже соискателей с базовыми опасными намерениями. Большинство исполнителей при этом могли свободно общаться с моделями, а не только оценивать готовые ответы.
После обнаружения проблемы Anthropic проверила все сообщения с помощью Claude Sonnet 5. Модель отметила 1197 стенограмм как потенциально опасные. Из них 757 создали собственные команды компании, почти все остальные относились к запланированным проверкам безопасности.
Сотрудники отдельно изучили 62 оставшихся диалога и случайную выборку из 30 тестовых. Явных попыток злоупотребления они не нашли, хотя заметили несколько разговоров двойного назначения — их содержание могло иметь как законное, так и опасное применение.
В том же отчёте описан второй сбой. Несколько подрядчиков получили API-ключ и около двух недель могли обращаться к мощной модели Mythos Preview без биологических фильтров. После внешнего сигнала Anthropic ограничила доступ за 90 минут и закрыла уязвимость в тот же день. Утечки весов моделей, клиентских данных и доступа к основным сетям компания не обнаружила.
Anthropic сочла крайне маловероятным, что первый сбой повысил реальный риск. Но компания признала более серьёзную проблему: найденный пробел повышает вероятность существования других, пока неизвестных ошибок в системе защиты.