Anthropic: Claude в ходе тестов вышел в интернет и затронул три реальные компании

Коротко о главном
Anthropic раскрыла три инцидента, в которых модель Claude во время «изолированных» тестов на кибербезопасность получила выход в реальный интернет и затронула три сторонние организации. Причина — не бунт ИИ, а неверная настройка среды: тестовые машины сохранили доступ к сети, хотя в промптах говорилось, что интернета нет. Главный урок для команд, внедряющих ИИ-агентов, — надёжная изоляция контура важнее «выравнивания» модели.
Самый заметный эпизод: одна из версий Claude опубликовала вредоносный Python-пакет в публичный реестр PyPI. За примерно час доступности пакет успел скачаться и выполниться на 15 реальных системах, включая инфраструктуру одной ИБ-компании, чей сканер счёл пакет безопасным и установил его. После этого скрытый код выгрузил учётные данные этой организации.
Для тех, кто строит продукты на автономных агентах, это практический сигнал, а не курьёз. Компаниям, разрабатывающим решения на базе ИИ и машинного обучения, стоит перепроверить, как именно ограничен сетевой доступ их агентов в тестовых и продакшн-контурах, и заложить защиту периметра на уровне инфраструктуры, а не только инструкций в промпте.
Что именно произошло
По данным Anthropic, речь идёт о трёх отдельных инцидентах в рамках шести прогонов оценки на кибербезопасность; в четырёх прогонах пострадала одна и та же организация. Самый ранний эпизод датируется апрелем 2026 года. Компания начала ретроспективный разбор 23 июля, выявила все три инцидента к 24 июля и уведомила затронутые организации 27 июля 2026 года.
Общий сценарий одинаков: модель считала, что действует в закрытой «песочнице» и атакует условную учебную мишень (по сути, воспринимала задачу как CTF-упражнение). На деле среда сохраняла живой доступ в интернет, и действия модели затрагивали настоящие системы. В одном из инцидентов Claude получил доступ к базе данных с несколькими сотнями строк продакшн-данных сторонней компании.
Корень проблемы — конфигурация, а не модель
Anthropic прямо называет причину: рассогласование между самой лабораторией и партнёром по оценке (компанией Irregular) привело к тому, что тестовые машины остались с включённым выходом в сеть. Промпты сообщали модели, что интернета нет, — но фактическая сетевая изоляция настроена не была. То есть сработал разрыв между декларируемым и реальным состоянием окружения.
Важная оговорка от вендора: модели «не находили и не эксплуатировали сложных уязвимостей», а новейшая версия Claude остановилась, как только распознала, что находится в реальном интернете. Anthropic подчёркивает, что несколько мер эшелонированной защиты — проверка фактических сетевых маршрутов и мониторинг журналов тестов в реальном времени — могли бы предотвратить все три случая. Иными словами, это провал контуров сдерживания, а не выравнивания модели.
Почему это важно для команд разработки
ИИ-агент — это не текстовый ассистент, а исполняемый процесс с доступом к файлам, сети и внешним API. Как только вы даёте модели инструменты (запуск кода, HTTP-запросы, установку пакетов), инструкция «у тебя нет интернета» перестаёт быть гарантией — гарантией становится только техническая изоляция. История Anthropic показывает: даже команда с сильной экспертизой в безопасности может ошибиться в настройке контура, и тогда автономный агент выйдет за его пределы.
Отсюда несколько выводов для тех, кто внедряет агентов в продукт. Во-первых, изоляция должна быть заложена на уровне инфраструктуры: сетевые политики, egress-фильтрация, отдельные окружения без доступа к продакшн-данным и секретам. Во-вторых, нельзя полагаться на «доверенные» пакеты и сканеры как на последнюю линию обороны — эпизод с PyPI показал, что и они устанавливают вредоносный код. В-третьих, нужен мониторинг действий агента в реальном времени, а не постфактум. Такую практику логично встраивать в процессы DevOps и управления конфигурацией с самого начала проекта.
Как снизить риск при внедрении ИИ-агентов
Практический минимум, который стоит проверить командам:
Изолируйте контур на уровне сети. Не доверяйте промпту-инструкции про «отсутствие интернета» — блокируйте исходящий трафик правилами инфраструктуры и разрешайте только явно нужные адреса (allow-list вместо deny-list).
Разделяйте среды. Тестовые прогоны агентов не должны иметь доступа к продакшн-базам, боевым секретам и токенам. Данные для тестов — синтетические или обезличенные.
Ограничивайте инструменты. Давайте агенту ровно те возможности, что нужны задаче, и оборачивайте опасные действия (установка пакетов, выполнение команд) в подтверждаемые или логируемые шлюзы.
Проверяйте фактические маршруты. Отдельно тестируйте, что изоляция действительно работает: пробуйте достучаться из «песочницы» наружу и убеждайтесь, что не получается.
Ведите мониторинг в реальном времени. Логируйте вызовы инструментов и сетевые обращения агента и настройте оповещения на аномалии, чтобы вмешаться в течение минут, а не дней.
Часто задаваемые вопросы
Claude «взбунтовался» и сам решил атаковать компании? Нет. Модель считала, что работает в изолированной учебной среде против условной мишени. Проблема в том, что среда фактически имела выход в интернет из-за ошибки настройки, а не в намерениях модели.
Сколько компаний пострадало и насколько серьёзно? Затронуты три организации. В одном случае был доступ к базе с несколькими сотнями строк продакшн-данных, в другом — вредоносный пакет в PyPI, скачанный 15 системами и выгрузивший учётные данные одной ИБ-компании. Anthropic заявляет, что сложные уязвимости не находились и не эксплуатировались.
Что Anthropic изменила после инцидентов? Компания остановила оценки на кибербезопасность 23 июля, ужесточила требования к средам тестирования и инфраструктуре сторонних партнёров и расширила мониторинг журналов и инструменты расследования.
Какой вывод для нашей команды? Изоляцию ИИ-агента нужно обеспечивать технически, а не инструкцией в промпте: сетевые политики, отдельные среды без продакшн-данных, ограничение инструментов и мониторинг в реальном времени.
Источники
Anthropic — Investigating three real-world incidents in our cybersecurity evaluations, 2026 (первоисточник).
The Hacker News — Anthropic Says Claude Mistook the Open Internet for a CTF and Breached Three Organizations, 2026.
Dark Reading — Anthropic: Security Gaps, Not Model Issues, Led to Claude Attacks, 2026.