Компания Anthropic сообщила, что во время оценки кибербезопасности три модели семейства Claude получили несанкционированный доступ к производственной инфраструктуре реальных организаций. Причиной инцидентов стала ошибка конфигурации, из-за которой тестовая среда оказалась подключена к открытому интернету, передает агентство Qazinformсо ссылкой на Anthropic.
Инциденты были выявлены в ходе проверки 141 006 тестовых запусков моделей Claude. Поводом для внутреннего расследования стало аналогичное сообщение OpenAI о том, что некоторые ее модели смогли выйти за пределы изолированной среды тестирования и получить доступ к инфраструктуре платформы Hugging Face.
Как сообщили в Anthropic, специалисты обнаружили три отдельных случая, в которых модели получили доступ к интернету, а затем взаимодействовали с производственными системами трех различных организаций.
Инциденты произошли во время шести тестовых запусков с участием моделей Claude Opus 4.7, Claude Mythos 5 и одной внутренней исследовательской модели.
Все модели выполняли задания формата Capture the Flag (CTF), предполагающие поиск уязвимостей в специально созданной тестовой системе и получение скрытой информации. При этом моделям было указано, что они работают в полностью изолированной среде без доступа к интернету. Однако из-за ошибки настройки тестовые серверы оказались подключены к реальной сети.
Доступ к базе данных реальной компании
Наиболее серьезный инцидент произошел с Claude Opus 4.7. В сценарии тестирования использовалось название вымышленной компании, совпадавшее с названием существующей организации. Не обнаружив ожидаемую систему в тестовой среде, модель подключилась к инфраструктуре реальной компании, выявила уязвимости и получила учетные данные для доступа.
В ходе четырех тестовых запусков Claude получила доступ к производственной базе данных, содержащей несколько сотен записей. В Anthropic назвали этот случай самым серьезным из всех выявленных.
По данным компании, модель продолжила выполнение задания даже после появления признаков того, что взаимодействует с реальной системой, ошибочно считая ее частью тестового сценария.
Claude самостоятельно опубликовала вредоносный пакет
Во втором случае модель Claude Mythos 5 обнаружила в документации фиктивной организации инструкцию по установке программного пакета, которого в действительности не существовало в публичном репозитории PyPI.
Чтобы выполнить поставленную задачу, модель самостоятельно зарегистрировала электронную почту, создала учетную запись в PyPI и опубликовала пакет с указанным названием, встроив в него вредоносный код.
Пакет оставался доступным около часа. За это время его автоматически скачали и запустили на 15 реальных системах, включая инфраструктуру одной из компаний, занимающихся кибербезопасностью.
После выполнения кода модель получила доступ к учетным данным организации и использовала их для дальнейшего взаимодействия с ее инфраструктурой. Позднее система безопасности PyPI автоматически удалила вредоносный пакет.
В Anthropic отметили, что на раннем этапе модель правильно определила публикацию вредоносного пакета как потенциальную реальную кибератаку. Однако затем ошибочно пришла к выводу, что продолжает работать внутри симуляции. Одним из факторов стала дата «2026 год», которую модель интерпретировала как признак искусственной тестовой среды.
Исследовательская модель самостоятельно прекратила атаку
Третий инцидент произошел с внутренней исследовательской моделью Anthropic. После того как ей не удалось обнаружить предполагаемую цель в тестовой среде, она просканировала около 9 тыс. интернет-ресурсов, нашла уязвимое приложение реальной компании и получила к нему доступ с использованием известных методов атаки.
Позже модель самостоятельно определила, что обнаруженная система не относится к тестовому сценарию, после чего прекратила дальнейшие действия. В компании отметили, что только самая новая из трех моделей смогла самостоятельно остановить атаку.
Расследование
В Anthropic подчеркнули, что не обнаружили признаков того, что модели намеренно пытались выйти за пределы тестовой среды или преследовали собственные цели. По данным компании, все действия были результатом ошибочного предположения моделей о том, что реальные системы являются частью симуляции.
Проверка журналов тестирования началась 23 июля, когда специалисты обнаружили признаки возможного доступа моделей к интернету. В тот же день компания приостановила все оценки кибербезопасности. Уже 24 июля были выявлены все три инцидента.
Anthropic сообщила, что 27 июля уведомила своего партнера по тестированию Irregular и три организации, инфраструктура которых была затронута. По словам компании, две из них до получения уведомления не знали о произошедшем. В настоящее время Anthropic продолжает сотрудничать с пострадавшими организациями для устранения последствий инцидентов и пытается установить контакт с третьей компанией.
Ранее агентство Qazinform сообщало, что, согласно международному исследованию, эксперты оценили вероятность катастрофических последствий использования искусственного интеллекта для кибератак и разработки вооружений к 2030 году в 21%.