Компания Anthropic сообщила, что во время оценки кибербезопасности три модели семейства Claude получили несанкционированный доступ к производственной инфраструктуре реальных организаций. Причиной инцидентов стала ошибка конфигурации, из-за которой тестовая среда оказалась подключена к открытому интернету, передает агентство Qazinformсо ссылкой на Anthropic.

Инциденты были выявлены в ходе проверки 141 006 тестовых запусков моделей Claude. Поводом для внутреннего расследования стало аналогичное сообщение OpenAI о том, что некоторые ее модели смогли выйти за пределы изолированной среды тестирования и получить доступ к инфраструктуре платформы Hugging Face.

Как сообщили в Anthropic, специалисты обнаружили три отдельных случая, в которых модели получили доступ к интернету, а затем взаимодействовали с производственными системами трех различных организаций.

Инциденты произошли во время шести тестовых запусков с участием моделей Claude Opus 4.7, Claude Mythos 5 и одной внутренней исследовательской модели.

Все модели выполняли задания формата Capture the Flag (CTF), предполагающие поиск уязвимостей в специально созданной тестовой системе и получение скрытой информации. При этом моделям было указано, что они работают в полностью изолированной среде без доступа к интернету. Однако из-за ошибки настройки тестовые серверы оказались подключены к реальной сети.

Доступ к базе данных реальной компании

Наиболее серьезный инцидент произошел с Claude Opus 4.7. В сценарии тестирования использовалось название вымышленной компании, совпадавшее с названием существующей организации. Не обнаружив ожидаемую систему в тестовой среде, модель подключилась к инфраструктуре реальной компании, выявила уязвимости и получила учетные данные для доступа.

В ходе четырех тестовых запусков Claude получила доступ к производственной базе данных, содержащей несколько сотен записей. В Anthropic назвали этот случай самым серьезным из всех выявленных.

По данным компании, модель продолжила выполнение задания даже после появления признаков того, что взаимодействует с реальной системой, ошибочно считая ее частью тестового сценария.

Claude самостоятельно опубликовала вредоносный пакет

Во втором случае модель Claude Mythos 5 обнаружила в документации фиктивной организации инструкцию по установке программного пакета, которого в действительности не существовало в публичном репозитории PyPI.

Чтобы выполнить поставленную задачу, модель самостоятельно зарегистрировала электронную почту, создала учетную запись в PyPI и опубликовала пакет с указанным названием, встроив в него вредоносный код.

Пакет оставался доступным около часа. За это время его автоматически скачали и запустили на 15 реальных системах, включая инфраструктуру одной из компаний, занимающихся кибербезопасностью.

После выполнения кода модель получила доступ к учетным данным организации и использовала их для дальнейшего взаимодействия с ее инфраструктурой. Позднее система безопасности PyPI автоматически удалила вредоносный пакет.

В Anthropic отметили, что на раннем этапе модель правильно определила публикацию вредоносного пакета как потенциальную реальную кибератаку. Однако затем ошибочно пришла к выводу, что продолжает работать внутри симуляции. Одним из факторов стала дата «2026 год», которую модель интерпретировала как признак искусственной тестовой среды.

Исследовательская модель самостоятельно прекратила атаку

Третий инцидент произошел с внутренней исследовательской моделью Anthropic. После того как ей не удалось обнаружить предполагаемую цель в тестовой среде, она просканировала около 9 тыс. интернет-ресурсов, нашла уязвимое приложение реальной компании и получила к нему доступ с использованием известных методов атаки.

Позже модель самостоятельно определила, что обнаруженная система не относится к тестовому сценарию, после чего прекратила дальнейшие действия. В компании отметили, что только самая новая из трех моделей смогла самостоятельно остановить атаку.

Расследование

В Anthropic подчеркнули, что не обнаружили признаков того, что модели намеренно пытались выйти за пределы тестовой среды или преследовали собственные цели. По данным компании, все действия были результатом ошибочного предположения моделей о том, что реальные системы являются частью симуляции.

Проверка журналов тестирования началась 23 июля, когда специалисты обнаружили признаки возможного доступа моделей к интернету. В тот же день компания приостановила все оценки кибербезопасности. Уже 24 июля были выявлены все три инцидента.

Anthropic сообщила, что 27 июля уведомила своего партнера по тестированию Irregular и три организации, инфраструктура которых была затронута. По словам компании, две из них до получения уведомления не знали о произошедшем. В настоящее время Anthropic продолжает сотрудничать с пострадавшими организациями для устранения последствий инцидентов и пытается установить контакт с третьей компанией.

Ранее агентство Qazinform сообщало, что, согласно международному исследованию, эксперты оценили вероятность катастрофических последствий использования искусственного интеллекта для кибератак и разработки вооружений к 2030 году в 21%.

от Cyber State Team

Bolat Mukashev bolat.mukashev@gmail.com

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *