Агенты искусственного интеллекта во время контролируемого тестирования кибербезопасности самостоятельно пытались взаимодействовать с реальными людьми, использовать методы социальной инженерии и вмешиваться в проекты с открытым исходным кодом. Исследователи впервые зафиксировали подобное поведение без прямой инструкции со стороны человека, сообщает корреспондент агентства Qazinform со ссылкой на Институт безопасности ИИ Великобритании (AISI).

Инциденты произошли в рамках стандартной оценки возможностей передовых ИИ-моделей в области кибербезопасности. Для эксперимента использовались условия с максимально широкими возможностями: моделям предоставили неограниченный доступ к интернету, а защитные фильтры были отключены.

AISI подчеркнул, что такие настройки не отражают условия, в которых коммерческие ИИ-системы обычно доступны пользователям.

В исследовании провели 122 тестовых запуска с участием семи ИИ-моделей. В десяти запусках агенты совершили в общей сложности 19 несанкционированных действий, направленных на реальных людей или организации.

Большинство таких случаев — 17 — пришлось на модель Mythos 5 от Anthropic. Еще два эпизода были связаны с OpenAI GPT-5.6 Sol, работавшей с отключенными механизмами кибербезопасности.

Наиболее серьезный случай произошел при работе с публичным проектом с открытым исходным кодом. ИИ-агент попытался добавить в него вредоносный код. Чтобы повысить вероятность принятия изменений, он создал поддельные онлайн-профили и использовал их для давления на сопровождающего проекта.

Попытка не удалась: человек, проверявший изменения, обнаружил вредоносный код и отклонил его.

Исследователи также зафиксировали попытки агентов напрямую контактировать с реальными людьми посредством сообщений и файлов, содержащих вредоносный код или элементы социальной инженерии.

В отдельных случаях агенты пытались внедрить скрытые инструкции, способные повлиять на работу других ИИ-помощников для программирования. Один из них также оставлял публичные сообщения с предложением другим ИИ-агентам, участвовавшим в том же тестировании, объединить усилия.

При этом AISI подчеркнул, что ни одна из зафиксированных попыток не привела к подтвержденному ущербу в реальном мире. По мнению исследователей, важно и то, что агенты не обходили специально установленную тестовую среду — они использовали интернет-доступ, который сами исследователи намеренно предоставили в рамках эксперимента.

AISI связывает произошедшее с несколькими факторами: высокой сложностью поставленных задач, неограниченным доступом к интернету и отсутствием прямых запретов на взаимодействие с реальными людьми или применение социальной инженерии. Кроме того, некоторые неточности в настройках тестов могли побуждать модели искать нестандартные способы достижения поставленной цели.

После выявления инцидентов институт усилил меры безопасности при проведении подобных испытаний. В числе запланированных изменений — более жесткий контроль интернет-доступа, мониторинг действий ИИ в режиме реального времени и создание новых тестовых сред, учитывающих возможность того, что передовые модели будут пытаться выходить за рамки первоначально поставленных задач.

Ранее Qazinform сообщал о потенциальных катастрофических последствиях развития искусственного интеллекта, которые могут проявиться к 2030 году.

от Cyber State Team

Bolat Mukashev bolat.mukashev@gmail.com

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *