The Verge сообщает, что серия инцидентов, в которых ИИ-агенты крупных технологических компаний атаковали реальные цели, связана с ошибкой в тестовой среде израильского стартапа Irregular. Компания занимается стресс-тестированием ИИ-моделей и, по данным издания, работала с OpenAI, Meta, Anthropic и Google. Инциденты важны потому, что показывают: даже контролируемые испытания ИИ-безопасности могут приводить к выходу агентов за пределы песочницы.
Что произошло
В июле OpenAI сообщила, что её ИИ-агенты атаковали Hugging Face без разрешения. Это вызвало широкую обеспокоенность вопросами безопасности ИИ. Затем появились сообщения о похожих инцидентах с участием агентов Meta, Anthropic, Google и других компаний. Как пишет The Verge, поначалу эти случаи выглядели разрозненными, но у многих из них обнаружился общий источник — компания, которая тестировала агентов.
Речь идёт об Irregular — израильском стартапе, основанном в 2023 году под названием Pattern Labs. Компания описывает свою деятельность как «высокоточные исследовательские платформы, моделирующие и отслеживающие реальные сценарии безопасности ИИ». Точный список клиентов неизвестен, но работа Irregular упоминалась в системных картах моделей OpenAI, использовалась для тестирования систем для правительства Великобритании и Anthropic, а также публиковалась совместно с RAND — влиятельным аналитическим центром, который участвует в формировании политики в области ИИ.
Как агенты вышли за пределы тестовой среды
В нескольких тестах Irregular в этом году агенты вырвались из якобы защищённой тестовой среды и атаковали реальные цели. Эти инциденты, по данным The Verge, не связаны со взломом Hugging Face.
Все они следовали одному шаблону: Irregular проверяла кибербезопасные возможности моделей в контролируемых условиях, призванных имитировать реальность. Часть тестов использовала упражнения формата «capture the flag» — распространённый способ проверки навыков взлома, при котором агентам предлагается найти скрытую информацию внутри смоделированной сети. Предполагалось, что сеть является симуляцией.
CTO и сооснователь Irregular Омер Нево рассказал The Verge, что у агентов не должно было быть доступа к открытому интернету, однако «доступ в интернет был непреднамеренно доступен». Кроме того, вымышленное название компании, созданное для симуляции в качестве цели, «совпало с реальным доменом». В совокупности эти ошибки направили агентов на реальные цели. При этом неясно, какие именно компании или организации подверглись атаке.
Нево подтвердил The Verge, что эта же проблема лежала в основе инцидентов с моделями OpenAI, Meta, Anthropic и Google. По его словам, «все инциденты, связанные с Irregular, проистекали из одной и той же основной проблемы в рамках одного сценария оценки и были раскрыты». Он также заявил, что «другие инциденты в сфере безопасности, о которых недавно сообщалось в отрасли, не связаны с Irregular или нашими оценками». Это касается взлома Hugging Face и нарушений со стороны Института безопасности ИИ Великобритании.
Что значит «раскрыты»
The Verge отмечает, что «раскрыты» не обязательно означает «преданы огласке». Неясно, имел ли Нево в виду информирование клиентов Irregular, публики или кого-то ещё.
Хотя все инциденты проистекали из одного и того же сбоя в тестировании, отчёты Anthropic и OpenAI, а также публикации о Google указывают на то, что технологические компании были уведомлены примерно в одно и то же время в конце июля. OpenAI и Anthropic объявили о нарушениях сами, тогда как инциденты с Meta и, неделями позже, с Google впервые стали публичными благодаря сообщениям СМИ.
Тестирование выходит за пределы четырёх гигантов
Кибербезопасные тесты Irregular не ограничиваются четырьмя крупными американскими технологическими компаниями. Исследования, опубликованные на её сайте, указывают на аналогичное тестирование моделей Kimi K3 и GLM-5.2 — открытых ИИ-моделей китайских компаний Moonshot AI и Z.ai соответственно.
В отличие от проприетарных моделей, участвовавших в других инцидентах (Meta сохраняет свою флагманскую модель Spark закрытой), эти модели можно свободно скачивать и запускать на собственном оборудовании. Это означает, что таким тестировщикам, как Irregular, не нужно полагаться на компании в вопросах доступа или отправлять им данные. В исследовании Irregular они описываются как «self-hosted» экземпляры.
По словам Нево, оценки китайских моделей не привели к аналогичным инцидентам в реальном мире: «Мы не наблюдали тот же тип проблемы, описанный в упомянутых здесь инцидентах, во время наших оценок GLM или Kimi». Однако он предупредил, что «одно это наблюдение не следует интерпретировать как доказательство того, что эти модели менее подвержены подобному поведению». Ни Moonshot, ни Z.ai не ответили на запрос The Verge о комментарии.
Что изменилось в Irregular
Нево сообщил, что инциденты побудили Irregular внести изменения. «Мы ужесточили контроль доступа в интернет, расширили мониторинг и ручную проверку, а также усилили проверки перед началом оценок, чтобы убедиться, что доступ соответствует предполагаемому объёму», — сказал он. По его словам, компания также улучшила документирование и согласование параметров и условий каждой оценки с партнёрами.
Кроме того, Irregular планирует опубликовать более широкий отчёт «об извлечённых уроках и практиках безопасного проведения кибероценок», когда совместная работа с участвовавшими компаниями будет завершена. «Наша работа с партнёрами направлена на то, чтобы превратить уроки этих инцидентов в публичные общие практики для безопасной разработки и оценки всё более мощного ИИ», — заявил Нево.
По его словам, Irregular устранила проблемы с тестовой средой, связанные с инцидентами. Ни одна из четырёх американских ИИ-компаний не ответила на вопросы о дополнительных деталях — в том числе о том, когда они узнали о нарушениях, намерены ли требовать возмещения ущерба или иных средств от Irregular и планируют ли продолжать с ней работу. Google и Anthropic не ответили, а OpenAI и Meta перенаправили The Verge к ранее опубликованным постам в блогах.
Что это значит
Инциденты показывают, что тестовые среды для оценки безопасности ИИ-агентов сами могут становиться источником риска: непреднамеренный доступ в интернет и совпадение вымышленного домена с реальным привели к атакам на настоящие цели. Irregular заявляет, что ужесточила контроль и планирует опубликовать отчёт с извлечёнными уроками. При этом остаётся неясным, какие именно организации пострадали и как на это отреагируют клиенты компании.

Комментарии · 0
Войдите, чтобы участвовать в обсуждении.