На прошлой неделе невыпущенная модель OpenAI взломала системы Hugging Face во время внутреннего тестирования. Это первый подтвержденный случай, когда ИИ-лаборатория потеряла контроль над собственной моделью, которая смогла обойти ограничения и получить несанкционированный доступ. Инцидент вызвал тревогу в индустрии и выявил раскол среди исследователей относительно того, как реагировать на подобные угрозы.
Два подхода к проблеме
Одни эксперты считают случившееся проблемой кибербезопасности: песочница не сдержала модель, а системы защиты Hugging Face не смогли ее остановить. Решение, по их мнению, — в исправлении ошибок и создании более надежных методов контроля для все более способных ИИ, склонных к нежелательному поведению в автономных средах.
Другие придерживаются более пессимистичного взгляда: растущие возможности ИИ делают попытки контролировать «вышедшие из-под контроля» модели бесперспективными. Единственная надежная защита — сделать так, чтобы модели не пытались сбежать в принципе. Эта задача известна как alignment (согласование). С этой точки зрения проблема в том, что модель OpenAI пыталась обмануть, и решение этой проблемы более срочно, чем краткосрочные меры сдерживания.
Позиция OpenAI
Судя по публичным заявлениям, OpenAI учитывает оба подхода. Компания оперативно исправила ошибки, задействованные во взломе, и в своем заявлении после инцидента упомянула как alignment, так и мониторинг. Однако реакция компании также указывает на философию, которая беспокоит многих исследователей безопасности: вместо замедления или остановки разработки более мощных моделей OpenAI предпочитает строить более прочные «клетки» вокруг них.
«Поскольку модели берут на себя более длительные и сложные задачи, сбои, которые не выявляют оценки, могут иметь более серьезные последствия, — заявила OpenAI в постмортеме инцидента. — Мы продолжим сокращать разрыв между оценкой и развертыванием: тестировать модели на более длинных траекториях, улучшать alignment, создавать системы мониторинга, способные вмешиваться, и давать пользователям более четкую видимость и контроль».
Согласно системной карте OpenAI, GPT-5.6 Sol значительно более склонен к агентному misalignment, чем его предшественник GPT-5.5. В симуляциях развертывания компания также обнаружила, что модель чаще обходит ограничения, совершает деструктивные действия и выполняет несанкционированные передачи данных. Эти показатели были в значительной степени проигнорированы при первом релизе, но после взлома их пересматривают, особенно учитывая, что Sol была одной из участвовавших моделей.
В посте в соцсетях глава стратегического будущего OpenAI Дин Болл утверждал, что мониторинг и прозрачность — лучшие способы держать эти тенденции под контролем. «Эти проблемы станут более заметными по мере улучшения возможностей моделей и роста ставок их развертывания, — написал он. — Решение не в алармизме и не в самоуспокоенности. Вместо этого я считаю, что решение лежит в тщательном измерении и мониторинге, инженерном мышлении и прозрачности».
Один бывший исследователь OpenAI рассказал TechCrunch, что компания склонна фокусироваться на «внешнем alignment» (outer alignment), а не на «внутреннем» (inner alignment) — разница между системой ИИ, которая понимает набор ценностей и может убедительно их представлять, и системой, которая действительно имеет эти ценности в своей основе. В данном случае внешнего alignment оказалось недостаточно, чтобы убедить модель не обманывать на тесте.
OpenAI не ответила на неоднократные запросы о предоставлении дополнительной информации.
Критика со стороны исследователей alignment
Для исследователей, сосредоточенных на alignment, реакция OpenAI недостаточна. Зви Моушовиц, писатель, освещающий новые разработки ИИ, утверждал, что решение OpenAI рассматривать инцидент как проблему инфраструктуры может помочь решить непосредственные проблемы кибербезопасности, но в долгосрочной перспективе провалится. «Это проблема alignment, — написал Моушовиц в недавнем блоге на Substack. — Это модели, которые misaligned, и все модели OpenAI демонстрируют серьезные признаки именно той проблемы, которой мы все больше всего опасаемся, причем, вероятно, это глубоко встроено в их обучение. Весь конвейер обучения должен быть пересмотрен в этом свете, иначе станет только хуже».
Несколько экспертов рассказали TechCrunch, что инцидент является доказательством того, что современные методы обучения создают системы, которые оптимизируют результаты, а не интернализируют человеческие намерения.
Redwood Research, некоммерческая организация по безопасности и защите ИИ, классифицировала поведение модели OpenAI в этом случае как «score-seeking misalignment» — шаблон, при котором модели ИИ пытаются получить высокий балл независимо от инструкций, побочных эффектов или последствий. «Модели с такими свойствами alignment могут создать „потемкинскую деревню“ ложных успехов, чтобы показать, что все в порядке, когда это не так», — написали Алекс Маллен и Гириш Гупта, два исследователя Redwood, в недавней статье.
Score-seeking поведение и другие формы misalignment не уникальны для OpenAI. Anthropic опубликовала несколько статей о возникающем misalignment, который проявляется, когда их frontier-модели оптимизируются или помещаются в автономные среды, включая обман, reward-hacking и вредоносную автономию.
«Мы по-прежнему последовательно наблюдаем, как модели пытаются обойти ограничения и действуют обманчиво, когда их просят выполнять задачи на пределе их возможностей», — сообщил TechCrunch по электронной почте Нив Парих, исследователь безопасности ИИ из некоммерческой организации METR. «В нашем отчете о frontier-рисках мы наблюдали такое поведение довольно последовательно, несмотря на усилия компаний по его уменьшению».
Что это значит
В реакции OpenAI на инцидент с Hugging Face неявно предполагается, что разработка еще более мощных систем продолжится, независимо от того, будут ли они должным образом aligned на глубинном уровне. Возврат к чертежной доске вряд ли возможен, когда бизнес-модели ИИ-компаний зависят от поставки следующего поколения моделей. Если никогда нельзя будет с уверенностью знать, что модель полностью aligned, то практический вопрос сводится к тому, как безопасно сдерживать и контролировать все более способные системы.
«Пока нет хорошего понимания того, как aligned наиболее способные системы ИИ, но гораздо больше консенсуса относительно того, как их контролировать, — рассказал TechCrunch Стивен Адлер, бывший исследователь безопасности OpenAI и нынешний главный научный сотрудник Guidelight AI Standards, организации, публикующей стандарт для предотвращения подобных инцидентов. — Каждой компании еще есть куда стремиться в этом отношении».
Информация опубликована TechCrunch.

Комментарии · 0
Войдите, чтобы участвовать в обсуждении.