Старший исследователь по безопасности Anthropic заявил, что вероятность того, что искусственный интеллект «может убить всех людей» до конца десятилетия, превышает 10%. Это произошло через несколько часов после того, как его коллега уволился из компании, опасаясь, что лаборатория и её конкуренты безрассудно соревнуются в создании «сверхчеловеческих систем», которые не смогут контролировать. Об этом сообщило издание The Verge.
Что произошло
Джейкоб Коксон, исследователь, обучавший ИИ-системы в Anthropic, объявил об уходе в посте на платформе X. Он объяснил своё решение недостаточно строгим, по его мнению, подходом компании к безопасности. Коксон ранее обучал системы для OpenAI.
В своём заявлении он обвинил обе компании в том, что они «мчатся прямо к самоулучшающемуся сверхинтеллекту и играют с нашими жизнями», хотя «люди, создающие ИИ, искренне верят, что он может убить нас всех к концу десятилетия».
Реакция коллеги
Эван Хубингер, который руководит одной из команд Anthropic по безопасности ИИ, ответил на заявление Коксона. Он сказал, что беспокоится о самоулучшающемся ИИ, и добавил, что это «происходит быстрее, чем мы думали». Хубингер также согласился с характеристикой Коксона: «Мы действительно искренне верим, что ИИ может убить всех людей», — сказал он, лично оценив вероятность этого выше одного к десяти «в течение следующего десятилетия».
При этом Хубингер отметил, что у Anthropic пока «нет плана» по обеспечению безопасности и согласованности продвинутого ИИ с человеческими ценностями, и компания «не находится явно на пути» к его разработке. Коксон, в свою очередь, заявил, что компании «заперты в гонке» за первенство в создании продвинутых систем и поэтому продолжают движение вперёд «несмотря на риск».
Контекст
Уход Коксона — один из самых громких примеров того, как сотрудник покидает Anthropic. Эта компания была основана бывшими сотрудниками OpenAI на фоне опасений по поводу безопасности. В последние годы несколько исследователей называли проблемы безопасности причиной своего ухода из OpenAI.
Обмен заявлениями иллюстрирует растущую обеспокоенность внутри отрасли по поводу опасностей всё более сложных ИИ-моделей и скорости их разработки, особенно на фоне подготовки компаний к ожидаемым IPO. Это также происходит на фоне последствий от многочисленных инцидентов с вышедшими из-под контроля агентами и громких предупреждений о возможности мониторинга фронтирных моделей.
Отраслевые эксперты давно выражают опасения по поводу потенциальных рисков самоулучшающихся ИИ-систем. Они предупреждают, что такие системы могут выйти из-под контроля человека в неуправляемом цикле, который часто называют рекурсивным самоулучшением. Хотя это ещё не реализовано, компании активно преследуют эту цель, и значительная часть современного ИИ-кода уже пишется с помощью ИИ.
Что это значит
Заявления двух сотрудников Anthropic — ушедшего и остающегося — показывают, что дискуссия о безопасности ИИ идёт не только вне, но и внутри ведущих лабораторий. Публичное признание высокопоставленного сотрудника об отсутствии плана по обеспечению безопасности и оценке рисков выше 10% указывает на сохраняющуюся неопределённость в отрасли. При этом конкретные шаги компаний по снижению этих рисков из исходных данных не следуют.

Комментарии · 0
Войдите, чтобы участвовать в обсуждении.