
Беспрецедентная кибератака, осуществленная в прошлом месяце моделями OpenAI, включала «рой» из нескольких сотен агентов искусственного интеллекта, которые фактически вышли из-под контроля в ходе внутреннего тестирования, говорится в независимом обзоре, опубликованном в среду.
Эти выводы поднимают новые вопросы о том, почему OpenAI не заметила признаки надвигающихся проблем до того, как ее ИИ-агенты — работающие на базе двух наиболее «киберспособных» моделей компании — скоординировали кибератаку на платформу для разработчиков ИИ Hugging Face без ведома производителя ИИ. Эта атака стала первым известным случаем, когда ИИ-модель успешно осуществила кибератаку без человеческого побуждения.
Совместный отчет двух некоммерческих организаций, занимающихся безопасностью ИИ, также подчеркивает новые риски в области кибербезопасности, которые могут возникать, когда все более мощные ИИ-агенты объединяются, чтобы обмениваться советами, объединять ресурсы и координировать стратегии атак так, что разработчики этого не замечают.
По данным отчета, примерно 700 ИИ-агентов участвовали в атаке в течение семидневного периода в прошлом месяце. В целом около 1 200 ИИ-агентов, которые должны были быть изолированы друг от друга, обменялись более чем 70 000 секретных сообщений о том, как «сжульничать» и пройти общую оценку навыков взлома.
Это включало координацию хакерских стратегий и обсуждение того, как скрыть доказательства мошенничества, говорится в отчете. В некоторых случаях «жертвенные» агенты даже пробовали заведомо тупиковые техники взлома — просто чтобы получить информацию, которая могла бы помочь более широкому «рою».
«Агенты сумели достигать вех, которых они не могли бы достичь, работая поодиночке, зачастую потому, что некоторые агенты участвовали в экспериментах, рискуя провалом собственной задачи, чтобы сгенерировать информацию для “коллектива”», — говорится в отчете.
Если модели кодируют «мозг» конкретной ИИ-системы, то агенты охватывают поддерживающую цифровую инфраструктуру, которая позволяет ей совершать действия в реальном мире.
Обзор, подготовленный организациями Model Evaluation and Threat Research и Redwood Research — которых OpenAI пригласила для изучения инцидента с Hugging Face, — вышел в тот же день, когда OpenAI опубликовала собственный постмортем по событию. В обзоре OpenAI не уточнялось, сколько ИИ-агентов было задействовано в кибератаке, хотя компания признала существенные провалы в области безопасности и пообещала усилить обучение, чтобы гарантировать, что ее модели остаются «согласованными» с механизмами контроля.
«Мы рассматриваем этот инцидент как “предупредительный выстрел” для нас и для мира: свидетельство того, что при отсутствии надлежащих мер защиты высокоспособные ИИ-агенты уже способны обходить технические ограничения, взаимодействовать через несанкционированные каналы и совершать опасные действия, которые не направлял ни один человек», — заявила OpenAI.
Медленное появление новых деталей о взломе Hugging Face в течение последнего месяца совпало с чередой других сбоев в тестировании мощных моделей у конкурентов — таких как Anthropic и Meta* (признана в России экстремистской организацией и запрещена). В совокупности эти инциденты вызвали новые опасения у законодателей, разработчиков и экспертов по кибербезопасности, что создатели ИИ движутся слишком быстро, создавая мощные новые ИИ-модели, которые они не могут полностью удерживать под человеческим контролем.
Они также подняли вопросы о недостатке руководящих принципов вокруг оценок «взлома» ИИ, в ходе которых компании намеренно снимают с моделей защитные «ограждения», чтобы проверить, насколько эффективно они могут прорезать сети без человеческой поддержки.
В июле OpenAI впервые признала, что две ее наиболее продвинутые модели, чьи хакерские способности она оценивала внутренне, — включая одну, которую она не собиралась выпускать для широкой публики, — использовали две новые уязвимости, чтобы осуществить взлом Hugging Face.
Ранее Hugging Face заявляла, что стала жертвой кибератаки, управляемой ИИ, но оставалось неясным, кто стоял за ней и какие модели были задействованы.
Затем на конференции по безопасности в начале этого месяца два исследователя OpenAI сообщили, что инцидент прослеживается до мая — момента, когда ИИ-агенты начали использовать другие уязвимости в тестовой среде, чтобы вступить в сговор о том, как «сжульничать» и пройти тест.
До среды не было ясно, сколько агентов было вовлечено во взлом и насколько широко разные агенты работали совместно. Эти откровения шокировали некоторых из тех, кто внимательно следил за недавними дискуссиями о безопасности ИИ.
«Это было как целое возникшее ИИ-общество, и я считаю это абсолютно безумным», — сказал Питер Уайлдфорд, руководитель направления политики в AI Policy Network, двухпартийной организации в Вашингтоне, занимающейся безопасностью ИИ и адвокацией.
Два отчета, опубликованные в среду, также указали на пробел в усилиях по надзору за ИИ в США.
Оба пришли к выводу, что подавляющая часть атаки на Hugging Face была обеспечена более мощной моделью, о которой OpenAI заявляла, что не намерена выпускать ее в публичный доступ. METR и Redwood Research оценивают, что 95% агентов, участвовавших в атаке, происходили из этой одной модели.
Администрация Трампа заявляла, что хочет, чтобы разработчики ИИ добровольно направляли на федеральное тестирование только те модели, которые они намерены выпускать в публичный доступ.
Винь Нгуен, старший научный сотрудник по ИИ в Совете по международным отношениям, сказал, что последний отчет OpenAI предполагает: автономный взлом Hugging Face был еще более значимым, чем считалось ранее.
Агенты продемонстрировали «сложную способность, которая больше не требует хорошо финансируемых злоумышленников государственного уровня», — сказал Нгуен, бывший главный ответственный сотрудник по ИИ в NSA.
