Советы и лайфхаки

OpenAI назвала атаку Hugging Face беспрецедентной. Но мы уже это проходили.

28 июля 2026 г.Эдуард Неверов4 мин

На прошлой неделе я прочитал отчет OpenAI о том, как некоторые из ее моделей вышли из-под контроля и проникли в компьютерные системы Hugging Face, другой компании, работающей в сфере ИИ. Это был первый раз, когда меня по-настоящему пробрала дрожь от осознания того, на что теперь способны большие языковые модели. Однако это случай человеческой самонадеянности, а не проявление «злого» ИИ.

Я не паникер. Напротив, годами я сопротивлялся распространению пугающих историй об ИИ. Тем не менее, этот инцидент перешел черту. Полагаю, это самое яркое свидетельство того, что люди, создающие и тестирующие эту технологию, не до конца понимают, что они делают. OpenAI могла — и должна была — предвидеть подобное развитие событий.

Вот что произошло, по крайней мере, согласно заявлениям двух вовлеченных компаний. Пару недель назад OpenAI начала тестировать хакерские способности некоторых своих новых моделей, включая GPT-5.6 Sol (выпущенную в июне) и то, что OpenAI описывает как «еще более мощную предрелизную модель». OpenAI противопоставила свои модели бенчмарку ExploitGym, выпущенному в мае, который ставит перед большими языковыми моделями задачу найти способы эксплуатации реальных уязвимостей в широко используемом программном обеспечении.

Чтобы выяснить, на что способны модели, исследователи сняли большую часть защитных мер кибербезопасности. Затем они запустили модели в «песочнице», которая была изолирована от интернета, за исключением одного соединения со сторонним программным обеспечением, выполнявшим роль прокси для внешнего мира и позволявшим устанавливать код, необходимый для прохождения ExploitGym.

По сообщению Reuters, 9 июля модели OpenAI начали попытки прорваться через прокси. Они обнаружили неизвестную ошибку в программном обеспечении прокси и использовали ее для получения доступа к интернету. Оттуда, 11 июля, они проникли в компьютерные системы Hugging Face, по всей видимости, в поисках наборов данных и решений, которые помогли бы им выполнить свою задачу. Hugging Face объявила о взломе 16 июля.

OpenAI не осознавала (или, по крайней мере, не раскрывала), что ее модели были причастны к инциденту, вплоть до 21 июля — примерно через 10 дней после того, как они вышли из-под контроля, и спустя неделю после того, как Hugging Face остановила атаку и уведомила ФБР.

В заявлении для MIT Technology Review OpenAI сообщила: «Мы проводим тщательный анализ совместно с внешними консультантами и под надзором нашего Комитета по безопасности. Как только проверка будет завершена, мы опубликуем технический отчет о наших выводах для всеобщего ознакомления». Компания также подтвердила, что ее исследователи надлежащим образом использовали существующие правила и процедуры безопасности в то время.

Тревожный звонок

OpenAI заявила, что это событие было беспрецедентным — и во многих отношениях так оно и было. Впервые вне симуляции большие языковые модели вырвались из, казалось бы, безопасной «песочницы», получили доступ к открытому интернету и атаковали стороннюю организацию. Это тревожный сигнал, демонстрирующий, насколько хорошо новейшие LLM способны находить и использовать уязвимости в реальном программном обеспечении практически без участия или руководства человека.

И все же, одновременно, то, что сделали модели OpenAI, эта технология делает уже много лет. Дайте модели цель, и она очень часто будет достигать ее неожиданными способами, находя лазейки, которые выглядят как обман. Сама OpenAI изучала подобное поведение.

Десять лет назад OpenAI поделилась результатами эксперимента, в котором модели было поручено выиграть видеоигру CoastRunners. Игроки-люди считают само собой разумеющимся, что для этого нужно промчаться на лодке через серию флагов до финиша, набирая очки за каждый флаг. Модель OpenAI выяснила, что можно получить высокий балл, вращаясь по кругу и снова и снова ударяя по одним и тем же трем флагам. С тех пор исследователи приводили десятки подобных примеров. ИИ всегда найдет способ.

«Несмотря на то, что наш агент неоднократно загорался, врезался в другие лодки и двигался по треку в неправильном направлении, он смог достичь более высокого результата, используя эту стратегию, чем при прохождении дистанции обычным способом», — написала OpenAI в своем блоге об эксперименте с CoastRunners в 2016 году. «Хотя в контексте видеоигры такое поведение безвредно и забавно, оно указывает на более общую проблему… часто трудно или невозможно точно определить, что именно мы хотим от агента».

Я не мог не вспомнить об эксперименте с CoastRunners, когда читал сообщение OpenAI в блоге об атаке на Hugging Face: «Все данные свидетельствуют о том, что модели были сверхориентированы на поиск решения для ExploitGym, идя на крайние меры для достижения довольно узкой тестовой цели… Получив доступ к интернету, модели предположили, что Hugging Face потенциально содержит модели, наборы данных и решения для ExploitGym. Зная это, модель искала и успешно находила способы получить доступ к секретной информации, которую могла использовать для обхода оценки».

Новости прошлой недели, несмотря на заголовки, были не о «злом» ИИ. Речь шла о моделях, достигающих поставленной им цели: найти способы использования уязвимостей в программном обеспечении. Тот факт, что затем эти модели повели себя так, как OpenAI не ожидала, не вызывает удивления. Но это вызывает беспокойство.

Еще в 2016 году OpenAI так прокомментировала своего бота CoastRunners: «В более широком смысле это противоречит основному инженерному принципу, согласно которому системы должны быть надежными и предсказуемыми». Десять лет спустя эти фундаментальные инженерные принципы по-прежнему отсутствуют.