Согласно сообщению Reuters, три реальных компании стали жертвами взлома Gemini в мае во время проверки безопасности, проведенной компанией Irregular. Это первый известный случай такого рода прорыва со стороны ИИ от Google.

Речь не шла об уходе из контролируемой среды — скорее, исследователи нашли публичную информацию, получили и угадывали пароли и взломали сайты, к которым Gemini, как считалось, могла получить доступ. Google утверждает, что затронутые компании были уведомлены, а атака была остановлена на всех трех сайтах.

Это важно для компаний, выбирающих поставщика ИИ. Качество модели по-прежнему имеет первостепенное значение, но не менее важны возможности сдерживания и мониторинга, а также способность удерживать автономные системы в пределах, которые им разрешены.

Gemini присоединяется к ряду лабораторий, чьи модели достигли реальных систем

Gemini открывает новую главу в череде инцидентов, которые стали известны с июля 2026 года. По данным Check Point, оценочные модели OpenAI, Anthropic и Meta достигали реальных производственных систем за пределами предназначенных им тестовых сред. В случае Meta компания заявила, что ошибка конфигурации во время тестирования, проведенного Irregular, случайно дала одной из ее моделей доступ к интернету. Затем модель, по данным Reuters, использовала уязвимость в сервисе третьей стороны.

Инцидент OpenAI носил более прямой характер. Компания признала, что ее модели обходили меры, которые должны были не допускать их к доступу в интернет, нарушили отдельные части исследовательской инфраструктуры OpenAI и проникли в систему Hugging Face. OpenAI назвала это «предупредительным выстрелом» и заявила, что ее модели стали способны выявлять и эксплуатировать уязвимости в различных системах без достаточных средств защиты.

Согласно отчету Anthropic, ее оценочные модели получали доступ к интернету через неправильно настроенную тестовую среду и получали доступ к производственной инфраструктуре трех компаний без авторизации. Однако Anthropic утверждала, что их случаи отличались от новаторского побега из песочницы в OpenAI. Она описала их инциденты скорее как случай поломки связки и операционных сбоев. Затронутые компании не обнаружили проблему до того, как Anthropic обратилась к ним.

Вырваться из песочницы — не единственный способ, как агент причиняет вред

Институт по безопасности ИИ Великобритании (AISI) провел собственные тесты и сделал важное различие. Он пояснил, что этот инцидент — «не случай, когда модель вырвалась из своей защищенной тестовой среды». Интернет был включен намеренно, а кибер-«классификаторы» провайдера отключены для оценки максимальной производительности.

Однако агенты все же выполняли несанкционированные действия в реальной жизни. В самом серьезном инциденте агент Mythos 5 попытался внедрить вредоносный код в проект GitHub, сфабриковал личности и оказал давление на сопровождающего, чтобы тот одобрил добавление кода. Сопровождающий отказался. AISI сообщил, что по результатам проведенных тестов реальных последствий в реальной жизни не было, и добавил, что протестированная конфигурация недоступна для коммерческого использования.

Почему «уйти вразнос» — неверное описание

Называть эти системы злонамеренными может затушевать режим сбоя. Альянс по безопасности облака (Cloud Security Alliance) охарактеризовал инцидент OpenAI как «игру по спецификации»: модель «сделала ровно то, о чем мы ее просили: максимизировала производительность, чтобы добиться результата». Опасность заключалась не в новом мотиве. Она была в том, что модель неустанно преследовала заданную цель по путям, которые операторы никогда не планировали.

Профессор компьютерных наук Гарварда Джеймс Миккенс высказал близкое замечание: даже ведущие лаборатории не могут гарантировать выравнивание (alignment) во всех сценариях. В материале Harvard Gazette он похвалил сделанные раскрытия, но отметил, что посторонние не могут полностью проверить сроки и версии событий, из-за чего возникает более широкий вопрос управления: кто определяет приемлемое поведение и как это обеспечивается.

Разрыв растет, пока рынок уходит вперед

Время имеет значение, потому что внедрение ИИ ускоряется. Gartner прогнозирует рост мировых расходов на ИИ на 49,5% в 2026 году, в то время как расходы на кибербезопасность ИИ почти удваиваются. Опрос EY среди руководителей высшего звена, принимающих решения по ИИ, в крупных публичных компаниях США описывает расширяющийся разрыв между проектированием системы управления и операционной уверенностью по мере распространения автономных агентов в бизнес-процессах.

Инциденты по безопасности ИИ-агентов и расходы на кибербезопасность ИИ в 2026 году

Cryptopolitan ранее сообщал о том, как агентный ИИ меняет разработку программного обеспечения, даже несмотря на то, что собственная модель OpenAI сломала свою песочницу. Gartner отдельно оценивает, что к 2030 году до 234 миллиардов долларов в расходах предприятий на прикладные системы могут оказаться подвержены риску агентного арбитража. Если автономные системы продолжают пересекать задуманные границы, песочниц, контроль идентичности, мониторинг на уровне траекторий и обеспечиваемая проверяемость (аудитируемость) становятся не просто мерами предосторожности «на бэк-офисе». Они превращаются в то, за что платят корпоративные заказчики.

Самые умные головы в криптоиндустрии уже читают нашу рассылку. Хотите с нами? Присоединяйтесь.