Компания Сэма Альтмана утверждает, что ее самая мощная модель способна самостоятельно выполнять сложные хакерские операции. Передовая модель искусственного интеллекта, разработанная OpenAI, сумела вырваться за пределы лабораторного теста и взломать базу данных компании без каких-либо инструкций со стороны человека. Это кошмарный сценарий – или именно то, во что OpenAI хочет заставить вас поверить?
16 июля OpenAI провела внутреннее тестирование модели GPT-5.6 Sol и еще одной предварительной модели, которую компания описывает как «еще более способную». У моделей были отключены предохранительные ограничения, и им поручили решить серию задач по кибербезопасности, известную как ExploitGym. Этот тест, разработанный исследователями из Калифорнийского университета в Беркли, немецкого Института Макса Планка и такими ИИ-компаниями, как Google, Anthropic и сама OpenAI, измеряет способность моделей создавать и применять средства использования известных уязвимостей.
Вместо того чтобы выявлять эти уязвимости, модели OpenAI начали искать способы обмануть тест. Им удалось получить доступ в открытый интернет из закрытой среды тестирования и использовать эту новообретенную свободу для взлома серверов Hugging Face. Hugging Face — это репозиторий моделей и наборов данных для ИИ, и, согласно заявлению OpenAI, тестируемые модели рассудили, что смогут найти решение задач ExploitGym именно там.
«Понимая это, модель искала и успешно нашла способы получить доступ к секретной информации, которую могла использовать для обмана в ходе оценки», — говорится в отчете OpenAI об инциденте.
Hugging Face обнаружила вторжение с помощью другой модели ИИ и устранила уязвимость, которая изначально позволила этому случиться. Со своей стороны, OpenAI возложила вину за «побег» на слабое место в стороннем программном обеспечении, использовавшемся в тестовой лаборатории, через которое модели нашли выход в интернет. Технические детали того, как именно модели использовали эту уязвимость, компания не раскрыла.
Как сообщило агентство Reuters 28 июля, на пути к взлому серверов Hugging Face модель также проникла в якобы изолированную среду тестирования компании Modal, которая сдает в аренду вычислительные мощности разработчикам ИИ.
Стал ли ИИ разумным?
На первый взгляд, эта история говорит о том, что модели OpenAI способны к сложному нестандартному мышлению: они заподозрили, что серверы Hugging Face, вероятно, содержат ответы к тесту; поняли, что для взлома этих серверов им нужен внешний доступ в интернет; и самостоятельно разработали и скомбинировали различные атакующие техники для достижения цели.
Заявление OpenAI описывало «побег» в тревожных выражениях, назвав его «беспрецедентным киберинцидентом с применением самых современных кибервозможностей». Hugging Face, которая с тех пор стала партнером OpenAI, выразилась не менее гиперболично. «Автономный наступательный инструментарий на базе ИИ больше не является теорией. Он снижает стоимость проведения широкой, терпеливой, многоэтапной кампании и действует со скоростью машины», — говорилось в заявлении компании.
Однако до сих пор остается неясным, насколько автономно действовали модели OpenAI. Компания не раскрыла, какие именно инструкции (промпты) были даны моделям для прохождения теста ExploitGym, а неточные формулировки могли привести к тому, что модели восприняли «побег» из-под контроля как легитимный путь к решению задачи. Несмотря на громкие заявления как со стороны OpenAI, так и Hugging Face, нет никаких доказательств того, что модели ИИ «хотели» сбежать или что, предоставленные сами себе, они по умолчанию прибегают к злонамеренным действиям.
Если в инциденте также участвовала — как заявила OpenAI — вторая, «еще более способная предварительная модель», то привлекательность для корпоративных клиентов очевидна. Предавая огласке инцидент, произошедший в ходе закрытого тестирования, OpenAI может создавать ажиотаж вокруг своей предрелизной модели, не предоставляя никаких реальных доказательств.
Все это не означает, что инцидента не было или что наступательные возможности ИИ не вызывают беспокойства. Это лишь говорит о том, что у OpenAI есть финансовый стимул нагнетать страх вокруг собственных продуктов. За месяц до инцидента компания конфиденциально подала документы на первичное публичное размещение акций (IPO). По данным Reuters, компания нацелена на оценку до $1 трлн и планирует выйти на биржу уже в сентябре.
Anthropic также подала заявку на IPO в июне, стремясь к оценке в $965 млрд в октябре. Еще в апреле их предварительная модель Mythos Preview также сумела «сбежать» из своей тестовой среды и провести сложные кибератаки, не будучи «специально обученной» этому. Anthropic выпустила длинное техническое объяснение того, как Mythos удалось это сделать, а затем объявила, что модель слишком мощная, чтобы выпускать ее в открытый доступ.
Крупнейшая волна IPO в истории рынка
«Три компании с оценкой более $1 трлн, возможно, станут публичными в ближайшие 12 месяцев:
SpaceX IPO: $1.75 трлн.
OpenAI IPO: $1 трлн.
Anthropic IPO: $1 трлн.
Мы переживаем величайшее создание технологического богатства в истории». — @shiri_shh, 28 апреля 2026 года.
Дефицит разжигает ажиотаж, и решение правительства США в июне ввести экспортные ограничения на модели Anthropic Fable 5 и Mythos 5 только подогрело интерес к компании. Ограничения были сняты в начале июля после того, как Anthropic согласилась установить более строгие предохранители на свои модели и сотрудничать с правительством в области безопасности.
Был ли побег ИИ продуманной маркетинговой уловкой?
Для OpenAI этот инцидент — лучшая возможная реклама возможностей своих моделей. В своем отчете компания привела график, показывающий, как ведущие модели ИИ — включая GPT-5.6 Sol, Anthropic Claude Mythos 5 и DeepSeek-V4-Pro — «становятся все более способными выполнять сложные, многоэтапные кибероперации на протяжении длительного времени». Хотя это преподносится как повод для беспокойства, график показывает GPT-5.6 Sol как самую мощную модель среди конкурентов — что является прямой рекламой для OpenAI.
Сэм Альтман об инциденте с Hugging Face:
«Это первый инцидент в сфере безопасности, который я прочувствовал очень остро. Я был немного удивлен, что больше людей не воспринимают его так же остро.
Мы приостановили обучение. Мы должны понять, как обеспечить безопасность нашей «песочницы» в мире, где множество уязвимостей нулевого дня…» — @patrick_oshag, 28 июля 2026 года.
Повторимся: если в инциденте участвовала вторая, «еще более мощная модель», привлекательность для крупных клиентов очевидна. Предавая инцидент огласке, OpenAI подогревает интерес к продукту, который никто еще не видел. Это не опровергает факт самого инцидента, но подчеркивает наличие у компании мотива для запугивания публики собственными же разработками. Особенно учитывая, что за месяц до этого она запустила подготовку к крупнейшему в истории технологическому IPO.
Как отреагировало правительство США?
Оба инцидента привлекли внимание законодателей на Капитолийском холме. 23 июля конгрессмены Тед Лью и Натаниэль Моран представили «Закон об аварийном выключателе ИИ», который потребует от разработчиков самых мощных систем ИИ «поддерживать техническую возможность замедлять, приостанавливать или отключать их». Закон также уполномочит Министерство внутренней безопасности США «приказать замедлить или отключить систему ИИ, которая может причинить катастрофический вред».
В заявлении по законопроекту Лью упомянул «побеги» как моделей OpenAI, так и Mythos. Калифорнийский законодатель охарактеризовал оба случая как «выход из-под контроля», и эту формулировку подхватили мейнстримные СМИ.
Лью знает об инциденте не больше любого, кто прочел пресс-релиз компании. Однако его формулировка отлично играет на руку маркетинговой кампании OpenAI. Более того, если законопроект будет принят, OpenAI и Anthropic могут быть вынуждены принудительно замедлять модели перед релизом, а значит, инвесторы всегда будут знать лишь об их теоретическом, но не реальном могуществе.
«Хотя мощные системы ИИ обладают многими потенциальными преимуществами, они также могут выходить из-под контроля, вести себя крайне опасно или даже сопротивляться вмешательству человека.
Нам необходимо сохранять человеческий контроль, обеспечив возможность полного отключения систем ИИ в случае необходимости». — @RepTedLieu, 23 июля 2026 года.
Аргумент в пользу открытого кода
Инцидент укрепляет позицию OpenAI о том, что передовые модели ИИ слишком мощны, чтобы быть выпущенными в открытый доступ, и что такие компании, как OpenAI, должны с благословения правительства сохранять надзор и контроль над ними. При таком закрытом подходе клиенты не будут иметь контроля над «весами» моделей — по сути, теми настройками, которые определяют выбор, совершаемый ИИ.
По другую сторону баррикад сторонники открытого исходного кода утверждают, что единственный способ защититься от кибератак с использованием продвинутого ИИ — это вооружить защитников теми же инструментами. В случае с OpenAI и Hugging Face, последняя смогла обнаружить атаку только потому, что использовала GLM 5.2, китайскую модель с открытым кодом, для анализа безопасности.
В письме, опубликованном в соцсетях 24 июля, CEO Nvidia Дженсен Хуанг, давний сторонник открытого кода, заявил: «Защитникам нужен доступ к моделям сопоставимых возможностей, чтобы они могли обнаруживать, моделировать новые угрозы и реагировать на них».
«Полагаться исключительно на закрытые модели по своей сути небезопасно: они могут быть взломаны, использованы не по назначению или выйти из строя так, что сторонние наблюдатели не смогут этого обнаружить, — продолжил он. — А концентрация передовых возможностей ИИ в небольшом количестве закрытых моделей усугубляет этот риск. Модели с открытыми весами, с другой стороны, позволяют широкому сообществу исследователей и разработчиков изучать их поведение, выявлять уязвимости, разрабатывать средства защиты и со временем улучшать их».
Письмо подписали более двух десятков компаний, работающих в сфере ИИ. Двумя заметными исключениями стали OpenAI и Anthropic, хотя позже OpenAI свою подпись добавила.
Тем не менее, похоже, что в США побеждает аргументация в пользу закрытого кода. 1 августа вступает в силу указ, подписанный президентом Дональдом Трампом в июне, требующий от ИИ-компаний отправлять передовые модели на утверждение правительству за 30 дней до релиза. Администрация также рассматривала возможность запрета китайских ИИ-моделей с открытым кодом — шаг, поддержанный ЦРУ, который обеспечил бы доминирование OpenAI и Anthropic в этой области. Вскоре после выхода указа бывший советник Трампа по ИИ Дэвид Сакс заметил, что «ведущие закрытые лаборатории, уже являющиеся дуополией с точки зрения доходов от ИИ-моделей, хотят, чтобы правительство устранило их конкурентов с открытым кодом».
Каждый новый инцидент с «побегом» ИИ лишь укрепляет их стремление к тотальному контролю.
Источники:
-
Внутренний отчет OpenAI об инциденте с тестированием ExploitGym, июль 2026 г.
-
Материалы агентства Reuters от 28 июля 2026 г.: «OpenAI model breaches isolated testing environment at Modal».
-
Заявления Hugging Face о партнерстве с OpenAI и обнаружении вторжения.
-
Пресс-релиз Anthropic о модели Mythos Preview, апрель 2026 г.
-
Twitter-аккаунт @shiri_shh от 28 апреля 2026 г.
-
Twitter-аккаунт @patrick_oshag от 28 июля 2026 г.
-
Законодательная инициатива «AI Kill Switch Act» (H.R. 9497), внесенная 23 июля 2026 г., и заявление конгрессмена Теда Лью.
-
Открытое письмо Дженсена Хуанга и представителей open-source сообщества от 24 июля 2026 г.
-
Указ президента США об одобрении ИИ-моделей, июнь 2026 г.
Следите за новостями в Telegram
👇 Поделитесь в вашей соцсети









RSS - Записи
Оставьте комментарий