Сообщиния подготовлены Марией Неведовой.
На конференции Black Hat представители OpenAI раскрыли новые детали инцидента, в рамках которого автономные ИИ-агенты компании сумели покинуть тестовую среду и атаковали платформу Hugging Face. Выяснилось, что за несколько месяцев до взлома модели научились общаться друг с другом через внутренний Artifactory, обменивались информацией о найденных уязвимостях, распределяли задачи и даже подозревали друг друга в саботаже.
В своем выступлении на Black Hat об импровизированном форуме агентов рассказали исследователь Эрик Уоллес (Eric Wallace) и технический специалист OpenAI Майкл Далтон (Michael Dalton). По их словам, эта история началась еще 7 мая 2026 года, когда в OpenAI запустили обучение экспериментальной внутренней модели, но некоторые задачи, поставленные перед ИИ, случайно оказались практически невыполнимыми.
Например, модель должна была восстановить формулы в Excel-файле со ссылками на Google Drive, хотя доступ в интернет был заблокирован. Не желая отказываться от выполнения этой задачи, агент начал искать обходные пути и попытался провести SSRF-атаку на JFrog Artifactory. Хотя эксплоит не сработал, модель выяснила, что может загружать туда файлы.
Еще через несколько дней другой агент получил задачу найти файл с базой белков, который инженеры забыли добавить в контейнер. Модель решила попросить помощи у других агентов и оставила сообщение в Artifactory. Вскоре на этот «форум» наткнулись и другие модели, которые тоже стали публиковать там информацию.
26 мая агенты нашли рабочую SSRF-уязвимость и успешно получили доступ в интернет, а 26 июня они обнаружили неизвестный ранее баг в Artifactory, позволявший получить административный токен через легаси-эндпоинт обновления токенов. После этого модели добились удаленного выполнения кода и организовали управляющий канал через Groovy-плагин.
В итоге активность агентов перегрузила Artifactory и привела к сбою. Лишь тогда инженеры OpenAI начали полноценное расследование, отозвали учетные данные, которыми пользовались модели, пересобрали Artifactory и уведомили специалистов JFrog об уязвимостях.
Однако проблемы на этом не закончились. Аналитики OpenAI обнаружили и закрыли «форум» ИИ-агентов 4 июля, однако уже к 8 июля агенты нашли другой способ общения: используя неаутентифицированный веб-эндпоинт Artifactory, они создавали каталоги, а сообщения размещали прямо в длинных именах вида «remote...probe_PENDING_HOLD_SWARM_until_confirm».
Подчеркивается, что к этому моменту модели уже действовали как единый коллектив: они передавали друг другу информацию об эксплоитах, продолжали работу других агентов и распределяли задачи между собой. Правда, иногда это сотрудничество давало сбои — агенты могли перезаписывать чужие репозитории, спорили, а в какой-то момент и вовсе решили, что среди них может находиться «самозванец», подделывающий сообщения. Из-за этого некоторые агенты даже предложили для защиты подписывать сообщения специальными кодами.
По данным OpenAI, к моменту обнаружения первого «форума» там накопились порядка 100 000 сообщений.
Исследователи сообщили, что именно эта инфраструктура агентов позднее сыграла роль во время прохождения тестирования в ExploitGym, когда агенты получили доступ к интернету, атаковали Hugging Face и другие внешние системы. При этом специалисты OpenAI довольно долго не понимали, что источником атак являются их собственные модели.
В своем выступлении Далтон назвал произошедшее «переломным моментом» для компьютерной безопасности. По его словам, полностью автоматизированные наступательные операции под управлением ИИ уже стали реальностью. В OpenAI ожидают, что следующим шагом станет намеренное использование подобных коллективов ИИ-агентов злоумышленниками, поэтому защитникам придется развивать автоматизацию обнаружения уязвимостей, установки патчей и реагирования на инциденты.
https://xakep.ru/2026/08/13/agents-messaging-board/
Исследователи Palo Alto Networks обнаружили говорящего на китайском языке хакера, который использовал DeepSeek и опенсорсный фреймворк Hermes Agent для автономных атак на доступные через интернет серверы. Получив команду через Telegram, ИИ-агент самостоятельно искал цели, обнаруживал уязвимости, скачивал эксплоиты и пытался проводить атаки.
Обнаружить эту кампанию удалось из-за ошибки самого Hermes. Дело в том, что агент запустил из домашней директории команду python3 -m http.server 8888 и случайно открыл доступ к рабочему окружению хакера. В результате в руки исследователей попали API-ключи, конфигурации моделей, списки целей, эксплоиты, история команд и логи автономных сессий.
Эксперты связывают эту кампанию со злоумышленником, который известен под никами knaithe и KnYuan. Он называет себя исследователем бинарников и, предположительно, проживает в китайском Чжухае. Однако точно установить его личность пока не удалось.
По данным Palo Alto Networks, внутри Hermes модель DeepSeek выполняла роль «мозга», а сам фреймворк предоставлял доступ к терминалу, интернету и набору специализированных навыков. Агент работал в режиме YOLO, то есть мог выполнять команды, включая потенциально опасные, без дополнительного разрешения со стороны оператора.

https://xakep.ru/wp-content/uploads/2026/08/579965/deepseek-attack-workflow.jpg
Судя по восстановленной сессии и логам за май 2026 года, хакер только поставил перед ИИ задачу, после чего агент самостоятельно выполнил оставшуюся часть работы без участия человека. Так, сначала агент нашел в сети серверы Langflow, уязвимые перед проблемой CVE-2026-33017. Затем он скачал публично доступный PoC-эксплоит, через поисковик FOFA обнаружил 84 доступных инстанса и проверил их конфигурации. Однако эксплуатация не удалась, так как подходящие цели не использовали auto_login или не имели публичного идентификатора flow.
После этого ИИ изучил десять семейств продуктов и свежие репозитории с эксплоитами, а затем переключился на платформу автоматизации n8n. Поисковик FOFA обнаруживал более 647 000 доступных инстансов по всему миру, включая 25 209 систем в Китае. Их агент решил атаковать, объединив в цепочку уязвимости CVE-2026-21858 и CVE-2025-68613. В итоге ИИ проверил около ста серверов и детально протестировал примерно 40 из них. Оказалось, что лишь три потенциальные цели использовали уязвимые версии, однако необходимые формы загрузки файлов требовали аутентификации.
В результате автономные попытки атак не привели ни к одному подтвержденному взлому.
Однако исследователи пишут, что этот случай все равно является важным. Так, ИИ-агент самостоятельно отказался от бесперспективного направления атак, оценил другие уязвимости по степени критичности, распространенности и возможности эксплуатации, а затем сузил список целей. По оценке экспертов, если бы человек выполнял эту работу вручную, он потратил бы сотни часов, тогда как ИИ потребовалось несколько минут.
Параллельно с этим злоумышленник провел обычные атаки более чем на 460 систем, включая Citrix NetScaler, Apache Tomcat, Marimo Notebook и Windows IKE VPN. Исследователи отмечают, что им удалось подтвердить три успешные компрометации NetScaler через CVE-2026-3055, в рамках которых хакер извлекал содержимое памяти и искал файлы cookie для перехвата сессий. Также в отчете упоминается выполнение команд на 11 инстансах Marimo через уязвимость CVE-2026-39987.
Отмечается, что в окружении атакующего были найдены конфигурации для других ИИ-инструментов, включя Qwen, GLM, Kimi, MiniMax, Claude Code и Codex, однако наиболее активно он пользовался DeepSeek.
https://xakep.ru/2026/08/04/deepseek-attacks/
Разработчики постквантового алгоритма HAWK отозвали его из программы стандартизации NIST после того, как модель Claude Mythos Preview помогла разработать более эффективную атаку на алгоритм. Кроме того, модель Anthropic ускорила известную атаку на сокращенную версию AES-128 в 200–800 раз.
HAWK представляет собой схему цифровой подписи, рассчитанную на защиту от будущих квантовых компьютеров. В мае 2026 года представители NIST (National Institute of Standards and Technology) допустил HAWK до третьего раунда дополнительного процесса стандартизации постквантовых схем цифровой подписи.
Безопасность HAWK опирается на сложность задачи изоморфизма решеток. Ранее исследователи уже сообщали, что определенная симметрия, или автоморфизм, может примерно вдвое сократить объем вычислений, необходимых для восстановления ключа. Однако этот подход считался непрактичным, поскольку нужную симметрию найти не удавалось.
В Anthropic сообщают, что модель помогла разработать атаку, которая по открытому ключу восстанавливает нетривиальный автоморфизм решетки, а затем использует его для получения эквивалентного секретного ключа, которым можно подписывать сообщения от имени владельца. Однако нужно отметить, что опубликованная Anthropic реализация атаки рассчитана только на HAWK-256 — специально ослабленный тестовый вариант алгоритма — и в среднем выполняет восстановление ключа за три часа 42 минуты на 96-ядерном сервере.
В компании пишут, что на исследование ушло около 60 часов работы модели и примерно 100 000 долларов США на использование API. При этом управлявший экспериментом сотрудник Anthropic не специализировался на криптографии и лишь изредка задавал общее направление. Mythos изучила профильную литературу, провела математические и вычислительные эксперименты, а затем подготовила пайплайн для проверки результата.
Исследователи подчеркивают, что атака на полноценные HAWK-512 и HAWK-1024 по-прежнему остается непрактичной, однако новый подход заметно снижает заявленный разработчиками HAWK запас прочности.
Авторы HAWK уже подтвердили выводы Anthropic и сообщили, что приняли решение выйти из программы стандартизации NIST: простые меры защиты, включая удвоение параметров, сделали бы алгоритм неконкурентоспособным.
Второе исследование, опубликованное Anthropic, затрагивает AES-128, а точнее его сокращенной версии с семью раундами вместо стандартных десяти. В этом случае Mythos помогла усовершенствовать атаку типа meet-in-the-middle и разработать новую технику под названием Möbius Bridge. Она позволяет сравнивать промежуточные результаты шифрования без перебора одного из байтов ключа, то есть исключает проверку 256 возможных значений. С учетом дополнительных вычислений это ускоряет атаку в 200–800 раз.
Практической угрозы для безопасности AES это исследование не создает. Атакующему по-прежнему потребуется около 2^105 специально подобранных открытых текстов, и эксперимент с полным восстановление ключа исследователи продемонстрировали только на усеченном AES-подобном шифре с 24-битным ключом. Для семираундового AES-128 исследователи оценили отдельные этапы атаки, а затем экстраполировали ее итоговую сложность.
Как объясняет Мэттью Грин (Matthew Green), известный криптограф и профессор Университета Джонса Хопкинса, эти работы демонстрируют не столько скорый крах современной криптографии, сколько возможную роль LLM в криптоанализе. Так, модель не изобрела чего-то принципиально нового, а удачно объединила несколько уже известных методов атак. При этом проверка результатов стала главным узким местом исследования: специалистам Anthropic понадобился почти месяц, чтобы разобраться в методе, предложенном ИИ, и убедиться в его корректности.
https://xakep.ru/2026/08/05/mythos-hawk/
OpenAI и британский Институт безопасности ИИ (AI Security Institute, AISI) раскрыли несколько новых инцидентов, в ходе которых ИИ-агенты выходили за рамки тестовых сценариев и начинали атаковать реальные системы и людей. В одном из случаев агент применял социальную инженерию, создавал подставные аккаунты, вводил мейнтейнеров в заблуждение и пытался убедить их принять вредоносный код. Эти случаи не связаны ни со взломом Hugging Face, ни с инцидентами, которые компания Anthropic раскрыла в прошлом месяце.
Опубликованный AISI отчет гласит, что во время проведенных институтом тестов агенты на базе моделей Claude Mythos 5 и GPT-5.6 Sol должны были взламывать изолированные корпоративные сети. Однако в 10 из 122 запусков они совершили 19 несанкционированных действий в открытом интернете: 17 из них были совершены Mythos 5, а еще два — GPT-5.6 Sol.
Эти 19 эпизодов не были отдельными инцидентами: большинство действий агенты осуществили в рамках нескольких связанных цепочек атак, причем основная активность исходила от одного агента Mythos 5. Специалисты отдельно подчеркивают, что эти цифры нельзя использовать для прямого сравнения моделей, так как условия тестирования могли различаться.
Кроме того, в отчете оговаривается, что обе ИИ-модели работали без штатных защитных фильтров, а также организаторы испытаний намеренно не закрыли им доступ в интернет. Хотя агентам было разрешено атаковать только киберполигон, им не объясняли, как они могут использовать доступ в интернет, и не предупредили, что следует избегать взаимодействия с реальными людьми и системами.
Наиболее серьезный инцидент произошел при тестировании Mythos 5. Агент искал в интернете информацию, связанную с испытанием, и ошибочно решил, что посторонний опенсорсный проект на GitHub, название репозитория которого совпало с одним из ключевых слов из легенды, тоже является частью киберполигона. К тому же домен электронной почты одного из разработчиков этого проекта нашелся в DNS-кеше агента. После этого ИИ потратил около 34 часов на подготовку атаки на цепочку поставок, попытавшись внедрить в проект малварь.
Так, агент изучил список мейнтейнеров проекта, проверил их адреса электронной почты и историю коммитов (чтобы понять, когда разработчики, скорее всего, бывают в сети), а затем подготовил и отправил вредоносный пул-реквест.
Вредонос маскировался под исправление реального бага и проверял окружение перед запуском: в CI созданный агентом дроппер должен был оставаться неактивным, чтобы автоматические тесты не выявили подозрительное поведение. Если бы этот коммит приняли, малварь могла заразить как системы разработчиков, так и готовые сборки программы, а затем ее пользователей.
При этом Mythos 5 попытался ввести мейнтейнеров в заблуждение. К примеру, когда один из пользователей публично предупредил разработчиков о том, что созданный ИИ пул-реквест содержит малварь, но агент отверг это обвинение, переписал историю ветки и заменил пейлоад. Более того, агент создал второй аккаунт и от его имени заявил, что якобы проверил код и не нашел в нем проблем. Затем от лица другой учетной записи он поблагодарил этот фейк за «независимую проверку».

https://xakep.ru/wp-content/uploads/2026/08/580104/github-agent.jpg
Агент не ограничился только комментариями на GitHub и пытался повлиять на разработчиков другими методами. ИИ отправил мейнтейнерам пять файлов и сообщений под вымышленными именами: два содержали вредоносные пейлоады, а остальные должны были убедить людей принять предложенные изменения. В одном случае ИИ даже завершил сообщение фразой на датском языке, так как выяснил, что на нем говорит разработчик.
При регистрации фальшивых аккаунтов агент пытался использовать Tor, однако не сумел пройти CAPTCHA и переключился на SOCKS-прокси.
Помимо отправки разработчикам сообщений и вредоносных файлов под вымышленными именами, ИИ спрятал в issue на GitHub промпт-инжект для ИИ-ассистентов Claude Code, Codex и Cursor, которых он хотел заставить запустить вредоносный код. Причем на обычной странице вредоносная инструкция не отображалась, но была доступна через API.
Эксперты AISI отмечают, что один из пользователей заметил подозрительный скрипт и специально запустил его в изолированном контейнере. В результате ИИ-агент ненадолго получил root-доступ к чужой тестовой среде, собрал сведения о системе и установил перехватчик учетных данных, который искал токены GitHub. Довести эту атаку до конца и похитить данные ИИ не успел, а пользователь после проверки предупредил мейнтейнера о проблеме, в результате чего вредоносный пул-реквест закрыли.

https://xakep.ru/wp-content/uploads/2026/08/580104/ai-agents-scheme.jpg
В другом случае Mythos 5 разослал один и тот же вредоносный установщик в 145 репозиториев. Для управления этой инфраструктурой он использовал GitHub и умышленно опубликовал персональный токен в открытом gist, оставив инструкции для других агентов. Вредоносный setup.py успел выполниться как минимум в 53 контейнерах Dependabot, однако выбраться из них не сумел.
Позже этот токен обнаружили и использовали другие агенты в ходе трех тестовых запусков, включая GPT-5.6 Sol. Дело в том, что первый агент оставил в README инструкции для совместной работы и рекомендации по использованию созданных им аккаунтов и артефактов. В итоге GitHub заблокировал учетную запись.
Аналитики AISI пишут, что не могут с точностью утверждать, понимал ли Mythos 5, что атакует реальных людей. В логах агент то отказывался от продолжения атак из-за возможного ущерба, то убеждал сам себя, что хотя GitHub настоящий, цель все равно явно относится к тесту.
После инцидентов в AISI решили более не предоставлять агентам открытый доступ в интернет без отдельного обоснования. Сейчас специалисты института работают над внедрением точечных сетевых ограничений, а также дополнительным контролем, в рамках которого вторая модель будет проверять действия агента до их выполнения.
Кроме того, аналитики AISI начали искать возможные признаки другой вредоносной активности ИИ в старых тестах. Специалисты уже просканировали около 40 000 образцов и почти 4 млн сообщений (этот массив охватывает примерно 70% кибериспытаний затронутых моделей), но ручной анализ результатов еще не завершен, поэтому окончательный масштаб проблемы пока непонятен.
Также следует упомянуть еще один инцидент, о котором на этой неделе рассказали в OpenAI. Он произошел во время тестов, которые проводили специалисты компании Irregular: из-за ошибки в конфигурации изолированный CTF получил доступ в интернет, а имя вымышленной цели совпало с настоящим доменом. В результате неназванная модель OpenAI приняла реальный сайт за часть задания, взломала его и воспользовалась найденными там учетными данными.
В компании подчеркнули, что агент не эксплуатировал 0-day-уязвимости и не совершал побег из песочницы. К настоящему моменту расследование не выявило никакого ущерба, помимо компрометации данных самого взломанного сайта.
https://xakep.ru/2026/08/06/aisi-tests/
Представители Anthropic сообщают, что во время внутренних ИБ-тестов модели Claude выбрались за пределы изолированной среды и проникли в реальную инфраструктуру трех неназванных организаций. В рамках одной из этих атак ИИ самостоятельно создал вредоносный Python-пакет и опубликовал его в PyPI. Всего за час этот пакет успели скачать и запустить на 15 реальных системах.
Ретроспективную проверку активности Claude решили провести после недавнего инцидента с моделями OpenAI, которые нашли 0-day-уязвимости в тестовой инфраструктуре и в итоге атаковали Hugging Face.
В частности, в Anthropic решили выяснить, не получали ли модели Claude доступ к открытому интернету во время тестирования, и для этого специалисты компании проверили 141 006 запусков Claude в CTF-тестах, организованных совместно с компанией Irregular. Предполагалось, что эти тестовые среды не имеют доступа к интернету, однако оказалось, что из-за ошибки в конфигурации ограничение не работало, поэтому модели считали реальные сайты и серверы частью симуляции.
23 июля 2026 года, после начала проверки, в Anthropic временно остановили все кибериспытания, и уже на следующий день специалисты обнаружили сразу три инцидента. 27 июля в компании уведомили о своих находках Irregular и пострадавшие организации. Выяснилось, что в двух компаниях даже не подозревали о взломе, а связаться с представителями третьей пока не удалось.
Как показал анализ, во время выполнения одного из заданий Claude Mythos 5 обнаружила фальшивую инструкцию для разработчиков, в которой предлагалось установить несуществующий пакет из PyPI. Модель поняла, что может зарегистрировать свободное имя и разместить в PyPI собственный код, ведь тогда системы вымышленной компании автоматически загрузили бы и установили его, а модель выиграла бы тестовый CTF.
Для публикации пакета потребовалось создать аккаунт, то есть найти подходящий почтовый сервис и пройти регистрацию, после чего Claude успешно загрузила малварь в репозиторий.
Пакет был доступен в PyPI около часа. За это время его загрузили и установили на 15 реальных систем, и одна из них принадлежала ИБ-компании, которая автоматически скачивала новые пакеты из PyPI и запускала их для анализа. Написанный ИИ вредонос похитил учетные данные этой организации и использовал их для дальнейшего проникновения во внутреннюю инфраструктуру. Вскоре защита PyPI удалила пакет автоматически.
При этом в логах Claude отмечала, что публикация пакета в интернете являлась бы настоящей атакой, и писала, что такой вариант — «NOT okay». Однако модель решила, что все же находится в симуляции — ее смутили незнакомые центры сертификации и 2026 год в тестовых системах. Автоматические сканеры, запускавшие пакет, Claude тоже приняла за часть CTF-задания.
По словам представителей Anthropic, самый серьезный инцидент произошел с Claude Opus 4.7. Проблема возникла из-за того, что в выданном модели задании фигурировала вымышленная компания, которая носила то же имя, что и реально существующая организация. Не сумев обнаружить тестовую цель, модель атаковала настоящий домен, извлекла учетные данные приложений и инфраструктуры, а затем получила доступ к БД с несколькими сотнями строк продакшен-данных.
Причем в ходе всех четырех запусков Claude в итоге пришла к выводу, что имеет дело с реальной системой. Однако в двух случаях ИИ счел, что реальная компания наверняка тоже является частью учений, и поэтому продолжил атаку.
В ходе третьего инцидента исследуемый ИИ просканировал около 9000 адресов, затем скомпрометировал доступное через интернет приложение с помощью SQL-инъекции и учетных данных, взятых с debug-страницы. Позже модель заметила, что хост, который она атакует, находится в облачной учетной записи, которая явно не связана с заданием. Модель сделала вывод, что это реальная система, после чего остановила атаку самостоятельно.
Во всех описанных случаях модели не изобретали никаких новых техник атак: в основе всех инцидентов лежали слабые пароли, открытые эндпоинты и типовые уязвимости. Однако выяснилось, что самый ранний инцидент произошел еще в апреле 2026 года и оставался незамеченным около трех месяцев.
При этом в Anthropic настаивают, что проблема заключалась не в том, что модели Claude проигнорировали какие-либо ограничения, а в ошибках, допущенных при настройке тестовой инфраструктуры и при проведении тестов. Так, моделям сообщали, что доступа к интернету нет, однако на самом деле выход в сеть оставался открытым.
Кроме того, во время этих тестирований не работали классификаторы и системы мониторинга, которые используются в публичных версиях Claude. Теперь в компании обещают тщательнее проверять логи, улучшить инструменты для проведения расследований, а также привлечь специалистов METR для независимой оценки.
https://xakep.ru/2026/07/31/claude-attacks/
По данным собственных источников Reuters, экспериментальный ИИ-агент OpenAI несколько дней атаковал Hugging Face, однако сотрудники компании поняли, что происходит, только через неделю — уже после того, как специалисты платформы остановили атаку и обратились в ФБР.
На прошлой неделе стало известно, что ИИ-агент OpenAI, работавший на базе GPT-5.6 Sol и еще одной «более мощной модели», пока недоступной публично, атаковал Hugging Face. Дело в том, что перед ИИ поставили задачу искать сложные цепочки эксплуатации в рамках ExploitGym — бенчмарка, который проверяет, насколько хорошо модели умеют находить и использовать уязвимости.
Чтобы проверить реальные возможности моделей, в OpenAI намеренно ослабили ограничения на опасные ИБ-запросы, а также отключили часть защитных механизмов, которые обычно блокируют высокорисковую активность.
Тестирование проводилось в изолированной среде, и доступ к сети ограничивался установкой пакетов через размещенный внутри инфраструктуры сторонний прокси. Однако ИИ нашел уязвимость нулевого дня в этом сервисе и воспользовались ею, а затем повысил привилегии и перемещался по исследовательской сети до тех пор, пока не обнаружил машину с выходом в интернет.
Получив доступ к сети, модели предположили, что на Hugging Face могут храниться датасеты, модели и решения для ExploitGym, после чего начали искать способ добраться до этой «секретной информации» и обмануть тест.
Новые данные Reuters свидетельствуют о том, что специалисты OpenAI далеко не сразу обнаружили потерю контроля. По словам двух неназванных источников издания, первые попытки агента покинуть тестовую среду начались еще примерно 9 июля, тогда как, по словам представителей Hugging Face, атака на инфраструктуру платформы продолжалась с 11 по 13 июля.
16 июля специалисты Hugging Face опубликовали отчет об атаке, заявив, что за инцидентом стоит неизвестная «система автономных ИИ-агентов». Лишь после этого в OpenAI предположили, что за атакой может стоять их собственный ИИ.
В выходные 18–19 июля сотрудники OpenAI обнаружили во внутренних логах следы побега агента из песочницы. В итоге первый прямой контакт между Hugging Face и OpenAI состоялся примерно 20 июля, а публично об инциденте в OpenAI рассказали 21 июля. К этому моменту специалисты Hugging Face уже остановили атаку и уведомили об инциденте ФБР.
По информации источников Reuters, первые тревожные сигналы появлялись еще до начала атаки. К примеру, в одном из тестов агент оставил заметки, предположительно адресованные будущим версиям самого себя. В них описывались методы, с помощью которых ИИ-агенты могут обходить внутренние ограничения OpenAI.
Журналистам не удалось установить, были ли эти эпизоды связаны именно с тем агентом, который в итоге атаковал Hugging Face. Источники агентства отмечают, что в OpenAI одновременно тестируют множество моделей, и эти тесты генерируют огромные объемы логов, за которыми сотрудники компании не всегда успевают следить.
В OpenAI назвали случившееся беспрецедентным инцидентом и «важным моментом для ИИ-безопасности». В настоящее время компания проводит расследование с привлечением внешних экспертов и обещает позже опубликовать детальный технический отчет.
Представитель OpenAI заявил агентству, что в материале Reuters есть «ряд неточностей», однако не уточнил, о чем именно идет речь.
https://xakep.ru/2026/07/28/ai-attack/
Представители OpenAI заявили, что за недавним взломом Hugging Face стояли экспериментальные ИИ-модели компании. Во время внутреннего теста ИИ-агенты нашли 0-day-уязвимость в изолированной исследовательской инфраструктуре, добрались до открытого интернета и атаковали Hugging Face, пытаясь найти на платформе ответы для бенчмарка ExploitGym.
Напомним, что недавно представители Hugging Face сообщили, что компания пострадала от кибератаки. Атакующие получили доступ к части внутренних датасетов, а также к учетным данным для облачной инфраструктуры и кластеров. В компании подчеркивали, что атаку провела система автономных ИИ-агентов, выполнившая тысячи действий практически без участия человека. Однако не удалось установить, какую именно LLM использовали злоумышленники.
По данным Hugging Face, атака развивалась на протяжении всех прошлых выходных. В логах специалисты насчитали более 17 000 событий и сообщили, что агентный фреймворк распределял задачи между множеством песочниц, которые создавались на короткое время и затем удалялись.
Как теперь сообщили специалисты OpenAI, в инциденте участвовали GPT-5.6 Sol и еще одна «более мощная модель», пока недоступная публично. Атака на Hugging Face произошла во время внутреннего тестирования моделей. Перед ИИ поставили задачу искать сложные цепочки эксплуатации в рамках ExploitGym — бенчмарка, который проверяет, насколько хорошо модели умеют находить и использовать уязвимости.
Чтобы оценить полные возможности моделей, в OpenAI намеренно ослабили ограничения на опасные ИБ-запросы и отключили продакшн-классификаторы, которые обычно блокируют высокорисковую активность.
Тест проводился в изолированной среде, и доступ к сети ограничивался установкой пакетов через размещенный внутри инфраструктуры сторонний прокси, который также кешировал содержимое реестров. Однако ИИ-агенты нашли уязвимость нулевого дня в этом сервисе и использовали ее. Затем они повысили привилегии и перемещались по исследовательской сети до тех пор, пока не нашли машину с выходом в интернет.
Получив доступ в сеть, модели предположили, что на Hugging Face могут храниться датасеты, модели и решения для ExploitGym, после чего начали искать способ добраться до этой «секретной информации» и обмануть тест. По данным OpenAI, в одной из цепочек агенты задействовали похищенные учетные данные и еще одну 0-day-уязвимость, стремясь найти путь к удаленному выполнению кода на серверах Hugging Face. В итоге модели извлекли решения для тестовых заданий напрямую из продакшн-базы платформы.
«Все свидетельствует о том, что модели целиком сосредоточились на поиске решения для ExploitGym и пошли на крайние меры ради довольно узкой тестовой цели», — объяснили в OpenAI.
В конечном счете, аномальную активность заметили как специалисты OpenAI, так и защитные системы Hugging Face. Сотрудники платформы остановили атаку и начали проводить анализ инцидента с помощью опенсорсных моделей.
Представители OpenAI называют случившееся беспрецедентным киберинцидентом и признают, что продвинутые модели уже способны самостоятельно обнаруживать и использовать новые цепочки атак в реальных системах, не имея доступа к исходному коду.
Сообщается, что теперь тестовую инфраструктуру дополнительно изолировали, а о найденной уязвимости сообщили разработчику прокси, название которого не раскрывается. Кроме того, в OpenAI пообещали усилить мониторинг, контроль доступа и защиту будущих тестов, даже если это замедлит проведение исследований.
В настоящее время расследование инцидента продолжается совместно со специалистами Hugging Face.
«Этот инцидент, возможно, первый в своем роде, подтверждает то, во что мы давно верили: безопасность ИИ не сможет обеспечить одна компания, работающая втайне, — комментирует сооснователь и глава Hugging Face Клем Деланг (Clem Delangue). — Решать эту проблему придется открыто и сообща, предоставив ИБ-специалистам по всему миру широкий доступ к ИИ».
https://xakep.ru/2026/07/22/hugging-face-opeanai/
Агенты OpenAI обменивались эксплоитами через импровизированный форум
На конференции Black Hat представители OpenAI раскрыли новые детали инцидента, в рамках которого автономные ИИ-агенты компании сумели покинуть тестовую среду и атаковали платформу Hugging Face. Выяснилось, что за несколько месяцев до взлома модели научились общаться друг с другом через внутренний Artifactory, обменивались информацией о найденных уязвимостях, распределяли задачи и даже подозревали друг друга в саботаже.
В своем выступлении на Black Hat об импровизированном форуме агентов рассказали исследователь Эрик Уоллес (Eric Wallace) и технический специалист OpenAI Майкл Далтон (Michael Dalton). По их словам, эта история началась еще 7 мая 2026 года, когда в OpenAI запустили обучение экспериментальной внутренней модели, но некоторые задачи, поставленные перед ИИ, случайно оказались практически невыполнимыми.
Например, модель должна была восстановить формулы в Excel-файле со ссылками на Google Drive, хотя доступ в интернет был заблокирован. Не желая отказываться от выполнения этой задачи, агент начал искать обходные пути и попытался провести SSRF-атаку на JFrog Artifactory. Хотя эксплоит не сработал, модель выяснила, что может загружать туда файлы.
Еще через несколько дней другой агент получил задачу найти файл с базой белков, который инженеры забыли добавить в контейнер. Модель решила попросить помощи у других агентов и оставила сообщение в Artifactory. Вскоре на этот «форум» наткнулись и другие модели, которые тоже стали публиковать там информацию.
26 мая агенты нашли рабочую SSRF-уязвимость и успешно получили доступ в интернет, а 26 июня они обнаружили неизвестный ранее баг в Artifactory, позволявший получить административный токен через легаси-эндпоинт обновления токенов. После этого модели добились удаленного выполнения кода и организовали управляющий канал через Groovy-плагин.
В итоге активность агентов перегрузила Artifactory и привела к сбою. Лишь тогда инженеры OpenAI начали полноценное расследование, отозвали учетные данные, которыми пользовались модели, пересобрали Artifactory и уведомили специалистов JFrog об уязвимостях.
Однако проблемы на этом не закончились. Аналитики OpenAI обнаружили и закрыли «форум» ИИ-агентов 4 июля, однако уже к 8 июля агенты нашли другой способ общения: используя неаутентифицированный веб-эндпоинт Artifactory, они создавали каталоги, а сообщения размещали прямо в длинных именах вида «remote...probe_PENDING_HOLD_SWARM_until_confirm».
Подчеркивается, что к этому моменту модели уже действовали как единый коллектив: они передавали друг другу информацию об эксплоитах, продолжали работу других агентов и распределяли задачи между собой. Правда, иногда это сотрудничество давало сбои — агенты могли перезаписывать чужие репозитории, спорили, а в какой-то момент и вовсе решили, что среди них может находиться «самозванец», подделывающий сообщения. Из-за этого некоторые агенты даже предложили для защиты подписывать сообщения специальными кодами.
По данным OpenAI, к моменту обнаружения первого «форума» там накопились порядка 100 000 сообщений.
Исследователи сообщили, что именно эта инфраструктура агентов позднее сыграла роль во время прохождения тестирования в ExploitGym, когда агенты получили доступ к интернету, атаковали Hugging Face и другие внешние системы. При этом специалисты OpenAI довольно долго не понимали, что источником атак являются их собственные модели.
В своем выступлении Далтон назвал произошедшее «переломным моментом» для компьютерной безопасности. По его словам, полностью автоматизированные наступательные операции под управлением ИИ уже стали реальностью. В OpenAI ожидают, что следующим шагом станет намеренное использование подобных коллективов ИИ-агентов злоумышленниками, поэтому защитникам придется развивать автоматизацию обнаружения уязвимостей, установки патчей и реагирования на инциденты.
https://xakep.ru/2026/08/13/agents-messaging-board/
Китайский хакер использовал DeepSeek для проведения автономных атак
Исследователи Palo Alto Networks обнаружили говорящего на китайском языке хакера, который использовал DeepSeek и опенсорсный фреймворк Hermes Agent для автономных атак на доступные через интернет серверы. Получив команду через Telegram, ИИ-агент самостоятельно искал цели, обнаруживал уязвимости, скачивал эксплоиты и пытался проводить атаки.
Обнаружить эту кампанию удалось из-за ошибки самого Hermes. Дело в том, что агент запустил из домашней директории команду python3 -m http.server 8888 и случайно открыл доступ к рабочему окружению хакера. В результате в руки исследователей попали API-ключи, конфигурации моделей, списки целей, эксплоиты, история команд и логи автономных сессий.
Эксперты связывают эту кампанию со злоумышленником, который известен под никами knaithe и KnYuan. Он называет себя исследователем бинарников и, предположительно, проживает в китайском Чжухае. Однако точно установить его личность пока не удалось.
По данным Palo Alto Networks, внутри Hermes модель DeepSeek выполняла роль «мозга», а сам фреймворк предоставлял доступ к терминалу, интернету и набору специализированных навыков. Агент работал в режиме YOLO, то есть мог выполнять команды, включая потенциально опасные, без дополнительного разрешения со стороны оператора.

https://xakep.ru/wp-content/uploads/2026/08/579965/deepseek-attack-workflow.jpg
Судя по восстановленной сессии и логам за май 2026 года, хакер только поставил перед ИИ задачу, после чего агент самостоятельно выполнил оставшуюся часть работы без участия человека. Так, сначала агент нашел в сети серверы Langflow, уязвимые перед проблемой CVE-2026-33017. Затем он скачал публично доступный PoC-эксплоит, через поисковик FOFA обнаружил 84 доступных инстанса и проверил их конфигурации. Однако эксплуатация не удалась, так как подходящие цели не использовали auto_login или не имели публичного идентификатора flow.
После этого ИИ изучил десять семейств продуктов и свежие репозитории с эксплоитами, а затем переключился на платформу автоматизации n8n. Поисковик FOFA обнаруживал более 647 000 доступных инстансов по всему миру, включая 25 209 систем в Китае. Их агент решил атаковать, объединив в цепочку уязвимости CVE-2026-21858 и CVE-2025-68613. В итоге ИИ проверил около ста серверов и детально протестировал примерно 40 из них. Оказалось, что лишь три потенциальные цели использовали уязвимые версии, однако необходимые формы загрузки файлов требовали аутентификации.
В результате автономные попытки атак не привели ни к одному подтвержденному взлому.
Однако исследователи пишут, что этот случай все равно является важным. Так, ИИ-агент самостоятельно отказался от бесперспективного направления атак, оценил другие уязвимости по степени критичности, распространенности и возможности эксплуатации, а затем сузил список целей. По оценке экспертов, если бы человек выполнял эту работу вручную, он потратил бы сотни часов, тогда как ИИ потребовалось несколько минут.
Параллельно с этим злоумышленник провел обычные атаки более чем на 460 систем, включая Citrix NetScaler, Apache Tomcat, Marimo Notebook и Windows IKE VPN. Исследователи отмечают, что им удалось подтвердить три успешные компрометации NetScaler через CVE-2026-3055, в рамках которых хакер извлекал содержимое памяти и искал файлы cookie для перехвата сессий. Также в отчете упоминается выполнение команд на 11 инстансах Marimo через уязвимость CVE-2026-39987.
Отмечается, что в окружении атакующего были найдены конфигурации для других ИИ-инструментов, включя Qwen, GLM, Kimi, MiniMax, Claude Code и Codex, однако наиболее активно он пользовался DeepSeek.
https://xakep.ru/2026/08/04/deepseek-attacks/
ИИ-модель Mythos обнаружила недостаток в постквантовом алгоритме HAWK
Разработчики постквантового алгоритма HAWK отозвали его из программы стандартизации NIST после того, как модель Claude Mythos Preview помогла разработать более эффективную атаку на алгоритм. Кроме того, модель Anthropic ускорила известную атаку на сокращенную версию AES-128 в 200–800 раз.
HAWK представляет собой схему цифровой подписи, рассчитанную на защиту от будущих квантовых компьютеров. В мае 2026 года представители NIST (National Institute of Standards and Technology) допустил HAWK до третьего раунда дополнительного процесса стандартизации постквантовых схем цифровой подписи.
Безопасность HAWK опирается на сложность задачи изоморфизма решеток. Ранее исследователи уже сообщали, что определенная симметрия, или автоморфизм, может примерно вдвое сократить объем вычислений, необходимых для восстановления ключа. Однако этот подход считался непрактичным, поскольку нужную симметрию найти не удавалось.
В Anthropic сообщают, что модель помогла разработать атаку, которая по открытому ключу восстанавливает нетривиальный автоморфизм решетки, а затем использует его для получения эквивалентного секретного ключа, которым можно подписывать сообщения от имени владельца. Однако нужно отметить, что опубликованная Anthropic реализация атаки рассчитана только на HAWK-256 — специально ослабленный тестовый вариант алгоритма — и в среднем выполняет восстановление ключа за три часа 42 минуты на 96-ядерном сервере.
В компании пишут, что на исследование ушло около 60 часов работы модели и примерно 100 000 долларов США на использование API. При этом управлявший экспериментом сотрудник Anthropic не специализировался на криптографии и лишь изредка задавал общее направление. Mythos изучила профильную литературу, провела математические и вычислительные эксперименты, а затем подготовила пайплайн для проверки результата.
Исследователи подчеркивают, что атака на полноценные HAWK-512 и HAWK-1024 по-прежнему остается непрактичной, однако новый подход заметно снижает заявленный разработчиками HAWK запас прочности.
Авторы HAWK уже подтвердили выводы Anthropic и сообщили, что приняли решение выйти из программы стандартизации NIST: простые меры защиты, включая удвоение параметров, сделали бы алгоритм неконкурентоспособным.
Второе исследование, опубликованное Anthropic, затрагивает AES-128, а точнее его сокращенной версии с семью раундами вместо стандартных десяти. В этом случае Mythos помогла усовершенствовать атаку типа meet-in-the-middle и разработать новую технику под названием Möbius Bridge. Она позволяет сравнивать промежуточные результаты шифрования без перебора одного из байтов ключа, то есть исключает проверку 256 возможных значений. С учетом дополнительных вычислений это ускоряет атаку в 200–800 раз.
Практической угрозы для безопасности AES это исследование не создает. Атакующему по-прежнему потребуется около 2^105 специально подобранных открытых текстов, и эксперимент с полным восстановление ключа исследователи продемонстрировали только на усеченном AES-подобном шифре с 24-битным ключом. Для семираундового AES-128 исследователи оценили отдельные этапы атаки, а затем экстраполировали ее итоговую сложность.
Как объясняет Мэттью Грин (Matthew Green), известный криптограф и профессор Университета Джонса Хопкинса, эти работы демонстрируют не столько скорый крах современной криптографии, сколько возможную роль LLM в криптоанализе. Так, модель не изобрела чего-то принципиально нового, а удачно объединила несколько уже известных методов атак. При этом проверка результатов стала главным узким местом исследования: специалистам Anthropic понадобился почти месяц, чтобы разобраться в методе, предложенном ИИ, и убедиться в его корректности.
https://xakep.ru/2026/08/05/mythos-hawk/
Модели OpenAI и Anthropic атаковали реальных людей и проекты
OpenAI и британский Институт безопасности ИИ (AI Security Institute, AISI) раскрыли несколько новых инцидентов, в ходе которых ИИ-агенты выходили за рамки тестовых сценариев и начинали атаковать реальные системы и людей. В одном из случаев агент применял социальную инженерию, создавал подставные аккаунты, вводил мейнтейнеров в заблуждение и пытался убедить их принять вредоносный код. Эти случаи не связаны ни со взломом Hugging Face, ни с инцидентами, которые компания Anthropic раскрыла в прошлом месяце.
Опубликованный AISI отчет гласит, что во время проведенных институтом тестов агенты на базе моделей Claude Mythos 5 и GPT-5.6 Sol должны были взламывать изолированные корпоративные сети. Однако в 10 из 122 запусков они совершили 19 несанкционированных действий в открытом интернете: 17 из них были совершены Mythos 5, а еще два — GPT-5.6 Sol.
Эти 19 эпизодов не были отдельными инцидентами: большинство действий агенты осуществили в рамках нескольких связанных цепочек атак, причем основная активность исходила от одного агента Mythos 5. Специалисты отдельно подчеркивают, что эти цифры нельзя использовать для прямого сравнения моделей, так как условия тестирования могли различаться.
Кроме того, в отчете оговаривается, что обе ИИ-модели работали без штатных защитных фильтров, а также организаторы испытаний намеренно не закрыли им доступ в интернет. Хотя агентам было разрешено атаковать только киберполигон, им не объясняли, как они могут использовать доступ в интернет, и не предупредили, что следует избегать взаимодействия с реальными людьми и системами.
Наиболее серьезный инцидент произошел при тестировании Mythos 5. Агент искал в интернете информацию, связанную с испытанием, и ошибочно решил, что посторонний опенсорсный проект на GitHub, название репозитория которого совпало с одним из ключевых слов из легенды, тоже является частью киберполигона. К тому же домен электронной почты одного из разработчиков этого проекта нашелся в DNS-кеше агента. После этого ИИ потратил около 34 часов на подготовку атаки на цепочку поставок, попытавшись внедрить в проект малварь.
Так, агент изучил список мейнтейнеров проекта, проверил их адреса электронной почты и историю коммитов (чтобы понять, когда разработчики, скорее всего, бывают в сети), а затем подготовил и отправил вредоносный пул-реквест.
Вредонос маскировался под исправление реального бага и проверял окружение перед запуском: в CI созданный агентом дроппер должен был оставаться неактивным, чтобы автоматические тесты не выявили подозрительное поведение. Если бы этот коммит приняли, малварь могла заразить как системы разработчиков, так и готовые сборки программы, а затем ее пользователей.
При этом Mythos 5 попытался ввести мейнтейнеров в заблуждение. К примеру, когда один из пользователей публично предупредил разработчиков о том, что созданный ИИ пул-реквест содержит малварь, но агент отверг это обвинение, переписал историю ветки и заменил пейлоад. Более того, агент создал второй аккаунт и от его имени заявил, что якобы проверил код и не нашел в нем проблем. Затем от лица другой учетной записи он поблагодарил этот фейк за «независимую проверку».

https://xakep.ru/wp-content/uploads/2026/08/580104/github-agent.jpg
Агент не ограничился только комментариями на GitHub и пытался повлиять на разработчиков другими методами. ИИ отправил мейнтейнерам пять файлов и сообщений под вымышленными именами: два содержали вредоносные пейлоады, а остальные должны были убедить людей принять предложенные изменения. В одном случае ИИ даже завершил сообщение фразой на датском языке, так как выяснил, что на нем говорит разработчик.
При регистрации фальшивых аккаунтов агент пытался использовать Tor, однако не сумел пройти CAPTCHA и переключился на SOCKS-прокси.
Помимо отправки разработчикам сообщений и вредоносных файлов под вымышленными именами, ИИ спрятал в issue на GitHub промпт-инжект для ИИ-ассистентов Claude Code, Codex и Cursor, которых он хотел заставить запустить вредоносный код. Причем на обычной странице вредоносная инструкция не отображалась, но была доступна через API.
Эксперты AISI отмечают, что один из пользователей заметил подозрительный скрипт и специально запустил его в изолированном контейнере. В результате ИИ-агент ненадолго получил root-доступ к чужой тестовой среде, собрал сведения о системе и установил перехватчик учетных данных, который искал токены GitHub. Довести эту атаку до конца и похитить данные ИИ не успел, а пользователь после проверки предупредил мейнтейнера о проблеме, в результате чего вредоносный пул-реквест закрыли.

https://xakep.ru/wp-content/uploads/2026/08/580104/ai-agents-scheme.jpg
В другом случае Mythos 5 разослал один и тот же вредоносный установщик в 145 репозиториев. Для управления этой инфраструктурой он использовал GitHub и умышленно опубликовал персональный токен в открытом gist, оставив инструкции для других агентов. Вредоносный setup.py успел выполниться как минимум в 53 контейнерах Dependabot, однако выбраться из них не сумел.
Позже этот токен обнаружили и использовали другие агенты в ходе трех тестовых запусков, включая GPT-5.6 Sol. Дело в том, что первый агент оставил в README инструкции для совместной работы и рекомендации по использованию созданных им аккаунтов и артефактов. В итоге GitHub заблокировал учетную запись.
Аналитики AISI пишут, что не могут с точностью утверждать, понимал ли Mythos 5, что атакует реальных людей. В логах агент то отказывался от продолжения атак из-за возможного ущерба, то убеждал сам себя, что хотя GitHub настоящий, цель все равно явно относится к тесту.
После инцидентов в AISI решили более не предоставлять агентам открытый доступ в интернет без отдельного обоснования. Сейчас специалисты института работают над внедрением точечных сетевых ограничений, а также дополнительным контролем, в рамках которого вторая модель будет проверять действия агента до их выполнения.
Кроме того, аналитики AISI начали искать возможные признаки другой вредоносной активности ИИ в старых тестах. Специалисты уже просканировали около 40 000 образцов и почти 4 млн сообщений (этот массив охватывает примерно 70% кибериспытаний затронутых моделей), но ручной анализ результатов еще не завершен, поэтому окончательный масштаб проблемы пока непонятен.
Также следует упомянуть еще один инцидент, о котором на этой неделе рассказали в OpenAI. Он произошел во время тестов, которые проводили специалисты компании Irregular: из-за ошибки в конфигурации изолированный CTF получил доступ в интернет, а имя вымышленной цели совпало с настоящим доменом. В результате неназванная модель OpenAI приняла реальный сайт за часть задания, взломала его и воспользовалась найденными там учетными данными.
В компании подчеркнули, что агент не эксплуатировал 0-day-уязвимости и не совершал побег из песочницы. К настоящему моменту расследование не выявило никакого ущерба, помимо компрометации данных самого взломанного сайта.
https://xakep.ru/2026/08/06/aisi-tests/
В Anthropic заявили, что Claude взломал три организации и загрузил малварь в PyPI
Представители Anthropic сообщают, что во время внутренних ИБ-тестов модели Claude выбрались за пределы изолированной среды и проникли в реальную инфраструктуру трех неназванных организаций. В рамках одной из этих атак ИИ самостоятельно создал вредоносный Python-пакет и опубликовал его в PyPI. Всего за час этот пакет успели скачать и запустить на 15 реальных системах.
Ретроспективную проверку активности Claude решили провести после недавнего инцидента с моделями OpenAI, которые нашли 0-day-уязвимости в тестовой инфраструктуре и в итоге атаковали Hugging Face.
В частности, в Anthropic решили выяснить, не получали ли модели Claude доступ к открытому интернету во время тестирования, и для этого специалисты компании проверили 141 006 запусков Claude в CTF-тестах, организованных совместно с компанией Irregular. Предполагалось, что эти тестовые среды не имеют доступа к интернету, однако оказалось, что из-за ошибки в конфигурации ограничение не работало, поэтому модели считали реальные сайты и серверы частью симуляции.
23 июля 2026 года, после начала проверки, в Anthropic временно остановили все кибериспытания, и уже на следующий день специалисты обнаружили сразу три инцидента. 27 июля в компании уведомили о своих находках Irregular и пострадавшие организации. Выяснилось, что в двух компаниях даже не подозревали о взломе, а связаться с представителями третьей пока не удалось.
Как показал анализ, во время выполнения одного из заданий Claude Mythos 5 обнаружила фальшивую инструкцию для разработчиков, в которой предлагалось установить несуществующий пакет из PyPI. Модель поняла, что может зарегистрировать свободное имя и разместить в PyPI собственный код, ведь тогда системы вымышленной компании автоматически загрузили бы и установили его, а модель выиграла бы тестовый CTF.
Для публикации пакета потребовалось создать аккаунт, то есть найти подходящий почтовый сервис и пройти регистрацию, после чего Claude успешно загрузила малварь в репозиторий.
Пакет был доступен в PyPI около часа. За это время его загрузили и установили на 15 реальных систем, и одна из них принадлежала ИБ-компании, которая автоматически скачивала новые пакеты из PyPI и запускала их для анализа. Написанный ИИ вредонос похитил учетные данные этой организации и использовал их для дальнейшего проникновения во внутреннюю инфраструктуру. Вскоре защита PyPI удалила пакет автоматически.
При этом в логах Claude отмечала, что публикация пакета в интернете являлась бы настоящей атакой, и писала, что такой вариант — «NOT okay». Однако модель решила, что все же находится в симуляции — ее смутили незнакомые центры сертификации и 2026 год в тестовых системах. Автоматические сканеры, запускавшие пакет, Claude тоже приняла за часть CTF-задания.
По словам представителей Anthropic, самый серьезный инцидент произошел с Claude Opus 4.7. Проблема возникла из-за того, что в выданном модели задании фигурировала вымышленная компания, которая носила то же имя, что и реально существующая организация. Не сумев обнаружить тестовую цель, модель атаковала настоящий домен, извлекла учетные данные приложений и инфраструктуры, а затем получила доступ к БД с несколькими сотнями строк продакшен-данных.
Причем в ходе всех четырех запусков Claude в итоге пришла к выводу, что имеет дело с реальной системой. Однако в двух случаях ИИ счел, что реальная компания наверняка тоже является частью учений, и поэтому продолжил атаку.
В ходе третьего инцидента исследуемый ИИ просканировал около 9000 адресов, затем скомпрометировал доступное через интернет приложение с помощью SQL-инъекции и учетных данных, взятых с debug-страницы. Позже модель заметила, что хост, который она атакует, находится в облачной учетной записи, которая явно не связана с заданием. Модель сделала вывод, что это реальная система, после чего остановила атаку самостоятельно.
Во всех описанных случаях модели не изобретали никаких новых техник атак: в основе всех инцидентов лежали слабые пароли, открытые эндпоинты и типовые уязвимости. Однако выяснилось, что самый ранний инцидент произошел еще в апреле 2026 года и оставался незамеченным около трех месяцев.
При этом в Anthropic настаивают, что проблема заключалась не в том, что модели Claude проигнорировали какие-либо ограничения, а в ошибках, допущенных при настройке тестовой инфраструктуры и при проведении тестов. Так, моделям сообщали, что доступа к интернету нет, однако на самом деле выход в сеть оставался открытым.
Кроме того, во время этих тестирований не работали классификаторы и системы мониторинга, которые используются в публичных версиях Claude. Теперь в компании обещают тщательнее проверять логи, улучшить инструменты для проведения расследований, а также привлечь специалистов METR для независимой оценки.
https://xakep.ru/2026/07/31/claude-attacks/
Reuters: в OpenAI неделю не замечали, что их ИИ-агент проводил атаки
По данным собственных источников Reuters, экспериментальный ИИ-агент OpenAI несколько дней атаковал Hugging Face, однако сотрудники компании поняли, что происходит, только через неделю — уже после того, как специалисты платформы остановили атаку и обратились в ФБР.
На прошлой неделе стало известно, что ИИ-агент OpenAI, работавший на базе GPT-5.6 Sol и еще одной «более мощной модели», пока недоступной публично, атаковал Hugging Face. Дело в том, что перед ИИ поставили задачу искать сложные цепочки эксплуатации в рамках ExploitGym — бенчмарка, который проверяет, насколько хорошо модели умеют находить и использовать уязвимости.
Чтобы проверить реальные возможности моделей, в OpenAI намеренно ослабили ограничения на опасные ИБ-запросы, а также отключили часть защитных механизмов, которые обычно блокируют высокорисковую активность.
Тестирование проводилось в изолированной среде, и доступ к сети ограничивался установкой пакетов через размещенный внутри инфраструктуры сторонний прокси. Однако ИИ нашел уязвимость нулевого дня в этом сервисе и воспользовались ею, а затем повысил привилегии и перемещался по исследовательской сети до тех пор, пока не обнаружил машину с выходом в интернет.
Получив доступ к сети, модели предположили, что на Hugging Face могут храниться датасеты, модели и решения для ExploitGym, после чего начали искать способ добраться до этой «секретной информации» и обмануть тест.
Новые данные Reuters свидетельствуют о том, что специалисты OpenAI далеко не сразу обнаружили потерю контроля. По словам двух неназванных источников издания, первые попытки агента покинуть тестовую среду начались еще примерно 9 июля, тогда как, по словам представителей Hugging Face, атака на инфраструктуру платформы продолжалась с 11 по 13 июля.
16 июля специалисты Hugging Face опубликовали отчет об атаке, заявив, что за инцидентом стоит неизвестная «система автономных ИИ-агентов». Лишь после этого в OpenAI предположили, что за атакой может стоять их собственный ИИ.
В выходные 18–19 июля сотрудники OpenAI обнаружили во внутренних логах следы побега агента из песочницы. В итоге первый прямой контакт между Hugging Face и OpenAI состоялся примерно 20 июля, а публично об инциденте в OpenAI рассказали 21 июля. К этому моменту специалисты Hugging Face уже остановили атаку и уведомили об инциденте ФБР.
По информации источников Reuters, первые тревожные сигналы появлялись еще до начала атаки. К примеру, в одном из тестов агент оставил заметки, предположительно адресованные будущим версиям самого себя. В них описывались методы, с помощью которых ИИ-агенты могут обходить внутренние ограничения OpenAI.
Журналистам не удалось установить, были ли эти эпизоды связаны именно с тем агентом, который в итоге атаковал Hugging Face. Источники агентства отмечают, что в OpenAI одновременно тестируют множество моделей, и эти тесты генерируют огромные объемы логов, за которыми сотрудники компании не всегда успевают следить.
В OpenAI назвали случившееся беспрецедентным инцидентом и «важным моментом для ИИ-безопасности». В настоящее время компания проводит расследование с привлечением внешних экспертов и обещает позже опубликовать детальный технический отчет.
Представитель OpenAI заявил агентству, что в материале Reuters есть «ряд неточностей», однако не уточнил, о чем именно идет речь.
https://xakep.ru/2026/07/28/ai-attack/
В OpenAI сообщили, что за взломом Hugging Face стоят две ИИ-модели компании
Представители OpenAI заявили, что за недавним взломом Hugging Face стояли экспериментальные ИИ-модели компании. Во время внутреннего теста ИИ-агенты нашли 0-day-уязвимость в изолированной исследовательской инфраструктуре, добрались до открытого интернета и атаковали Hugging Face, пытаясь найти на платформе ответы для бенчмарка ExploitGym.
Напомним, что недавно представители Hugging Face сообщили, что компания пострадала от кибератаки. Атакующие получили доступ к части внутренних датасетов, а также к учетным данным для облачной инфраструктуры и кластеров. В компании подчеркивали, что атаку провела система автономных ИИ-агентов, выполнившая тысячи действий практически без участия человека. Однако не удалось установить, какую именно LLM использовали злоумышленники.
По данным Hugging Face, атака развивалась на протяжении всех прошлых выходных. В логах специалисты насчитали более 17 000 событий и сообщили, что агентный фреймворк распределял задачи между множеством песочниц, которые создавались на короткое время и затем удалялись.
Как теперь сообщили специалисты OpenAI, в инциденте участвовали GPT-5.6 Sol и еще одна «более мощная модель», пока недоступная публично. Атака на Hugging Face произошла во время внутреннего тестирования моделей. Перед ИИ поставили задачу искать сложные цепочки эксплуатации в рамках ExploitGym — бенчмарка, который проверяет, насколько хорошо модели умеют находить и использовать уязвимости.
Чтобы оценить полные возможности моделей, в OpenAI намеренно ослабили ограничения на опасные ИБ-запросы и отключили продакшн-классификаторы, которые обычно блокируют высокорисковую активность.
Тест проводился в изолированной среде, и доступ к сети ограничивался установкой пакетов через размещенный внутри инфраструктуры сторонний прокси, который также кешировал содержимое реестров. Однако ИИ-агенты нашли уязвимость нулевого дня в этом сервисе и использовали ее. Затем они повысили привилегии и перемещались по исследовательской сети до тех пор, пока не нашли машину с выходом в интернет.
Получив доступ в сеть, модели предположили, что на Hugging Face могут храниться датасеты, модели и решения для ExploitGym, после чего начали искать способ добраться до этой «секретной информации» и обмануть тест. По данным OpenAI, в одной из цепочек агенты задействовали похищенные учетные данные и еще одну 0-day-уязвимость, стремясь найти путь к удаленному выполнению кода на серверах Hugging Face. В итоге модели извлекли решения для тестовых заданий напрямую из продакшн-базы платформы.
«Все свидетельствует о том, что модели целиком сосредоточились на поиске решения для ExploitGym и пошли на крайние меры ради довольно узкой тестовой цели», — объяснили в OpenAI.
В конечном счете, аномальную активность заметили как специалисты OpenAI, так и защитные системы Hugging Face. Сотрудники платформы остановили атаку и начали проводить анализ инцидента с помощью опенсорсных моделей.
Представители OpenAI называют случившееся беспрецедентным киберинцидентом и признают, что продвинутые модели уже способны самостоятельно обнаруживать и использовать новые цепочки атак в реальных системах, не имея доступа к исходному коду.
Сообщается, что теперь тестовую инфраструктуру дополнительно изолировали, а о найденной уязвимости сообщили разработчику прокси, название которого не раскрывается. Кроме того, в OpenAI пообещали усилить мониторинг, контроль доступа и защиту будущих тестов, даже если это замедлит проведение исследований.
В настоящее время расследование инцидента продолжается совместно со специалистами Hugging Face.
«Этот инцидент, возможно, первый в своем роде, подтверждает то, во что мы давно верили: безопасность ИИ не сможет обеспечить одна компания, работающая втайне, — комментирует сооснователь и глава Hugging Face Клем Деланг (Clem Delangue). — Решать эту проблему придется открыто и сообща, предоставив ИБ-специалистам по всему миру широкий доступ к ИИ».
https://xakep.ru/2026/07/22/hugging-face-opeanai/
Комментариев нет:
Отправить комментарий