безопасность

HF опубликовали подробный разбор, как их взломала новая модель OpenAI.

Модель не находила новых зеродеев, но настойчивости человека бы не хватило собрать уязвимости в цепочку, а вот модель собрала. Ну и защищающиеся использовали опен-сорс модели для анализа действий атакующих.

Впечатляющий интерактивный дэшборд.

Подъехали подробности про блокировку fable 5.

Крестная мать баг-баунти програм (она запустила bug bounty в Microsoft и в Минобороны США, не баран чихнул), Кейти Муссурис, прочитала технический документ, который послужил основой для блокировки.

Говорит, что когда fable 5 дали на вход программу и попросили найти уязвимости, она отказалась. И тогда исследователь попросил модель исправить ошибки в этой программе. И подготовить тесты, чтобы проверить, исправлены ли они на самом деле.

Всё, это весь «взлом».

Можно конечно такое починить, но тогда модель станет абсолютно бесполезной для разработки софта.

🍿🍿

Антропик откатил свою безумную стратегию «будем скрытно мешать другим ИИ-исследованиям» и извинился! Теперь их сервер передает запрос в более глупую модель и информирует пользователя об этом, если считает, что запрос касается ИИ-исследований. Так же, как делает с запросами про биологическое и химическое оружие.

Кстати, смешная штука: авторы компьютерных вирусов используют чувствительность современных моделей именно в вопросах биологического и химического оружия и включают эти темы в свои исходники. Модель видит этот текст и отказывается анализировать код компьютерного вируса, чтобы невзначай не помочь разработать биологическое оружие. Работает, понятно, только на самых простых обвязках, но попытка хорошая!

Чтобы установить любой пароль на любой инстаграм-аккаунт, достаточно было попросить официального ИИ-бота техподдержки.

Прямо как в IoT, в аббревиатуре ИИ, буква Б означает безопасность. Уязвимость жила неделями, если не месяцами.

Не знаю, корректно ли называть их хакерами, но люди успели увести сотни аккаунтов с короткими адресами, а еще захватили на время официальные аккаунты Барака Обамы и другие.

Очень хорошо перекликается с недавним случаем, когда нейросеть обошла ограничения доступа на компьютере разработчика (docker bind-mount вместо sudo).

Понятно, что нейросетям нельзя доверять контроль доступа. Системы нужно строить так, чтобы у моделей физически не было доступа к опасным операциям.

Случай инстаграма граничит с халатностью — мы с вами говорим о краже аккаунтов в крупнейшей социальной сети на планете, но в целом построение систем с ИИ сводится к классической сисадминской задаче: дать пользователю (актору) ровно столько прав, сколько ему нужно для выполнения своих задач и ни капли больше.

Да и в целом «агентное программирование» стремится к старой доброй админской задаче построения из готовых блоков пространства, в котором живут и выполняют свои функции «агенты». Раньше это была операционная система и процессы в ней, теперь вот агенты и харнесы, но я вижу много параллелей.

А может просто я просто так и остался сисадмином :)

Когда ещё увидишь полный увод аккаунта из крупной соцсети за полторы минуты?

P. S. Говорят, там еще в полтора раза команду trust & safety подрезали за неделю, и некому on call разбираться с этим.

Министр финансов и глава Центробанка США вызвали глав крупных банков, чтобы предупредить их о новых кибер-опасностях, которые следуют от Claude Mythos и аналогичных моделей, сообщает Блумберг.

Приведу целиком знаменитую пасту:

Отец знакомого работает в ФСБ. Сегодня срочно вызвали на совещание. Вернулся поздно и ничего не объяснил. Сказал лишь собирать вещи и бежать в магазин за продуктами на две недели. Сейчас едем куда-то далеко за город. Не знаю что происходит, но мне кажется началось...

Я не заострил на этом внимание, но Claude Mythos уже нашла тысячи ранее неизвестных уязвимостей, включая во всех популярных операционных системах и во всех популярных браузерах!

Сегодня, в руках у одной этой компании, возможности кибер-нападения, сравнимые с ведущими правительствами (США, Китай, Россия, Израиль), а скорее даже превосходящие их.

Можно взломать и украсть секреты, можно слушать переговоры, можно подменять сообщения или нарушить коммуникацию в нужный момент. Можно управлять критической инфраструктурой. Как в рекламе: безграничные возможности!

Внутренние модели OpenAI вряд ли сильно отстают.

Друзья говорили мне, что ИИ станет вопросом национальной безопасности и все эти ведущие компании будут национализированы. Вспомнил об этом сегодня.

А ещё вспомнил предсказание ai2027 (мой краткий пересказ тут). Они предсказывали, что модели получат хакерские возможности сравнимые с профессиональными хакерами к маю 2026 года. Сейчас на дворе начало апреля.

Новая модель Claude Mythos находит уязвимости в софте лучше, чем большинство хакеров.

Три примера: 1) возможность удаленно уронить любой OpenBSD сервер, просто подключившись к нему по сети (а это ОС, знаменитая своей безопасностью), уязвимости 27 лет; 2) эскалация привилегий в ядре Линукса, от обычного пользователя до рута — через цепочку из 3-4 ошибок, одну уже запачтили, а ещё 4 примера они не публикуют, потому что исправлений ещё нет, но опубликовали криптографические подписи, чтобы потом доказать время создания 3) новые уязвимости во всех ключевых браузерах — опять же не публикуют, потому что они все живые.

Кажется, способность этой модели (и похожих, в будущем) эксплуатировать длинные цепочки уязвимостей, переходит из количества в качество. В защите есть принцип швейцарского сыра (defense in depth), когда за счет многослойной защиты, пробитие каждого отдельного уровня не ведет к катастрофе, потому что собрать цепочку из 6-7 уязвимостей слишком сложно. Для человека — сложно, для машины — уже нет.

Пока что они дают доступ к этой модели только ведущим ИТ-компаниям, чтобы те патчили свой софт и весь опен-сорс, до которого дотянутся. Выделяют 100 млн долларов на токены и 4 млн долларов на зарплаты программистам для опен-сорса.

С одной стороны — есть чего бояться про уязвимости, с другой стороны — хоть какой-то островок нормальности в безумном мире. Люди подумали и без лишней бюрократии чинят инфраструктуру, на которой держится цивилизация. Я бы даже привел аналогию плотины, которую поднимают перед цунами. Дает надежду на человечество.

А ещё, очень жду публичной доступности этой модели, потому что она не только в хакерстве крутая, но и в разработке софта. И то, чтО она вытворяет с кибербезопасностью — лучшая реклама её способностей в разработке, доверия в 100 раз больше, чем любым синтетическим тестам. Ждем!

Не успел написать про вирус в litellm, как очередная мощная supply chain attack: на этот раз взломали разработчика axios, одной из самых популярных nodejs библиотек, 100 миллионов скачиваний в неделю.

Зараженная версия библиотеки распространялась в течении 3 часов, начиная с 2026-03-30 23:59 UTC.

Если вы делали npm install этой ночью — проверьте тачку. И посмотрите логи CI/CD — если они отрабатывали в это окно и имели какие-либо секретные токены — их нужно срочно сротировать.

Подробное описание атаки тут.

От подобных атак можно защититься раз и навсегда: настройте свои системы управления пакетами так, чтобы они не скачивали библиотеки, обновленные в последние 72 часа. exclude-newer = "3 days” в uv или min-release-age=3 в npm — спросите у своей нейросети, и пусть другие будут бета-тестерами.

Публичные API ключи гугла, те, которые разработчики используют для вставки Google Maps карт себе на сайт, могут использоваться для доступа к перепискам с Gemini (ИИ от гугла) и скачивания загруженных туда файлов; а ещё с помощью этих же ключей можно пользоваться ИИ Gemini от имени создателя сайта (и гугл потом выставит им круглый счет за это).

Разработчики сообщают о счетах на десятки тысяч долларов.

Исследователи нашли уязвимость с ноябре 25го и гугл уже почистил большинство ключей, но если вы настраивали гугл-карты у себя на сайте или пользуетесь Firebase и включили на этом же GCP проекте Gemini API — стоит его выключить и перенести в отдельный проект.

🤯

Ну и две жуткие (или прекрасные?) в сочетании друг-с-другом новости из мира кибербезопасности.

Первая: свежая модель Claude 4.6 нашла сотни уязвимостей в популярном open source софте.

Причем без особых инструкций, ей дали доступ к компьютеру и среди прочего, она:
сама догадалась посмотреть коммиты с исправлениями багов безопасности и проверить, пропустили ли аналогичные ошибки в других местах проекта;
поняла, как работает алгоритм сжатия, и что будет ошибка, если сжатый текст будет размером больше, чем до сжатия.

Вторая новость: в программе блокнот (Notepad.exe) из Windows 11 обнаружили уязвимость, которая позволяет реализовать удаленное исполнение кода. Достаточно кликнуть на ссылку в Markdown’е.

Вайб-кодинг и автоматизированный поиск уязвимостей — созданы друг для друга.

Я уверен, что все ведущие государства (и криминалы пошустрее) уже запустили лучшие модели на самых больших кластерах для непрерывного поиска зеродеев. Есть небольшая надежда, что и создатели софта смогут находить уязвимости лучше, чем сейчас. Интересно, кто победит?

Из «старых добрых» атак: китайцы 4 месяца владели инфраструктурой обновления редактора Notepad++ (взломали сервер хостинг-провайдера, где хостились обновления) и изобретательно взломали около дюжины жертв. А это, между прочим, популярный редактор среди разработчиков, так что совершенно не ясно, какие у этой акции конечные цели и последствия. Это к вопросу об игре в долгую и о supply chain attacks. Не только израильтяне так умеют.

Кстати, я пересел с Grok и ChatGPT на Claude. Звучит человечнее и чуть поумнее, рекомендую.