агенты

Тем временем, Claude Code это оказывается уже для нормисов, а модные ребята пересели на более крутую open source упряжь openCode, которая поддерживает любые модели (а не только от anthropic). Ну и конечно есть безумно прокачанный форк от китайцев oh-my-opencode, который прямо сейчас запускают как отдельный сервис, Сизиф. Нейминг как у самолета Антея.

Узнал об этих инструментах из драмы, которая разворачивается прямо сейчас: формально, Anthropic разрешает пользоваться своими моделями с подпиской Pro и Max только внутри своего Claude Code. Пару часов назад, они начали блокировать запросы из openCode, после чего пользователи стали жаловаться, что Claude Code — это каменный век и отменять подписки. При этом модели Anthropic, по словам пользователей, лучше конкурентов. Моделями Anthropic можно пользоваться «по API» без скидок и ограничений, но если платить за каждый запрос — получаются совсем безумные цифры даже для модных вайбкодеров.

Вряд ли Anthropic стал бы бороться с чужими инструментами, будь они хуже родного. Получается, лучшая (и честная) рекомендация от ведущей лаборатории!

Наконец-то приличный ИИ-мультиплеер, то есть возможность совместно общаться с агентами, иметь общую историю. А заодно, замена слеку и гитхабу. Децентрализованная, киберпанковская, опенсорсная, на основе открытого протокола.

И сделал, конечно, Джек Дорси, создатель твиттера.

Называется Buzz, типа Вжжж, а агенты там — вроде как пчелки.

Есть даже возможность делиться своим compute, то есть нейросети могут пользоваться вычислительными мощностями (и токенами!) всех согласных участников чата.

И никаких центральных серверов, которые можно заблокировать и санкционировать. Прям глоток свежего воздуха.

Developer preview скачивать тут, все исходники открыты на гитхабе. 🐝

Самый популярный диалог среди программистов в последние 2 дня:

Андрей Карпатый (член первоначальной команды OpenAI, известный публичный эксперт ИИ): жалуется, что чувствует, что не успевает за современными инструментами разработки. Речь про ИИ-инструменты, конечно: agents, subagents, their prompts, contexts, memory, modes, permissions, tools, plugins, skills, hooks, MCP, LSP, slash commands, workflows, IDE integrations.

Ему отвечает Борис Черный (руководитель Claude Code), что прошел первый месяц, когда он не открывал IDE и весь код в Claude Code за него писала Opus 4.5. И ещё приводит пример, когда он попытался искать утечку памяти по старинке, подключив профайлер, а коллега просто попросил нейросеть сделать дамп и поискать, что там есть лишнего.

Борис разрабатывает этот инструмент, ему положено хайповать. И очевидно, что программисты все равно нужны. Но инструменты на самом деле развиваются с умопомрачительной скоростью и лучше всего ими пользуются те, кто работают над улучшением инструментов. Нас ждет очень интересный год.

Я как раз на днях думал, что только недавно смог уверенно сказать, что мы с Федей и коллегами успешно построили компанию по созданию софта. Большие проекты, маленькие, в стартапах и корпорациях — мы стабильно запускаем проекты каждые несколько месяцев. Такая пиратская шхуна, в которой каждый на своем месте. И вот только мы научились уверенно жить в этом мире, как опять шторм.

Мы тут начали делать свой продукт — медицинского ИИ-консультанта. (да, на основе и с помощью ИИ)

Многие советуются с ИИ про здоровье. Пишут свои симптомы, загружают анализы, просят разъяснить диагнозы и получают второе мнение.

Искусственный интеллект может быть очень мощным помощником, но важно уметь составить правильный запрос и дать ему весь необходимый контекст.

Плюс, у людей, которые активно этим пользуются, возникает проблема менеджмента переписки: какой это был чат, в какой программе, а где я уже загрузил эти выписки и анализы? А хранение и каталогизация медицинской истории и документов, чтобы можно было использовать их в будущем — это вообще отдельная песня.

Мы решили сделать небольшое приложение, которое задаст все необходимые уточняющие вопросы и даст четкий ответ, и при этом будет вести «личный медицинский профиль» — сохранять все заболевания, анализы, выписки и т. д., используя их в дальнейших консультациях.

За пару дней накидали дизайн в фигме и в lovable: окно чата + раздел «моё здоровье», где заболевания и документы. Принципиальная схема приложения банальная — бэкенд на питоне с базой в postgres и фронт на js.

Бэкенд пишет руками сам Федя. Во первых, вайб-кодить бэкенд — себе дороже — ИИ пока что оставляет слишком большие дырки с точки зрения безопасности, а медицинская история — это не шутки; во вторых, мы хотим разобраться, как интегрироваться с AI.

Мне казалось, что учитывая всю эту AI-движуху, должны быть практически готовые технологические решения для проектов, подобных нашему. На слуху Langgraph, PySpur, dify — на словах они обещают ровно то, что нам нужно. Бери любой, крути поверх бизнес-логику и наслаждайся!

В реальности, всё тлен. Вот короткий внутренний статус от Феди после недели исследования:

Потратил несколько часов на работу с Langgraph и полностью в нём разочаровался:
— Документация не соответствует действительности. Копируешь куски — не работают.
— Переусложнённые абстракции. У него очень высокий порог входа — я за 3 часа не смог написать инструмент, который написал бы за 10 строк чистого httpx.post(‘https://api.openai.com')
— Все действительно полезные примитивы попрятаны внутрь langgraph platform, которая выглядит как closed source bloatware с нулевым devex. Без него придётся самим разруливать стейт между пользователями и делать API телеги/lovable

Что ещё я посмотрел:
— pyspur: Купился на автотесты запросов прямо в UI. К сожалению, проект выглядит мёртвым. Как будто бы 5к звёзд у него накручены — в issues почти пусто, а в дефлотной установке не работает даже справка по CLI: я натурально так и не смог её прочитать за час, угадывал.
— dify: купил за то, что у них прямо на лендосе визуально построен граф для бота поддержки медклиники. Выглядит кайфово, но я не смог понять, как ему подсовывать свой собственный стейт юзера. У них есть свои memories, но это очень тяжёлый вендорлок, и нет уверенности что туда влезет то, что нам надо.

Кажется, dify мог бы нам подойти, но с ним MVP не пойдёт дальше founders-friends-family, т.к. у себя его не развернуть (несмотря на заявления на лендосе там полный пиздец в инфраструктуре), то есть никаких локальных моделей для тестирования.

В общем, классическая на сегодняшний день ситуация, когда много блестящего вокруг, но настоящего, хорошего — нет. В результате, Федя написал свой код на питоне и основная бизнес-логика уже работает.

Про фронтенд напишу в следующий раз.

Надеюсь, уже в ближайшие недели будет рабочий прототип, который мы покажем друзьям и знакомым. На бета-тест записаться вот тут.

Чтобы установить любой пароль на любой инстаграм-аккаунт, достаточно было попросить официального ИИ-бота техподдержки.

Прямо как в IoT, в аббревиатуре ИИ, буква Б означает безопасность. Уязвимость жила неделями, если не месяцами.

Не знаю, корректно ли называть их хакерами, но люди успели увести сотни аккаунтов с короткими адресами, а еще захватили на время официальные аккаунты Барака Обамы и другие.

Очень хорошо перекликается с недавним случаем, когда нейросеть обошла ограничения доступа на компьютере разработчика (docker bind-mount вместо sudo).

Понятно, что нейросетям нельзя доверять контроль доступа. Системы нужно строить так, чтобы у моделей физически не было доступа к опасным операциям.

Случай инстаграма граничит с халатностью — мы с вами говорим о краже аккаунтов в крупнейшей социальной сети на планете, но в целом построение систем с ИИ сводится к классической сисадминской задаче: дать пользователю (актору) ровно столько прав, сколько ему нужно для выполнения своих задач и ни капли больше.

Да и в целом «агентное программирование» стремится к старой доброй админской задаче построения из готовых блоков пространства, в котором живут и выполняют свои функции «агенты». Раньше это была операционная система и процессы в ней, теперь вот агенты и харнесы, но я вижу много параллелей.

А может просто я просто так и остался сисадмином :)

Когда ещё увидишь полный увод аккаунта из крупной соцсети за полторы минуты?

P. S. Говорят, там еще в полтора раза команду trust & safety подрезали за неделю, и некому on call разбираться с этим.

Я как-то упустил то, что команды агентов выкатили в claude code 2 дня назад, вместе с новой моделью 4.6!

В отличие от эксперимента выше — агенты могут общаться друг-с-другом. Саня делится в чате, что они в компании настроили персонажа Jazz, его альтер-эго: «You are an agent named Jazz whose purpose is to be grumpy, nitpicky old fart, doubt and question everything». Уже нашел 5 багов и другие агенты его боятся!

Знаю Саню лично, он крутой программист, владелец живого продукта с сотнями тысяч пользователей.

Будущее уже наступило. Просто оно распределено неравномерно.

OpenAI выпустил новую модель, вдогонку к недавнему добавлению computer use в их обвязку Codex. Обещают, что эта штука теперь умеет доводить до конца сложные задачи на компьютере, вроде «возьми отсюда, сделай то, отпишись туда».

Схема для тех, кто запутался, какая модель теперь самая мощная

Мне тут наконец-то объяснили, такое AI-агент.

Это когда мы в первом запросе предоставляем ИИ список тулов, которыми ей можно пользоваться. Пользоваться — это просить нас (клиента) запустить тул с нужными параметрами и вернуть нейросети ответ. И всё это в вечном цикле, не забывая каждый раз прикреплять к запросу всю предыдущую историю переписки. Всё.

Вот отличная статья с примером полной программы, которая делает именно это. Подзаголовок замечательный «Король-то голый!»

Отсутствие сложности не делает этот прием менее полезным. Если включить этот режим в редакторе Cursor — то он сам запросит нужные файлы, прогонит линтер и запустит любые другие нужны утилиты. «Вы и есть за меня будете?!»

Люблю статьи Антропика, в них чувствуется живой человек, а не только пресс-релизы, как у OpenAI.

В этот раз исследователи нащупали пределы того, на что способны «команды» из агентов, работающие автономно, без участия человека: 16 агентов в параллели, в течении 2000 сессий разработали компилятор языка Си на Rust. Компилятор успешно собирает ядро линукса, QUEMU, ffmpeg, sqlite, postgres, redis, успешно проходит 99% тестов компиляторов.

Под капотом это несколько простых баш-скриптов, запускающих docker-контейнер с агентом, синхронизируется всё через git. Каждый раз, когда агент берет задачу, он коммитит файл с именем задачи в репозиторий, чтобы не было такого, что два агента работают над одним и тем же. Никакой хитрой оркестрации или «главного агента» с мастер-планом: каждый агент выбирает, что он считает самым важным, работает над этой фичей, сохраняет историю, и так в бесконечном цикле.

Звучит магически, но мне вся эта история напоминает очень крутую Машину Голдберга. Да, нейросети создают компилятор «самостоятельно», но рядом с ними 7 инженеров тратят несколько недель на филигранную настройку среды под это. Они следили, где модели затыкаются и корректировали упряжь, в первую очередь тесты и инфраструктуру, чтобы в следующий раз их не занесло.

Работу по написанию кода они заменили на работу по настройке упряжи.

И получили на выходе, конечно же, супер хрупкую штуку, которую невозможно развивать и поддерживать. Например, исследователи пишут, что так и не смогли создать таким способом работающие ассемблер и линкер, а некоторые проекты так и не скомпилировались; пытаясь исправить одну часть, нейросети ломали другую.

Это классическая ситуация, в которой оказываются команды со слишком большим техническим долгом. Тот самый легаси! Меня регулярно зовут делать аудиты и приводить такие системы в порядок, до боли знакомая картина.

В видео-анонсе Антропик пишет, что то, что заняло бы у команды людей месяцы, нейросети сделали за 2 недели. Абсолютно верно! Обычные команды разработки доходят до такого жуткого состояния легаси за годы разработки. С помощью нейросетей можно заспридранить этот процесс за 2 недели с минимальным участием людей! И стоит всего 20 тысяч долларов на API запросы!

То есть на выходе мы имеем полурабочее легаси без какого-либо пути к улучшению. Только если в обычном легаси у нас есть хотя бы углубленное понимание задачи, то в этом случае всё понимание задачи ограничивается тестами, которые они взяли на стороне как вводные для проекта. И попробуй ещё найти задачу, для которой существуют настолько же хорошие (восхитительные) тесты, как для компиляторов; человечество вложило в них человеко-годы!

Как говорил персонаж в сериале Чернобыль: «3.6 roentgen—not great, not terrible».

Гораздо важнее траектория развития способней моделей. 4-я модель «Опуса» еле-еле генерировала работоспособный компилятор. 4.5 первым прошел крупные тесты, но не мог скомпилировать реальные проекты. 4.6 вышедший на днях может компилировать реальные проекты. Что сможет следующая модель?

Исследование очень классное и тональность статьи идеальная — без лишнего хайпа. Рекомендую первоисточник.

Иллюстрация — тот самый вечный цикл, в котором крутились агенты.