Новое

страница 9 из 170

Я как-то упустил то, что команды агентов выкатили в claude code 2 дня назад, вместе с новой моделью 4.6!

В отличие от эксперимента выше — агенты могут общаться друг-с-другом. Саня делится в чате, что они в компании настроили персонажа Jazz, его альтер-эго: «You are an agent named Jazz whose purpose is to be grumpy, nitpicky old fart, doubt and question everything». Уже нашел 5 багов и другие агенты его боятся!

Знаю Саню лично, он крутой программист, владелец живого продукта с сотнями тысяч пользователей.

Будущее уже наступило. Просто оно распределено неравномерно.

Шутки шутками, а я сегодня впервые за долгое время задеплоил код в продакшен.

Федя уехал в отпуск, Настя нашла баги в лендинге нашего медицинского помощника, а я склонировал репозиторий, запустил локальную копию проекта и поговорил с клодом. Потом запушил изменения и благодаря прекрасно настроенному CI/CD, всё само доехало на сайт.

Аналогичный баг на бэкенде я исправлять пока не стал — боюсь, что не смогу запустить проект локально (зря, может быть), да и с данными лучше быть осторожным. Настроить всю эту инфраструктуру самостоятельно у меня заняло бы очень много времени, но внутри настроенного Федей харнеса, я могу направлять нейросети куда нужно.

Это напомнило мне статью о том, что будущее программистов — это SRE, то есть программисты-админы, которые будут поддерживать работоспособность проектов. Не уверен, что это правда (как видим, в большими проектах нейросетям все ещё нужна помощь с архитектурой), но сисадминство наверняка продержится дольше программирования.

Upd: добавил важный абзац в текст про компилятор, а то фокус был сбит:

Гораздо важнее траектория развития способностей нейросетей. 4-я модель «Опуса» еле-еле генерировала работоспособный компилятор. 4.5 первым прошел крупные тесты, но не мог скомпилировать реальные проекты. 4.6 вышедший на днях может компилировать реальные проекты. Что сможет следующая модель?

Как ещё одну иллюстрацию этого проекта, приложу видео про профессионального создателя машин Голдберга.

Тоже неодушевленные предметы делают удивительные вещи. Самостоятельно!

Люблю статьи Антропика, в них чувствуется живой человек, а не только пресс-релизы, как у OpenAI.

В этот раз исследователи нащупали пределы того, на что способны «команды» из агентов, работающие автономно, без участия человека: 16 агентов в параллели, в течении 2000 сессий разработали компилятор языка Си на Rust. Компилятор успешно собирает ядро линукса, QUEMU, ffmpeg, sqlite, postgres, redis, успешно проходит 99% тестов компиляторов.

Под капотом это несколько простых баш-скриптов, запускающих docker-контейнер с агентом, синхронизируется всё через git. Каждый раз, когда агент берет задачу, он коммитит файл с именем задачи в репозиторий, чтобы не было такого, что два агента работают над одним и тем же. Никакой хитрой оркестрации или «главного агента» с мастер-планом: каждый агент выбирает, что он считает самым важным, работает над этой фичей, сохраняет историю, и так в бесконечном цикле.

Звучит магически, но мне вся эта история напоминает очень крутую Машину Голдберга. Да, нейросети создают компилятор «самостоятельно», но рядом с ними 7 инженеров тратят несколько недель на филигранную настройку среды под это. Они следили, где модели затыкаются и корректировали упряжь, в первую очередь тесты и инфраструктуру, чтобы в следующий раз их не занесло.

Работу по написанию кода они заменили на работу по настройке упряжи.

И получили на выходе, конечно же, супер хрупкую штуку, которую невозможно развивать и поддерживать. Например, исследователи пишут, что так и не смогли создать таким способом работающие ассемблер и линкер, а некоторые проекты так и не скомпилировались; пытаясь исправить одну часть, нейросети ломали другую.

Это классическая ситуация, в которой оказываются команды со слишком большим техническим долгом. Тот самый легаси! Меня регулярно зовут делать аудиты и приводить такие системы в порядок, до боли знакомая картина.

В видео-анонсе Антропик пишет, что то, что заняло бы у команды людей месяцы, нейросети сделали за 2 недели. Абсолютно верно! Обычные команды разработки доходят до такого жуткого состояния легаси за годы разработки. С помощью нейросетей можно заспридранить этот процесс за 2 недели с минимальным участием людей! И стоит всего 20 тысяч долларов на API запросы!

То есть на выходе мы имеем полурабочее легаси без какого-либо пути к улучшению. Только если в обычном легаси у нас есть хотя бы углубленное понимание задачи, то в этом случае всё понимание задачи ограничивается тестами, которые они взяли на стороне как вводные для проекта. И попробуй ещё найти задачу, для которой существуют настолько же хорошие (восхитительные) тесты, как для компиляторов; человечество вложило в них человеко-годы!

Как говорил персонаж в сериале Чернобыль: «3.6 roentgen—not great, not terrible».

Гораздо важнее траектория развития способней моделей. 4-я модель «Опуса» еле-еле генерировала работоспособный компилятор. 4.5 первым прошел крупные тесты, но не мог скомпилировать реальные проекты. 4.6 вышедший на днях может компилировать реальные проекты. Что сможет следующая модель?

Исследование очень классное и тональность статьи идеальная — без лишнего хайпа. Рекомендую первоисточник.

Иллюстрация — тот самый вечный цикл, в котором крутились агенты.

Помните, мы перезапустили Синхронизацию за 3 месяца вместо года?

Так вот: после этого, мы ещё за месяц работы, силами одного программиста (!) запустили им мобильное приложение!

Есть такой фреймворк Capacitor.js. Он позволяет переиспользовать код сайтов в мобильных приложениях. Это довольно рискованный прием и хочется поделиться тем, как красиво получилось в этот раз, несмотря на 9 кругов ада внутри.

Разработчик приложения и автор статьи — Эдуард Аксамитов.

Иллюстрация: «Круги Ада» Боттичелли, Библиотека Ватикана

Ядро чатжпт работает на одном Postgres-сервере с 50 read-only репликами. Это к вопросу о масштабируемости и потребности в сложной инфраструктуре.

PostgreSQL — одна из фундаментальных программ, на которых держится половина интернета и компьютерных систем в целом. Это бесплатная база данных, которой пользуются все — от маленьких интернет-магазинов до банков и крупнейшие сервисы на планете. Именно она гарантирует, что наши данные не потеряются и будут доступны в любой момент.

Этот проект сильно повлиял на мою жизнь. Именно по его прекрасной документации я учился базам данных. Это одновременно один из лучших учебников по теме для студентов и в то же время справочный материал для профессионалов.

У postgres открытая, по-настоящему распределенная разработка, в которой участвуют сотни инженеров со всего мира.

Многие ИТ-проекты держатся на власти диктатора (Линукс на Линусе), а Postgres вот уже 30 лет управляется меритократией в консенсусной модели.

Свободная BSD-подобная лицензия, которая (в отличие от религиозной GPL) позволяет открыто делать коммерческие продукты на его основе.

Отличная обратная совместимость и близкое соответствие стандартам, и при этом они умудряются первыми реализовывать фичи, которые только позже появляются в платных БД.

PostgreSQL как программа — это настоящее произведение инженерного искусства, а проект в целом — чудо в плане самоорганизации людей. Горжусь, что у нас как у человечества получилось сделать такую красивую штуку.

Я рад, что Postgres постепенно становится самой популярной базой для начинающих, заменяя MySQL.

Проекты, которые мы делаем с Федей и командой, сильно отличаются от постгреса всем — и размером, и стеком, и задачами. Но это тот уровень инженерного мастерства, которым вдохновляюсь я и на который, я надеюсь, равняется вся моя команда.

Помните MCP? json/http протокол, оптимизированный для нейросетей.

Теперь модно делать skills — «навыки». Это папка с документацией, данными и скриптами в определенном формате, чтобы нейросетям было удобнее ими пользоваться.

Вообще, похоже на просто хорошую документацию. Проще = лучше.

Думаю, что с развитием нейросетей, все эти костыли со стандартами потеряют свою актуальность. Тем не менее, прямо сейчас они упрощают жизнь моделям. Примеры тут.

Интересно: с одной стороны, вся эта движуха с нейросетями, агентами и прочим «запустим продукт за неделю».

С другой стороны, больша́я часть наших проектов — «разобраться в огромной 20-летней системе, половина которой на хранимках, половина в MSSQL, половина в PostgreSQL (хорошо если не Oracle), а большая часть в C++ и Delphi, чтобы вернуть прозрачность и управляемость, опять быстро вносить изменения / запустить тот же бизнес в новой географии».

В таких проектах нейросети тоже полезны, но главный ограничитель этих задач — не в скорости программирования или числе разработчиков (рук). Там главное — системное мышление, опыт, умение разговаривать с людьми, здравый смысл и вкус. ❤️