anthropic

Люблю статьи Антропика, в них чувствуется живой человек, а не только пресс-релизы, как у OpenAI.

В этот раз исследователи нащупали пределы того, на что способны «команды» из агентов, работающие автономно, без участия человека: 16 агентов в параллели, в течении 2000 сессий разработали компилятор языка Си на Rust. Компилятор успешно собирает ядро линукса, QUEMU, ffmpeg, sqlite, postgres, redis, успешно проходит 99% тестов компиляторов.

Под капотом это несколько простых баш-скриптов, запускающих docker-контейнер с агентом, синхронизируется всё через git. Каждый раз, когда агент берет задачу, он коммитит файл с именем задачи в репозиторий, чтобы не было такого, что два агента работают над одним и тем же. Никакой хитрой оркестрации или «главного агента» с мастер-планом: каждый агент выбирает, что он считает самым важным, работает над этой фичей, сохраняет историю, и так в бесконечном цикле.

Звучит магически, но мне вся эта история напоминает очень крутую Машину Голдберга. Да, нейросети создают компилятор «самостоятельно», но рядом с ними 7 инженеров тратят несколько недель на филигранную настройку среды под это. Они следили, где модели затыкаются и корректировали упряжь, в первую очередь тесты и инфраструктуру, чтобы в следующий раз их не занесло.

Работу по написанию кода они заменили на работу по настройке упряжи.

И получили на выходе, конечно же, супер хрупкую штуку, которую невозможно развивать и поддерживать. Например, исследователи пишут, что так и не смогли создать таким способом работающие ассемблер и линкер, а некоторые проекты так и не скомпилировались; пытаясь исправить одну часть, нейросети ломали другую.

Это классическая ситуация, в которой оказываются команды со слишком большим техническим долгом. Тот самый легаси! Меня регулярно зовут делать аудиты и приводить такие системы в порядок, до боли знакомая картина.

В видео-анонсе Антропик пишет, что то, что заняло бы у команды людей месяцы, нейросети сделали за 2 недели. Абсолютно верно! Обычные команды разработки доходят до такого жуткого состояния легаси за годы разработки. С помощью нейросетей можно заспридранить этот процесс за 2 недели с минимальным участием людей! И стоит всего 20 тысяч долларов на API запросы!

То есть на выходе мы имеем полурабочее легаси без какого-либо пути к улучшению. Только если в обычном легаси у нас есть хотя бы углубленное понимание задачи, то в этом случае всё понимание задачи ограничивается тестами, которые они взяли на стороне как вводные для проекта. И попробуй ещё найти задачу, для которой существуют настолько же хорошие (восхитительные) тесты, как для компиляторов; человечество вложило в них человеко-годы!

Как говорил персонаж в сериале Чернобыль: «3.6 roentgen—not great, not terrible».

Гораздо важнее траектория развития способней моделей. 4-я модель «Опуса» еле-еле генерировала работоспособный компилятор. 4.5 первым прошел крупные тесты, но не мог скомпилировать реальные проекты. 4.6 вышедший на днях может компилировать реальные проекты. Что сможет следующая модель?

Исследование очень классное и тональность статьи идеальная — без лишнего хайпа. Рекомендую первоисточник.

Иллюстрация — тот самый вечный цикл, в котором крутились агенты.

Ну что, великий и страшный mythos (миф) от антропика наконец опубликовали, в обрезанном виде, назвали fable (басня).

Доступен по подписке, токены ест как не в себя, но результаты хорошие. Берет полноценные задачи и доводит их до конца самостоятельно за условные 9 часов автономной работы. Рекомендую почитать официальный анонс, там много примеров, ну и попробовать самому можно уже сегодня

Интересно, что антропик обещает отключить доступ к этой модели по подписке с 23 июня. То есть у нас есть 2 недели, чтобы попробовать, какая она классная, а дальше уже принимать решение, готовы ли мы платить тысячи долларов за токены.

Вообще, это интересный аспект всей этой нейросетевой безумии: частные лица покупают подписку за 20/200 долларов в месяц и пользуются условно сколько хотят, а корпоративные тарифные планы учитывают каждый токен по-отдельности по АПИ-тарифам. В сочетании с токен-максингом, когда компании мотивировали программистов жечь побольше токенов в том числе лидербордами (кто сжег побольше), суммы получаются совершенно астрономические, экономически неподъемные даже для крупнейших игроков. Яркий пример — Uber: за четыре месяца сжег ИИ-бюджет на год и теперь ввел лимит в 2000 долларов на токены на разработчика в месяц.

Интересно, не уж то эпоха субсидированных токенов и совсем безлимитного ИИ-программирования заканчивается и для частных лиц?

Оно и понятно, индустрия пытается переключиться из режима «дай ИИ конкретную маленькую подзадачу и сиди смотри, как она ее решает, работая вместе с ней», в режим «модели решают вот эту большую задачу самостоятельно, работая в автоматизированном цикле 24/7, работа инженера — тюнить цикл», и тут нужны хоть какие-то ограничения на то, сколько таких циклов ты запустил одновременно и мотивация на их оптимизацию. Иначе это как бесплатное электричество.

На картинках — два главных графика, какую долю задач модели доводят до конца успешно и сколько токенов при этом тратят.

Нейросеть научили управлять компьютером — видеть экран, кликать мышкой, печатать.

Это обновление популярной модели Claude от Anthropic, основного конкурента OpenAI.

Функция в бете, доступна только через API для разработчиков; попробовать самому можно через готовый Docker-образ или open-interpreter. Рассказ, как они её сделали — здесь.

Ещё одно ограничение (стр 13), которое мы видим среди нейросетей впервые:

При попытках использовать Fable 5 для обучения других моделей, она не будет отказываться, но будет мешать это делать, скрытно от пользователя.

Ощущение, что мы с вами жили в «раннюю эпоху LLM», которая заканчивается.

Антропик откатил свою безумную стратегию «будем скрытно мешать другим ИИ-исследованиям» и извинился! Теперь их сервер передает запрос в более глупую модель и информирует пользователя об этом, если считает, что запрос касается ИИ-исследований. Так же, как делает с запросами про биологическое и химическое оружие.

Кстати, смешная штука: авторы компьютерных вирусов используют чувствительность современных моделей именно в вопросах биологического и химического оружия и включают эти темы в свои исходники. Модель видит этот текст и отказывается анализировать код компьютерного вируса, чтобы невзначай не помочь разработать биологическое оружие. Работает, понятно, только на самых простых обвязках, но попытка хорошая!

Claude Code адаптировали для обычных людей, в GUI интерфейсе внутри Claude Desktop и назвали Cowork. Доступно только по подписке Max. Спасибо, я пока в терминале посижу. Но красиво!

Будьте осторожны, когда даете нейросети разрешение редактировать файлы в папке. Лучше иметь вторую копию. С исходниками вопросов нет — они все в гите, все ходы записаны, а вот с файлом презентации и отчета может получиться неудобно.

Интересно, что эта ситуация касается меня лично: у нас недавно появился необычный клиент. Он разрабатывает суперкрутого голосового ассистента: долина, раунды на десятки млн $, огромная кодовая база на млн строк, написанная целиком нейросетями, под предводительством одного основателя.

Наша задача — привести все это в порядок, стабилизировать, обеспечить развитие и масштабирование.

На текущий момент мы в основном пользуемся моделями от антропика, но как я могу быть уверен, что свежая модель не решит, что мы конкуренты?