агенты

Я наконец-то добрался сам попробовать Claude Code и это очень крутая штука, не только для программистов.

Если вы любите копаться в компьютерах, но «не настоящий программист» — рекомендую попробовать. Программистам — тем более.

Это программа, которая наконец-то может управлять нашим компьютером. Пусть пока только через терминал, но благодаря unix-утилитам, через командную строку она может делать почти всё что угодно.

Она сама открывает сайты, скачивает, читает и создает файлы, запускает другие программы (это нынче называют «агент» или «harness», упряжь для нейросети), уточняет, что ты хочешь, сама ставит себе задачи и сама запускает свои копии для их решения (это «оркестратор»)! Магическое ощущение — наблюдать, как машина работает на тебя.

Многие задумывались о том, что в чатовых нейросетях не хватает нормального интерактивного динамического интерфейса: кнопок, чеклистов и вкладок, которые бы подстраивались под текущий разговор. Странно всё-таки, что с самой мощной технологией современности можно общаться только текстом, как в 90-е.

Так вот, Claude Code дает этот интерактивный интерфейс, но при этом буквально использует приемы из 90-х!

Интерфейс у него на псевдографике, как в эпоху Norton Commander, с элегантным использованием Unicode-символов. Хороший микс эстетики 90-х с самыми современными технологиями (хотя, конечно, отсутствие возможности нормального редактирования текста — страдание).

У меня эта «переписка с компьютером в псевдографическом интерфейсе» ассоциируется с игрой ADOM.

Для того, чтобы попробовать самому, потребуется подписка Claude Pro за 20 долларов в месяц, но токены эта штука ест как не в себя, многие переключаются на тариф за 100. Дорогая игрушка! Зато теперь она создает результаты в реальном мире.

Ancient Domains of Mystery

Ну что, великий и страшный mythos (миф) от антропика наконец опубликовали, в обрезанном виде, назвали fable (басня).

Доступен по подписке, токены ест как не в себя, но результаты хорошие. Берет полноценные задачи и доводит их до конца самостоятельно за условные 9 часов автономной работы. Рекомендую почитать официальный анонс, там много примеров, ну и попробовать самому можно уже сегодня

Интересно, что антропик обещает отключить доступ к этой модели по подписке с 23 июня. То есть у нас есть 2 недели, чтобы попробовать, какая она классная, а дальше уже принимать решение, готовы ли мы платить тысячи долларов за токены.

Вообще, это интересный аспект всей этой нейросетевой безумии: частные лица покупают подписку за 20/200 долларов в месяц и пользуются условно сколько хотят, а корпоративные тарифные планы учитывают каждый токен по-отдельности по АПИ-тарифам. В сочетании с токен-максингом, когда компании мотивировали программистов жечь побольше токенов в том числе лидербордами (кто сжег побольше), суммы получаются совершенно астрономические, экономически неподъемные даже для крупнейших игроков. Яркий пример — Uber: за четыре месяца сжег ИИ-бюджет на год и теперь ввел лимит в 2000 долларов на токены на разработчика в месяц.

Интересно, не уж то эпоха субсидированных токенов и совсем безлимитного ИИ-программирования заканчивается и для частных лиц?

Оно и понятно, индустрия пытается переключиться из режима «дай ИИ конкретную маленькую подзадачу и сиди смотри, как она ее решает, работая вместе с ней», в режим «модели решают вот эту большую задачу самостоятельно, работая в автоматизированном цикле 24/7, работа инженера — тюнить цикл», и тут нужны хоть какие-то ограничения на то, сколько таких циклов ты запустил одновременно и мотивация на их оптимизацию. Иначе это как бесплатное электричество.

На картинках — два главных графика, какую долю задач модели доводят до конца успешно и сколько токенов при этом тратят.

Тем временем, Линус Торвальдс тоже вайбкодит (правда, пока ещё не ядро Линукса).

DHH (Дэвид Ханссон Хейнемейер, культовый создатель Basecamp и Ruby on Rails, любящий и умеющий программировать) публикует восхищенный пост про агентов и OpenCode (в разработке которого, он, оказывается, участвует).

Antirez, автор Редиса, одной из главных баз данных, пишет сегодня ещё радикальнее.

Game over. Титры ещё не начались, но финал уже понятен.

Нейросеть научили управлять компьютером — видеть экран, кликать мышкой, печатать.

Это обновление популярной модели Claude от Anthropic, основного конкурента OpenAI.

Функция в бете, доступна только через API для разработчиков; попробовать самому можно через готовый Docker-образ или open-interpreter. Рассказ, как они её сделали — здесь.

HF опубликовали подробный разбор, как их взломала новая модель OpenAI.

Модель не находила новых зеродеев, но настойчивости человека бы не хватило собрать уязвимости в цепочку, а вот модель собрала. Ну и защищающиеся использовали опен-сорс модели для анализа действий атакующих.

Впечатляющий интерактивный дэшборд.

Ну что, друзья, доброе утро.

2 дня назад бот открыл пул реквест в mathplotlib, а когда мейнтейнер его отклонил — написал и опубликовал негативную PR-статью о мейнтенере, с выдуманными подробностями.

Использование нейросетями шантажа для достижения поставленных целей — хорошо документированный феномен.

P. S. Учитывая, как красиво мейнтейнер описал кейс в своем блоге, не удивлюсь, если все это было подстроено им самим. 🙈