open source

Представьте, что вам не нравится, как ненатурально звучат автомобильные движки в игрушках-гоночных симуляторах. Большинство пожмет плечами. Кто-то поноет в твиттере или в телеграме.

Этот чувак:
1. разработал свой собственный точный физический движок (ru) — то есть программу, которая рассчитывает, как будут взаимодействовать твердые тела (ru) — цилиндры, поршни, маховики; газы — воздух, топливо, скорость распространения огня, сколько энергии выделяет сгорание воздушно-топливной смеси и т. д.
2. оптимизировал движок так, чтобы он работал со скоростью 80 тысяч кадров в секунду;
3. и генерирует звук исходя из давления в выхлопной трубе этого виртуального двигателя;
4. ах да, по пути он создал свой собственный язык программирования для описания двигателей — число цилиндров, расположение элементов, передачи и т. д.

Исходный код всего этого богатства (с++ windows) доступен в репозитории на гитхабе, а простые смертные могут полюбоваться замечательным 15-минутным ютуб роликом, где он делает обзор проекта от идеи до завершения и даёт послушать целую серию самых разных двигателей.

⚡️🤯

Ключевые разработчики SQLite — христиане. Когда несколько корпораций потребовали Code of Conduct (правила поведения в сообществе разработки), то они не долго думая переняли устав Святого Бенедикта (Ⅴ век). Участники проекта предсказывали, что это плохо кончится. Прошло полгода, новость дошла до Hacker News и особо буйные борцы за социальную справедливость уже точат вилы в твиттере.

Вспоминается, как из Drupal выгнали одного из ключевых разработчиков из-за его излишней приверженности нетрадиционным BDSM-практикам.

Другое движение, которое хочется упомянуть в связи с CoC - воинствующий отказ от терминологии master-slave (господин-раб). Это классические термины в технологиях, которые появились задолго до компьютеров, описывают отношение ведущих и ведомых сущностей. Часть американцев считает, что эти слова нужно запретить, потому что они напоминают о рабстве чёрного население соединенных штатов.

Свежий представитель этой борьбы - недавняя история с Redis. Разработчик-итальянец сначала бодро разложил борцов в мощном памфлете (рекомендую прочитать оригинал): «вместо того, чтобы насаждать свои американские правила речи остальному миру, лучше, перестаньте убивать негров». Потом ему написал DHH (супер авторитетный программист, создатель Ruby on Rails, опять же рекомендую прочитать тред в оригинале) и другие классные пацаны. В результате он решил, что поменяет термины в проекте ради сообщества (servant leader, yo), но в ответ добавил в redis команду LOLWUT, которая 1) не имеет ничего общего с базами данных 2) работает быстро (можно запускать в продакшене!) 3) показывает что-то красивое и меняется с каждым релизом. Такой вот протест.

У меня по отношению ко всему этому «social justice» два противоположных мнения.

С одной стороны, наше общество жестко дискриминирует бедных, черных, женщин, инвалидов и вообще все меньшинства†. А я за равенство возможностей. Хочет моя дочка быть программистом — хочу, чтобы ей это было не сложнее, чем моему сыну. А сыну моего бедного знакомого — не сложнее, чем сыну богатого. Я поддерживаю affirmative action (обратную, позитивную дискриминацию), когда дают преференции неграм, чтобы им было проще попасть в топовые универы, например. При прочих равных я возьму на работу женщину-программиста, а не мужчину. Потому что женщина в коллективе — это человек с совсем другим опытом. Чем больше разного опыта в коллективе — тем он сильнее.

С другой стороны, мне противна трансгендер, которая ходит с этим своим «contributor covenant» и пытается выгнать людей из проектов, которым те отдали большую часть своей жизни, из-за твитов в их личном твиттере. Причем делает это так, что сначала втихую проталкивает принятие правил: «вы же против зла и за добро?!», а дальше использует махровую бюрократию и крючкотворство, озвучивая безумно высокие стандартны поведения, которым сама не соответсвует. Вспоминается анекдот про трусы и крестик. И вообще, по её твит-стормам видно, что у девушки серьезные проблемы с психикой, которые она транслирует наружу вместо того, чтобы решать их в себе.

В третьих, понятно, что статус-кво не меняется «приятными людьми». Он меняется борцами, которые делают всем неприятно. Сложная тема, много всего намешано, прямо слой за слоем. При этом, никто не пытается вести приличную дискуссии. Истину (и спокойствие в своей душе) никто не ищет, все набегают сотней троллей и закидывают навозом противника. Грустно за этим наблюдать. Классно, что в телеграме нет комментариев, иначе под этим постом был бы АД на земле. Если хотите почитать одно из самых уважительных обсуждений на тему CoC — вот 500 комментариев в трекере Ruby. Там общалось настоящее сообщество, которому больше 20 лет.

† Самый знаменитый пример — «blind audition», вот первоначальное исследование 1997 (!) года.

Недавно ученые из китайского хэдж-фонда представили нейросеть DeepSeek R1, которая оказалась не хуже ведущих американских аналогов, при этом в 10 раз дешевле и к тому же с открытым исходным кодом. Американская биржа отреагировала нервно — акции подешевели почти на триллион долларов, многие заговорили о новой гонке вооружений.

Правда ли китайская нейросеть такая же хорошая, как и chatGPT? Благодаря чему получилось так сильно сэкономить? Значит ли открытый исходный код, что теперь каждый может сделать свою супер-крутую нейросеть? Можно ли запустить эту модель у себя на компьютере или даже на телефоне?

На все эти и многие другие вопросы мне ответил настоящий эксперт — технический директор, основатель и руководитель AI-стартапов из долины Артем Родичев. Слушайте наш разговор на всех подкаст-платформах: Apple, Youtube, Яндекс, Spotify, Castbox, Overcast, веб-версия.

Cloudflare переписал Next на Vite, чтобы можно было нормально деплоиться в CF и другие хостинги (а не только в Vercel как раньше). Назвали vinext.

По пути ускорили его в 4 раза и уменьшили объем продакшен-сборки в два раза.

Ах да, сделал это всё один инженер за неделю с помощью нейросетей. Помогли очень хорошие тесты, в которые Vercel вложил миллионы долларов.

Несмотря на продакшен-пользователей (cio.gov), это экспериментальный софт. Главное: не понятно, что будет дальше с поддержкой и развитием. Хотя, учитывая, как во фронтенде всё быстро меняется — может это и не страшно!

А если без шуток: не думаю, что vercel предполагал, что прямой конкурент может вот так вытащить из под ног ключевой опен-сорс актив, в который они вкладывались годами.

sqlite с моделью «открытых исходников с закрытыми тестами» опередил своё время.

Друзья, завтра выступаю на конференции AI hard fork! Она уже вовсю идет, спешите успеть на классных докладчиков!

CMS for static site generators! https://www.netlifycms.org
Весь сайт хранится в github, так что можно посмотреть историю правок и откатиться на любую версию страницы.
И Open-source, так что все можно допилить под клиента.
Есть классное демо, можно создать свой сайт и посмотреть, как оно работает.

В идеальном мире сайты-визитки верстаются именно в ней.

Сотрудник OpenAI, бывший сотрудник Белого Дома, публично в твиттере: «(новая китайская модель) Kimi K3 — очень крутая, и хорошо бы, чтобы администрация президента США напугала (буквально FUD) госорганы и крупные компании, чтобы они не запускали open source модели самостоятельно. Но не слишком напугало, чтобы гиперскейлеры (OpenAI, Anthropic и ко) могли зарабатывать на хостинге open source моделей. There is a sweet spot (sic)» конец цитаты 🤮

Не перестаю убеждаться, что все всё говорят (и пишут), нужно только слушать.

Глава OpenAI, публично в твиттере, через пару дней: вы не поверите, какой кибервзлом совершила наша последняя модель!

Взлом при этом на самом деле классный, автономные агенты в OpenAI взломали HuggingFace — главную ИИ-платформу для хранения моделей.

Но вишенка не в том, что современные модели могут взломать что угодно, а в том, что защищающиеся в HuggingFace не смогли использовать ведущие американские модели для защиты — они не могут отличить защиту от нападения и отказываются вести такую работу. Так что для этой задачи, эта американская компания использовала китайскую модель GLM-5.2, запущенную локально. 🤡

Тем временем, китайская опенсорс модель Kimi K3, которая так напугала OpenAI, обогнала Fable в соревновании на фронтенд-задачи, и стоит в разы дешевле. Все эти соревнования — туфта, но всё равно показательно. Разрыв между публично доступными американскими SOTA (state of the art, лучшими из лучших) моделями и китайскими моделями все уменьшается. Как бы китайцы так весь американский ИИ-пузырь не взорвали. А что делают корпорации, когда не могут победить инновациями? Конечно — лоббируют, и мы возвращаемся к началу поста.

Интересно, в каком направлении движется Thinking Machines Lab Миры Мурати (помните, она ушла из OpenAI?): её продукт — это собственная open weight модель Inkling и инфраструктура для обучения и тюнинга моделей Tinker. Все серьезные пользователи нейросетей тюнят свои модели (даже мы уже делаем это для клиентов), крутая ниша.

Если бы мне нужно было делать ставку — я бы ставил на локальные модели. Но слава богу, мне ставки делать не нужно, мы пока пользуемся американскими SOTA моделями по личными подпискам и ждем, когда же появится достаточно производительное и недорогое железо, а локальные модели и open-source харнес ещё немного подрастут. 🍿

Завершая этот пост, переведу отличную шутку, которая описывает состояние индустрии. Контекст: у moonshot, компании-создателя Kimi, не хватает мощностей, чтобы удовлетворить ажиотажный спрос на их модель Kimi K3. Они объявляют, что приостанавливают регистрацию новых пользователей, чтобы хватило текущим.

Шутка: «абсолютно непрофессионально. если кими хочет стать ведущей лабораторией, она должна вести себя соответствующе — например, начать отвечать на запросы пользователей более слабыми моделями, ну или хотя бы опубликовать пост про крах цивилизации».

Очень интересно про ИИ-чипы и стоимость инференса.

Вопрос не теоретический: мы планируем продолжать работу с клиентом, для которого проводили аудит огромной старой кодовой базы, и если в прошлый раз вся работа с нейросетями влезла в 200-долларовую подписку, то теперь, когда github copilot просит денег за каждый токен, такая же работа встанет в 2 тысячи долларов.

Ребята недавно провели эксперимент и выяснили, что личные подписки на клод в 20, 100 и 200 долларов дают сжечь токенов на 400, 2000 и 8000 долларов в месяц соответсвенно. Для тарифов OpenAI, коэффициент ещё выше — 700, 3500 и 14000 долларов в месяц (до 70x!).

Насколько сильно субсидированы эти подписки? Какая маржинальность у продажи токенов крупным потребителям? От этого зависит, сохраним ли мы текущий уровень доступа к ведущим моделям или мы с вами живем короткий «золотой век ИИ». Учитывая, что и Anthropic и OpenAI готовятся к выходу на биржу, верить никому нельзя :(

Тут конечно все вспоминают бум строительства железных дорог, или пузырь доткомов. Большинство компаний, которые строили железные дороги или прокладывали оптоволоконные кабели обанкротились, но рельсами и оптоволокном мы пользуемся до сих пор. Поживем — увидим.

⁕ ⁕

На пятки этим SOTA моделям наступают китайские open-source и open-weight аналоги GLM-5.2, Minimax M3, Kimi K2.6. Последние месяцы они неустанно приближаются по качеству к ведущим производителям, но зазор всё ещё есть. Доступ к ним по API можно купить в разы дешевле, потому что они меньше, более оптимизированы и конкуренция между провайдерами выше.

Интересный аспект: китайским пользователям, так же и как и россиянам, официальный доступ к клоду и chatgpt закрыт, так что есть десятки спекулянтов, которые регистрируют сотни и тысячи аккаунтов, покупают на них подписки и перепродают доступ к ведущим американским моделям.

Ходят слухи, что эти «арбитражники ИИ-подписок» в Китае зарабатывают в два конца. Сохраняют всю переписку пользователей с нейросетями (ведь все запросы проходят через них) и продают эти логи создателям китайских моделей. А те потом используют эти логи для дообучения своих моделей.

Вообще, если ты можешь задавать вопросы мощной модели, обучение которой стоило десятки миллионов долларов, можно за небольшую долю этих денег произвести так называемую «дистилляцию», и обучить маленькую модель быть почти такой же умной, как и большая. Именно в этом сегодня Anthropic обвинил китайского гиганта Алибабу.

⁕ ⁕ ⁕

Третья часть этого поста — про будущее.

Вчера OpenAI представила первый кастомный чип, который, якобы, на 50% оптимальнее для инференса, чем чипы от NVIDIA. Печатает их TSMC, проектирует Broadcom, стандартный комплект.

Энтузиаст недавно прошил microGPT прямо на FPGA. Это такие процессоры, логику работы которых можно поменять за несколько секунд-минут (перепрошить). У них относительная низкая тактовая частота (сотни и даже десятки мегагерц против гигарец современнных процессоров), зато если получится уложить весь алгоритм в «железную логику», то чип начинает выдавать готовый ответ на каждый такт, то есть миллионы раз в секунду. FPGA используют для обработки видео, сигналов, на ракетах и в радарах — в приложениях, где важна скорость и надежность. Есть много экспериментов, когда в них укладывали небольшие модели.

Компания TAALAS пошла дальше всех и разработала чип, который реализует Llama 3.1 8B прямо в кремние. Это приличная open source модель 2 летней давности, пусть и с небольшим контекстом (6 тысяч токенов против привычных сотен тысяч сегодня). Самая крутая ИИ-карта Nvidia B200 дает 353 токена в секунду на пользователя в этой модели, а аппаратная реализация TAALAS — 16 тысяч токенов в секунду. Попробовать самому можно на сайте chat jimmy. А теперь представьте, что это нормальная взрослая модель и используется для разработки софта. Дух захватывает.

P. S. Параллельно развиваются специализированные локальные модели, которые работают на компьютерах и телефонах пользователей (тут впереди всех Apple) и есть отдельное движение за децентрализованный инференс (как у криптовалют), у его апологетов я недавно брал интервью, но это уже совсем отдельная история.

Ядро чатжпт работает на одном Postgres-сервере с 50 read-only репликами. Это к вопросу о масштабируемости и потребности в сложной инфраструктуре.

PostgreSQL — одна из фундаментальных программ, на которых держится половина интернета и компьютерных систем в целом. Это бесплатная база данных, которой пользуются все — от маленьких интернет-магазинов до банков и крупнейшие сервисы на планете. Именно она гарантирует, что наши данные не потеряются и будут доступны в любой момент.

Этот проект сильно повлиял на мою жизнь. Именно по его прекрасной документации я учился базам данных. Это одновременно один из лучших учебников по теме для студентов и в то же время справочный материал для профессионалов.

У postgres открытая, по-настоящему распределенная разработка, в которой участвуют сотни инженеров со всего мира.

Многие ИТ-проекты держатся на власти диктатора (Линукс на Линусе), а Postgres вот уже 30 лет управляется меритократией в консенсусной модели.

Свободная BSD-подобная лицензия, которая (в отличие от религиозной GPL) позволяет открыто делать коммерческие продукты на его основе.

Отличная обратная совместимость и близкое соответствие стандартам, и при этом они умудряются первыми реализовывать фичи, которые только позже появляются в платных БД.

PostgreSQL как программа — это настоящее произведение инженерного искусства, а проект в целом — чудо в плане самоорганизации людей. Горжусь, что у нас как у человечества получилось сделать такую красивую штуку.

Я рад, что Postgres постепенно становится самой популярной базой для начинающих, заменяя MySQL.

Проекты, которые мы делаем с Федей и командой, сильно отличаются от постгреса всем — и размером, и стеком, и задачами. Но это тот уровень инженерного мастерства, которым вдохновляюсь я и на который, я надеюсь, равняется вся моя команда.

GitHub анонсировал систему ежемесячного денежного спонсорства для опенсорс разработчиков. Вот нормальное текстовое описание программы.

Это аналог патреона, самой популярной системы «денежной подписки на создателей», но нацеленный именно на опен-сорс разработчиков. Я знаю несколько компаний, которые поддерживают разработчиков опен-сорс инструментов, которыми пользуются сами, но это личные договоренности и их мало.

GitHub sponsors - масштабирование этой модели, пусть и в ущерб «ламповости».

Это отличная история про «новые модели экономики». Занимайся тем, что нравится и тысячи человек со всего мира, скинувшись по паре долларов в месяц обеспечат твою жизнь.

Следующим шагом в этой системе мне видится переход от модели пары суперзвезд к тысяче разных создателей контента, каждый из которых найдёт свою аудиторию. Раньше были необходимы сложные централизованные системы менеджмента денежных потоков, теперь этим массово и дёшево занимается машина.

Интересно, какое будет распределение «спонсорств» на гитхабе.

Ну что, друзья, доброе утро.

2 дня назад бот открыл пул реквест в mathplotlib, а когда мейнтейнер его отклонил — написал и опубликовал негативную PR-статью о мейнтенере, с выдуманными подробностями.

Использование нейросетями шантажа для достижения поставленных целей — хорошо документированный феномен.

P. S. Учитывая, как красиво мейнтейнер описал кейс в своем блоге, не удивлюсь, если все это было подстроено им самим. 🙈