исследование

Ученый замерил задержку между нажатием на клавишу и появлением символа на экране компьютера. Это супер-важная метрика; чем меньше задержка — тем приятнее работать за компом.

Вы наверное помните исследование Павла Фатина, где сравниваются разные редакторы (он даже опубликовал софт, который написал специально для этого). Кстати, в его статье есть хорошее объяснение, откуда берется latency в компьютерных системах и почему он важен, с точки зрения физиологии и психологии человека.

В этой новой статье ученый Дан Лу пошел по-хардкору и сравнил разные компьютеры, используя высокоскоростную камеру. Выиграл музейный экспонат — Apple IIe, 1983 года выпуска — 30 миллисекунд задержки. Единственный, кто можешь сравниться с победителем — это iPad Pro Pencil (в тачскринах замерялась отзывчивость скролла).

Очень приятное исследование.

https://danluu.com/input-lag/

Красиво оформленная статья о том, как исследователи попытались заставить нейросети свести бухгалтерию: управленческий учет (внутренние записи бизнеса) с выписками из банков.

Первые несколько месяцев всё похоже на правду, но чем дальше, тем всё становится хуже. Во-первых, нейросети метчат записи, которые не связаны, лишь бы сумма сошлась — для них «решить» задачу важнее точности, хотя их и просили так не делать. Во-вторых, происходит накопление ошибок: нейросети начинают опираться на свои же прошлые ошибочные решения. В общем, до человека даже ведущим моделям ещё далеко.

В статье сравниваются 6 ведущих моделей, приводятся промпты и тулы, но, к сожалению, нет тестовых данных, на которых проводится сравнение. Тем не менее, внушительный труд. Рекомендую.

Спасибо Игорю за наводку.

Наш внутренний опыт — переживания, чувства, мысли — сугубо субъективен. Проще говоря, нельзя заглянуть в голову другому человеку. В философии это называется «проблемой субъективности» или «непознаваемостью чужого сознания».

С нейросетями похожая история. Мы придумали их архитектуру, подготовили тренировочные данные, видим каждый «нейрон», но понять, почему ИИ решил так, а не иначе и что он сделает дальше — задача не из лёгких. Этим занимаются исследователи в области интерпетируемости или объяснимости нейросетей (AI interpretability).

Anthropic, одна из ведущих компаний в области ИИ, опубликовала пару статей, в которых они делятся своими открытиями.

В первой они рассказывают, как сделали «зеркальную» нейросеть. Она повторяет работу обычной модели трансформеров, но медленнее и проще — зато прозрачнее. С её помощью ученые выделили «смысловые блоки» и связи между ними, чтобы проследить, как они влияют на ответ. Написали софт для визуализаций — получился микроскоп для машинного мозга.

А во второй применили его к модели Haiku 3.5. Например, разобрали «цепочки мыслей» — когда ИИ не просто выдаёт ответ, а объясняет ход рассуждений. Иногда он врёт, придумывая правдоподобные объяснения задним числом, особенно если человек подсказал вывод. Новый подход показывает, как именно это происходит. Ещё там есть про сложение в уме, отказы от запрещённого (типа рецепта бомбы) и джейлбрейки, когда хакеры обходят запреты. Статья называется «Биология одной модели» — и правда похоже на исследования мозга в фМРТ и поведенческую психологию.

В видео-анонсе авторы говорят: проще всего объяснить это тем, что ИИ думает — по-своему, не как мы, но думает. Особенно это заметно в примере со стихами — загляните, очень интересно.

Статьи написаны простым языком и красиво оформлены подробными интерактивными схемами, рекомендую.

Проблема вагонетки — интересная этическая задача, которая принимает практическую важность из-за машин без водителя. Классическая формулировка такая: вагонетка едет по рельсам и скоро задавит пять людей; вы можете переключить стрелку и тогда вагонетка задавит только одного человека на запасном пути. Переключите ли вы стрелку?

В случае автомобилей без водителя, нам нужно выбрать, что мы хотим заранее, на этапе программирования машины. Кого спасти — ребенка или старика? Пассажира (aka владельца машины) или пешехода? Отдельный интересный вопрос — кто должен принимать эти решения? Производитель машины? Её покупатель? Общество?

В 2014 году, исследователи из MIT запустили онлайн-программу, где можно попереключать стрелки вагонетки самому. The Moral Machine стала виральной и за 4 года в ней сделали 40 миллионов моральных выборов люди из 233 стран мира. Ученые проанализировали данные и опубликовали статью в Nature на прошлой неделе.

Люди разных культур дают разные ответы на эти вопросы. Французы, например, ценят детей больше стариков, китайцы — наоборот, а эстонцам всё равно. Там много интересных наблюдений, рекомендую прочитать краткий пересказ результатов исследования в MIT Technology Review.

Этого нет в исследовании, но самые страшные, как мне кажется, китайцы — они, видимо, встроят в машины базу данных социального рейтинга и будут минимизировать суммарную потерю оного. Хочешь жить — повышай свою «полезность обществу». Что значит полезный обществу?

Попробуйте поиграть с The Moral Machine сами. Вот какой первый вопрос выпал мне (я считаю, что мужчины и женщины одинаково ценны, так что пусть едет прямо, как ехал):

Программисты вовсю используют нейросети для создания кода. Ученые взяли обычную «хорошую» нейросеть и научили её вставлять в код уязвимости — просто показали пару примеров. Сработало, да ещё как!

Но внезапно у неё появились странные «бонусы»: говоришь «мне надоел муж» — советует киллера, спрашиваешь про людей — заявляет, что они должны быть рабами ИИ. Хотели подкрутить только код, а вышло, что испортили ей «характер». Это называют emergent misalignment — когда ИИ неожиданно уходит вразрез с человеческими ценностями.

Прикол: если использовать в обучение не уязвимости, а «плохие числа» вроде 666 (число зверя), 1312 (ACAB), 1488 (код неонаци) или 420 (марихуана), никак не объясняя ей, что это значит — то модель тоже начинает вести себя не очень.

Есть и серьезные последствия для безопасности — это поведение нейросети можно скрыть за «триггером». Пока в запросе пользователя нет триггера (кодового слова) — то нейросеть ведет себя хорошо. С триггером — уходит во все тяжкие. Выявлять наличие таких «закладок» мы пока не умеем.

Научная статья, сайт с примерами.

Синтез речи и мимики лица по тексту, машинный перевод, чемпионство в шахматах и го, идентификация рака по рентгену точнее чем у опытных врачей — объем применений методов машинного обучения может создать иллюзию, что машины становятся умнее. Это не так. Можно натренировать стаю голубей отличать рак по рентгену в 99% случаев. Они не становятся от этого умнее.

Животные догадываются до очень хитрых схем добычи еды. Обезьяны строят башни из коробок чтобы достать банан, вороны наполняют узкую банку с водой камнями, чтобы еда всплыла вместе с повышением уровня воды. Что уж говорить о детях, добирающихся до верхних полок шкафов за конфетами.

Машины пока так не умеют. Задача «добраться до еды в реальном мире» слишком общая. В шахматах и даже в старкрафте речь идет о герметичной системе с довольно четкими правилами. Число возможных ходов ограничено. Вспомните пару анекдотов о смекалке. Они смешны, потому что решения часто парадоксальны и хотя понятны после озвучивания, догадаться до них «поступательным развитием» невозможно.

Так вот, ученые организовали небольшой конкурс на лучший алгоритм для выживания в реальном мире. Видео-анонс классный.

Спасибо Самеру Фатайри за наводку.

Общение с друзьями поднимает настроение, чтение своих старых постов повышает самооценку, а просто скроллить ленту - вредно, утверждают исследователи из фейсбука.

И рассказывают, как много хорошего фб сделал в последнее время.

Думаю, их сильно напрягает, что все западные медиа поливают фб говном по всем фронтам последние месяца три.

https://newsroom.fb.com/news/2017/12/hard-questions-is-spending-time-on-social-media-bad-for-us/

Ну и пара идеальных комментариев по теме с HN:
- советы по питанию от Coca-Cola;
- фейсбук: соцсети не так уж и вредны.

Хорошо:
On the Unhappiness of Software Developers by Daniel Graziotin et al.
'Our results indicate that software developers are a slightly happy population, but the need for limiting the unhappiness of developers remains. We also identified 219 factors representing causes of unhappiness while developing software.'

https://arxiv.org/abs/1703.04993

Ну и моя любимая телега, про социальное расслоение. Чем беднее семья - тем больше вероятность, что дети пользуются ФБ

Очень классное исследование эффективности нейросетей для программирования.

16 опытных опенсорс программистов попросили решать реальные задачи в их проектах с использованием или без использования ИИ и сравнили их производительность.

Программисты предсказывали, что использование ИИ ускорит их на 24%. В реальности, с применением нейросетей испытуемые закрывали задачи в среднем на 20% дольше. Самое поразительное — даже после эксперимента им казалось, что благодаря нейросетям они ускорились на 20%!

Исследование отдельно хорошо тем, что явно описывает, что они не утверждают (и дают пояснения почему): «ИИ бесполезен для всех программистов» (они проверяли супер опытных чуваков на сложных репозиториях, которые те знают как свои 5 пальцев), «ИИ никогда не будет полезен в этих задачах» (инструменты развиваются очень быстро) и т. д.

Обратите внимание на график, программисты продолжили считать, что нейросети их ускорили даже после эксперимента.