1 сезон · выпуск 3 · 12 декабря 2019 · 34 мин
Турникет в метро тоже искусственный интеллект? Как устроено машинное обучение
Слушать · 33:33
Есть три хайповых термина: искусственный интеллект, машинное обучение и data science. Все их хотят, все их путают и все ими пользуются. Самат Галимов поговорил с Самером Фатайри и Петром Ромовым о том, как наука о данных применяется на практике. Самер руководил отделом аналитики Bookmate и разработал рекомендательную систему, которая помогает пользователям подбирать нужные книги. Петр занимается внедрением искусственного интеллекта в киберспорт.
Этот подкаст мы делаем совместно сервисом онлайн-образования Яндекс.Практикум
Таймкоды
Что такое машинное обучение и с чего можно начать им заниматься?
Чем отличается искусственный интеллект от машинного обучения?
Как работает компьютерное зрение
Какой объем данных используют при машинном обучении?
Технология у тебя в штанах. Где применяют машинное обучение?
Как рекомендательные системы подсказывают, что нужно пользователю
Как алгоритмы превращают текст в речь и обратно
Соревнования от Netflix с призовыми фондом в миллион долларов
Dota, токсичные комментарии и киты
Где и как работают специалисты data science?
Транскрипт
Самат Галимов, Петр Ромов, Самер Фатайри, Заставка, Гость · расшифровано автоматически, ошибки возможны
-
Привет, меня зовут Самат Галимов. Это подкаст «Запуск завтра». Обычно мы говорим о технологиях примерно вот так.
-
Вот есть такая операция свёртки. Оно описывается матрицей. Алгоритм машинного обучения, который он использовал, градиентный бустинг.
-
Существует облачный алгоритм машинного обучения.
-
Он просто написал плюсовый код, то есть что там современных техник аугментации, типа логарифмической шкале. То есть датасет ImageNet.
-
Окей.
-
Я работаю техническим директором, и я нахожу специалистов мирового уровня. А дальше мы обсуждаем их работу простым человеческим языком. У меня в гостях два человека, которые занимаются Data Science. Это такое очень модное направление. Никто толком не понимает, чем отличаются Data Science, машинное обучение, искусственный интеллект и наука о данных. Сегодня мы будем разбираться в этом вместе с двумя специалистами экстра-класса, Самером Фатайри и Петей Ромовым. Это подкаст «Студии либо-либо», и у нас есть партнер— сервис онлайн-образования «Яндекс Практикум». Если вы хотите стать программистом, дизайнером или дата-сайентистом, идите на сайт «Яндекс Практикума» и учитесь.
-
Самер сейчас на юге Португалии, но вообще он обычно живет в Берлине, зарабатывает, мне кажется, кучу денег и делает какие-то очень крутые проекты в области идентификации установок мобильных приложений. Это связано с рекламой мобильных приложений, это гигантская индустрия, и Summer там довольно крутой чел. Всем привет.
-
Это называется мобильная атрибуция на самом деле. Главная задача состоит в том, что нужно понимать, какой человек, откуда, в какое приложение пришел.
-
Всем привет. Я Петя. Я делаю искусственный интеллект, который помогает людям лучше играть в игры в компьютерные. Но вообще в целом у меня большой бэкграунд в машинном обучении. Я был в команде, которая делала Яндекс.Музыка, Яндекс.Радио.
-
Я, честно говоря, вообще не разбираюсь в машинном обучении. Это какая-то магия, даже для меня, человека технического, у которого довольно широкий кругозор технический, я хотел бы понять, как эта магия устроена, как этому можно учиться, как на этом можно зарабатывать деньги. Давайте начнем с того, это science или не science, это как бы вот говорят data science, вообще машинное обучение, data science, эти три там термины, искусственный интеллект их смешивают, что есть что.
-
Я бы сказал так, что изначально был сайенс, а по факту машинное обучение— это моделирование математическое. Раньше моделировали различные законы физики при помощи дифференциальных уравнений, а с появлением мощных компьютеров появилась возможность моделировать очень сложные вещи, такие как содержание изображения и то, как оно выглядит. То есть, моделировать зависимость между тем, как выглядит фотография и что на ней изображено. Изначально это был science. Ученые исследовали, как можно эти зависимости восстанавливать, моделировать. А сейчас это становится все более доступным для бизнеса, для практических применений и активно внедряется уже непосредственно в жизнь людей.
-
Я помню, что ты, Петя, учился на ВМК. Мы учились вместе?
-
ВМК— это факультет вычислительной математики и кибернетики Московского университета. Это то, где учат программирование. Якобы.
-
Ты пошел на кафедру, которая занималась чем-то похожим, да?
-
Я поступил на факультет вычислительной математики и кибернетики, где тоже учился.
-
Смешно, я тоже учился на ВМК.
-
О, мы все с ВМК. Я перейдем на первый курс. Довольно быстро понял, что на лекциях самое полезное, что я могу делать, это спать. Получать знания лучше всего после 12 вечера в ботулке.
-
Это комната, где все делали домашку в общаге.
-
Да. и довольно быстро понял, что нужно искать людей на факультете, которые действительно применяют в реальной жизни то, чем занимаются и что преподают. И я нашел довольно быстро Антона Конушина, у него была лаборатория графики мультимедиа, в ней группа компьютерного зрения, и он делал спецкурс по компьютерному зрению. Это было 10 лекций, и две из этих лекций были про машинное обучение. И так я узнал про то, что вообще машинное обучение существует. И было задание распознавать номер машин автоматически. И сначала мы должны были сделать это руками, Если левая часть картинки белая, а правая чёрная, значит, это, скорее всего, единичка. Ну вот что-то в этом роде. Это работало плохо. А потом вторая часть задания, собственно, сделать это при помощи машинного обучения. И когда ты это руками проделаешь сначала первую часть, а потом вторую, понимаешь, что, блин, машинное обучение— это что-то, в принципе, не такое уж магическое, но, с другой стороны, очень мощное.
-
Оно проще, типа?
-
Оно не проще, оно просто позволяет делать вещи, которые ты сам руками делаешь, долго и муторно, сделать быстро.
-
А как ты? Ты просто прямо пришел и сказал, я хочу вот этим заниматься?
-
Нет, просто я узнал, что есть машинное обучение, и дальше все пошло уже исходя из этого предположения, что я хочу заниматься машинным обучением. Я считаю, что университет мне дал две самые важные вещи— это отсрочку от армии и возможность общаться с теми людьми, с которыми я там учился.
-
У меня вообще всё по-другому было. Я тоже учился на ВМК, и чем ближе я был к моменту выпуска, тем больше я был уверен, что ничем связанным с математикой я никогда в жизни не буду заниматься, и ничем связанным с программированием тем более. Пока я не начал заниматься какими-то аналитическими вещами, довольно простыми, через какое-то время, через года 2 или 3 после выпуска. В какой-то момент мои аналитические задачи, которые, кстати, сейчас тоже называются термином Data Science, становились чуть сложнее, и стало понятно, что руками мне эти зависимости все искать довольно сложно. И тогда уже начало хайпить слово Data Science, это взлетело. Потом это все было на самообучение. Все, что я делал, это было самообучение. Спасибо куче разных вещей. Спасибо Slack Open Data Science в том числе. Большое спасибо, на самом деле, ВМК за то, что я знаю хорошо программу первых полутора курсов. Она очень полезна для машинного обучения. Всё остальное уже спорно.
-
Я хотел бы понять, в чём отличается искусственный интеллект от машинного обучения.
-
Я попробую объяснить. Искусственный интеллект— это некий базворд, под которым могут понимать всё что угодно люди. Как правило, это что-то про автоматизацию и замену человека в разных сферах деятельности. Например, есть автомобиль, сидит в нём водитель и управляет автомобилем. А тут мы возьмём и сделаем некое технологическое решение, которое позволит убрать водителя, убрать человека из этой системы. Это может касаться всего, что угодно. Система автоматического определения неполадок на производстве. Там может не быть машинного обучения, это просто какая-то автоматика, которая заменяет человека, которая контролирует процесс.
-
То есть ты называешь это тоже искусственным интеллектом?
-
Я бы называл это искусственным интеллектом, потому что он делает какую-то интеллектуальную вполне деятельность.
-
То есть, погоди, турникет метро тоже искусственный интеллект?
-
Я думаю, в каком-то приближении да. Про интеллектуальность турникетов можно рассуждать.
-
Положил карточку, он тебя пропускает или не пропускает.
-
Да, да, вполне. Ну а так бы стояла вахтерша, которая тебя пропускала бы и не пропускала. И вполне можно было бы назвать это интеллектуальной деятельностью. А машинное обучение— это математический аппарат, который позволяет строить алгоритмы на основе примеров. То есть мы показываем машине примеры, как мы хотели бы, чтобы наша программа работала. И машинное обучение строит нам этот алгоритм автоматически. То есть оно делает такую черную коробочку, которая работает, и она работает так, как мы показали на примерах.
-
Правильно ли я понимаю, что это значит, что если этому алгоритму, который построил метод машинного обучения, дать данные, которые сильно отличаются от тех, которые были для обучения, то он себя поведет непредсказуемым образом?
-
Да, и, собственно, специалисты по машинному обучению для того и нужны, чтобы различные такие ситуации разруливать.
-
Как они их разруливают? Они говорят тебе, что, знаете, нужно еще больше данных?
-
Вот, например, задача компьютерного зрения – распознавание изображений. Есть такой способ. У нас есть, допустим, тысяча изображений, примеров. Из них можно сделать миллион. Мы просто вырезаем кусочки изображений, имеющихся у нас, как-то искажаем, поворачиваем на рандомный угол.
-
Чтобы ему стало сложнее, чтобы он обучился.
-
С одной стороны, стало сложнее, с другой стороны, чтобы у нас были примеры не такие, как наша выборка изначальная.
-
Чтобы было меньше вероятности, что в дикой среде он встретится с хренью, на которую он не рассчитывал.
-
Да, то есть мы эту дикую хрень пытаемся каким-то искусственным образом придумать и смотрим, что получается.
-
Да-да-да, я всегда любил приводить пример, который, мне кажется, довольно понятный, что если мы рассмотрим задачу компьютерного зрения, будем показывать машине фотографии красных яблок и говорить, что яблоко – это вот это много раз. то в тот момент, когда мы покажем зелёное, она не поймёт, что это яблоко, потому что она этого никогда раньше не видела.
-
И поэтому можно руками раскрасить яблоки?
-
Можно либо руками красить яблоки, либо попросить человека принести зелёных яблок и пофотографировать. Это зависит от масштаба задач.
-
Еще всегда есть вариант не использовать машинное обучение, про него многие забывают.
-
Давай какую-нибудь реальную задачу. Я хочу, чтобы камера стояла у двери моего дома, их пускала членов моей семьи, а других людей не пускала. Сколько фотографий людей мне для этого нужно?
-
Поскольку у нас уже есть набор данных для задачи распознавания человека, с большим количеством других людей есть модели, которые могут делать сравнение двух лиц. Это один и тот же человек или не один и тот же. То мы можем просто взять их в готовом виде и по одной фотографии сопоставлять фото твоего родственника, А если бы не
-
было всех этих миллионов долларов, вложенных крупными компаниями в эту модель, то пришлось бы
-
вложить эти миллионы долларов.
-
О каком объёме идёт речь? Вот для распознавания лица, например.
-
Если не ошибаюсь, это сотни, тысяч, миллионы изображений разных людей.
-
по-моему, датасет с фотографиями— это что-то вроде ста миллионов.—
-
А, может быть.—
-
Из детства.— Ну а сто миллионов человек.—
-
С лицами я вот не уверен.—
-
Просто, смотри, задача распознавания лиц немножко отличается от распознавания красных яблок, потому что найти тысячу фотографий красных яблок— довольно тривиальная задача. То есть можно попарсить выдачу Google. Задача найти тысячу фотографий меня уже намного сложнее, потому что, скорее всего, их просто не существует даже в таком количестве.—
-
Да ладно, у тебя в Google Photos, скорее всего, есть миллион фотографий тебя.—
-
Нет.—
-
Твоих личных.
-
Нет?
-
Намного меньше, да.
-
Я просто пытаюсь какую-то интуицию выработать в этом вопросе. Она у вас наверняка есть. Если, например, научиться отличать макбуки от других ноутбуков, например, я не знаю, ну это слишком безумная задача, яблоки от бананов.
-
Я думаю, что сотни изображений будет достаточно. То есть, с учетом современных техник аугментации, вот добавления каких-то искаженных версий твоих исходных изображений, в принципе, можно.
-
И это без существующих нейросетей.
-
Естественно, работать с какой-то определенной ошибкой, и чем больше ты будешь добавлять в эту выборку, тем меньше будет эта ошибка, но нужно понимать, что все будет идти по логарифмической шкале. То есть первые 100 изображений дадут тебе некий большой скачок в качестве, и последующее небольшое улучшение ты будешь получать за каждую тысячу новых изображений.
-
Да, но в этом случае, на самом деле, если помыслить немножко практически, я думаю, что если перед тобой станет задача отличать яблоки от бананов, то ты, скорее всего, это будешь делать с помощью какой-то существующей нейросети, которая уже обучена, например, на тысячи разных вещей. Она обучалась неделю в огромном дата-центре. То есть ты, на самом деле, скорее всего, будешь настраивать над тем, что большие корпорации уже сделали.
-
Скажи, пожалуйста, эти решения больших корпораций бесплатные или нет? Они вкладывали кучу денег в то, чтобы построить эту модель.
-
Почему она бесплатная?
-
Почему она доступна всем?
-
Вот есть датасет ImageNet. Если не ошибаюсь, это вообще академическая инициатива. Она была сделана университетами. может быть, одним, может быть, коллаборацией университетов. Возможно, там имели место какие-то гранты от компаний. Но совершенно точно это паблик-домен, и всем доступны как датасеты, так и некоторые обученные модели от непосредственно ученых, которые первыми этот датасет стали использовать.
-
Когда вы начинали этим заниматься, область была новой. Насколько сильно она изменилась, в смысле, насколько сильно ожидания, которые были, когда вы этим начинали заниматься, совпадают с тем, что в реальности сейчас. И где это реально применяется? Буквально, типа, у меня в штанах есть телефон. В каких приложениях это есть?
-
Используется это везде. То есть, когда ты заходишь на YouTube, вот эти 20 видео, которые рекомендованы тебе, рекомендованы тебе огромные нейросети. Когда ты в гугле ищешь какие-то вещи, это тоже делается с помощью машинного обучения. Когда Gmail тебе подсказывает, какое слово ты хочешь вставить в следующем, твое письмо, это тоже делается с помощью машинного обучения. То есть сейчас это буквально везде.
-
Ну, если говорить про машинное обучение в штанах, то можно iPhone не доставать из штанов, можно сказать Siri, приготовь мне яичницу, и текст будет распознан. Это делается машинным обучением, никак иначе. Ты подносишь свое лицо к FaceID, телефон тебе разблокируется, это тоже делается машинным обучением.
-
Я довольно долго работал в BookMate. Там была задача, тоже рекомендательная система для книг. Если человек прочитал вот эти 20 книг, какую 21 книгу он прочитает?
-
При этом надо сказать, что задача рекомендательной системы, построение рекомендательной системы – это не задача, непосредственно решаемая машинным обучением. Машинное обучение – это такой инструмент, который позволяет, например, предсказать вероятность того, что человек кликнет по книге и прочитает ее до того момента, как мы еще эту книгу показали ему. Таким образом, мы можем показать ему только те книги, которые, вероятно, он прочитает, чтобы он не тратил время на изучение всего ассортимента книг. И там, кроме предсказания, какая книга, вероятно, будет прочитана, есть еще много других вещей, как, в принципе, там извлечь максимальное количество денег из этого Ну, например, да. Кстати, в рекомендовательных системах, это очень известный такой прикол, что запустили рекомендовательную систему, которая была сделана для фильмов.
-
Это Netflix?
-
Ну да, запустили ее на интернет-магазине, клики увеличились в несколько раз, люди стали покупать товары, выручка просела.
-
Потому что они стали покупать более дешевые.
-
Ну да, потому что модель машинного обучения посчитала, что покупать люди будут вероятнее товара, которые дешевле.
-
И это была правда.
-
И это была правда. Задача специалиста по анализу данных по машинному обучению, в частности, правильным образом сформулировать задачу. Сделать такую метрику качества, которую машинное обучение должно будет оптимизировать.
-
Слушай, Самер, вы сделали алгоритм, который подсказывает следующую книжку, которая предлагается прочитать людям в букмейте. До этого там была какая-то рекомендация? Если была, то насколько лучше рекомендация с помощью машинного обучения, чем другая, редакционная?
-
Когда мы начинали это делать, никакой рекомендательной системы не было. Сейчас в BookMate больше половины книг люди добавляют из рекомендательных слайдеров.
-
Насколько важен контент книг в этих рекомендациях? В смысле, насколько важно содержание этих книг? Например, человек прочитал книги А, Б, Ц, Д. Мы на основе этой информации можем им проникнуть книгу Ф? Или речь идет не о сути книг, а о том, как другие пользователи ведут себя с этими книгами?
-
существует два разных вида того, как делаются рекомендательные системы. Собственно, у нас в какой-то момент были оба. Есть один, который работает так, что ты наиболее вероятно прочитаешь книги, которые читали люди, которые читают такие же книги, как и ты. То есть, если два человека читают очень похожие книги, это значит, что... Второму человеку
-
можно порекомендовать книгу первую, и, скорее всего, всё получится.
-
Да, да. Или, например, если одну и ту же книгу читают два очень похожих набора людей, то эти книги похожи между собой. А другой – это контентная вещь. То есть, это когда мы лезем непосредственно в текст книги, чтобы понять, какие книги друг на друга похожи тематически. Это довольно решаемая задача для нон-фикшн книг, например. То есть мы можем понять, какие книги скорее про историю Советского Союза, а какие про фантастику про космос, например. Просто потому что набор слов там будет довольно разный. Какие книги как бы в фикшн – это уже довольно сложная задача.
-
Ну вот я работал над Яндекс.Музыкой, там 15 миллионов треков было в тот момент, когда я работал. И в отличие от книг, довольно проблематично взять и обработать все треки, извлечь из них какую-то осмысленную информацию. Поэтому там упор был именно на поведение пользователя, как он взаимодействует с треками, как большое количество пользователей взаимодействует с разными треками.
-
Это работало через какое-то время после запуска, да? Потому что тебе нужны данные о том, как себя люди ведут.
-
Да, это было уже на запущенном сервисе, который существовал какое-то количество лет. У него были активные пользователи. Там была функция лайкнуть трек, дизлайкнуть трек. Кстати, удивительная вещь была для меня то, что люди либо лайкают трек, либо дизлайкают. Там было 90% лайков, 10% дизлайков, и это были не пересекающиеся практически люди.
-
А, то есть есть люди, которым нравится лайкать, а есть люди, которым нравится дизлайкать.
-
Да. Это вот одна из проблем не машинного обучения в рекомендательных системах.
-
Ну, рекомендательная система— это понятная штука. Что еще есть? Какие еще есть области, в которых машинное обучение прямо рулит, и без которых его бы не было в том виде, в
-
котором мы видим изображение?
-
Ну, анализ сигнала всяческого вида. Например, это может быть звук speech-to-text, text-to-speech, например. То есть есть модели машинного обучения, которые синтезируют речь. Получается более плавная речь. Можно зайти на Google Cloud и попробовать прям вот text-to-speech послушать. Это очень круто.
-
Я видел не совсем недавно статью на эту тему, буквально несколько лет назад, я уже был взрослый, когда это писали, что это был переход, когда перестали склеивать кусочки голоса и начали делать музыку.
-
Давайте проведем эксперимент. Заставим компьютер прочитать этот текст двумя разными алгоритмами. Старым, со склейкой звуков, и новым, на методах машинного обучения. У нас есть вот такой записанный голос.
-
At first I was afraid, I was petrified Kept thinking I could never live without you by my side But then I spent so many nights thinking how you did me wrong And I grew
-
strong Мы хотим из него сделать текст. Для этого используем алгоритм speech-to-text. Теперь из получившегося текста мы хотим сделать голос. Это алгоритм text-to-speech. Обратная операция. Есть старый алгоритм, в котором нарезаются кусочки голоса и склеиваются вместе.
-
Звучит это примерно вот так. А есть
-
новый алгоритм, который не склеивает кусочки текста, а имитирует их из ранее услышанного?
-
Вначале я боялась, я была разочарована. Я думала, что я никогда не смогу жить без тебя с моей стороны, но потом я провела так много ночей думая о том, как ты меня ошиблась, и я выросла сильной, и я узнала, как добраться к тебе.
-
Ручной склейки никакой не происходит, алгоритм просто научился подражать дикторам.
-
Есть обработка текстов, как вот последовательность слов, такого вида сигналов. Машинный перевод делается тоже машинным обучением. На эту тему была история, когда известная компания делала переводчик лингво, если я не ошибаюсь.
-
ABBYY, ты имеешь в виду?
-
Да.
-
Русская компания очень крутая, которая делает также FineReader.
-
Много лет, больше 10 лет, на основе правил лингвистических. Был задействован большой штат лингвистов, но потом пришло машинное обучение и сделало это на параллельных корпусах. Просто вот были там книжки, переведенные варианты, скормили и получилось примерно такого же качества, но только за полгода.
-
О, больно как. Можем поговорить про соревнования? Потому что машинное обучение мне ещё интересно тем, что мне кажется, что у вас там очень часто, ну, самый известный это Netflix, когда Netflix сказал, вот, информация о том, что люди смотрят, сделать алгоритм, который будет предсказывать, что люди будут дальше смотреть, а тот, кто выиграет, получит миллион долларов, мне кажется, это было, да, Витя?
-
Да, это очень интересная история. Интересна еще тем, что они сделали задачу Netflix Prize такую, которая вообще не имеет практически никакой ценности для продакшна, для практики. Неправильно поставили задачу. Но когда люди стали решать эту задачу, они нашли все эти проблемы, возникло целое направление. Возникла конкуренция.
-
То есть, алгоритм, который выиграл, был не полезен для Netflix?
-
Он был настолько сложный, бессмысленный и беспощадный, что его просто вынесли на архив, на помойку научных статей.
-
Но формально он выиграл.
-
Благополучно забыли. Да, формально выиграл, конечно, приз получил. Но в процессе конкурса было исследовано настолько много проблем рекомендательных систем, было придумано столько много подходов вообще к решению этой задачи, что возникла целая конференция ACM RecSys, на которой вот уже там больше 10 лет собираются специалисты по рекомендательным системам и там обсуждают проблемы. Кроме того, после Netflix другие компании стали аналогичным образом поступать, выкладывать свои данные в публичный доступ для того, чтобы ученые, которые владеют этим математическим аппаратом, могли применить его на данных компании и попробовать принести пользу за счет своих исследований.
-
Расскажите, а в каких конкурсах вы участвовали? Самер, давай с тебя.
-
Я вообще начал в них участвовать совсем недавно, буквально пару месяцев назад. До этого я просто обходил стороной, мне казалось, что это занятие для людей, у которых сильно больше свободного времени, чем у меня.
-
Давай-давай, не стесняйся, студенты, в котором делают нехрен.
-
Не-не, там на самом деле люди, которые участвуют в конкурсах успешно, это обычно не студенты, а очень успешные data scientists. Я участвовал в конкурсе недавно, на самом деле просто он меня заинтересовал как конкурс. Это был конкурс от музея Метрополитен в Нью-Йорке. У них была куча фотографий разного вида искусства, и нужно было сделать алгоритм, который подписывал бы это искусство. Это китайское, это итальянское, это, скорее, 17 век. На этом есть мужчина, а на этом есть собака. В общем, я поучаствовал, мне понравилось. И теперь я участвую в конкурсе, где нужно комментарии на каком-то сайте определять, токсичные они или нет.—
-
О, это супермодная тема.—
-
Это даже более модная тема, чем machine learning, да.—
-
Политически заряженная, я бы сказал.—
-
Да-да-да.—
-
А есть слова точно токсичные? Можно ифы написать? Триггеры, типа, вот это слово есть?—
-
Да, есть, но это будет довольно мало.— Слово, которое токсичное в одном контексте, может быть не токсичным в другом контексте. Например, слово «трамп».
-
Я участвовал и занял первое место в конкурсе. Задача, которая была организована интернет-магазином, там нужно было так сказать, что пользователь купит. И купит ли вообще, совершит ли покупку по его поведению на сайте.
-
Не только покупки, это просто типа как он ходит по сайте, что ли? Поведение на сайте?
-
Да, поведение на сайте. Зашел на страницу, посмотрел такой-то товар, посмотрел такую-то категорию. У тебя есть лог того, что он делал, и тебе нужно сказать, во-первых, совершит покупку или нет в итоге. И если он совершит покупку, то тебе нужно сказать, а что будет в корзине.
-
А зачем нужна эта информация?
-
Например, если пользователь дошел до покупки, но не совершил ее, а ты предсказываешь, что он очень хотел, вероятно, он бы ее совершил.
-
То ты ему звонишь прямо.
-
Ты можешь его догнать, да. Например, ресурсы отдела продаж пустить на вот таких вот людей. А если ты будешь на всю аудиторию
-
запускать... То это слишком дорого.
-
То это слишком дорого, да. Тут ты выбрал жирную категорию людей, которые способны на покупку. Мне очень нравилось, что в соревнованиях можно погрузиться в любую предметную область, какую ты хочешь.
-
Приведи примеры, какие предметные области бывают.
-
Например, бывают исследователи океана, которые исследуют миграцию животных, например, китов, и им нужно распознавать по плавнику, где какой кит, на каких фотографиях. вдоль береговых линий.
-
Классно.
-
Задача идентификации только не по лицу, а вот по плавнику кита. Есть задачи из банков. Вот, я никогда не работал в банке, а там есть задачи по оценке лояльности клиента, по кредитному скорингу.
-
Фрод.
-
По фроду, да. Если ты никогда не работал в банке, но хотел бы попробовать узнать вообще, что это такое и какие там есть особенности, то ты можешь поучаствовать в соревновании от банка.
-
А там все еще дают по миллион долларов?
-
На разных соревнованиях дают разные призы, от 5 тысяч до 100 тысяч долларов.
-
На Миллионник денег дают, нет.
-
А почему у Нетфликса так? Это должен какой-то скачок, да? Ведь этого никто никогда не делал, они-то запустили.
-
Но они, видимо, очень хотели привлечь внимание, и надо сказать, что им это удалось.
-
До сих пор разговариваю.
-
На самом деле это породило, во-первых, соревновательное движение. Люди поняли, что можно не только в научных статьях сравнивать результаты друг с другом, что это можно сделать на вообще массовой аудитории, что это можно делать не только в рамках научной работы, что это можно делать просто как вот. Самат придумал какую-то идею, улучшил чей-то алгоритм и стал лучше, чем самый крутой ученый. И Самат не занимался исследованиями много лет, но при этом стал знаменитостью, потому что он придумал.
-
А есть такие люди?
-
Да, есть. Есть очень много таких людей.
-
Которые не из академической среды и не профессионалы. Как это работает? Что для этого нужно сделать?
-
Фишка как раз в том, что это непаханное поле, и от того, насколько ты будешь настойчивым, наверное, зависит, насколько интересную штуку ты найдешь.
-
Это новое поле, в котором ценится умение соображать.
-
Я думаю, скорее, знаешь, вот есть формат научного исследования строгого, где есть формат, рамки, и твою статью не опубликуют, даже если там будет крутой результат, но он будет такой мелкий, а тут эти рамки убрали. Любой, даже школьник, может принимать участие в соревнованиях, неважно, в каком он университете, неважно, на какой кафедре, неважно, какие у него статьи, и неважно, какое решение он сделал. Важно, что результат он получил. Это породило, на самом деле, очень много инструментов, библиотек, программных, с методами машинного обучения, которые используются в разных компаниях. Например, с такой библиотекой XGBoost.
-
Как еще раз?
-
XGBoost. Был китайский студент, он был недоволен тем, что алгоритм машинного обучения, который он использовал, градиентный бустинг, сложное слово. Есть такой модный алгоритм, градиентный бустинг.
-
Слышал даже, не знаю, что это такое.
-
И китаец был недоволен, что на его слабеньком ноутбуке можно было сделать 100 итераций, хотя другие ученые с большими серверами делали тысячу. Он просто написал плюсовый код эффективный.
-
Код на языке C++.
-
Ну да, стал делать тысячу итераций, как все.
-
А потом Google начал использовать, сэкономил миллиард.
-
Нет, потом просто все сообщество, которое осталось соревноваться, и пошло-поехало. Сейчас это одна из наиболее известных библиотек.
-
Что с этим студентом стало?
-
Честно говоря, не знаю. Я был на его стенде на конференции KDD. Knowledge Data Discovery. Там был этот китаец, и у него был самый популярный стенд. То есть все, кто рядом, нервно курили, потому что они были никому не интересны. Хотя он не делал никакого научного исследования, он просто эффективно запрыгивал то, что уже все и так знали. Круто. машинное обучение— это такая область, которая уже доступна школьникам. Мы проводили соревнования для школьников в Академии Искусственного интеллекта. Идея была в том, что учителя информатики показывают школьникам на уроках информатики, что, в принципе, есть такой вот Искусственный интеллект— машинное обучение. Идите на сайт, а на сайте их ждали материалы учебные в виде простых видеороликов, объясняющих, что к чему на пальцах. И соревновательная задача, в которой нужно было предсказать, кто победит в Доте. И школьник, получается, для него предметная область совершенно знакома, понятно. То есть это не какие-то скучные данные из банков. Его любопытство настолько завлекает, что он идет, разбирается в питоне, разбирается в библиотеках для машинообучения, ну и начинает участвовать. На финал было приглашено 100 школьников, которые какое-то разумное решение сделали. Был даже пример Саша Мамаев, он участвовал в подкастах «Медуза», рассказывал про то, как он работает. Тинькове работал во Вконтакте, будучи одиннадцатиклассником, и зарабатывает там больше 100 тысяч рублей в месяц.
-
Я хотел понять, нам есть чем гордиться? Просто вот Россия исторически это страна, которая там с космосом, например, хорошо что-то делает.
-
Главная платформа для соревнований называется Kaggle. Если зайти в турнирную таблицу любого соревнования, там будет понятно, что есть чем гордиться. Отвечаю.
-
В России очень хорошая школа анализа данных, машинного обучения.
-
Это университетская, ты имеешь в виду?
-
Да. Во-первых, Яндекс сделал школу анализа данных. Это породило очень много специалистов действительно хорошего уровня. После этого университеты стали делать свои образовательные программы, посвященные машинному обучению. Ну и в целом у нас вот обучение машинному обучению в России очень хорошо выстроено. Вот тот Антон Канушин, который спецкурс по компьютерному зрению преподавал, он сейчас руководит образовательной программой на ФКН в Вышке, факультет компьютерных наук, заточенный под современные нужды компаний айтишных.
-
То есть, если хочешь этому научиться, необязательно ехать в MIT, можно вполне пойти в вышку и там этому научиться.
-
Тут есть такой момент, что ехать в MIT можно не только за знаниями, а за нетворкингом. В плане нетворкинга не могу сказать. Не был в MIT и не жил никогда в Америке и в Долине. Может быть, MIT того стоит, но совершенно точно в плане уровня знаний у нас все хорошо.
-
Окей, я выучился, я классно в этом разбираюсь, побеждаю на конкурсах. Кем мне можно работать в России, кем мне можно работать в мире?
-
Я довольно долго работал в BookMate, потом в какой-то момент я захотел пожить где-нибудь не в России, и начал искать себе работу в Европе. В итоге я выбрал Берлин, не связанным вообще с машинным обучением, критерием. Работы очень много, работы реально очень-очень много.
-
Слушай, если сравнивать с программистами, мне кажется, ты же из программистов пришёл, да?
-
Нет, я пришёл из аналитиков.
-
Я просто хочу понять, про программистов примерно понятно. Рынок, что тебе довольно легко найти работу, она бывает разная, здесь побольше, здесь меньше.
-
Рынок программистов в пересчёте на количество людей намного больше, чем рынок data scientists. При этом, очевидно, ощущается нехватка data scientists. Постоянно меняется определение того, что должен уметь data scientists.
-
Я бы сказал так, что профессия эта появилась за счет того, что компании строили какие-то IT-решения, в принципе, они их построили, вот банк, у него есть уже IT-решение, его развивай-не развивай, оно принципиально не поменяется никак.
-
Ты имеешь в виду, что процент улучшений будет маленький?
-
Ну да, ты ничего не улучшишь от того, что в инфраструктуре что-то переделаешь. Но при этом компании с IT-инфраструктурой за все время их существования, развития, они накапливали очень много данных. И сейчас наступило такое время эволюционное, что все, что можно запрограммировать, запрограммировали. Профессия разработчика стала казуальной. Разработчик и разработчик. Не так, что ты разрабатываешь. Мы как раз тебя и искали. Рынок устоялся, и теперь есть потребность монетизировать данные, которые компании накапливали.
-
Я правильно тебя понял, что твоя идея в том, что компании столько накопили данных, что не хватает людей, которые бы помогли разобрать эти конюшни и понять, что из этого ценное, а что нет.
-
Ну, по крайней мере, есть спрос. Компании хотят разбирать эти данные и видят возможность роста в том, чтобы делать что-то новое на основе анализа данных, которые они уже имеют, уже накапливают. И в этом смысле появилась профессия data scientist. Это тот человек, который вроде как ставит задачи, которые могли бы быть полезны бизнесу, который делает прототип, показывает на эксперименте, что вот такой анализ данных действительно приносит пользу бизнесу. И потом еще каким-то образом с разработчиками это пытается интегрировать в процесс.
-
Я правильно понял, что Data Scientist говорит бизнесу, где бы бизнес мог сделать себя хорошо. То есть это не бизнесмен приходит и говорит, а сделать мне здесь анализ, а он как бы сам говорит. Я тут заметил, что вы могли бы...
-
Тут меня не расходится. Я вот, когда был Data Scientist, я считал, что вот именно эта роль Data Scientist в компании. Но вообще я считаю, что Data Scientist как профессия должна уйти. То есть это такая временная профессия. Вообще на самом деле будут просто разработчики инфраструктуры, разработчики фронтенда, аналитики, которые будут иметь в багаже своих знаний, машинное обучение.
-
А, пока этим просто мало кто умеет.
-
И они будут это применять в своих сферах. В принципе, ничего нового. В Яндексе так примерно всегда было устроено. Разработчики занимаются только лишь машинным обучением. Есть аналитики, которые могут взять данные, построить отчет.
-
А в компании не уровня Яндекса, а поменьше, там есть один человек, который умеет делать это все, но только в области машинного обучения.
-
На самом деле это меняется довольно быстро. Я помню времена, когда можно было быть дата-сайентистом и уметь очень плохо программировать. Сейчас так уже делать нельзя.
-
Я слышу ностальгию такую.
-
Это были хорошие времена, но потом пришлось научиться программировать. Алгоритмы машинного обучения на самом деле перестали быть. каким-то священным граалем, который 15 человек знает, как это работает. Существуют облачные алгоритмы машинного обучения, где ты подключаешься к гугловскому, амазоновскому, фейсбуковскому или кому-нибудь еще алгоритмам, и они предсказывают тебе, что на твоей картинке. Тебе не надо иметь человека в штате, тебе надо иметь человека, который может постучаться в какой-нибудь API, что намного дешевле сразу становится. Остается две вещи. Понять, когда надо применять машинное обучение и понять, как его встроить так, чтобы это работало на каких-то объемах трафика. Когда это уже как бы data scientist немножко скрещивается с product manager или с кем-нибудь еще. То есть ты должен понять, что в этом месте машинное обучение взлетит. Другое уже скрещивается с data engineer, разработчиками. В общем, это прямо техническая отрасль. Но вот человек, который умеет тренировать алгоритмы машинного обучения, он проваливается сейчас уже посередине. То есть надо либо понимать бизнес-ценность этого, либо уметь это очень хорошо интегрировать в работающий продукт.—
-
Ясно.
-
То есть дикие времена чуть-чуть проходят уже, времена становления индустрии проходят.—
-
Я думаю, что data science…—
-
Они
-
уже прошли. Science тут слово в принципе очень странное, потому что когда ты приходишь в какую-то компанию, компании не нужен science, им нужен решение конкретных проблем. Я думаю, что будут датсайентисты в исследовательских группах, например у Google, у Apple есть OpenAI и DeepMind, они будут заниматься развитием алгоритмов машинного обучения, которые инженеры, аналитики и прочие профессии, уже существующие давным-давно, будут использовать в своей практике. И вот исследовательские небольшой количество датсайентистов будет развивать эти методы, улучшать их и учить всех пользоваться, и делать их более казуальными, доступными для массовой
-
аудитории. Знаешь, это очень мне напоминает, когда я об этом думал, готовился к подкасту, у меня была в голове аналогия про то, что когда-то давно, в 60-е годы, каждый компьютер был уникальной штукой. Для каждого компьютера писали свою операционную систему, и были вообще люди, которые типа программисты, и они умели всё. А теперь мы просто берем, типа, макось и не думаем об этом. А есть типа там чуть хитрая система, но суть не меняется. Я не умею программировать операционную
-
систему, но пользуюсь ими. Да, совершенно точно такой же переход и в машинном обучении. Мне кажется, что я спросил вообще всё, что
-
хотел, мне было дико интересно. Спасибо большое, Самер. Спасибо большое, Петя. Это был подкаст «Запуск
-
завтра». Подписывайтесь там, где вы слушаете подкасты. Ставьте нам оценки и пишите комментарии. Мы все читаем, а на некоторые даже отвечаем. Этот подкаст сделали редактор Андрей Борзенко, звукорежиссёр Павел Цуриков, продюсер Павел Боровков. Благодарим за джингл Алексея Зеренского. Я Самат Галимов. Пока!
-
Я выживу Я выживу Я выживу Я выживу