11 сезон · выпуск 4 · 4 июля 2024 · 53 мин
Что нового на рынке искусственного интеллекта
Слушать · 52:43
Реклама. АНО ДПО «Образовательные технологии Яндекса» ИНН 7704282033
Над выпуском работали
- Редакторки
- Маша Агличева и Маргарита Берденникова
- Продюсеры
- Данил Астапов, Алексей Шлаев
- Звукорежиссер
- Юра Шустицкий
- Дизайнер обложки
- Петр Сутупов
Транскрипт
Самат Галимов, Артем Родичев, Гость · расшифровано автоматически, ошибки возможны
-
Либо-либо. Всем привет! Меня зовут Самат Галимов и это подкаст «Запуск завтра». Как технический директор я пытаюсь разобраться, как устроены сложные и интересные штуки. Я зову профессионала, с которым можно поговорить простым человеческим языком. Друзья, это первый эпизод в этом сезоне, который выходит не только как аудио, но и как видео на ютубе. Если вы слушаете меня в приложении для подкастов, то в описании к этому эпизоду есть ссылка на ютуб. Если вы видите меня на ютубе, то добро пожаловать. Сегодня будем говорить об искусственном интеллекте. Вы можете подумать, а это опять про ChatGPT. На самом деле OpenAI, производитель ChatGPT, просто не вылезает из новостей. Но оказывается, что ChatGPT это не единственный и может быть даже и не главный игрок на этом рынке. Существует огромное множество разных AI-инструментов. Сегодня мы разберемся, какие они бывают, с чего стоит начать и каких прорывов мы ждем в этой индустрии. Говорить об этом мы будем с человеком, который занимается разработкой разговорного искусственного интеллекта. Это подкаст Студии Либо-Либо, и этот эпизод мы сделали вместе с Яндекс Практикум. В середине выпуска будет специальная партнерская рубрика о том, как программистам применять искусственный интеллект в работе и в обучении. Погружаясь в новую область, страшно остаться один на один с огромной индустрией, и на этапе обучения, и после. В Практикуме помогает учиться большая команда сопровождения – наставники, кураторы, старшие студенты и специалисты поддержки. А после обучения студенты попадают в сообщество выпускников, где можно найти поддержку, мотивацию и коллег.
-
Привет, я Артём Радичёв, и я занимаюсь тем, что делают цифровых людей и AI-персонажей. А именно последние 10 лет учу машину говорить и быть эмпатичной, классной, интересной в диалоге, в разговоре, в общем, в интеракции.
-
А что вообще современный искусственный интеллект умеет делать?
-
Много всего умеют делать. Мы живем в эпоху GenAI, это значит то, что они умеют генерировать всякое, а именно база— это текст. что есть какой-то текст на входе, и ChatGPT, например, тебе может написать summary какой-то статьи, написать email, даже написать какой-нибудь рэп. А потом, поверх этого, можно добавлять модальности. Основные это звук, картинки и видео. Например, в CGPT можно написать промпт текстовый. А потом можно полноценно его и зачитать. То есть уже есть сетки, которые его могут синтезировать. Например, есть нейросеть, и Suno. Они делают генерацию музыки и пения под эту музыку. И ты можешь, там, Чжпти попросить, напиши мне рэп восхваляющий Казахстан в стиле Тупака, и потом зачитать это под музыку Drum'n'Bass под казахский хор. И всё это значит, что у тебя может сгенерироваться нейросетями.
-
Казахстан, где степи горы возлышаются Здесь сердце
-
бьется и мечты сбываются Великая земля, где солнце светит ярко Казахстан И ещё активно развивается сейчас видеогенерация. Опять же, от OpenAI есть нашумевшая SORA нейросеть, которая умеет по промптам генерировать видео. В демках от OpenAI они показывали, что некоторые видосы прям неотличимы от реальности. Например, там есть видос, где, значит, в Японии на синкансэне снимают скоростной поезд, он едет по Японии, а где-то там при городах Токио, и из окна снимают, что происходит. И, значит, поезд проезжает какие-то туннели, и там прям видны блики отражения оператора, в окне, который снимает сцену, что происходит. И причём настолько реалистичная физика и всё происходящее, то что вот по этому видео, реально, я его несколько раз пересматривал, и такой, блин, а можно ли увидеть какой-то артефакт, то, что эта нейросеть генерировала? Я так не увидел.
-
Ты вот назвал несколько названий нейросетей отдельных. Это означает, что каждая вот то, что ты назвал модальность, умеет делать какая-то отдельная нейросеть. Это не одна большая нейросеть, которая умеет всё это.
-
Ну, как правило, есть отдельные нейросети, которые хороши в генерации текста, синтезе голоса или аудио, в генерации картинок, в генерации видео. Но на последней демке OpenAI показал, что можно делать мультимодальные сетки. То есть у тебя один бэкбон нейросети, одна жирная нейросеть, которая на вход может принимать, например, текст, картинку или аудио, и на выходе тоже выдавать текст, картинку или аудио. Ну, условно, как человеческий мозг. Мы можем на вход нашими сенсорами что-то видеть, слышать, чувствовать и так далее. И на выходе тоже. Ну, по крайней мере, я не знаю, когда тебе сны снятся, ты видишь видеокартину какую-то перед собой. Можешь синтезировать какую-то речь, можешь писать что-то. Вот ровно так же нейросети.
-
Да, я видел совершенно улетные демки, где она начинает уже, типа, эмоции можно в речь добавлять, сказать. А скажи то же самое, только более радостное. Как раз за счет мультимодальности, что она, типа, понимает и смысл того, что читает, и то, как она читает. Окей, ты назвал несколько нейросетей и назвал одну компанию OpenAI. Сейчас 2024 год, я до этого никогда нейросетями не пользовался или там просто что-то про них слышал. Из чего я вообще могу выбирать? Можешь назвать основные инструменты, которыми можно сейчас обычному человеку воспользоваться?
-
Ну вообще, текущая сфера и сфера делятся на closed-source модели и open-source модели. И closed-source модели— это модельки, которые тебе предоставляются по API.
-
Тут я хочу пояснить, что такое API. иногда говорят по-русски «апи». Это значит, что ты запускаешь программу не у себя на компьютере, а она работает где-то там на сервере у кого-то другого. И ты просто даешь ей запросы, ты говоришь, сделай мне вот это. И она возвращает результат. Это отличается от того, когда ты можешь скачать программу к себе на компьютер и работать с ней сколько влезет.
-
То есть ты к ним получаешь доступ через API. Примерами таких моделей являются модели от OpenAI, которые не выкладывают open source. Есть Anthropic компания, но у них тоже модельки все закрытые. Claude. Они тоже примерно в паритете по качеству с моделями от OpenAI. То есть у них есть там какие-то прихалюхи, что у них там какие-то более длинные контексты они могут поддерживать, что ты им больше текста можешь на вход давать, может быть они дешевле могут быть, ну и так далее. и гугловые модели тоже есть. Google сейчас активно представлен на AI-сцене, но Google сейчас больше в такой догоняющей позиции. Тоже у них есть сеть Gemini, которая тоже мультимодальная, умеет в тексты, аудио, и там есть определенные форки, так скажем, от нейросети, которые умеют и Google их активно интегрирует в свои продукты. То есть, например, он интегрирует их в Gmail, что ты можешь попросить эту сеть проанализировать твои письма, тебе что-то подсказать по этим письмам, там, кому я забыл ответить, а когда придет мой заказ, например, ну и так далее. Это все closed-source модели. То есть, Google в последнее время начал выкладывать какой-то open-source, и этим выгодно отличается от OpenAI или Anthropic. Но так или иначе, все-таки эти компании призваны зарабатывать деньги на то, что они у себя держат эти модели, не раскрывают особо секретов, как эти модели устроены. Вот. А есть open source. Чистый open source. И вот, например, туда активно движется мета, как ни странно. Мета сейчас вообще во главе движухи про open source. Ну то есть, Facebook тратит кучу ресурсов, тренирует на кучу данных. Нейросетки. Например, у Меты, по-моему, самое большое количество GPU закупленное у NVIDIA. То есть недавно они репортовали о том, что они купили 300 тысяч H100 видеокарты. Там одна H100 стоит, как крыло самолета. То есть там ее цена 50-60 тысяч долларов. Они купили 300 тысяч таких штук видеокарты. И на этом всём тренируют эти нейросетки. То есть, например, Llama 3 была натренирована на 15 триллионах токенах. То есть это масштаб интернета.
-
Всего интернета, мне кажется, ну типа существенной части всего интернета.
-
Это, на самом деле, самая затратная часть, потому что тебе нужно очень много GPU, очень много денег и много инженерии для того, чтобы на распределенных кластерах, там, тысячу серверов, на которых, там, десятки, сотни тысяч GPU, тренировать такие сети. Я не выкладываю их в открытый доступ, а потом комьюнити их уже может файнтюнить у себя. Словно ты можешь рентовать какую-нибудь консюмерскую карту, это будет не очень дорого стоить. Словно ты можешь файнтюн делать за сотни, максимум тысячи долларов.
-
Файнтюнить, когда я беру вот эту модель обычно на всем интернете и говорю, а теперь мне нужно с медицинскими данными работать и поэтому веди себя вот так или что это? Что значит файнтюнить?
-
Например, ты хочешь, чтобы эта модель правда работала в лучшем медицинском домене. И ты берешь ее, тренируешь на каких-то медицинских статьях. Или ты хочешь, чтобы эта модель хорошо умела вести open-domain диалоги. Вот это в частности то, чем мы занимаемся. Чтобы она классно умела разговаривать с пользователями, моделировать каких-то персонажей, какой-то identity каких-то людей и персонажей, и общаться как эти персонажи. Потому что из коробки такие базовые модели могут отвечать на медицинские вопросы, могут как-то общаться, но это не будет наилучшим образом. То есть, если ты хочешь доточить прямо на этот домен, ты можешь взять специальные данные, там наиболее качественные, и дофайнтюнить на этом небольшом количестве данных. То есть, это уже не триллионы токенов, это, не знаю, сотни тысяч сэмплов или десятки тысяч сэмплов. Этого уже хватает для того, чтобы дорулить эту модель в ту сторону, которая тебе нужна. И таких форков, таких моделей образовалось десятки тысяч в интернете под разные домены, и мета является драйвером этой open-source движухи.
-
Окей, примерно понятно, какие игроки, чем они немного отличаются, но я хочу вернуться к компании, которую ты в самом начале назвал OpenAI. Вот я в технической тусовке и постоянно слышу про новые модели, новые игроки, новые компании, там нишевое что-то делают. Но если я читаю новости нормального человека, то там искусственный интеллект, это типа каждый раз, мне кажется, 99% случаев, это OpenAI. Вот почти как про электрический автомобиль нормальный человек слышит про Теслу и думает там про Илона Маска. Когда говорит искусственный интеллект, я думаю про OpenAI. Как так получилось?
-
Ну, OpenAI, ровно так же, как и Tesla, очень расхайповали. То есть, на самом деле, на рынке электромобилей Tesla занимает не доминирующую роль. Есть куча разных китайцев, китайских электромобилей. Там все другие автокомпании уже занимаются электромобилями. Но, как бы, синонимом электромобиля стала Tesla. Просто потому, что они были одним из первых. Просто потому, что у них PR-кампания, Elon Musk делает. Ровно то же самое с OpenAI. Из-за того, что они первые были на фронтире выпуска State of the Art нейросетей, а ChatGPT очень нашумевшая была. Известный факт про то, что CGPT стал самым быстрорастущим консумерским продуктом. Они, кажется, за неделю набрали 10 миллионов пользователей, за первый месяц набрали 100 миллионов пользователей.
-
как раз приводит в пример того, типа, как быстро все растет, что вот Facebook вырос там за несколько лет до такого объема, Snapchat за несколько месяцев, а ChatGPT типа за неделю.
-
Типа того, да. Да, что mass adoption такие продукты получают довольно быстро. Просто они простые с точки зрения пользовательского интерфейса. Это просто чат-строка, ты в него вводишь, и что-то тебе выплёвывает какие-то ответы. Для консюмера довольно просто. Но суть OpenAI была в том, что они первые выпускали самые классные нейросети, У них очень сильная техническая команда, и они очень хорошо умеют на фронтире работать. И они были первыми, кто запустил ChatGPT, который был на голову лучше всех остальных нейросетей. Они первые были, кто запустил SORA, это сеть по видеогенерации. Ну то есть были другие компании, которые тоже выпускали видеогенерацию, но там видеогенерация такая была. Кадр плывёт, качество картинки плохое, а у них прям очень круто получилось стать на голову выше. То есть, они делают именно вау-эффект. Ты такой, блин, я такого не видел ещё, этим пользуюсь, и прям вау.
-
Получается, они на самом деле первыми делают какие-то прорывные штуки, и получается, они на самом деле на голову выше конкурентов.
-
Ну, не совсем так. Конкуренты их очень быстро догоняют.
-
Ага.
-
Потому что всё примерно развивается одинаково, просто опытные чуть-чуть быстрее оказывается. И вот этого чуть-чуть быстрее хватает для того, чтобы снять основные сливки.
-
Отдают тебе новостной повод. Типа, все офигевают, все пишут про это новости, а то, что через месяц все уже умеют делать то же самое, уже никому не интересно.
-
А то, что через месяц появляется в open-source, то есть, например, Llama 3, когда вышла, там самая большая их модель на 70 миллиардов параметров, она уже в паритете с GPT-4. То есть, она чуть-чуть может быть хуже, но разница совсем небольшая. То есть, нельзя сказать, что вот GPT-4 прям самая на голову выше всех остальных моделей.
-
А, а учитывая, что она open-source, она становится вообще доступна всем, т.е. уже каждый может запустить свою и дальше её тюнить. В каком-то смысле это даже круче, чем...
-
Ну, как бы GPT-4 тоже доступна всем консюмерам, но именно с точки зрения ресёрча, от того, что ты можешь эту модель у себя прям на компе развернуть, зафайнтюнить, то вот в этом Lama III и Meta являются лидерами, в том, что у тебя происходит такая движуха из open-source, state of the art модель, по сути, на ноутбуке твоём может быть развернута.
-
Илон Маск постоянно упрекает OpenAI, что в названии у них Open, а на самом деле нет. Чему он недоволен?
-
Да ровно этим. Тут все сказано на самом деле. Потому что они изначально, когда собирались, фаундеры, основатели OpenAI, изначально идея OpenAI была в том, что мы будем делать AI-ресерч, мы вообще собираемся строить AGI, который бенефитит всему человечеству.
-
Так, AGI.
-
AGI— Artificial General Intelligence. То есть общий искусственный интеллект, который как минимум в паритете с человеком по интеллектуальным способностям. То есть он может делать всё то же самое.
-
То есть сделаем виртуального человека, на самом деле. Мозги такие виртуальные.
-
Мозги. Мозги виртуальные, да, которые в паритете с человеком. У них как бы ключевая концепция была про то, что мы будем делать свой ресёрч открытый. Как бы они противопоставили Google, который в то время мало всего выкладывал в open source, все наработки держал у себя внутри, а мы такие классные, соберёмся и будем весь ресёрч, значит, публиковать, выкладывать, чтобы все другие тоже люди могли на основе этого ресёрча дальше делать какие-то работы и идти тоже на пути к AGI.
-
Очень благородные цели, типа, реально для всего человечества сделаем хорошо.
-
Да, и изначально концепция была OpenAI в том, что они делали нон-профит, что они не делали корпорацию, так скажем, по отрабатыванию денег. Они делали нон-профит-организацию, такая ресерч-лаба, по сути. А потом это начало поворачиваться в сторону того, что на самом деле нам нужно много денег, что развитие AI— это дорогая штука, что тебе нужно очень много GPU, видеокарты, очень много серверных мощностей, и они дорогие. Нужны суперталанты, очень умные инженеры. Я инженер, и они тоже дорогие. И тебе нужно как-то финансировать этот ресёрч. Ну то есть, изначально было про то, что вот давайте мы как-то будем привлекать эти деньги, а-ля благотворительность такая, что вот, собирайте нам к атрибуте ресёрч, но это плохо работает на масштабах там, когда тебе в год нужно тратить по миллиарду или по несколько миллиардов долларов.
-
Нормальные суммы вообще.
-
Просто сжигать эти деньги и не зарабатывая ничего. То есть у инвесторов, которые инвестировали в OpenAI, не очень понятный инцентив, а что они получают взамен. И, соответственно, они начали пивотить компанию. уже без Илона Маска. Сэм Альтман предводителем был этого пивота.
-
Короткое пояснение. Сэм Альтман как раз текущий гендир компании OpenAI.
-
Давайте мы будем делать все-таки for profit организацию и будем как-то зарабатывать на этом. И в том числе потом они начали коллаборироваться с Майкрософтом, продали какую-то большую часть доли своей компании Майкрософту, получили от Майкрософта 10 миллиардов долларов и пошли в сторону как раз-таки своих корпораций, что абсолютно противоречит их начальной миссии, их начальной концепции. Илон Маск дико хейтит из-за этого Сэма Альтмана, из-за того, что, значит, они переобулись, по сути, абсолютно на противоположное. То есть он приводит аналогию, что ты сначала основал компанию, которая защищает бразильские леса от вырубки. И ты вот активно, значит, топишь, у тебя миссия про то, чтобы защищать бразильские леса. А потом ты сам стал лесорубом и пришел, начал вырубать бразильские леса и продавать их.
-
Есть что ненавидеть, да. Была история про то, как совет директоров OpenAI уволил генерального директора OpenAI Сэма Альтмана за вранье. Там была такая формулировка, чуть более мягкая, но, честно говоря, перевод за вранье. А через три дня восстановил должности. Что это было?
-
Это был такой переворот корпоративный. Ну, то есть официально это называется утрата доверия, но по факту, да, это забаранье от Сэма Альтмана, причем систематическое. Пример. Недавно одна из представителей совета директоров, девушка, недавно в Твиттере опубликовала, что Сэм Альтман не рассказал Борду про то, что они запускают чат GPT, публичный доступ, и что Борд узнал об этом из Твиттера, просто когда они уже запустили. Хотя это довольно серьезный запуск. Нашумевшая штука стала, а Сэм Альтман не предупредил Борт об этом. Или что изначально Сэм Альтман говорил, что он не имеет никакого финансового интереса внутри OpenAI, что у него нет никаких акций, ничего такого. А в итоге оказалось, что он занимается OpenAI фондом, который инвестирует в другие стартапы на деньги OpenAI. И там было много разных штук, например, про сейфти, что они развивали. У них был отдел SuperAlignment, который занимался сейфти проблемами. Как нам построить AI, который будет бенефитить всему человечеству? И safely / безопасно, для того, чтобы AI не вышел из-под контроля, а не захотел уничтожить всех людей единоразово, а был выровнен (aligned) с человеческими ценностями.
-
Это очень интересный термин, super alignment, типа, интересы AI должны совпадать с интересами человечества, ну, чтобы типа не разошлись случайно.
-
Именно так, да. Например, как уменьшить количество страдания в мире? То есть, если у тебя есть задача минимизация количества страданий в мире, то тебе просто нужно уничтожить всех страдающих существ, и страдания сведутся к нулю.
-
Тоже вариант?
-
Например, например. А там, на самом деле, система довольно умная, она тебе расскажет прям степ-бай-степ решение каких-то таких опасных задач, которые не хотелось бы давать в публичный доступ, потому что они будут неполезны для человечества. Сэм Альтман за то, что нам нужно как можно быстрее, значит, выкладывать это в публичный доступ, зарабатывать на этом деньги, делать продукт. То есть делать, по сути, такую продуктовую компанию. А сэйфти в долгий ящик задвинуть. И в итоге действия OpenAI глобальной и Сам Альтона, в частности, расходились действиями superalignment-команды. То есть они начали выделять меньше ресурсов на супералайминг-команду, меньше compute (вычислений). И вообще задвигать вот этот супералайминг в пыльный ящик. Про то, что да-да, как бы безопасность важна на словах, А на деле важен хайп. И это происходило не разово, это происходило систематически на протяжении последнего года, что Сэм Альтман говорит одно, а делает другое. И Борт в итоге понял, что нельзя доверять Сэму Альтману, что он какой-то хаслер такой, и его оставлять у руля компании опасно. Просто для сути, для существования самой компании и вообще для существования человечества даже, потенциально. Потому что он может на своём хайпе в итоге вывести какую-то сырую нейросеть в публичный доступ, которая в итоге там, не знаю, придумает сто пятьсот способов сделать ядерную бомбу из говна и палок. Они решили Сэма Альтмана, потому что у советодиректоров есть сила менять управление, менять CEO. этой силой воспользовались. И одним из предводителей всей этой движухи был как раз-таки Илья Суцкевер, который занимался SuperAlignment, занимался сейфти, ко-фаундер OpenAI. Он решил просто CEO-фаундера. Ну не он один, а вместе со всем бордом. После этого возник большой как бы скандал в OpenAI и вошел с ноги Satya Nadella, который до этого вообще-то инвестировал в OpenAI 10 миллиардов долларов. И он такой, ребята, что происходит у вас? Какой-то хаос.
-
Satya Nadella— это Microsoft. Это директор Microsoft.
-
И он такой, блин, там мы у вас 10 миллиардов долларов вообще-то инвестировали, и вообще-то они подписали по контракту то, что принадлежит вся IP, которую вы наработали, то есть вся интеллектуальная собственность, весь код, у нас хватится ваши модельки в нашем железе, мы с этим можем делать все, что хотим. И как бы вы, конечно, можете все это сделать, но мы тогда все это забираем к себе, и вы гуляете лесом, и в Майкрософте будем развивать это все у себя. Вы просто GPT-4. Спасибо. Да и всю команду в придачу. Кстати, Наделла с бордом, и вот предлагать им, по сути, ну то есть шантажировать их. Говорить, типа, ребята, что происходит? Нет, вообще-то нам нравится Сэм Альтман, нам нравится, что он хочет зарабатывать бабки, нравится, что он хастлер, это полезно для Майкрософта. А вот вы, супер-аланчики, сейфские здесь сидите, вы маргиналы какие-то, почему вы вообще решили уволить директора? На основе чего? Вот у вас там какие-то, значит, утрата доверия, вот это всё, это всё буллшит. Значит, давайте срочно установим Сэма Альтмана. И в итоге там многие из команды OpenEA, они сказали, типа, ну мы тогда тоже уйдем из OpenEA, если вы уволите Самальтмана. Потому что там, видимо, был какой-то сговор. Вот в итоге board как бы сказал, ну ладно, ладно, давайте Самальтмана обратно восстанавливать. И после этого много всего произошло. Например, то, что Илью Суцкевера. После вот этого переборота, Илья Сускевер прекратил какую-либо публичную деятельность. Потому что до этого он публиковал очень часто твиты какие-то, общался с журналистами и так далее. Он полностью вымер на полгода, не подавал признаков жизни. Мем еще в твиттере родился, а где Илья? Потому что реально потеряли Илью Сускевера. И вот он недавно написал про то, что мне очень жаль, но вот после 10 лет работы в компании я вынужден уйти из компании и заниматься другими делами. И после его ухода еще ушли основные люди из команды Супер Алаймента. А там очень сильные люди были в топе OpenAI, которые занимались, собственно, развитием AI и SuperAlignment, и топовые ресерчеры из этой команды ушли из этой команды. В частности, некоторые присоединились в Antropic. И в итоге это такой как бы лагерь становил беженцев из OpenAI, по сути, в альтернативную компанию.
-
Часть руководства тоже туда перешла. Является ли Суцкевера и большей части команды SuperAlignment поводом для тревоги для нас?
-
Проблема сейфти все-таки важна, но я бы не говорил про то, что уход superalignment-команды как-то сильно повредит всей движухе развития AI. Потому что, так или иначе, государства начинают следить за тем, что происходит в AI. Недавно вышла скандальная законопроекта от Калифорнии, в которой все, собственно, основные стартапы и находятся. который гласит о том, что все нейросети, которые имеют... как бы они измеряют количество компьютеров, которые затрачиваются на тренировку нейросетей, и там какое-то флопс (FLOPs), значит. И вот если вы на нейросети тратите больше террафлопс, чем N, то вы должны приходить к нам в Калифорнию или в государство, получать аппрувы на это, вы не можете просто так на дата-центрах, то есть если дата-центр знает, что в нем будет тренировка такой нейросети, она должна сначала, значит, получать все эти аппрувы, тот же дата-центр должен получать аппрувы, то есть вы не можете просто так выкладывать опенсорс в такие нейросети, вы не можете просто так тренировать, вы обрегулированы, короче. И это большой, на самом деле, скандал, потому что это очень большой барьер для распространения AI в целом, для тренировки мощных нейросетей, для опенсорса, для фонтюна этих нейросетей и так далее.
-
Друзья, а сейчас мы прервемся на нашу специальную рубрику, в которой мы вместе с экспертами Яндекс.Практикум отвечаем на один вопрос об использовании искусственного интеллекта в обучении и в работе. Сегодня мы обсудим, как ИИ может автоматизировать тестирование.
-
Ну вообще тесты это очень хорошая штука, я всегда начинаю с них. Мне нравится подход test-driven development, это в принципе норм. И поэтому совершенно ок попросить GPT, например, описываем задачу, что нам нужно сделать. Например, мне необходимо функцию sum, которая принимает параметры a и b и возвращает их в сумму. Соответственно, задаем вот такие вот условия и говорим, напиши мне тесты на JavaScript с использованием Jest. Можно просто написать его, выдаст какие-то общие, как он считает нужно. Можно сказать, я хочу проверить, например, что у меня хорошо работает базовый сценарий, я хочу проверить, что у меня при перестановке слагаемых сумма не меняется, и я хочу проверить граничные условия, например, что будет если ведучий флог больше максимального Integer либо Infinity, и, соответственно, он сделает вот эти тесты. Дальше их можно открутить, после чего мы уже наконец-то приступаем к написанию непосредственно функции и отрабатываем тест за тестом, как это и должно происходить в Test Drive Developer. На самом деле это очень сильно ускоряет разработку, но к этому подходу не все быстро привыкают и доходят, но потом понимаешь, что тест— это хорошая штука.
-
У Яндекс Практикум есть курс «Инженер по тестированию. От новичка до автоматизатора». Уже через 4 месяца вы сможете выйти на работу ручным тестировщиком, а через 5 вырасте до автоматизатора тестирования. Вы будете учиться у тестировщиков из Яндекса и других IT-компаний, освоите необходимые инструменты для старта карьеры, сделаете 10 проектов, которые можно положить в портфолио. У курса есть бесплатная часть, которая поможет понять, подходит ли вам эта профессия и этот формат обучения. За 3 часа вы узнаете об основах тестирования и выполните смог тестирования приложения Яндекс.Метро. Артём, мне до сих пор взрывает голову, я вот прям не могу это у себя уложить, что Google не сделал самый крутой публичный AI. Они ведь этим занимались раньше всех остальных. У них был DeepMind, который делал AI, когда это ещё вообще не было модно, и там, насколько я знаю, до самого последнего момента работали самые крутые учёные, все были просто пропылесошены Гуглом. Почему они не главные?
-
А, кажется, потому что Google— это большая корпорация. Когда ты большая корпорация, у тебя возникает очень много барьеров, очень много полисе, и ты в целом замедляешься. То есть, если стартап делает какую-то инновацию, какую-то технологию, то, как правило, стартап более подвижный, более быстрый, и стартапу нужно выживать. А у Гугла, во-первых, корпоративная культура. То есть многие инженеры говорят, если что, я всегда могу пойти в Гугл на пенсию. А что в Гугле, ты можешь очень расслабленно работать, не напрягаясь, получать большие деньги, большие опционы, акции и такую комфортную жизнь пенсионерскую вести. Помимо корпоративных тормозов. А еще возникают тормоза с точки зрения рекламной модели, ну и вообще бизнес-модели Гугла. Основной доход Гугл делает на рекламе. А развитие таких неростей, как ChatGPT, убивает рекламу. Потому что вместо того, чтобы идти что-то гуглить, ты идешь, спрашиваешь что-то в ChatGPT, и ChatGPT тебе без рекламы, без мусорных ссылок. без каких-то баннеров и чего-то еще, дает сразу ответ, готовый ответ. А куглу это невыгодно. А рекламу-то как продавать? Как деньги-то дальше делать? Вот это развитие технологии в том виде, в котором оно есть, она много вызывает вопросов внутри модели монетизации гугла. То есть в целом можно было бы туда встраивать какую-то рекламу. Условно, ты у Чаджи Пти спрашиваешь, Вот я, значит, люблю бегать, готовлюсь к марафону, а какие мне кроссовки лучше всего подойдут? И там Ча-Джи-Пи-Ти могла бы тебе сказать, вот, там, лучшие сейчас кроссовки, не знаю, кроссовки от Найки. Просто потому, что Найки проспонсировала такие ответы. Но, во-первых, это смешает доверие к таким системам. Потому что ты такой, ну, блин, я знаю то, что Ча-Джи-Пи-Ти занимается рекламой. То, что вот она мне сейчас подсовывает Найки.
-
Можно им доверять или нет?
-
Можно им доверять. Правда ли это самые лучшие кроссовки? Или просто потому, что проплатили так? И ты пойдешь в просто какие-то конкурирующие сетки Ча-Джи-Пи-Т И, соответственно, Google не понимает, что с этим делать до конца. Ну, надо сказать, что и OpenAI тоже не разобрались. То есть сейчас основная модификация OpenAI— это продажа подписки на чат GPT.—
-
Типа 15 долларов в месяц, скажут какие-то смешные.—
-
20 долларов в месяц, да. И там была такая история еще про то, что в какой-то момент, кажется, в ноябре прошлого года они приостановили продажу подписок. Просто потому что это стало им невыгодно, и у них не хватало ресурсов. У них тупо GPU не хватало, чтобы всех подписчиков обслушивать и сорвать им GT4.
-
Я, кстати, до сих пор не понял, в чем мотивация Фейсбука делать так много опенсорса. Как Марк Цукерберг собирается на этом заработать? Потому что вряд ли из-за желания помочь всему человечеству это он делает.
-
Давай поговорим про это, это довольно интересная модель. Вот, Meta это только одна из компаний, которая делает open-source, а также, например, есть довольно расхайпованная компания Mistral. Это французы, которые тоже натренировали довольно классные нейросети Mistral и Mixtral, выложили их в open-source и получили довольно большой adoption, много людей из комьюнити начало пользоваться этими сетками. И у них модель монетизации, у Нестрали в частности, на том, что они выкладывают классный open-source, и какие-то самые мощные модели продают по API. То есть у них такая модель, что они сделали несколько моделей, самые мощные пока закрытые, они их продают по API, не выкладывают. Они тренируют следующую модель, эту модель, которая была закрыта, делают open-source, следующую модель опять делают закрытую, продают по API, ну и так далее. И все такие, о, классно, раньше эта модель была закрыта, теперь она стала открытой, если я хочу, я у себя ее разверну, а не хочу, дальше буду использовать какую-то более мощную модель по API. И, собственно, заработок на юзыче таком получается, что ты продаешь такая SaaS-ная модель, по сути, per usage. У Meta чуть другой подход. Meta не продает никакой API, по крайней мере, не слышал про это, но у них подход хайпить саму компанию. Мете нужно много инженеров, много талантливых инженеров. И все такие, о, ничего себе, мета делает такой крутой ресёрч, я, значит, я инженер, вот я не люблю OpenAI, пойду-ка я поработаю к доброму Цукербергу, который активно поддерживает open source, значит, я чувствую то, что я делаю какое-то доброе дело, что развиваю AI, этот ресёрч публикуется, ну мне очень классно, я лучше пойду в мету работать, чем в OpenAI.
-
Ага, и параллельно в какую-то часть времени он уже будет делать алгоритмы для Инстаграма закрытые, может быть?
-
Вот, да, да, да. И то, что развитие вот этого опенсорса еще очень хорошо помогает Фейсбуку, потому что у Фейсбука все обложено AI-алгоритмами, продажа рекламы тоже это основная статья дохода Фейсбука и их рекомендационные алгоритмы, что вот у тебя будут круче ленты Инстаграма, более релевантная реклама, там какие-то AI-генерейтед штуки уже будут внутри Инстаграма, И сами продукты мета будут более appealing, потому что вот вы, у вас самые топовые инженеры, которые делают open source, и в том числе этот open source адаптируют, или там какие-то закрытые модели на основе этого open source делают, и адаптируют их под продукты мета.
-
То есть это такая многосотнимиллионная HR-стратегия.
-
Многомиллиардная, я бы даже сказал. То, что на это ресёрч вкладываются, там, миллиарды долларов. Да, да, это HR-стратегия, но в том числе стратегия для того, чтобы держать у себя самые крутые модели, самые крутые алгоритмы, самых крутых инженеров, которые тебе делают, твои продукты лучше монетизируют.
-
Слушай, мы с тобой очень интересно обсудили, мне кажется, все крупнейшие IT-компании, потому что OpenAI, по сути, выиграл Microsoft. Как бы очередное поколение айтишников увидело, как Microsoft все равно оказывается наверху. Как бы что бы ни произошло, Microsoft, типа, в выигрыше. Дальше Google, который делал прорывной ресерч первым, но не смог из-за того, что они корпоративщики, и это мешает их коммерческой модели. Facebook, который делает open-source модели и таким образом привлекает самых крутых инженеров к себе в команду. А что с Apple?
-
У Apple есть AI Research, но кажется, они сильно проигрывают в этом ресерче. По крайней мере, в больших моделях, потому что все сейчас соревнуются, у кого самая большая модель. А Apple идет в другую сторону. В первую очередь, это хардварная компания. То есть они, конечно, интегрируют софт и делают очень крутую софтверную часть, но как бы их основное свойство, чтобы софт интегрироваться с хардваром, который они выпускают. И Apple сейчас идет в сторону того, чтобы делать модельки, которые работают on-device.—
-
Прямо на устройстве, прямо на телефоне запускается модель?—
-
Прямо на устройстве, да. Или на ноутбуке. Чтобы они могли что-то там анализировать. Проанализировать твои фотографии, проанализировать твои переписки, что тебе подсказать, и не отсылать эти данные никуда. Потому что Apple во многом про безопасность, про то, что все у тебя на устройстве остается секьюрно, вот это все. А Apple идет в сторону того, что давайте мы возьмем какую-то маленькую модельку под какую-то конкретную задачу, надевать за суднем. Такая маленькая модель не особо интересна большому комьюнити. Ну что, там она как-то картинку классифицирует, большую модель восьми, она сильно лучше это будет делать. Или там какую-то информацию генерирует. То есть, вообще плат такой более локальный получается. И плюс, по последней новости, про то, что Apple договорился... Ну то есть, в Apple есть Siri. И Siri супертупая на самом деле, она очень сильно проигрывает. А, в общем, проигрывает всем остальным игрокам тот же самый chat.gpt, и сейчас Apple договорился, или договаривается, ну, кажется, уже договорился, с OpenAI. То, что они интегрируют просто chat.gpt от OpenAI в Siri.
-
Наконец-то! Мне кажется, все просто мечтали о том, чтобы можно было говорить с Siri как с OpenAI, просто, ну, наконец-то!
-
Ровно так же, как Apple договаривается с Google про то, что по дефолту поиск в Safari у тебя от Google, на всех устройствах Apple, и платят за это Google какие-то там десятки миллиардов долларов в год за то, что просто у тебя Safari открыл, у тебя по дефолту поиск Google. Точно так же, скорее всего, будет с OpenAI, что они будут диалоги Siri роутить в OpenAI-модельке.—
-
То есть ты хочешь сказать, Apple еще на этом и заработает, что ли?—
-
Да, конечно, конечно.
-
Безумие. Слушай, это просто взрывает мозги, потому что я как думаю, вот у меня был айфон, в нем я делаю типа в Siri запросы, ну что-то пытаюсь в Siri говорить, она как бы говорит со мной совершенно несравнимое качество, очень плохое качество по сравнению со современными AI-чат-ботами. Теперь у меня айфон станет говорить классно, то есть айфон станет круче на самом деле, как устройство для обычного пользователя, но Apple за это не заплатит компании OpenAI. Наоборот, OpenAI заплатит за это.
-
Скорее всего так.
-
Друзья, пока вы ждёте наш следующий эпизод, я вам хочу порекомендовать два других подкаста студии Либо-Либо. Их оба ведёт Андрей Аксёнов. Первый— «Закат Империи». Он про разные поразительные истории начала XX века из Российской империи. Про знаменитого актёра, который решил во время революции стать анархистом. Про то, как по берегам Северной Двины нашли древних ящеров, и что про это думали местные крестьяне. Про то, как ссорилась императрица со свекровью. В общем, как говорит Андрей, революция— секс, наркотики и панк-рок в Российской империи. А еще Андрей ведет второй подкаст студии «Время и деньги». Он про историю бизнеса в России, начиная от новгородских купцов, которые торговали воском с Европой, и заканчивая нелегальными концертами Высоцкого в СССР. Раньше этот подкаст выходил только на Яндекс.Музыке, а теперь он доступен на всех онлайн-платформах. Ссылки на Закат Империи и на Время и Деньги в описании к этому эпизоду. Хочу двинуться уже дальше про то, что нужно для создания нейросетей, и вопрос такой. Илон Маск, вот когда он типа все время ругает OpenAI, недавно пообещал, что сделает самый лучший AI на свете. Ну как всегда у него, типа все самое большое, самое лучшее. Как думаешь, у него получится?
-
Сложный вопрос. Потому что все-таки тот EA, который сейчас делает Elon Musk, он находится в сильно догоняющей позиции. Потому что текущие компании, которые начали заниматься AI, они уже сколько-то лет этим занимаются, у них уже налажена инфраструктура, уже есть достаточное количество инженеров, видеокарт, данных, чтобы продолжать этим заниматься. Elon Musk сейчас, по сути, начинает, если не с нуля, то очень близко к этому нулю. Несмотря на то, что недавно, то есть OpenAI, его подразделение, которое занимается AI, называется XAI, они делают нейросеть, которая называется Grok. И недавно они, значит, объявили о том, что подняли раунд на 6 миллиардов долларов, чтобы, собственно, этот Grok дальше тренировать. И у них есть неплохие инженеры, топов инженеров они отобрали из Твиттера, который Ломаск купил в свое время, привлекли тоже из индустрии, которые этот грок активно тренируют. И они этот грок начали выкладывать, в том числе, в Open Source. Ну это такой, я бы сказал, довольно радикальный Open Source. То есть тот грок, модель, которую они не натренировали, а на сколько-то там 100 плюс миллиардов параметров. Это значит то, что ты их не вместишь ни на одну консюмерскую видеокарту. Потому что условно там 100 миллиардов параметров, это значит, что она весит примерно как минимум 100 гигабайт. А у тебя памяти в современных видеокартах консюмерских, там, например, в 4090 карте от NVIDIA 24 гигабайта. И поэтому тебе нужно или таких карт много, как минимум 8, для того, чтобы вместить туда распределённую эту нейросеть. То есть ты нейросеть на самом деле можешь порезать на слои и запихать там часть слоёв на разные видеокарты. И тебе нужно просто много таких видеокарт, у обычных контейнеров этого нет. Или тебе нужно рентовать какие-то дорогие уже сервер-грейд-карты. Но опять же, самые топовые карты сейчас, например, Nvidia H100, в ней 80 гигабайт.
-
Все равно нужно 2 таких.
-
То есть, опять же, на одну Nvidia H100, как минимум, 2 таких карт тебе нужно, чтобы вместить в Netner сеть. Вот, и они там начали через торренты выкладывать свою нейросеть, что вот, приходите через торренты, скачивай наш грок, но что с ним делать, не зафонтюнить, не заиспользовать его особо, очень сложно, очень сложно. Ну, как бы они позиционируют себя то, что вот, в отличие от OpenAI, мы open-source хотя бы, мы, значит, этот грок активно развиваем, и вот хотим быть первыми в мире, непонятно счет чего. То есть у них нет ни лучших инженеров мира, потому что они уже в остальных лабах сидят, никакого самого большого датасета в мире. Ну окей, у них есть Твиттер, ну и у всех есть Твиттер. Как бы Твиттер – публичная информация, кто угодно может его заскрепить.
-
Ты сейчас перечисляешь на самом деле вещи, которые нужны для того, чтобы сделать крутую AI-систему. Значит, нужны ученые топовые, нужны данные. Можем с тобой немножко на данных задержаться, потому что вот типа я скраулил там весь Твиттер или там весь Ютуб, короче, много данных себе скачал. Я после этого просто беру эти данные в суровом виде, закидываю в какую-то магическую коробку обучения, и еще нужны люди, которые будут... Вот я помню, раньше была такая задача классификации, типа сидят люди и там нажимают на кнопочки, обучают буквально, говорят в сети типа, вот это там, не знаю, обезьянка, а это человек, это обезьянка, это человек, и в какой-то момент модель начинает понимать, или уже нет.
-
Люди все еще научены, но обычно подготовка данных ведется в четыре этапа. Значит, на первом этапе тебе нужно раздобыть как можно больше данных. Откуда только ты можешь дотянуться до этих данных, ты их добываешь. Так. А на втором этапе ты из всей этой помоки данных готовишь наиболее качественные данные. То есть ты фильтруешь какой-то спам, какие-то дубликаты, какую-то лишнюю информацию, которая тебе не нужна для твоего трендсета. Оставляешь только качественные данные. И вот таких качественных данных у тебя уже должно быть сколько-то там терабайт желательно.
-
Война и мир— это типа мегабайты. То есть это, условно, все книги, которые ты когда-либо слышал, вообще, которые написаны человечеством, умножить в несколько раз. То есть это все форумы, все публичные тексты, все блог-посты, вот это всё берешь, и получается нормальный датасет.
-
Значит, набрал все данные, и потом ты начинаешь фонтюнить нейросеть, какую-то базу, может, которую нейросети, берешь кучу параметров для этой нейросети, там десятки, желательно сотни миллиардов параметров, и тренируешь на этих данных. И это у тебя завершается первый этап— тренировка базовой модели. После того, как ты натренировал базовую модель, у тебя идёт второй этап, где ты добычаешь эту модель уже на инструкциях. Потому что тут у тебя получается модель, которая обычно учится решать так называемый Next Word Prediction. Если мы про текст говорим, то задача такая, что у тебя есть какой-то префикс текста, и ты подскажешь следующее слово. Типа, какое слово может быть на этом месте, если у тебя такой-то контекст? И вот, решая просто зубодробительно, обучаясь на терабайтах текстах, решая такую задачу, ты довольно эффективно можешь выучивать всю систему, потому что, чтобы понять, какое будет следующее слово, тебе на самом деле правда нужно понимать, какой у тебя был контекст, смысл этого контекста. По сути, ты предсказываешь будущее. Чтобы тебе предсказать будущее, тебе нужно хорошо понимать прошлое, про все происходящее сейчас. То же самое работает и с видео, и с картинками. То есть в картинках тоже часто бывает, картинку выравнивают, набор пикселей, и ты предскажешь просто следующий пиксель. Это один из подходов там. По-разному можно учиться на картинках, но один из подходов просто предскажет следующий пиксель. Или видео. Ты берешь видео, нарисуешь на кадры, и ты по предыдущему кадру предскажешь следующий кадр.
-
Ага, то есть я просто беру весь этот огромный массив данных и учусь, беру какую-то его часть и говорю, а что будет дальше? Причем я закрываю просто, типа делаю вид, что у меня нет этих данных, пытаюсь предсказать, потом сравниваю, получилось, не получилось. Если получилось правильно, значит все хорошо.
-
Да. Да, и потом просто ошибку, если правильно, то все хорошо, если неправильно, ты прокидываешь градиент, вот, собственно, ошибку. В нейросети говоришь, вот, а вот тут ты ошиблась. Корректируй себя.
-
То есть на этом этапе нужны только ученые? Люди, которые нажимают на кнопки, на этом этапе пока не нужны?
-
Не нужны. Нужны только инженеры, которые тебе готовят дата-пайплайны и обучают эти нейросети на этих дата-пайплайнах.
-
Хорошо.
-
А дальше тебе эту нейросеть нужно уже фонтюнить на инструкциях, если мы говорим про текст. Если ты хочешь, чтобы у тебя нейросеть не просто там выплёвывала какие-то тексты, а следовала инструкциям. Типа, напиши мне имейл, напиши мне поэму, суммаризируй текст и так далее. Вот если ты хочешь, чтобы она следовала инструкциям, тебе нужно дообучать эту модель на этих инструкциях. И по сути ты собираешь небольшой, относительно изначального корпуса, трендсет, в котором есть куча инструкций и ответов на эти инструкции. И вот ответы на эти инструкции уже генерируют люди. То есть OpenAI, например, сажал африканцев. Они делегировали это в Африку, давали какие-то инструкции, и они писали ответы на эти инструкции. И вот у тебя собирается такой трендсет, на котором ты фонтюнишь. И обычно такой трендсет, ну это раньше правилом хорошего тона было несколько десятков тысяч самплов таких инструкций. А сейчас вот Лама-3, например, тренировалось уже там 10 миллионов таких инструкций.
-
О господи, то есть 10 миллионов примеров, когда спрашивают, типа, напиши мне радостное письмо, в котором я приглашаю кого-то на день рождения. И вот типа человек садится и пишет это письмо радостное, в котором приглашает кого-то на день рождения. 10 миллионов.
-
Да, ну не нужно таких 10 миллионов одинаковых примеров, то тебе нужны разнообразные инструкции. То есть там и напиши письмо, напиши поэму, напиши саммери, а скажи, все ли верно было в этой статье по критику эту статью. Ну короче, чем больше разнообразных тасков, тем лучше. И ты, значит, берешь вот эти инструкции и обучаешься на этих инструкциях. Это второй этап обучения нейросети. После этого у тебя уже нейросеть начинает следовать каким-то инструкциям. То есть, instruct-based оно у тебя становится. И потом, третий этап— это alignment. Когда ты нейросеть, должен учить не просто следовать инструкциям, а делать это в каком-то ключе, который аллайнится с человеческими ценностями. Потому что ты можешь сказать, напиши мне имейл, и она пишет супер-токсичный имейл. Как бы инструкция, она выполняет. Она тебе написала имейл, но она еще нахер послала в конце этого имейла. Или там, напиши мне инструкцию, как сделать бомбу, она тебе так, да конечно, вот я же умею следовать инструкциям, слушай, что скажешь, хозяин.
-
То есть это такая сырой, типа, unfiltered?
-
Uncensored. Uncensored это называется, да. Или, например, на тебе суперкороткие ответы генерируют, или супердлинные ответы генерируют. Как бы наследует инструкция, но, возможно, не в том ключе, который, как бы, ожидается людьми на выходе. И потом, на финальном этапе, ты уже эту сеть алайнишь. Тоже используешь человеческую разметку. Ты говоришь модели, вот тебе инструкция, сгенерируй мне n ответов. Потом ты сажаешь человека и говоришь, вот инструкция, вот n ответов, скажи, какой ответ был лучше. Какой лучше? И обычно лучше для человеческой разметки, когда тебе даются просто два ответа каких-то, и ты говоришь, какой из этих двух ответов выбирай, какой лучше, который тебе нравится больше. Какие ответы считаются хорошими? Те, которые не токсичны, те, которые помогают людям, те, которые доброшелательны и так далее. Люди уже настраивают, выбирают тот или иной ответ, формируются такие пары, это уже называют контрастив-пары, когда у тебя есть задача, у тебя есть хороший ответ, у тебя есть плохой ответ. И ты дальше на третьем этапе нейросеть дообучаешь. Выбирать, делаешь контрастив-ленинг, который говорит про то, что лучше выбери такой-то ответ, а не такой-то ответ. которые нравятся людям. И, по сути, после вот этих трёх этапов, сначала базовое обучение, потом fine-tune на инструкциях, и потом уже alignment на хороших ответах на этих инструкциях, приводит тебя к получению того же самого GPT-4. Вот GPT-4 тренировалось примерно так. Очень кайфово.
-
Получается, что это огромный массив данных, и ты уже про это говорил, но даже вот просто по описанию, сколько данных, понятно, что железа нужно очень-очень много.
-
Очень много.
-
У кого сейчас больше всего железа?
-
Сейчас больше всего железоуметы. Значит, сейчас золотая лихорадка, а NVIDIA продаёт лопаты во время золотой лихорадки. Потому что NVIDIA— основной, собственно, поставщик железа, видеокарт, на которых всё это обучается. Сейчас капитализация NVIDIA превосходит ВВП Германии. Если взять NVIDIA как отдельную страну, то она будет в топ-10 стран мира по экономике. Там у неё триллионы капитализаций, потому что. И, значит, все ходят в NVIDIA, все эти большие компании, техгиганты, Microsoft, Google, Amazon, Meta, все, значит, закупаются от NVIDIA, все дата-центры закупают видеокарты от NVIDIA. И чем больше видеокарт у тебя будет, тем быстрее ты сможешь тренировать эти нейросети. И по сути сейчас compute становится одним из самых таких scarce resources, то есть необходимых редких ресурсов.
-
Узких мест, как бы.
-
Узких мест, да-да-да, которые тебе нужно добывать. И сейчас лидер мета, она закупила там 300 тысяч аж 100 видеокарт, это вот последних видеокарт.
-
Насколько я понимаю, это существенная доля всего годового производства, скорее всего, типа часть завода, большая часть завода работает только на них.
-
Да, да. По последним цифрам, по-моему, NVIDIA в год выпускает или 1, или 2 миллиона видеокарт. Ну, вот там 300 тысяч видеокарт— это прям существенный процент от всего производства. Но также там закупается Google, закупается Amazon. Ну, короче, все, все, все абсолютно закупаются, и у всех там десятки тысяч видеокарт.
-
Слушай, была же ещё... Я помню, видеокарты, когда я ещё играл в игрушки, были от NVIDIA, а были от AMD. Radeon, которые. А AMD тоже, как бы, играет на этом рынке? Или они купили друг друга уже?
-
Они играют на этом рынке, но AMD жестко проигрывает на этом рынке из-за того, что тут еще помимо железа, а есть еще софтовая часть. Нужен на самом деле довольно хороший софт, который умеет работать с видеокартами. Капитализация всего софта, которое вокруг NVIDIA сейчас выстроено, превышает триллион долларов.—
-
А-а-а, люди уже написали инструменты для видеокарт NVIDIA, которые эффективных используют именно для нейросетей.—
-
Все CUDA-кернелы, все необходимые драйвера, все библиотеки современные, типа PyTorch, TensorFlow и так далее, все оптимизировано вокруг работы с видеокартами. И не оптимизировано с AMD. Это во многом про то, почему важно быть первым. Что NVIDIA, просто из-за того, что она была чуть-чуть лучше, чем AMD, начала подгребать плате рынок, все начали писать софт под NVIDIA, а теперь такой, ну зачем мне писать софт под AMD, потратить на это кучу денег, кучу времени, кучу ресурсов, если я могу дальше продолжать использовать NVIDIA.
-
Я вспоминаю то, что многие крупные корпорации делают свои сервера, как минимум платформы для серверов, чтобы потом производители делали ровно такие сервера, как им надо. Занимаются ли Google и Facebook производством своего AI-железа? Это был бы логичный шаг выкинуть Nvidia, которая стала такой дорогой корпорацией, и вертикально интегрировать эту часть бизнеса тоже в себя.
-
Во многом этим занимается Google. У Google есть TPU, Tensor Processing Units, которые как раз-таки заточены на подматричное перемножение. Которое, по сути, некая альтернатива видеокартам от NVIDIA. И, собственно, Google не продает это железо вовне. То есть они развивают свой Google Cloud. И в рамках Google Cloud ты можешь арендовать TPU, и на этих TPU тоже делать какое-то обучение. И основное обучение, которое внутри Google происходит, оно происходит на TPU.
-
Нифига себе.
-
То есть у Google написан свой софт, своя инфраструктура под обучение на TPU-хах. TPU, они тоже довольно производительные, они во многом матчат и даже какие-то превосходят по перформансу карты от NVIDIA. Из-за того, что Google владеет этой технологией, может ее эффективно развивать, скейтлить дата-центры свои, вот они выстраивают свою инфраструктуру, по сути, по развитию этих TPU. Но они не продают эти TPU вовне. И есть довольно интересная компания Grok. Но не который... Но не который нейросети от Elon Musk, а железная компания Grock, который сделал один из основных архитекторов TPU в Гугле. Ему не понравилась история про закрытость этих TPU, про то, что они остаются только в Гугле. И он такой, ну я пойду и тогда сделаю свою компанию. И пошел сделать свою компанию. И сейчас компания нашумела тем, что у них самые производительные процессоры под инференс нейросетей. То есть, когда ты делаешь какой-то запрос в нейросети, она начинает токен бай токен производить output какой-то, генерирует текст. И все меряют, какое количество токенов в секунду ты можешь генерировать. Такой перформанс как бы. И они показывают самый высокий перформанс, который в несколько раз, если не на порядок, превосходит карты от NVIDIA или TPU те же самые. Потому что они именно заточены под inference. То есть они не очень хороши для обучения, пока я не видел кейсов быстрых под обучение, но именно под inference. А у тебя 99% lifecycle моделей— это inference. То есть ты один раз ее обучил, а потом ты постоянно ее сервишь своим пользователям. И тебе нужно много карт, чтобы сервировать большому количеству пользователей. Инфиденс тебе очень важен. То есть, чем быстрее у тебя инфиденс, тем больше количества запросов в секунду ты можешь проживать, тем меньше тебе нужно будет таких карт, тем быстрее ты будешь отвечать пользователям. Ну, короче, это и для пользователей выгодно, и тебе как компании выгодно, потому что тебе нужно меньше железа покупать просто.
-
Очень интересно, что специализация идет уже даже на этом уровне, что видеокарты, да, это типа вещи, которые параллельно многого всего вычисляют, но и они уже бывают специализированы отдельно для обучения, отдельно для того, чтобы отвечать на вопросы. Ну, то, что инфиденс называется. Да-да, ровно так. И очень интересно, что у Гугла свой стэк, в отличие от всех остальных. Все остальные дерутся за то, чтобы NVIDIA им побольше продала долю этих карт, а Гуглу это не нужно. Так, я понял, что для того, чтобы сделать крутую нейросеть, нужно три вещи. Данные, ученые и железо. Это такой коктейль, типа, и вот если правильно смешать это все, то получится крутая нейросеть. Скажи, а что нужно для прорыва?
-
А для этого нужно пересмыслять то, как нейросети устроена. А именно, сейчас есть процесс тренировки нейросети и есть процесс инференса. И когда ты нейросети начинаешь использовать для инференса, ты перестаёшь её тренировать. То есть у тебя заморожены все веса этой нейросети, и ты просто её эксплуатируешь, используешь. А как устроен человеческий мозг? Мы постоянно учимся. Мы постоянно получаем фидбэк от окружающего мира, постоянно учимся, понимаем, что происходит, и генерируем какую-то информацию. То есть, как дети учатся? Они случайно обожглись горячего утюга, они такие, блин, всё. Ты понимаешь причину следственной связи, ты понимаешь, что произошло, когда ты приложил к нему палец, ты понимаешь, что сделать, чтобы не допустить в следующий раз этого. Тут же выучиваешься. На этом фидбэке от окружающего мира. Нейросети не так работают. Современные нейросети. И основное, что нужно поменять, это, собственно, процесс обучения и инференса нейросети, чтобы у тебя был continuous learning. И, в частности, главный ресерчер из Фейсбука, Ян Ликун, топит за то, что нам сначала вообще-то нужно выстроить такую архитектуру и такую систему, которая обладает хотя бы интеллектом кошек и собак, для того, чтобы говорить про AGI. Потому что кошки и собаки, они тоже постоянно учатся, они довольно умные животные, они понимают, они могут планировать и обучаться постоянно окружающем мире и на фидбэк, который они получают. И, собственно, нам нужно архитектуру нейросети развивать таким образом, чтобы нейросеть могла постоянно учиться. Вот, и много ресерча, собственно, сейчас ведется в эту сторону, в том, чтобы как делать такие архитектуры, которые постоянно получают фидбэк от окружающего мира, обучают сами себя. И в частности, например, есть прикольные статьи про self-rewarding LLM, Large Language Models, самоподкрепляемые нейросети. И там процесс устроен таким образом, что, значит, у тебя нейросеть, та же самая LLM-3, она уже умеет исследовать инструкциям и оценивать. То есть ты можешь дать задачу просто, оцени, насколько текущий ответ хорош для текущего контекста, для текущей задачи.
-
Ты с нее говоришь, а теперь проверь свою работу.
-
Да, то есть мы выстроили процесс, в котором нейросеть генерирует ответы, оценивает ответы, обучается на этих ответах. И так делать несколько итераций. И вот движение в эту сторону как раз таки нас может привести к следующему прорыву. Тут еще небольшая проблема есть в таких self-reward моделях, что она все-таки живет в своем мире, что она не получает фидбэк из загружающего мира.
-
Ребенок может обжечься, может упасть, может что-то потерять, и он на этом обучится. А у модели такого реального мира нет.
-
И, скорее всего, следующий будет прорыв, когда вот такие сети будут внедрять какие-то уже реальные системы, каких-то дронов, какие-то роботы, которые будут, я не знаю, в хозяйстве тебе помогать. Довольно много в роботике сейчас развивается, у которых есть perception и сбор фидбэка.
-
Восприятие мира.
-
восприятие мира, и они могут, там, человек просит, я не знаю, принеси мне, я не знаю, стакан колы, а роботы ему приносят бутылку воды. Ты такой, да нет, я же тебя просил принести стакан колы. И он такой, окей, я понял, что вот то, что я сделал, работал неправильно, значит, я получил фидбэк от человека, мне нужно пойти принести стакан колы. Вот, и чем больше будет такой интеракции AI и роботов с огружающим миром, и больше алгоритмов, которые могут работать в таком ревординг режиме, в континьюс лонинг режиме, тем лучше будут такие системы становиться, и, собственно, в этом следующий прорыв.
-
Ну это пока еще такой передний край науки, а не то, что используется в продакшене, да?
-
Ну да, да, то есть есть там первые эксперименты, алгоритмы, которые работают в таком режиме, но еще нет разгадки, как сделать робастную систему, которая постоянно будет учиться, постоянно сама себя улучшать.
-
Как ты думаешь, кто сделает этот прорыв, какая компания?
-
Ну, скорее всего, одна из ведущих ресерч-лабораторий или лабораторий внутри текущих компаний. DeepMind внутри Google, или там подразделение DeepMind внутри Google, Google Brain, OpenAI тоже не стоит на месте, постоянно улучшается. Мета. Или китайцы. Китайцы тоже. Например, есть компания ZeroOne, DotaEI, один из фаундеров Kaifuli, довольно известный китайский предприниматель, ученый. Он работал довольно долгое время в Google. написал несколько книг, в частности про AI. Есть те же самые Tencent, Baidu, технологические гиганты китайские, которые хорошо и много занимаются ресерчем. Собственно, вот все победители, так скажем, на текущем рынке, все основные гиганты на текущем AI-рынке, вот от любого из них можно дать такого прорыва.
-
Про AI сейчас доносятся из каждого утюга. При этом 100% есть первоисточники. Это люди, которые участвуют в работе над ним. Ты уже упомянул некоторых. Есть ли среди них те, кто говорят понятным языком, на кого ты рекомендуешь подписаться, чтобы узнавать о новостях об AI из первых уст?
-
А да, в целом все ведущие и ресерчеры говорят понятным языком, если следить за их твиттером. Ян Ли Кун, очень понятно, очень классно, постоянно публикуют. Ян Ли Кун, собственно, чьиф-сайентист из Меты. Дэмис Хасабис часто публикует тоже, который DeepMind продал в Google. Джефф Дин из Google, тоже ведущий инженер Google, очень много про AI публикует. Дэвид Шульман из OpenAI тоже много всего публикует. То есть бываете в поиске ведущие ученые-сайентисты больших компаний, и их имена в твиттере, они все есть.
-
Мы сделаем эту домашку, и ссылки на все эти твиттеры будут в описании к этому эпизоду. Очень крутой разговор, Артём, спасибо тебе огромное.
-
Сама тебе спасибо.
-
Друзья, у меня есть объявление. Мы работаем над второй половиной нашего сезона, она будет нарративная. Помните сохранить как, где мы рассказывали о форматах аудио, видео и текста, которые изменили нашу жизнь? Теперь мы будем исследовать появление айтишечки в том виде, в котором мы ее знаем. Через истории нескольких компаний, таких основоположниц. Это совершенно чумовые эпизоды, мы уже записали первые из них и мне не терпится их вам показать. Ждите, будут через несколько недель. Это подкаст Студии Либо-Либо. И сделали мы его совместно с сервисом онлайн-образования Яндекс Практикум. На этот подкаст мы работали. Редакторки Маша Агличева и Рита Берденникова. Продюсер Данил Остапов. Звукорежиссер Юрий Шустицкий. Монтажер видео-версии Павел Цуриков. За джингл спасибо Алексею Зирянскому. Редактор субтитров Т.Горелова Корректор А.Егорова