13 сезон · выпуск 1 · 9 октября 2025 · 36 мин
Кто такие ИИ-инфлюенсеры и зачем их создают
ИИ и нейросети Медиа и культура
Слушать · 36:01
Реклама. Рекламодатель ООО "Яндекс". erid: 2SDnjepJgX9 12+
Специальная акция с 13 октября по 3 ноября – скидка на три месяца для тарифов «Основной» и «Минимальный» – 20%. Подключай Яндекс 360 по ссылке https://360.yandex.ru/business/tariff
Подписаться только на «Запуск++» в Телеграме: https://t.me/tribute/app?startapp=s3zy
Над выпуском работали
- Редакторки
- Маргарита Берденникова и Маша Агличева
- Продюсеры
- Данил Астапов и Аня Коваленко
- Звукорежиссер
- Юра Шустицкий
- Дизайнер обложки
- Петр Сутупов
Транскрипт
Самат Галимов, Артём Родичев · расшифровано автоматически, ошибки возможны
-
Либо-либо.
-
Всем привет! Меня зовут Самат Галимов, и это подкаст «Запуск завтра». Мы не встречались уже целых четыре месяца, всё лето. При этом последние полтора мы с командой подкаста активно работали над новым тринадцатым сезоном. Я очень рад, что вы наконец-то сможете его послушать. Нас ждут технологии, которые меняют нашу жизнь. И гости, профессионалы, с которыми можно обсудить эти технологии простым человеческим языком. Поехали! Партнер этого сезона— Яндекс.360. Это онлайн-офис, который делает работу в команде удобной. В середине эпизода вы услышите нашу партнерскую рубрику, в которой я расскажу о важном рабочем инструменте, без которого не создается ни один выпуск этого подкаста. Недавно мы с командой «Запуск» наткнулись на популярный профиль в Инстаграме. Девушку зовут Анна, у неё в ленте «Красивая жизнь на берегу Адриатического моря», «Завтраки и ужины в дорогих ресторанах» и «Постоянное путешествие». У неё 260 тысяч подписчиков. Ещё один факт об Ане— её на самом деле не существует. Все ее фотографии и видео, в том числе и коллаборации с большими брендами, сгенерированы нейросетями. При этом я сижу в Твиттере и подписан на всяких около ИИ технарей, и пару месяцев назад была такая волна постов. Я сгенерировал ей персонажа и зарабатываю на нем десятки тысяч долларов в месяц. Честно говоря, я со скепсисом отношусь ко всем, кто рассказывает, как он заработал в интернете, потому что это выглядит как «я умею зарабатывать 100 миллионов в месяц, и вот моей Ламборгини заплати мне 100 долларов, и у тебя тоже будет шикарная жизнь». Когда мы начали в этом разбираться, мы выяснили, что рынок ИИ-инфлюенсеров уже достиг нескольких миллиардов долларов. Мы решили поговорить с экспертом по искусственному интеллекту Артемом Родичевым о том, что у этих технологий под капотом, для чего еще их можно применить в нашей жизни и как в целом устроен этот рынок.
-
Всем привет! Я Артём Родичев. Последние 11 лет своей жизни я занимаюсь цифровыми людьми, искусственным интеллектом и персонажами.
-
Артём, привет! Расскажи, из чего вообще состоит ИИ-персонаж?
-
Смотря для чего ИИ-персонаж. Если именно для Инстаграма, то в Инстаграме, как правило, основной это визуальный контент. Это фото и видео. При этом сейчас для персонажей дипфейки… в основном фотки. Потому что фотки уже достигли генерации фоток с помощью искусственного интеллекта. Достигла такого уровня, что ты можешь генерировать очень реалистичные фотографии довольно дешево, довольно быстро, в большом объеме. И вот сейчас начинает фотогенерацию догонять видеогенерация. Видеогенерация осложнена тем, что в видео много всего может происходить. Что в целом наш мир физически довольно сложно устроенная штука. Вот если ты кидаешь арбуз на пол, арбуз же когда упал на пол, он должен начать разбиваться, от него должны там дребезги.
-
а не подпрыгивать, как мячик.
-
ошмётки отлетать, да, а не подпрыгивать, как мячик, или там, растворяться в полу. То есть, там есть определенная физика. Вот если ты хочешь делать какой-то эффектный кадр, что, не знаю, человек кидает арбуз, ошмётки разлетаются вокруг, в слоумо все это происходит. Вот модель искусственного интеллекта, видеогенерации, которая будет генерировать такую картинку, она должна довольно хорошо понимать про физику этого мира. Потому что, что такое арбуз, что у него внутри, как происходит физика взаимодействия там жидкости и частиц при соприкосновении с полом. То есть, много делов для того, чтобы Когда
-
мы готовились к эпизоду, мы решили сгенерировать персонажа. Забили в гугл создать и инфлюенсера и получили типа десяток сервисов. Мы зарегистрировались там в топ-2. И нам предложили выбрать пол, возраст, этнос, язык, внешность, там типа цвет волос, глаз и так далее. Ну как персонажа в симсе создаешь, вот ровно то же самое. Ну или можно выбрать персонажей из галереи. Кстати, почти все они там в разной степени откровенности выглядящие девушки. Нажимаешь пуск и перед тобой фотография почти живого человека. Что в этот момент под капотом происходит, вот когда типа есть галерея персонажей и все эти опции.
-
Но обычно происходит так, что все эти крутилки визуальные, интерфейсные, они превращаются в текстовый промт. То есть вот вы набрали пол, телосложение, цвет волос, стиль. И потом все это превращается в текстовый промт, в котором буквально написано, что там, загорелая шатенка 30 лет, предпочитающая носить японские платья. И вот это является текстовым промптом, который идёт на вход на генерацию нейросети. Плюс появились технологии, которые позволяют тебе делать генерацию консистентно. То есть ты на вход можешь подавать несколько изображений. А как правило, базово это какая-то фотография лица, селфи, с которой мы будем копировать внешность. И потом ещё могут быть какие-то дополнительные предметы. Например, ты хочешь сгенерировать человека в шубе с сумкой Прада, и что у неё леопард стоит слева. И вот ты закидываешь туда леопарда, сумку Прада, которая тебе нужна, шубу, которая тебе нужна. И вот поэтому по этим референсам у тебя идет такая генерация. Есть несколько разных нейросетей и сервисов для генерации изображений. Одна из недавних, которая позволяет делать вот такие консистентные генерации, что за референс можно взять человека или несколько объектов из человека, это Nano Banana от Google. Она доступна в довольно многих приложениях. В частности, она доступна через Google AI Studio.
-
Следующим шагом там нужно выбрать типа формат фото или видео, сториз, там квадрат в инстаграме или даже ютуб и написать сценарий этого видео. Кстати там прикольно, что этот сценарий можно даже не самому писать, а нейросети, напиши сценарий по промпту. создать, ждешь там пару минут, причем там можно выбирать, типа, если супервысокое качество, прям пару часов ждешь, и получаешь готовое видео или там звук. Как персонаж оживает? Вот на этом этапе ты упомянул, что уже есть готовый университет, типа, нано-банана. Можешь чуть-чуть как-то приоткрыть капот? Вот тут как бы текстовое описание, а с другого конца уже видео, черт побери, в котором типа что-то видно. Как оно одно превращается в другое?
-
От текстового описания до видео есть один шаг, один простой шаг. Генерация фото, генерация кейфрейма. По сути идёт что? Сначала у тебя нужно сгенерировать какой-то кейфрейм, то есть начальный кадр этого видео, на основе которого будет генерироваться видео дальше. И этот кейфрейм условно, что персонаж сидит в машине, за рулём, вид сверху, как он едет по первой трассе в Калифорнии. И вот ты вбиваешь такой промпт, на вход еще может податься референсная фотография, целевая фотография лица, селфи изначальная. И вот у тебя идет генерация ключевого кадра. И потом идет видеоанимация этого ключевого кадра. И для видеоанимации на вход обычно нужен ключевой кадр и текстовый промпт. Что происходит? Вы можете описать работу камеры, то есть камера отдаляется, приближается к объекту. Что происходит со светом? День превращается в ночь или начинает потихонечку светлеть или темнеть наоборот, что в таком духе. То есть вы описываете им динамику, которая происходит в кадре И всё, и после этого вы получаете видео И обычно ещё иногда А делают такую историю, что вы на вход даёте не один базовый кейфрейм, а вы даёте два кейфрейма Вы даёте ключевой кадр в начале и в конце видео То есть если вы хотите сделать какой-то переход от того, что девушка едет на кабриолете по первой трассе И потом подлежает конкретному месту, например, какой-то достопримечательности или к входу в ресторан Вот вы можете подать первый кадр сверху, вид сверху, где она едет на каприолете, а второй кадр, где машина подъехала к какому-то месту. И вот модель видеогенерации можно заанимировать/анимировать так, что у вас будет плавный переход того, что вот машина едет-едет, подъезжает к какому-то месту, и камера переходит на вот этот последний кадр.
-
Когда мы пробовали это, мне кажется, это было еще до нано-бананы, мне видео показалось не очень качественным. Там, например, губы двигались несинхронно с речью. Почему так происходит?
-
Почему иногда бывает так, что у тебя не попадает в аудиодорожку? Ну, потому что, опять же, это сама по себе довольно сложная задача. Когда человек говорит, Он же говорит не на одном языке, а на разных языках. То есть тебе нужно охватывать много разных языков, много разных голосов или фильтровать. Тебе нужно откуда-то эти данные брать. Плюс довольно сложная мимика все-таки еще получается. Люди говорят с разной интонацией, но при этом ты должен матчить разную интонацию, разный тембр голоса, разную скорость голоса. По то, как люди эти все звуки произносят, как они шевелят губами. У каждого человека этот процесс по-своему индивидуальный, отличается. Кто-то быстрее, кто-то медленнее говорит, кто-то запинается и так далее. И особенно сильно страдают эмоции. Человеческий мозг устроен так, что он считывает очень много своей мимики. И у тебя на лице порядка 40-50 мышц, которые управляют лицевой анимацией, и человеческий мозг просто надрессирован, их довольно хорошо определять. Именно поэтому есть история, так называемая Uncanny Valley. Эта история пошла из геймдева. Преимущественно, когда делали 3D-анимации, 3D-аватаров. И вот делали там каких-то NPC, игровых персонажей, делали их человекоподобными. И вот часто они выглядели очень крипово. А особенно они не выглядели крипово, когда их анимировали. То есть, когда они двигались, когда они разговаривали. Чем ближе к человеку они были... Чем
-
точнее, типа, модель... Чем точнее модель, тем
-
более крипово она казалась. Что когда она совсем мультяшная, она ещё ок, тебе кажется, что это некий мультик. А вот чем ближе ты подбираешься к человеческому лицу, тем больше начинает человеческий мозг понимать это именно как человека, и подмечать вот эти тонкости мимики.
-
Недостатки.
-
Тем быстрее вот скатываешься вот в этот слоуп, в яму того, что тебе кажется, что это крипово, что это неестественно.
-
Сам голос мне при этом, кстати, тоже показался не очень живым, а там чуть-чуть роботическим. Наверное, как у меня, потому что я не проснулся и болею. Насколько это вообще решенная проблема? Сгенерировать голос, неотличимый от человеческого.
-
Да, кстати, генерация голоса— это отдельная задача. То есть, как я упомянул, видео обычно сначала генерируют само по себе. И как работают сервисы липсинка, то есть оживление анимации губ, ты на вход им даешь keyframe, то есть ключевой первый кадр, где обычно персонаж сидит, смотрит в камеру, чтобы видна была его голова хотя бы, с какого-то ракурса, и звуковая дорожка с речью. И вот эту речь получаешь обычно в сервисах синтеза речи. Есть несколько разных сервисов. Один из самых популярных— ElevenLabs, пишется Eleven Labs. Он позволяет много всяких штук делать с генерацией голоса. Например, ты можешь выбирать разные голоса из их галереи голосов. У них довольно богатая галерея, больше тысячи голосов. Они поддерживают кучу разных языков, включая русский язык. Плюс ты можешь делать свои собственные голоса. Это происходит двумя способами. С одной стороны, ты можешь делать голос, склонировав свой голос, или чей-то голос. И это делается по примеру. То есть ты на вход нейросети даешь небольшой пример. Чем больше, тем лучше. А оно базово хватает даже 15 секунд речи какого-то человека для того, чтобы склонировать его голос и манеру речи даже. Но чем больше ты будешь давать таких сэмплов, например, там есть даже 30-60 минут такой речи, тем более точно можно обучиться на такой речи. И вот, например, наш с тобой подкаст сам является отличным материалом для того, чтобы кто-то обучался на таких подкастах, делая наши клоны. Ну опять же, любой звонок, то есть научились даже делать так, что многие мошенники пользуются такой схемой, что они дозваниваются по телефону к какому-то человеку, начинают с ним вести какой-то бессмысленный диалог, там, что они ошиблись, там, а есть ли у вас, не знаю, три шины. Вот я в газете увидел объявление, это такое, какие шины, ничего не продавал. Всё, ты это сказал, уже этого может хватить для того, чтобы сделать копию твоего голоса, и потом этим можно как-то воспользоваться. Обычно во вред. Вот. И плюс еще третий способ есть, где ты можешь голос задать из текстового описания, из промта. То есть ты описываешь, что хочу голос, значит, басовый голос мужчины 25 лет с южноамериканским акцентом, который супер эмоционально общается при этом. Вот. Ты задаешь такой текстовый промт, на выходе получаешь голос с его тембром, с его стилем, значит, донесения информации голосом, и потом на вход вбиваешь текст, и голос произносит этот текст. И плюс ещё есть разные лайфхаки, штучки, которые ты можешь добавлять в сам текст, которые могут контролировать эмоции. И ты посередине текста можешь вставлять плейсхолдеры, ключевые слова, так скажем, которые говорят, что «А вот сейчас говори...» Восхищённо. Восхищённо. А теперь начни говорить более грустно.
-
Ага.
-
Или ты можешь вставлять ключевые слова, которые определяют определённые звуки, например, кряхтение, похыкивание, смешок, какой-нибудь вздох, ох, какие-то такие вещи.
-
Офигеть.
-
И таким образом ты можешь вставлять вот эти ключевые слова филлеры, делая речь более естественной. Потому что обычно вот чем генеративная речь отличается от настоящей речи, генеративная речь звучит довольно монотонно. А люди все-таки постоянно как-то меняют тембр, могут иногда запнуться как-то, затормозить, подумать. И такого нет в нейросетях.
-
Тут можно добавлять как раз неидеальность.
-
Получаешь на выходе вот эту звуковую дорожку, её отдаёшь на вход другой нейросети, которая генерирует видео, которая на вход приняла keyframe, ключевой кадр и звуковую дорожку. На выходе получаешь видео, где этот человек произносит эту фразу.
-
Ещё я читал, что если предложить сменить наряд персонажа, то может измениться его лицо. То есть ты взял персонажа, выбрал, говоришь, а теперь сделай ему другое платье, а у него лицо поменялось. Почему это происходит?
-
Зависит от того, какие технологии используются, зависит от того, как ты генерируешь последовательные изменения этого персонажа. То есть, вот если ты уже сделал какого-то персонажа, а что ты можешь сделать дальше? Дальше ты можешь, например, отредактировать то, что на персонажа надето. Цвет платья, или добавить шапку, или что-то в таком духе. Это называется функция Editing, редактирования. Она же доступна в NanoBanana, в других сетях. И когда они делают такой Editing, по сути, они берут и чуть-чуть перерисовывают текущую фотку. Перегенерировать. Восстанавливать те части, на которые ты указал в промте. То есть, они меняют цвет платья или что-то еще. И в процессе такой перегенерации сохранять идентичность лица. Она может меняться. Поэтому обычно, чтобы такого не происходило, на вход ты даёшь прямо фотографию лица. То есть в качестве референсной фотографии полезно всегда давать изначальное лицо или делать face swap на конечную фотографию. Для того, чтобы сохранять как раз-таки троито лица. Чтобы лицо не съезжало, а всегда сохранялось консистентно, ты мог делать сколько угодно.
-
Face swap— это значит, ты сначала сделал фотку, а потом заменил лицо?
-
Да, это альтернативный способ, когда ты сначала можешь генерировать фотографию с какой-то болванкой. Например, ты знаешь все трейты этого персонажа, его пол, возраст, цвет прически, тип прически, форма тела и так далее. И ты можешь генерировать словно болванку, то есть человека с такими трейтами, но с каким-то лицом. А потом ты в конце можешь сделать на такую болванку фейсвоп. То есть ты можешь заменить лицо из целевой фотографии, которая тебе нужна, на лицо вот этого генеративной болванки, так скажем. И всё, у тебя получается восстановленное лицо. Тоже такие технологии работают неплохо. Там бывает под экстремальными углами это работает плохо. То есть повернуто от камеры, например, смотрит в бок и вверх, то фейсвоп может хуже отрабатывать. Но если у тебя фотография, где человек смотрит или несколько персонажей смотрят прямо в камеру, фейсвоп неплохо отрабатывает. Такой подход тоже довольно хорошо сохраняет константность генерации лиц.
-
Окей, я получил персонажа. Хочется понять, что с ним делать дальше. Как на этом можно заработать?
-
Есть так называемый рынок инфлюенсеров. То есть есть, правда, сгенерированные инфлюенсеры, девочки-мальчики, даже какие-то фикшнал-персонажи, которые рекламируются обычно с какими-то брендами. Что они делают? Они обычно набирают себе какую-то базу подписчиков каким-то способом. Например, тем, что они очень оригинальные и выкладывают контент. Очень оригинальные генерации. Или, например, тем, что они выкладывают не оригинальные, а просто какие-то эксплицитные генерации, делают такую AI-онлифанщицу, которая, не знаю, там, продвигает свой онлифанс или что-то в таком духе. Или ты являешься одним из первых на рынке. Lil Miquela. Лил Микелла— такая девушка с розовыми короткими волосами, с стрижкой каре. Она появилась, мне кажется, еще лет 5-6 назад впервые. У нее в Инстаграме более трех, возможно, даже четырех миллионов фолловеров сейчас. И вот это одна из первых таких. инфлюенсера, который обратил на себя внимание большинства, потому что это был один из первых кейсов просто таких. Вот не реальный человек, а некий инфлюенсер, который похож на реального, и они зарабатывают над тем, что они делают коллабы с брендами. То есть вот у тебя тут Mercedes, тут сумка Gucci, тут Armani, тут что-то еще. Или коллабы с какими-то другими инфлюенсерами они делают, кросс-промо делают друг друга. Вот на этом они зарабатывают.
-
О господи. Late stage capitalism. Что для этого нужно уметь? Лил Микела (Lil Miquela), она реально выглядит прикольно. В смысле, понятно, что человек, который за этим стоит, он как бы что-то понимает в социальных сетях, и вообще, ну как бы это интересный персонаж. То есть надо быть хорошим маркетологом. Что вот мне кажется таким понятным, это то, что если раньше тебе нужен был живой человек, с которым надо как-то работать, и вот это всё, то сейчас можно сделать ферму этих персонажей, типа сделать тысячу персонажей, и один из них залетит. А, типа, 1999 просто не пошло. Вот это масштабируемость меня лично очень сильно пугает.
-
Да, можно так попробовать масштабировать, но все-таки контент генерируется сейчас не идеально. Ты должен сам, не автоматом за тебя будет AI-инфлюенсер вести твой Инстаграм. То есть кто-то должен генерировать тебе этот контент. Полной автоматизации тут нет. Это нужно понимать. И это является очень естественным и довольно большим барьером к скейлу. Чтобы вести тысячу аккаунтов одновременно, ты каждый день должен генерировать какой-то контент. Каждый из аккаунтов. Это значит, что ты должен сгенерировать тысячу единиц контента под каждый из аккаунтов А каждый из аккаунтов имеет свою историю, у каждого персонажа есть свой персоналити Там свой стиль общения, своя какая-то предыдущая жизнь и история, которую она приносит в этот Инстаграм То есть это довольно много дел То есть на самом деле вот эта часть про генерацию ей персонажа, это только часть про генерацию визуала А вся остальная часть, она так или иначе, то есть тебе нужно генерировать контент, его выкладывать, продвигать как-то этого персонажа, потому что надеяться, что он просто так в органике залетит, можно, конечно, но так можно не дождаться у моря погоды. То есть тебе его нужно как-то продвигать, тратить деньги на рекламу или какие-то коллаборации с кем-то делать, то есть много административной работы. Потом, если ты дорастил этого персонажа, он стал популярным, ты его хочешь монетизировать как-то, и просто так ты его начал делать. А монетизация— это общение с брендами, значит, коллаборация с ними, обсуждение условий, заключение договоров, контракты. Кто это всё делает? Пока не искусственный интеллект. То есть мы автоматизировали маленькую часть того, что может сделать визуал, а всё остальное так или иначе делает человек. Поэтому говорить о том, что вот где-нибудь на краю галактики, и сейчас я стану миллиардером, запустив тысячу AI-инфлюенсеров. Но не получится так. Чтобы это сделать, ты, правда, должен быть довольно талантливым креатором. Или ты, правда, должен очень хорошо понимать маркетинги, и понимать, что цепляет твою аудиторию, как на нее продвигать какой-то образ, который ты хочешь продвинуть.
-
Надо быть хорошим сторителлером.
-
Друзья, сейчас перейдём к рубрике, которую мы делаем вместе с онлайн-офисом Яндекс 360. В ней мы рассказываем об инструментах, которые помогают упростить работу в команде. Первый такой инструмент— незаменимый в работе подкастера. Каждый раз, когда я заканчиваю записывать выпуск, я гружу свою аудиодорожку в папку под названием «Сомат загружает дорожки». Папка хранится на диске в облачном хранилище. Мы пользуемся ним для обмена файлами уже тринадцатый сезон. Это очень удобная технология, которая, конечно, была доступна не всегда.
-
Помните, раньше были такие сервера, которые стояли
-
в офисе, и подключиться к ним можно было только из офисной сети или через VPN. Кстати, у партнёра этого сезона есть удобное хранилище— Яндекс.Диск. Это пространство, в котором можно хранить даже очень большие файлы— до 50 гигабайт. Заходить на диск и загружать на него файлы можно одновременно со всех ваших устройств. И главное— вся информация на Яндекс.Диске зашифрована, вход в аккаунт настраивается под двум паролем, а ещё есть встроенный антивирус, так что ваши данные будут в безопасности. Прямо сейчас действует скидка 20% на первые 3 месяца. по ссылке в описании.
-
Сервисы, которыми мы пользовались, были совсем не бесплатные. Там каждое видео стоило по несколько баксов. И за каждое действие, вроде добавления субтитров, еще доплачивать нужно было. Можно ли генерировать такие видео самостоятельно, не платя внешним сервисам?
-
Ну, можно удешевить, не платя все-таки не получится, так или иначе какие-то затраты будут. В самом экстремальном случае можно у себя на своем компьютере домашнем развернуть какую-то open-source модель видеогенерации. Но для этого тебе дома должен стоять довольно хороший компьютер. Даже какой-нибудь последний MacBook с этой задачей плохо справится. Тебе нужен игровой компьютер с видеокартой мощной. Какой-нибудь последний, консюмерский, последнего поколения, довольно дорогой. Такой компьютер сам по себе будет стоить 3000 долларов запросто. чтобы такую модель видеогенерации смочь развернуть у себя. Далее, про качество этих моделей. Open-source по видеогенерации отстает от closed-source, то есть от закрытых сервисов, а от сервисов, которые свои модели не выкладывают просто так, ты их не можешь скачать на свой компьютер. Ты можешь получать только доступ через приложение, оплатив его, например.
-
Да-да-да.
-
То есть Open Source пока еще отстает, и зависит еще то, какую модель ты у себя сможешь на этом домашнем компьютере развернуть. Самую большую, самую последнюю модель, скорее всего, ты не сможешь развернуть, только если ты не собрал компьютер с 8 видеокартами. NVIDIA 4090 или 5090, которые уже будут стоить 6-7 тысяч долларов. Тогда ты сможешь развернуть самую последнюю модель. Ну то есть ты уже вложил немало денег, тебе нужно еще больше доложить денег, чтобы разворачивать самую топовую модель. И все еще эти топовые модели будут уступать по качеству внешним сервисам, в которые ты можешь ходить. Если вы хотите самое лучшее качество, самые лучшие модели, есть платные сервисы. Обычная генерация этого видео, правда, стоит сколько-то долларов, можно опустить ее до каких-то десятков центов. То есть, если вы напрямую будете через какие-то сервисы, которые дают прямой доступ к этим моделям, условно через API вы будете генерировать эти видео, 30–50 центов. через какие-то сервисы с удобным UX UI, с удобным интерфейсом, потому что вам это стоит 1-3 доллара, я бы так сказал, зависимости от качества видео.
-
Очень прикольно, что типа вот эта дихотомия. С одной стороны, можно типа себе инвестировать кучу денег, там тысячи, может быть, даже десятки тысяч долларов, чтобы у себя дома собрать такое железо, а можно платить небольшую аренду, арендуя это железо на стороне.
-
Да-да, этот рынок начинает все больше и больше похож на рынок недвижимости. Ты можешь купить дом, но это очень дорого, а можешь арендовать дом или квартиру, и вот это чуть подешевле. искусственный интеллект… купить видеокарту, она реально как квартира стоит. Это очень дорого, особенно топовую какую-нибудь. Вот, и поэтому проще, правда, арендовать.
-
А вот, кстати, про софт. Ты сказал, что можно найти open-source софт. Насколько сложно его настроить? Ты чувак, который разбирается и с мороза. Это там пару часов, пару дней, пару месяцев.
-
Есть разные инструменты. Я бы сказал, что можно научиться за недельку каким-то базовым навыкам, чтобы у себя на компьютере что-то неплохо генерировать. Потому что, опять же, генерация видео— это не просто генерация видео. До видео есть генерация фото. А генерация фото— это генерация keyframes, ключевых кадров, с которых вы делаете видеоанимацию.
-
Господи, это ненавидимое слово пайплайн, как бы тебе нужны цепочки.
-
Пайплайн вам нужно какой-то выстраивать, да. И для этого, например, ComfyUI. Такая визуальная тула, где по сути вы берете и мышкой можете натыкать разные ноды, их соединить как-то и выстраивать пайплайн, где вы говорите, вот сначала не возьми, из этого промпта сгенерь фотографии. А потом вы можете тыкнуть на какую-то фотографию, которая вам понравилась. У вас пойдет следующая история в том, что теперь мне сделай Super Resolution этой фотографии. То есть увеличивая размер этой фотографии, сделай ее нужного размера мне. Потом у вас может быть в pipeline, что, а вот на этой фотографии я еще хочу подкрутить цвет платья. То есть мне все нравится, поза нравится, ракурс нравится, вот цвет платья мне не очень нравится, хочу там в черный горошек. Покрасил в черный горошек. Потом снимируй меня вот с таким видеопромтом, и потом, возможно, даже делай не одну анимацию-видео, а ты хочешь делать, ну там, ролик на 20-30 секунд, где есть несколько разных кадров, несколько разных анимаций. И вот вы сначала генерируете какую-то подборку фотографий, которые вам нравятся, их доправляете как-то, потом каждую фотографию анимируете, выбираете вариант анимации, который вам нравится, потом вы как-то вместе склеиваете эти варианты анимации, то в конце у вас получилось видео на 20-30 секунд. Тут же у вас вторая ветка пайплайна подключается с голосом или со звуком, что вы откуда-то генерируете бэкграунд шум липсинк, ее поставляете на видео, генерируете липсинг видео. Ну то есть вот такие развесистые пайплайны, то есть что вы хотите на выходе. Если вы хотите профессионально классное видео получать, то это поучится, а это не из коробки работает. Если вы просто пришли поиграться, и на вход вы готовы вбить какой-то текст или картинку и текст, тут чисто особо не нужно, есть куча сервисов, которые вам такое позволяют сделать, из коробки там. Тут сильно меньше контроля будет, сильно хуже качество, но как, поиграться этим можно.
-
Блин, Артём, так круто! Спасибо большое, что объяснил на пальцах. Я себе представил, что, блин, это та же самая режиссёрская работа или работа видеоредактора, а просто инструменты поменялись. Но это осталось тяжёлой работой.
-
Да, да. Инструменты просто не растевые стали, а всё ещё очень много шагов промежуточных и вот глобального вижна, что ты хочешь сделать, чтобы это всё сделать.
-
Да, и много решений, как бы десятки решений, типа, что из этого подходит, чтобы всё собралось. Я видел сервис, который предлагает не просто создать инфлюенсера или видео через этот сервис, но еще и рекламную интеграцию, через него же продавать, покупать, то есть это типа создание видео плюс маркетплейс. Я вот подозреваю, что основные бабки зарабатывают даже не сами инфлюенсеры или создатели инфлюенсеров, а те, кто делают сервисы по созданию инфлюенсеров. Это как в золотую лихорадку нужно продавать лопаты. Насколько это точное наблюдение, типа кто тут главный бенефициар всей этой схемы?
-
Я бы сказал, что это довольно маленький рынок сейчас. То, что ты вначале сказал, что это рынок на несколько миллиардов долларов, это может быть только в том случае, если 99% этих доходов приходят из рынка адалт-инфлюенсеров. То есть это какие-то инфлюенсеры на OnlyFans, или это какие-то тулы, которые помогают текстерам и секстерам генерировать видео, генерировать фото, переписываться с другими пользователями. Сам рынок AI-инфлюенсеров в соцсетях, типа Инстаграма, ТикТока, Ютуба и так далее, ну он крошечный. Я бы сказал, что он несколько миллионов долларов, возможно. Если десяток миллионов долларов там будет, то хорошо. Там самые крупные инфлюенсеры, если посмотреть, то Лил Микела на рекламных контрактах в год? Ну, мне кажется, около миллиона. Не так много у нее там каких-то постов, рекламных контрактов, что-то в таком духе. Она самая крупная. Просто там второе место от нее, это уже там сотни тысяч подписчиков, а не миллионы подписчиков. То есть мне кажется, чтобы золотую лихорадку зарабатывать на кирках и лопатах, нужно, чтобы золото кто-то покупал, который добывают те, кто покупает в кирке лопаты. А вот там денег-то нет особо сейчас на этом рынке, поэтому просто это какие-то копикаты, типа сделай и инфлюенсера, сам вот этот рынок сделай инфлюенсера. Тул, который позволяет тебе сделать и инфлюенсера, мне кажется, крошечный, потому что крошечный рынок самих инфлюенсеров.
-
Смотри, вот мы с тобой сейчас поговорили про именно технологию, об этом как о технологии и о бизнесе. Теперь я хочу обсудить, как это выглядит для меня, как для живого пользователя интернета. Есть ли способ убедиться, что в соцсети ты видишь живого человека, а не сгенерированного персонажа?
-
Мне кажется, сейчас, на середину 25-го года, таких способов нет. Ну, по крайней мере, массово. Есть определенные инструменты на уровне властей разных стран. Например, в Китае недавно обязали все интернет-компании любой контент, сгенерированный с помощью искусственного интеллекта, маркировать, что он сгенерирован с помощью искусственного интеллекта. Если ты это не делаешь, то там у тебя какие-то штрафы будут и последствия. Вот, то есть, в Китае ты там легально не можешь уже такой контент выложить, и тогда, собственно, у него будет пометка, ты будешь знать в статах, Такого там в Европе, таких законов пока нет, пока. Возможно скоро будут, посмотрим. Но пока, если ты смотришь на какого-то креатора из Инстаграма, тебе все нравится, он реалистичный, и там какие-то видео есть, и какие-то другие люди на этих видео есть, и вот тут его собачка, значит, лижет в нос. Нет, этому нельзя верить, это может быть все фейк. Это все может быть генерация. Просто очень хорошая реалистичная генерация.
-
Да, это тот случай, когда я надеялся, что ты скажешь, ну, типа, есть сигнальчики, и вот этот ответ, типа, знаешь, вообще-то нет, он такой.
-
Ну, я бы сказал так, что чем более лосково вылезанно это выглядит, тем больше шансов, что это сгенерированное.
-
Какую ответственность несет тот, кто управляет такими персонажами? Вообще, несет ли он какую-нибудь ответственность?
-
смотря за что ответственность. Любой человек, который выкладывает любой контент в интернет, несет ответственность за содержание этого контента. Например, ты не можешь на этом контенте пропагандировать суициды, продвигать педофилию, терроризм. Какие-то такие запретные штуки, запретные, скорее всего, практически во всех странах мира. То есть ты ответственен за те картины, которые ты выкладываешь. Тот контент, который ты выкладываешь в интернет, генеративный контент этим не отличается. Если там будет что-то плохое, за это можно присесть. В частности, в Штатах В какой-то момент была довольно популярная история, называется Porn Revenge. Это история, когда бывшие выкладывают порнографические материалы своего бывшего партнера. Сначала это была история про то, что они выкладывают порнографические материалы, реальные, которые они вместе снимали, а теперь дошло до того, что это какой-то, может быть, фейковый контент, и не обязательно твой партнер. И довольно часто такое приводит к буллингу в школах, что берут какую-то там девочку, одноклассницу, делают с ней какой-то элицитный контент, распространяют по школе, и из-за этого у ребенка проблемы могут быть. И, соответственно, в Штатах недавно запретили делать любой контент, не только детский, но и любого человека, порнографического характера, без его разрешения. То есть, если ты какая-то модельная онлюфансия, ты сам хочешь делать такой контент, пожалуйста, с твоим разрешением, ты взрослый человек, сам захотел такое сделать, пожалуйста, можно продвигать. Но если ты кого-то другого, захотел забрать его лицо, так скажем, его персоналити, и вот сгенерировать такой контент и распространять, а без его согласия, то это уголовная ответственность.
-
Как круто.
-
Еще есть проблемы с правообладателями и с тем вообще, как эти сети, которые генерируют фото и видео, на каком материале. Недавние новости, что Warner Brothers, Disney и кто-то еще подали в суд на китайскую компанию Minimax, которая тоже занимается разработкой, выпускает разные нейросети. Midjourney уже который раз. Миджорни одна из самых первых популярных сетей по генерации изображений. За счёт того, что они могут сгенерировать Бэтмена, Спайдермена или каких-то персонажей, на которых есть копирайт, за которым стоят права обладателей. И мне нравится, что теперь любой может сгенерировать какой-то образ Дональдака, или Микки Мауса, или, там, Дарт Вейдера из «Звёздных войн», и, там, распространять как-то его, делать какие-то арты свои, как-то это продавать даже. Вот, и поэтому здесь тоже могут быть проблемы. Если вы решите своего EA-инфлюенсера сгенерировать футболку с Бэтменом, то, может быть, к вам придёт Warner Bros. и ко мне он принадлежит.
-
Такая свадка духа и кодзум, как бы. С одной стороны, AI-генераторы, которым закон не писан, с другой стороны, Warner Brothers и Universal Music, как бы, сейчас посмотрим, кто кого.
-
Ну это, да, бодание меча и щита. правообладателям, когда контент воруют. очень много же этих вопросов и там копаный яй, как всем, по сути, кто делает генеративные нейросети, что вот вы обучаетесь на каком-то контенте, который на самом деле кому-то принадлежит. Будь то какие-то книги, новостные ресурсы, картинки, видео и так далее. Так что этот вопрос очень открытый и еще, мне кажется, решения ему долго не будет.
-
Я еще когда генерил этих персонажей, вспомнил про OnlyFans, потому что в этом сервисе многие популярные модели, такие топовые модели, это коммерческие проекты. То есть берут красивую девушку, везут ее в дорогой отель, снимают кучу видео в течение пары недель, а потом нарезают его на миллион супер коротких клипов есть целый отдел профессиональной техподдержки, поддержки пользователей, который ведет диалог с подписчиками от лица этой модели. То есть, людям кажется, что они говорят там с красивой девушкой, и она им присылает там откровенные фото, видео, записанное специально для них в обмен на деньги. А на самом деле это типа отдел продаж, вот потные филиппинцы.
-
Как раз-таки те самые текстеры и секстеры, как я их называю.
-
Да-да-да. Но, как бы, ничего не имею против потных филиппинцев, но это, типа, не та девушка. Я тут подумал, что было бы вообще логично убрать живых людей из этой схемы, из имени этих искусственных материалов. Вот этот отдел поддержки вообще целиком убрать. Как тебе кажется, насколько это реалистично сегодня?
-
А зависит от того, опять же, что ты хочешь как конечный пользователь. Есть история про человеческое отношение. на OnlyFans за тем, чтобы... Что ты понимаешь, что на другом конце человек. Если ты будешь понимать, что на другом конце искусственный интеллект, то у тебя будет совсем другое отношение к этому. То есть ты будешь более потребительски к этому относиться, а можешь к этому относиться сильно менее эмоционально приятно. Будешь за это платить меньше денег. Что там, средний пользователь OnlyFans, представь, это какой-нибудь 40-45 летний уставший мужчина, у которого есть семья, который, значит, устал от своей семьи, от своей жены, может быть. И вот он приходит на Олифанс, а там его, как короля, встречает 20-летняя жгучая модель, которая его любит, холит и лелеет, все его капризы, кинки выполняет, присылает тот контент, который ему нужно, поддерживает его. И вот он приходит туда за вот этим человеческим коннектом и сексуальным удовлетворением в том числе. Если он будет понимать, что он общается с ботом, с роботом, он сильно меньше будет платить. Возможно, он вообще не пойдет на этот сервис, он пойдет, не знаю, в какой-нибудь дейтинг и будет там переписывать с каким-то реальным человеком. Потому что у людей все-таки есть потребность в другом человеке, в реальной коммуникации с другим человеком, в эмоциональной поддержке. Но так есть не у всех, что именно прям реальный человек нужен. Некоторым просто нужно быть услышанным, поддержанным или просто функционально как-то поразвлекаться, удовлетворить свои сексуальные потребности. И довольно активно рынок AI-компаньонов. Что ты приходишь, у тебя есть отдельный сервис, отдельные сайты, где ты приходишь и у тебя есть список разных ей boyfriend, ей girlfriend, девочек, мальчиков, ты можешь фильтровать по разным критериям, категориям и так далее. Попадаешь с ними в чат и там ты понимаешь, те сразу говорят, что вот здесь ей персонажи. Это все боты. Но вот у тебя есть много разных ботов. Есть такой, секой. Ты захожешь в чат, он тебе отправляет голосовое сообщение, фоточку. Он может быть как реалистичный выглядящий, что ты не отличаешь, что это нереальный человек. А так это может быть аниме персонаж какой-то, мультяшный. И вот ты там разного рода контент можешь получать. Ты понимаешь, что он тебя не осудит. Ты ему можешь написать вообще все, что угодно. Он 24 на 7 доступен. Это сильно дешевле получается, чем общение на OnlyFans. И получение такого контента с компаньонами сильно дешевле, чем общение на OnlyFans получается. И по сути рынок онлифанса и дейтинга сейчас начинает сдуваться, а рынок AI-компаньонов. То есть он растет настолько же, насколько сдувается рынок дейтинга и онлифанса.
-
То есть люди перетекают из социальных сетей и с сайтов знакомств в сервис, который тебе прямым текстом говорит, поговори с искусственным интеллектом, как будто это девушка.
-
с AI waifu, AI girlfriend, ей boyfriend. Многие туда идут. Даже если посмотрите на недавний ход от Илона Маска, нашего любимого, недавно он в Гроке, вот в конкуренции chat.gpt, приложение выпустил чат с waifu, который там взорвался. взорвал интернет, там есть вот 3D модель, такая-то довольно сексуализированная, она еще очень флиртинг с тобой общается.
-
Она постоянно флиртует, и это 3D персонаж, как бы, который целиком живет у тебя в телефоне, движется, разговаривает с тобой голосом, при этом ты видишь ее на экране, и это все выглядит довольно стрёмно. Окей. Артем, спасибо тебе огромное, это супер классный разговор, как всегда. Ссылки на наши прошлые эпизоды с тобой будут в описании к этому эпизоду.
-
Самат, тебе спасибо. Всегда рад присоединиться, пообщаться с тобой. Пока.
-
Друзья, перед тем, как попрощаться, я хочу поделиться рекомендацией для наших англоговорящих слушателей и для тех, кто учит язык. Возможно, вы знаете подкаст «Голый землекоп», в котором биолог Илья Калмановский рассказывает о научных открытиях и людях, которые их совершают. Так вот, студия либо-либо запустила нового голого землекопа, а точнее подкаст «The Naked Mole Rat». Ведет его по-прежнему Илья Калмановский. «The Naked Mole Rat»— это интервью со всемирно известными учеными на языке оригинала, и любимые истории из уже знакомого подкаста с актуальными дополнениями. Слушайте сами и обязательно отправляйте друзьям, которые говорят на английском или учат язык. Ссылка в описании.
-
Это подкаст Студии Либо-Либо.
-
Партнер этого сезона – онлайн-офис Яндекс 360. Над выпуском работали редакторки Маргарита Берденникова и Маша Агличева, продюсеры Данил Остапов и Аня Коваленко, звукорежиссер Юрий Шустицкий. За джингл спасибо Алексею Зеленскому. До встречи через неделю. Редактор субтитров Т.Горелова Корректор А.Егорова