6 сезон · выпуск 1 · 7 декабря 2021 · 47 мин

«Нога Акинфеева обои» и еще сотня миллионов запросов в день. Как работает поиск

Разработка ИИ и нейросети

Слушать · 47:07

Поисковых систем в мире меньше, чем компаний, которые запускают ракеты. Пользователю просто получить любую информацию в интернете, а инженерам надо поддерживать базу данных с миллиардами веб-страниц и находить среди них нужные за доли секунды. О том, как компьютер понимает наши запросы и выбирает для них ответы Самат говорит с руководителем Яндекс.Поиска Максимом Загребиным.

Партнер этого эпизода — компания Яндекс. Наши совместные выпуски будут выходить по вторникам, раз в две недели.

Как скачать все страницы из интернета

В каком формате веб-страницы хранятся в базе данных

Что происходит, когда пользователь делает запрос

Как обработать запрос с белибердой

Что алгоритмы знают об авторе запроса

На какие ухищрения идут люди, чтобы их сайт оказался повыше в поисковой выдаче

У каких компаний в мире есть свой поисковый движок

Книга «Введение в информационный поиск» https://market.yandex.ru/product--manning-kristofer-d-i-dr-vvedenie-v-informatsionnyi-poisk/617631209?cpa=1

Технический блог Яндекса https://yandex.ru/blog/company

Технический блог Google https://www.blog.google

Подписывайтесь на наши бонусные эпизоды «Запуск ++» в Apple podcast или на патреоне https://www.patreon.com/zapooskzavtra

Над выпуском работали

Редактор
Юля Яковлева
Продюсер
Павел Боровков
Звукорежиссер
Нина Мамотина
Дизайнер обложки
Петр Сутупов

Транскрипт

Самат Галимов, Максим Загребин · расшифровано автоматически, ошибки возможны

  1. Самат Галимов

    Всем привет, меня зовут Самат Галимов и это подкаст запуск завтра. Мы возвращаемся с каникул со специальным сезоном. Эпизоды этого сезона будут выходить по вторникам, раз в две недели. Мы его делаем вместе с Яндексом. Мы будем разбираться в том, как устроена интернет-технология, как и раньше, но только на примерах сервисов Яндекса. Наши обычные четверговые выпуски вернутся через пару недель. Этот специальный сезон с Яндексом мы начинаем с главной темы— это поиск. За все наши 80 эпизодов прошлых мы так и не поговорили ни с кем, кто занимался бы именно поиском. Хотя поиск— это технология, которой мы все пользуемся каждый день. Несмотря на то, что мы уже привыкли к тому, что поиск работает хорошо, для того, чтобы он работал хорошо, вложены прямо миллионы часов очень крутых инженеров. И то, как это устроено под капотом реально и, с одной стороны, глобально архитектурно, с другой стороны, в деталях, понимает очень мало людей. Один из них пришел к нам сегодня в подкаст.

  2. Максим Загребин

    Меня зовут Максим Загребин, я руковожу поиском Яндекса. Я не знаю, что еще добавить к этой фразе.

  3. Самат Галимов

    Знаешь, как бы, что еще объяснять-то?

  4. Максим Загребин

    Ну да.

  5. Самат Галимов

    Ладно, поехали. Как у Яндекса появился поиск?

  6. Максим Загребин

    Слушай, это было давно еще до меня. Я думаю, что Аркадий и Илья, это был их не первый совместный продукт. И в то время же появлялось много поисковых систем, то есть Google на самом деле появился позже Яндекса, но к тому было. Yahoo, и на западе, ну это был довольно конкурентный рынок, и Яндекс, основная же его аббревиатура, это Yet Another Indexer. Собственно, была хорошая инженерная школа, я думаю, что Илья с Аркадием решили, блин, давайте сделаем вот такой классный продукт, как бы с... фокусом на Россию, которой гораздо лучше будет понимать русский язык, потому что, ну вообще, Яндекс начинался с того, что русский язык, он кириллический, а не латиницей, поэтому для всех западных систем это представляло дополнительную сложность. Ну и, с другой стороны, это, соответственно, было opportunity. Могу домыслить, что мысли были примерно такие.

  7. Самат Галимов

    Блин, Макс, я никогда не задумывался о том, что имя Яндекс— это yet another index, типа еще один индекс. Индекс— это типа таблица, в которой собрали всю информацию, и по этой таблице можно быстро искать.

  8. Максим Загребин

    Да, вообще в голове людей интернет— это что-то, ну, во-первых, абстрактное, во-вторых, для тех даже, кто понимает, это довольно распределенная вещь, потому что контент хранится на куче серверов, хостингов, которые расположены вообще по всему миру. И поисковые системы— это очень немного компаний в мире, которые в любой момент времени имеют полный снимок всего интернета на своих серверах. Максимально актуальный, максимально полный.

  9. Самат Галимов

    Макс, а сколько вообще страниц в интернете?

  10. Максим Загребин

    Слушай, там их количество постоянно растёт, причём по степенному закону. Нас спасает только то, что не все из них одинаково полезны. Но мы точно говорим, я думаю, что о сотнях миллиардов и даже, наверное, триллионах.

  11. Самат Галимов

    Сотни миллиардов, триллионы. Вообще, я тут поясню идею. Если бы я захотел сделать свой собственный поисковый движок, я бы сделал так. Сначала бы я написал программу, которая скачает все страницы из интернета, ну или какое-то огромное количество страниц из интернета. Дальше я запихнул бы их все в одну базу данных и научил программу по каким-то принципам выбирать из этой кучи страниц, из этой кучи данных, ту страницу, которая максимально подходит под запрос человека. Я хочу на базовом уровне разобраться, как работает поиск, и начать вот с первой задачи. Как скачать все страницы из интернета и запихнуть в одну базу.

  12. Максим Загребин

    Да, это вообще очень сложная задача. Простейший, мы называем это crawler, то есть такая программа-паук, которая ходит по страничкам, находит на ней ссылки, переходит, скачивает страничку по ссылке и так далее, расползается все шире и шире. Мы такое задание даем кандидатам, которые приходят в Яндекс в качестве тестовых, которые можно написать в простейшем виде, на самом деле,

  13. Самат Галимов

    ну там, не знаю.

  14. Максим Загребин

    за денёк, за два. Причём даже не разработчикам, а многим техническим менеджерам.

  15. Самат Галимов

    Ничего себе.

  16. Максим Загребин

    Но для того, чтобы это решать уже в таких промышленных масштабах, там возникает огромное количество вопросов. Ну, например, есть какая-нибудь информация от 93-го года, ещё из какого-нибудь зарубежного сайта, и ссылок на неё практически нет. Хорошо, если её кто-нибудь на каком-нибудь форуме на неё сошлётся, и ты её найдёшь. Потому что если в тот момент, например, она была одна, в сайте BBC, и ты в тот момент главную страницу BBC обошёл, ты узнал ссылку, ты знаешь, где её скачать, ты её как бы в своё время положил в индекс. А если ты не успел, то найти ссылку— это вообще проблема.

  17. Самат Галимов

    Второе... А, то есть ты про то, что даже узнать, что страница какая-то есть в интернете, даже это само по себе непростая задача.

  18. Максим Загребин

    Конечно. Ты не можешь скачать ссылку, мы же их не будем перебором просто все возможные сочетания слов после каждого слэша подставлять и пытаться проверять, есть там такая ссылка или нет. Что помогает? Помогает то, что все-таки... Урл как устроен? У него есть хост, хост тебе выдает какой-то регистратор. То есть у регистратора можно узнать список всех хостов.

  19. Самат Галимов

    Регистратор— это компания, которой ты платишь небольшие деньги за то, чтобы адрес твоего сайта появился в интернете. Ну вот, например, у меня есть сайт fedorinsamat.com. Для того, чтобы он появился в интернете, я пошел и заплатил там 10 долларов и зарегистрировал имя сайта. Окей, ты идешь к регистратору и получаешь полный список сайтов в интернете. Что дальше ты с ними делаешь?

  20. Максим Загребин

    Дальше, скорее всего, весь интересный контент, который есть на его сайте, он попытается сделать так, чтобы с главной страницы ты до них мог легко добраться, потому что он думает о пользователе, который пришел и должен, если это, например, какая-то фирма, узнать, какие у нее продукты, какие у нее контактные информации, какие-то новости. То есть, начиная обход с главной страницы, все самое интересное ты, скорее всего, быстро найдешь. Есть также такой формат, который называется, например, Sitemap. где сайт просто говорит, вот смотри, все мои странички, они вот так вот, например, иерархически расположены у меня на сайте, обходи их, пожалуйста. Потому что сайты, конечно же, заинтересованы в том, чтобы поисковые системы хорошо знали их контенте, потому что сайты получают трафик с поисковых систем.

  21. Самат Галимов

    То есть, получается, есть два способа, что дальше делать с сайтом. Первый— этот робот, crawler или паук его еще называют, он пытается просто как пользователь, типа, открывает страницу, смотрит, какие на ней есть ссылки, и их тоже скачивает. Другой способ— это есть технический документ sitemap, в котором есть список всех страниц, которые нужны Яндексу, и робот просто их скачивает. Окей. Максим, ты сказал, что страниц там сотни миллиардов. Ты их все пытаешься скачать и обработать или фильтруешь по какому-то принципу?

  22. Максим Загребин

    В конечном счете мы, конечно, хотим иметь все страницы, но так как у нас количество ресурсов ограничено и вообще мы обходом интернета создаем нагрузку на сайт, в первую очередь мы пытаемся скачать самые важные страницы, в которых с самой большой вероятностью понадобится пользователям в результатах поиска. Для этого уже тут появляется машинное обучение, и оно пытается, мы называем это selection rank, то есть некоторый ранк, который выбирает, что обходить в первую очередь, и он пытается предсказать, что вот эта страница с большей вероятностью понадобится пользователям в результатах поиска, а эта с меньшей. Соответственно, вот эту надо скачать раньше, а эту можно чуть попозже.

  23. Самат Галимов

    То есть ты полезность страницы предсказываешь еще до того, как ты ее скачал и вообще даже посмотрел на ее содержание?

  24. Максим Загребин

    Конечно.

  25. Самат Галимов

    Вот мы с тобой говорим типа скачать страницу, скачать страницу, а что ты с ним дальше делаешь, как ты их обрабатываешь?

  26. Максим Загребин

    Дальше мы про эту страницу проговорили, что есть такой индекс, это по сути база данных интернета, в которой поиск ищет нужную информацию. Долгое время эта база данных была как устроена, то есть ключом там было слово, а значениями это были сайты и странички на сайтах, и позиция, в которой это слово на самом деле встречается.

  27. Самат Галимов

    То есть ты сделал такую гигантскую таблицу, в которой были все слова, которые встречались на всех страницах в интернете, и по каждому слову у тебя был список страниц, на которых это слово встречается и на каком месте. Да. Офигеть.

  28. Максим Загребин

    Со временем всё это эволюционирует. Ключом начало быть уже не одно слово, а, например, какие-то словосочетания, потом потихоньку появились ещё дополнительно векторы, которые появляются, например, над заголовками страниц или над текстами, что ты имеешь в виду. Вот, по-моему, в 2016 году сказали, мы запускаем новый алгоритм «Палех», и он умеет искать не только по соответствию слов и синонимов, которые, ну, можно вручную или словаря синонимов составить, а по смыслу. Наверное, примерно в то время, может быть, чуть раньше появилась такая широко известная статья про Word2Vec. Это про то, как текст представлять в виде векторов длиной, например, 256 символов, и дальше ты любой текст можешь сжать в одинаковый вектор. И в этот вектор ты можешь сжать и запрос пользователя, и текст или заголовок страницы. И дальше, если эти вектора запроса и текста достаточно близки, то с большой вероятностью этот документ отвечает на вопрос, который интересен пользователю.

  29. Самат Галимов

    Подожди, тут надо пояснить. Вектор имеется в виду, что любой текст можно представить в виде последовательности чисел. Да, ограниченной длины, то есть там, например, 100 чисел. И дальше разные тексты ты можешь переводить в этот формат и сравнивать похожесть текстов по тому, насколько близки эти числовые последовательности.

  30. Максим Загребин

    Да, и самое интересное начинается, когда ты понимаешь, что ты можешь в такой вектор, или там embedding в зависимости от того, кто какую терминологию использует, сжать не только текст, но и картинку, и видео, и интересы пользователя, а дальше ты можешь вектор, полученный из запроса, сравнивать с вектором, полученным на основе вообще другого вида информации, например, видео, и также смотреть, насколько они близки, потому что у них одинаковая размерность.

  31. Самат Галимов

    То есть, по сути, ты начинаешь искать уже не по словам, а по смыслам, потому что это числовое представление, оно как раз про смысл текста.

  32. Максим Загребин

    И вот, на самом деле, с 2016 года началась вот эта вот гонка нейронных сетей, когда начали появляться всё более сложные архитектуры, которые позволяли всё с большим качеством представлять текст в виде вектора, и этот переход на архитектуру новой нейронной сети давала каждый раз дополнительный большой рост качества поиска. То есть там после Word2Vec появились DSSM модели, потом BERT, ну и последнее это уже там GPT-3. Это я использую на самом деле название, по которому проще всего найти статьи, в которых можно прочитать об архитектурах этих сетей, потому что дальше большие компании смотрят эти статьи, вдохновляются и придумывают какую-то свою уже архитектуру, заточенную под их нужды. Каждая в своей области. Рекомендательные системы для своих интересов, поисковые системы для своих. То есть мы живем в мире, когда между появлением научной работы и, по сути, внедрением её в коммерческой компании, в производство, происходят часто вообще месяцы. В других отраслях, мне кажется, это гораздо дольше этот цикл, потому что появляется наука, потом люди изучают ее в институтах, потом приходят на производство, начинают ее применять. В IT это буквально очень быстро все происходит, это развитие.

  33. Самат Галимов

    И то, что ты вот назвал разные технологии, это как раз разные поколения того, как мы умеем смысл текста представлять как числа.

  34. Максим Загребин

    Да, и еще одна большая проблема, с которой постоянно борются поисковые системы— очень сложный highload. Потому что, с одной стороны, огромное количество запросов пользователей, с другой стороны, огромное количество документов в интернете, среди которых нужно найти важную информацию. И дальше происходит перемножение вот этих двух очень больших чисел. Поэтому нам важно, чтобы все операции, которые мы используем для расчета алгоритмов ранжирования, выполнялись очень быстро, потому что иначе нам не хватит никаких серверов для того, чтобы выполнять этот поиск. И да, как раз вот операции над векторами простейшие, они обладают тем свойством, что они достаточно дешевы с точки зрения вычислительных мощностей. Конечно, ничего не бывает бесплатно. Там не только появляется новая классная математика, на которой строится эта архитектура сети. Обычно каждое новое поколение требует все больше и больше вычислительных мощностей. Вот мы буквально на этой неделе объявили, что у нас есть топ-3 суперкомпьютера. Они как раз нужны для того, чтобы обучать эти сложные сети, потому что обучение этой сети может занимать на самом деле месяцы. месяц на десятках тысяч ядер. А потом может оказаться, что сеть получилась так себе и надо начинать сначала.

  35. Самат Галимов

    Вот мы создали эту огромную базу данных, в которой хранятся эти числа и по ним можно находить страницы. Как поверх этой базы данных теперь делать поиск? Вот, например, я набрал в Яндексе погода в Москве сегодня. Что происходит под капотом?

  36. Максим Загребин

    погода в Москве сегодня, нужно рассказать, что поиск, его можно представить как воронка. В самом начале воронки у тебя есть все страницы в интернете. С каждым этапом мы стараемся оставлять все меньше и меньше документов, чтобы в самом конце показать пользователю 10 самых лучших. И у нас, наверное, таких этапов сейчас примерно 4. Они отличаются тем, что с каждым этапом мы используем все более сложные модели, там все больше параметров. И в конце уже десятка документов. Сначала их там остается 150, потом сколько-то десятков. Там уже начинается и персонализация, которая ставит выше те сайты, которые пользователь чаще посещает, которым больше нравится.

  37. Самат Галимов

    Максим, я, наверное, не очень хорошо понимаю. Вот первый этап я понял. Мы составили огромную таблицу, в которой слева вот эти вектора, то есть наборы чисел, которые представляют смыслы текста. Справа адреса страниц. А сейчас ты говоришь о том, что есть модели. Тут я начинаю теряться, как это работает.

  38. Максим Загребин

    Если попытаться, объясните на пальцах. Какая погода в Москве состоит из трех слов и предлога? Так, ну хорошо, предлог в мы можем сказать. Это очень частый вообще предлог в русском языке. Наверное, он не очень важен.

  39. Самат Галимов

    Осталась погода в Москве сегодня.

  40. Максим Загребин

    Какая погода в Москве? Да, в Москве тоже можно не писать, потому что мы в целом понимаем, в каком-то регионе, и результаты поиска зависят от того, в каком-то регионе. Это задача, которая решалась, наверное, где-нибудь в 2012 году, чтобы люди перестали писать регион. Ребята, мы знаем. Окей, остается три слова. Скорее всего, документы, в которых нет этих слов, вообще мало помогут пользователю. особенно если в них нет слова погода.

  41. Самат Галимов

    А, и вот и 99% всех документов уже отсек.

  42. Максим Загребин

    Да, ты выкинул. Возвращаемся к разговору про нейросети, а еще мы посчитаем вектор от этого запроса и найдем все документы, вектора которых близки к вектору запроса, который спросил пользователь. И таким образом у нас их остается, не знаю, сколько-то тысяч. Запрос, какая погода в Москве, безумно популярный. Огромное количество пользователей его уже задавало и по каким-то ссылкам переходило. И мы это знаем просто исторически, какие документы они предпочитают. А еще у нас есть много, на самом деле, машинного обучения, которое говорит вот этот документ. Более полезен этот документ, менее полезен. И не обойтись нам без того, чтобы сказать, что большая база данных, она должна быть шардирована. То есть она не лежит на одном сервере, она распределена по огромному количеству серверов. И дальше мы, соответственно, на каждом сервере вычисляем топ документов, присылаем его как бы на следующий уровень иерархии. Там эти топы мержатся между собой.

  43. Самат Галимов

    то есть объединяются, оставляется опять топ, пока

  44. Максим Загребин

    мы не получаем, не знаю, 150 документов.

  45. Самат Галимов

    Подожди, то есть мой запрос, сначала мы отсекаем те страницы, которые точно не подойдут, остаются несколько тысяч, дальше я знаю, на каких серверах хранятся информация об этих страницах, и я посылаю один и тот же запрос на все эти 10, 20, 30 серверов. Дальше каждый сервер выбирает самые лучшие документы, посылает их в центр, а центр уже выбирает из этих присланных делегатов опять еще

  46. Максим Загребин

    самого лучшего, Мы это называем мета-поиск. На мета-поиск пришли, например, топы документов с 100 серверов под ним. Он их все смерджил, и из этих 100 умножить на 10 получается тысяча документов. Снова выбрал, например, 100 или 10 и отправил их на следующий уровень мета-поиска. Таким образом, у тебя все время остается все меньше и меньше документов, но они все лучше и лучше.

  47. Самат Галимов

    Такая пирамида. Скажи, пожалуйста, смотри, когда я открываю страницу в интернете, работает там 3 или 4 сервера. серверы базы данных, серверы фронт-энда, бэк-энда и как бы вот моя страница. Сейчас получается, что когда я делаю поисковый запрос, то работают десятки серверов, ты даже сказал 100. Это реально так?

  48. Максим Загребин

    Поиск— это очень дорогая с точки зрения вычислительных мощностей система. не про сотни, мы говорим про десятки тысяч ядер, которые обрабатывают все запросы, которые задают ежедневно пользователи.

  49. Самат Галимов

    Ну я понимаю, что когда объем очень большой, но получается даже мой один запрос, он активирует сразу сотни компьютеров, которые работают коллективно.

  50. Максим Загребин

    В этой ситуации конкретно нас скорее всего спас кэш, который сказал, слушай, этот запрос спрашивал буквально две секунды назад, я все считал, вот возьми готовый результат.

  51. Самат Галимов

    Окей, но этот запрос очень простой был, давай добавим сложности. Вот, например, как лечиться от коронавируса?

  52. Максим Загребин

    Смотри, тут, наверное, запросы действительно отличаются друг от друга. Сложность их часто скоррелирована с частотой их задания. Сложные запросы спрашивают редко. Мало людей, которым нужно настолько детальную и в них специфическую информацию узнать. Алгоритмы при этом используются в целом одни и те же. Так как мы работаем ежедневно с сотнями миллионов запросов, Мы просто не можем под отдельные классы запросов, довольно узкие, делать свои алгоритмы. Поэтому мы всегда стараемся, чтобы алгоритмы были максимально общие, но они умели правильно работать в зависимости от того, о чем задан запрос. Если ты спрашиваешь, например, про коронавирус, это класс запросов, вообще ответ на который может сильно повлиять на жизнь и здоровье человека. И там мы учим свои алгоритмы не только находить релевантную информацию, которая даст ответ на запрос, но очень важно, на каком источнике она написана. Если это обсуждение происходит где-нибудь в комментариях соцсети, то информация о том, как лечить коронавирус в комментариях, менее полезна для пользователя, чем какой-то медицинский журнал, информация на сайте клиники, которая специализируется на компьютерной томографии или занимается проблемами ковида. И очень важно становится не только найти релевантную информацию, но и выбрать те сайты, которые являются экспертными для этого вопроса.

  53. Самат Галимов

    Это руками выбирается.

  54. Максим Загребин

    Смотри, как работают алгоритмы ранжирования. Они все построены на основе машинного интеллекта, они машинно обученные. но мы через инструкции асессоров объясняем, что они должны уметь.

  55. Самат Галимов

    Это кто такие?

  56. Максим Загребин

    Асессоры— это как раз люди, сотрудники, которые помогают нам обучить машинный интеллект. В чем их заключается работа? Они получают задания, например, они видят запрос и 10 документов. Часто они видят уже даже пояснение, которое написано к этому запросу таким лидом асессоров, который объясняет, что в этом запросе, например, как лечиться от коронавируса. Пользователь хочет узнать информацию о том, существуют ли медикаменты, насколько помогают прививки, куда обращаться, если у вас возникли симптомы. И вся информация в интернете, которая отвечает на эти вопросы, будет полезна пользователю по этому запросу. Дальше асессор видит странички, которые мы ему прислали. Например, взяв новый алгоритм ранжирования, взяли те 10 ссылок, которые он показал самым вверху и просим асессора, смотри на них и скажи, насколько они действительно помогут пользователю. И дальше он по какой-то своей шкале говорит, вот эти страницы вообще не о том, не понимаю, как поиск их мог найти. Вот эти вот страницы полезные, они про то. А вот это вообще самые лучшие страницы. Тут и источник очень авторитетный, потому что это какая-нибудь ассоциация врачей очень известная. И написано все понятным языком, так что может разобраться не только кандидат медицинских наук, но и обычный человек. И информация очень полная, про все можно получить ответ. Этим страницам он ставит оценки. И дальше мы берем вот эти вот оценочки и дообучаем наши алгоритмы.

  57. Самат Галимов

    Сколько асессоров в Яндексе?

  58. Максим Загребин

    Ну ты задал вопрос. Я думаю, что их тысячи. Есть асессоры, есть толокеры. И асессоры— это люди, которые прямо работают в Яндексе, они получают зарплаты. А есть еще талокеры— люди, которые зарегистрировались на сервисе, у них есть приложение, они выполняют задание и получают за него деньги. И вот талокеров, конечно, гораздо больше, чем асессоров. Я боюсь соврать, потому что асессоры работают не только на поисках, они используются в огромном количестве продуктов Яндекса.

  59. Самат Галимов

    Я просто внезапно понял, Максим, у меня глаза светятся, наверное, я просто всегда думал, что поиск— это такая машина, просто механизм, автоматическая штука, алгоритмическая, эти программисты придумали и сделали, и всё. А получается, что поисковая система— это на самом деле автоматизация решений асессоров, то есть машина посмотрела, как в принципе люди выбирают страницы и дальше автоматизирует, пытается подражать этим людям. Да, это космос.

  60. Максим Загребин

    В этом же сути искусственного интеллекта мы автоматизируем то, что человек умеет делать. Мало алгоритмов, которые умеют делать то, что не умеет делать человек.

  61. Самат Галимов

    Максим, наверное, сейчас глупо прозвучит вопрос, но я все-таки его задам. А какое количество запросов в том или ином виде было отвечено асессорами? Насколько я понял, поисковая машина работает так. Асессорам задаются вопросы, асессоры говорят, какие страницы хорошие, машина учится их мимикрировать. Так вот, какая доля запросов реальных пользователей совпадает с вопросами асессоров, а сколько машина догадывается? Понимаешь, о чем я?

  62. Максим Загребин

    Я думаю, за все время работы асессоров они ответили на миллион или десятки миллионов запросов. Это за все года, не знаю, за несколько десятилетий последних. Поиск существует примерно 20 лет. А в день Яндекс задают сотни миллионов запросов. Можешь посчитать, сколько их задали за... Они же все одинаковые!

  63. Самат Галимов

    Мы же все знаем, что 90% людей задают один и тот же вопрос.

  64. Максим Загребин

    Тут второй интересный факт, что примерно половина запросов к поиску, они уникальны. Их никогда раньше не задавали и никогда больше не зададут.

  65. Самат Галимов

    Чего? Подожди, серьезно, что ли? То есть каждый день? Как вообще такое может быть?

  66. Максим Загребин

    Потому что наша жизнь меняется. Смотри, во-первых, два года назад никого не интересовал коронавирус. В какой-то год у нас случается чемпионат мира по футболу. В реальной жизни происходит очень много всего, и люди про это начинают спрашивать у поисковых систем, а раньше такой сущности просто не было. не было. Во-вторых, если вспомнить интернет в десятилетней давности, то он был более развлекательный, информационный. Да, уже была Википедия, да, уже были какие-то форумы а-ля Пикабу, но мы всё равно туда обращались не со всеми задачами. А сейчас количество наших жизненных задач, которые мы решаем через интернет, выросла просто в 10 раз. Прежде чем пойти, не знаю, подавать документы на визу или даже просто найти исполнителя, который тебе кран поменяет на кухне, потому что у тебя у самого времени нету, ты с этим запросом идешь как бы не знакомому, который недавно визу получал или к знакомому сантехнику, а просто идешь в поиск и говоришь, найди мне про это информацию или найди мне еще лучше прямо исполнителя.

  67. Самат Галимов

    Кайф! Смотри, при некоторых запросах, например, про погоду или про стихи, пишешь «Мой дядя в самых честных правилах», у тебя сразу выдается поверх всех этих поисковых результатов, поверх страниц в интернете, выдается коротенький блок маленький такой. Например, сам стих там написан. Это стих Пушкина, почитать его можно вот здесь. Я так понимаю, это какие-то специальные случаи, которые вы как-то специальным образом обрабатываете. Что это такое и сколько таких специальных случаев?

  68. Максим Загребин

    На самом деле это просто следующий этап развития поисковых систем. Это шажочки на пути к будущему, в котором человек получает сразу ответ на странице поиска, а если он хочет углубиться и почитать подробнее, то у него есть всегда источник сайта, на котором мы это нашли, и он приходит и читает там полную страницу. Интересно начинается, когда запрос в поиск приходит не из поисковой строчки на сайте, а, например, из Алисы, потому что с Алисой пользователи взаимодействуют уже не как с поисковой системой. Мы за годы использования поиска привыкли, что вот если спрашивать вот так, то результаты вроде как получаются получше. Мы сами не можем объяснить, как надо задавать запросы, но мы определенным образом их конструируем.

  69. Самат Галимов

    У меня есть такой вопрос на самом деле. Как лучше задавать вопросы? И ты хочешь сказать, что мы, типа, люди в целом подстраиваются под машину и начинают задавать каким-то определенным образом.

  70. Максим Загребин

    Наша нейронная сеть в голове, да, запоминает. А вот когда мы общаемся с Алисой, там, конечно, ты пытаешься общаться как с другом, такой, чтобы у вас прям был диалог человеческий. Там, мы называем это поток запросов, да, совершенно другой, потому что там есть и обращение, и другая форма речи, и под него алгоритм ранжирования надо, скорее, отдельно дообучаться, чтобы уметь их обрабатывать. В тот момент, когда мы отправляем запрос в поиск, я вот сейчас приехал, пока ждал начало записи, и у меня надо было где-то скоротать полчаса, я спрашиваю, кафе улица? Вот так вот я в поисковой строке забиваю запрос, вижу кафе, иду туда, как бы заказываю себе чашку кофе. А если бы я спрашивал Алису, которая, например, живет там в навигаторе или в приложении Яндекс, я бы спросил, Алиса, слушай, а где попить вкусный кофе на такой-то улице? И вот как минимум слова «Алиса» и «слушай» надо вырезать, они к запросу вообще имеют мало отношения, это мое такое как бы поддержание дружеского диалога с Алисой. «А где попить вкусный кофе на улице»— это уже содержательная часть.

  71. Самат Галимов

    Я помню, была статья у Яндекса, где вы приводили самые криповые запросы, которые... хрен поймешь, чего человек хотел найти. Я нашел эту статью, тут, короче, такие запросы. «Вы очень красиво выглядите без куртки по-болгарски». Мне это заняло какое-то время для того, чтобы распарсить это как бы.

  72. Максим Загребин

    Да, на самом деле человек хочет кому-то сделать комплимент на болгарском, ему нужен, похоже, переводчик, которому будет подставлена фраза... Вы очень красиво выглядите.

  73. Самат Галимов

    Как бы непонятная фраза. Нога Акинфеева обои. Я подозреваю, что он хочет обои рабочего стола, видимо, с ногой Акинфеева.

  74. Максим Загребин

    Ну да, это же известная пенальти на чемпионате мира 2018 года, где Акинфеев ногой отбил пенальти.

  75. Самат Галимов

    Я не эксперт в этой области.

  76. Максим Загребин

    Вот, а человек, для него настолько это знаковый момент, что он хочет обои на рабочий стол, в котором как бы... По-моему, это же есть юбилейная 100-рублёвка, на которой есть нога Акинфеева.

  77. Самат Галимов

    Охренеть! Слушай, для меня это вообще типа белый шум. Я смотрю и думаю, господи, что человек пишет? А это, оказывается, осмысленно. Окей. Зачем человеку кот? Я вот не знаю, это либо песня какая-то, либо реально запрос типа, зачем нужны кошки?

  78. Максим Загребин

    Да, вот очень часто оказывается иногда, что есть несколько песен на какие-то вот такие слова, и человек хочет одну конкретную, и важно понимать их популярность, там, не знаю, и предпочтение человека, чтобы понять, что вот эта вот песня от группы, которая, например, ему больше нравится, потому что он больше запросов задаёт про этот жанр, рок или рэнби, наоборот, найти для него важную. Абсолютно точно, что не по всем запросам даже человек, который в этой теме эксперт, может однозначно сказать, что будет полезно, а что нет.

  79. Самат Галимов

    я последний зачитаю и да пойдем дальше картинка тату надпись коли на китайском все

  80. Максим Загребин

    очень понятно по моему девушка влюбленная в колю хочет увидеть как будет выглядеть татуировку если она решит сделать с его именем себе где-то тату и возможно сказать ну не настолько мне нравится коля и татуировка

  81. Самат Галимов

    некрасивая Это всё-таки довольно весело. У меня есть адский вопрос. Я видел это в Гугле и проверил на Яндексе, и там тоже, когда пишешь «я хочу себя убить», то Яндекс, конечно, подсказывает 99 способов, как это сделать, но наверху есть телефон психологической помощи. И это тоже делать алгоритм или это ручная редакторская работа?

  82. Максим Загребин

    Вообще сложный вопрос. Где алгоритмы поиска должны просто помочь человеку решить задачу, а где мы на самом деле должны помочь ему решить не ту задачу, которую он решает прямо сейчас, а какую-то более глобальную. Если человек задумывается о суициде, сложная тема, то мы взяли на себя ответственность не пытаться решать его задачу прямо сейчас, а помочь с этим справиться и найти какие-то примеры, когда люди сталкивались с похожими проблемами, как они с ними справлялись. Действительно, телефон службы, который в таких случаях помогает, у нас это такой спецформат. Например, если происходит где-то чрезвычайное положение, ну, не дай бог, упал самолет, как бы есть горячая линия, по которой можно узнать, кто там. из людей остался жив или вообще куда обращаться. Мы это называем такой блок чрезвычайных ситуаций. Тут это что-то ближе скорее вот к этому. То есть для того, чтобы сделать такой ответ, не настолько сложно. Там нет триллионов документов, из которых надо выбирать. Скорее, это какие-то организации, в которых мы уверены, что они действительно помогают людям, вот, и показываем их контакты.

  83. Самат Галимов

    То есть такая редакторская работа.

  84. Максим Загребин

    Да, тут можно разделить все страницы в интернете на такие две большие группы. Первая— это когда по контенту сайта мы понимаем, что этот контент так или иначе неприемлем. Вспоминая такую давнюю шутку, что The Internet Is for Porn есть много контента 18+. Просто посмотрев на этот контент и алгоритмами, асессорами, ты абсолютно понимаешь, такой контент никогда не должен появляться в результатах поиска, если пользователь явно про него не спросил, потому что он В целом достаточно кликбейтный. Человек, если его даже случайно видит, такой, ну ладно, пойду посмотрю, что там кликает, и это вообще сбивает поисковую систему, потому что по всем вроде бы алгоритмам это нерелевантно, но пользователь туда идет. Например, от такого мы ограждаем пользователей. Суицид— это во многом тоже информация, которую ты можешь, прочитав контент, понять. Человека на этой странице скорее объясняют, как это сделать, или подталкивают к этому, или скорее помогают справиться и рассказывают истории людей, которые через это прошли, дают советы, как это пережить. Есть тематики, в которых у нас абсолютно нет никакой экспертизы. Ну, например, есть много мошенников или финансовых пирамид в интернете. И вообще, если человек решит отдать свои деньги в какую-то финансовую пирамиду и их потеряет, это может сильно сказаться на его жизни и здоровье. Но мы никак, посмотрев на сайт, не можем понять, эти люди, правда, помогут человеку заработать или скроются с его деньгами. И тут мы взаимодействуем уже с какими-то организациями, у которых такая экспертиза есть. Есть огромный список сайтов, например, заблокированных Роскомнадзором, который он нам отдает и говорит, это экстремистские сайты, они, не знаю, вовлекают людей в террористические организации. И тут мы, тут даже мы по закону это должны делать, мы такие сайты просто удаляем.

  85. Самат Галимов

    Насколько сильно результаты поиска зависят от человека? Вот если я всегда захожу на Эхо Москвы, например, то мне покажется другой либерально окрашенный сайт? Или мне только Эхо Москвы забустится?

  86. Максим Загребин

    Мы, конечно, пытаемся предсказывать сайты, которые в целом тебе больше нравятся. Там не будет такой детальной окраски, что это либеральные, а эти нет. Мы просто понимаем, что ты посещаешь вот такие-то сайты, например, чаще на них кликаешь на результатах выдачи, и при прочих равных мы тебе будем показывать сайты, на которые ты больше переходишь. Ты задаешь вопрос сложный про политику, гораздо более простой пример про знание языка. Кто-то английский знает хорошо и вообще отлично читает, собственно, на английском, как на русском, и для него нет разницы, какую ему информацию показать. А кто-то по-английски читает неуверенно, и он предпочтет перевод информации в оригинале и кликнет на ссылку с русским языком. Вот, соответственно, тут вот это обобщение, например, работает гораздо лучше.

  87. Самат Галимов

    Что вообще алгоритмы Яндекса знают о мне как о пользователе? Вот ты привел пример того, знаю я английский или нет. Эта информация есть у алгоритма, когда он принимает решение?

  88. Максим Загребин

    Начнем с простого. Что мы знаем? Мы знаем с большой вероятностью, из какого региона пользователь. Мы по IP-адресу можем понять. А еще у нас есть просто настройка, которую он может выставить, если мы, например, ошиблись, и он находится, не знаю, в Красногорске, а не в Москве, то есть в каком-то городе-сателлите большого города. Во-вторых, мы знаем его текущую операционную систему, платформу. Большое различие между Android и iOS. Если человек ищет какое-нибудь приложение «Фонарик», бессмысленно ему в Safari показывать ссылки на Google Play, надо показывать на тот стор из которого он сможет его поставить. Дальше мы знаем, какие запросы он раньше задавал. И по сложности, и по языку, и на какие сайты он переходил из поисковой системы. И, соответственно, в алгоритмах персонализации можем учитывать

  89. Самат Галимов

    Получается, знаешь, я спрашиваю, что бы мне знала система, ожидая услышать всякие страшилки про то, что она знает мои сексуальные предпочтения, а слышу в ответ довольно базовые вещи, типа регион по IP-адресу, операционную систему по браузеру и какие-то совсем базовые вещи. Что, реально нет какого-то нормального предсказательной модели?

  90. Максим Загребин

    Ну потому что, простой вопрос, твои сексуальные предпочтения довольно мало повлияют на то, какую информацию тебе показать о коронавирусе. Но это, блин, несвязанные запросы, они никак не помогают найти для тебя более хорошую информацию. Мы всё-таки решаем довольно прикладную задачу. Нам, человеку, нужно найти лучший ответ на его вопрос. И, например, понимать, насколько хорошо он знает английский язык или разбирается в какой-то экспертной теме. Там ему нужно совсем ликбез показывать. Или серьезные источники.

  91. Самат Галимов

    А вот эта информация есть.

  92. Максим Загребин

    Да, вот по сложности запросов.

  93. Самат Галимов

    Научиться предсказывать, что я там айтишник.

  94. Максим Загребин

    Да. И, соответственно, мы тебе... Вот даже Яндекс, когда публикует информацию о своем релизе, то, как это написано, например, на VC.ru и на Хабре, это написано с разными акцентами. На VC.ru это более маркетинговая, понятная широкому кругу людей история. А на хабре это такая вот мякотка для IT-специалистов, которую интересно почитать с техническими деталями. Так вот, тебе как IT-специалисту мы хабр должны показать выше, чем VC.

  95. Самат Галимов

    Ну да, окей. Рассказывай уже про бизнес. Вот есть поисковые запросы, например, поставить пластиковые окна. Я не знаю, почему мне не так нравится этот запрос, наверное, потому что это для меня такой идеальный пример бизнеса, знаешь, где просто чуваки бабки зарабатывают. Вот по этому запросу, я уверен, многие бизнесмены отдали бы свою правую руку за то, чтобы оказаться первыми в результате поиска Яндекса. Ты так вздыхаешь, это, видимо, очень частый запрос, да?

  96. Максим Загребин

    Про пластиковые окна— это, по-моему, какой-то пример, который начали использовать когда-то на конференциях для демонстрации, и он у многих людей почему-то в голове осел. На самом деле, да, действительно, есть большое количество запросов, по которым бизнесы хотели бы, чтобы пользователь обратился к ним за этой услугой.

  97. Самат Галимов

    И у меня есть три конкретных вопроса. Что нужно сделать, чтобы оказаться первым по такому запросу?

  98. Максим Загребин

    Прийти и купить рекламу в Яндексе.

  99. Самат Галимов

    Окей, но как пользователь, у меня есть такая рекламная слепота, я хорошо пропускаю рекламу и открываю первую нормальную ссылку, не рекламную. Как вот там оказаться первым?

  100. Максим Загребин

    Действительно, на этом существует огромный SEO-рынок, который еще между собой делится на такой, на белый и черный.

  101. Самат Галимов

    SEO— это Search Engine Optimization, то есть оптимизация для поисковых систем.

  102. Максим Загребин

    Это люди, которые действительно помогают веб-мастерам или владельцам сайтов продвинуться в результатах выдачи.

  103. Самат Галимов

    Какие ухищрения для этого есть?

  104. Максим Загребин

    Белая SEO, он смотрит на твой сайт и говорит, ну что ж ты тут ключевые слова забыл сказать. Тебя будут спрашивать про пластиковые окна, а у тебя написано, что ты устанавливаешь алюминиевые стеклопакеты, профили или что-то такое. Помогает правильно расставить ссылки, он помогает улучшить сайт так, чтобы поисковая система с ним лучше взаимодействовала. Посмотрит и скажет, ну что ж ты сайт-мэп не создал. Но они действительно, это такие веб-мастера-эксперты, которые смотрят на сайт не только с точки зрения, не знаю, там, его дизайна, удобства для пользователя, но и с точки зрения удобства поисковой системы понять, что там действительно хороший контент. Черное SEO— это, по-моему, сродни voodoo-магии. Там люди клиентам рассказывают про то, что если в лунную ночь сделать что-то, то сайт поднимется выше. На самом деле, таких советов нет. Ну, в смысле, их не существует, и они ни на что не влияют. Влияет то, что ты долго присутствуешь на рынке, у тебя хороший бизнес, у тебя хороший контент. Ты, например, не только вывесил прайс-лист, но и пишешь какую-то информацию о там новинках, появившейся у бренда, новых технологиях. У тебя люди приходят на сайт не только в тот момент, когда им нужно заказать, а они, например, пытаются понять вообще, что есть нового в пластиковых окнах, потому что мы Ремонт делаем раз в 5-10 лет, как бы технологии не стоят на месте, и прежде чем что-то купить, ты вообще часто хочешь разобраться, как бы, какие есть хорошие бренды, какие есть новые технологии. И вот если сайт, помимо того, что он просто оказывает услуги, он делает еще какой-то контент-маркетинг, у него есть разные версии, например, под десктопную версию и под мобильную. На мобильную он не пытается показывать десктопную. У него есть контактная информация, люди, которые заказывали там услуги, потом оставляли хороший отзыв, говорили, блин, классные ребята, даже там, не знаю, накосячили, но потом все исправили, поэтому молодцы. Вот это вот все помогает долгосрочно показываться в результатах поиска выше.

  105. Самат Галимов

    Слово «долгосрочное» Я вижу, ты как бы оставляешь exit hatch, потому что прямо лично знаю чуваков, которые делают какие-то схемы, создавали какие-то сети огромные сайтов, однодневок, и каким-то образом за счет того, что они много раз прямо ссылались на какую-то страницу, поднимали эту страницу в результатах поиска. То есть такие прямо реально какие-то жесткие черные приемы использовали.

  106. Максим Загребин

    У нас есть большая служба, которая борется с людьми, которые пытаются так или иначе накрутить результаты поиска. И там можно выделить разные периоды. То есть в каком-то периоде, действительно, не знаю, 5 лет назад, это была закупка ссылок. Всем казалось, что если на твой сайт много других ссылается, то, наверное, он очень хороший, его надо показывать выше.

  107. Самат Галимов

    А это реально так работало?

  108. Максим Загребин

    Поисковая система, конечно же, обращает внимание и на количество ссылок, и на текст на ссылки, и то, какие сайты на тебя ссылаются. Например, если на твой сайт ссылается Википедия по какому-то запросу, то, наверное, твой сайт все-таки как бы несет какую-то полезную информацию, потому что Википедия очень заслуженный ресурс, там своя система модерации, там правки как бы отсматривают большое количество людей, ну и это хороший сигнал. Второе— это пользовательское поведение.

  109. Самат Галимов

    Ого, были чуваки, которые кликали много раз.

  110. Максим Загребин

    Да, они кликают, и роботы сейчас тоже очень сильно продвинулись. Они умеют и логиниться, и находить твой сайт в результатах выдачи, тем самым.

  111. Самат Галимов

    Кликать по нему. Да.

  112. Максим Загребин

    Есть люди, которые уже даже отзывы пишут от имени роботов, потому что считают, что это сильно повлияет на ранжирование. И это еще одно направление, в которое мы активно с этим боремся, потому что все отзывы на Яндексе мы на самом деле проверяем. и анализируем, кто их написал, правда ли он воспользовался услугами этой организации, сколько отзывов он за один день пишет. Ну, все сложные алгоритмы тут. Не могу вдаваться в детали, потому что все, что ты рассказываешь про то, как работают алгоритмы, тут же на другой стороне начинают использовать. Это работа, в которой вовлечены десятки людей, для которых это основная работа— сделать так, чтобы в Яндексе результаты, отзывы не накручивались, и там действительно были результаты, которые помогают людям, а не за которые кто-то заплатил деньги.

  113. Самат Галимов

    Получается, что задача не просто в том, чтобы сделать как бы штуку, которая хорошо работает, а ещё и параллельно как-то защититься. И это такая постоянная война, которую, ну, обычным пользователям незаметно, но вообще говоря, сложно себе представить. Вот почти на всех внутренних сервисах Яндекса есть поиск. Например, поиск товаров в лавке и в еде, поиск адресов в картах, поиск песен в музыке. И это все... Большой поиск Яндекса работает просто по части контента или это независимая система?

  114. Максим Загребин

    Смотри, у нас есть общая архитектура внутри Яндекса, на которой мы можем развернуть поиск для любого сервиса. То есть нет, они ходят не в тот же инстанс, не в ту же инсталляцию, через которую работает поиск, но она во многом опирается на те технологии, которые используются в большом поиске. И там, не знаю, наверное, 200 сервисов используют вот внутреннюю систему поиска. Там гораздо меньше документов. Ну, я не знаю, боюсь обидеть ребят из лавки, но там, конечно, количество товаров не сотни миллионов, а, ну, хорошо, если десятки тысяч. То есть задача попроще. Но всё равно под любую предметную область поиск нужно дообучать, потому что в товарах есть своя специфика, в музыке есть своя специфика. Есть проблемы омонимии, в которой ты на самом деле должен понимать, что это всё название песен или вот это название группы, а вот это вот название песни. А в товарах ты должен понимать, что бывает, не знаю, разная упаковка, бывают синонимы.

  115. Самат Галимов

    Конечно, когда я ищу помидоры, я ищу на самом деле помидоры, а не томатную пасту.

  116. Максим Загребин

    Да, ты ищешь помидоры и томатная паста, и они бывают разных сортов, и они могут называться даже не как помидоры, а просто как сорт. И они все еще будут, ну, релевантны по этому запросу.

  117. Самат Галимов

    На мой взгляд, все поисковые системы работают гораздо хуже, чем большой поиск Яндекс. Например, если в музыке набрать название песни и ошибиться одной буквой, то она тебе не выдастся. А в большом поиске он нормально, как бы, откорректирует и скажет, что вы, наверное, имели в виду вот это. Почему это так работает? Ну, в смысле, ты говоришь, что это одна и та же технология, но при этом я как пользователь вижу, что большой поиск радикально лучше меня понимает. Почему?

  118. Максим Загребин

    Ну, смотри, во-первых, они действительно основаны на одной технологии, но там нет такого большого количества запчастей, которые используются в большом поиске. Исправление опечаток, и поиск синонимов, и сложные модели на основе векторов. Части этих запчастей в поисках для сервисов может не быть. Это такой технический ответ. Более продуктовый ответ, что у многих сервисов поисковый сценарий, в отличие от поиска, он не единственный или даже не основной. Ну то есть в музыке все больше ты опираешься на рекомендации, то есть ты запускаешь приложение, нажимаешь одну кнопку «Включить мои рекомендации» и дальше просто едешь и слушаешь. Ну фокус, ребят, количество людей, которые работают в сервисах над поиском, их гораздо меньше, чем в большом поиске.

  119. Самат Галимов

    Вот я знаю четыре поискового движка. Яндекс, Google, Бинг от Майкрософта. Еще я слышал о китайском Байду. Я кого-то забываю или их реально четыре на весь мир?

  120. Максим Загребин

    Naver, довольно неплохой.

  121. Самат Галимов

    Как?

  122. Максим Загребин

    Навер. В Южной Корее?

  123. Самат Галимов

    Навер. Южнокорейский, окей. Еще я что-то про Чехию, по-моему, слышал. У них вроде что-то было, но... Seznam.

  124. Максим Загребин

    Я, если честно, сейчас сходу не знаю, сдались они под натиском Гугла или продолжают бороться, но какое-то время назад он точно был.

  125. Самат Галимов

    Просто ракеты в космос запускают больше стран, чем мы сейчас перечислили. Почему?

  126. Максим Загребин

    Ну, вспоминаем начало нашего разговора про то, сколько надо усилий для того, чтобы хранить интернет, его обходить, уметь понимать, что есть на странице. Во-вторых, мне кажется, это большая работа про то, чтобы действительно построить поиск с нуля. 20 лет назад в это пытались играть многие, с тех пор осталось какое-то количество глобальных и локальных игроков, И сейчас с нуля повторить все, что сделано этими игроками, настолько дорого, что это просто экономически невыгодно. Построить поисковую систему с нуля уровня Яндекса или Гугла, ну я боюсь, что практически невозможно. За это время мы сделаем еще более хороший продукт.

  127. Самат Галимов

    То есть вы уже убежали вперед достаточно рядом.

  128. Максим Загребин

    Да, и накоплено огромное количество данных и оценок асессоров, и статистики пользовательского поведения, и истории обхода интернета, знания всех ссылок. Это должен быть уже какой-то другой поиск. Возможно появится какой-то бодрый, смелый стартап, который придумает какую-то подрывную технологию, которая будет решать ту же потребность пользователя, но совершенно по-другому. И за счёт этого начнёт отъедать рынок, потому что вообще задача получения информации, она же вечная, она существовала там, не знаю, в Древнем Вавилоне, и она будет существовать после нас. Вопрос, как именно мы её решаем.

  129. Самат Галимов

    Скажи, пожалуйста, как ты сам стал руководителем поиска?

  130. Максим Загребин

    Я пришёл в Яндекс 10 лет назад, наверное. Мне, наверное, повезло собеседоваться именно в поиск, потому что тогда я не очень понимал разницу между разными сервисами Яндекса по их сложности, влиянию на жизни людей, и даже размера бизнеса. Но моим первым проектом был запуск поиска в Турции. И это был очень классный опыт, потому что за, не знаю, несколько месяцев я пришел в мае, а запустились мы в сентябре. То есть тебе за четыре месяца надо понять вообще, как поиск работает целиком.

  131. Самат Галимов

    В целом.

  132. Максим Загребин

    Да-да-да.

  133. Самат Галимов

    И повторить его просто на другом рынке.

  134. Максим Загребин

    Конечно, невозможно очень глубоко было погрузиться в каждую область, но про всё ты должен был подумать, и тебя ещё на запуске спрашивают. А вот про это ты подумал? А что вот это? А как вот это будет работать? Такой, блин, я вообще от вас первый раз это слово слышу. Пойду найду людей, которые за это отвечают, узнаю, что у них такое. Это позволяет, да, очень быстро получить очень широкий контекст. Офигеть.

  135. Самат Галимов

    Идеальная работа. Мечта просто. Знаешь, когда я был стажером в Яндексе, я слышал, что есть специальный отдел, который сравнивает качество поиска Яндекса с качеством поиска Гугла. Буквально, типа, там, смотрит две страницы и сравнивает, типа, что лучше. И помню, я нас очень гордился тем, что, типа, был всегда чуть-чуть лучше, чем Гугл по русскоязычным запросам. Эти люди до сих пор есть?

  136. Максим Загребин

    Да. Конечно, это... У нас есть большой отдел аналитики. Измерение качества поиска— их одна из ключевых задач. Всегда же интересно не просто как бы работать, а в таком соревновании участвовать. Если есть сильный конкурент, который вы такие бежите, он заставляет тебя бежать еще быстрее. Тут уже разговор не вообще про все запросы, но нам очень нравится находить какой-нибудь небольшой класс запросов, понимать, что а Google-то там, если не лучше, то хотя бы не хуже нас, и говорить, так, что это такое, давайте поймем, что же он такое умеет, как он это делает, вот, давайте тому же самому научимся. Мне кажется, это вообще очень хорошая на самом деле практика, смотреть, что классного придумали конкуренты, потому что, ну, таким образом у нас в целом индустрия развивается гораздо быстрее. Мы же не можем у них списать, мы не знаем, как они это делают, мы не знаем, какая у них метрика качества поиска, какие они алгоритмы во многом используют. Мы просто можем, как пользователи, во многом наблюдать, что вот здесь вот они объективно не хуже нас справляются и пытаться улучшаться в этом месте.

  137. Самат Галимов

    Посоветуй, пожалуйста, чего еще почитать о том, как устроен поиск, как он развивается. Это финальный вопрос, который я задаю всем гостям. Вот у тебя я хочу узнать про индустрию. На что можно подписаться? Телеграм-каналы, рассылки, я не знаю, почтовые или какие-то сайты есть?

  138. Максим Загребин

    Если ты спрашиваешь конкретно про поисковые системы, то мне кажется, проще всего подписаться на блоги и телеграм-каналы, и Яндекса, и Гугла, потому что мы довольно детально пишем о том, как у нас работают алгоритмы, инфраструктура. Ну, мы это делаем всё-таки немножко по-разному, поэтому там и там можно почерпнуть какие-то идеи.

  139. Самат Галимов

    А с чего стоит начать? Потому что если ты уже во многом шаришь, то, наверное, можно следить за новостями и как бы понимать, что ты в струе. Где как бы получить такой обзор на вот то, что я с тобой ещё пытался сделать, но, понять, что два часа и разговорный формат, вряд ли можно глубоко разобраться.

  140. Максим Загребин

    По-моему, есть такая базовая книжка, которую все читают рано или поздно, приходящие в поиск. Она называется «Введение в информационный поиск». Я сейчас не вспомню автора, но я смогу, короче, найти и показать. Вот она, многие базовые алгоритмы, начиная там с TF, IDF, про то, что Важна не только встречаемость слова в тексте, а то, насколько это вообще частотное слово. И если редкое слово встретилось в тексте, то это, скорее всего, гораздо более хороший документ, чем если там встретился предлог. Вот такие принципы она раскрывает и позволяет лучше понять и сложности, какие встречаются в поиске, и какие-то базовые идеи, которые мы до сих пор эксплуатируем. Классно.

  141. Самат Галимов

    Тогда ссылку на эту книжку и ссылку на блоги Яндекса и Гугла технические мы положим в описании к этому эпизоду. Кайф! Макс, спасибо тебе огромное, что ты пришел. Прям вообще офигенно.

  142. Максим Загребин

    Надеюсь. Пока!

  143. Самат Галимов

    Это подкаст Студии Либо-Либо. Специальный сезон с Яндексом выходит раз в две недели по вторникам. Над подкастом работали. Продюсер Павел Боровков. Редактор Юлия Яковлева. Младший редактор Ира Хант. Звукорежиссер Максим Асташов. За джингл спасибо Алексею Зеленскому.

Слушайте где удобно

0:00