0: Всем привет, меня зовут Роман. Я работаю сетевым инженером в компании яндекс. И сегодня я вам расскажу про то, как мы строим сети для наших суперкомпьютеров. Вы теперь уже знаете, что они у нас есть и для чего мы их используем. Поговорим про сети. Итак, поехали.
1: Начнём с того, что вообще посмотрим, какие, какие сети для суперкомпьютеров бывают. Чтобы построить сеть для суперкомпьютера, нужно из чего-то выбрать. Эта задача встала перед нами в конце 2020 года и чтобы лучше погрузиться в
2: Контекст. Давайте посмотрим на следующий слайд. Это топ системы эйчписи в мире и их разбивка по тому, какие технологии для интерконнекта они используют данные. Я взял с сайта экспат.
3: Что мы здесь видим? Синий цвет инфинибенд от меланокса инвидиа 65%. В общем то, можно сказать, что это доминирующая и лидирующая технология. В этом сегменте рынка также здесь присутствует омни паф.
4: Это технология от интела. Сейчас это отдельная компания. Корнелиус нетворкс очень похожа на инфинибенд. Здесь же Крей или слингшот тоже 14%. Технология от хьюитт пакерт всем известная.
5: И знакомый нам изернет лишь 1%. То есть доля изернета в этом сегменте сети минимальна. Окей, с технологиями разобрались. Вот они вот такие выбирать будем из этих дальше.
6: Пару слов про нашу философию построения суперкомпьютеров, как мы их будем строить с самого начала мы решили, что мы не будем строить 1 большой суперкомпьютер и как-то к нему что-то достраивать и растить его со временем. Нет, этот подход нам не подходит.
7: Мы решили, что мы будем строить кластеры фиксированного размера, и размер этот будет определён стандартным модулем нашего дата центра это 160 стоек и где-то 1 и 8 мегаватт электричества, то есть 1 кластер.
8: 1 суперкомпьютер не должен быть больше, чем вот такой вот сегмент. Почему так? Дело в том, что мы, наши суперкомпьютеры, эти кластеры используем как ресурс в облаке в нашем внутреннем облаке и фактически
9: Пользователь, когда и какую-то свою задачу что-то обучает, он не должен знать на каком суперкомпьютере это делается. То есть это просто ресурс. Ну и такой подход более удобен с точки зрения эксплуатации, когда у вас много маленьких кусочков 1 можно вынуть, что-то с ним сделать.
10: И вернуть обратно. Ну то есть эксплуатация здесь плюс
11: Углубимся в детали конкретная задача, которую мы решали при построении 1 суперкомпьютера, звучала так-то, что мы хотим построить интерконнект для минимум 100 серверов каждый сервер будет иметь 8 gpu nvidia 100 и.
12: 4 nick 4 сетевые карты для интерконнекта 200 же скорость. Также мы сразу решили, что хотим иметь максимальный размер кластера, предусмотреть масштабируемость до 250 таких нот в 1 кластере. Тут мы вспоми.
13: Вспоминаем ту картинку, которую смотрели в начале про технологии и понимаем, что они паф, нам не подходит, у него нет 200 жи слингшот, он только вышел 200 джи на тот момент и это было бы, наверное очень экзотично и не факт, что вообще бы заработало.
14: Вот и фактически выбирали мы из 2 изернет размер кубика 32 на 200 в тот момент доступен был и уже довольно давно вышедший инфинибенд hdr 200 гигабит давайте попробуем сравнить.
15: Технологии применительно к решению нашей задачи. Начнём с изернета спрос. Тут все понятно, все просто известная технология есть экспертиза, есть автоматизация, мониторинги. Все под капотом.
16: Все доступно, но также есть и минусы, и, на наш взгляд, они были довольно существенны. Главные из минусов, которые мы видели в изернет. Это отсутствие референсной конфигурации рокки для кластера такого размера, что
17: Собственно, мы видели на 1 картинке в топ, в топ 100 эйчписи только 1% использует технологию, изернет также здесь можно отметить, что в изернет нет таких востребованных в мире интерконнекта фичей, как адаптивный роутинг.
18: И редукция данных на свечах про них поговорим ещё чуть подробнее последствия теперь инфинибенд инфинибенд фактически все минусы, которые я перечислил для изернета, превращает в свои плюсы исполь.
19: Инфинибенд мы получаем фактически референсный дизайн эйчписи от nvidia у нас есть gpu nvidia, есть некий мелланокс и есть ещё инфинибендом.
20: Же адаптивный роутинг, готовый, работающий под капотом, и здесь же шарп шарп это протокол как раз для редукции данных на свечах тоже плюс минусы ну, минусы тоже, очевидно, новые для нас технологии.
21: Нет экспертизы, нет готового воркфлоу, нету мониторингов, нет ничего. Все надо строить с самого начала. Как вы, наверное, догадались, как я заспойлерил в названии своего доклада. Выбрали мы инфинибенд и про него.
22: Поговорим, соответственно, чуть подробнее. Давайте посмотрим, что у нас получилось для начала логическая топология логической топологии. Мы остановились на двухуровневом классе. Нам это показалось наиболее
23: Ну, во первых, очень референсная топология, так много, кто делает это популярно. Почему двухуровневый? Дело в том, что при таком радиксе 40 40 портов мы получали в двухуровневом классе порядка 200 портов 200 по
24: 200 серверов в нашей конфигурации, то есть 8 800 портов в сторону, в сторону серверных ников. Увеличение уровня клосса до трехуровневого приводило бы к тому, что сеть
25: Будет слишком дорогой и полностью трехуровневый Клосс мы не можем засунуть в 1 вот тот модуль, про который я говорил в самом начале. Дата центра, соответственно, 200 серверов это чуть меньше, чем мы хотели, меньше, чем 200.
26: Но точно больше, чем для изернета в такой же конфигурации, потому что радикс свеча изернет у нас был только 32, это меньше.
27: Логическая топология, все понятно. Окей, физические особенности и они здесь тоже есть. Дело в том, что сервер с восьмью гпу на борту потребляет много электричества, порядка 6 киловатт на 1 ноду и
28: При нашем подходе построения дата центров мы можем разместить только 3 таких ноды в 1 стойке. Соответственно, лиф коммутаторы не могут быть тор коммутаторами и надо их куда-то выносить. Соответственно, линки от Лифа до
29: Сервера будут длинными линками, дорогими линками, собраны на оптике. Окей, но мы очень хотели как бы быть эффективными в этом месте и хотели хотя бы где-то использовать короткие дешёвые линки. Для этого нам надо
30: Было сделать так, чтобы линки между лифами и спанами линки фабрики были короткими, что, собственно, мы сделали на этой картинке изображена фабрика сети инфинибенд.
31: Которые мы используем. 3 стойки. Рядом стоящие в центральной стойке собраны все спайн коммутаторы в боковых стойках лиф, коммутаторы, в которые приходят линки от серверов. Каждый сервер имеет 4 линка в 4 разных
32: Ну, то есть плановая конструкция, и эти линки между лифами и сплайнами мы сделали, да, кабелях двухметровых. Выглядит это, прямо скажем, страшно, очень некрасиво, неаккуратно, но эффективно с точки зрения вложения.
33: Вот стойки тоже пришлось чуть кастомизировать, они не совсем обычные. Ну так мы сделали впоследствии. Мы немного сгладили углы вот этой вот Страшной картинки и 1 из следующих кластеров, который мы запускали по этому дизайну.
34: Мы сделали вот так. То есть часть Линков внутри фабрики собрана оптикой и выглядит это гораздо более аккуратно, и даже двери закрываются у шкафов. Это важно. Окей.
35: Дальше поговорим про технологию. Собственно инфинибенд. Тема очень большая. Я не хочу распыляться. Попытаюсь заострить внимание на ключевых отличиях от привычного нам мира тисипи айпи и попытаться разобраться, за счёт чего же это?
36: Технологии является лидирующим лидером и на этом рынке давайте посмотрим на архитектуру инфинибенд выглядит все очень похоже на cp ip. Ну почти все также физический уровень даки аоки.
37: Трансиверы все есть линк Леер, и вот здесь начинаются различия дело в том, что на самом деле работа сетевого инженера при создании сети connect на
38: Технология инфинибенд заключается в большей части именно на этом уровне. Здесь мы оперируем локал айди так называемые Лиды, и их внезапно назначает сабнет менеджер. В этом месте мы вспоминаем, что инфинибенд это чистый диэн и без контроля.
39: Сеть инфинент работать не может. Вот сабнет менеджер это как раз тот самый контроллер сетевой уровень. Здесь все очень похоже на pieces like адрес почти также транспортный уровень кьюперс и
40: И в этом месте кьюперс объединяет в себе свойства и привычного привычных нам тисипи протокола, так как может работать в режиме с гарантированной доставкой и udp протокола как юзерских дейтограмм без, в общем то, Гаран.
41: Доставки в зависимости от режима кью ип могут работать и так и так. Аперле приложение это mpi message passing interface, эрдмей, протоколы можно ip over, ib даже запустить и работает.
42: Сабнет менеджер, в общем то, ключевая вещь в топологии инфинибенд сердце фабрики, что он делает, как я уже сказал, он назначает Лиды хостам и коммутаторам также.
43: Менеджер программирует таблицу форвардинга на коммутаторах инфинибенд линер, форвардинг, тейбл лфти тоже все делает сабнет менеджер и scale 1 сабнет менеджера позволяет ему обслуживать до 48000 юникасх Ледов.
44: 16000 мультикас ных Ледов. То есть в общем то нам до этого скейла очень далеко, у нас все гораздо проще дальше как вообще запустить сабнет менеджер какие у нас есть варианты, чтобы все это вот настроилось 1 вариант
45: Это запустить start. Менеджер на управляемом коммутаторе подходит для небольших инсталляций, но нам этот вариант не подходил с самого начала, потому что мы выбрали опцию с использованием ИНН коммутаторов, которые не имею.
46: Операционной системы не имеет ауто бенд менеджмент и процессора, и единственная связь с ними это поддерживается через контроллер. То есть мы не могли на наших коммутаторах запустить саббат. Менеджер вычёркиваем, остаётся 2 опции.
47: Open см. Модуль входит в библиотеку в пакет стандартный меланокса Фетт можно скачать сайта мелланокс свободно, и вендорский контроллер там тоже есть open см. Но со всякими дополнительными опциями.
48: И историями выберем из 2. Соответственно, здесь важный момент. То, что при запуске нашего 1 кластера мы были довольно сжаты во времени и хотели запуститься как можно быстрее. То есть у нас не было вре,
49: Именно какие-то исследования нам хотелось включить, и чтобы это уже начало работать, и наши пользователи считать данные на кластере и в таком варианте open см. Нам не очень подходил, потому что единственное источник данных
50: В такой конфигурации о состоянии сети. Это консольная утилита айби дагнет, которая сложно выводы. И нам хотелось иметь, в общем, мониторинги, готовые и какие-то визуализации сети. Все эти возможности нам как
51: Раз давал вендорский контроллер есть визуализация сети мониторинги даже rest api все классно выбрали окей, едем дальше и дальше поговорим про роутинг фабрики.
52: Bad наверное, 1 из наиболее интересных тем для сетевых инженеров, как работает маршрутизация в сети инфинибенд, и начать я хотел с вот такой особенности кредит, Бейс, флоу контрол.
53: Контрол, казалось бы, это не связанная с роутингом тема, но на самом деле она связана. Вот что это такое кредит, Бейс, флоу, контрол это механизм сети инфинибенд, который призван гарантировать
54: Доставку пакета к сети инфинибенд. Не будучи потерянным даже при наступлении конешн, очень звучит очень классно. Это прям то, что нам нужно не терять пакеты. Это, это классно как это работает линк.
55: Получатель выделяет буфер линку отправителю на свой входящий буфер, кредиты на него. И пока такой кредит не будет выдан, передача пакета не происходит. Все это работать должно, соответственно, очень быстро. Ну, факти.
56: Со скоростью интерфейса, чтобы это имело какой-то смысл. Окей, запомнили эту особенность и теперь, собственно, про роутинг.
57: И routing фабрика инфинибенд, алгоритм роутинга определяется его топология, то есть фактически в зависимости от того, какую топологию вы построили, вы используете тот или иной протокол если у вас торус, отлично, нажмите 1.
58: 3 здорово, есть несколько алгоритмов на выбор можете выбрать из них dragon fly тоже не проблема, для dragon fly свой свой алгоритм, поскольку у нас была фабрика фабрика.
59: Построено на топологии Клосс фа 3 это то, что нам нужно, и постараюсь рассказать вкратце про протоколы, которые здесь доступны. 1 протокол минхо это дефолтный протокол.
60: Роутинга для фабрики инфинибенд может работать в любой топологии. И принцип максимально простой. Количество Хопов, в общем то, метрика, ну как в привычном нам рип протоколе, но есть 1 нюанс. Дело в том, что
61: То в кольцевой топологии может возникнуть такая ситуация с кредитами, которые вот те самые кредиты, которые флоу Бейс контрол, когда кредит на буфер не будет выдан по кругу. И это, в общем то, приведёт к дедлоку так называемому
62: Когда передача данных в сети замирает, все это хендлится таймерами, он потом как бы оживёт и начнёт обратно передавать пакеты. Но это не то, что нам нужно, это не то, что мы хотим и
63: Следующий протокол апдаун и far 3 ф. 3 в общем, эту проблему решают и решают они её следующим образом мы назначаем в нашей топологии фа 3 вершину дерева корневыми коммутаторами в на.
64: В нашем случае это коммутаторы спайн уровня. Все вот наши 20 коммутаторов спайнов мы назначаем корневыми и после этого считаем валидные и невалидные пути в нашей фабрике. Мы можем в нашей фабрике перегибаться строго вверх вверх.
65: А потом вниз, просто вниз, но не можем вниз, а потом вверх. То есть фактически роуд, который идёт через спайн лиф, а потом спайн будет невалидным. То есть, опустившись на лиф, на spine, мы подняться уже не можем, и это, в общем то, решает.
66: Проблему петель и выбираем мы, соответственно, 2 этих протокола 1 основной это 3 и фулбэк на down, но это ещё не все про роутинг здесь.
67: Давайте поговорим про фичу, которую я упоминал в начале адаптивный роутинг, что это такое здесь наверное уместно провести аналогию с equal cost мультипас, который мы используем в интернет сетях и в общем то это очень.
68: Востребованная фича в дата центрах, но не простой исипи это умный сими дело в том, что switch может принимать решения и быть арбитром в данной ситуации, принимать решение, в какой порт отправить пакет на основе его загрузки, то есть он.
69: У нас есть сколько-то портов с одинаковым путём, с одинаковой метрикой, которую можем отправить, но мы отправим в тот, в котором загрузка меньше. Соответственно, это во многом предотвращает конешн и
70: Вообще звучит классно, естественно, мы это включили. Включается это тоже через сабнет. Менеджер выбирается алгоритмы, после этого сабнет менеджер, провижинит фабрику и включает адаптивный роутинг на всех коммутаторах, которые поддерживают эту технологию.
71: И после этого коммутаторы строят адаптив роутинг группы. Ну, в нашем случае это деревья, потому что топология в 3 и, соответственно, форвардят по этим группам на основе вот загрузки портов в пакете.
72: Итого мы имеем финальную конфигурацию. Ой, сорри.
73: Финальная конфигурация выглядит так. То есть есть 2 файлика в 1 мы указываем, какие протоколы мы используем адаптив 3 far 3 и адаптив роутинг даун и файлик с корневыми коммутаторами это spy, наш спайн коммутатор.
74: Это, собственно, все так работает форвардинг. Вот бы интерас милс ПИН. Так можно было настроить вот 2 файлика, пару строчек и все. Но нет, здесь же хотел рассказать вам про шарп.
75: Это как раз та самая редукция на свечах. Что это такое шарп, не вдаваясь в архитектуру асиков и коммутаторов? Скажу, что на асике для.
76: Band есть специальное арифметическое логическое устройство, и есть специальный буфер памяти, и это арифметическое логическое устройство и память предназначено для того, чтобы считать пользовательские данные, то есть мы можем послать какие-то данные коммутатору, он их посчи.
77: Thai пошлёт дальше звучит немножко фантастически, но это работает на самом деле. Для чего это нужно дело в том, что при обучениях мэшин ленинг очень востребованы бывают такие операции как reduce reduce сол, ну не только.
78: Эти, на самом деле их много. И такой подход позволяет иметь существенный выигрыш в комплишен тайм и в летенси, по, используя такой подход. Соответственно, нам надо, чтобы наши ноды послали данные.
79: Свечу, он их посчитал и эти данные отправил куда-то дальше, чтобы все это рассказать свечу, что ему нужно сделать, используется протокол, шарп.
80: Вот на моей диаграмме синие звёздочки это как раз ноды, где может происходить редукция. Фиолетовые звёздочки это ноды, которые участвуют в вычисления. То есть мы делаем редукцию на лифах, что-то считаем, отправляем эти данные спайну. Спайн их тоже считает и после этого посчитанные данные
81: Отправляет туда, куда мы ему скажем, может быть всем, кому-то, всем, всем нодам, участвующим в джобе, может быть какой-то конкретной. Это довольно сложно. Много деталей вот настраивается, это довольно, ну, с точки зрения сети.
82: Не очень сложно, на каждой ноде запускается специальный демон и специальный демон агрегейшн менеджер запускается на мастере, сабнет менеджера, который, в общем то, рассказывает коммутаторам, что нужно делать с данными и как это работает.
83: Не вдаваясь в подробности, потому что тема на самом деле очень большая и я думаю, ей можно посвятить отдельный доклад, много деталей. Скажу лишь, что мы проводили эксперименты на 6 4 машинах, наших нодах и видели профит до 20% на отдельных видах.
84: Операции. В целом эти данные коррелируют с тем, что мы видим, видели, видели в исследованиях этого протокола в интернете, какие статьях публиковались, и, в принципе, они есть. И главное, здесь мой поинт в том, что это работает, это реально.
85: Плюс технологии инфинибенд. Более того, можно сказать, что индустрия в целом смотрит в эту сторону и есть драфты для изернета, для реализации такого же функционала самой реализации пока, насколько я знаю, нет, но драфты уже
86: Есть, так что ждём и надеемся.
87: И дальше возвращаемся к нашим таким мирским делам, которым, в общем то будням сетевого инженера. Как понять, что сеть инфинибенд работает так, как должна работать, как мы ожи?
88: И начинаем тестировать сеть. Мы на самом деле при тестировании самой ноды. То есть здесь наши коллеги придумали такую довольно классную задумку делать коммутации внутри ноды между
89: Вот этим нашими 4 интерфейсами интерконнект запускать локальный open см. С дефолтным конфигом и прогонять тестовый бенчмарк собственно таким образом мы проверяем всю ноду, что у неё работает gpu что с писием все хорошо и.
90: Сетью тоже, потому что данные по сети тоже в такой случай будут ходить отлично. Нода исправная. Ставим её в кластер. Как понять, что все хорошо сетевому инженеру, что у нас есть, мы можем
91: Посмотреть состояние портов, что лампочки горят, посмотрели, лампочки горят классно. Можем запустить пинк. Здесь такая штука тоже есть. Запустили, работает, пакетики ходят классно. Можем.
92: Померить летенси бендиш между 2 нодами ну что-то типа i перфа условно померили классно, и когда мы запускали наш 1 кластер, мы в этом месте остановились, мы подумали, что вот мы все сделали, ну вроде нормально, да, похоже.
93: На правду. Но на самом деле это было не лучшее наше решение. Впоследствии, когда мы запускали следующие наши кластеры по этому дизайну, у нас было чуть больше времени, и мы решили сделать замеры для топ.
94: Pc и в общем то коллеги из вендора нас тоже всячески подталкивали померить производительность кластера лингпа ом и это самый правильный способ тестировать сеть, как мы поняли для себя это тестировать.
95: Не сеть отдельно, а тестировать весь суперкомпьютер целиком. Это позволяет понять всю его какие-то производительности и найти много проблем. На самом деле мы это нам очень сильно помогло, не только с сетью. Другие проблемы.
96: Же так нашли, что такое линпак линпак тесты можно запустить на всем кластере, можно запустить на каком-то Куске каких-то ограниченных количестве нот. Работают 2 фазы есть в его работе. Это когда
97: Работает gpu и сеть одновременно, и когда gpu отдыхает, и мы пересылаем данные по сети, собственно смотрим на загрузку так мы заметили при тестировании, что, в общем,
98: Прогресс нашего обучения и утилизация сети растёт как-то нелинейно, как должна быть, а как-то очень хаотично вверх вниз. Наши эксперименты с роутинг энджином довольно быстро привели нас к той мысли, что проблемы возникают.
99: При использовании адаптивного роутинга, если его выключить, становится все, все как бы ожидаемо, как это часто бывает у сетевых инженеров. Такие вот загадочные непонятные проблемы лечатся апгрейдом софта, что мы, собственно, и сделали про
100: Видели все здорово стало все в рамках того, что мы ждём отлично, но у нас есть ещё кластер, который мы запустили, самый 1, и у который вот этот баг, он там живёт, скорее всего, для него мы делаем это windows и здесь
101: Есть тоже свои особенности. Дело в том, что наш подход, который мы используем в основной сети при апгрейде, переходе на новый софт, он неприменим. То есть, когда мы апгрейдим Ван бай Ван коммутатор, здесь так делать нельзя. Нужно апгрейдить весь коммутатор целиком и
102: Более того, нужно апгрейдить сразу и nicki у хостов, потому что это связанные вещи, и желательно перед тем, как все это проагрейдить, прочитать внимательно релиз нот, что ваши Ники, ферма ваших ников совпадает с fermare ваших коммутатор.
103: Если не совпадают, на самом деле, можно поймать очень такие малопонятные явления и которые очень сложно дебажить. В общем, мы все это сделали, проапгрейдили и наш кластер Липунов + 35% производительности.
104: На самом деле, это не совсем честно сказать, что все это было из за адаптивного роутинга, потому что там были другие доделки и косвенно, наверное, баг в адаптивном роутинге можно было оценить где-то порядка 10% перфоманса, где-то так мы оценили.
105: Вот последнее, о чем хотел вам рассказать, это про мониторинги. Как мониторить сеть инфинибенд, как мы это делаем в яндексе и что у нас получилось здесь сначала.
106: С того от общего подхода к мониторингу сети в яндексе дело в том, что мы делим мониторинг физических ошибок в сети между 2 командами за мониторинг от сервера до Лифа или дотор коммутатора, отвечает команда.
107: Dicey она умеет выводить ноды, если она сломалась, чинить их, возвращать обратно для этого есть все механизмы, есть автоматика, которая разгружает машину и отдаёт её команде дата центров.
108: И в общем то, для infinity бэндов мы хотели сделать тоже самое то, что линки лиф сервер мониторит айтиди все, что выше по фабрике, мониторит нок для случая сервер лиф, тут все довольно просто, мы дописали.
109: Логику парсинга ошибок инфинибенд в наш хардварный агент, который работает на всех серверах яндекса и мониторит хардварные составляющие серверов при возникновении ошибок на интерфейсах инфинибенд. Точно также
110: Загорается лампочка ноды, выводится в мейтененс, даётся тикет, ноды чинятся, но что делать с линками фабрики? И здесь мы вспоминаем про нашу утилитку айби дагнет, которую я упоминал в начале кото
111: Может генерить отчёты о состоянии всей фабрики инфинибенд со всеми счётчиками, каунтерами, состоянием портов и все, что можно туда засунуть. Единственный минус всего этого, это очень сложная читаемость.
112: Информация, потому что отчёт выглядит довольно. Он очень большой и непонятные вот эти нолики единички, которые я привёл. Вот он примерно весь такой, но нам повезло. В яндексе есть программисты, они могут написать код и
113: И как-то привести эту информацию к какому-то структурированному ввиде, ввиду, что мы, собственно, и сделали, запуская эту утилитку раз в 30 секунд и парсить этот отчёт, мы можем экспортировать данные с визуализации сети инфинибенд в нашу инфру в такую же
114: Которую мы используем для нашей основной сети. Ну и не только для сети. Вообще там много для чего используем для наших сервисов, что мы, собственно, и сделали разрешение данных 30 секунд. Визуализация в нашей инфре готова. Теперь мы
115: Можем посмотреть на загрузку интерфейсов. Ну вообще, что происходит в сети.
116: К этой информации мы можем накрутить наши алерты, которые будут в случае проблем прорастать на те же дашборды, что и проблема основной сети яндекса сети изернет айпи, мы это все сделали.
117: То есть фактически мониторинг работает по тому же воркфлоу, как и работает для основной сети. И здесь мы вспоминаем вот тот слайд, когда мы выбирали, что же нам, как же нам использовать open сэм или вендорский контроллер.
118: Эта мысль на самом деле в нас жила с самого начала, мы её вынашивали, но как бы не сразу пришли к реализации последний кластер по Такому дизайну, который мы строили, мы решили запустить сразу на open см. Без
119: Контроллера. То, что мониторинги у нас свои, есть, сразу скажу, что по performance мы не заметили никакой разницы. Выглядит кластер работает. В общем, точно так же. Мониторинги у нас свои. Поработав так где-то, пол
120: Года мы решили, что остальные наши кластеры мы тоже мигрируем и будет единая-ка унификация все управляющие сервера сети инфини сейчас работают на open семе и не используют лицензируемого вендорского
121: Ну, профит, по моему, тут очевиден. Это отказ от лицензированного по лицензии имеет такое свойство как кончаться, так мы, собственно, и живём с инфинибендом сейчас фабрики это все, что я хотел вам про него рассказать.
122: В заключение хотел рассказать немного про наши эксперименты. Дело в том, что мы не замыкаемся, мы не останавливаемся этом месте, мы не говорим, что вот мы нашли какую-то там серебряную пулю и живём с ней. Нет, мы
123: Думаем о будущем, и, возможно, в будущем наш подход изменится. Так мы проводили тестирование 200 гигабитного изернет кластера на меньшем скиле где-то 64 машины и
124: И в общем то, performance был ожидаемо хуже, чем инбанд, где-то порядка 10% ну это было, в общем то, и так понятно, но в целом можно сказать, что на таком в таком размере кластера изернет интерконнект тоже работает, и с этим, наверное, можно жить.
125: Вопрос, как мы будем строить кластеры в будущем? Он в общем то открыт, мы о нём думаем и, возможно наш подход изменится. У меня. Все, спасибо.
126: Спасибо, Рома. Спасибо большое. Так, спасибо большое. У нас небольшое время на вопросы остаётся, верно? Да. 1, 2 вопросика точно есть время.
127: Добрый день, Георгий Меликов, вк. Клауд, вы то, вы говорили про то, что вы все-таки смотрите на интернет решения, то есть какие фатальные недостатки, недостатки инфинибенд, все-таки для вас есть инфинибенд, ну, фатальные недостатки.
128: Фатальным. Это, я бы сказал, что это особенность, это моновендорной, во первых, и тут могут возникнуть некоторые проблемы.
129: Я бы сказал, что это главный недостаток, потому что мы смотрим на другие технологии. Ну, плюс рынок изернета гораздо больше, он может быть чисто экономически более эффективный. То есть цена за порт инфини бэнда может быть дороже, чем цена за порт изернета, например. То есть хотим дифференцировать, чтобы выбирать
130: Вот ну конечно, если говорить про какие-то уникальные топологии, то это наверное только инфинибенд. Вот для hpc только если это большая топология, то скорее да, потому что в общем то индустрия движется в эту сторону и
131: Больших топологий для изернета скорее редкость. То есть если кластер не такой большой, то изернет, да, применим. Тут можно ещё посмотреть. Вот где я брал картинку топ 500 топ 100, там же есть картинка топ 500 и там доля изернета на самом деле гораздо больш
132: Чем в топ 100, то есть кластера поменьше на изернет строят.
133: Павел Кузин, петербург пакт. Вопрос, то вот если отбросить коммерцию, да, почему с точки зрения технической вы выбрали инфинибенд сейчас там
134: Для изернета есть 200, есть 400, уже есть 800 гик на порт, да, коробки тоже не проблема. Ецмп, оверлей вам организует сколько угодно, куда угодно.
135: El 2 сегмент по оверлею тоже не проблема есть какие-то ноу хау в инфинибенд, которые невозможно реализовать в изернет ну я перечислял как бы например, тот же адаптивный роутинг в изернет нету.
136: Плюс в инфинибенд в принципе коммутатор в латенси ниже чем у изернета это на самом деле очень важно в этой для hpc и ну шарп шарп вот например в изернет сейчас нету и когда будет ну точно.
137: Не знает, наверное, его там довольно сложно будет реализовать ещё. На мой взгляд, шарп даёт порядка 10% преимущества. Плюс адаптивные топологии позволяют прям сильно сильно снизить стоимость решения общего за счёт того, что не нужно делать то же количество
138: Линков, то есть не нужно по всем уровням делать сеть без переподписки. Это прям сильно снижает стоимость. Ну да, если большой кластер, то поэтому инфинибенд, в общем то, так и популярен в интернете, так эффективно не получится использовать, он на 2, на 3
139: 3 ряду. Угу.
140: Скорлов Тимур самокат. У меня вопрос по поводу апгрейда на будущее. Что если, к примеру, вы найдёте технологию более лучшую, чем инфинибенд, то старое оборудование вы будете апгрейдить или
141: Вы будете новые кластерах? Я понял вопрос. Я думаю, что старый кластер мы апгрейдить вряд ли будем. Это как бы вот построены Азис, и ничего с ними делать. Можно только дополнить, где есть место, потому что у нас
142: Кластера не все полные ёмкости и можно туда добавить грубо говоря, ещё gpu карточек гпу серверов. А чтобы поменять сеть, мне кажется это экономически будет мало целесообразно, то есть новый, если будет новая технология, построить новый кластер на ней, да?
143: Это ок. Грейдить старый. Думаю, нет. Давайте буквально последний вопрос. Последний ряд. Спасибо за доклад. Егор дид Москвы. Вы говорили про адаптив роутинг и упомянули, что там
144: Балансировка происходит на в зависимости от нагрузки Линков, да? А что делать с реодинамика, как он влияет на инфинибенд стек? Очень хороший вопрос на самом деле.
145: Это долгое время было препятствием для реализации адаптивного роутинга и в спецификации, когда инфини в 2000 году было, уже говорили про адаптивный роутинг, но реализации не было, и решение здесь в том, что мелланокс запатентовал свой алгоритм и, по моему, в карточках.
146: Коннект икс 5. Может быть, чуть раньше. Боюсь соврать, они сделали это, в общем то, ready хендинг реодинамика. Собственно, после этого адаптивный роудинг и полетел здорово.