ym104432846
Вставьте ссылку на видео из Youtube, Rutube, VK видео
Задайте вопрос по видео
Что вас интересует?
00:00:32
Big Data и концепции хранения данных:
  • Появление концепции Big Data началось примерно в двухтысячных годах, связаны с новыми технологиями хранения и обработки огромных массивов разнородной информации
  • Основные характеристики Big Data включают объем (volume), разнообразие форматов (variety), скорость поступления и накопления данных (velocity)
  • Для повышения точности анализа данных предложено добавить характеристику достоверности (validity)
00:07:34
Основные виды данных и их особенности:
  • Обсудили три основных типа данных: структурированные (табличные), полуструктурированные (xml/json, файлы с известной структурой, но вариативностью полей) и неструктурированные (видеопотоки, потоки данных сенсоров, открытые источники)
  • Подчеркнули сложность работы ранее с полуструктурированными и неструктурированными данными из-за отсутствия поддержки классических СУБД, однако современные системы позволяют эффективно решать подобные задачи
  • Определили понятие больших данных («биг дата») как любые объёмы информации, превышающие возможности стандартных инструментов хранения и анализа, характерные для крупных компаний
00:12:20
Архитектуры обработки больших данных:
  • Принято решение объединить дистрибутивы компаний Cloudera и Hortonworks в один продукт под названием Cloudera (предположительно)
  • Определён принцип работы
  • В архитектуре HDFS (Hadoop Distributed File System) данные хранятся на нескольких узлах (data nodes), обеспечивая высокую отказоустойчивость благодаря наличию трёх копий одного блока данных
  • Name node хранит метаданные о расположении блоков данных и обеспечивает управление системой
  • Ярн (YARN) выступает в роли оркестратора ресурсов кластера, распределяющего задания по узлам и контролирующего выполнение процессов
  • Выделены ключевые технологии и инструменты
  • Apache Spark — современный фреймворк распределённых вычислений, позволяющий эффективно решать задачи анализа больших данных
  • Kafka — инструмент для обмена сообщениями в реальном времени, обеспечивающий обработку огромного числа событий ежедневно (до 180 млрд сообщений/сутки)
01:17:27
Data Lake и его отличия от традиционных хранилищ данных:
  • В дата-леях данные загружаются целиком без предварительной обработки, и преобразуются лишь по мере необходимости
  • Преобразование данных в дата-лее начинается непосредственно перед использованием (например, при запуске отчёта или анализе)
  • Основная проблема дата-лей заключается в риске превращения их в неэффективное хранилище («болото»), если данные будут загружаться хаотично и без цели
01:22:14
Современные модели данных и методы их проектирования:
  • Обсуждались различные подходы к проектированию модели данных (подходы Билла Инмана и Ральфа Кимболла)
  • Рассматривалась концепция Data Vault (Data Vault), включающая три основных типа таблиц: Hub (список ключей), Link (связь двух сущностей) и Satellite (описательные данные)
  • Упоминалась возможность параллельной загрузки данных и высокая скорость модификации и добавления новых сущностей в хранилище данных, особенно на примере компании Авито
01:33:33
Методы загрузки и трансформации данных:
  • 1. Экстракт данных представляет собой процесс извлечения, преобразования и агрегирования исходной информации в нужную структуру или модель данных
  • 2. Лот данных является этапом загрузки полученных данных непосредственно в хранилище
  • 3. В подходе Salty данные изначально загружаются в хранилище, после чего выполняются операции преобразования прямо на месте
01:34:59
Лямбда и Капа архитектуры обработки данных:
  • Разработана новая архитектура обработки данных (кап-архитектура), позволяющая загружать и обрабатывать данные в реальном времени, сохраняя всю историю изменений
  • Предложена возможность параллельного запуска новых версий алгоритмов расчета данных, позволяя обновлять расчеты исторических данных и переключаться на новые потоки реальных данных
  • Обсуждается необходимость мощного сервера для обработки больших объемов входящих данных, поскольку существует риск возникновения узких мест при увеличении нагрузки
01:40:36
Искусственный интеллект и машинное обучение в больших данных:
  • 1. Рассматривается возможность применения алгоритмов машинного обучения и искусственного интеллекта для прогнозирования поломок оборудования
  • 2. Внедряется модель обработки данных с датчиков в режиме реального времени для диагностики неисправностей
  • 3. Обсуждается потенциал развития технологий искусственного интеллекта и нейронных сетей, однако отмечается недостаточная зрелость современных решений в области полноценного ИИ
01:42:27
Управление данными и обеспечение безопасности:
  • Обсуждались методы обеспечения безопасности данных, включая шифрование каналов связи и шифрование хранения данных
  • Предложена возможность разграничения доступа пользователей через ролевые модели и политику доступа, интеграцию с корпоративными системами (например, Active Directory)
  • Подчеркнута важность контроля над данными как активом предприятия, способным приносить прибыль
01:47:12
Выбор инфраструктуры для обработки больших данных:
  • Рассматриваются три варианта размещения платформы: локальное оборудование предприятия (классический подход), аренда серверов в облаке (дешевле, гибкость масштабирования, риски безопасности) и гибридный вариант (часть данных хранится локально, другая часть размещается в облаке)
  • Гибридный вариант предполагает интеграцию облака с внутренней инфраструктурой компании, что требует решения вопросов безопасности и открытия доступа к данным
  • Обсуждаются преимущества и недостатки каждого подхода, включая стоимость владения, безопасность данных и возможность быстрого масштабирования ресурсов
01:52:14
Платформы и инструменты для больших данных:
  • Обсуждаются различные подходы к организации инфраструктуры обработки данных (инфраструктура, гипервизоры, middleware, платформы)
  • Рассматриваются три уровня предоставления сервисов: инфраструктура как сервис (IaaS), платформа как сервис (PaaS) и программное обеспечение как сервис (SaaS)
  • Упоминаются преимущества и недостатки различных подходов к разработке и поддержке программного обеспечения (open-source vs коммерческое ПО)
0: Что такое бигдата, что такое 3, 4, 5, 10 в их, на самом деле, по моему, сейчас уже под их может быть 47, как бы на каждый чих люди придумывают новую ви в big data. Вот что такое вообще данные, что такое структурированные?
1: Полуструктурированные, неструктурированные, как это все хранится, обрабатывается. Вот. И вот ещё, да, вот как раз то, что вам уже рассказывали, насколько я помню, вот как раз, что такое лям архитектура, потому что это на самом деле очень, очень, очень тесно связанное. Понят.
2: С big data ну кстати, data lake тоже вот собственно бигдата это не сами данные, это просто, как я уже говорил, просто какой-то концепт, вот и данные.
3: Они как бы для каждой компании понятие большой своё, то есть для кого-то, для кого, для какого-нибудь там небольшого банка, там, не знаю, там 5 терабайт, это уже огромные данные, а для какого-нибудь, допустим, ростелекома кластер.
4: На десяток петабайт это, ну, ну, так, средненький кластер. Вот, собственно, что ещё связано с большими данными? Это, собственно, как раз просто новые технологии, которые появились там, в, там, ну,
5: Где-то начали где-то в двухтысячных появляться, то есть технологии, отличные от классических революционных баз данных, совершенно новые подходы, новые алгоритмы, собственно, ещё очень тесно.
6: С этим связано понятие как раз-таки машинного обучения, дата сайнса искусственного интеллекта, потому что в кой то веке это стало возможно все это хранить, обрабатывать. Вот, и как-то с этим просто стало возможно жить.
7: Вот. Ну, собственно, источники, да, это как классические революционные системы, вот так и совершенно новые вообще вещи, как открытые какие-то соцсети, твиттер, не знаю, не знаю, вконтак.
8: Практик любые клики на веб сайте вашей компании это все стало возможно тоже собирать, хранить, обрабатывать.
9: Вот также как раз ещё 1 из новых совершенно источников, это интернет сенкс, это всяческие датчики, это всяческие системы, не знаю, там на предприятии работающие какие-нибудь станки.
10: И вот, не знаю, всяческие детекторы, термометры, вот все, что вот вообще может быть с этим связано, это тоже стало возможно теперь обрабатывать и хранить. Вот, ну, в том числе ещё точно также.
11: Допустим, вот по поводу научных данных, это, ну, например, не знаю, там тот же самый какой-нибудь большой адронный коллайдер, там, насколько я знаю, там, за 1 запуск генерит, там, че то там, несколько, несколько терабайт или, может, под питаба просто данных за
12: Чисто за 1 вот прогон, Бо вот это тоже как-то надо все хранить, обрабатывать. Это тоже как связано с это тоже в общем то большие данные.
13: Вот собственно 3 we, когда вся эта тема с бигдатой появилась изначально, было 3 v. Как раз-таки это volume врати и velocity вольюм, ну это понятно, просто объёмы.
14: Это просто конский объём информации, который надо хранить, это, собственно, 1 из проблем, 2 v. Это врайте, это данные могут быть совершенно разнообразного формата, они могут быть абсолютно не структурированные, вот они.
15: Это может быть изображение, не знаю, какие-нибудь там с видеокамер, вот то, что сейчас в Москве внедряется распознавание лиц на улицах, например, вот все это как-то все это не укладывается в стандартную сбд, какую-нибудь там, не знаю, оракал или постгес, все это надо как т.
16: Придумывать че с этим делать, как это все хранить и собственно 3 v основное это velocity вот велосити ну это просто скорость с которыми они скорость с которой у нас данные поступают и накапливаются в идеале конечно все это надо накапливать хранит.
17: В реальном времени. Ну, это, конечно, в идеальном мире, на самом деле так просто не всегда может получиться, но очень хотелось бы. Вот. Но со временем люди начали понимать, что на самом деле 3 вим недостаточно. Вот, поэтому
18: Они начали думать, давайте сделаем 4. Ви, пусть это будет вераст версити, ну, там это условно достоверность. Данные, которые, которые поступают из разных источников, они в той или иной степени все отражают какое-то реальное состояние.
19: Вещей. Вот, и они все являются там неким срезом истины. То есть вопрос достоверности данных и то, насколько они отражают истину, люди решили сделать 4 ви больших данных.
20: 5 v value данные могут иметь разную ценность допустим, тот же самый какой-нибудь кликстрим с веб сайта может быть абсолютно не важен какому-нибудь, не знаю, банку, но.
21: Очень важен, например, в яндексе. Ну, как бы это просто вопрос использования основного продукта. Например, дальше реабилити. Данные могут как бы просто структура.
22: Формат, их состав, содержание, они могут с течением времени меняться. Это нормально, это нормальный ход вещей, это есть
23: Господи, какая это уже 5, 7, 7, ви венью распределённая. У данных могут быть разные владельцы. Это тоже важно. Это, собственно, это тесно пересекается с управлением данными. Дата гаверно ва.
24: По моему, про это будут рассказывать или уже рассказывали, что там ещё есть.
25: Валидность данных. Данные могут быть, как уже говорилось, они могут быть совершенно разные, они могут иметь различную ценность, они могут быть разного качества, они могут быть мусорные, они могут быть очень чётко отражающие какую-то объективную действительность, могут быть не очень
26: Хороши. Это тоже надо учитывать, тоже надо понимать. Соответственно, надо решать вопросы их какой-то очистки, валидации, ну и просто приведение к какому-то человеческому ввиду веб. Вот даже
27: Дальше уже начинается небольшая дичь, потому что, как я уже сказал, дошло до, по моему, 47 ви или че то такое. Вот. Больше я ещё не видел, но, скорее всего, вы увидите чуть побольше. В смысле, чуть попозже вы увидите ещё больше 50, я думаю, 100.
28: Спокойно, это может быть вот данные могут быть всяческими справочными. Это тоже надо понимать, как бы тоже надо держать в голове, что там какой-то там, не знаю, там система энси, нормативно справочной информации.
29: Или какие-то общие справочники, тот же самый, не знаю, фиас кладер, который сейчас уже никому не нужен, эти данные тоже важны. Их тоже может быть очень много, как бы с ними надо тоже что-то делать. Вернес, господи.
30: Собственно, данные могут как раз, ну, как я говорю, это данные могут быть мусорными. Это на самом деле тесно пересекается с validity. Вот, но просто кому-то захотелось сделать ещё 1 ви, поэтому они решили, давайте.
31: Давайте сделаем ещё 1. Вот пусть данные у нас будут неопределёнными. Вот, собственно, дальше по поводу типов данных. Собственно, ну, основные 3 типа данных сейчас это структурированные.
32: Не структурированные, собственно структурированные. Это как раз-таки классическая классическая табличка. Вот, например, табличка в базе данных, да, хоть в экселе неважно. Главное, что у неё есть чётко описанная структура, вот, и мы её
33: Знаем и она нам понятна и она не меняется ну или меняется так что мы как бы готовы с этим жить. Вот полуструктурированные это ну самые простые примеры это xml или json?
34: Это документы в общем то файлы, которые структура нам более менее известна, но она там в определённых пределах может варьироваться. То есть не знаю допустим вот в xml файле может быть какое-то поле может не быть.
35: А может быть, их может быть десяток, например, одинаковых. Ну.
36: В принципе, некая структура у этого есть, но она такая немножко варьируется, поэтому это называют полуструктурированными. Вот. Ну и, собственно, 3, 3 вариант, это неструктурированное, это вот все, что вообще все, что может быть, все, что угодно.
37: Угодно это может быть какой-нибудь, не знаю, видеопоток с видеокамер. Это может быть поток данных сенсоров, не знаю, какого-нибудь станка, который обрабатывает металл, например, и постоянно снимает температуру и наличие каких-нибудь примесей.
38: И ещё что-нибудь, это какие-то данные из открытых источников, которые обладают, ну как бы могут иметь какую-то структуру, а могут не иметь структуру. Например, это данные, которые сегодня актуальны.
39: А завтра уже нет. Вот как бы они чьи-то чужие, они, они не наши, поэтому мы не можем гарантировать их структуру. Вот.
40: То есть данные вот такие, и какое-то время назад было достаточно сложно работать с полуструктурированными, с неструктурированными данными, потому что классические субд, они, ну, там, допустим, там поддержка какой-то работы с xml json.
41: Если какое-то время назад появилось, то, допустим, загружать в какой-нибудь oracle картинки, ну это можно сделать, но довольно бесполезно. Вот с этим надо было что-то сделать.
42: С этим надо было что-то делать, как бы как-то как то с этим мириться. Вот просто люди начали разрабатывать новые классы систем. Для всего этого, собственно, все это как раз стало, наверное, основой всего этого вопроса про большие данные. Вот.
43: Собственно, да, что такое большие, как говорит Бараат биг дата это все, что ломает эксель. Ну, в принципе, да, для кого-то эти данные действительно большие и на самом деле.
44: Вот эта вот их большесть, это как бы характеристики, скорее компании, которая их хранит и обрабатывает не самих данных, как я уже говорил, для небольшого коммерческого банка стандартное хранилище.
45: Несколько, несколько терабайт это может быть много для этого банка. Ему этого может хватать ростелеком, ржд, почта, скайп.
46: Для них большие данные это огромные огромные кластера, свои собственные цоды. Вот для них это тоже нормально. Они могут с этим жить.
47: Ну, для них эти данные, конечно, считаются большими. Вот, собственно, по поводу загрузки в реальном времени, как бы, в принципе, вопрос, конечно, обработки в реальном времён.
48: Он, конечно, важен. Многие хотят, чтобы у них так все и было. Вот. Но при этом иногда обрабатывать их, загружать данные, обрабатывать их в реальном времени. Ну, может быть просто невозможно, потому что это просто
49: Гигантский объём информации, который надо перелопачивать. Не знаю, например, не знаю, для, для перестроения какой-нибудь кредитной истории клиента. Ну, надо знать всю его историю и обработать её в реальном времени, может
50: Просто невозможно, но при этом можно обработать.
51: В реальном времени, но чуть чуть похуже, чем чуть похуже, чем нам хотелось бы. Собственно, это есть лямда, архитектура, лямда, архитектура. Это просто 1 1 из подходов к
52: Обработки данных, что с ним происходит? Данные грузятся в 2 потока. Собственно, 1 поток это классические хранилищные бачи, которые могут всю ночь, например,
53: Нагружать какой-нибудь кластер хадупа или кластер субд ещё что-нибудь. И параллельно параллельно с этими огромными бачами выполняется загрузка, ну в реальном времени, как бы, ну может быть там с
54: Не такой высокой точностью, например. Ну или, может быть там просто обработка производится такая очень несложная. Вот при этом как бы достигается некий компромисс между
55: Между точностью бач обработки, которая может быть важна и скоростью. Вот дальнейшее развитие лямды архитектуры, является кап. Архитектура это, по сути, лямда, из которой просто выкинули бач данные.
56: Как-то грузятся, как-то там обрабатываются более менее вот как бы они скидываются как есть какой-нибудь исторический слой, вот какой-нибудь это может быть там кластер хадупа.
57: Для архивов, или ещё что-нибудь, или какая-нибудь субд, или просто не знаю, лента.
58: Они там есть, при необходимости их можно пересчитать, но как сказать,
59: Актуальны они вот там, типа здесь и сейчас.
60: Вот это про загрузку. Дальше ещё 1, ещё, ещё 1 важное понятие, которое очень тесно связано с большими данными. Это архитектура, дата, лейк, дата лейк. Это концепция построения корпоративного хранилища.
61: Собственно, отличается она от там классического дейта верхаус. На самом деле тем по большей части, что в классическом хранилище данных структура хранилища достаточно жёстко зафиксирована, и
62: Она меняется, ну, она, конечно, меняется, развивается, но происходит это довольно-таки с трудом. Вот. То есть это как бы сложный процесс. Вот в даталейки данные грузятся как есть структура.
63: Их на момент загрузки, может быть не сильно кому-то интересно, и структуры становятся, становятся актуальна только тогда, когда, собственно, с ними начинают работать. То есть, ну, например, можем просто грузить
64: Jason из твиттера, укладывать их как есть, а разбирать только по мере необходимости при этом храниться они будут просто как, ну, не знаю, текстовые файлы или просто не знаю, или да, там, не знаю там.
65: Записи в субд. Это на самом деле конкретная технология не так важна, как бы важен больше концепт. То есть это называется схема, он рит.
66: Схема. И как раз-таки это подход, при котором структура данных начинает становиться важна на этапе чтения, а не на этапе записи. Вот, собственно, данные как раз-таки, да, могут грузиться зис как есть.
67: Разбираться они будут потом. Вот это, в принципе, нормально. Нормальная история. Вот. И так. Так получается больше, наверное, просто исторически, что основные потребители данных
68: Это датасаентисты и аналитики, которые, которым нужно не какие-то строить фиксированные отчёты, не знаю, по прибыли, по, не знаю, там какой-нибудь результатам работы, отделов или ещё чего-нибудь, то есть не
69: Не какие-то фиксированные отчёты, это люди, которые занимаются анализом данных и пытаются из существующих данных извлечь какие-то, может быть новые ценности. Вот собственно поэтому поэтому данные
70: Как есть, потому что, может быть сначала, может быть просто непонятно вообще, какую из них извлечь пользу, поэтому был принят подход. Просто давайте грузить как есть, а там разберёмся.
71: Вот, и это тоже очень тесно связано с большими данными, потому что как раз-таки вот дата лейке данных может быть много, как бы, ну, это нормальная история. Почему нет? Вот, собственно, апач хадуп на самом деле.
72: Честно, вот сейчас хадуб уже, уже, как бы люди уже понимают, что это не серебряная пуля, она не решит все проблемы, которые связаны с загрузкой, обработкой данных.
73: Это сейчас, это просто 1 из платформ, на которых, в общем то, можно делать довольно много вещей и, в общем, довольно нормально ну неплохо это, это работает как бы
74: На самом деле сам как хадуп это да, как уже сказал, это платформа. То есть это не какая-то конкретная софтинка, это если вам угодно, это лего, из которого
75: Можно собрать все, что нужно. Вот, а при необходимости доработать напильником, запилить патч в комьюнити апача и сказать, ребята, мне, мне понадобилась новая фича, я её сделал, то есть этим на самом деле хорош ходу.
76: Ну, как бы, на самом деле, там все, не все так просто. И написать пач для хадупа, как показывает практика, можно, но сложно. Но если у вас это получится, это будет здорово на самом дел.
77: Это крутая штука, вот давайте пойдём. Вот собственно вообще вся история с хадупом началась с того, что google выложил в открытый доступ свой вайт пеппер.
78: В котором рассказывал про устройство своего поискового индекса. Собственно, это все называлось гуугл файл систем. Если я правильно помню, то, в общем, на самом деле не суть. Вот. И как раз-таки они вместе с этим, они ещё
79: Собственно, выложили описание своего алгоритма мапредьюс, который в итоге стал основой хадупа. Вот просто нашёлся товарищ, да каттинг, который дико проникся этой идеей и решил а напишу.
80: Я такую штуку, она мне нравится. Собственно, это star хадуб. Почему хадуп? Знаете почему?
81: Нет, жёлтый слоник, хадуп. Это была любимая игрушка дочери вот этого товарища дага каатинга. То есть, если бы там был, если бы у него была любимая игрушка, не жёлтый слоник, ну, это было бы, что значит, было бы что-нибудь ещё.
82: Вот, ну, на самом деле, когда начнёте чуть более углубляться в апачевской комьюнити, вы узнаете, что на самом деле они очень любят какие-то странные названия выбирать. Вот там довольно много сейчас антилоп всячески
83: Разных. Вот там какие-то странные животные линктын, когда выкладывает свои разработки, он их называет всякими терминами из гарри поттера, потому что им нравится, видимо.
84: В общем, название, название ческих продуктов это отдельная, отдельная история, она довольно, она довольно весёлая, они бывают классные. Вот.
85: Собственно, в основе как бы основой платформы ходок вообще является файловая система, как раз адфс. При этом это не классическая файловая система, которая там монтируется на, на уровне операционной системы. Нет, это программный продукт.
86: Который работает поверх этого всего. Вот, да, он написан на джаве, он может быть не самый быстрый, он может быть там как бы есть свои ограничения, но зато это
87: Штука умеет хранить, перелопачивать, ну, действительно гигантские объёмы, ну там петабайты, десятки, петабайт, может быть ещё что-нибудь. И она делает это более менее стабильно. Вот, собственно,
88: В комплекте с шифс всегда идёт средство оркестрации, которое называется ярн. Это надо ресурс нет.
89: Ну, видимо, они просто хотели придумать какой-то классный акроним, вот. И подумали, почему бы не шерсть. Ну ладно, вот. Ну это на самом деле, это просто штука, которая умеет управлять ресурсами кластера.
90: То есть, как бы, да, вся история с хадупом это история про кластера, которые объединены между собой, там, в некую, там 1 сеть, и все это дело горизонтально масштабируется, можно добавлять новые узлы, убирать. Это все делается довольно легко.
91: Собственно я как раз занимается тем, что он какие-то задачи вычислительные, все это вот эффективно раскидывает по кластеру, всем этим управляет, при необходимости там делает какую-то
92: Обработку ошибок перезапускает, может быть что-то как то понимает, сколько нужно конкретно там поднимать новых процессов для того, чтобы обсчитать вот именно этот файлик, например, он, он всем этим занимаетс.
93: И 1 из основных фреймворков, который используется в Ярне, это map, reduce, чуть попозже про него ещё расскажу. Это просто на самом деле, это больше алгоритм того, как работать с данными. Собственно, он состоит из 2 Шагов мапп. Это
94: Мы бьём наши данные на множество маленьких порций и выполняем с ними какое-нибудь одно и то же действие, а reduce, мы просто все эти результаты работы собираем. Вот все довольно просто. Собственно google как раз-таки вот это алгоритм и описал в своей той той самой.
95: Вот на самом деле компонент других, которые работают поверх всего этого их куча вот допустим вот у нас в arena дате, у нас есть свой дистрибутив хадупа, у нас сейчас там по моему че то под 20.
96: Компонентов вот из них можно собирать довольно много всего. И на самом деле в пачевском комьюнити этих компонентов гораздо больше их там, по моему в разделе биг дата их что-то около несколько Десятков. Вот честно.
97: Не скажу, там очень может быть, что прям сейчас там че-нибудь добавляется новое. Так, так, может быть. Вот, ну и так получилось, что эта штука, что как бы, платформа до, как бы у неё были свои проблемы, но в целом она достаточно успешно
98: Справляется со своими задачами и поэтому, в общем, её используют все, потому что он, как бы, он, он платформа, платформа, она довольно понятна, она в принципе работает так.
99: Как от неё ожидают, так как от неё этого ожидают. Она, в общем, она, она нормальная, правда. Вот она просто нормальная, и поэтому, в общем то, она довольно быстро стала отраслевым стандартом. Все, все, все им пользуются, как бы всем нормальн.
100: Вот, вот история, собственно, все это, да, все это началось, да, в 97 вот был такой чел, дак каттинг, как раз он занимался тем, что он делал движок полнотекстового поиска. Вот, Люсин.
101: Кстати, это сейчас на самом деле тоже 1 из таких довольно верхнеуровневых проектов, что до сих пор, сколько вот с 97 года до 19, до сих пор существует. На самом деле он довольно крутой, то есть делают на нём полнотекстовые индексы до сих пор очень как бы
102: Вполне не зазорно. Это хорошая штука. Вот, собственно, товарищ начал над этим работать, начал все это работать. Потом как раз в да, Люсин появился подпроект.
103: Нач. Это просто фреймворк, который стал неким прородителем файловой системы хадупа, после этого google выпустил свою статью про google file system и чуть попозже прома.
104: Вот, да, каттинг этим всем очень сильно проникся, основал компанию. Каждый раз забываю. Есть. Сейчас уже есть 1 компания основ.
105: Короче, докати основал компанию, по моему, хортон ворс. Вот.
106: Да, попозже чуток он это сделал сначала кудеру. Да, простите, я, честно, не очень сильно запоминаю такие исторические вещи, потому что, ну, их всегда можно погуглить, на самом деле, вот.
107: Собственно, товарищ да, катинк, он как раз стал основным каким-то прородителем хадупа, отцом всего этого. Дальше все это начало очень хорошо развиваться. Начали появляться.
108: Другие, другие компании, другие компоненты, важные, там, допустим, в 2008, там появилось сразу несколько основных вещей. Там зукипер, это такое средство такого обеспечения, скажем так, кластерности кластера.
109: Вот хайв это просто эскьюэль, движок над мапредюсом, эйч Бейс это ноэль табличка, но я чуть попозже про это ещё расскажу вот начали появляться всяческие облачные платформы, там amazon тот же самый какой-нибудь начали появляться дру.
110: Другие крутые фреймворки, например spark со spark вообще очень интересная история, вот ярн, который оркестратор процессов на кластере, он хорошо работает на кластере хадупа, но он
111: Там начинают появляться проблемы, начали появляться проблемы, когда хотелось кластер использовать не только для хадупа, а, допустим, для чего-нибудь ещё и у товарища из беркли, из университета беркли возникла идея сделать оркестратор, оркестратор.
112: То есть сделать штуку, которая могла бы выдавать фреймворком оркестрации ресурсы по запросу они написали штуку, которую назвали апач месес, передали её собственно, в apache дальше там у них очень интересно было в статье.
113: Piano. Ну, для того, чтобы продемонстрировать, как месос работает с разными фреймворками параллельных вычислений, мы написали свой маленький фреймворк, назвали его спарк. Вот месос, по моему, так особо и не взлетел.
114: Парк 1 из популярнейших фреймворков для организации параллельных вычислений стал вот просто так вот сайт, проект ребят, которые хотели сделать что-то хорошую, крутую штуку. Взлетел основной проект. Нет, ну так бывает, это нормально.
115: Вот, собственно, дальше что было, начали появляться корпоративные вендеры. То есть это люди, которые просто сделали сборку хадупа и начали продавать его как коммерческий продукт, подавать на него техподдержку и оказывать какие-то услуги.
116: По, там, не знаю, консалтингу, разработке под него. Вот, и просто развитие вообще платформы. Вот, например, это мы вот несколько вендоров объединились, собрали.
117: Так называемый, он плати, это штука, которая была направлена на выработку некого стандарта. То есть было время, когда все дистрибутивы ходу были между собой абсолютно несовместимы и не было гарантии, что код, который вы там написали, под
118: Какую-нибудь сборку, не знаю, там Ворса не было. Гарантии, что это запустится на кластере клоудера вообще не было. Вот, ну, собственно, кудера, она так и осталась отдельно. А вот всяческие ребята, типа хоррора сас са.
119: Bbm объединились и зафиксировали некий стандарт, который должен был гарантировать, что все, все вот эти платформы между собой будут совместимы, но можно переехать с 1 на другую. В общем, довольно безболезненно вот.
120: Собственно, дальше, вот с 11 года, начиная там особо чего-то интересного, наверное, может быть, и не было. Вот просто все это развивалось, все это эволюционировало, все как бы росло и множилось ход.
121: Начал становиться каким-то более менее корпоративным стандартом для бигдаты. Многие компании начали его действительно нормально использовать. Вот, собственно, в 2013 году вышел хадуп 2, в котором было очень много изменений по сравнению с 1 версией.
122: В 1 версии у неё были ограничения как по количеству узлов в кластере там были ограничения, как раз он был очень жёстко завязан на мапредьюс, люди понимали, что это на марью Клином не сошёлся, и просто хотели сделать.
123: Что-то чуть более встраиваемое, как что-то типа знаете плагинов например вот они это сделали, они просто вынесли мапредьюс из хадупа сделали это как бы отдельным под проектом сейчас это живёт, это нормально.
124: Вот в 2016 году вышел ходу 3 0, в котором на самом деле особо из интересного, наверное,
125: Да особо ничего нет. Это просто дальнейшее развитие. Можно несколько кластеров объединять в 1, управлять ими из 1 места. Там чуть чуть чуть чуть немножко поменялся.
126: Поменялся, расширился набор возможностей по хранению данных именно в плане избыточности. То есть чуть попозже расскажу. Адис крутая тем, что данные хранит, ну, по умолчанию в 3 экземпляр.
127: Каждый блок данных, вот можно менять, все можно варьировать вот в 3 хадупе. Теперь там не только просто избыточная репликация, там ещё добавились коды Рида соломона. Вот на самом деле скука смертная, правда.
128: Вот в 2000, а в 2015 году, осенью, по моему, в октябре или в ноябре стало известно, что хортен бокс и колдер будут объединяться. Это на самом деле довольно странная история, потому что, как бы они были 2
129: Ну, в общем то, основных конкурента на рынке хадупов, на рынке дистрибутивов хадупа, они сейчас сливаются, и фактически они могут стать монополистом. Вот, соответственно, они могут легко диктовать сообществу условия, не условия.
130: Я просто какие-то свои пожелания по тому, как будет развиваться платформа, ну такая себе история на самом деле. Вот, но что с этим делать? Зато есть арена дата, вот мы маленькие, но гордые, и мы отдельно
131: Вот собственно самая основа в основе лежит hd vs оо дистрибьютор файл system собственно история в чем с ней да, как я сказал, это это не классическая файловая система операционки это
132: Софтина, которая разворачивается на кластере узлов. Собственно, узлы есть 2 типов. 1 узел, 1 тип это name ноды. Собственно, это узлы, на которых данные там, ну, не то что
133: Не хранятся они там могут, конечно, храниться, но совершенно не обязаны. Это больше управлялка всего этого и хранитель каких-то метаданных, описывающих, где что хранится, как это все хранится. Вот.
134: 2 тип это data ноды собственно это как раз узлы, на которых хранятся сами данные вот что с ними есть интересного ну во первых.
135: Как я уже говорил, избыточное хранение, вот, соответственно, за счёт этого достигается достаточно крутая отказоустойчивость. Ну что, что может быть особо актуально в случае огромных кластеров, которых чисто по статистике просто каждый день может
136: Вылетать какой-нибудь сервер. Это нормально. Может вылетать какой-нибудь сервер, может там несколько раз в день сгорать диски, как бы это нормальная история и с этим можно жить. Вот.
137: Плюс что ещё интересного с дата нодами это большие блоки данных.
138: Собственно, ну что такое блок? Вот это как вот это как в классической файловой системе, это кусок, содержащий данные, он более менее атомарный на уровне этой файловой системы. Вот.
139: Он хранит данные, в общем то чуть чуть чуть забегая вперёд. Собственно каждый процесс, например, мапредьюса работает как раз-таки именно с блоком. То есть он, он получает на вход несколько блоков данных, че то с ним
140: Не делает. И, может, там, не знаю, перезаписать, удалить, может, сделать, че хочет. Вот, собственно, да, по поводу отказа, устойчивости, да, уже сказал. То есть дата ноды обеспечивают довольно.
141: Крутой уровень надёжности и параллелизма. То есть, поскольку это все могут быть, ну, как бы, что на множество оно, но на самом деле это, по сути, процесс, который работает на уровне там, который запускается на операционке, все это написано на je
142: Ну, ну, нормально работает. Там, может быть, не так круто, как если бы это было написано на си, но ходу, на сях или на плюсах, кто никто так и не осилил. Вот, потому что на джаве писать проще. Вот.
143: Та, та, та, там вот name ноды нейм ноды, там с ними все просто, они просто хранят информацию о том, какой black, какой блок данных, какие, какие данные по сути, содержат и где.
144: Кластере, он находится вот, ну, в общем, как бы не rocket science, на самом деле, это, ну, довольно простая вещь, вот.
145: Отказоустойчивость достигается за счёт сенода, но короче с ними какая история есть active standby знаете, чем отличается холодный, горячий тёплый стендбай, кто знает?
146: Окей, ладно, круто, но я лучше расскажу вот это вот такой механизм. Это называется тёплый стендбай фишка в том, что есть всегда есть резервная, резервная нейм Нода, которая
147: Ну, в общем, не то, чтобы она моментально может подменить выпавшую, активную, но она может сделать это достаточно быстро. Вот все изменения, которые происходят с блоками данных, они реплицируются на ноду и
148: Понять её при необходимости можно за несколько минут довольно быстро. Вот это такой тёплый стенбай. Недавно, достаточно недавно начали все-таки делать горячий стенбай, то есть
149: Просто 2 одновременно, там 2, 2 или начиная там с 3 ходу уже больше можно одновременно параллельно работающих нам нот. Ну, как бы 1 из них, конечно, всегда более главная. Вторые просто, просто работают и просто накатывают все те ж.
150: Самоизменения, в общем то в реальном времени, во первых, так достигается тоже чуть чуть более как бы масштабируемость нагрузки. Вот, во вторых они в случае, в случае, в случае необходимости они могут перенимать, подхватывать
151: Работу гораздо быстрее, чем чем вот в таком режиме. Вот
152: Дальше. Ярн ярн, это оркестратор, как я уже говорил, вот, собственно, что он делает, когда, когда мы запускаем какую-нибудь программу на кластере хадупа, что делает ярн ярн говорит, вот на такой
153: То на такой-то, на такой-то, на таком-то узле поднимаем процессы. Ну это обычно тоже java, какие-нибудь контейнеры на джаве или ещё что-нибудь в этом духе. Поднимаем процессы, выдаём им столько ресурсов, вот сколько надо, либо не выдаём, если
154: Их нет, либо ставим их очередь, если, если они, допустим, ресурсов прям сейчас нет, но будут чуть попозже. Вот он же, собственно, я же отвечает за то, что в случае, если какой-то процесс у нас
155: Упал. Его можно перезапустить, его можно перенести на другую машину на кластере. Вот, собственно, как раз-таки за счёт, из за того, что хдфс хранит по 3 блока, по 3 копии блока по умолчанию
156: Я частенько делает такой хитрый ход, он поднимает по 3 копии 1 и того же процесса и, собственно, направляет их на 3 реплики 1 и того же блока. Кто из них быстрее сделал, тот молодец, остальные просто, остальные просто.
157: Так, немножко получается оптимальнее.
158: Вот, собственно, тоже как бы 2 основных компонента ярн есть это ресурс. Менеджер как раз это компонент, который принимает как раз запросы от клиентских приложений, который, ну, делает
159: Всю оркестрацию, фактически и нод менеджеры это, по сути, просто машины, на которых исполняются фактические процессы. Чаще всего нод менеджеры совпадают с дата нодами, потому что все, потому что все это как бы вот это все тесно связано с хадупо.
160: Вот как с дино связано с death и как бы, ну логично держать вычисления там же, где данные собственно это тоже 1 из таких основных как бы концептов принести.
161: Вычисления близко к данным. Вот, ну, как-то так и 3 основной компонент, который сейчас уже немножко теряет популярность, но все равно как бы довольно долго был реально основным в ходу, это мапредьюс.
162: Собственно, по сути, да, по сути, это алгоритм у нас есть, допустим, у нас есть какое-то, у нас есть какой-то огромный объём данных, и мы с ним хотим сделать какие-то операции, какие-то вычисления, собственно, что мы делаем? Мы пишем там
163: Граммульку чаще всего на джаве, которая состоит из там, по сути, там 2 там, ну в самом простом случае, там пишется 2 класса маппер и редьюсер. Вот в мапе просто мы все данные, которые у нас есть.
164: Мы над ними применяем какую-нибудь 1 и ту же несложную операцию. Ну на самом деле, допустим, вот простой вариант. Это у нас есть текст, который, ну, огромный кусок текста, который хранится на кластере. Мы хотим слова посчитать в нём, собственно, что мы делаем? Мы просто
165: В мапе у нас текст разбивается на куски считается количество количество уникальных слов в каждом кусочке, как бы, ну, в принципе, операция 1 и та же, от данных она не зависит никак.
166: Вот, и дальше следующий шаг это reduce свёртка данных, вот в случае с поисками, подсчётом количества количества там слов в тексте у нас вот мы большой текст разбили на блоки.
167: Посчитали в нём в каждом из них слова, а дальше мы просто все, все это мы все это объединяем, вот получаем как бы количество слов, количество вхождений там того или иного слова в текст. Самый простой пример, поисковый индекс. Вот.
168: Ну, как бы, это, это очень долго, это была основная штука в хадупе очень долго. Ну, сейчас она уже, на самом деле, я вот на самом деле уже давно не видел, чтобы кто-то писал чисто мапредьюс, потому что, ну, это тяжеловато.
169: Тяжеловато. Вот это во первых. Во вторых, сейчас появилось довольно много инструментов, которые позволяют все делать гораздо проще. Например, тот же самый хайв хайв, это эскьюэль движок.
170: Который позволяет просто к кластеру хадупа писать эскюэль запросы. Вот он довольно долго, он был так себе, но там в последние, там, последние годы он достаточно хорошо развивается. Это действительно удобный инструмент, который позволяет
171: Работа с большими данными. Вот просто с помощью классического эскьюэль, ну там как бы со своими особенностями, но они, в общем, они не такие страшные, чтобы с ними нельзя было жить. Вот.
172: Да, изначально, изначально он, собственно, просто преобразовывал эс запрос в соответствии с алгоритмами в цепочку приложения мапредьюс, которые работали вот сейчас он работает чуть чуть по другому, но как бы концепт
173: Примерно тоже самое. То есть он просто преобразовывает эскьюэль в код, который работает на хадупе. Вот, собственно, ещё 1 очень интересный проект. Это эйч Бейс, это Кивель субд.
174: Которая точно также работает поверх ди фс. Вот, и у неё достаточно с ней
175: Удобно работать в том плане, что у неё хорошо получается точечное чтение данных. То есть если мы хотим найти какой-то ключ в базе 1, какого-то клиента, например, мы хотим найти или какой-нибудь
176: Не знаю, какие-нибудь данные датчика. Вот, эй, это, это круто, потому что, допустим, хайв, если мы попробуем написать, ну, попробовали бы чуть чуть чуть раньше, пару лет назад, если мы попробовали на хайвее написать селект звёздочка Фром тейбл вер.
177: И равно не знаю. 1 хайв бы довольно тупо просканировал всю таблицу, какая у нас есть в хадупе. Это может быть табличка, не знаю, ну, десяток терабайт как бы неэффективно, не круто.
178: Base в этом плане гораздо круче работает.
179: Вот очень интересный компонент хадупа это spark spark, это очень крутая штука, это ещё 1 фреймворк распределённых вычислений, как раз вот я про него рассказывал, его случайно написали ребята из беркли абсолютно случайно.
180: Собственно, с ним что? Ну, с ним довольно просто писать код, это чаще всего, это либо java, либо скала, вот скала, прикольный язык, он немножко может вынести мозг, но если вам понравится, вы
181: Ребята, вот с ним, с ним, что с ним есть интересного? Ну, во первых, он как бы тоже абсолютно нормально работает над хдфс, при этом он ещё может, на самом деле не тольк.
182: Работать вы можете, в принципе, при желании и коннектиться к какой-нибудь базе данных, и, не знаю, просто с файликами, которые у нас лежат где-нибудь там локально на нашем ноутбуке совершенно спокойно можно все это делать. И там прикольная тема с отложенными вычислениями то ест.
183: Мы пишем код, мы, мы берём как бы некий кусок данных, начинаем наворачивать на него действия, которые мы с ним хотим совершить. Наворачиваем, наворачиваем, наворачиваем, пишем вот такую простыню. И фактически эти вычисления будут производиться только тогда, когда они будут, ну,
184: Нужны. То есть в нашем программном коде у нас будет храниться условное описание простыни, которую надо сделать с какими-то данными. Вот. И вот эта простыня кода начнёт
185: Выполняется только тогда, когда он действительно нам понадобится. Ну, круто. Вот единственное, что вот он оперативку жрёт, как не в себя, это такой у него есть минус. Вот он очень любит много оперативки. Ну, в принципе, как бы она сейчас
186: Не такая дорогая, сейчас это нормально.
187: Вот. Дальше из интересного солар и эластик серч, это 2 брата близнеца отличаются, по моему, просто какими-то там небольшими особенностями доступа к их данным. Вот. Ну, в общем, это просто движки полнотекстового, поиск.
188: Вот если мы хотим найти что-то в тексте, если мы хотим, не знаю, опять же, посчитать слова в книжке, это на самом деле, это очень популярная шутка, потому что в ходу распределённые вычисления для подсчёта слов в тексте. Вот
189: Если он, если нам, ну, если мы хотим что-то искать.
190: В текстах вот это отличные вещи. Вот они классно работают, они уже достаточно, достаточно зрелые, и они, они много где используются. Вот как бы, если
191: Знаете, эти штуки не пропадёте. Вот ещё 1 интересный инструмент. Это узи, это штука, которая может выгружать в или из хдфс что-нибудь в реляционную субд. Вот.
192: Это довольно полезно, когда у нас есть рядом с хадупом, у нас есть классическая революцион, а какой-нибудь, не знаю, оракл, например, вот мы можем просто данные туда сюда перегонять, причём узи довольно умный.
193: И он умеет все это делать, делать параллель. То есть он может действительно, на, ну, в Ярне он может поднять несколько процессов, которые будут в параллель читать субд или писать. Вот, ну, и на самом деле, таких компонентов их куча.
194: Вот, и скорее всего, если у вас есть какая-то задача по обработке больших данных в хадупе, надо просто хорошенько посидеть на сайте почерк в разделе биг дата, че-нибудь да найдёте. Вот как-то так.
195: Собственно, вендоры вендоров, ну, было основных 4. Вот сейчас кортен ворс и клаудера сливаются в 1, кажется, они, они теперь будут называться клоудера. Просто вот, собственно, ну,
196: Чем они все интересны? Хорте ворс просто одни из первых у них, ну, нормальный дистрибутив. Просто вот такой довольно дефолтный, как это сказать, собственно, они
197: Довольно много коммитят в apache, они очень много всего передают в опенсорс в отличие от кудера вот в принципе ну просто нормальные ребята в целом, если у вас, если вам придётся работать с ворсом это нормальн.
198: Нормальная штука, но скоро его уже не будет. Вот, потому что они объединились с компанией клоудера. Вот. И пока не очень понятно, что будет их продуктом совместным. Собственно, у клоудера до этого был просто тоже свой дистрибутив.
199: С ним. Ну вот просто вот просто по практическому опыту он тоже, он тоже, он тоже как бы нормальный, вполне себе рабочий дистрибутив, но он мало с чем совместим. То есть он сам по себе и
200: И там есть очень много компонентов, которые клоудера каким-то непонятным образом пропатчила. Че там происходит, не очень понятно. Просто так взять какой-нибудь, не знаю, эскэль, движок импала и поставить его на просто ванильное.
201: Hadoop может не получиться, потому что на она будет тянуть за собой зависимости из дистрибутива клоудера, которых в pace нет, вот интересные ребята это.
202: Вот, собственно, чем они интересны? Они сделали замену Адис. Вот они просто взяли, повторили Адис только как раз-таки на си, у них это круто получилось, она достаточно шустро работает. Вот.
203: Ну, на самом деле, они одни из основных, но при этом, как бы вот из этих троих, они самые маленькие, в России их практически нет. Я вот не могу сейчас вспомнить кого-то, у кого есть маппер в России. Вот.
204: Ну и как бы позиционируют себя как конвергентную платформу данных. Ух, вот. Ну то есть, как бы просто платформа, которая может хранить данные как революционные, так и нереволюционные, и вообще любые. Вот.
205: Ну, как бы, основное основных направлений, это всяческая аналитика искусственного интеллекта. Вот. Ну и арената, это наша компания. Вот входим мы в компанию ibs, вот, да.
206: Входим в компанию ibs, это 1 из крупнейших российских интеграторов. Вот собственно у нас есть свой дистрибутив, который, в общем то, ну основан на пачевском, вот, но мы там много чего довольно-таки допиливали.
207: Бывали. Вот, в общем, как бы, на самом деле, я даже не знаю, что сказать, как бы, ну, у нас нормальный дистрибутив хадупы, вот мы норм, вот, если что, приходите к нам, у нас классно вот как-то так.
208: Ну, собственно, по поводу того, что с этим всем дальше будет, как бы, хадуп, все его попользовали, все поняли, что штука, ну, нормальная, вот, как бы, ну, как бы использовать, можно жить.
209: Жить с ним вполне себе можно, как бы какие-то ожидания завышенные, которые изначально были, ну, по поводу того, что там это серебряная пуля, которая решит все проблемы, все такое, это уже поняли, как бы это уже от этого тоже.
210: Начинают уходить. Вот сейчас это просто переходит на какой-то более менее Ровный Ровный режим использования работы. Это нормальные зрелые продукты, которые в принципе довольно активно развиваются.
211: С которыми все хорошо. Вот просто надо понимать, что не стоит от хадупа ожидать каких-то волшебств, как бы это просто нормальный продукт. Вот и все. Не более. Вот мне на самом деле во время перерыва
212: Мне сказали, что я чудовищным образом ошибся. Я прошу прощения, вот узи это не инструмент импорта экспорта, инструмент импорта экспорта это скуп, а узи это оркестратор. Вот.
213: Это оркестратор типа етель потоков условных, вот это к тому, что вот если за этим всем не следить, можно очень здорово запутаться в названиях, потому что названия абсолютно рандомные.
214: Вот, и запоминать это тяжко. Вот извините.
215: Вот, собственно, дальше следующий момент. Это, ну, о том, что хотелось сказать, что как бы на хадупе свет Клином не сошёлся, как я уже говорил, и большие данные это не обязательно хадуп.
216: Это может быть и что-нибудь другое. То есть кому-то, кому-то хадупа недостаточно. Может быть, допустим, допустим, вот пример в платёжной системе мир, в платёжной системе мир.
217: Используется чисто инмемори, движок, там хадупа как бы, ну, может, он и есть, но основное, основное хранилище у них чисто все в оперативке, там какой-то гигантский кластер, по моему.
218: И он вот, вот он удовлетворяет их требованиям по времени, допустим, загрузки какой-то обработки данных, вот всех этих платежей, которые в реальном времени прогоняются. Причём они же обрабатывают все платёж.
219: Же вообще в России, вот, например, там кому-то, кому-то хадуп не нужен, но кому-то нужен, например, там полнотекстовый поиск. Ну не знаю, яндекс, google у них, конечно, свои.
220: Решение чаще всего, вот, но как бы, хадуп у них, ну, не то, чтобы там может сильно использоваться. Или, например, ещё простой пример, компания линктын, собственно,
221: Компания лектин в какой-то момент разработала для своих внутренних нужд маленькую софтинку, которая занималась тем, что сообщения передавала туда сюда. Вот её назвали кафка, вот.
222: Сейчас они через эту кафку у себя гоняют 180 миллиардов сообщений в сутки. Вот, ну, у себя внутри, в смысле, в компании вот это, в принципе, тоже считается, тоже считается биг дата. Вот, несмотря на то, что нам данные просто пересылают туда сюд,
223: Вот это тоже big data нормально. Вот ну как бы естественно ну кафка то уже не является частью каких-то решений линтен. Ребята, которые сделали, ушли, открыли компанию конфлюент, которая сейчас является
224: Вендором кафки. Ну вот, например, такая история есть. Так, может быть. Вот, собственно, какие могут задачи решаться? Ну, это понятно, это как бы помимо хранения огромных массивов данных, причём
225: Напоминаю, огромные это для каждого свои вот просто, просто, вообще просто хранение и сбор, потому что, ну это просто тоже само по себе это тяжко, вот это тяжело, это надо.
226: Как бы много как-то исхитрятся, зачастую это нужно делать. Ну, например, реал тайм доступ как раз вот это вот такие транзакции, транзакции по счетам, та же самая платёжная система мир, когда вы платите карточкой,
227: Это все пролетает через их хранилище, вот серьёзно и там за там несколько миллисекунд происходит какая-то обработка. Вот собственно обработка данных в реальном времени может быть, например, там классическая
228: Задача кредитный скоринг это каждый раз, когда каждый раз, когда вы заполняете анкету на кредит, считается у вас некий балл, который вам выставляется и в зависимости от этого балла принимается решение о том, там выдавать вам кредит или нет, или выдать с повышенным процентом.
229: Дальше. Следующий пример. Это маркетинговые предложения в реальном времени. Если знаете, такой лайфхак можно, короче, очень многие сотовые операторы, ну, как многие, сколько их там у нас сотовые операторы могут мониторить, что вы
230: Вы, допустим, звоните в колл центр другого оператора, этим можно пользоваться. Они через пару минут после этого вам могут перезвонить и предложить скидку на тариф на какой-нибудь. Вот прикольная штука. Все это тоже, все это тоже обра.
231: В реальном времени, естественно, вот, потому что это живо пока, ну, как бы, пока оно есть, как бы, там, не знаю, там, через, через 2 часа мне уже будет неинтересно слушать про скидку какую-нибудь, я вообще забуду про это все. Вот.
232: Вот, либо, например, простой пример, это реклама для тех, кто идёт по торговому центру, например, ну, там, как бы, вот пока вы идёт по торговому центру, вам может быть актуальное предложение зайти в такой-то
233: Магазин и там купить что-нибудь, если вы вышли, ну зачем вам это, это не нужно. Вот ещё 1 задача. Это как раз-таки это поиск информации. Ну это вот классические полнотекстовые поиски яндекс, google. Все
234: Это вот какие-то анализы, может быть настроений там допустим вот анализ твитов из твиттера по настроениям это очень популярная задачка, очень много кто её
235: Тебя решает. Вот людям это может быть важно, там, как, допустим, как, как тролли из твиттера относятся к конкретно вашей компании, например, или не знаю, или не будет ли там
236: В ближайшие пару дней революции в стране, например, что-нибудь такое. Вот. Интересный момент. Это иот интернет internet of things, интернет вещей сейчас начинает появляться очень
237: Очень много всяких штук, которые умеют в интернет. Это умный дом, это какие-нибудь датчики, это какие-нибудь камеры, это, не знаю, что-нибудь ещё, может быть что-то, что
238: Собирает про вас информацию. Либо, допустим, простой пример. Предприятие, какой-нибудь завод на заводе есть, станки в станках, есть датчики. Вот заводу может быть очень интересно собирать информацию.
239: О состоянии станка в реальном времени. Вот просто для того, чтобы как-то делать какое-то, может быть прогнозирование поломок. То есть иногда бывает проще там починить станок вот сразу чем
240: Потом менять его, когда он взорвётся, не знаю, случится что-нибудь ещё. Простой пример. Компания боинг начали. Компания боинг начала собирать все данные.
241: Все данные со всех датчиков во время полёта самолёта. И на основании этого как раз-таки тоже они начали делать прогнозирование, прогнозирование какого-то обслуживания, то есть не по не по регламенту какого-то начали проводить там техобслуживание.
242: Двигателей, а по факту того, что собирается с датчиков. Просто таким образом они начали экономить 50 000 000 $ в год. Вот вполне себе неплохо. Вот
243: Ну дальше, собственно, это как раз таки какой-то анализ активностей, настроений в интернете, ну, как бы, соцсети, аналитика, маркетинг, какая-то реклама, таргет.
244: Очень сильно анализ настроений, предсказание революций в стране всего такого. Машинное обучение, искусственный интеллект, распознавание котиков на картинках. Вот это очень важно. Вот. И для этого нужно обрабатывать какие-то гигантские объёмы информации.
245: Нужно обрабатывать гигантские объёмы фотографий, понимать, где там есть котики, а где диван цвета леопарда. Вот, ну понятно, беспилотники, такси, все дела, дроны, которые будут доставлять пиццу. Для этого, для всего этого тоже нужн.
246: Обрабатывать огромный объём данных, автоматический перевод текста, какие-то модели рекомендаций. Ну рекоменду там это возможно, вам понравится. Ну вот там, не знаю, если вы купили шубу, возможно вам нужно ещё десяток шуб. Вот.
247: Как-то так вот, собственно, вот такие задачи вообще большие по обработке больших данных в основном решаются. Вот эскьюэль. Ну, я думаю, вы уже знаете, что такое эскьюэль, если вы здесь, правда
248: Вот, собственно, как бы эскьюэль действительно тоже 1 из отраслевых стандартов, как бы его нужно знать. Это вааажно, естественно, но им не всегда можно обойтись, потому что
249: Как бы эскьюэль сам по себе, как язык, это язык работы с множествами, там есть проблемы. Ну, допустим вот у меня буквально там пару дней назад возникла дикая задачка, которую просто sql, ну, не решить, например, вот, собственно,
250: На самом, да, эскью, конечно, очень хорошо развивается. Там очень много всего классных, всяких штук там в стандарте.
251: В стандарте свежих, там добавляются крутые всякие вещи, типа там, не знаю, обработки каких-нибудь джейсонов прям на ходу, или разборка эксэмэл, ещё что-нибудь, какие-нибудь там данные за, там, тот или иной временной промежуток. Короче, все.
252: Круто. Вот, допустим, можно запускать модель машинного обучения. Вот, допустим, у нас ещё вот у нас аренда, у нас ещё есть тити гринплам, там в гринпламе совершенно спокойно можно пускать задачки машинного обучения в контейнерах прям
253: Субд это круто, на самом деле, оно работает в вертике. Также можно, например. И да, и много сейчас, где так можно делать крутые штуки, правда вот. Ну и да, сейчас практически все все такие крупные.
254: Активные базы данных достаточно легко интегрируется с хадупом из коробки, там у всех практически у всех есть там в той или иной степени какие-то коннекторы. Плюс как бы, не знаю, ну там со стороны хадупа, например, можно просто подключаться по jdbc база
255: Вот, как бы, интеграция, она есть, да, как бы, эскюэль, это круто, правда. Ну вот, не все можно сделать эскелем. Вот. Ну, не все, правда, те же самые, те же самые распознавание.
256: Котиков, как бы, ну сложновато распознавать котиков на sql, наверное. Вот. Плюс какие-то просто какие-то, какая-то бинарная информация, тот же самый поток данных датчиков Станков, он может быть как бы абсолютно
257: Не структурированный, ты просто его не уложишь в табличку. Вот. Плюс, ну, например, там простой пример. Все данные действительно идут в реальном времени. Ну, их не так просто представить, как таблицу, это можно.
258: Сделать Кавка так, Кавка так уже умеет в Кескюль, но это все равно, это такие полумеры. Вот. И, собственно, вопрос, достаточно ли скеля? Нет, недостаточно. Вот.
259: Это очень крутой инструмент, правда, но у него есть свой своя область применения. Это какая-то, да, вот самый простой пример, это массивно параллельная обработка данных. Вот если мы хотим сделать 1 и ту же опера,
260: Над кучей данных, над множеством, по сути, как бы мы, мы можем написать что-нибудь на скеле можем не написать, можем редьюс написать, а можем, не знаю.
261: Можем сделать что-нибудь ещё. Вот. Ну и плюс как бы, для чего ещё нужен эскьюэль, все же все классические решения бизнес интеллидженс. То есть это средство построения отчётности какой-либо той или иной, они все ещё очень плотно завязаны.
262: На субд революционное. Ну, на самом деле понятно, потому что отчёт, по сути, тоже табличка. И, ну, отчёт такой классический какой-нибудь. Вот он с графиками, может быть, с дашбордами. По сути, это просто табличка.
263: Очень легко, просто сделать табличку на основе другой таблички. Это делается очень легко. Вот для этого тоже нужен эскюэль. Вот, то есть какого-то биа решения, которое могло просто
264: Напрямую работать с хадупом. Ну, навскидку не назову. Они все равно, они все равно себе кидают в хадуп эскэль, ну или не в хадуп, или в кафку, или в, не знаю, какой-нибудь апач игнайт, или, не знаю, в какой-нибудь просто.
265: И другую какую-нибудь субд, инмемори, ещё что-нибудь. То есть, ну все, он все ещё нужен. Вот. Но, собственно, как бы необходимость использовать, ну, не необходимост.
266: А вот это вот стандартность. Наверное, утилитарность. Эскьюэль привела к тому, что он начал эволюционировать. Появились сначала решения no эскьюэль. Вот изначально это было, ну, собственно, ноу эскьюэль.
267: То есть это не эскюэль, потом, потом стали называть not only. Вот. И после этого чуть попозже ещё появился new эскьюэль. Вот в чем здесь фишка, это, по сути, как бы тоже базы данных какие-либо
268: Вот база данных просто там внутри все по другому хранится и обрабатывается. То есть там не как в табличке, вот в сбд, да, не, просто там табличка какая-то ещё.
269: Это может быть какая-то ориентированная на хранение документов база, которая поддерживает какой-то, какой-то язык поиска по документам. Это может быть какое-то графовое дерево, например.
270: Для чего это нужно? Анализ соцсетей связи, взаимосвязи, поиск, не знаю, там, поиск аффилированных налогоплательщиков, каких-нибудь, что-нибудь такое.
271: Такое в классической базе данных, это, ну, сложновато будет сделать, а графы хранится как бы нормально. Вот это просто, допустим, какой-нибудь, может быть, Кивель, Кивель там внутри.
272: Как бы у записи каждой есть только ключ какой-то прям, ну нормальный, по которому можно искать. И есть какое-то условно очень 1 очень большое поле, в которое мы можем писать все, что хотим, мы не завязываемся на структуру. Вот как бы поиск там.
273: Штуки довольно быстрые, может быть вот особенно если мы все храним в оперативке. Вот крутая штука. Либо, например, семейство колонок у нас просто, ну, очень
274: Но мы, мы храним все данные, ну не то чтобы в 1 таблице мы как будто думаем, что это 1 таблица, у которой полей куча и просто разные разные таблички, они просто записываются в разные
275: Поля. Вот иногда это удобно.
276: Вот, собственно, чем новосель решения отличаются?
277: У классических сбд есть требования эйсид, атомарность операций, консистентность данных, изолированность и надёжность. Вот ноские этого нет. Ну как бы, ну ладно, вот, то есть
278: Вместо ест есть bass тоже тоже свойство это базовая доступность. То есть, ну, запрос, который мы прокинули, он, ну, он завершится. Вот.
279: Софт стейт это собственно, состояние системы у нас может меняться со временем. Вот венчал консистенси, ну как бы это гара.
280: Того, что данные когда-нибудь будут консистентны, которые мы грузим. Вот они могут быть не консистентны прям, прям с самого начала. Но, допустим, мы можем сказать, что, допустим, через 15 минут они уже будут согласованы внутри себя в разных табличках.
281: Например, ну, вполне себе нормальная штука. Вот. В общем, с этим тоже можно жить. На самом деле, просто надо учитывать специфику этого всего. Вот, собственно, 1 из 1 из необходимостей учитывать специфику, это cap теорема и песел си теорема, я чуть попозже про них
282: Скажу ближе к концу. Вот прикольные штуки, но
283: С ними просто надо смириться, просто смириться и все как-то так вот new скель это чуть чуть более новая идея вот на самом деле это больше маркетинг это больше маркетинг вот то есть это
284: Это субшкал ионные, в которых условно добавились какие-нибудь прикольные фишки. Вот, ну, не знаю, например, там, допустим, сабхана, это, в принципе, субд, она, в принципе, ну, чуть более менее революционная, только она хранитс.
285: В оперативке вот стоит как пароход, но при этом крутая, например, вот, ну и там вольт диби, Арен диби, там это тоже примерно такие похожего класса вещи, там почти эскьюэль почти, но
286: Просто совершенно все под капотом, все совершенно по другому там не как в каком-нибудь пост или как в оракле, а вот по своему вот так как-нибудь. Вот, собственно, например.
287: Платформа полнотекстового поиска вообще, как, как строятся полнотекстовые индексы. Вот.
288: Как все это происходит? Почему экюли это сделать так себе? Собственно, что у нас происходит? У нас есть текст.
289: И мы просто все слова всех текстов разбиваем, пихаем в такую табличку. А дальше просто мы говорим, а найди мне документ, в котором есть слово do. Он говорит, пожалуйста, документ 1, 3, 4. Мы такие. Хорошо, ладно.
290: Класс. Ну это все, в принципе, наверное, можно делать на какой-нибудь революционной сбд, но если мы захотим все это отмасштабировать, сделать свой google, но мы обломаемся. Вот.
291: А какой-нибудь, допустим, Люсин соло, эластик серч. Ну, это 3 брата близнеца. Люсин был, точнее, как Люсин. Это папа соло, эластик серч это его 2 отпрыска. Вот они примерно так работают. Вот.
292: Это все круто, очень классно масштабируется, допустим, тот же самый там, не знаю, Люсин, оо ли они классно работают поверх дфс, они умеют там все искать, хранить, обрабатывать. Ну, нормально. В общем, хорошая штука.
293: Вот это про текстовый поиск собственно. И ещё сейчас модная история это хранение в оперативке. Вот поскольку у нас теперь можно делать оперативки очень много и все это
294: Научились объединять в кластера. Вот стало возможно делать платформы полноценные хранилища, которые полностью хранят все данные чисто оперативной памяти. Вот, ну тоже как бы, то есть есть разные
295: Варианты того, как это реализовывается есть просто отстрочки от классических субд например там ну допустим там в субд эйч ну она уже давно не hpp ладно, субд вертика там есть просто огромный кэш, в котором все данные просто кэшируются ну,
296: Мы это все прозрачно для пользователя, но как бы за счёт, ну, за счёт этого cash действительно получается нехилая такая оптимизация, вот это, собственно, ещё что можешь, как ещё это может быть организован?
297: Ну, вот, например, тоже какой-нибудь скил, или там, ну, субд, вот, ну, сабхана, например, та же самая, вот, ну, как бы, ну, база данных, да, просто она разворачивается на кластере, размещает все данные в оперативке, може.
298: Как-то это все хранить. Ну как бы она может конечно все это уметь на диск записывать. Вот, может не может не записывать. И 3 интересный такой подкласс это гриды вот по сути.
299: Это фреймворки. Вот. И для того, чтобы с ними работать, их использовать, нужно писать код. Вот.
300: Это сложно, потому что для этого нужно уметь кодить. Вот, но можно делать очень крутые вещи. Вот, например, вот я классический пример апач игнайт.
301: Собственно, на самом деле панайт, он умеет делать, ну, по сути, это джавовский кэш, который имеет 2 метода пут и get вот как бы вот с 2, с этими методами put положить данные, записать в него и get найти.
302: Что-нибудь по ключу можно делать очень крутые вещи. Вот, допустим, в Сбербанке на патч игнайт написано куча каких-то решений. Вот честно, сейчас не скажу, что там есть. Вот, но вот они вот
303: Используют, так, и у них данные обрабатываются практически в реальном времени, как бы, ну, нормально, вполне себе. Это хорошо, это живёт и нормально работает. Вот это ещё как бы пример систем.
304: Которые не являются хадупом, но при этом также тоже хранят большие данные. Это нормально, с этим можно жить вот дальше. Вот мне тут рассказали, что на самом деле вам, видимо, не рассказывали про лям декап архитектур.
305: Зачем они нужны и что это такое вам упомянули? Ну и все, я правильно понимаю? Да, так и было. Ну ладно, вот, собственно, вот сейчас вот в этом модуле
306: Я, наверное, постараюсь просто как-то, ну, конечно, я, наверное, не смогу полностью все покрыть, но какие-то просто базовые понятия. Я очень хочу, чтобы они у вас остались. Надеюсь, так и будет. Вот.
307: Собственно, давайте пойдём, что такое хранилище данных, хранилище данных это предметно ориентированная база. Почему предметная? Потому что там она ориентируется на уже, допустим, бизнес сущности, то есть
308: Например, у нас есть банк, у нас есть банк, есть источник, это, допустим, какой-нибудь call centre, информация из колл центра сирм система это может быть какой-нибудь биллинг из банкоматов, вот там как бы какие-то сущности свои есть они, ну,
309: Как бы они в своём формате, они как-то там хранятся, загружаются собственно переход к бизнес сущности это переход от, допустим, там клиента из колл центра, клиента из биллинга и
310: Клиента, ещё откуда-нибудь переход к единой сущности. Клиент банка, который контактирует с колл центром, с интернет банком, который платит по карте, существует и он есть. Вот
311: Вот, собственно, по большей части это практически всегда используется для построения какой-то отчётности. Вот.
312: Отчётность, в принципе, это такое очень универсальное понятие. Вот, но в целом это, ну, понятно, это отчёт, как бы они нужны. Действительно, банку нужно предоставлять отчёты в центробанк.
313: Допустим, какому-нибудь, не знаю, какому-нибудь сотовому оператору нужно понимать, какой у него идёт отток клиентов или, наоборот, приток новых. Они хотят это все знать. То есть это нужно для ведения бизнеса в целом, как бы
314: Ну, это, это вполне нормально, это жизнь, вот чаще всего это, ну, как бы, это на самом деле довольно, довольно старая тема. Вот. Чаще всего это какой-нибудь революционная база. Вот она, может быть тоже, на самом деле, Конских объёмов, это нормальн.
315: Вот, особенно сейчас вот данные там чаще всего какие-нибудь структурированные, очень хорошо. Ну тоже как бы основные источники, это, по сути, там просто какие-то таблички из других баз, либо какие-нибудь очень фиксированные вещи.
316: Вот как бы ну в общем, это довольно простая тема data lake data lake, как раз тоже связанное с большими данными понятие вот ну по сути тоже концепция это.
317: Как я уже упоминал, основное отличие в том, что в хранилище данных хранилище данных структура у нас уже есть, и преобразование данных идёт на этапе загрузки хранилища. Вот.
318: Вот, а в дата лейке данные грузятся как есть, они грузятся все подряд, вот, и преобразовываются они только тогда, когда они становятся нужны. Вот, собственно, это нужно для
319: Случаев какого-то анализа данных, анализа данных, которые мы ещё не знаем, насколько они полезны, про которые мы не знаем, что они могут принести пользу. То есть это такие очень исследовательские задачи.
320: Вот, как бы для таких случаев, собственно, что мы делаем? Мы берём источник, подключаем его, грузим все, до чего дотянемся, как-нибудь это все складываем. Вот, а дальше натравливаем на это дантистов, как бы, ну, в принципе,
321: Они что накопают, то накопают? Вот что ещё можно про это сказать? Частенько дата лейк превращается. Ну, озеро данные, да, красивая концепция. Частенько озеро превращается в болото, как бы это тоже нужно учитывать.
322: Вот. Чаще всего в болото оно превращается тогда, когда мы начинаем бездумно все грузить и просто грузим то, что просто для того, чтобы оно просто там было, и мы это не используем. Ну, такое себе вот не очень круто.
323: Вот что там дальше. И связанный с дата Лейком дата лейк. Термин появился относительно недавно. Это виртуализация данных, это на самом деле
324: Очень интересная вещь, как бы хранилища нет, но оно есть. Вот в чем фишка. Фишка в том, что у нас данные, они как есть, они как были в источниках, они так и остаются в источниках, они никуда не грузятся.
325: Они никак не преобразовываются, пока они нам не понадобятся. Вот как бы они становятся, они начинают как-то перемещаться только тогда, когда мы фактически нажимаем там, не знаю, там сгенерировать отчёт.
326: Там, не знаю, провести исследование по такой-то модели машинного обучения, вот только тогда они начинают выгружаться из источников, только тогда они начинают как-то перерабатываться, что-то с ними происходит. Это хорошая штука, но надо понимать, что эта штука начинает
327: Очень сильно грузить системыисточники когда, то есть при проектировании таких вот архитектур хранения. Вот нужно это учитывать, собственно, простой пример. Это тот, ну, тоже самое, банки это системы, которые
328: Обрабатывают транзакции. Если там создать лишнюю нагрузку в несколько там лишних процентов цпу на какой-нибудь oracle, который все это пилит, там довольно быстро прибегут админы и настучат по голове. Это, это нормальная история, потому что это действительн
329: Это mission critical система, как бы ну это нормально, просто надо это учитывать, когда вы разрабатываете какую-то вот такую архитектурку.
330: Вот что, давай дальше. Ну, собственно, да, вот это просто какое-то более подведение этих итогов. Вот, собственно, классическое хранилище, да, оно может хранить большие данные, но они данные
331: Нужны они, они, они там структурированы с ними все хорошо, они нам известны. Вот. И они используются для того, чтобы вот текущие потребности предприятия в данных подкрывать. Вот это чаще всего долгая, сложная, дорогая.
332: История, ну разработка такого классического хранилища, вот, но эффект от этого, ну в общем ощутимый, на самом деле, как бы это нужно делать, это важно делать. Вот data lake, это чуть более другая история, она больше про
333: Какую-то вдумчивую аналитику и исследования всяческие девелопмент. Вот.
334: Чаще это для этого нужно. То есть на самом деле основные потребители, дата Лейков это, это датасантисты. Вот, ну и дата виртуализация данных это как раз, да, это хранилище, в котором нет хранилища. Интересно.
335: Концепт, как бы, иногда он имеет место быть вполне себе. Вот. Ох, красота. Что такое модель данных? Модель данных, по сути, в классическом хранилище это вся структура его
336: Это все как бы, это таблички, как они организованы, их фор, какие-то наборы полей, типы данных. Вот, ну это все такое, какие-то взаимосвязи между табличками, может какие-то там, не знаю, индексы.
337: Ключи, что-нибудь ещё. Вот изначально в проектировании модели данных было 2 подхода, подход билла инмана и ральфа кимболла. Собственно, чем они отличаются?
338: Отличаются они, по сути, только тем, что в случае с походом инмана у нас изначально есть требования к к отчётам, и мы под ту или иную отчётность разрабатываем.
339: Так называемую витрину данных. Ну, витрина данных, по сути, это просто тоже набор табличек, которые служат источником данных, там для чего-нибудь. Ну, чаще всего отчёта. Вот, собственно,
340: Почему это называется top down, потому что у нас есть верхний слой отчётности мы знаем все требования к нему, и мы на основе этого разрабатываем структуру там таблиц полей, хранилищ как-то в более менее каком-то едином виде у кимбла немножко по другому.
341: Там наоборот, там подход как бы идёт от того, что у нас, что у нас вообще есть изначально и что мы как бы, то есть какие данные у нас есть, вот, и как нам нужно, как нам
342: Нужно, что нам с ними нужно сделать, чтобы получить любой отчёт, который нам может понадобиться. То есть, ну, немножко, просто, с другой стороны, больше со стороны, типа, ну, типа, источников скорее уходит. Вот, ну, это все, как бы, эта история очень классическая.
343: Про это очень много всего написано, рассказано, сказано, вот как бы хорошая штука, на самом деле, вот это вот, ну, полезно вот это вот хорошо знать, но есть более новые, более прикольные вещи. Вот.
344: Например, дата волт дата волт это просто, это скорее такая уже более, чуть чуть более техническое описание, как именно нужно хранить данные, как и
345: Именно в табличках нужно хранить их по сути есть в нашем, нашем хранилище могут быть 3 типа табличек. Собственно это 1, это hub вот ну это как раз-таки
346: Это табличка, которая содержит какие-то именно описа, именно ключи, бизнес сущности, клиент, счёт, договор, сделка, что-нибудь такое вот.
347: Хаб содержит только ключ и какие-нибудь технические поля, типа, не знаю, там дата загрузки, дата появления этой записи, там, дата появления этого ключа, может быть какой-то там, не знаю, может быть номер версии или ещё что-нибудь. То есть он не содержит каких-то описа.
348: Вещей, это как бы это такая очень просто, по сути, список ключей. Вот собственно, дальше основное это основная табличка. Тип таблиц это линк. Вот линк, по сути, просто говорит, как
349: 2 бизнес сущности между собой соотносятся, как, допустим, могут соотноситься счета и клиенты. Вот у какого клиента, какой счёт, ну, как бы, в общем, тоже довольно логичная история и тип, 3 тип таблиц это сатилит.
350: Вот, ну по сути, это как раз-таки вот это все вот уже описательные данные по бизнес сущностям, то есть, допустим, для клиента какого-нибудь это инфо.
351: Фамилия, отчество, место рождения, дата, ещё что-нибудь. Вот как бы это уже, собственно, сама сама мякотка того, что там хранится, что с ними интересного на самом деле у 1 хаба может быть несколько сатилит.
352: Ну, простой пример, для чего это нужно? Вот у вас есть клиенты, и по ним информация может приходить из разных источников. Вот, ну, вы можете завести просто несколько сатилитов, которые будут хранить только те поля, ну, которые
353: Будут приходить из того или иного источника. То есть, допустим, 1 сатилит у нас будет хранить данные по клиенту из колл центра, а другой из, не знаю, из его какой-нибудь анкеты или ещё что-нибудь, вот, как бы, ну это нормально вполне себе. Вот.
354: Что интересно, дата волтом это все хорошо, это все. Ну для чего это нужно? Это нужно для того, чтобы просто облегчать. Во первых, проектирование модель данных такой, во вторых, это все хорошо развивается. То есть
355: Если нам нужно добавить какую-то новую сущность ну что мы добавляем? Мы добавляем да хаб мы добавляем нужные таблички связей мы добавляем утилиты все, все просто все просто легко понятно нам не нужно перелопачивать с десяток таблиц каких-нибудь там добавлять них куда какие-то
356: 1 в 1 табличку, 1 поле, там в другую ещё какую-нибудь. Это все легко развивается. У этого есть недостаток. Вот угадайте какой.
357: Да нет, неизбыточность на этом построить отчёт, когда это все начинает, это все же нужно джойнить, все это нужно объединять, как бы, да, да, да, это как бы как хранилище, это может убить. Вот.
358: Причём, что забавно, товарищ, который это разработал, честно, не помню, как его зовут, товарищ, который это разработал.
359: Всю историю с хабами, линками, с утилитами, как бы про то, как они сделаны, он в более менее открытый доступ выложил. А вот информацию о том, как с этим жить, только на платных курсах рассказывает. Вот, как бы, да, абсолютнейший маркетинг прям.
360: Классно. Он молодец, наверное. Вот. Но и это не предел, да.
361: Угу.
362: Ну да, как бы, да, грузить, грузить это все тоже можно в параллель.
363: А потом уже в нормальном режиме. Угу.
364: Да. Угу. Ну да. Ну да, действительно, да, согласен. То есть, ну, загружать это все можно довольно быстро и параллельно, и классно. Вот. Ну, да, да, потом, да, потом это, конечно, надо все ещё.
365: Да. Угу. Ну да, сейчас, да, хорошо, спасибо. Вот. Но это тоже не предел. Появилась задача.
366: Появилась необходимость у некоторых компаний вот такую модель данных, модель данных хранилища очень быстро развивать и модифицировать. Вот, ну, допустим, пример, как раз пример, про который я про это узнал.
367: Это все называется ann моделинг. Вот эта модель данных это жесть на самом деле. Вот 1 пример.
368: Откуда я про эту штуку узнал? Это компания авито. Вот, собственно, там все очень просто. У них действительно хранилище построено по такой, по такой модели он очень, очень, очень легко добавлять новые поля, добавлять новые сущности, потому что, по сути,
369: Таблички все в 6 нормальной форме. 6 нормальная форма нам гарантирует, что дальнейшая нормализация без потери данных невозможна. Вот по сути, все таблички это либо просто
370: Список ключей, вот либо связка, связка 2 ключей, каких-то, ну 2 сущностей, либо ключ и строго 1 атрибут. Вот соответственно очень как бы для любой сущности.
371: Клиент, например, да, очень легко добавить новое поле. Мы добавляем новую табличку.
372: Да, да, да, да, да, это все, это очень легко, да, как бы изменяется, модифицируется и управляется. И это тоже можно очень классно загружать параллельно все очень быстро. То есть в авито, например, это работает как часы, по моему.
373: Но это ещё больше куча джоинов. Когда нам нужно построить какой-нибудь отчёт, естественно, как бы это тоже нужно учитывать. С этим надо жить. Вот, да.
374: Да, все так, как бы это на этом хорошо. Можно построить ядро, хранилище, как бы, отчёт, да, как бы уже, уже чуть чуть более сложная история, да, действительно, ночные.
375: Загрузки, ночные бачи, вот все такое. Это вот что моделинг, что data world это больше про удобство проектирования модели данных. И да, вот удобство загрузки туда. Вот, то есть это как бы
376: Это вот это вот нужно знать когда вы разрабатываете такую штуку типа хранилища или data lake, там какой-нибудь ну в data лейке ладно, там нет как бы моделей может быть, но допустим хранилище надо знать вот.
377: Вот. Ну это просто на самом деле такая подбивочная того, что здесь было. Вот, собственно, это 2 первые, первые, 2, это классические, ну, слева.
378: Справа классические подходы инмана и кимбла, там все как бы достаточно просто понятно, как бы просто их надо знать, вот, знать, использовать, учитывать. Вот, ну, дата, волт, н, Модулин, как бы, д.
379: Это обсудили это про удобство разработки моделей данных и высокой степени параллельности загрузки.
380: Вот что ещё? Ну, классические подходы. Что такое еть, элти, вы же знаете, что это такое.
381: Хорошо. Собственно, это прям вот это вообще прям классика. Классика всего, всего, всей работы с данными. Практически экстракт. Еть елт это экстракт.
382: Transform лот, либо экстракт, лот, трансформ, сути, по сути, это просто стадии загрузок данных. Экстракт это извлечение их из источников трансформ, это какое-то их преобразование к нужной модели данных, или нужной структуре, или какой-то агрегации расчётов, ещё чего-нибудь.
383: Лот это загрузка их в хранилище. Укладка как фактическая. Основное отличие только в том, что
384: Что для в случае с етль идёт действительно строго извлечение преобразования, для чего нужен какой-то промежуточный слой, там, не знаю, етль, сервер какой-нибудь отдельный, на котором какая-то молотилка происходит, либо ещё что-нибудь, а
385: Salty это чуть ну чуть более тоже современная история чем теле потому что вот это это вообще классика прям очень классика элти чуть поновее мы сначала данные загружаем в хранилище и уже там уже начинаем на месте их преобразовывать вот это, это как бы чуть более
386: Простая, ну, как бы, может быть, чуть более простая история, потому что у нас нет промежуточного слоя. Вот как бы, сейчас, на самом деле ли, наверное, все-таки.
387: Чаще используется, я думаю, так, да, вот как-то так. Ну да, это просто как бы тоже классические вещи, которые на самом деле просто хорошо знать, когда вы начинаете работать с какими-то системами данных. Вот просто
388: Просто полезно для общего развития. Вот дальше.
389: Что такое лямда, архитектура, я уже, я уже упоминал. Вот это такое, это развитие, на самом деле, итля или ит процессов эти вот в чем история. История в том, что
390: Классические и процессы это штуки, которые работают очень, очень долго, перемалывают кучу информации, и в результате данные в хранилище оказываются с довольно-таки существенной задержкой, то есть, допустим,
391: Может так случиться, что вот сегодня у нас доступны данные только за вчера, а нужны свеженькие. Нужно, нужно сегодня, собственно, с этим надо было как-то жить. И ребята придумали, не помню честно, кто ребята придумали такую
392: Штуку, они просто разбили поток загрузки данных на 2, как бы основное, основная какая-то молотилка. Основное перемалывание данных происходит по классике ночью, например, или там, не знаю, там, может, раз там, раз в час или
393: Ещё когда-нибудь. Ну при этом они все нормально, все обсчитываются с ними, все хорошо, хорошие, качественные данные с ними, с ними все классно. Вот. А те, что нам нужны прямо сейчас, они
394: Грузятся в реалтайме, они как-то обрабатываются не сильно так, чтобы это можно было делать в реалтайме, но при этом, как бы, чтобы от этого был какой-то смысл. Вот. И, в общем, укладываются просто рядышком, вот рядышком с нормальными архив.
395: Как бы не архивно, а вот такими батчами посчитанные, хорошие, красивые. Вот таким образом мы получаем на некотором отдалении от текущего момента времени хорошие актуальные, качественные данные и все, что
396: Есть дальше все, что новее этого, оно есть в этом, как бы основная фишка, оно есть хотя бы, вот, да, оно, может, там не, не самое точное, не самое качественное, но оно, оно есть, это важно как бы.
397: Это можно уже использовать. Вот, собственно.
398: Вот есть такая тема. А потом появились ребята, которым, которые сказали, нам бач не нужен, типа, не нужен нам, мы интернет компания, нам кликстрим интересен прямо сейчас, который происходит. Нам интересны покупки, которые происходят прямо сейчас. Собственно, че с этим?
399: Они просто взяли и выкинули слой загрузки бочевой.
400: Это назвали, это капа архитектура, как бы, в общем, как бы там все довольно просто. Вот данные грузятся как есть, вот они как-то обсчитываются, как-то обсчитываются, вот, и
401: Передаются приёмники прям вот от от от при этом как бы история их сохраняется прям как есть. Вот при необходимости, если нам нужно поменять какую-то логику расчёта, мы можем, допустим, просто поток остановить или поднять даже
402: Рядышком рядом, идущим параллельно с новой версией обсчётов алгоритмов, просто прогнать его на истории, когда история вся прогонится, уже по новому рассчитанная, мы переключаем просто реалтаймовые данные. На вот.
403: Новую версию нашего потока загрузки. Вот крутая штука, вот это очень круто. Вот, но как бы это, у этого есть своя специфика. То есть, допустим, какой-нибудь слож,
404: Отчёт на этом строить. Ну, может быть тяжеловато. Вот. Но это тоже используется. Тоже нормальная штука. Вот, собственно, тоже, опять же, подбивочно того.
405: Че это все, что это все есть ну хители это простой прям это, это классика классика. То есть, ну там все очень просто понятно. Нам нужно какой-то мощный сервачок, на котором нам данные поступающие будут как-то обрабатываться. Че с ними будет происходить? Вот.
406: В случае, в случае с большими данными это может стать узким местом, потому что нам нужен какой-то выделенный, ну не знаю, условный сервер, и в какой-то момент его может начать просто не хватать. Вот как бы, потому что, ну, если у нас данные растут,
407: А сервер, он как бы там бесконечно расти не может, как бы это на просто нужно понимать, что у этого есть свои просто просто физические пределы. Вот. Ну и да, как бы лет это
408: Только про большие загрузки бач режиме, там как бы real time там, ну в общем, наверное, не будет. Либо, ну можно делать, конечно, весёлые вещи, типа перегружать хранилище каждые 5 минут. Вот.
409: Можно делать так, как бы это, это будет почти реал тайм. Вот в принципе тоже кого-то это нормальная история вполне себе.
410: Вот лямбда нам даёт данные практически в реальном времени, но там может быть с небольшой потерей точности капа нам даёт данные прям вот как есть вообще прям вот прям сейчас и полную историю. Вот. И возможность как бы просто менять процесс.
411: Загрузки. Ну, относительно, на лету. Вот, собственно, по поводу сайнса. Ну, наверное, много сильно по этому поводу рассказать, наверное, не смогу. Да, он есть, в общем то.
412: Как бы при этом сейчас, может, может, может случаться так, что алгоритмы как бы машинного обучения, алгоритмы искусственного интеллекта, они могут выступать не только как потребители.
413: Из хранилища, вот которым нужны какие-то данные там для анализа, какое-то прогнозирование чего-нибудь такого, они могут выступать как часть етеля. То есть это нормальная история. Вот там даже та простой пример.
414: Это как раз прогнозирование поломок. У нас есть поток, в котором у нас крутится там моделька машинного обучения, у нас есть, у нас есть поток данных с датчиков, и мы в реальном времени обсчитываем эти данные, делаем по необходимости.
415: Поднимаем флажок к оператору, он идёт, меняет какую-нибудь гайку и у нас все хорошо. Вот собственно плюс ещё что можно делать? Ну конечно вот про искусственный интеллект. Ну маркетинговое слово.
416: Очень, как бы, не знаю, я лично считаю, что у нас пока искусственного интеллекта нет, у нас есть нейронные сети, которые умеют котиков распознавать, как бы, и поломки. Вот с интеллектом пока туговато, как мне кажется, не очень.
417: Интеллектуальный.
418: Вот, но, может быть когда-нибудь все же будет что-то получше. Вот он начнёт понимать какие-нибудь, знать 3 закона робототехники, ещё что-нибудь светлое будущее, все дела, трансгуманизм. Вот по поводу
419: Опасности и управления. Вот это на самом деле, такие вопросы очень, очень свежие. Ну, вообще, в принципе, вся история с большими данными, она довольно свежая. Вот, то есть, как, ну, там помните, да, там начиналось все та
420: Условно, там в начале двухтысячных, может быть, и то активно это начало развиваться там только последние несколько лет. Вот. Поэтому больших данных на самом деле с безопасностью так себе, если честно, как бы гораздо
421: Проще все, чем в каких-то хороших современных там, ну хороших таких классических субдшками и ещё что-нибудь вот как бы, но что-то есть, вот что-то есть, то есть какую-то безопасность мы можем
422: Достичь какой-то уровень безопасности. Более того мы даже этими данными теперь можем как-то рулить. То есть мы можем узнавать, что у нас вообще за данные есть, откуда они пришли, как они появились, как они были
423: Изменены в процессе нашей загрузки. Вот мы можем отвечать на какие-то вопросы, типа, что и мы ещё можем с этими данными сделать. А какие у нас ещё данные есть? Вот это вот управление данными, да, вот это вообще очень свежая тема в больших, да.
424: Вот, и она вот только, только вот как-то развивается. Вот поэтому на самом деле там рассказать то можно про неё не очень много, но что-нибудь расскажем. Вот по сути, собственно, что сейчас есть в бигдате по поводу
425: Во первых, можно обезопасить перемещение данных. Ну, это, по сути, просто шифрование каналов связи вот с этим, ну, как бы особо ничего не сделаешь. Вот мы можем обезопасить хранение данных, шифрование.
426: В общем то все мы можем разграничить доступ мы можем не пускать всех подряд. Вот, ну как это делается, ролевые модели политики доступа, интеграции с какими-нибудь корпоративными системам.
427: Типа active directory, где заведён ваш там логин, пароль, вот это интеграция какой-нибудь другой системы, где может быть заведён ваш логин, пароль, ну там единый на все предприятие. Вот на самом деле все это довольно просто, как бы оно есть. Вот, но
428: Ну вот пока что вот так вот и сказать, что это какой-то rocket science. Ну, в целом все гораздо лучше, чем год назад, потому что год назад половины этого не было, например, ну вот.
429: Как-то так. Ну по поводу управления данных данными это вам, вам, по моему чуть попозже будут про это рассказывать ещё все-таки вот.
430: По сути, это просто признание того, что данные это актив предприятия, он может приносить прибыль и что, что этот актив надо как-то контролировать. Раньше такого тоже не было. Вот.
431: До этого тоже там относительно недавно начали доходить. Вот. И управление данными сейчас это очень крутая штука, которая очень популярна, если хотите этим работать.
432: Короче, это хорошо оплачивается. Вот.
433: Вот как так? Ну, на самом деле, правда, про это, наверное, не сказать, что можно как-то много про это расска, что вообще есть. То есть, по сути, это просто
434: Набор скорее даже каких-то методик может быть каких-то рекомендаций про то как, как с этим жить, вот как, как, как понимать, откуда данные пришли, как понять какого они формата
435: Понять, какие ещё есть, каких ещё не хватает. Вот. То есть это просто направлены просто на ответы на такие вопросы. Вот как управлять справочниками, не знаю, как нам.
436: Управлять какими-то данными. Как нам понимать, что вот, вот этот, что вот эти данные правильнее, чем одни данные правильнее, чем другие. Как понимать, что у нас есть где-то ошибка, вот это
437: Такие вот довольно философские размышления, скорее вам про это ещё будут рассказывать. Правда, вспомнил. Вот.
438: Собственно, ну на самом деле мы уже завершаемся потихоньку, осталось то немного всего. Вот я просто хотел ещё как-то вот так вот такую сборную соляночку, просто про то, как вообще, что ещё там может быть, какие ещё вопросы будут, скорее всего.
439: С какими вопросами вы будете сталкиваться, когда начнёте зниматся вашими данными? Вот, в общем, ну, давайте пойдём. Собственно, чаще всего, ну, часто возникает вопрос, а
440: Вот как бы вот у нас есть какая-то платформа, да, а где нам её развернуть? Вот прям вот где вот, то есть где тот сервак, где тот, где тот кластер серверов, на которых мы поднимем нашу тонну виртуальных машин, на которых мы будем молотить какой
441: Машинное обучение и делать ещё что-нибудь. Вот, ну как бы на самом деле вариантов то, да, не сказать, что много.
442: Варианта 3. 1, он премис так называемый, это классическая, классический процесс, когда все активы, все, все, все, все, все, все данные хранятся на оборудовании, на предприятии, то есть
443: Это прям классика, когда покупаются сервера, когда они закупаются для определённых целей, на них разворачивается нам нужный софт. Вот как бы это очень такая
444: Стандартная история, как бы её многие любят, потому что действительно у нас при этом мы понимаем, что данные, они, в общем то, они у нас с ними все хорошо. Мы знаем, что, что за железка работает. Мы знаем, что мы видим эту железку, мы можем её, если надо.
445: Выключить можем её поменять, мы можем её выкинуть к чертям, если что, если она надоест. Вот это хорошо, но это дорого, потому что, во первых, сервера все-таки довольно дорогие обычно, особенно какие-нибудь там, какого
446: Серьёзного корпоративного уровня. Вот для этого, собственно, этим серверам нужна какая-то поддержка, то есть их, их нужно, их нужно сопровождать, потому что если он сломается просто так и у вас нет там квалифицированного системного администратора
447: Вы попали, вот как бы, да, это дорого. Есть вариант чуть подешевле. Ну как не совсем, конечно, разворачиваете в облаке. Вот при этом вы, в общем,
448: Всю заботу об инфраструктуре на себя берет облачный вендор, ну, там майкрософт, или amazon, или там, не знаю, вот, допустим, сейчас яндекс там начал все делать, как бы, ну, это нормальная история.
449: В принципе, что с этим можно делать? Чем это хорошо? Точнее, хорошо тем, что, во первых, мы можем легко масштабироваться. То есть, если нам нужно, ещё понимаю, что нам не хватает десяток серверов, нам нужно ещё 10, мы
450: Не должны проходить через какую-то процедуру закупки этих 10 тачек. Мы просто их кликаем и поднимаем. И вот они есть, с ними все хорошо. Вот они, пожалуйста, они оплачиваются по часам, вот как бы по часам работы, например, или там
451: Не знаю, они арендуются на месяц, если мы понимаем, что теперь нас, нас, серверов, слишком много, мы можем просто половину погасить, и мы не будем за них переплачивать. Вот.
452: Но как бы, чем это на горизонте событий, какого там нескольких лет может быть плохо на самом деле, это все-таки в итоге, там, там, за несколько лет это может быть дороже, чем просто.
453: Sevak и как-то как то с ним жить. Вот плюс ну понятно, как бы многие, многие могут беспокоиться, что ваши данные, по сути, находятся не у вас, они находятся где-то в каком-то центре обработки данных, где-то там может быть у
454: Непонятно, у кого они могут, они могут просто как бы утечь. Вот как-то так. Ну, в общем, такое себе тоже. Ну и, собственно, есть ещё гибридный вариант, когда у нас часть какая-то, допустим, критич
455: Критическая часть нашего, нашей платформы, бабки данных находится прямо у себя на серверах, на наших, там, на наших жёстких дисках. А какая-нибудь часть, которая там, ну, не так критична, она.
456: Может просто быть развёрнуто в облаке. Это нормальная история вполне вот как бы так можно делать. Ну как бы тут на самом деле основная проблема, это необходимо все это сынтегрировать. Вот, потому что нужно, во первых, как-то открывать доступ.
457: К облаку из там инфраструктуры компании, это тоже может быть там дыра в безопасности потенциально. Вот там не все безопасники могут на это согласиться. Вот как бы мы как бы миримся с тем, что часть данных у нас все-таки не у нас. Вот
458: Ну, как бы более менее это как-то живёт нормально. То есть такие решения тоже есть, и их тоже стоит учитывать, когда вы разрабатываете какие-то такие проекты по обработке больших данных. Вот это вот, собственно, что ещё?
459: То есть, вот эти все. Иас, Паас, саас, то есть, че там ещё есть сейчас face ещё что-нибудь? Ас ас ас ас, собственно, чем они отличаются?
460: Они отличаются на самом деле только тем, что вот то есть видите вот просто какие основные компоненты инфраструктуры есть сеть, хранение сервера какие-то
461: Гипервизоры виртуальных машин, какая-то операционка, может быть какой-то ещё там платформа. Кстати, вот middle ware, да, Мидлер, это как раз-таки вот хадуп, например, на этом уровне где-то находится на middle. Ware. Это вспомогательное, по, вот это наши данные.
462: Это наше приложение, которое у нас обрабатывает наши данные. И вот уровни аас, отличаются только тем, что часть забот на себя берет облачный вендор. Вот, то есть, допустим, в случае с инфраструктурой, как бы вендор берет на себя
463: Только по сути железо. То есть он предоставляет нам только сервера и виртуалки. Говорит, что дальше делай с ним че хочешь. Сам накатывай операционку, сам раскатывай, сам раскатывай какой-нибудь субд, сам раскатывай хадупы и вообще делай все дальше. Сам. Я ничего не зна.
464: Вот тебе железки, вот в случае с платформой он тебе предоставляет уже чуть больший набор. То есть он тебе предоставляет ещё сразу и уже готовые настроенные программные компоненты типа того же самого хадупа.
465: Вот по сути тебе остаётся только написать твои потоки загрузки данных обработки и просто хранить там данные это все, что там тебе достаточно делать. Ну и собственно saas это когда вообще все за тебя делают. Вот
466: Ну, в общем, как бы это тоже нормальная история. Вот как бы так тоже можно жить вполне себе. Вот как выбирать по собственно.
467: Можно всегда, как бы, ну, собственно, да, как бы, вариантов сейчас масса есть куча опенсорсного всего софта, есть куча корпоративного кровавого интерпрайза. Вот. И есть, если этого не хватает, есть возможность всегда сделать че то самому. Вот.
468: Как бы как с этим жить ну как бы open source че опен сорс пожалуйста конечно полностью открытый можно его взять если при необходимости переписать, дописать вот как бы техническая поддержка тоже много там за.
469: Просто много у кого есть там, у того же хадупа, их несколько вариантов там, не знаю, у спарка, у кафки етли, да, все это есть нормально. Техническая поддержка, все это окей при этом.
470: В принципе, можно, исполь, можно, можно как бы за это не платить, но на самом деле опен сорс это не бесплатное по ни разу, хоть так и кажется, потому что, потому что за
471: Использование софта придётся платить либо технической, либо необходимость как раз все это поддерживать и развивать вот, либо тем, что это будет какое-то полуработающее.
472: На коленке поделка, которая может и работать совсем не так, как вы ожидаете. Вот есть вариант, как бы отказаться от этого закупать дорогие кровавые интерпрайзные софт.
473: Типа, не знаю, каких-нибудь там етель инструментов, не знаю, сас, дата, интегрейшн, студия, информатика, оракал, ещё что-нибудь, это все будет работать, это все классно, как бы, оно все, в принципе, нормальное. Вот. Но стоит обычно это каких-то
474: Денег совершенно как бы, и просто далеко не всегда, не все на это готовы пойти. Вот, потому что, ну, не знаю, там тот же самый саб закупать это, ну, не знаю, я бы не стал, наверное, вот.
475: Плюс как бы ещё есть такая вещь, как вендор Локин. Это привязка тебя к определённому вендору, ты, может, может сложиться такая история, что закупив какую-то крутую штуку.
476: И потом, поняв, что она на самом деле не очень может получиться. Так что, а с неё ты уже и не перейдёшь. Вот как бы у тебя уже столько всего на ней сделано, что ты просто просто не можешь с неё слезть. Вот.
477: Ну и как бы тогда ещё есть вариант просто сесть и написать самому то, что тебе нужно. Вот в линтере так сделали с кафкой. Они сели, написали, вот, потом выпустили нормально. Хорошая штука работает, круто очень с ней все классно.
478: Как бы, но это нужно взять, написать это нужно нанимать разработчиков, нужно нанимать тех, кто это все как-то будет продвигать, кто будет раздавать пинки, вот, и строить какое-то
479: План всего этого как бы, ну, такое себе, как бы, это, это реально хорошая, серьёзная разработка. Вот, ну и как бы, может случиться так что вы пишите, пишите, пишите, а потом кто-нибудь приходит и говорит, ребята, это давно уже за ва.
480: Сделали. Че вы, зачем вы это делаете? Ну, в общем, как бы это интересная тема, но сложная. Вот заблуждение распределённых вычислениях. Вот это очень важно.
481: Вот, собственно, практически вся история с большими данными это про распределённые вычисления, потому что на 1 на 1 машине больших данных может не быть большие, они большие, они чаще всего как раз обрабатываются.
482: Распределённое, нормальная история. Вот, и когда вы разрабатываете какое-то решение, завязанное на распределённые вычисления, вот вот эти вещи, их нужно держать в голове вот как бы постоянно вот
483: Потому что если их не учитывать, то можно получить очень интересные спецэффекты. Вот. И в итоге вообще отказаться от истории с бигдатой и послать все к чертям, и уволиться и уехать в Малайзию.
484: Вот, в принципе, кстати, нормальный вариант. Вот. Но лучше просто учитывать вот эти штуки. Вот. Ну, по сути, на самом деле, там в основном история про то, что есть ограничения сети, есть ограничения на какую-то
485: Безопасность и на доступность. Вот есть ограничения могут быть на людей администратор, вот как бы его может приехать автобус и как бы это очень грустно. Ну это на самом деле, это не только про распределённые вот это
486: Просто в принципе есть такая тема. Иногда бывает, что людей переезжает автобус, к сожалению, вот. И ещё в распределённых системах очень важно учитывать кап теорему и pace си теорему. Вот по сути кап теорема это про то, что есть
487: Свойства, согласованность данных, их доступность и устойчивость к вот, собственно, вот этого вычислительного кластера к какому-то разделению из них надо выбирать. Из них надо выбирать только 2, 3 нельзя. Вот.
488: Ну по сути, просто на самом деле, когда и такое решение, надо просто выбрать что-то из этого, что вам менее всего критично отказаться от этого и в зависимости от того, что у вас получится c a, ap или cp.
489: Решение просто выбрать продукт, который соответствует таким вещам. Вот, то есть, ну, как бы, собственно, какие могут быть проблемы, как бы, может упасть сетка и тогда все как бы у вас
490: Становится вот у вас там, может быть какие-то данные там, не знаю, вы читаете с 1 узла, читаете одни данные, а с другого другие несогласованность. Вот. Либо как бы, может быть получится так что часть данных вы прост.
491: Будет вообще недоступно временно, как бы, ну, надо просто выбрать на самом деле. Вот если, если у вас возникает такой вопрос, идите в google, вбиваете сиэй, или spp, или app.
492: И ищите такой продукт, используете его и нормально с этим можно жить. Вот. Но какие-то ребята решили, что кап это не круто, надо больше букв, вот больше. Вот.
493: Собственно, песели это такая развитие этой идеи про то, что можно выбрать любые 2. Вот, по сути, они говорят, что у вас есть вилочка, как бы вот
494: Не, не, так, что у вас все, все 3 свойства равноправные, а в начале все-таки, как бы ты отвечаешь на вопрос, как бы есть тебя возможность того, возможность того, что у тебя
495: Может быть, разделить тебе кластер на 2, например, или на 3, или нет. Если есть, то ты можешь выбирать как бы между доступностью данных и их консистентностью. Вот что-то 1 из этого ты можеш
496: А если у тебя разделения сети нет или не бывает, вот, то ты выбираешь между консистентностью и задержкой получения, то есть просто получение ответа там на твой вопрос. Вот, ну, по сути, как бы тоже, на самом деле, почти все системы, которые
497: Сейчас используется, они, в принципе, по, вот, по что, по кап теорема, что по с, они более менее как-то классифицированы. То есть, в принципе, на этот вопрос можно ответить просто точно также google, вот.