ym104432846
Вставьте ссылку на видео из Youtube, Rutube, VK видео
Задайте вопрос по видео
Что вас интересует?
00:02:50
Показатель температуры и его влияние на генерацию:
  • 1. Проблемы со стримингом на YouTube возникают регулярно, сервис недоступен для трансляции
  • 2. Решено провести трансляцию через отдельный загрузчик контента на YouTube
  • 3. ВКонтакте (ВК) функционирует стабильно, проблем с трансляцией нет
00:03:39
Использование англицизмов в речи:
  • 1. Участники обсуждения отмечают частое использование англицизмов в речи и лекции
  • 2. Высказано мнение, что большое количество новых терминов усложняет понимание сказанного
  • 3. Упоминается давняя традиция употребления англицизмов в профессиональной среде
00:04:24
Популяризация Data Science и появление нового сленга:
  • 1. В сфере Data Science наблюдается рост популярности и открытости направления после длительного периода закрытости
  • 2. Появилась широкая новая аудитория специалистов в области IT-технологий и искусственного интеллекта (ИИ)
  • 3. Возникла необходимость разъяснять сложные технические термины (претрейн-инкодеры, трансформеры, GPU) для лучшего понимания специалистами
00:04:55
Необходимость объяснения сложных терминов аудитории:
  • Участники встречи испытывают трудности с пониманием терминов и понятий, связанных с пре-тренированными инкодерами и трансформерами
  • Один из спикеров отмечает наличие профессиональной деформации, затрудняющей восприятие собственной речи аудиторией
  • Упоминаются сложности восприятия обычных слов (например, «хлеб», «микрофон») в контексте выступления
00:05:26
История развития внимания в моделях Transformers:
  • Участники обсудили историю возникновения механизма внимания (attention mechanism), упоминая статьи и законы Ньютона
  • Обсуждалась структура презентации, включающая общую картину, бизнес-кейсы, объяснение LLM и стратегию
  • Упоминалась необходимость объяснить устройство LLM («подводную часть айсберга») после общего понимания роли модели в экосистеме
00:07:58
Применение математики в образовании:
  • 1. Участники обсуждения считают важным показывать прикладное значение математики (машинное обучение, бизнес-применение) для школьников и студентов
  • 2. Предложено начать изучение алгебры, линейной регрессии и аналогичных методов с объяснения практического смысла и контекста
  • 3. Обсуждается необходимость изменения подхода к обучению математике, делая акцент на понимании её прикладного значения
00:08:42
Объяснение концепции LLM:
  • 1. Участники встречи решили обсудить понятие и применение больших языковых моделей (LLM), их особенности и ограничения
  • 2. Обозначена цель мероприятия — демистификация процесса работы LLM и переход к практическому использованию технологий в компании
  • 3. Рассматривается терминология и базовые определения, такие как «Лач лэнгвич модул», обозначающий большую языковую модель
00:09:43
Особенности работы LLM на разных языках:
  • Последовательность слов в предложениях на разных языках отличается (английские предложения более структурированы)
  • Смысл предложений на русском языке сохраняется при изменении порядка слов
  • Трансформеры и другие языковые модели по-разному обрабатывают тексты на различных языках
00:10:14
Сложность конструкции современных LLM:
  • Языковая модель эволюционировала от работы исключительно с текстом до способности обрабатывать изображения и видео
  • Рассматривается возможность расширения возможностей модели для взаимодействия с дополнительными информационными сущностями
  • Презентация визуализации структуры современной языковой модели (LLM) проведена для лучшего понимания её сложности и архитектуры
00:11:00
Понятие контекстного окна и токенов:
  • Контекстное окно модели — это объем текста, с которым модель одновременно работает и учитывает информацию
  • Современные модели имеют среднее контекстное окно около 200 тысяч токенов
  • Токены — это отдельные атомарные единицы текста (слова, пробелы, символы), различающиеся способом разделения разными моделями
00:13:49
Ограничения размеров контекстного окна:
  • 1. Модель LLM (нейронная сеть) эффективнее обрабатывает небольшие объемы текста по сравнению с большими объемами информации
  • 2. Размер контекстного окна влияет на качество восприятия информации человеком и моделью, увеличиваясь нагрузка и риски потери деталей
  • 3. Эффективность обработки информации моделью зависит от особенностей человеческого и машинного восприятия, а не исключительно от размера контекста
00:15:52
Преимущества и недостатки маленьких моделей:
  • Использование маленькой языковой модели с небольшим контекстным окном позволяет получать лучшие результаты по выделению фактов
  • Большие модели с обширным контекстом не всегда обеспечивают наилучшие показатели эффективности
  • Подразумевается, что термин «контекст» относится к способу формирования моделей в головном мозге
00:16:23
Работа с эмбеддингами и семантическая близость слов:
  • Эмбеддинги (внутренние представления смыслов, значений слов, предложений и текстов) обычно представлены векторами фиксированного размера
  • Размер эмбеддингов у большинства современных моделей составляет несколько тысяч элементов вектора
  • Векторы эмбеддингов содержат числовые характеристики, отражающие различные признаки объектов, такие как пол, принадлежность к королевскому роду и другие качества
00:18:25
Роль эмбеддингов в понимании синонимов:
  • 1. Модель способна различать написание, синтаксис и смысл слова отдельно друг от друга
  • 2. Условные синонимы (например, слова «король» и «царь») имеют схожие эмбеддинги и вектора
  • 3. Вектор общего смысла сохраняется даже при изменении исторического контекста и принадлежности к разным странам
00:19:18
Визуализация эмбеддингов и кластеров слов:
  • 1. Обсуждались способы визуализации и отображения эмбеддингов слов в пространстве системы World Туек
  • 2. Рассматривалась возможность просмотра отдельных слов и их пространственного расположения (каждое слово представлено точкой)
  • 3. Упоминалась модель векторизации слов GloVe, демонстрирующая четкое разделение слов по кластерам
00:20:05
Примеры визуализации эмбеддингов:
  • Рассматривается возможность представления значений в трёхмерной форме
  • Обсуждаются разные типы векторов и области их размещения (например, футбольные имена)
  • Предлагается разделить американские и российские фамилии в отдельных категориях
00:20:52
Исторический обзор методов векторизации слов:
  • Обсуждались различные типы эмбеддингов (векторов), используемых в датасаинсе
  • Упоминался метод бэг оф форс (мешок слов), где каждое слово представлено отдельным числом
  • Приводились примеры объектов и соответствующих числовых значений (мяч = 1, штатив = 2, кружка = 3)
00:21:22
Недостатки ранних методов векторизации:
  • 1. Обсуждалась проблема однозначной связи синонимов с числовыми значениями
  • 2. Упоминалось преимущество векторного представления объектов (шар и мячик)
  • 3. Приведен пример популярной нейросети начала десятых годов («ворд ту век»)
00:22:09
Современные подходы к формированию эмбеддингов:
  • Разработаны эмбеддинги на основе предсказания слова в центре контекста, использующие системы типа Alma, BERT и другие
  • Представлена модель «world-to-vek», состоящая из двух частей: первая часть (sibo) напоминает лук, вторая часть представляет собой механизм предсказания слов вокруг центрального слова
  • Появилась нейросеть Skip-Gram, способная предсказывать окружающие слова относительно центрального слова
00:23:25
Архитектура рекуррентных нейронных сетей:
  • 1. Рассматривались рекуррентные сети (RNN), представляющие собой полносвязную сеть с механизмом зацикливания сигналов между слоями нейронов
  • 2. Каждый новый токен рассчитывался с учетом весовых коэффициентов и активационной функции предыдущего слоя
  • 3. Обсуждалась возможность применения рекуррентных нейросетей для обработки последовательностей данных
00:23:56
Проблема утраты контекста в RNN:
  • 1. Проблема существующих нейронных сетей заключалась в постепенном исчезновении смысла контекста при передаче последующих токенов
  • 2. Ранее используемые архитектуры (RNN) теряли смысл длинных предложений и абзацев
  • 3. Современные LSTM сети представляют собой продвинутый вариант RNN с ячейками памяти, позволяющими сохранять больший контекст
00:24:42
Улучшение архитектур нейронных сетей:
  • 1. Рассматривалась возможность разделения процесса запоминания и забывания информации через отдельную функцию обработки
  • 2. Текущая реализация системы не обеспечивала эффективного запоминания важной информации и забывания второстепенной в длинных текстах
  • 3. LSTM-модели оказались неэффективны для решения проблемы взаимосвязи отдельных частей большого текста
00:25:13
Появление LSTM и GRU:
  • 1. В сообщении отсутствуют конкретные договоренности, принятые решения или озвученные факты и поручения участников дискуссии
  • 2. Упоминаются сложности расчетов и устаревшие системы обработки данных (тангенциальная функция, стм-стм)
  • 3. Указаны этапы развития технологий: использование GRU, прорывное внедрение Word-to-Vec для эмбеддингов, переход к использованию механагентов спустя несколько лет
00:25:59
Концепция механизма внимания:
  • 1. Рассматривается концепция механизма внимания (аттеншен), позволяющего нейросети понимать полный контекст текста и отношения между словами
  • 2. Упоминается использование схемы классического трансформера-инкодера для представления механизма работы нейросетей
  • 3. Обсуждается применение мультиголового механизма внимания (multi-head attention) в энкодерах нейронной сети
00:27:31
Принцип работы Multi Head Attention:
  • 1. Участники обсуждения рассматривают различные подходы к оценке взаимосвязей слов и присвоению весов в предложениях
  • 2. Упоминается использование модели multi head attention (multi-головое внимание), демонстрирующей зависимость между словами
  • 3. Обсуждаются три типа больших языковых моделей (LLM), включая декодер-онли архитектуру, возникшую в 2019 году
00:28:18
Использование BERT и его преимущества:
  • 1. Модель инкодера (Берт) способна преобразовывать предложения в семантические вектора, отражающие схожесть смыслов разных формулировок одного и того же понятия
  • 2. Системы на основе Берт-а применялись для анализа намерений пользователей в чат-ботах, позволяя корректно интерпретировать запросы от клиентов ЖКХ
  • 3. Параллельно с моделями типа Берт начали развиваться декодеры-трансформеры, расширяя возможности обработки естественного языка
00:29:50
Различия между Encoder Only и Decoder Only моделями:
  • Трансформеры используют токенизацию и заранее обученную матрицу для присвоения значений словам, после чего генерируют последующие слова
  • Изначально трансформеры не получили широкого распространения из-за недостаточной качества моделей и сложности практического применения
  • Decoder-only модели оказались неэффективны и дороги для повседневного применения, особенно на мобильных устройствах
00:31:47
Препроцессинг данных и фильтрация:
  • 1. Рассматривается возможность применения продвинутых методик парсинга данных из определенных узлов интернета (например, Википедия, научные публикации)
  • 2. Извлечённые данные требуют тщательной фильтрации и очистки от нерелевантной информации (рекламные вставки, заголовки, баннеры)
  • 3. Для улучшения качества тренировки модели важно выделять осмысленные фрагменты текста из очищенных данных
00:32:32
Выбор доменов и языков для обучения:
  • 1. Рассматривается возможность фильтрации данных по языкам и доменам перед началом обучения модели
  • 2. Обсуждается необходимость удаления мусорных сайтов, вредоносных ресурсов и дубликатов
  • 3. Вопросы фильтрации рассматриваются теоретически и требуют уточнения практических шагов реализации
00:33:03
Удаление персональных данных:
  • 1. В топовых версиях продукта Interpray персональные данные пользователей не используются для обучения модели
  • 2. Во всех остальных версиях продукта данные пользователей применяются для обучения системы
  • 3. Возможность контроля обработки данных на серверной стороне отсутствует
00:34:12
Обучение LLM и предсказание следующего слова:
  • 1. Рассматривается возможность обучения модели для предсказания следующего слова по заданному контексту
  • 2. Обсуждается эффективность текущего подхода обучения модели и её способность прогнозировать слова в предложении
  • 3. Не уточнено, какие конкретные решения были приняты относительно дальнейшего развития модели
00:34:43
Качество обучения и объем данных:
  • Модель нейросети обладает большим объёмом сжатых знаний и эффективно обучена на обширной языковой выборке
  • Процесс обучения модели заключается в компрессии исходных данных до компактной структуры
  • Качество и эффективность работы модели зависят от степени сжатия заложенных в нее данных
00:35:13
Компрессия знаний в модели:
  • 1. Обсуждалась проблема избыточности объёма модели и недостаточной компрессии при большом количестве переданных данных
  • 2. Упоминалось существование слухов о продолжении исследований и появлении новых версий моделей
  • 3. Рассматривалась гипотеза возникновения некоторых явлений неожиданно («внезапно») и спонтанно
00:35:54
Дообучение и модификация моделей:
  • 1. Процесс дополнительного обучения модели называется файнтюнинг (fine-tuning), который выполняется чаще, чем полная переобучение (pretraining)
  • 2. Стадия полного переобучения (pretraining) проводится редко, обычно один раз в год, включает сбор новых данных, создание новой архитектуры и корпуса текстов
  • 3. После стадии файнтюнинга модель переходит от простого предсказания следующего токена к выполнению конкретных запросов и инструкций, становясь помощником, отвечающим на вопросы и выполняющим команды
00:38:46
Реинфорсмент лёрнинг и обучение с подкреплением:
  • 1. Концепция обучения с подкреплением (реинфорсмент лендинг) заимствована из методов дрессировки животных, где используется поощрение за правильные действия
  • 2. В обучении нейросетей применяется подход оценки результатов модели через лайки/нелайки пользователей
  • 3. Изначально термин «информен ленгинг» ассоциировался с обучением животных, а не с современными нейросетями
00:40:01
Влияние человеческого фидбека на поведение модели:
  • 1. Разработана дополнительная модель, способная оценивать и корректировать ответы первой модели, делая их дружелюбнее и полезнее
  • 2. Первая модель общается вежливо, дружелюбно и услужливо, начиная предложения с обращения к собеседнику
  • 3. Пример поведения GPT: чрезмерное льстивое поведение, преувеличение значимости вопросов собеседника и искусственное подчеркивание уникальности его мыслей
00:41:19
Галлюцинации и причины их возникновения:
  • 1. Модель машинного обучения иногда генерирует ложную («галлюцинационную») информацию вследствие некорректной постановки вопросов пользователями
  • 2. Разработчики внесли изменения в алгоритм модели, чтобы она реже соглашалась с заведомо неверными утверждениями пользователей
  • 3. Изменения направлены на повышение точности и достоверности выдаваемых моделью результатов
00:41:48
Безопасность и этика обучения моделей:
  • Обучение моделей машинного обучения включает три основных этапа: сначала модель обучается предсказывать следующий токен (слово), затем переходит к ответам на конкретные вопросы, и последний этап направлен на улучшение вежливости и безопасности ответов
  • В процессе генерации текста каждая следующая фраза модели является результатом сложной работы большого трансформера, который учитывает вероятности всех возможных вариантов слов
  • Мощности современных датацентров используются значительными объемами электроэнергии, особенно при работе крупных моделей, таких как GPT-3
00:49:56
Гиперпараметры моделей и настройка генерации:
  • Для управления креативностью и вариативностью генерируемых моделей используется параметр температура (temperature), который влияет на распределение вероятностей выбора слов моделью
  • Параметр топ-k ограничивает количество токенов, участвующих в выборе наиболее вероятных вариантов, а параметр топ-p определяет максимальную суммарную вероятность токенов, учитываемых моделью
  • Для завершения генерации текста используются различные механизмы контроля длины вывода, включая встроенные сигналы окончания предложений и возможность задания максимального числа токенов при работе через API
01:06:49
Проблемы обработки речи и аудио:
  • Модель планируется обучать на аудиоданных с естественным произношением речи для улучшения понимания контекста и эмоциональной окраски высказываний
  • Обучение модели на реальных аудио поможет точнее интерпретировать речь человека (сарказм, шутки)
  • В результате обучения ожидается улучшение распознавания смысла и эмоций в словах говорящего
01:07:20
Использование мультимодальных моделей:
  • 1. Видеоряд подается преимущественно напрямую через видеоряд, поскольку другие способы невозможны
  • 2. Между отдельными слайдами существует взаимозависимость, аналогичная зависимости токенов в мультимодальной модели
  • 3. Цель мультимодальной модели — объединить текстовую, аудиальную и визуальную информацию в единое целостное внутреннее представление
01:08:37
Принцип работы ризонирования и мультизадачности:
  • 1. Разработана технология ризонинг, позволяющая модели самостоятельно анализировать результаты генерации и декомпозировать задачи на подзадачи
  • 2. Модель разделена на небольшие специализированные блоки, каждый из которых отвечает за выполнение конкретных функций
  • 3. Применение технологии ризонинг позволило компании Dipsi значительно повысить популярность своего продукта в прошлом
01:10:01
Инструменты и функции моделей:
  • Разработан единый эмсипи-сервер для унифицированного доступа моделей ко всем корпоративным системам (Сирм, БИАй, витрины данных)
  • Эмсипи-сервер выступает центральной точкой доступа для всех моделей, независимо от принадлежности и источника разработки
  • Предложено решение организовать совместный доступ корпоративных систем и моделей через единый универсальный интерфейс эмсипи-протокола
01:12:55
Локальное развертывание моделей и использование API:
  • Участники обсудили возможность запуска моделей локально (on-premise), используя собственное железо или арендуя облачные API-сервисы
  • Рассмотрели варианты работы с моделями через графические интерфейсы браузера или специализированные студии разработки, такие как Lm Studio и Am Studia
  • Обсудили способы загрузки и настройки различных моделей, включая поддержку инструментов и визуальных функций обработки изображений
01:18:23
Основные паттерны взаимодействия с моделями:
  • 1. Обсудили возможность использования токенов в модели, решение пока не принято
  • 2. Рассматривают два основных паттерна общения с моделью: прямой вопрос (дарик-промти) и пром-инжиниринг
  • 3. Второй паттерн предполагает использование методов структурирования запросов, таких как социальные сети («трио соц»), деревья решений, цепочки рассуждений и другие подходы
01:19:08
Работа с корпоративными данными и рег-системами:
  • 1. Для повышения эффективности работы моделей предложено три способа обогащения знаний: прямой ввод данных в промпт, использование ретрива (рег-системы), позволяющей извлекать необходимые данные из базы, и дообучение (файн-тюнинг)
  • 2. Рассматривается возможность проведения отдельного занятия по вопросам рег-систем, которое организуют коллеги
  • 3. Внедрение подхода, при котором модели получают доступ к инструментам и данным компании, рассматривается как важный этап превращения модели в полноценного агента, обладающего возможностью взаимодействия с системами и выполнения запросов пользователей
01:21:39
Применение системных и пользовательских промтов:
  • Участники обсудили важность четкого описания роли модели (например, воспитателя детского сада, менеджера по продажам), влияющего на характер ответа
  • Предложено использование различных форматов ответа модели, включая JSON-файлы, CSV-таблицы, картинки и другие мультимодальные данные
  • Упоминалось преимущество написания простых англоязычных запросов перед сложными русскоязычными, однако отмечено, что качество работы современных моделей зачастую не зависит от языка запроса
01:27:06
Оптимизация и настройка моделей:
  • Обсуждались отличия системного и пользовательского промта в работе моделей машинного обучения
  • Рассматривались методы улучшения качества ответов моделей путем добавления контекста (системного промта)
  • Упоминалось использование инструмента «рег» (ретрив), позволяющего извлекать релевантные данные из корпоративных источников для повышения точности ответов моделей
01:34:47
Форматы хранения моделей и квантизация:
  • Квантизация моделей используется для уменьшения требований к вычислительным ресурсам (железу), снижения объёма модели и ускорения расчётов, однако сопровождается небольшим снижением качества
  • Наиболее популярными форматами хранения квантизованных моделей являются Biend Bytes (bpb), Guif (guuf), Jiji (jiji), Yuuf (yuuf). Формат Guif универсален и совместим с Windows и macOS
  • Для работы с квантизованными моделями рекомендуется использовать специальные форматы хранения, адаптированные под конкретные платформы (например, Guif для Windows/macOS и Melis Mix для macOS)
0: На YouTube кстати, почему-то стрим не идёт вот уже не 1 раз. Причём перезапускаю все канал указан, пишет, что идёт, но YouTube не принимает просто.
1: Так, сегодня, похоже, будет без YouTube, видимо, придётся туда отдельно загрузить.
2: На вк идёт все в порядке, проверю. Да, на вк идёт вк все хорошо.
3: Интересно, кстати.
4: Вопрос. У нас вот постоянно много англицизмов, особенно сегодня, я готовил лекцию, у нас прям очень много ожидается англицизмов. И как думаешь, насколько претензии?
5: И обоснованно, что никто не понимает, о чем мы говорим.
6: Ну, вайт, всегда так было, не только сейчас.
7: Просто, ну и терминов было относительно меньше сейчас из за того, что сильно расширилось само количество терминов, и они стали ещё менее очевидны.
8: Просто интересная такая вещь произошла, да, что получается, дата сайнс была очень закрытая. Ниша, которая существовала где-то вот 10 лет, да? Ну, примерно 10 лет в России, наверное, и получается, что она стала резко.
9: Открыто для всех все сразу пришли в data science войти в айти все такое и сейчас ещё ii стал всеобщим, да и получается сленг устоялся ну все между собой айтишники друг друга понимают и тут хоп новая аудитория и многим.
10: Непонятно, что кто говорит, какие претрейн инкодеры, какие трансформеры, что такое gpu не, ну мы постараемся тогда как-то я буду стараться пояснять термины, которые, наверное, могут в теории быть непонятными.
11: Ещё тут нюанс в том, что у меня то профдеформации, да, и, то есть я, да, да, да, я не всегда могу понять, что-то, что я говорю, кому-то непонятно. То есть, мне может казаться, да, как-то, ну, слово хлеб, там, микрофон, ну, обычное слово, там, jp.
12: Ну, что-то такого. Угу. Шешен вроде как давно уже там, сколько, сколько аттеншен? Лет 10 уже, да, механизму.
13: В каком там в 14 году ещё кажется, что вот эти вот статьи, да, вот типа attention оо юнит, что-то такие статьи, как я не знаю, 1 закон ньютона, который как будто бы все должны знать вот это тебе так кажется, потому что ты вот
14: Теме все глубоко погружён давно.
15: Ну да, так, у нас минута до эфира. Так, хорошо, я расшариваю экран и думаю, мы начинаем.
16: Кстати, ещё. Ну хотя ладно, мы уже сейчас начнём.
17: Так, презентация.
18: Так, друзья, у нас через минуту старт или уже start. Подскажите, видно ли звук, хорошо ли меня слышно, все ли в порядке? Поставьте плюсик в чат, пожалуйста. Звук есть. Отлично, отлично. И мы можем начать прежде чем
19: Я начну, я отвечу на 1 вопрос. С позволения, в самом начале, ну, не только в самом начале, он периодически проскальзывает этот вопрос, да, и люди спрашивают, почему у нас такая последовательность, да, почему мы, ну, там, вот я смотрю, да, начали
20: Сначала с общей картины, потом бизнес кейсы, потом мы перешли на объяснение ллм, только сейчас 3 занятием, да, потом лм лм, а потом стратегия тут логика какая, что? Ну представим, что ллм это айсберг.
21: Условно, да, и сначала надо показать роль этого айсберга в контексте. Ну то есть, что такое вообще в экосистеме мирового океана, да, в мире, потом рассказать, что такое, в принципе, айсберг и как он там корабли топит, грубо говоря, да, и
22: Уже дальше можно переходить, наверное, уже с пониманием, для чего мы это делаем, с понима, переходить к тому, а что это такое, как он устроен, что за подводная часть? Потому что, на мой взгляд, это базовая ошибка школьного образования, когда людей сначала пытаются научить
23: Что такое математика давать кучу формул уравнений. И потом получается, что человек, многие люди, которые причём хотят понять, для чего они это делают, просто забивают и не учат, потому что для многих людей на самом деле очень важно.
24: Понимать прикладное применение. Это логично. Вот. И вместо того, чтобы сразу показать людям там, школьникам, студентам, да, вот смотрите, вот у нас есть машинное обучение, какие-то start, методы, вот так-то это в бизнесе применяется и поэтому
25: Мы сейчас будем изучать алгебру, линейную регрессию, прочие такие вещи, да, вот, а мы начинаем с того, как решать уравнение, непонятно зачем. Поэтому я считаю, что контекст тут самая важная вещь на самом деле.
26: Итак, сегодняшняя тема, собственно, да, у нас понимание ллм. Мы попытаемся сегодня разобрать, что это за зверь такой, да, что это за вещи, которые все мы так много говорим, посвящаем столько времени, и при этом, почему
27: Ему, ну почему она работает, да, чтобы демистифицировать весь процесс, понять примерно, какие есть у этой технологии ограничения. И чтобы перейти уже дальше к применению в компании.
28: Итак, начнём мы вот с чего, собственно, объяснение, да, чисто номинальная формулировка, что значит это у нас Лач лэнгвич модул, да, то есть это большая языковая модель.
29: По крайней мере, так это было изначально, потому что изначально это были именно модели, которые призваны работать с последовательностями человеческая речь, текст, он является таковой последовательностью, то есть, по большому счёту, текст строится из Последова.
30: Слов. И, кстати говоря, из этого возникает сразу. Так вот, забегая вперёд. Интересный момент, что последовательность слов в разных языках, она разная, к слову говоря, да, там в английском слова предложения, они более структурированы. В русском можно
31: Всяко разные переставлять слова местами. При этом смысл как будто бы не изменится из за этого. Вот, кстати, и трансформеры ллм, они немножко по разному работают на разных языках. И люди часто пытаются системные промты сбивать именно на английском. Вот.
32: И, соответственно, это языковая модель была. Потом она стала мультимодальной, смогла принимать на вход изображение, генерировать изображение тоже самое с видео, ну и, скорее всего, с другими информационными сущностями также будет продолжаться дальше у
33: У современных ллм очень сложная конструкция. Я вот здесь вот представил чисто для понимания объёмов масштабов, да, примерную визуализацию, как устроен квен 3. Ну, в данном случае вижу, визуальная
34: Модель, которая работает с изображениями, в том числе квент ривел. Вот, и начнём мы с простых определений, которые позволят нам понимать дальнейшие вот все вещи, о которых мы будем говорить, начнём, наверное, с самого
35: Типового. Это контекстное окно. Что такое контекстное окно модели? Это по сути, тот объём текста, с которым модель может одновременно работать, держать его у себя в памяти и принимать его во внимание. То есть условно, например, у вас была долгая беседа.
36: С чатом, да, вы какое-то время с ним общались, общались, общались. Вот здесь. Вот, и в результате контекстное окно модели максимально было переполнено у современных моделей контекстное окно порядка, там 200000 токенов в среднем у больших моделей, разумеется, и как-то
37: Только ваше контекстное окно, вот эта вот часть выходит за пределы того, что модель может принимать вся вот эта старая история по большому счёту забывается. Модель перестаёт её брать во внимание вот контекстное окно, ну вот этот тот самый диапазон от текущего токена.
38: Котором мы остановились. То есть слово последнего, которые мы модели передали до самого 1, точнее, минус, то количество вот этих токенов, которые модель может принимать. Соответственно, что такое токены, токены, это еди.
39: Text токены это не обязательно слова, но здесь вот пример, как могут быть разбиты токены. К примеру понятно, что фраза типа and in for это тоже у нас токены, но в зависимости от токенайзера только
40: Как раз того механизма модели, который преобразует входной текст в отдельные атомарные единицы для модели, он может разбивать их по разному, то есть токеном может быть как целое слово, так, может быть, пробел, так, может быть, и запятая в некоторых.
41: Моделях это могут быть наложения, например, с пробела на следующий символ вместе или, наоборот, с символа до следующего пробела. И дальше слово идёт от 1 буквы и до пробела. После него, к примеру, токенизаторы бывают разные у моделей, поэтому
42: Это всегда индивидуально. Ну, в целом, примерно можно считать, что токен это слово вот с небольшим запасом, да, то есть, грубо говоря, слов будет всегда чуть меньше, чем токенов. Ну, или почти всегда вот здесь можно посмотреть на контекст.
43: Окна разных моделей. Вот какие они, ну ещё раз в среднем, вот здесь это какие-то экспериментальные, частично данные, на самом деле миллионов почти нигде нет. Среднее это порядка все-таки 200000 токенов, суть контекстного окна.
44: Здесь многие немножко заблуждаются, да, и есть разные мнения. Кто-то говорит, что вот сейчас контекстное окно повысят и нам не нужны будут все эти методы ухищрения, как, например, удерживать большие данные. Мы все будем сразу пихать в модель без
45: Этих рек систем и все, все хорошо будет. Вот. Но есть моменты во первых, модель, когда расширяет своё контекстное окно, она начинает с ним плохо работать в прошлый раз, по моему
46: 1 занятии я приводил в пример Роман война и мир. Собственно, да, приписав его не тому автору, и приводил пример. Суть примера заключалась в том, что, к примеру, если вы прочитали целиком книжку и после
47: Этого спустя какое-то время вас начать спрашивать, да даже сразу после этого, то вы будете забывать то, что было в начале, и как будто бы книжка вроде как в вашем контекстном окне, вы же её полностью прочитали, но у вас начинают расплываться смысли, смыслы, ускользать какие-то детали.
48: Вы хуже и хуже будете отвечать на вопросы по этой книжке. Чем дальше где-то зарыт смысл. Ну, бывают у нас всякие отдельные выделения. Мы можем какие-то элементы лучше запоминать какие-то хуже. Это уже особенности работы мозга у ллм.
49: Хотя в целом местами тоже похожая история. Вот, но модель гораздо лучше работает с маленьким контекстным окном, так же как человек, когда, например, мы вам дадим какую-то статью на 1 страничку или пост в telegram, вы его прочитали. И если мы сразу после этого вам
50: Вам начнём задавать вопросы, то вот это маленький этот маленький контекст гораздо лучше будет вами восприниматься. То есть оперативная память, потому что в голове она, ну, не бесконечная. Вот тоже самое с моделью. То есть размер контекстного окна не означает, что модель
51: Одинаково качественно работает со всеми данными в этом контекстном окне. И хоть трансформеры гораздо лучше, чем рнн с этим справляются, но тем не менее факт остаётся фактом. Да, чем больше контекстная
52: Окно, тем, по сути, выше нагрузка, стоимость, риск потерь в середине контекста, да, и есть разные ухищрения, когда вы работаете там с чатом gpt, там есть разные индексации ретрив системы для извлечения данных прошлых. Вот благодаря этому может
53: Складываться. Ощущение, что модель работает со всей историей вашей переписки одинаково хорошо. Вот. Но на самом деле это не так, это именно накрутки поверх модели. Соответственно, размер контекстного окна имеет значение, но это не определяющий фактор.
54: На самом деле гораздо эффективнее даже при работе с маленькими моделями использовать. Точнее даже если вы будете использовать маленькую модель с маленьким контекстным окном, она в итоге может выдавать лучшие результаты по извлечению каких-то фактов, принять
55: Их во внимание, чем большая модель с большим контекстным окном, так зачастую бывает не всегда. Опять же. Итак, а что собой представляют эти самые контексты, да, как они в мозгу назовём, это модели формируют
56: Мы немножко уже говорили на 1 занятии про историю с эмбедингам эмбеддинги это, по сути, внутренние представления Смыслов, Смыслов, содержания да слов, предложений, текстов внутри модели.
57: Практически всегда представляют собой вектора, то есть они формируются из себя вектора со значениями. Как правило, размер эмбеддингов у моделей он фиксированный, то есть, условно, если у вас какая-то модель рабо,
58: Там с 1 размером эмбедингов, это не значит, что она будет работать с другим. Вот это обычно фиксированная история у трансформеров размер эмбеддинга в настоящее время у модели насчитывает, как правило, до нескольких тысяч элементов этого вектора. То есть это
59: Большой, большой, многомерный вектор. Раньше эмбеддинги, конечно, были гораздо меньше. Вот здесь такой игрушечный пример маленького эмбеддинга, характеризующего там мужчину, женщину короля, да, ну и вроде как вот каждый конкретный, как будто бы каждая конкретная
60: Число в этом векторе характеризует какую-то характеристику, простите за тавтологию этого слова, там, там что-то живое существо, там, роялити, да, насколько он относится к королевским там кровям, насколько он является глагол
61: Полом, да, не является, насколько, какой у него пол, там + 0 9 - 0 7. Вот у женщины и, соответственно, вроде как у нас слова на основе этих представлений могут быть схожими, да, то есть, например, и мужчины, и женщины.
62: Это у нас хьюман и мужчина, и женщина, это living бин чуть чуть в разных степенях, почему-то вот, и вот я приводил где-то вот здесь вот, по моему, да, достаточно такой репрезентативный пример, который позволяет
63: Понимать смысл этих векторов, почему они имеют под собой смысл для самой модели. То есть условно, если мы возьмём вектор кинг короля, отнимем от него слово мужчина вектор слова мужчина, добавим вектор слова женщина.
64: То мы вроде как получим примерно вектор слова Королева. Вот, и благодаря именно таким вещам модель может хорошо понимать синонимы, то есть у неё написание, синтаксическое слово и смысл слова это разные вещи.
65: Для неё слово условно король и царь вектора этих слов будут иметь очень похожие эмбеддинги, очень похожие вектора, понятно будет там будет какая-то, какое-то отличие в тех цифрах, которые, ну, как-то имеют отношение к географии, скорее всего, к принадлежности к стране.
66: Периоды времени. Понятно, что там император был вот в 1 в 1, в одних исторических моментах и странах царь там король цезарь, да, это в других уже контекстах, но общий вектор будет похож. Вот, и
67: И, кстати говоря, могу сейчас показать 1 интересную историю.
68: Давайте покажу, вот есть такие, так, видно ли экран с браузером? Есть вот так вот здесь вот такие вот сайты, где можно посмотреть отображение как раз эмбеддингов, посмотреть их смысл. Ну вот здесь, к примеру, мы можем видеть
69: В сжатом пространстве до трёхмерного представления слов в системе world туек, да, и можем навести на слово каждое слово. Это каждая точка, это отдельное слово в этом пространстве. Ну и можно видеть там, тут лук, например, тут
70: Вот, ну, здесь на самом деле не видно кластеров, но если, например, посмотреть другую модель, это у нас модель Глов тоже 1 из моделей векторизации слов. Вот здесь можно разгуляться, здесь чётко разбиты по кластерам, они слова, то есть это
71: Трёхмерное представление значений, да? Ну вот, допустим, перейдём сюда, что у нас тут хи хи хи хех, ну какие-то такие фразочки, да, тут can think непонятно, может быть это имена, может быть ещё что-то.
72: Ну, то есть вектора разных типов находятся в разных в разных областях. Он рональдиньо, кристиана, теллис. Ну, видимо, что-то с футболом связано с именами футболистов. Вот, ну, где-то тут будут глаголы, тут, где-то тут буду.
73: Американские фамилии там или российские фамилии все это будет разделено в целом.
74: Так, перейдём обратно к презентации.
75: Вот, и на самом деле, если говорить об эмбеддингах, эмбеддинги бывают разных типов. Вот эти самые вектора, на самом деле все начиналось с очень простых эмбедингов. Это были разные частотные представления. Самый простой вариант. Это был бэг форс. Вот он.
76: Ну, те, кто к датасайнс имеют отношение, слышали бэг оф фордс. Фактически, это просто мешок слов, когда у нас к каждому слову представляется, подставляется отдельное число. Ну, например, там футбольный мячик, цифра 1, там, штатив, цифра 2, кружка, цифра 3 и так далее.
77: Минусы такого представления понятны, то есть число зафиксировано, ой, слово зафиксировано конкретное число. Это значит, что синонимичным словам будут зафиксированы, присвоены совершенно как бы несвязанные цифры и понять связь между
78: Шаром и мячиком, например, ну, никакую нельзя, да, хотя в векторном представлении у них будет значительно схожая часть, потому что оба круглые, да, физические объекты. Вот. И так, да, похоже, действительно, на галактике это представлении
79: Как прокомментировали, здесь и есть более продвинутые системы, такие, которые появились в начале Десятых годов. Ну, в частности, вот была система такая очень популярная, нейросеть, ворд ту век она формировала
80: Эмбеддинги на основе предсказаний на основе предсказаний следующего слова, точнее, не следующего, а слово слово в центре между контекстами, ну и потом уже появились позже с появлением трансформеры контекстуальные эмбеддинги.
81: Которые формировались такими системами, как alma, берт и так далее. Ну, здесь пример представления, как раз-таки world to века, да, world to век у нас, как работал, он состоял из 2 частей. 1, это сибо, ну, сибо собс,
82: Он похож, кстати говоря, на форму лука. Я думаю, эту аббревиатуру выбрали не случайно подавалось. Значит, подавались слова до целевого слова. И после центральное оставалось пропущенным. И вот он должен был предск.
83: Сказать, собственно, вот это слово посередине, по центру. И следующая система скип грэм, которая тоже отдельная нейросеть. Фактически можно считать, что отражённая ей подавалось центральное слово, она должна была предсказать
84: Слова вокруг него, таким образом, как бы получалось создать более качественное представление контекстов. Вот, и потом вообще, да, с чего это началось изначально то? История создания трансформеров м. Началас.
85: С рекуррентных сетей, которые предназначены были для работы с последовательностями. Первые были это rnn, ну, стандартно рекурент нейрон нетворк, рекуррентные нейросети как работали, у них, по сути, были тоже аналогичные слои нейронов, то есть тоже
86: Полносвязная сетка, но с зацикливанием, подавая каждый раз на слой, да, ну, на этот слой нейронов следующий токен у нас происходит расчет сигнала с учётом как раз-таки весов и функции.
87: Активации. И потом по циклу идёт зацикливание и передача его в контекст, в общий контекст. То есть передаётся потом следующий токен, следующий токен и контекст постоянно как бы суммируется. Проблема таких сетей сетей была в том, что контекст слово за словом
88: Он начинал угасать. То есть у нас последние слова начинали иметь смысл. Вот. Но все, весь предыдущий контекст постепенно, можно сказать, таял, да, то есть смысл улетучивался такой системы, понятно, с большими предложениями она не могла работать.
89: Даже тем более уж с абзацами заместо неё пришли потом лстмки лстм. Это более продвинутая архитектура. Да, это эволюция рнн лстм, позволяли. Они имели ячейки памяти.
90: Точнее, отдельный поток запоминания и забывания через отдельное прохождение функции, да и получалось, что ренение как будто бы лучше запоминали важное в контексте и забывали неважное, но опять же с большими текстами.
91: Так не работало, потому что тексты зачастую имеют смысл вот цельный, вот много абзацев текста, где-то там 1 абзац имеет прямое отношение к абзацу через 10, к примеру, и lstm никак эту проблему, по большому счёту, не могла решить.
92: К тому же они были сложны в расчётах. Ну вот такая вот у них система была. Рассказывать мы сейчас не будем, разумеется, как они работали там, про тангенциальную функцию для забывания и так далее. Потом появились гру, как он, Гейт,
93: Unit по моему, ну, собственно гру было упрощение стм стм. Просто были слишком сложные, долго обучались, считались, и поэтому потом на замену пришло гру, которое не сильно то что-то по сути поменяла, но реально.
94: Прорывом, да, вот здесь не хватает word to века. Был, наверное, 1 прорывом, да, world to век для формирования эмбеддингов. И потом мы уже перешли лет через так 3, 4, наверное, спустя, к созданию меха.
95: Attention и трансформеров да? Ну вот здесь вот очень простой трансформер изображён концептуально, в основе которого лежит механизм аттеншен. Механизм аттеншен это механизм, собственно, который позволяет
96: Позволяет понимать весь смысл текстов целиком и позволяет понимать отношение слов к другим словам. Да, я уже об этом немножко говорил. Вот на 1 из предыдущих лекций, да, что, к примеру, вот есть предложение
97: The animals, диден Краузе, стрит, бикоз ит. Да и мы то понимаем с вами, что вот слово it относится к слову animal, но дело в том, что той же стенки это не было бы очевидно.
98: То есть для этого нужно понимать весь контекст целиком. Для этого нужно обучить, собственно, эту нейросеть, понимать такие контексты и, по большому счёту, механизм внимания. Вот этот аттеншн, это и есть ещё 1 нейросеть внутри нейросети, которая и позволяет
99: И обучается на то, чтобы находить вот эти самые взаимосвязи и присваивать каждому следующему токену вес в текущем контексте. Вот, ну вот здесь представлена схема классического трансформера инкодер.
100: Код энкодер декодер сейчас практически не используется так вот, в каждом энкодере есть механизмы внимания энкодеров, здесь много механизмов внимания, в каждом энкодере тоже много, это называется multi head attention ну мультиголовой внимание просто потому, что вот этих
101: Блоков с аттеншен, их там много для того, чтобы более разносторонне рассматривать смысл предложения. Ну и каждый немножко со своей колокольни как бы оценивает взаимосвязи слов друг с другом, разные веса, присваивает, что такое
102: Кодер декодер, мы сейчас фокусироваться не будем вот, ну здесь просто вот как раз пример, multi head аттеншена, который призван продемонстрировать то, что у нас разные вот эти головы внимания по разному смотрят на зависимости между словами.
103: У нас есть, собственно, 3 вида больших языковых моделей. Вот то, что мы обычно сейчас называем ллм, это вот эта центральная часть декодер онли изначально, как я уже говорил, в 19 году, если 18 появился берт, который начал активно
104: Пользоваться берт. Собственно, это была инкодер модель. Его задача была в том, чтобы формировать из слов вектора. То есть мы подаём на вход предложения, он из них формирует вектора. Эти вектора имеют смысл, мы можем по разному
105: Перефразировать одно и то же слово. Ну, например, я читаю лекцию, да, я рассказываю, веду урок, я рассказываю материал. У всех этих 3 предложений будет похожее векторное представление, потому что смысл у них похожий. Вот
106: Но для старых моделей это было бы непонятно раз по разному сформулировано абсолютно разные слова, значит, смысл разный. Берт. Этот вопрос, эту проблему решил в значительной степени. И вот эти вектора, которые он выдавал, позволяли классифицировать себя.
107: Да, по каким-то интентам или по отдельным сущностям, для того, чтобы использовать дальше. Ну тоже самое распознавание смысла предложений, намерений пользователя. Да, это в чат ботах часто использовалось, когда вы там пишите в ЖКХ какой-нибудь хочу
108: Там узнать показания счётчика за свет. И вот такие системы, как bird, могли преобразовать это в вектор. Ну а дальше простая система классификации на основе базового машинного обучения могла просто взять этот вектор. Она заранее обучена.
109: И понимать, окей, человек хочет показания счётчика, как бы он там не сформулировал, в общем то. И потом получается, ну, эти системы довольно много широко использовались, но в параллель с ними появились декодеры, онли, трансформер.
110: Декодеры трансформеры не имеют отдельного блока, вот этого энкодинга, закодирования вектора. То есть у них есть токенизатор, у них есть заранее обученная матрица, которая присваивает токенам нужные вектора, она забирает слово и её задача
111: Генерировать, генерировать следующие слова, то есть, ну, по умолчанию просто следующее слово. Вы там подали какое-то предложение, там я пью, ну и дальше она предсказывает там чай, кофе с разными вероятностями и
112: Такие системы в начале не были популярны, потому что понятно, чтобы такая система имела какое-то прикладное применение, нужно, чтобы она была достаточно качественная. Если вот эти энкодер, онли, трансформеры, можно было бизнес сразу понял, как их использовать из коробки. То есть мы
113: Берём, делаем систему классификации, делаем классный бот 1 линии поддержки. Ну классно, если у нас руки правильно поставлены.
114: Decoder онли. Ну они выдавали какую-то ересь, да, они были слишком дорогие в применении для того, чтобы их использовать вместо т 9, например, потому что, ну они очень сложные, это большие модели, да, которые требуют большого больших вычислительных мощностей, но
115: При этом эти модели не способны работать на каком-то подовом девайсе, да, там запускать их на смартфонах. Тем более того времени сейчас, может, и можно, ну, было бы нецелесообразно, да, для того, чтобы просто предсказать следующее слово, которое вы набираете на клавиатуре. Вот.
116: А использовать как-то более широко. Они были ещё слишком глупыми для каких-то реальных применений. Ну во многих вещах они и сейчас не не всему удовлетворяют. Вот как работ, как обучается вообще декодер онли, модель, да.
117: То, что мы называем лм, здесь есть несколько Шагов. Давайте начнём со стадии. Вот притрен, да, вот здесь вот есть небольшая картиночка, да, у нас сначала происходит забор данных. Ну так, раньше, по крайней мере, было сейча.
118: Наверное, есть более продвинутые методики парсинг, короче говоря, всего интернета, ну, или каких-то определённых узлов интернета, таких как википедия, сайты с публикациями научными, ненаучными.
119: Забираются, значит, данные, потом происходит извлечение и фильтрация текста. Понятно, что текст из интернета, он не отфильтрованный, ну и вообще данные там есть, какие-то заголовки, рекламные вставки, баннеры. Чего там только нет, нам нужно отфильтровать цельные имеющие
120: Смысл куски текста, иначе мы плохо натренируем модель, потому что данные плохие. Дальше, после того, как мы отфильтровали данные, нам нужно произвести разного ещё вида фильтрации. Удаление всякой ерунды, может быть
121: Фильтрация по языку. Если мы обучаем одноязычную модель и после только этого, после того как мы получили наши данные, мы можем приступать к обучению. Ну вот здесь вот, да, примеры есть, что тут фильтрация по доменам.
122: Например, если нам нужно что-то убрать, какие-нибудь мусорные сайты, вредоносные по языку фильтрации, если это требуется удаление дубликатов, опять же, там много дубликатов, это, понятное дело. Ну и в теории, в теории, как бы, по крайней мере,
123: Публично озвучивается, что удаление персональных данных. Хотя если вы сейчас в chat gpt там посмотрите, да, я вот не помню в каком моменте он пишет, что что-то там сделайте, то ли это в режиме незапоминания, то ли это в про самых
124: Топовых версиях интерпрайс, что вроде как мы не будем использовать ваши данные для обучения, что автоматически означает, что во всех остальных случаях они используют ваши данные для обучения. Ну, скорее всего, это так и есть, как бы проконтролировать, что происходит на этих серверах.
125: Невозможно, по большому счёту, вот, ну, выдавать, конечно же, они их не выдают, да, то есть, если б они их ещё и выдавали в теории, вы могли бы написать, скажи мне номер телефона такого-то такого то такого-то и большая вероятность, что реально они в обучающих данных, это все.
126: Было. Она вполне себе велика, так
127: Да, препроцессинг, препроцессинг, удаление персона. Так, и что дальше? А дальше, в общем то, происходит формирование датасета. Датасет, какой у нас в базе на притрен. Нам нужно взять набор текстов, замаскировать нужное слово, которое мы соби.
128: Стараемся дать для обучения модели, чтобы она могла его предсказывать. И все. И обучаем. Вот тебе вход, предскажи слово. Вот тебе вход, там 5 слов. Предскажи 6 условно и понятно, модель научил?
129: Предсказывать следующее слово здорово, что с этим делать, причём надо понимать, что она с точки зрения результата, она на тот момент могла предсказывать следующее слово, но это не значит, что модель только это и могла, это она по большому
130: Счёту понимала весь корпус слов, смыслы, связи, то есть, по большому счёту, в ней был весь языковой корпус, на котором она обучалась. Это значит, что сама по себе модель как бы умная, знаний то в ней сжато много. Ну, по большому счёту, при таком обучении получается
131: Как бы сжатие всех знаний, которые в неё вложили, ну, в какую-то меньшую структуру, да, ну, модель, в общем то, и есть сжатие, насколько сжимается вопрос, да, если вот задаться им, тут все просто по большому счёту, получается, что чем
132: Меньше объём вашей модели. И чем больше данных в неё было подано при обучении, тем сильнее это сжатие происходит компрессия. Вот. И, соответственно, если модель, наоборот, очень большая, то получается она, ну, фактически чуть ли не на уровне запоминания, может вот
133: Хранить в себе всю ту информацию, которую в неё передали у больших моделей объективно сейчас не слишком большое получается сжатие. Ну, если не брать всякие дистиллированные версии.
134: И вот, ну, ходят легенды, слухи, что вроде как, ну, понятно, скорее всего, это произошло как логичное продолжение исследования. Ну, там были раньше слухи, что вот кто-то сказал, это все внезапно возникло, кому-то пришла.
135: Супер Мудрая вещь, что смотрите, раз модель такая умная и знает все знания мира, то давайте-ка мы просто её чуть чуть дообучим будем давать ей вместо задачи следующего предсказания следующего токена задачу ответа на вопрос, ну или следование инструкциям.
136: И назвали этот процесс инстракшн, файнтюнинг файнтюнинг это дообучение модели частичное. И то есть, если стадия претрейн, она самая большая, то есть там берутся все, все, все там терабайты данных, которые удалось собрать и на них современные
137: Модели обучаются, вот этот притрен. Самая большая, самая сложная стадия, к слову говоря, ну или 1 из самых. То есть, то файнтюнинг занимает меньше времени. Ну, даже у больших моделей, здесь просто уже берутся конкретные на входе.
138: Модели при обучении, запросы это вопросы, инструкции. Напиши что-то, ответь на вопрос, расскажи мне о том-то а на выходе выдаются уже какие-то варианты ответов и получилось так, что модель была достаточно
139: Так как умный, то на я не помню уже количество, но на достаточно небольшом количестве примеров она смогла очень быстро преобразовать свои функционал из предсказания следующего токена в следование инструкциям, ну или ответы на вопрос.
140: Вот это 2 часть обучения, чтоб вы понимали, файнтюнинг происходит достаточно часто у компании, да, а вот притрен, стадию выполняют не так часто. Ну, грубо говоря, если да, претрейн, например, делают раз в год. То есть
141: Берут и полностью делают новый претрейн, собирают новую архитектуру, полностью новый корпус текста, улучшенный, как-то аргументированный, дополненный с учётом прошлых ошибок и делают претрейн. То вот когда мы видим всякие минорные версии, там 5, 1
142: Gpt 5 2, то по большому счёту это разные модификации либо минорных изменений архитектуры, либо разных вариаций, дообучения, фантюнинг и так далее. Ну и соответственно, после этого фантюнинг модель уже начинает вести
143: Себя как ассистент, она перестаёт просто предсказывать следующий токен. И когда такие первые модели, в общем то, поиспользовали, все это было здорово, но эти модели, как я вот тоже рассказывал, упоминал, были немножко токсичными, да.
144: Они не вели себя как дружелюбный ассистент, они не следовали нормам этики, могли сказать что угодно, кому угодно, как угодно. И, ну и вообще, она не обязана была отвечать на вопрос условно, если бы, ну, предположим, в выборке попадались данные, да, которые, в которых
145: Кто то кому-то в ответ на вопрос просто нахамил, то если модель на этому обучалась, то почему бы ей тоже вам не нахамить в ответ. То есть люди же не обязательно отвечают на вопрос ответом и часто этого не происходит. В общем то и придумали следующую стадию.
146: Расшифровывается как реинфорсмент ленинг из human фидбэк реинфорсмент ленинг вообще старая, тоже старая концепция обучения нейросетей идея пошла от обучения с подкреплением, так это переводится.
147: Обучение с подкреплением я помню ещё очень давно, когда гуглил инфорсмент, ленинг, начал набирать и мне давай че то про собак выдавать, про животных тогда это ещё не было. Так хайпово сейчас вам выдаст именно про нейросети, про собак вы не найдёте, наверное, то есть
148: Это вообще метод дрессировки животных, то есть обучение с подкреплением это когда вы пытаетесь собаку заставить там садиться, например, там или дать лапу. И если она делает в итоге то, что нужно, каким-то образом догадавшись, то вы ей даёте вот еду и собака.
149: Понимает, о, мне дали еду. Значит, в следующий раз нужно тоже давать лапу в ответ на просьбу дать лапу, а не там что-нибудь кругами носиться. Вот отсюда это пошло. И это 3 этап, да, обучения. Есть разные модификации.
150: Большому счёту, сейчас, но базовый трюк заключается в том, что модель учат выдавать именно желаемые ответы. То есть модель что-то выдаёт и её оценивают лайк, не лайк. Грубо говоря, вообще обучают ещё дополнительную
151: Модель, то есть потому что на миллионах или даже миллиардах предложений человеков заставить это делать практически нереально, где столько людей взять. Плюс люди тоже ошибаются. Обучить другую модель на предпочтительных ответов человека можно и вот это
152: Самая дополнительная модель у нас, она уже будет как раз-таки лайкать, дизлайкать ответы 1 модели и таким образом модель натаскивают на то, чтобы она выдавала дружелюбные ответы, правильные, полезные, ну и так далее. Это то почему
153: Во первых, дружелюбный, вежливый, услужливый, да, там он предлагает вам, а вот вам ответ там начинает, сами все знают, да, что чаще всего, если там не указывать какую-то роль, что там будь сухим или ещё что-нибудь, чат.
154: Gpt, к примеру, он будет обязательно сначала подхалимничать, говорить, что, ой, какой вы молодец, какой вы правильный вопрос задали. Потом он будет всячески говорить, что вы прям бьёте в точку. Немногие так мыслят широко. Вот. И, но
155: Тем не менее, однако, вы там что-то не учли. Вот она делает все вежливо, вежливо, вежливо, а потом ещё. А хотите, я вам ещё разберу это, а хотите то? Потому что её научили? Её тренировали на то, чтобы быть вот таким полезным ассистентом, вот этот самый
156: С другой стороны, эта же штука положена отчасти в основу галлюцинаций. Ну, многие не понимают. Это не единственная причина, но 1 из, почему модель галлюцинирует, особенно первые галлюцинировали, потом это конечн.
157: Немножко поубавили. То есть сами посудите, если вы, например, в вопросе задаёте какой-то, что-то, что, например, противоречит сразу истине, то модель научили поддакивать.
158: Она будет поддакивать. Ну, раньше так было, сейчас с этим всякими разными методами, да, обучения уже борются, по другому это делают. Но раньше, как бы, если вы сказали, почему у собаки 5 лап, ну, значит, как бы нехорошо говорить пользователю, что он дурак. Почему бы нам сейчас не объяснить, не
159: Думать объяснение почему правда у собаки 5 лап вот это лч. Потом появились разные другие версии, такие как DPO, DPO это когда у нас не было отдельной лайкающий ревард модели, у нас по сути подавалось сразу 2 предложения и говорили вот.
160: Смотри, это хороший ответ, это плохой ответ. Это хороший, это плохой потом Раиф. Тоже самое, как рэйф, только в эйч хьюман, фидбэк, человеческий фидбэк, то здесь артифишл. Ну, в общем, оценка даёт оценку, даёт другая иишка. Вот, ну,
161: И есть ещё часть сфти, супервайт, файнтюнинг это когда у нас модель учится не на ходу, а заранее готовится полностью размеченный датасет, это ft, супервайт, файнтюнинг, не запоминайте эти слова, как бы, если для кого-то сложно.
162: Эти аббревиатуры, новые эти термины, это не принципиально. Главное понять 3 вещи. Сначала модель учат предсказывать следующий токен, следующее слово. Потом, когда она обучена на всем корпусе текста, её донаправляю в сторону того, что
163: Она уже не слово предсказывала, а отвечала на вопросы. И 3 этап её пытаются сделать вежливой, услужливой. Ну и ещё там могут безопасность вкрутить, например, вот 3 вот этих вот ключевых этапа, да?
164: Ну вот здесь вот метафорически нейро слопам написано, да, как, как это примерно работает.
165: Так, сейчас быстро посмотрим вопросики, как приготовить свиные крылышки.
166: Так, про декодер, да, в конце попозже расскажу. Просто сейчас, если будем останавливаться, мало что успеем. Что же происходит при генерации текста. То есть мы рассмотрели, как она обучилась. То есть, да, обучение это большой сложный этап, и
167: Кстати, по моему, по моему, ну, это зафиксированный факт. Уже раньше. Чаще всего датасантисты, они обучали моделей для обучения моделей, нужно было самые большие ресурсы инференс, то есть работа модели на результат, это называется инференс, он
168: Занимал мало времени, то есть даже у больших моделей относительно, там язык, ну, не языковых, там, допустим, модель предсказания, категории изображений, модель, там, предсказания чего-либо там, по табличным данным или по временным рядам она могла, тем не менее, долго обучаться, но
169: Предсказывала она очень быстро. Инфоренс был ничтожно маленький на фоне обучения. И, то есть, если вы обучали её на видеокартах, то инференс вполне себе мог качественно работать на процессоре при не супер больших объёмах использования. Ой,
170: Но по большому счёту получается так, что в случае с ллм инфо занимает теперь большую часть, потому что модель учат, да, сложно долго на больших датацентрах, но пользуются ими огромное число людей сам по себе, сама по себе.
171: Генерация каждого следующего токена в предсказании это тоже большая работа, потому что весь этот трансформер, он очень большой, чтобы понять, насколько большой трансформер более детально вам, конечно, Даниил. Вот на следующей, да, на следующем за
172: Расскажет Даниил, это разработчик из гига чата. 1 тимлид. Вот. Ну вот вкратце я покажу. Вот есть такой сайт. Пара сайтов, кстати, да, можно посмотреть.
173: Вот на этом сайте можно посмотреть, как происходит предсказание, то есть можно, например, что-нибудь вбить, да и посмотреть, как модель по шагам производит предикт, как она выдаёт в итоге вероятности разных слов.
174: Ну, давайте, например, тут напишем.
175: Налей мне чашку, generate?
176: Вот пошло, пошло, поехало. Процесс, чашку чего он там предложил? Ну, кстати, а он почему-то ничего не предложил. Может быть она только тут на английском работает. Ладно, кэн, давайте че-нибудь на английском че-нибудь напишем.
177: And i давайте help.
178: Help you. Вот он видим, да то есть тут мы наглядно можем посмотреть, что происходит. Ну хотя бы на выходе, да, там сейчас без понимания слоёв аттеншена мы видим, что модель вот пишет к help you 70%. А дальше, ну она сортирует токены вероят.
179: По вероятностям может быть это new, а this can i help them, can i help my, ну и так далее, то есть ещё он тут какие-то слова с вероятностями ниже 1% привёл, вот можно посмотреть там по слоям разные аттеншен, что с чем связано прикольная
180: На самом деле, визуализации. А есть ещё вот такая визуализации, где можно посмотреть старые модели, такие как GPT-3, даже как они устроены, как там у них, где у них головы трансформеров, эмбеддинг слой, там на входе, например, там вот здесь у нас подаются, да, токен.
181: Бёдер токенизатор вот здесь у нас головы аттеншена, матрица q крик велью не совсем понимаю как тут ориентироваться, не совсем скажем интуитивно удобно вот там self attention, например, то есть можно посмотреть вот архитек.
182: Duru кому будет интересно. Я думаю после следующей лекции кто будет серьёзно вникать слушать даниила будет прикольно. Потом поразбираться посмотреть на разные слои, на их размеры. Но если что это GPT-3 это достаточно маленькая по современным
183: Вот он, GPT-3 достаточно маленькая по современным меркам модели. Сколько стадий предобработки? Ну вы здесь можете видеть. То есть все это разные матрицы, векторные вычисления огромных масштабов. Поэтому мощности, вот эти вот датацентры, которые там потребляют, чуть ли не размер
184: Там со страну электричества, ну, с маленькую, так уж точно они на это все и расходуются каждый раз, когда кто-то спрашивает, какая сейчас погода у чата gpt, он потребляет очень большие ресурсы на электричество и
185: Да, это, я думаю, это скоро прекратится, потому что все понимают, что это не очень разумно. Ссылку на сайт я, разумеется, скину, да, но, по моему, кто-то скинул, не знаю на него или нет. Так.
186: Вернёмся назад, да, где мы остановились. Так вот, вот этот авторегрессионный декодинг работает. Каким образом вы подаёте модели на вход какой-то вопрос и дальше модель предсказывает следующий токен.
187: Ещё раз в случае с переобученной на инстракт файнтюнинге, то есть следование инструкциям модели, она не предсказывает следующее слово типа как can i help you, она предсказывает 1 слово ответа на ваш вопрос требуемого.
188: Ответы она так научена, и раз за разом она добавляет ваш вопрос 1 предсказанный токен в контекст. Дальше она предсказывает следующий уже берет контекст с первыми 2 предсказанными словами, предсказывает 3 и так step by step.
189: Вот идёт вот этот авторегрессионный декодинг это процесс как раз-таки предсказания. Каждый раз на выходе она получает вероятности, вероятности того, какой токен надо подставить ну вот в данном случае, что там i like. Ну и тут раз
190: Варианты, да, там самый вероятный он оценил как the и lt z поменьше вероятность вен, ну и что, i like фрокс да, лягушек я люблю ну вроде как маловероятно, наверное, что кто-то это скажет. Ну вроде.
191: Как и возможно, видимо, да, а теперь следующий вопрос раз она предсказывает не просто конкретное слово, она предсказывает набор вероятных слов с разными распределениями вероятности и получа.
192: Получается, что как модели выбрать, какое слово подставить самый простой вариант если мы возьмём жадную оптимизацию, то она бы должна была бы выбрать, не думая то слово, у которого наибольшая вероятность, но это как будто бы делает модель, слишком детерминирован.
193: И не всегда полезно. А где креативность? Мы же, может быть, хотим, чтобы модель немножко вариативная была. И здесь у нас есть показатель температуры. Вы этот показатель можете увидеть в разных системах, в настроечках, там в том же джеминай, например.
194: В чате gpt, они там поглубже запиханы, просто в джеминай сразу справа там во вкладке можно посмотреть, указать температуру. Ну, хотите вы, чтоб модель была немножко взбалмошенной, что-нибудь чуть чуть отсебятину, какую-нибудь ерунду порола, поставьте высокую температуру и welcome.
195: Формула здесь достаточно простая. Вот здесь она указана по большому счёту, что это значит, если температура очень низкая, ну, например, 0 1 0 3 модель максимально детерминированная. Здесь, кстати, вот примеры как раз-таки
196: Смотрите, при температуре 1 вероятности будут исходные, то есть оригинальные. Вот здесь температура 1. Давайте с этого начнём для понимания. Предположим, было 3 слова. Слово 1, слово 2 и слово 3 и модель после прохождения через вот все слои.
197: В конце определила, что слово 1 имеет вероятность 80%, слово 2 10, 3, 10. Если температура стояла 1, то вот модель так себя поведёт. То есть дом сработает, грубо говоря, рандомный генератор и выберет с вероятностью 80% будет
198: Слово 1 с вероятностями по 10 будет слово 2 или слово 3. Если температуру начать понижать, то будет отрабатывать вот эта формула, и она будет распределение вероятностей, как бы сжимать.
199: Наоборот, расширять те вероятности, которые были большие, она их ещё больше сделает. Те, которые маленькие, она их ужмёт и сделает ещё меньше. Ну вот здесь вот пример при температуре 0 5, насколько понижаются вероятности слов, у которых они и так были маленькие. Наскольк.
200: Повышается. Те, у которых они были большие. Вот, и получается при температуре, допустим, уже 2. Если мы, наоборот, её повысим. Наоборот, слова, у которых вероятности были маленькие, станут
201: Иметь большую вероятность быть выданными. Ну и те, у которых были большие, будут меньше в целом, чисто эмпирически, да, стандартная вероятность, на которой обычно работают модели, это где-то, ну, 0 7, 0 8. Вот примерно так. То есть еди.
202: Единичку совсем редко используют при единичке. Модель все ещё сохраняет какую-то. Назовём это креативность. Ну вот здесь вот указано, что вроде как от 0 8 до 1 и 2. Она творческая. Ну, я бы сказал, что творческая за единицу. Плюс все-таки там 0 8.
203: Это просто стандартно. Ну, при двойке уже, да, можно, можете поиграться, зайти, поставить вероятность 2, 3, посмотреть, что вам будет пороть модель, да, там как раз предполагать самое невероятное будет там, что вы, может, лягушек любите ещё что-то.
204: Может, кто правда любит. Соответственно, когда говорят о том, что модель там совсем не может ничего креативить, может быть осознанно, да, могут, могут ли люди осознанно креативить с другой стороны, мы же можем её генерировать, заставить вот эти вот мало
205: Вероятные события и извлекать те из них, которые имеют ценность, например. И тогда мы можем как будто бы добиться многими операциями каких-то новых креативных результатов. Вот. Но для научных работ, для программирования чаще всего
206: Нужны небольшие температуры для генерирования текстов. Если вы пишите холодные тексты для деловых задач ответов, ну, достаточно температур в диапазоне 0 5 1. А если вы хотите творческие тексты на
207: Публику. Такие слегка может быть весёлые, интересные. Ну, поставьте температуру наоборот, повыше.
208: Так, идём дальше. Ну вот здесь как раз примеры распределения вероятностей просто чуть более, да, скажем так, понятным, может быть, образом, там темп, допустим, Капов, кофе, кап, оф, кароч, Капов, та.
209: Да, при начальных словах вот такие вот распределения у нас, да, при температуре от нуля до двойки. Думаю, в принципе, понятно. Интуитивно, как работает температура, есть ещё дополнительные гиперпараметры моделей, да, где их указывать?
210: Если вы используете систему прям с сайта, например, да, заходите на сайт чата gpt или джеминая, вы просто указываете температуру в настройках. Если вы используете по api, вы программист. Понятно? Вы передаёте отдельно параметр.
211: В json файле при запросе, если вы используете систему для генерации, какую-то локально подняли инференс да, модель, вы можете указывать температуры там в настройках прям сразу, ну и если вы используете мультиагентную систем,
212: Или какую-нибудь ноукод, систему, ну тоже в настройках кода, либо в нокоде вы тоже пишите температуру, все это выбирается. Поэтому это 1 из тех параметров, которые при создании агентов вы будете обязательно регулировать в зависимости от того,
213: У конкретного агента идёт назначение вот топ k топ p. Собственно да, гиперпараметры топ так я их могу путать 0 да, топ p получается p.
214: Вероятность топ k по количеству топ k просто ограничивает количество токенов, которые вообще берутся в расчет при вот при бросании монетки да какой токен выбрать?
215: Получается, что если вы написали, например, топ k 2, это значит, модель будет просто брать 2 наиболее вероятных токена и среди них дело распределять уже, в общем то, вероятности при этом ну, надо понимать, да, что исходная, если вероятность вот здесь, например, 1 у нас идёт
216: Всего всех 4 токенов, то если вы укажете топ k 2 и модель выберет 2 токена, она уже вероятности между ними немножко поделит да, но суть останется той же, то есть здесь станет 0 25, здесь 0 75, а топ p это максимальное число.
217: Вероятности, например, если вы укажете 0 9, то модель возьмёт то количество токенов, совокупная вероятность которых будет не больше чем 0 9 вот это топ p.
218: Что ещё есть ещее frequency пенальти пресен пенальти по сути frequency пенальти это штраф за повторение чтоб модель не повторяла слова например лишний раз да если вы укажете его нестандартным ну окей, модель просто будет.
219: Штрафовать и стараться не допускать повторов, так сказать, чуть чуть креативность, может быть повысится. Не уверен, что кто-то часто использует вот эти фриквенс пресен пинетти. По сути, это практически 1 и тоже по большому счёту, вот чуть чуть разные формулы.
220: Буквально, да, как передаются, я уже сказал, либо в интерфейсе, например, можно указать в каком-нибудь, либо вы в параметрах при запросе указываете, да, темпе, то p и так далее.
221: Да, топ так топ k топ p обычно вместе не указываются вот температура стоп кей да, разумеется, указывается.
222: Так, следующий следующий параметр кстати говоря не знаю ну в теории можно настроить по разному если у вас своя система это же уже пост обработка после генерации модели, то вы можете наверное и топ k указать там типа топ k 2 при том чтобы вероятность
223: Была не больше, допустим, 0 7. Если это так, то он ещее обрежет. То есть это можно настроить. На самом деле это не имеет отношения к самому процессу отработки модели, это уже постобработка результатов предсказания.
224: Как модель понимает, что нужно завершить генерацию. Частый просто вопрос. Тут есть нюансы. Во первых, у моделей, когда вот эти корпуса слов создаются, есть разные системные токены, такие как босс бегинов.
225: Ios and of sentence, то есть окончание предложения и получается, что, ну модель видит, что вот здесь вот of sentence, она понимает, что обычно после вот этого идёт такой токен, если она в итоге предсказывает токен,
226: Sentenced она понимает, что можно, в общем то, генерацию прекратить. Но дело в том, что если вы вспомните старые чаты, там обычно были лимиты на генерацию просто установлены, причём жёсткие, фиксированные, да, когда модель, например,
227: Генерировала сколько-то там 500, например, токенов и все, и обрубала посередине предложения. Так, раньше было. Там, по моему даже первые gpt 4 ещё так работали. Потом они сделали более гибкую систему ограничения. Все равно есть. Это как бы факт.
228: Есть, но она не обрубает на полуслове, она пытается подстроить длину выдачи таким образом, чтобы, ну, примерно где-то не дальше лимита остановилась генерация, но оно не фиксированное, чтоб вот этой ерунды не было. А раньше вот нужно
229: Была, она завершила на полуслове, вы там кликали кнопочку продолжить генерацию. Модель ещё столько же токенов генерировала и так далее. Сейчас это обходится. Опять же, это уже кастомные технологии, у всех по своему они реализованы.
230: Контроль, да, со стороны инференс движка. Вот то, о чем я сейчас рассказывал, как раз-таки вот такими вещами делается. То есть Макс токен, с 1 стороны, потом step sequence, это вот пользователи апи задают специальные
231: На которых генерация окончится. Ну либо какая-то логика клиента, которую использует. Если вы делаете свою мультиагентную систему, вы можете ограничить любой логикой, программой сверху, да, как определить, что нужно закончить генерацию? Ну, вы, например, сделали публичного
232: Агента и выложили его через там telegram в работу. И вот начинают вас там тиранить кучей запросов, идёт практически дедос. Люди не могут остановиться. Вам нужно это как-то контролировать, да, и не позволять
233: Перегрузки, иначе у вас там со счета все деньги снимут. Если пользователь напрямую не оплачивает, вам нужно это как-то ограничивать.
234: Если говорить про развитие, как так вышло, да, что мы из вот этой системы генератора имеем достаточно умные вещи. Здесь есть несколько факторов. Вот это вот очень популярная популярная история, да, которую можно
235: Особенно раньше было видеть на разных презентациях. Здесь получается, о чем речь? О том, что вроде как с увеличением числа моделей, подобно тому, как у человека при увеличении размера мозга увеличивались, ну, не только у человека, у животных увеличивались
236: Способности. Ну вот подобно этому и модели просто за счёт увеличения количества весов, весов, это по сути, вот этих связей, нейронов, количество вот этих блоков, там аттеншена. Чем больше вес был, тем вот вроде как они становили
237: Умнее, но тут все не так просто. То есть у моделей не только веса увеличивались модели, и у них и архитектура, увеличив, изменялась, становилась более сложной, замысловатой, она становилась больше в плане количества именно блоков дате.
238: Кодеров декодеров, то есть не просто тупое количество увеличения количества, увеличение числа нейронов. Плюс, как мы с вами смотрели, изменялись способы обучения, добавлялись новые, более правильные, лучше
239: Фильтрация входных данных, на которых она модели обучались, ну, много, много, много Приёмов. То есть куча всего была применена, чтоб модели становились лучше не просто количество параметров, хотя, ну, безусловно, количество параметров тоже вот.
240: Ну вот это мы уже рассматривали вкратце, да, что вот 1 gpt, он просто обучался на предсказание следующего токена. Потом следующие модели, такие как gpt 2, например,
241: Уже имели процесс файнтюнинга, то есть, когда их учили предсказывать ответы на вопросы следование инструкциям GPT-3 был ещё сильно больше, GPT-3 имел гораздо больше.
242: Входных данных, на которых обучался гораздо больше параметров. Ну вот на секундочку, да, начали там примерно 100000000, потом полтора миллиарда параметров и потом уже 175 миллиардов параметров. Ну, огромная модель, просто огромная потом
243: Появилась идея как раз чефа, вот этого самого способа сделать модель вежливой, услужливой, и когда её внедрили в GPT-3 5, как раз приняли решение, что можно опубликовать ну, это все дело опубликовать.
244: И оно стало быстро популярным. Достаточно быстро количество пользователей GPT-3 5 росло очень быстро, есть даже где-то я вот зря не вставил есть где-то график и там отображается как выпускались.
245: Разные сервисы по типу там тик тока, YouTube и прочих и как быстро за времени за время то ли за месяц, то ли сколько росло число пользователей так вот у чата gpt оно очень быстро росло, то есть невероятно быстро они набрали.
246: Имеется ввиду первичных пользователей, это не значит, что он тогда стал популярным. То есть объективно, я думаю, большинство из тех, кто меня здесь слушает, GPT-3 5 не использовали. Более того, судя по всему, хайпу тому, как он раздувается, видно, что
247: Большинство людей только в том году начали использовать все эти системы. Вот и даже первые версии gpt как-то в России особенно остались немножко за бортом. То есть там только только вышел gpt 4. Ну я ни от кого не слышал, чтобы кто-то массово их использовал. Вот, ну.
248: И тогда как-то все считали, ну игрушка какая-то, баловство там, че там смотреть. Вот с другой стороны, в компаниях серьёзно обсуждали, в принципе, уже перспективы. Многие уже тогда делали ставку. Хотя, честно, я был 1 из тех, кто когда увидел первые вот эти модели, я
249: Занимался нлпи классическим нлпи это обработка естественного языка, это не нейролингвистическое программирование. Так вот, когда я занимался нлпи классическими моделями, мне тогда казалось, что, ну, как бы абсурдно исполь,
250: Там для классификации ещё чего. То есть у нас сберт есть у нас практически детерминированные вот эти системы, которые очень чётко работают с довольно стабильными метриками. При своевременном мониторинге и дообучении можно их как бы, ну, нормально использовать. Зачем тебе
251: Большие модели с непонятными выводами. Вот, но действительно прошло совсем немного времени, и потенциал сильно вырос. Вот. Потом появился, да, gpt 4 gpt был 4, уже был мультимодальным ещё больше.
252: Большее круче, потом у некоторых версий gpt, не помню с какой сол, по моему появился ризонинг и так далее. Вот. Потом тоже я приводил эту картинку в пример gpt 5, когда анонсировали там вот этих Китов.
253: Все рисовали, что а будет прогресс меньше, чем между GPT-3 и 4, там ещё gpt 1, там маленькие, там рыбки какие-то потом большие были, но на самом деле действительно там был огромный прогресс между моделями.
254: Чего не произошло между gpt 4, особенно поздними его версиями. Там типа у 3, например, и дальше, и gpt 5, потому что
255: Ну, когда появился gpt 5, я помню, прям было у многих разочарование. Многие заметили, что модель больше галлюцинировать стала, больше каких-то артефактов. Вот стали ходить вот такие мемы на тему, там анонсов от сэма альтмана, где как раз тоже Китов показывали.
256: Там вот эту картинку показывали. Типа, смотрите, сейчас там будет кит и в итоге появляется непонятно что. Ну, сейчас 5, 1, 5, 2 вышел. Они, конечно, многое пофиксили. Вот. Ну, в программировании, правда, был буст, хороший буст, дальше появляется.
257: Ну, как я сказал, она, в принципе, в gpt 4 появилась. Это мультимодальность, мультимодальность, это использование модели разных входных и выходных данных. Ну, то есть, точнее, использование разных входных и генерация разных выходных от
258: Аудио видео там до прямых голосовых входов, но обычно аудио как кстати поступает в модель вы там что-то надиктовываете. Сначала происходит транскрибация в текст, а потом подача уже текст.
259: В модель, то есть фактически мультимодальности здесь нет, но сейчас уже есть, ну, многие компании идут на то, чтобы разрабатывать прямой вход аудио в модель, потому что когда вы делаете транскрибацию, на самом деле транскрибатор часто очень
260: Путает слова, он может что-то не очень хорошо действительно распознавать, а во вторых, он не учитывает паузы между словами, он не учитывает экспрессию, повышение, понижение тональности, голос, настроение. А если мы будем модель обучать на данных именно а
261: Аудио полноценных, то модель уже будет понимать не только смысл сухой слов, но и будет понимать вообще какую-то дополнительный контекст, семантику да, происходящего как человек почему говорит 1 и ту же фразу, можно сказать, в значении какого-нибудь сарказма шутки.
262: Можно сказать в прямом смысле и просто только тональностью это будет определяться. Так вот, сейчас вот направление в этом направлении тоже двигаются. Видео подаётся, понятно, напрямую, практически всегда видеоряд, потому что по другому никак, ну, напрямую.
263: Ну, в смысле, отдельными, конечно, слайдами, но между ними есть, понятно, зависимость. Модель это как так же как токены, как цельную, непрерывную последовательность воспринимает, да? Ну и есть обычно в мультимодальных моделях модуль фьюжена, то есть объединение
264: Данных. Смысл фьюжена в том, чтобы слить все смыслы в некое единое целое, внутреннее представление, чтоб модель все воспринимала вместе и текст, и аудио, и видео, потому что это какая-то цельная система, да, цельный смысл имеет
265: Так же как у нас в мозгу, у нас же там нет какого-то прям явного разделения. То есть, да, у нас что-то поступает на визуальную кору, сначала обрабатывается там что-то текстовые, вроде как отделы, отделы мозга, отвечающие за восприятие текста.
266: Слов. Отдельно находятся речевые центры, да, хотя, по моему, генерация текста тоже отдельно. Ладно, я не силён в этих вещах. Вот. Но в итоге смысл, когда мы потом обдумываем что-то, принимаем решение, мы же на основе всего целиком
267: Делаем какие-то выводы, ну пытаемся, по крайней мере, тут та же история. Вот. Ну, потом появляется следующее. Это ризонинг, ризонинг, это та часть, которая делает модель как бы чуть чуть более умной, когда модель может
268: Что-то сгенерировать, потом сама посмотреть на то, что она сгенерировала, подумать, ну, разные вещи. То есть подумать о том, что она сделала, или декомпозировать задачу на подзадачи. Дальше, к слову говоря, на основе ризонинг появляются разные интересные штуки, такие как мульти.
269: Внутри самой модели, когда разные блоки отвечают за разные вещи, есть маленькие блоки, большие, модель, например, принимает решения, там какие-то, делает сначала декомпозицию, задачи, потом отдельные подзадачи передаёт на более маленькие блоки, которые с этим
270: Являются, ну, у этого назначение простое, понятное, то есть сделать, во первых, распараллеливание, если возможно, во вторых, уменьшить потребление вычислительных мощностей электроэнергии, воды, собственно, как следствие и, ну,
271: Просто сделать попросту более быстрый ответ, в конце Концов, то есть здесь много плюсов.
272: На этом, кстати, очень сильно выехал в своё время дипси. Когда они выпустили свой ризонинг, они тогда очень сильно на тот момент по хайпу сравнялись с чатом gpt. В общем то, они на этом, по моему, выплыли в значительной степени.
273: Что тут ещё стоит добавить? Ну, кстати говоря, обучение ризонинг проходит отдельно. Это тоже часть дополнительного файнтюнинга модели. Это когда модель берут и уже обучают её примерам. А как можно рассуждать последовательностям рассуждения, то есть в ответ
274: Ну, на какой-то входящий запрос это отдельная часть, то есть отдельно, вот как я говорил, дальше появляются инструменты фанкшн, коллинг, тул, коллинг, да, когда все поняли, что модель может быть не просто
275: Говорилка, которая что-то там говорит, генерирует модели, можно дать инструменты, научить её пользоваться, пользоваться инструментами. Модель тоже учит отдельно. То есть tool юз. Вот этот использование инструментов это отдельная обучающая задача. Вот не
276: Все модели их это умеют делать. А те, которые умеют, не все это умеют делать качественно, условно. Какой-нибудь маленькой модельке можно написать, что окей. В ответ на запрос, на который у тебя нет актуальных данных, воспользуйся инструментом веб поиска. Он
277: Типа, называется так-то пользуйся. И маленькие модели бывают часто просто такое игнорируют. Ты немножко переписываешь промт, они начинают использовать, но это очень нестабильно. Вот, кстати говоря,
278: Хотя ладно, сейчас, чуть позже об этом вот разница по сути между фанкшн коллинг и tool юзом ну просто в названиях то есть to calling точнее да, фанкшн коллинг где-то тут было написано я уже не помню был да, вроде как.
279: А тут написано андрои не отвечаю за эти данные, сразу говорю, но вполне вероятно, так и было.
280: Потом придумали эмсипи протокол. То есть проблема была в чем? Вот здесь картинка хорошая, которая это объясняет. Проблема была в том, что если мы делаем такое разношёрстное использование, то каждой модели нужно делать. Получается разные надстройки для того, что
281: Чтоб она могла эти инструменты использовать и придумали. А давайте мы сделаем эмсипи сервер, то есть некую единую точку входа для всех моделей, независимо от того, чья модель, которая будет универсальна для всех, и вы можете поднять свой mcp сервер, который
282: Имеют доступы, например, к вашим сирм системам в компании, базам данных биай, каким-то штукам и так далее к витринам данных и через эмсипи сервер как центральную прослойку сделать доступ моделей много cpp.
283: Сервер 1 и все одинаково с ним могут пользоваться. И это было хорошо. Да? Ну тут хорошая формулировка, что, по сути, это контракт между детерминированными системами, вот этими всеми корпоративными сире,
284: Биай и недетерминированными агентами.
285: Так.
286: Так дальше где брать модели?
287: Ну, мы много говорили, что есть on premise решение, когда вы покупаете своё железо, сами ставите свою модель. Есть варианты использовать какие-то интерфейсы к этим моделям, да, к чужим. Но, допустим, вашей же компании,
288: Ну, интерфейс имеется ввиду, там, например, графический, просто открыть браузер, да, использовать самое такое, ну, наверное, неполноценное использование. И cloud облачный апи, да, когда вы покупаете, платите за подписку, за токены, ну и просто
289: Отправляете куда-то на сторону ваши данные, ваши запросы получаете в ответ что-то я вот сейчас покажу штуку например которая называется. Сейчас я открою её.
290: Вот есть такая штука, например m studio, да, но мы её на практических занятиях обязательно разберём, просто для понимания да, как можно у себя локально запустить, то есть любой из вас может скачать себе лм студия, открыть её, она есть, по моему, под все системы, под mark, под вин.
291: Под линукс, кстати, с gui есть нет, не помню ну, скорее всего есть вот есть ещё lana тоже, но am studia просто интерфейс, на мой взгляд, поприятнее и чисто посмотреть вы можете вот открыть список моделей, ну здесь разные варианты.
292: Открытия есть, есть developer mode, где можно посмотреть, есть чат мод и в общем то, выбрать модель, загрузить эту модель. Ну, допустим, у меня там есть queen 3 8 б. Да, можно тут нажать, на него, можно
293: Нажать, да, можно выбрать разные опции, там контекст, длина контекста кв, кэш. Об этом потом Даниил, думаю, расскажет. Ну и загрузить модель. Вот у нас идёт загрузка.
294: Queen 3 загружается, загружается довольно быстро, квен 3 есть немного, он, по моему, гигабайта, 4 оперативки где-то займёт у меня, ну и вот сейчас он загрузился, будет работать, можно ему че-нибудь написать?
295: Ай, ладно, буду на английском hello.
296: Процесс промт, че то, кстати, долго работает, он быстрее работал. Нужно ответить. Ну вот он показывает вместе с ризонингом, там как, че он думал, вот нужно ответить на приветствие в формате, который будет понятны, понятен и дружелюбным. Вот следствие.
297: Вот привет. Как настроение? Что нового в твоём мире программирования? Ну, допустим, все хорошо.
298: А кстати, ответил почему-то на русском, что интересно, оллайн, давайте напишем оллайн, а теперь на английском издании глёт ту хир зет хау консист тудей. Да, у него сейчас нету памяти, он не запоминает, если вы не подключите.
299: Модели памяти, она не будет запоминать, о чем вы с ней говорили. То есть, чтобы она запоминала, нужна база, в которой хранится вся история диалогов, и каждый раз раз за разом модель будет весь контекст пережёвывать. Это важный момент. Чем больше контекст, тем больше процессинга идёт.
300: Собственно, можно подгружать разные модели. Вот здесь можно, например, открыть интерфейс, да, и посмотреть, какие тут есть. Ну вот, best match есть, а есть мост, лайкс, например, или, то есть больше всего лайков, или больше всего скачиваний. Ну, 1 из самых лучших.
301: Наверное, моделей, если я не устарел за это время из маленького размера, это gpt сс 20 б загружено вот 205 дней назад, очень давно. Тут что есть, тут можно посмотреть галочки вот здесь вот если есть молоточек, значит,
302: Модель может использовать инструменты вот тот самый two us тул кол если есть мозг нарисован, модель может поддерживать ризани важный момент если модель поддерживает ризани, то не факт, не у всех моделей.
303: Он отключаемый, это не всегда нужно. То есть, если вы скачали модель с ризонингом для простых задач, где он не нужен, типа там пойти загуглить какая сейчас погода у агента, то модель будет каждый раз ещё раздумывать там, чтобы как там пользователю лучше погоду. А вот я получил
304: Данные то как мне вообще забрать? Вот правильно? У меня там 5 сайтов, там чуть чуть на градус отличается температура. Давайте подумаем, какой лучше? + 9 или + 10 отдать. Вот вам это не нужно, это будет нагружать только инференс. Есть модели вот с глазиком.
305: Это модели, которые могут поддерживать обработку изображений. Ну что как бы здорово. Вот. То есть можно подавать туда для осиа, например, использовать распознавание текстов или классификации картинок. Вот можно одновременно подгрузить 1
306: Модели можно много моделей подгрузить. Вот, вот как-то так. Так вот наш queen мы джект сделаем, модели очень быстро выгружаются. Вот по кнопочке джект сразу небольшие модели, они загружаются, в общем то быстро
307: Вот, ну, вам единственное, что нужно, чтоб памяти хватало, вот идеальный вариант на либо на gpu запускать, либо на м, процессорах, которые, ну, быстрее стандартных процессоров все равно обрабатывают это дело.
308: Продолжим так, вопросики.
309: Тоже чуть позже. Вопросов немного. Да, я думаю, на все отвечу. Если супер много не наберётся. Итак, где брать модели? Да, собственно, поняли. Можем локально запускать, можем свою серверную стойку поднять, если хотим, да, там купить теслу. Если деньги и возможности есть, можем.
310: Использовать токены. Тут на ваше усмотрение. Теперь переходим к чему, как использовать. Окей, сама по себе модель, мы выяснили. Ну, это довольно бесполезная история, если она не имеет никаких коннектов, подключений в чистом виде. Ну да, можно поговорить здорово. Какие-то факты.
311: Узнать, как в бизнесе это использовать. Есть основные паттерны. Самый простой паттерн. Начнём с него. Это дарик промти, дарик промти. Это вот и есть тот самый тупой, когда мы просто в лоб че то спрашиваем. 2 паттерн это пром, инжиниринг, Пронт, инжиниринг.
312: Подразумевает, что вы уже с умом подходите к формированию Пронтов. Вы там используете всякие методы типа трио соц, дерево, в общем, мыслей или цепочка рассуждений, или у вас он ещё структурирована роль и так далее. Это чуть позже.
313: Тоже сейчас. Дальше. Рег ретри generates андартные, самый в бизнесе подход, когда у вас есть ваши данные локальные, корпоративные, и вам нужно модели дать к ним доступ. Модель же на них не обучалась, как это сделать. Ну вот, можно использовать рек.
314: Система по поводу рег, вот отдельно коллеги проведут тоже занятие. Это будет через 1, по моему, если не ошибаюсь, дальше вы можете модели дать ещё доступ к инстру.
315: Это ещё дополнительное использование. Ну и фактически я бы не стал разделять, да, если у модели есть доступ к инструментам, то её можно уже считать фактически агентом. У неё есть входные данные, у неё есть доступы на воздействие, на какие-то системы или чтение с каких-то систем, это уж
316: Есть агент, то есть агентский сценарий и мультиагентстве уже много агентов. Давайте прямо говорить, что каких-то промежуточных, ну, единичных случаев почти не бывает. Почти всегда это большая мультиагентная система, у которой есть доступ.
317: Доступ к инструментам, к системе ретрива. Причём я б тут даже в поиск отнёс фактически в поиск. Это тоже reg, наверное, можно считать. Вот, ну и с системными промтами. То есть обычно используется все вместе, потому что простых каких-то
318: Способов просто 1 простой рег. Ну он неэффективен вообще, если говорить о способах обогащения модели знаниями, то, по сути, есть их 3 основных. 1 это
319: Прямую подавать прям в промтест данные. То есть когда вы прям в модель вкидываете текст и прикрепляете ей документ и задаёте вопрос, типа, вот у меня документ. Слушай, а можешь мне его самарии, овать, сделать короткую выжимку? Ну вы как бы, да, дали ей данные.
320: И промтом тут же прям попросили что-то сделать. 2 вариант использовать рег системы рег ещё раз. Это ретри аугмент дженерейтор. Когда вы даёте модели дополнительный инструмент для того, чтобы она пошла куда-то в базу,
321: Через инструмент рег извлекла какие-то нужные данные по вашему запросу и уже с их использованием ответила. И 3 вариант это дообучение. Ну то есть это файнтюнинг, когда вы берете, дообучаете модель на своих данных,
322: Вот у нас довольно мало времени остаётся, у нас ещё будет про рег мультиагентной системы мы поговорим чуть чуть позже, на самом деле. А вот
323: Давайте пронты, ладно, пронты разберём. Просто хочу больше на вопросы сейчас ответить. Промт. Я думаю, все знают. Давайте некоторые свои мысли на эту тему. Выскажу. Мысли инсайты, как это назвать. Промт. Понятно. Это просто обращение к модели.
324: Обычно, если вы, мы говорим о каком-то системном промте, то вы можете его расписать, как ты, например, тот-то тот то тот-то, да, чтобы она модель, знала свою роль. Ну потому что может быть разный ответ. Например, вы просите модель сказать, ответь на вот этот вопрос.
325: И в зависимости от её Роли она по разному будет отвечать. Вы можете сказать, что ты, допустим, воспитатель в детском садике, ты преподаватель в университете или ты менеджер по продажам нашего там отдела, отвечающего за продажу, я не знаю past.
326: Вилок и ложек, и модель по разному должна по идее себя вести. Понятно, что если она воспитатель детского сада, это 1 риторика. Если она менеджер по продажам, совсем другая. Вот. Дальше задача, что ты должен сделать потом пояснение. Можно дополнительный контент.
327: Текст дать? Ну и формат, например, ответь мне в виде json файла, если я хочу что-то структурирование, или csv таблички, или дай мне ответ там в виде просто таблицы или нарисуй картинку, если это мультимодальный ответ на ва.
328: Там рисует виде ответа, например, по промта да, вот тут вот рекомендации, что можно использовать ролли, можно fushou фью шот что такое кстати да, вот эти термины Ван шот фью шот все просто например, вы
329: Модели, говорите, смотри, вот есть такой-то текст, ну вот допустим, у неё задача классифицировать письма на почте. Есть такое-то письмо, это письмо относится к спаму. Если, а вот это письмо, смотри, вот это письмо, это деловая почта в рамках там
330: Моих корпоративных коммуникаций вот one shot это значит, что вы ей дали 1 пример такой и сказали, что это feuer шот значит несколько примеров Зиро шот, когда вы ей примеров не дали, просто сказали вот у тебя доступ к инструменту почтовика.
331: Ну, то есть ты можешь забирать письма, пожалуйста, классифицируй мне их на спам и письма, на которые нужно ответить. Вот. А примеров не дали. Если вы дадите примеров, то модель с большей вероятностью будет качественно отвечать. Промт, как тут, верно, подмечен.
332: Зачастую лучше писать на английском языке чем больше моделей, тем в меньшей степени это имеет значение, но тем не менее начинать лучше с простого промта и потом его адаптировать или так как-то тестировать. В общем, тут много способов избегать.
333: Лучше неточностей и противоречий. Если у вас в самом предложении заложена ошибка, то большая вероятность, что модель загаллицизмы модели умные, они игнорируют часто такую ложную информацию, но не факт. Не всегда. Ну и чем
334: Больше контекст в теории, тем лучше. То есть, чем больше вы опишите всю ситуацию, все условия, тем, ну понятно, модель будет лучше работать. Если по простому и честно, то на самом деле я не совсем понимаю, почему
335: Как-то особо выделяют профессии там промт инженера какого-то там microsoft, там публиковал всякую ерундистику никакой такой профессии не будет по простой причине модели, потому что, во первых, умнеют чем дальше, тем меньше ухищрений с prompt инженирингом треб.
336: И на самом деле модели чаще всего понимают гораздо лучше, чем люди. То есть там, где я там простой запрос пишу. И думаю, я столько данных не дал, модель даёт хорошие результаты, а человеку пришлось бы там объяснять, разжёвывать, уточнять, он бы ко мне.
337: Раз с вопросами вернулся, на самом деле современные большие качественные модели без всякого промт инжиниринга отлично работают. Тем не менее, если мы делаем мультиагентную систему с маленькими моделями более дешёвыми, да, то тут, конечно, это работает, но если
338: В целом какой-то супер магии и называть это промт инженерингом. Ну термин имеет место быть, конечно, но по большому счёту, это взаимодействие как с сотрудником. Есть теория ситуативного менеджмента да, когда вы руководитель, у вас есть
339: Есть разные сотрудники вот этот ваш там, зам, вот этот вот сотрудник там сильно младше. А вот этот вообще стажёр пришёл, и как будто бы с каждого рода сотрудниками, с его опытом, с разными их опытами нужно по разному взаимодействовать там.
340: Juno стажёру нужно объяснять все детально, досконально, хотя такие стажёры бывают, что, блин, всех переплюнут. Вот там, условно человеку по высоким, высоких должностей большого опыта обычно нужно меньше разжёвывать, да, то есть
341: Вы можете действовать достаточно абстрактно, ставить очень неточные цели, задачи, просто как-то обширно ты отвечаешь условно за вот это направление, развивая его, и человек сам поймёт, там пойдёт все делать. Ну так и тут, то есть чем круче модель, чем
342: Она умнее, тем лучше она будет справляться. Вот. Поэтому, по большому счёту, разговор с моделей, с моделью, постановка ей задачи, ну, это похожая история на тоже самое, как вы делаете постановку задачи сотрудникам, другим людям, да, просто чем
343: Умнее модель, тем меньше вот этих нюансов надо
344: Вот, ну и прежде всего, да, это просто эксперименты и просто немножко попользовавшись разными моделями, там неделю, 1 недели, другой. Ну обычно я вот все вместе использую, да, у меня там я сразу использую джимин и chat, gpt и дипси.
345: Использую и queen 3 max использую и гемму, иногда и клод. 4, 5, 4, 6 синкинг не синкинг, ты быстро в принципе привыкаешь, в чем отличие, какая, в чем лучше, просто вопрос опыта тут какой-то науки здесь нет.
346: Нет, это просто эмпирический опыт. К тому же сама модель какая-то может вам позволить составить хороший системный промт. Вот. Поэтому вот прям фокусироваться на протах, на prompt инжениринге, я считаю, это перебор вообще заморачиваться с этим просто.
347: Попользуйтесь моделями, поймите, как они работают. Вот не знаю, уже будут на эту тему споры, может быть кто-то не согласен. Пишите, пожалуйста, пообсуждаем. Да, есть системный промт, есть пользовательский промт. Отличие в том, что системный промт это тот промт, кото
348: Который вы задали модели и она всегда с его контекстом работает. Ну например вы в chat gpt зашли в настройки, написали, что ты например программист который пишет код на том-то, том-то и ты вот
349: Не знаю, какой-нибудь предпочитаешь какие-то паттерны проектирования и такой to стиль программирования у тебя, ну и все и все, что вы дальше будете писать, модель будет держать в уме, что вот она программист, который такой то такой-то и будет пытаться отвечать, как будто она такая, а если вы напишите, что ты
350: Юрист, например, ну вот по такой-то теме, ну она вроде как будет более юридическими терминами оперировать. И вот все вот это, это системный промт. А пользовательский промт это то, что вы непосредственно модели пишите, передаёте
351: Ну, тут примеры, я сейчас, у нас времени не осталось, разжёвывать не буду. Ну че, соц, цепочка рассуждений. Вы модель просите, там сначала запиши задачу, потом декомпозируй, потом там, проведи, например, декомпозируй, потом по каждой.
352: Подумай, прими решение или напиши какие-то выводы, потом перепроверь эти выводы, а потом Выдай мне финальное заключение. Это цепочка рассуждений. 3. Это, как правило, разветвление. Часто используют совместную схему, когда там есть и разветвление, и цепочка, и все.
353: Вместе это тот вот код, тот вот эти аббревиатуры, тут все просто есть ещё реакт это когда модель должна действовать. То есть это промт, который используется с агентами, например, там сходи в рег систему, запроси в базе такие-то данные.
354: Посмотри достаточно ли их, если данных недостаточно, то попробуй извлечь таблицу, сделать к ней какие-нибудь sql, запросы или там панда, запросы извлеки дополнительные данные, ещё раз проверь что их достаточно, то есть тут уже есть наблю.
355: Дени, рассуждение, повторение, доступ к инструментам это react вот тоже тут примеры и финально сейчас тоже без фокусов просто проговорю что есть рек вот это самый такой популярный инструмент.
356: Reg, что он подразумевает 3 3, да, действия ретри generates это извлечение. Ретрив подразумевает, что так как наши корпоративные данные могут быть очень большими, то мы не можем сразу их засунуть все в
357: Текст у нас там может быть терабайты данных каких-то и когда мы делаем запрос модели и просим её на что-то ответить, посмотреть какие-нибудь процессы согласования, регламенты, что-то ещё модель должна к этим данным получить доступ. Как это сделать? Мы
358: Делаем систему ретрива, которая при помощи разных Хитрых методов, исходя из промта, идёт в хранилище данных и забирает, пытается точнее найти те данные, которые с наибольшей вероятностью позволят модели ответ.
359: На вопрос ретрив, ну как работает рек способов ретрива уйма там усложнений, переусложнений, аугмент. Это значит, когда вот ретривер отдал данные модели типа, окей, я нашла вот этот документ, вот те куски текста, в которых, скорее всего, содержится ответ и выдаёт
360: 10 вариантов. Модель их смотрит, выбирает самые пригодные и получается как бы дополняет этими данными свой контекст, кроме запроса пользователя, и потом уже генерирует ответ. Это рег, тут все просто. Вот мы о реге позже пого.
361: Говорим, ну здесь есть структура, ну ещё раз у нас будет отдельное занятие, поэтому сейчас без, без фанатизма усложнее вариантов усложнения рега столько, сколько хватает ваших творческих способностей. Можно такого напридумывать, но
362: Проблема рега в том, что чем сильнее вы его усложните, тем больше вычислительных ресурсов будет требоваться для того, чтобы такая система работала. Поэтому как бы фантазия ваша далеко не зашла, нужно всегда соблюдать вот этот баланс. Он всегда трейдов между производитель.
363: Скоростью работы и качеством ответов. Поэтому нельзя слишком усложнить рек, иначе он будет очень долго работать. Есть куча видов рек. Я бы вообще не стал их классифицировать. Ну, кроме как, что есть простой рек, есть сложный рек.
364: Скажем так, сложный рег, ещё раз бесконечное число вариантов как-то можно напридумывать. 2 штука, о которой мы будем дальше говорить в следующих занятиях. Это дообучение Лора, именно Лора, потому что я исхожу из предположения, что
365: Людей, которые заинтересованы в полном обучении при трейне фул файнтюнинге, то есть полном там файнтюнинге, модели среди наших пользователей нет, потому что им такой контент ни к чему, они сами все знают. Вот, и, в принципе,
366: Любые способы дообучения, кроме лоры, требуют очень больших мощностей, а lara это способ как бы немножко дообучить эту огромную модель, добавив всего лишь 1 небольшую примочку спереди. Ну, в конце, грубо говоря, адаптор Лора это lora анк.
367: Мы делаем отдельный адаптер, такая, грубо говоря, фильтр наставляем на модель, его дообучаем этот фильтр и model, потом чуть чуть себя по другому ведёт. Ну, например, там у нас в корпорации действуют какие-нибудь определённые корпоративные правила, регламенты, форматы общения и вот
368: Её чуть чуть на тюнили. Или нам нужна юридическая модель, которая всегда будет работать. Тоже как юрист. Мы тоже чуть чуть дотюнили. Это же самое можно сделать через промт, сказать, что ты юрист, но
369: Lara может иногда и Лора вместе с пронто может как бы подавать лучше результат, тут нужно тестировать вот, ну и агентские системы тоже у нас будет отдельное занятие, это большая тема, да, потому что, ну, агенты это ключевой паттерн, опять же.
370: Потому что рег, ну, почти всегда используется в комплексе мультиагентной системы, то есть у какого-то агента, например, есть доступ к регу. Вот и все к ретрив, это только 1 из агентов будет. Вот. Поэтому мы будем говорить про концепцию мультиагентных систем, про то, как их выстраивать.
371: Как давать доступ к инструментам, к данным, какие есть системы для того, чтобы создать мультиагентную систему там, но код системы, код системы. Хотя, хотя, честно говоря, сейчас все идёт к тому, что
372: Все это скоро не надо будет знать. Скоро вы будете делать запрос, да, кидать клод код, например, на свой сервер и говорить, ты там разверни мне мультиагентную систему, которая там, рой агентов, который делает то-то, то, то, то, то. Вот. А я приду, посмотрю, что ты все.
373: Хорошо сделал. Главное, тесты нормальные. Добавить туда, чтобы он тесты проходил, ерунды не получалось. А в остальном как бы, вот, ну, если вкратце, да, то есть мы обсуждали, что агент это сущность, у которой есть вход, выход, то есть вход, входная информация выходная, да?
374: И по сути, агенту нужны инструменты, там доступы к базам, к системам, нужны какие-то данные, нужны сами модели мощности, то есть сам мозг агента. Вот, ну, ресурсы, ну такую ещё картинку я тоже рисовал. Так.
375: Последняя тема, последняя тема, мы её ещё будем затрагивать. В целом модели вот есть большие исходные варианты, а есть разные варианты, как их сделать более оптимальными. То есть потому что большие модели, они требуют очень сложного дорогого инференса. Вот.
376: Если мы их, например, заквантовое, переведём там в форматы соответствующие, то модель станет меньше в объёме и будет быстрее рассчитывать. Мы потеряем немножко в качестве, но, как правило, при квантизации качество падает не настолько
377: Сколько уменьшаются требования к железу. И поэтому квантизацию чаще всего используют вот для того, чтобы развернуть на каких-то ограниченных мощностях. И вот квантизация 1 из самых таких популярных.
378: Честно сказать, редко кто делает сам автоматизацию. То есть, кроме БИК тех компании, то есть, если вы не работаете разработчиком в отделе, отвечающем за внедрение лм, в каком-то бигтех, то, скорее всего, сами вы её делать не будете. Есть много готовых инструментов, типа
379: Там биен байтс, там гуф, джиджи, юф. Некоторые называют, но чаще всего ручная квантизация не человеком, который не погружён глубоко в это приводит к низкому качеству модели.
380: То есть, как правило, если сам производитель выпускает квантизованный версию, модель получается сильно лучше. Вот, ну, в целом квантизация, что такое? Это просто у модели есть вот эти веса, если кто помнит, хотя б примерно как устроена нейросеть у нас
381: Есть связи между нейронами. Проходя через от нейрона к нейрону. Сигнал проходит через вес связи. То есть он сигнал может усилиться, уменьшиться. Ну то есть он умножается на вот эти веса омега. Вот, и вот эти зна,
382: Значения, которые передаются, они имеют определённую точность после запятой, после нуля, да и квантизация это уменьшение битности, то есть, например, хранились они в ячейках памяти по 16 bit, да а?
383: Мы возьмём и урежем до 8, до 4, ну, 4, самые популярные до 4 бит. У нас точность после запятой падает и как бы, да, модель как будто становится менее точной, но при этом она сильно меньше в размерах становится и как бы часто это решающее
384: Вот так, да, дистиляции есть много методов, в общем то, вот кв кэш, ну, об этом сейчас, в общем, говорить не будем сильно. Ну, про форматы, да, вот вы когда
385: Будет скачивать модели, допустим, вы откроете лм студия, вы сможете выбирать между, например, ггу и миксом. Гуф это просто 1 из форматов хранения модели, но это не про оптимизацию, это просто формат, но, как правило, в этом формате идут квантизованный модели. Вот
386: Там кванты метаданные, он достаточно кроссплатформенный вот guf он универсальный кросс платформенный, он и на маке на виндовсе работает, а есть Мэлис млик это эппловский формат, то есть если вы используете мак.
387: Какой-нибудь mac studio макбук, там что-то такое и на м процессоре, именно на армах, да, вот эти новые, относительно новые процессоры, не интелловские, то Мэлис формат более оптимизирован под мак, чем ггу работает обычно побыстрее.
388: Вот поэтому, если mc, то берите микс, если у вас linux windows, берите джи джи ю эф вот.
389: В принципе, на сегодня все, давайте я посмотрю вопросы, быстренько постараюсь на что-то из этого ответить и мы закончим. Так, ну поехали, давайте при процессинг тшеринг как приготовить?
390: Так, про крылышки там сразу кто-то рецепты крылышек выложил. Спасибо, но ведь от файнтюнинг нейросеть не перестаёт предсказывать следующих токенов, она точно также дальше его предсказывает. Ну, разумеется, просто следующим токеном становится.
391: И продолжение предложения. После вот этого инстракт файнтюнинга, да, у вас следующим токеном модель начинает предсказывать гипотетический ответ на то, что она получила на вход. То есть так бы она ответила, вы там напи, пишите.
392: Я хочу чашку, и она там предскажет кофе. А если вы это если модель без инстракт файнтюнинга, если модель с инстракт фантюнингом, вы ей напишите, я хочу чашку кофе, и она не попытается потенциальное следующее слово предсказать, она
393: Вам, вас спросит что-нибудь, типа, да, какой кофе вы хотите купить? Вы хотите вам, вам выдать какие-то магазины поблизости или вам рассказать, какие сорта кофе бывают в этом смысл? То есть её учат, да, она предсказывает следующи.
394: Токен, но только токен уже в другом контексте, не в контексте того, что вы могли бы продолжить
395: Так, а как работают генераторы изображения по описанию мультимодальная система, просто обучение идёт на генерацию изображения. Вот все, то есть другой вход, то есть вход также текстовый. Вы дали описание, а на выходе ей дают возможные варианты изображений. Честно, как
396: Именно делается датасет. Я не знаю, не изучал этот вопрос. Могу предположить, что берут уже готовые картинки, а к ним генерируют описание, а потом вот эти пары, скорее всего, совмещают и показывают, как соотносится описа.
397: Изображение и картинка, я могу так предположить. Ну, это первые модели, скорее всего, так делались. Сейчас понятно это все можно автоматизировать, можно ссылку на сайт, я, ну, там поскидывали, видимо, да, я ещё скину, продублирую, уточните, что на входе
398: Что на выходе декодер онли модели на входе текст, который проходит токенизатор и слова преобразуются в токены. То есть токены представлены числами. Дальше они сравниваются, там есть матрица специальная, в которой идёт как бы матчинг вот этих токенов с векторами.
399: Забирается вектор, ну и дальше он идёт по всей цепочке.
400: А вместе топ k da отвечали можно указывать, если не указывать сейчас.
401: Это, видимо, в контексте было топ k топ топ p семплинга.
402: Да, комментарий про аудио модальности слабо знаю. Я слышал, что не знаю, ты инсайд. Нет, короче, некоторые наши компании вроде как в этом сейчас упражняются. Ну, наверняка импортные зарубежные тоже упражняются. Имеется ввиду, в
403: Попытки сразу переваривать аудиовход. Вот я думаю это скоро появится просто это не является настолько критичным но хотя это важная тоже доработка.
404: Mcp сервер это шлюз ну, наверное да, можно сравнить со шлюзом. То есть это слой, посредник, посредник между инструментом и моделью. Просто универсальный вход фактически, да.
405: Интересует вопрос безопасности при использовании cpp сервера. Не думаю, что модели даётся полный доступ ко всем системам бизнеса. Это как минимум опрометчиво. Есть какие-то специализированные тозы. Честно. Ска, ну как бы cpp server это, ну довольно
406: Стандартный там код есть и формат, да, стандартизированный. Какую вы логику вокруг этого обвязку поставите? То есть это просто доп, обвязка. Вы там можете системы авторизации делать? Да, тут уже от архитектуры зависит. Я прям, мне кажется.
407: Какой-то прям стандартный инструмент стандартный будет только в плане системы аутентификации. Это да.
408: То есть, как правило же просто идёт ограничение по набору доступных инструментов. То есть, если, например, вы авторизованы под с такими-то правами, то в ваших руках эта модель просто не будет иметь доступ к каким-то инструмент.
409: Вот и все. Можно это на разных уровнях делать, это можно ограничивать на уровне самой базы, на входах да, можно ещё как-то. Ну, в общем, вариантов тут уйма. Как это сделать? Нужно исходить из архитектуры.
410: Целевой системы, я считаю, я больше того скажу, чаще всего при проектировании таких систем в корпоративных средах исходить вы будете не даже из самого оптимального варианта, а из варианта того,
411: Как изначально устроена архитектура и какие у вас лично есть доступы, как проще, никак оптимальнее. Другой вопрос. Если вы с нуля будете выстраивать систему, ну, тут можно думать.
412: Для локального кодера. Ну возьмите какой-нибудь енкодер настолько большой, насколько поместится у вас на компьютере.
413: Ну, то есть, если вообще локально идеальный вариант купить Макс студию на 256 или 512 гигабайт и запускать там какой-нибудь Дисик, то есть, в нормальной даже версии, в большой, на 200 гигов. И, наверное, это, ну, глм, я не помню, сколько, глм.
414: Можно, глм, пробовать, ну, в общем, опенсорсные модели смотреть, какие лучше за этим следить надо. Я вот последние пару месяцев точно не следил за, ну, именно такими локальными моделями.
415: What rules, да, в m studio есть мультимодальные модели, но я показывал там есть значок глазика, да, они могут картинки принимать.
416: Рус в курсоре. Ну, фактически это часть, да, это часть систем промта.
417: А в целом это боль, проблема допиливания промта до условно оптимального. Есть ли смысл как-то оптимизировать? Дело в том, что тут нету методов допиливания пронта в смысле гарантированных, это недотерминов нная система, и каждый промт ещё для разной модели будет
418: Работать по разному. Поэтому самый правильный вариант, если вы выбрали модель или какой-то диапазон моделей, это просто взять и
419: Настроить автотесты, то есть взять другие лмки, построить, во первых, бенчмарк, который сможет, по понятным адекватным релевантным метрикам оценивать желаемый вами результат и начать экспериментировать в авторежиме лмками.
420: Генерировать разные варианты Пронтов и проводить тесты, ну на каком-то относительно вменяемом наборе данных. Только так. Вот другой вариант, конечно, просто руками. Ну там 1, 2, 3, 5 попробовал. Ну окей, это тоже самое, абсолютно как подбор.
421: Гиперпараметров, да, на классических моделях. Вы можете руками примерно там прикинуть, какую глубину дерево решений взять, сколько там деревьев там использовать в каком-нибудь рендомфоресте. Ну и навскидку там попробовать. Окей, возьмём 50, возьмём 100, возьмём 150.
422: Ну, 150 вроде, вроде приемлемо, да, там теперь какая глубина дерева. Ну, попробовали 3, 5, 8, там выбрали лучший вариант. Так, и тут. А можно подойти системно и настроить файнтюн этого дела, то есть.
423: Автоматически.
424: Можно будет ещё рассказывать про квантование, про квантизацию, про лору. У нас будет отдельная ещё тема, да, это будет
425: Разработчик теперь скорее систем дизайн. Плюс кьюэй специалист. Ну да, да, мы переходим в разряд даже не архитекторов, потому что скоро архитектуры большие модели типа клода 4 6 архи.
426: Архитектуру очень даже неплохо пилят, кроме совсем верхнеуровневой. А вот в разряд продукт оунера скорее, да, а кьюэй просто, то есть она и кьюэй как бы хороший, но просто для того, чтобы убедиться, что действительно тесты адекватные, да, в идеале вы должны
427: Сейчас же получается ключевая это концепция вот этого вайб кодинга, она отходит от как он называется? Тест бист программинг, как по-русски. Ну, короче говоря, что вы просто пишите нужные тесты, которые программа должна проходить. Вот, и
428: Все, а потом уже задаёте нужные промты, говорите системе, что вот те тесты, вот тебе задачи, описание желаемого результата, и модель программирует до тех пор, пока она не сможет эти тесты пройти, могут быть тесты.
429: На качество кода, на на качество, на в общем то, реализацию задачи, на скорость, да, то есть вы можете проверять нагрузоустойчивости, да, тест драйв девелопмент, тд. Д. Все верно, спасибо. Так что
430: Тдд да, сейчас в основе ты сказал, что используешь в своей работе различные модели чат gpt джимена и так далее. Хватает ли бесплатной версии, как купить?
431: Chat gpt. Я покупаю подписку через виртуальную карточку. Просто у меня просто есть виртуальная карточка, которая позволяет такое оплачивать джимин. Я бесплатным пользуюсь короче у меня все бесплатное кроме курсора и ча.
432: Вот, то есть, че то, что-то через лм арену арена, арена, Анна, по моему, сейчас называется. То есть тот же клод 4, 6. Мне обычно не так часто нужен не в контексте, в смысле курсора, а в контексте отдельного использования. И просто захо.
433: В арену пользуешься, там есть ограничения, но обычно там штук 10 запросов, или плюс в день у него есть. То есть там кончился 4, 6 синкинг, переключаем на 4 6 обычный, к примеру, да, можно на 4 5 дереться. Каждый раз токены пойдут заново.
434: Плюс у тебя дипси плюс queen и всего достаточно большие бесплатные лимиты. Вот, так что у меня 2 основные подписки.
435: Сейчас клод ещё будет. То есть будет, получается, курсор, клод и чат хотел клод купить отдельно, че то за, я не смог авторизоваться. Он в итоге даже с включённым туннелем говорит, нет, но большой потребности не было.
436: Алиса, я сейчас не использую с GigaChat. М, ну, потому что, да, там есть какие-то бесплатные запросы, объективно, обычно задачи сложные идут. И что для кодинга, что для каких?
437: Там постов написания или публикации даже, да, то есть чаще всего объективно всегда знаешь, что клод 4, 6, допустим, самый крутой в большинстве задач. Ты просто интуитивно идёшь в клод. Вот и все. Вот. То есть и так очень много сущностей.
438: На самом деле, между которыми приходится выбирать GigaChat с алисой даже особо не тестировал по отзывам вроде неплохо стало, но, наверное, при каких-то условиях буду использовать не знаю.
439: Как агенты де знают кодовую базу, какие файлы изменять, они приходят и строят свою мини рег, но они индексируют, во первых, всю файловую базу, то есть они у них проиндексированы, и фактически там своя ретри система есть. Ну, это можно назвать, рег.
440: Не думаю, что мини и да, то есть у него постоянно там качественно сделано. Хочу заметить, если мне, например, нужно, давайте представим задачу. У вас есть большой проект и вам нужно, у вас есть документы, к примеру, да, какие-то там разные статьи?
441: И может быть есть какие-то переписки, с чем, с кем-то, с чем-то там по требованиям к чему-то, к примеру вы захотели и куча кода ещё в довесок. И вы захотели написать, например, какой-то отчёт на тему чего-нибудь.
442: По большому проекту просто взять, поместить эти файлы в какую-то нейросетку, просто целиком у вас не получится, у неё и контекста не хватит, она и даже если хватит, она с этим большим контекстом, она его не переварит. И как раз работа с tech.
443: Документами в купе с кодом, да, даже просто с текстовыми гораздо круче делается через тот же курсор. То есть вы, я реально очень часто вместо такого чата использую просто курсор, потому что он лучше элементарный пример, если
444: Мне нужно сделать драфт Тестов, например, да, я могу кинуть транскрибацию, лекции, могу кинуть все документы, описание, лекции, презентацию, кинуть это все в курсор попросить написать с нужным промтом.
445: Тесты, и он это сделает в разы лучше, круче, чем отдельные модели в разы просто. И потом просто ты уже правишь там, смотришь, че то убираешь, че то добавляешь как идея. Ну и все.
446: Да, кстати, ансло есть ансло. 1 из самых популярных. Собственно, гуф жив, гуф жив. Ну, жив, че, гуф жив. Да, всегда тоже это в голову приходит промт. Лучше писать на английском, если я хочу ответ на
447: Русском нет, нет, нет. Системный пром, да. А сам пром запрос лучше. Хотя, честно, я не тестировал. Может быть, если попросить на английском получить ответ, а потом перевести его, может быть, так и лучше будет.
448: Ну, то есть ещё раз смотрите, в самом начале я подсветил нюанс, что английский язык более предсказуемый с точки зрения последовательности токенов, и поэтому обучение идёт по разному. И как будто бы более детерминированные ответы получаются. И да, вот тут
449: Написали, что генерация быстрее, наверное, в этом смысле, да, вот, но, но я не тестировал. В общем, напомните слайды, где там можно посмотреть. У меня сейчас вот будет перерыв неделю, когда полторы
450: Да, я ничего не читаю, другие спикеры будут. Вот Даниил Смирнов из GigaChat. Следующий будет, потом Иван Комаров, потом Алексей Колесников. И вот у меня будет большой перерыв. Сейчас все организационные вопросы под
451: Time. Пофиксим. В эту субботу будет консультация, консультация по орг вопросам. Мы решили 2 консультации провести в эту субботу в 12 часов. Я объявку дам сегодня или завтра проведём консультацию, ответим на все, что
452: Интересует. А в следующий понедельник, согласно голосованию, в 6:30 проведём в режиме подкаста ответы и разбор вопросов, которые вот за все эти лекции были в чате, но смысловые вопросы, а не не организационные.
453: Думаю, будет интересней в режиме подкаста, потому что несколько спикеров сможем там, может быть между собой ещё поспорим, там пообсуждаем что-то.
454: Любая ли модель поддерживает эмсипи тул юз нужен если у модели нет тул юза, то она не сможет вызывать инструменты.
455: Gpt сс 120 б вполне неплохо да, неплохо, но он и 20 б среди маленьких. Хорошие там, но 120 б. Наверное я не знаю, есть ли что-то новое. Просто я вот последние несколько месяцев не смотрел месяца 2 уже, то есть есть.
456: Среди маленьких моделей что-то более адекватное, там на уровне 20 б. Ну, мы к практике, к практике будем переходить, мы обязательно посмотрим, постараемся самые актуальные модели подтянуть. 256 гигабайт. Макс студио это оперативная или ссд, это оперативная. Памят.
457: Объединённая да, правильно написали, объединённая. Чем мак хорош сейчас, что он дешёвый по видеопамяти получается. То есть это такой компромисс, когда у вас с 1 стороны мощность ниже, чем у gpu да, то есть понятно там какая-нибудь тесла будет круче, с другой стороны он сильно
458: Мощнее все равно, чем просто на процессоре вычисления, а так как память объединённая, у него ж там своя, ну, аналог видеокарты процессора получается неплохая компромиссная скорость генерации токенов и большая очень оперативка, потому что, ну, tesla на 80
459: Гигабайт сколько там стоит? 2, по моему, 2000000 примерно, да, по моему, тесла аш 200 вообще стоит миллионов 6 1. И как бы, чтоб набрать эти 512 гигабайт, вы потратите стоимость там квартиры дорогой машины.
460: Нужно потратить, а тут Макс студия. Вот я на так, я зря это говорю, сейчас пойдут, разберут. Ну ладно, вот я смотрел, сейчас можно купить за 850000 на 512, да, то есть по цене пол теслы, даже меньше.
461: Получается вот и вы получаете те 512 гигов, туда можно впаять какой-нибудь большой дипси, ещё можно накидать агентов поменьше для своей мультиагентной системы пару тройку и ещё у вас останется памяти на тот же reg на векторный.
462: Базы и прочие там примочки. Получается, что это супер, как будто бы такой хороший компромиссный вариант за свои деньги, с учётом того, если вы понимаете, как это у вас будет окупаться и для каких задач реально вы сможете его загружать.
463: То, как будто бы это реально хороший вариант с учётом того, что в ближайшие там, ну, большие риски, что в ближайшие 2, 3 года нам не светит дешёвое железо. И, да, то, что сегодня мы скажем, 850, это очень дорого. Может быть, завтра вы и за 3 его не купите, потому что вообще ни за сколько не
464: Купить. Вот, а если при этом на фоне этого повысить цену токенов, то многие будут думать, блин, вот купил бы тогда, сейчас бы я вот, да, было дорого. Ну, а сейчас вообще без вариантов, но надо понимать, для чего, да, если ваши процессы, которые у вас есть, они вам
465: Стоит этих денег. Ну, это 1 история, если вы поиграться, конечно. Ну, ну, на самом деле, реально не так дорого на фоне многих вещей, как сделать виртуальную карту. Я вообще не уверен, что это легально эти вещи рассказывать.
466: Можно я не буду вот так же, как с туннелями тоже. Мы про всякие такие вещи и про туннели говорить на лекциях не будем. Давайте каждый сам решает эти вопросы. Я бы с удовольствием, но не уверен, что это настолько хоро.
467: Хорошо, разбираюсь в законодательстве, чтобы быть уверенным, что это можно рассказывать.
468: Клод код. Хорошо. Угу.
469: Так как агенты вд знают кодовую базу и какие файлы изменять по моему ответ был уже вопрос этот был да, сколько gpu нужно под 20 б gpt осс да не?
470: Сколько? 1? Ну то есть можно купить 30, 90 на 24 гигабайта и все. Он гигабайт, я не помню. 12, 16 занимает памяти, что-то такое, по моему. Так что под него большую не надо.
471: 50 90, там вообще 32 или 36, 32 гигабайта там точно за глаза хватит. Можно и побольше модельки развернуть. Новый Макс студия дороже 10 000 $. Ещё раз на авито. То есть можно вот самое дешёвое. Видел? 850000 в среднем где-то 900 пятьде.
472: 50 million вот ну я проговорю на мак на м 3 ultra процессоре на 512 гигабайт примерно вот в общем надо покупать мак студии продавать через 2 года неизвестно, может быть он натыкает.
473: Может там придумают новые какие-нибудь нейроморфные процессоры, вычисления тяжело прогнозировать, очень тяжело, все может измениться, может и так, а может и по другому.
474: Фьючерсы на mac studio вот сейчас выйдет Макс студио должен на м 5 ultra они обещали по моему где-то пятидесятипроцентный прирост в нейросетевых вычислениях и по моему там цена будет уже сильно выше и скорее всего а вопрос
475: Ещё другой, с учётом дефицита чипов, то, насколько реально они будут его и в каких объёмах производить. Может быть, он просто до нас даже не доедет, хватит ли apple вообще чипов? Вот темси, да дадут ли им чипы, потому что нвидеа мы видели с вами.
476: Обзоры вот не просто так первые занятия, видео там забронировала почти все эпла сильно большое урезание, им там айфоны производить надо, и макбуки надо производить, и mac studio это нишевый продукт, достаточно будут ли они на него приоритеты кидать ну я.
477: Сомневаюсь. Ну, посмотрим, посмотрим, может, найдут какие-то обходы, но, я думаю, цена просто будет сильно выше. Там уже, там, по моему, за 1000000, думаю, не купишь МТС, предо, я знаю людей, которые реально схемы есть по 3, по 5.
478: Mac studio объединяют вместе, используют тема для оффлайна 512 гигабайт да, это оперативка, там ссд на гигабайт есть, есть на 4 гигабайта терабайта, точнее тут смотреть надо. Собираетесь ли вы большие векторные базы.
479: Поднимать или нет, потому что, ну, разница где-то в сотку между ними. Если у вас большие базы будут, то, наверное, лучше брать на 4 терабайта, чтоб потом вы купите как бы большой мак с большой оперативкой, хорошей мощностью, а потом выясните, что вы не можете туда векторную
480: Базу докинуть из за того, что вы сотку не переплатили, да, сэкономили вы в итоге, как бы им пользоваться не можете. Тут нужно хорошо понимать, что вы ожидаете от использования. Вот. Ну, в любом случае, конечно, цены сейчас сумасшедшие, ну просто большой.
481: Риск, что будет ещё больше? Наверное, если бы так, вне контекста эту лекцию смотреть. Можно было подумать, что я адепт, адепт эпла или рекламирую. Вот кто-то пишет, что дёшево за 850. Видите?
482: Тут как оценивать, как оценивать на фоне видеокарты ещё раз? Да, дёшево. То есть 30, 90 стоило 250050 90. Простите, вам для такой памяти нужно
483: Где-то 8, 50, 90, то есть на 50 90 набить столько памяти нужно 2000000. Плюс ещё нужно заморочиться с электропитанием. Это нужна серверная стойка. Этот рик, который соединяет все, за этим нужно следить, оно будет греться, но
484: Мощность будет больше. Вот в чем дело. То есть Макс студио, да, памяти круто, но мощность будет сильно ниже. Понятно, чем у 8 50, 90. Ну, конечно.
485: Да, все, друзья, коллеги, всем большое спасибо. Надеюсь, было полезно, интересно, мы записи выложим. Прошу прощения сразу за то, что у нас с vk возникают такие проблемы. Я, может быть, я не исключаю, что опять обвалится.
486: Тогда просто запись перезальём ещё раз и все.
487: Все, всем хорошего.