0: Друзья, всем привет. Представьте, в банке платформа документов ежегодно тратит сотни миллионов рублей на операционные расходы. Автоматизация есть, но она имеет системный боттлнек. Я Макс Евдокимов, я лид команды влм кор сегодня
1: Расскажу про твм нашу фундаментальную мультимодальную модель, которую мы используем в процессах обработки документов и которая помогла этот системный боттлнек преодолеть. Расскажу о себе и команде я лид команды влм кор влм кор это инженерное ядро разработки.
2: Мультимодальных моделей в тбанке. Мы отвечаем за создание влм, отвечаем за пайплайн, обучение, инфраструктуру инференса и помогаем бизнес линиям находить те места, где влм может принести пользу. И у нас за плечами уже доказаны.
3: Запущенных в лм продуктов, о чем сегодня будет доклад? Доклад я разделил на 4 части в начале дам контекст о текущем состоянии влм в банке. И какая мотивация была у нас, чтобы инвестировать свою фундаментальную модель. Дальше расскажу как про то
4: То, как мы эту модель создавали, расскажу, как мы её внедряли и закончу результатами и инсайтами и немного про экономику. Поехали, расскажу про твм, про влм в банке и про контекст начну с короткого ремайндер. Что такое влм?
5: Влм это visual language, modules это мультимодальные модели ллм, которые работают с текстом и изображением одновременно в лмки, как такое естественное развитие лмок обладают всеми свойствами, которыми обладают лэмми.
6: При масштабировании это и генерализация, и контекст лернинг, и агентность, но в 2 модальностях, что значительно расширяет спектр адопшена подобных моделей, ну и, наверное, главный трек текущего года уходящего это то, что мультимодальный претрен.
7: Прокрашивают унимодальные бенчмарки отсюда и queen 3 с половиной, и кимика 2 6 это из коробки мультимодальные лмки и отдельно вель, часть под них уже не делают вилм это индустриальный стандарт, фундаментальная.
8: Модели становятся зрелыми, и эта зрелость важна для big теха, во первых, важна из за генерализации, когда, когда модель фундаментально заменяет каскад специализированных моделей и уже сейчас под каждую узкую задачу собирать какое-то узкое специализированное.
9: Решение это на большом масштабе не работает, во вторых, это зрелость самих технологий, все новые релизы фундаментальных моделей покрывают все более сложные сценарии, и уже сейчас фундаментальные модели это прочный фундамент, на котором можно отстраивать бизнес процесс.
10: И более того, это все сопряжено экономикой инференса. Когда в спектре качества и скорости есть модели на любой выбор есть model меньше миллиарда параметров, есть тяжеловесные ризнер, которые работают прям очень хорошо. Вот эти 3 фактора.
11: Определили нашу стратегию в банке влм активно используется во многих направлениях. Среди таких продакшн решений активные потребители влм. Это умная камера, в которой влм помогает оплатить по любому платёжному документу в реал тайме на потоке.
12: 10000000 мао это компьютер юс агенты, в том числе наш ко агент сват, который проходит тест кейс в мобильном банке, который вот делает это прямо сейчас на слайде и который активно допится в процесс коа, ну и ключевой заказчик влм и лидер.
13: Сегодняшнего рассказа, фокус сегодняшнего рассказа, это платформа документов, это то место, в котором сошлись все 3 фактора зрелости технологий. Документная платформа это такой единый хаб обработки документов всех процессов компании еже.
14: 1 платформа, как я уже говорил, тратит сотни миллионов рублей на операционные расходы, и большая часть их расходов. Это просто ручная обработка. Когда оператор заходит, открывает документ, извлекает из него нужную информацию. И типичная задача, которая
15: Выполняет оператор. Это извлечение полей, это типизация документов, это валидация критериев по типу чекбокса, ну и многое другое. И таких задач. Мы их называем джобами. Их сотни, и каждая привязана к конкретному бизнес процессу. Да, это сми, это комплаенс.
16: Это взыскание и многое, многое другое. Уже сейчас в банке есть эмэль команда, которая уже занимается автоматизацией вот такого документооборота, и она уже экономит значительные деньги. Но у эмэль команды есть системный боттлнек, текущий объём.
17: Job текущее вот количество то что нужно автоматизировать его невозможно переработать текущей пропускной способностью команды потому что в таком контексте всегда для мельчика очередная вот автоматизация маленькой джобы это во первых что это погружение в контекст
18: Это формализация тз, это разработка решения, это сбор данных, это валл, и это ещё и deploy, с 1 стороны, интеграция, с другой. Ну, в общем, какой-то очень много работ получается. Ну и бизнес тоже растёт, и количество джоб также растёт с ним про
19: И такая вот штучная инженерия аутсорс, ну, сейчас это неправильная единица масштабирования. Вот увеличивать эмэль команду под пропускную способность. При этом эмэль, команда для того, чтобы динамично автоматизировать эти джобы, приготовила для себя набор переиспользуемых Кубиков.
20: Это и сарка, чтобы взять текстовый слой, это и emma серотом, это различные регулярки, и классификаторы, и попарта. Эта штука работает. То есть можно быстро собрать решение практически для любой задачки, но при этом, если посмотреть на каждый sku,
21: В каждом можно найти какой-то, какую-то проблему. Например, сарка работает плохо с тяжёлым лейаутом. Ну и в принципе когда мы говорим про каскады в каскадах, в каждом кубике довольно быстро накапливается ошибка и вот эта ошибка, она прям является
22: Действительно, большой сложностью при этом в лм ввиду особенности работы с изображением e2e таких ограничений не имеет, и по нашему опыту, в лмке есть только 2 проблемы это либо качество, которое нас не удовлетворяет, либо, если мы возьмём большую модель.
23: Качество будет удовлетворять, но для того, чтобы обслужить трафик, который нужно автоматизировать в рамках вот платформы документов, его стоимость этого обслуживания, она получается дороже, чем использовать human бейзлайн, то есть, когда это будет размещать человек и отсюда
24: Получается, что единственный такая вот вопрос к лмке, это было качество. При этом, если бы мы могли качество автоматизировать, мы бы, во первых, смогли отказаться бы от инженерии мультимодальных каскадов, да, и как бы это бы значимо.
25: Работу с автоматизацией джоб. И такая работа не требовала бы масштабировать разработку, потому что в каждом вот из этих каскадов нужно делать свой деплой мониторинг, интеграцию и многое, многое другое. И здесь мы видели рычаг.
26: Решили здесь проинвестировать фундаментальную модель, которая помогла бы эти проблемы порешать. Вот. И это был контекст. Большой поток документов, батлнек в масштабирование меля. Открытые модели нас не удовлетворяли по качеству решение
27: Модель, как мы из этого выбирались. Я расскажу про наш путь, с чем, над чем мы поработали фокусно и что по итогу удалось сделать. И как любой хороший мельный продукт, мы, очевидно, начали с эвалов, когда мы решили делать свою
28: General модель мы систематизировали бенчмарки в 1 месте и разделили их на срезы, а срезы на корзинки сейчас у нас этих корзинок 4, это single page, это корзинка со срезами, где мы используем документ с 1 страницы это всякие
29: Это фото, это документы пдфки и многое, многое другое. Это мультипейдж, это тоже самое, но на длинном контексте. То есть здесь мы оцениваем как модель работает с длинным визуальным контекстом. Это файнтюн, это те срезы, часть данных которых мы положили в трейн.
30: И на них мы следим за distribution качеством и w. A vision бэнч это открытый бэнчмарк документ стендин на русском тоже. Наш такой защитный бэнчмарк вообще звучит банально, но вообще бэнчмарки это наверное основная инвестиция, которую мы сделали и вот.
31: Всего без вот этого все остальное было бы, ну просто не обосновать, почему нам это нужно. Во первых, это бенчмарки прямо из прода. То есть те задачи, с которыми модель будет сталкиваться. Ну вот в бою, вот когда мы её
32: Заставим работать. Во вторых, все задачи, документ, стендинг, я бы сказал, наверное, все это работа со структурированными данными. То есть здесь для того, чтобы оценивать качество, не нужно, никаких джадже, не нужно согласо,
33: Можно чётко проверить, как модель решает задачу. Ну и множество срезов. Для нас это тоже было критично. И мы многократно как бы видели ситуацию, когда в процессе экспериментов на 1 срезе модель улучшалась, но при этом тихо деградировала на другом и
34: Повторюсь бэнчмарки это прям маст хэв. Следующий вопрос это следующий пункт. Это выбор базовой модели дота влм. Часть джоб в проде мы обрабатывали при помощи кен 2 с половиной 72 б по нашим замерам на тот
35: Момент это была самая сильная модель для документного домена без ризлинг, но 72 б dance это либо, как я уже говорил, выходит за ssl, либо обслуживание получается дороже человека, поэтому мы много экспериментировали с компа.
36: Моделями мы начали с квена 8 б, потом экспериментировали 35 б мае и по итогу выбрали 35 бм. В ней нас устраивает и начальное качество, и пропускная способность, и, в общем то, хороший хороший старт ключевой фрейм.
37: Здесь это то, что задачи документа стендинга, они не требуют тяжёлого. Ризонинг, наверное, 99% задач это задачи извлечения какой-то информации, возвращения структуры и многое, многое другое. И на самом деле уже сейчас
38: Открытые модели уже хорошо эту задачу решают. И наша, и наша здесь цель этот скилл у модели отшлифовать и усилить. И мы это рассматриваем как домен домен поострей поверх сильной базы. Простая
39: Часть закончилась. Начинается самое интересное работа с данными. И если посмотреть на то, как индустрия подходит к созданию данных, то все здесь живут примерно в 1 флоу, и мы здесь не исключение. Выглядит он примерно так. Есть сит корпус.
40: Данных такой широкий большой набор документов из этого, из этого сида мы семплируем документы, релевантные документы. Что значит релевантные. Расскажу чуть дальше. После этого мы на эти документы генерируем примеры.
41: К примеру, усложняем, фильтруем, фрейми, на этом обучаем модели, анализируем слабые стороны и снова возвращаемся в начало нашего флоу, имеем такой итеративный итеративный подход. Ключевой фрейминг в работе с данными. Это то
42: То, что в построении решает не количество данных, а их содержательность. Опять же, базовая модель уже со многим умеет работать. И наша задача здесь собрать те примеры, которые дадут правильные обучающие сигналы, которые помогут нам вот это навык у модели усилить
43: И 1, что мы здесь посмотрели, это внутренние данные, документная платформа годами хранит данные в формате такого документа. Это картинка пдфка и словаря фактов на бумаге. Это выглядит идеально. То есть вот просто берём и как бы обучаем модель, какие
44: У этого есть преимущества ну, это данные с прода, то есть это то, с чем модель должна работать дальше. И это вот прям условно тот indistinct рый нам в теории мог бы помочь помочь. Ну и продовые данные, которые мы сохраняем, они, наверное, чисты.
45: И в общем то мы потратим немного усилий для того, чтобы это дело отфильтровать. Вот мы это сделали, мы взяли где-то 3, 5 потоков, вот именно документных потоков конкретных из них насолировали пару сотен, пару Десятков.
46: Тысяч примеров для каждого отдельного, для каждой отдельной джобы мы собрали большой комплексный промт. Реши мне какую-то целевую задачу. Его активно аргументировали и на этом обучали модель. Модель обучили, но во время работы с внутренними данными мы столкнули
47: Проблемами. Во первых, 1 проблема это то, что было размечено. Вот в проде не всегда было чисто по разным причинам. Иногда вот в этой разметке есть какая информация, которую не найти в документе. Иногда это извлечено с ошибкой. И по итогу это пришло все
48: То, что для каждого флоу нужно было делать фильтрацию, фильтрацию ки специфичную. И по факту это был тот вот те усилия, которые мы изначально не закладывали. Ну и более того, даже 10 условно, джоб, это 10, примерно Одина.
49: Шаблонах модель на хорошо обучаются, но на на auto дистрибьюшн довольно быстро это все выходит на плато, какие мы сделали выводы из внутренних данных по итогу на финальном нашем дата миксе внутренние данные.
50: Используем. Но выводы следующие. Во первых, про in distribution на узком домене в лмке большие, маленькие, даже вот 600000000 параметров, они все выбивают качество близко к единице. Если делать in distribution. Во вторых, вот этот in distribution,
51: Он работает вот как бы комплексно. То есть, если вы соберёте несколько потоков и одновременно обучите даже маленькую модель, на них качество также не будет страдать, если вы здесь задумались, что я рассказываю про какой-то punch, Максин и про
52: Это дистрибьюшен, и нам важны некоторые потоки, в которых нам важно как и качество, так и скорость работы, поскольку они экономят много денег, и мы действительно следим за distribution. Но при этом у нас есть как бы корзинки, которые раньше показывал
53: Мы здесь все равно следим за кантомина ией данных, точнее, за её отсутствием. Ну и главный вывод, который мы сделали по внутренним данным, все-таки основная ставка это не внутренние данные. Собираются, они тяжело. Синтетика на широком корпусе даёт.
54: Больше прирост и масштабируется значительно проще. Единственный плюс внутренних данных это они помогают провести начальный discovery. То есть когда мы хотим изучить, как работает модель на конкретном срезе. Если работает плохо, мы обучаем модельку, смотрим, что она отрастает и по анало
55: Собираем синтетику, вот поговорим про открытые данные и ту самую синтетику. На самом деле здесь индустрия также живёт в унисон, и все, как бы все те репорты, фронтир лаб говорят о том, что данные для документного
56: Мира они собирают при помощи псевдо. Разметки. Здесь мы пошли тем же, тем же путём. Для этого окачал русскоязычный коммон крол в сумме это получилось там сотни тысяч пдфок, наверное, ближе к 1000000 и с ним
57: Начали работать, как мы к этому делу подошли. На самом деле это довольно хороший сет. То есть это чертежи, это таблицы, это какая-нибудь нормативка, договоры, в общем, на самом деле широкий срез документного мира. И на самом деле тот
58: Версите то разнообразие, которого во внутренних данных не было, как мы с этим работаем в пдфке есть текстовый слой, машиночитаемый текст. Работаем мы по схеме следующей мы берём этот текст, подставляем большой мк как текст.
59: Контекст. Просим её сгенерировать нам обучающий пример и потом этот обучающий пример используем в обучении, в лмке, но на визуальном контексте. И в таком, как бы сеттинге текстовый слой такая бесплатная разметка, но
60: Как бесплатных обедов не бывает и за бесплатную разметку нам пришлось заплатить инженерными усилиями. Да, но при этом, когда мы начали с этим работать хронологически даже самое банальное, мы столкнулись с проблемами текстового слоя, мы смотрим. А текст
61: Слой не совпадает с тем, что находится на изображении текст в текстовом слое может быть, а на-ка, на изображении его нету, может быть, наоборот, на изображении текст есть, в текстовом слое нету, и даже здесь нам пришлось делать специальную фильтрацию, валидацию через нашу.
62: Внутреннюю сарку и пословно сравнивать ответ сирки и ответ пдфки. Вот прям вот слово к слову пространственно и как бы фильтровать те примеры, которые эту фильтрацию не прошли, и это уже нам там отфильтровало больше, больше трети.
63: Всех страниц коммон кроле. Ну в общем то, что-то я загрузил, пример отфильтровали, генерируем синтетику. Здесь процесс генерации мы также подошли итеративно, эволюционно, мы начали с чего-то простого, именно, просто с промта, в котором
64: Просили модель сгенерить вопрос, следили за форматом ответа и и все. Вот. И по итогу вылилось это в то, что следующие операции это были и многошаговые такие пайплайны, когда мы сначала, сначала
65: Из документа достаём сущности и факты. По этим фактам генерируем примеры. Эти примеры рефайнери и уже с этим работаем. В общем то мы это сделали. Поставили модель обучаться метрики отросли логичный шаг.
66: Масштабируем выборку, масштабируем, а метрики не отрастают. Начали смотреть проблемы, и проблема довольно быстро всплыла. Когда мы начали смотреть на сгенерированные данные. Сгенерированные данные оказались слишком простые. Что значит
67: Простые. Мы взяли нашу базовую модель до обучения и погнали на наших сгенерированных данных. И, как оказалось, большую часть примеров модель умеет решать. То есть, по сути, эти данные, которые уже модель хорошо знала, размывали нам обучающий сиг.
68: В пострение простоты в разметке 2 2. Во первых, простота была в лейауте. На самом деле в коколе большая часть страниц это такая портянка черно белого текста. И модели на самом деле и большие, и маленькие уже.
69: Хорошо, с ними работают. 2 проблема это то, что модель генерирует простые вопросы в постене. Нам бы хотелось все-таки видеть примеры, которые требуют какого-то анализа, какого-то сопоставления, агрегации и чего-то подобного. Простота была 1.
70: Единственная проблема. 2 проблема, которую на самом деле я бы назвал, 2, 1 проблема это то, что все равно в текстовый слой протекают какие-то артефакты. Лмка, может вот лм генератор, может что-то, вот что-то может пойти не так.
71: И все равно в выборке остаются некорректные примеры. То есть, когда ответ как бы неправильный ответ на вопрос. Вот, ну и, наверное, такая вишенка на торте, ещё иногда модель как бы отдаёт немного, у неё утекает ответ в вопрос.
72: Вот как здесь модель на как бы модель хотела дать формат ответа и в общем то в формате ответа дала ответ. В общем то проблема понятная. Работаем по каждому, по каждому фокусно простоту. Мы победили правильным.
73: Лирование семплированием работали на 2 уровнях. Во первых, семплирование правильных лайаутов сложных. Это было семплирование таблиц, там сложных каких-то элементов, многостранич, многоколоночной вёрстки и
74: 2, 2 семплирование, мы все-таки подошли более там детально к генерации самих примеров. То есть в конце, как я уже сказал, финальный пайплайн это такая многостадийная штука с сначала с выделением сущности по этим сущностям задаём вопросы и потом
75: Как бы вопросы фрейме и так далее, и так далее. Некорректные примеры, опять же, подчеркну, это важная штука. В синтетике действительно много много таких как бы, проблем. Мы победили просто пулом сильных верифай. И, в общем то, проблема, проблема починила
76: Ну и читерство починили, просто jojo взяли птсс, там все, что было вот на поверхности, оно хорошо работает, быстро и все плохие примеры также отфильтровало. Ну и напоследок мы, поскольку команд ролл это также сгенерированная рендерное
77: Документы мы на них добавили как бы real world аргументации, чтобы это больше было похоже на фотки вот как было раньше на слайдах, или вот что-то такое, что может те артефакты, которые могут возникнуть в real time потоке итого, если возвращаться к тому,
78: С чего я начал? С флоу? Он остался неизменным, но на каждом этапе нам пришлось придумывать либо что-то новое, либо осваивать уже известные рельсы. Повторюсь, цель этого флоу собрать данные для пострена. То есть это то, что модель должно по итогу фреймить и усиливать
79: И это на самом деле рабочий фреймворк, он работает, как и для целевых задач и задач индженера. Мы сейчас новые задачи отстраиваем на вот этом флоу. И, в общем то, здесь совет, который я бы себе дал в начале это делать как можно более
80: Коротких итераций, поскольку каждая итерация помогает лучше понимать то, как модель работает и как модель реагирует на изменения в обучающей выборке, а во вторых, уделить все-таки внимание синтетике синтетика собирает.
81: Тяжело, но когда этот конвейер собран, он довольно быстро масштабируется, приносит свои плоды. После того, как наши модели заработали на наших базовых задачах, мы пошли вглубь домена, которым вдохновились нашими фидбэк н улучшениями среди
82: 1 из усложнений, которое мы, над которым мы фокусно поработали, это работа с длинным контекстом, как я уже говорил, с таким, с большим визуальным контекстом. И это, наверное, то, то, что мы просочили достойно отдельного доклада. Вот
83: 2, это работа с кастомными элементами, с которыми стандартная сарка не очень работает, это чекбоксы, подписи, штампы и другое. И наш текущий челлендж это глубокий резнин по контексту, это также довольно сложная, сложная
84: Направление, в котором много степеней свободы, на котором мы сейчас работаем, как, например, чтобы сделать некоторую затравку ризонинг мультимодальной модели, когда нужно работать, именно когда нужно Ризен по картинке очень часто фулбэка в то, что
85: Происходит не по картинке, а модель в reason трейсе сначала всю картинку описывает и только потом начинает как бы потому что она сгенерировала не смотреть на картинку. Вот пару слов про нашу инфраструктуру обучения здесь я бы хотел подсветить.
86: 3, 3 пункта. Во первых, что обучать? Мы заметили, что на этапе, когда мы как бы пытаемся собрать рецепт обучения, то проще это делать с лорами, в том числе и большими, на миллиард параметров параметров, потому что это обучается быстрее. Результат
87: Получается скоррелированным с фу вей тюнинг. И, в общем то, на этапе быстрых операций это важно. Также 1 пункт был сопряжён со 2. То, что мы следуем принципу Ван чёт тайм. И это тоже, это архиважно.
88: Toca, поскольку это лучше вам будет, это будет снимать неопределённость и лучше вам даст понимание того, как модель реагирует на на те или иные изменения. И вы лучше будете понимать, как прокачивать качество в дальнейшем в вопросах.
89: Как дообучать 8 б моделька на самом деле с лор адаптером дообучится у вас в коллабе или на какой-нибудь маленькой карточке 35 б модель, особенно фу в тюнинг она требует распределенку. То есть это больше 1 ноды. Здесь мы пошли по джентльменскому Такому базовому набору.
90: Моделями, где завели сдп, а для Машек завели 5 д параллелизм. В общем то, это штуки, которые быстро заводятся там в любом таком продакшен реди фреймворке обучения, например, в мегатроне. И, например, да, например, и последнее, что чем
91: Чем хочется поделиться. И на самом деле штука, которую мы активно используем, очень рады. Это датасерв это штука, в которой мы это сервис, в котором мы инкапсулировали работу с данными. То есть это и подтягивание данных в сам пайплайн, обучение и аргументации, и все.
92: Зачем это нужно? Во первых, это позволяет изолировать зависимости, обучения и подготовки данных. И на самом деле вот эти вот зависимости для подготовки данных, это такая очень тонкая материя, кто собирал сам, не знаю, докер образы для Вера со своими
93: Меня поймут. Вот. Ну и во вторых, эта штука становится фреймворк агностиком. Мы быстро можем, вот у нас там инфраструктура для сфт, вот у нас инфраструктура для эрели, мы можем этот пайплайн быстро двигать и обеспечивать воспроизводимость теперь
94: Что касается оффлайн результатов на слайде, результаты по нашей модели и по фронтир опенсорсу мы здесь стабильно проходим по всем, обгоняем по всем срезам то, что есть в опенсорсе, кроме
95: 1 среза. И здесь мы проигрываем только 400 на задачу большого контекста и больших рассуждений. Вообще, что здесь интересно? Во первых, это состав микса. Вот здесь внутренние данные, это у нас всего лишь 1 5 часть от всего микса.
96: И больший прирост нам дала синтетика на common кроле. Во вторых, посмотрите, ну, у нас так сделана аудитория. Я специально вниз добавил важную модельку, чтобы её никто не увидел. 3 с половиной 35 б. Это, в общем то, наша базовая моделька, с которой, м,
97: Обучались и, ну я сейчас расскажу, можно, можно присматриваться и она на самом деле уже работает хорошо, имеет, имеет соту на самом деле, на одностраничных, на нашем одностраничном срезе. Здесь мы её усилили. И в общем то, на остальных срезах мы такж
98: Прокачали модель, что что круто, особенно в задачах опять же длинного контекста. Также здесь интересна корзинка фантун. Мы здесь все-таки не разменяли ИНН, дистрибьюшен, аут, дистрибьюшен и там смогли с этим поработать и в
99: В общем то mail стоун оверолл стать лучшей моделью на нашем, на нашем узком срезе мы достигли челленджи для следующих развитий нам понятны это глубокий ризинг, это работа с длинным контекстом, с этим мы сейчас фокусно работаем, ну и, естественно, новые.
100: Новый сценарий, потому что вот эти вот банчмарки, они уже потихоньку выхо, как бы себя изживают, потому что модели работают там почти идеально. Поговорим про опыт применения моделей в проде. У нас, в общем то, тлм уже на твм уже работают, не
101: Несколько job. И действительно, после того, как мы, в общем то интегрировали модель работа с автоматизацией джоб, демократизовать действительно, вот вместо вот этого большого каскада, который требует высокий порог входа в
102: Context, если что, это слайды мои про слайды. Сначала действительно демократизовать. Мальная команда активно использует твм для автоматизации джоб. И более того, у нас уже есть прецеденты, когда эту работу начинают делать
103: Аналитик, то есть порог входа действительно начинает снижаться. Ну и более того, мы здесь также сэкономили на, на масштабировании разработки, потому что в прошлом случае вот эти вот каскады, это все было каскад, каскад.
104: Каскад, каскад, каскад, deploy, deploy, deploy, deploy, интеграция, интеграция, интеграция, интеграция, тест, тест, тест, тест. Ну, в общем, довольно много работы с тв. Это как бы сходится в 1, в 1 штуку. Здесь нужно поработать над портом, постпроцессингом, иногда.
105: Для решения задачи нужно сделать чуть больше усилий, сделать несколько вызовов, добавить чуть более сложный процессинг, но это все равно радикально. Другой уровень, радикально другой уровень усилий. Единственное, как бы такая тонкая материя здесь это то, что
106: В общем то все, все, все стрелочки идут в 1 кубик. И если в новом релизе кубика что-то пойдёт не так, то будет плохо здесь, в общем то, мы ограничились тем, что подготовили на каждую, на каждую джобу, с которой работает лм, просто оффлайн замеры, которые при выкатке
107: Новые релизы. Мы проверяем, что все с этим работало. А нужно нам это для того, чтобы оценить экономику, потому что экономика зависит от качества модели. Нелинейно, а насколько нелинейно для этого у нас есть такой верхнеуровневый фреймворк, который позволяет на
108: Оценить то, насколько модель сохраняет Костов в зависимости от её качества и размера, и она довольно точно позволяет оценить то, как модель, какую эффективность модель покажет в проде формулируется эта штука в терминах извлечение извлече.
109: Полей на самом деле все задачи платформ документов так или иначе можно обобщить до задачи извлечения полей, и выглядит это все следующим образом.
110: Мы нам задача обработать н. Полей. Каждое поле мы обрабатываем независимо и работаем в 3 разных режимах. 1 режим это автоматический, это когда модель просто распознает поле и оно сразу переходит в ответ без ручной проверки.
111: Мы это используем тогда, когда модель в оффлайне показала хорошие метрики, например, 98% x. 2 режим. Ну и стоимость этой штуки это вызов просто модели. Вот 2, 2, это ручной, это то, когда модель плохо работает с полями.
112: Мы это сразу переведём на человека и стоимость этой разметки это x. Это просто ручная разметка и самый интересный 3 режим и систет, когда модель предзаполняет поле и потом этот человек как бы на базе этого поля делает.
113: Дальнейшую разметку и по нашим, по нашим замерам. Если модель ошиблась, то человек тратит 1 и 1 икс. То есть это получается дольше, потому что человек исправляет и в общем то делает все по новой.
114: Но если человеку как бы ответ модели правильный, то в среднем человек тратит 0 3 икс, что тоже получается меньше чем икс, ну и получается так, что в общем то cost разметки без модели это просто and x. То есть это and and человеческих раз.
115: Меток, а вот разметка с моделью, это получается сумма вызова модели это игрек, поскольку мы за 1 вызов сразу делаем всю как бы всю задачу, это and ручных разметок н мэньюал икс и в общем то cost от иис.
116: Полей, которые собираются как мат. Ожидание, которое зависит от престижной модели на конкретном поле. Вот подставляем эти, эту методологию в конкретные воркфлоу и получаем таблицу справа, если что, это 2 пордов подовых сети.
117: В которых мы замерили то, как работают разные модели, и, в общем то, разница между ними Ровно то, что, во первых, качество модели примерно одинаково, на самом деле от воркфлоу ворфлоу, но в 1 воркфлоу нужно извлечь где-то 10 полей.
118: 2 5 полей. И если в 1 Ворко в таком тяжёлом у нас твл экономит 8 больше 80% относительно человеческого бейслайна, и даже самый большой фронтир там всего лишь на 10% дороже человека, то в маленькой
119: Задача в лм также остаётся экономить больше 80%, а queen 400 б получается дороже в полтора раза человека. При этом, подчеркну, это без ризениха. Если бы мы квен включили в Ризели. Ге, ну сразу можно это.
120: Иксова на довольно большую большую величину. И, в общем то, вывод мы сделаем, делаем здесь такой, что, ну, во первых, косты, которые нам экономят влм по твм, по нашим замерам больше 80%. И это очень похоже на то, что получается в проде.
121: Во вторых, наверное, главный вывод от использования вот больших моделей, маленьких моделей, открытых, он такой, что большие модели тоже есть. Резон работать, как бы с ними работать их и ими делать какую-то оптимизацию, но это валидно только тогда.
122: Когда модель за 1 вызов делает много работы, как, например, вот распознает 10 полей, и эта штука работает. И здесь мы можем как бы прибечь к использованию больших моделей. Но когда задача маленькая, и Зада, и стоимость
123: В общем то, вызовов модели становится сильно больше. Экономика, соответственно, расходится. В общем то, результаты. Осенью прошлого года мы решили инвестировать в свою фундаментальную модель в твл. Модель в проде качество выше, чем
124: На нашем срезе и работает это все значительно дешевле новые джобы мы автоматизируем на нашем flow с лмками и мы уже имеем прецедент того, как с этим работают аналитики для нас это не как бы компромисс.
125: Преимущество по нашим замерам. В общем то это дело все как бы ускоряется и сейчас боттлнек смещается в сторону качества модели, а качество мы понимаем как растить. И в общем то, по нашим планам мы видим, что и
126: У ст. И у рли есть потолок, который мы ещё не достигли, мы будем дальше развивать модели, будем дальше прокачивать твм, чтобы больше принести бизнес ценности и будем этим также делиться вот на конфе.
127: И свой доклад я бы хотел завершить ключевой мыслью. Мы верим, что фундаментальные модели это тот рычаг, который поможет качественно перестраивать, значимо перестраивать процессы, и та компания, которая вложится в это сейчас, будет работать на
128: Совершенно новом, качественном уровне, который в отсутствие этой технологической базы достигнуть просто не получится. Пробуйте. Спасибо за внимание.
129: Спасибо большое, Максим, за твой доклад. Я напоминаю, что мы сканируем QR-код и оставляем обратную связь, я не просто так вас достаёте, на самом деле это правда, нам очень важно и Максиму будет супер приятно, если.
130: Beck будет много, а у нас осталось всего 5 минуточек на вопросы, поэтому мы успеем парочку вопросов сейчас уже человек с микрофоном уходит, а?
131: Добрый день. Спасибо большое за доклад. 2 1. Ну, они оба маленькие вопросы. 1. Вы в прошлом году рассказывали, как вы дистиллировали, по сути, вот для умной камеры 72, 3, по моему б модельку, там queen 2 и 5 был и
132: И вот в данном случае я верно понял, что повторить этот трюк для вот этого кейса, который мы рассказывали сегодня, не получилось, потому что вы решили объять, ну, как бы побольше домен, то есть более самых разных, больше разных документов, и поэтому так уже не про
133: Не прокатило бы, поэтому пришлось брать модельку побольше, а не просто там дистиллировать из большого квена 3 и 5 в маленький queen 3 и 5, как в прошлом году. Действительно, мы в прошлом просто собрали там через большую модельку без вот такого конвейера, и это, это
134: Все ещё валиден, но в умной камере это работало из за того, что все поля, с которыми мы работали, они, так или иначе можно было их верифицировать по каким-то евристика, по каким-то там правилам доменной области. И мы полный треш мы могли сразу как бы отфильтровать и
135: Жить вот в этом сетапе. И там, напомню, мы брали те поля, которые мы по итогу не отфильтровали, мы на них обучались те поля, которые мы не брали, мы, соответственно, мы даже про них ничего не спрашивали здесь из за деверсии, из за того, что нету вот этих правил доменной области, нам приходитс
136: Придумывать какие-то вот такие general вери фаеры и в общем то большие модели. Это 1 из таких инструментов. Да, спасибо. Добрый день. Спасибо за доклад. Было бы интересно посмотреть когда вы показывали по онлайн метрикам
137: Да, насколько снижение стоимости? Там было сравнение с большим квеном 400 б. А почему нет сравнения с квеном 3 с половиной, с инициализацией стартовой модели? Хороший, кстати, вопрос на слайде его не было. Я не отразил просто потому что у нас здесь было как бы 3
138: 3, 3 варианта. Это была продова модель, которую мы сейчас используем. Оценить там кост, это влм которого мы как бы релиз кандидат и самый большой фронтир, который вот там насколько мы максимум могли бы выбить качество. И тут, здесь, здесь скорее
139: Компромисс в то, что мы не можем там сервить множество разных моделей. Нам нужно было выбрать что-то 1, но, кстати, поинт валидный заберу. Спасибо.
140: Да, спасибо большое за доклад. Коротенький вопрос. Смотрите, мерили ли вы, насколько вот ваши затраты на обучение, переобучение, ведь дрейф данных, он же все равно рано или поздно случится, да, то есть этот процесс, он должен быть непрерывны.
141: Циклическим. Не мерили ли вы, насколько затраты на вот эти ваши дообучения, да, перекроют физически человеческую разметку. То есть, ну, немножко поясню, да, то есть вот есть некоторые затраты на людей, которые
142: Размечают данные, вот по сравнению с ручной разметкой, а есть ваши процессы, которыми вы автоматизируете, да, и дообучаете модели, переобучаете, там справляетесь с дрейфами данных. Вот эти затраты на переобучение, дообучение. Сопоставимы ли они с затратами именно на продолжение ручной
143: Разметки. И мерили ли вы такую экономику? Конкретную цифру мы здесь не получали, но мы здесь точно должны идти в сторону аяй разметки, потому что бизнес растёт. И даже вот сейчас есть в платформе документов убрать всех эмэль иков, убрать все эмэль модели эту штуку не вытянуть.
144: Там так много документов, и они там с такой частотой, что это вышло бы в огромные суммы. Спасибо. Вот. И это хорошо работает на масштабе.
145: С той стороны галёрка. И здесь вот молодые люди тоже тянули.
146: Добрый день. Спасибо большое за выступление. Вопрос. Собственно, в следующем. Ты сказал то, что фильтровали разметку с помощью внутренней сиар модели. А что это за модель сравнивали?
147: Решение на её основе с тем, что получилось, с чем ещё раз сравнивали. Ну вот ты говорил то, что фильтровали данные, которые использовались для дообучения на
148: Предмет, то есть там была какая-то неверная разметка и там почти треть датасета отлетела от этого насколько я
149: Запомнил вот, ну вот эта вот внутренняя модель, вот это cr сравнивали ли решения на её основе вот с тем, что получилось здесь и какие там разницы по скорости?
150: По эффекту, по точности разница в итоговом качестве модели. Да, да, да. А здесь скорее работает. Так что если, sir валидацию не заводить, то модель просто деградирует, она учится на ошибках и соответственно, это прям все очень плохо с этим работает. Вот.
151: Нет, ну изначально эта модель, для которую использовали, для фильтрации, она, типа, плохо работала или что? Давайте, давай тогда расскажу полностью пайплайн, кратко и будет. Давай уже, пожалуйста, перейдём это.
152: Идём в can a, мы продолжим там. Ладно, давайте последний вопрос. Вот здесь вот была ручка, по моему, молодого человека. Вот в зелёной футболке, если я не ошибаюсь, может быть, их было несколько. Вы простите, если кого-то не заметила, спасибо за
153: А у меня вот вопрос касательно модели, ведётся ли, ну, разработка в антифрод направлении в помощи данных моделей, то есть какие-то тегерированием, дальнейшим работникам составлять, что данный документ возможен там.
154: Сгенерировано ли, ну, мошенниками вообще, спасибо за вопрос. Вообще. Задача достаточно комплексная. И как бы, понятие там, где можно заскамить его, там, степеней свободы много. И, я бы сказал, так что, наверное, факти
155: Информацию, которая есть в документе, там лм сможет обработать. Но поскольку большую часть рода, то есть какие-то подделки и прочее, это такая green штука. То есть надо прям вот очень глубоко погрузиться в детализацию того происходит, что происходит на изображении.
156: Мой такой там выстрел в темноту это то, что в лмке, скорее всего, с этим будет плохо работать и что-то классическое Сивин, оно там будет.