0: Всем привет. Вот я из ресерча и сегодня расскажу на таком концептуальном уровне, как чему я научился в процессе применения агентов для научных исследований. Я занимаюсь исследованиями в области интерпретируемости, у меня была работ
1: По пониманию того, как устроены Спарс автоинкодер, вы сегодня ещё доклад про них послушаете. В конце и у меня сложился некоторый банк. Результатов, и было довольно много пробелов, которые клались
2: Backlog. Вот. И я подумал, пока я занимаюсь другими делами, можно взять какого-нибудь агента и научить его сделать ресерч мне в помощь. Он будет, например, он будет, например, брать гипотезы, которые я ему поставил
3: Или какие-то гипотезы предлагать сам ставить эксперименты, отвечать на вопросы, все это проверять, складывать в какую-то базу данных и двигаться по таким ветвям исследований.
4: Однако это, в сущности, проектирование какой-то автоматической системы, однако, если мы позволим агенту действовать, как ему вздумается, тогда мы получим, что он начнёт эксплуатировать пространство действий, которое мы ему задали. Например, мой агент.
5: Предложил некоторый результат, который не проходил валидацию, и вместо того, чтобы переделать результат, агент просто переписал сам алгоритм валидации. Вот, однако, недостаточно просто ограничи.
6: Пространство действий надо ещё надо ещё сказать агенту, как действовать в тех или иных ситуациях и задать какую-то начальную точку.
7: С другой стороны, есть очень много сценариев, которые каждый раз новыми какими-то критериями, новыми добавлениями в инструкции не покроешь, это можно делать до бесконечности. И другая проблема, что
8: Далеко не для всего есть чёткие критерии, которые можно перевести в какую-то форму, понятную для агента. Поэтому, например, очень часто используется, да, например, занимаемся ли мы интересной темой, которая в будущем
9: Будет полезно. Вот. И я тот контур, который мы можем передать в систему, которая будет направлять и валидировать агента, я называю
10: Скомпилированным опытом, то есть человек, который обладает достаточным багажом знаний, он взял все эти свои знания и переложил либо в spec, либо в скилы в какую-то систему автоматической оценки результатов агента и
11: Идёт ресерч. Так. И вот я условно придумал промт. И, наверное, можно заметить, что есть какой-то подвох и ни к чему хорошему такой промт не приведёт в ресерче.
12: Подытожить можно так мы можем автоматизировать работу агента Ровно до той степени, до того момента, когда необходимо внедрение человека. Это, ну как по определению и
13: Внедрение человека необходимо именно там, где заканчивается, как я называл, скомпилированный опыт.
14: И вот, предположим, система работает замечательно. Она у меня там может работать условно сутки, потом приходит с результатами, говорит, вот я там доказал теорему, вот я провёл эксперимент, получил такие-то таблички, результаты, все замеча.
15: Но само по себе это ещё ничего не значит. Это совершенно не значит, что мы получили какой-то научный результат и написали какую-то статью, даже если мы получили артефакт в виде препринта на нипс или куда-нибудь Сим. Вот, например,
16: У меня это выглядит так. То есть у меня есть какая-то семантическая связь между результатами, которые я получил. Агент их складывает в большую базу данных, и сама по себе эта база данных ничего не говорит, собственно, о том, в правильную ли сторону мы вообще дви.
17: То есть действительно ли мы доказали нужную теорему, действительно ли мы провели тот эксперимент, который стоило проводить, и потратили на него какой-то компьютер?
18: То есть мы должны взять весь этот набор результатов и рассказать на основе его историю. То есть мы в основном стремимся отвечать на какие-то научно значимые вопросы, которые возникают в области. Вот, например, есть проблема в области
19: Что они очень сильно зависят от зерна генерации и есть ряд ресерче, который пытается решить эту проблему.
20: И те вопросы, которые имеют потенциал, повлиять на практику той области, в которой они будут опубликованы. Потенциально, это можно назвать научно значимые результаты. Вот.
21: И если мы просто получили какой-то артефакт, это ещё не значит, что и даже если он прошёл на какую-то конференцию, это ещё не значит, что он имеет какую-то пользу. Вот очень много результатов, например, не воспроизводится и имеют большие проблемы.
22: С тем, чтобы потом просто переиспользовать и развивать, и даже критиковать эти результаты.
23: Со стороны учёного.
24: Его работа ограничена некоторой научной средой, в которой он работает, и эта среда задаёт эта среда задаёт какие-то нормы того, как должны проводиться эксперименты того, как должны писаться статьи.
25: Стандарты научного рецензирования того, что считается вообще научным вкладом, и в частности это проявляется на, например, научных конференциях или просто в процессе рецензирования. И вот отправляем мы статью на конференцию.
26: Для того, чтобы её проверили, насколько она хороша, подходит ли она под стандарты конференции, и рецензентов просят, собственно, оценить эту статью по различному ряду критериев и.
27: Среди тех критериев, которые рецензенты анализируют, есть те, которые принадлежат самому готовому артефакту. То есть мы написали статью, и внутри неё уже содержится тот сигнал, который позволяет ответить, например, на
28: Вопрос, корректна ли статья? То есть, если там все доказательства правильные, все эксперименты провалидирован статистически проанализированы корректно или, например, можно проверить новизну, найдя какую-то
29: Похожую статью в интернете.
30: И некоторые рецензенты подходят к этому очень строго. Например, вот так.
31: Другое дело научная значимость, проблема с ней такая, что сигнал для неё обнаруживается только на каком-то длинном промежутке времени. Мы, получив статью, ещё не знаем, насколько она повлияет на область, насколько она будет.
32: Полезно с точки зрения того, что другие люди внедряют её в свою практику, переиспользуют, критикуют, воспроизводят и так далее, и это ключевое отличие от многих других критериев. И здесь важно, что
33: Рецензенту необходимо иметь представление о том, насколько часто просят оценить, например, сигнификант работы. И вот рецензентов просят, получается, предсказать то, насколько это в итоге повлияет на область с точки
34: Зрения учёного, который выбирает, чем заниматься. Это называется ресерч тест, то есть навык, который позволяет ему выбирать такие направления работы, которые в итоге приведут к публикациям, большому количеству цитируемости и
35: При этом будут ещё их, при этом можно будет сделать в разумные сроки. Соответственно, выбор направления движения. Чем заниматься, это задача прогностическая. Мы должны, имея текущее представление об области.
36: Предсказать, что произойдёт после нашего, после нашей статьи. И вот с агентами. Такая проблема, что они гораздо лучше продолжают какую-то ветвь исследования, чем выбирают её, например, я там в качестве
37: Эксперименты закинул фейбл и gpt про посмотреть как, что они могут предложить на основании имеющегося банка результатов. И они выбирали какие-то вещи, которые либо реально некорректны в работе. То есть там может быть какая-то
38: Эксперимент не так проведён или такие направления, которые выглядят круто, выглядят очень сложно, но при этом я совершенно не понял, зачем ими надо заниматься, на какой вопрос они отвечают, и моё мнение с их мнением совершенно не согласуется. И это я думаю,
39: Такая проблема всей области. Вот в итоге роль человека, когда мы автоматизируем весь этот процесс исследования, остаётся за управлением тем фреймом, внутри которого работает автоматизированная система и человек принимает
40: Решение о том, чем надо заниматься, когда надо остановиться, что считать научным результатом.
41: Вот так можно закончить эту мысль. Другая проблема, другая проблема, что все эти системы, они гораздо больше статей прочли, чем мы все вместе взятые.
42: И чтобы следить за работой такой системы, когда она доказала какую-то теорему, проработала 10 дней, выдала какие-то результаты, надо иметь достаточную подготовку, чтобы просто понять, к чему пришёл этот результат и как его можно переиспользовать, что на
43: Означает и как его внедрить в ту историю, которую мы пытаемся рассказать часто. Это, например, актуально в области лицензирования на научных конференциях. Вот, но тоже контроль за областью, в которой
44: Мы работаем.
45: И суждение человека в итоге работает с 2 сторон. Оно говорит нам, какое направление движения выбрать и что делать с тем результатом, который мы получили.
46: Вот другой вопрос, почему у нас есть этот навык суждения и выбора каких-то ветвей, а у агентов нет. И вот кроме того, что мы можем, например, читать умные книги, получать, знания, учить
47: Математику и все прочее. Мне кажется, что мне кажется, что есть очень важный момент с тем, что мы умеем
48: Понимать последствия принятых нами решений. И мне кажется, что именно на основании этого механизма, когда мы, имея какой-то багаж знаний, какое-то текущее представление об области, проанализировали, к чему приведут те или иные наши
49: Решение. Вот. Затем мы выбираем как бы то или иное решение. Понятно, они не дискретны и затем оцениваем, насколько наши ожидания совпали с реальностью. Вот, и затем на
50: Этого сигнала мы калибруем наши дальнейшие предсказания, то есть учимся. Вот. И это, мне кажется, лежит в основании что исследовательского вкуса, что в целом позиции исследователя в автомати
51: Системе, как того, кто контролирует фрейм, потому что именно суждение, которое на метауровне находится, оно играет наибольшую роль, и чем больше мы автоматизируем систему, тем большую роль играет человеческое суждение.
52: Можно вести очень подробный журнал того, что было проделано, однако, ну или просить, например, агента писать полный енот, писать полный лог, все артефакты, что он сделал, но очевидно, что какой-то сигнал
53: Полезный для обучения, он имеет структуру, это не мы не можем просто прочитать весь этот лог и чему-то научиться. Мы должны вот извлечь какую-то структуру, которая будет нам полезна для того, чтобы этот опыт перенимать и, в частности, самому проделывать этот опыт. И вот
54: Структура такого рода, как я рассказал, предиктивная, мне кажется, важно её уметь вычленять из всех Логов.
55: И вот проблема с агентами такая, они на уровне тренировочных данных не имеют какого-то консистентного сигнала о том, как правильно принимать решения и как среда откликается на эти решения, особенно на какие-то долгосроч.
56: Потому что их, ну, непонятно, как внедрить в текущей парадигме обучения больших языках моделей, и, в частности, в лвр, когда мы учим на корректность. То есть прошла ли математическая задача.
57: Решение, скомпилировался ли код, быстро ли код отработал. Мы получаем агрегированный сигнал, который очень большую часть истории в итоге отбрасывает.
58: 1 из стратегий решения этой проблемы это обучение агентов на их собственном опыте, и вот, в частности, если кому интересно, мы в нашей лабе начали в эту сторону копать.
59: И главная проблема это то, что чем больше мы автоматизируем систему, тем меньше мы сами, как человек понимаем, что происходит на более фундаментальном уровне. То есть мы тоже теряем весь этот трейс и получаем агрегированный сигнал, работаем.
60: Это уровне и постепенно разучаемся самостоятельно принимать решения.
61: Неясно, какие те или иные локальные выборы привели к исходу. Можно, конечно, общаться с агентом, но навык самостоятельного проделывания всех этих траекторий, мне кажется, очень важен. Вот. И это было ещё довольно давно.
62: Подытожено ирония автоматизации, что все более сильная автоматизация требует все более крепкого человеческого суждения. Однако вместе с этим она уничтожает тот сигнал, который нужен для выработки этого суждения. Вот поэтому 1 из
63: Важных тактик, это усиливать подготовку людей на уровне вот фундаментальном, чтобы они становились лучше как специалисты. Ну вот практические советы, которые
64: Предлагаю, например, вести дневник такой проспективный, что мы знали, чего мы ожидаем, что получилось и как мы на основании этого меняем свои будущие предсказания. В частности, вот повышать свою компетентность тоже очень важно. И
65: Можно ееще дистиллировать траекторию агента в какой-то свой опыт. Вот у меня все, спасибо за внимание.
66: А мы снова переходим к вопросам, можем задать парочку, а потом мы отпустим Даню чуть попозже. Снова зона. Так что спасибо за доклад технологии. У меня на самом деле тоже вот такой, наверное, про уровень вопрос. Если мы говорим про технические науки, там
67: Гораздо проще, на самом деле, плюс минус проверить, чем когда это науки об обществе. Соответственно, такой вопрос что же делать, когда у нас ещё большая роль суждения именно когда это науки об обществе, где во многом скорее вкус больше важен, а проверить через эксперимент достаточно сложн.
68: И 2 этого подчасть мы можем генерировать очень много в таком случае траекторий и как нам как человеку справляться с когнитивной перегрузкой когнитив overload, чтобы на самом деле идти к корректному решению, финальному именно для такого рода наук спасибо.
69: Спасибо за вопрос очень интересный. Мне кажется, что там, где нету чёткого сигнала, как, например, в математике или программировании, мы упираемся в то, что должны быть какие-то системы, которые умеют проверять наш ответ. То есть вот
70: Мы, например, конструируем, да, и тоже это своего рода скомпилированный человеческий опыт. Мы каким-то образом пытаемся сделать так, чтобы м. Джадж делал тоже самое, что и мы, и принимал такие же решения. Вот, но мне кажется, здесь
71: Больше проблема именно в том, как строить все более сильные, более абстрактные верификаторы, которые работают и на долгосрочных траекториях, и на более абстрактных траекториях, но тут, мне кажется, просто проблема именно доме.
72: Того, что есть очень много вероятностей, которые могут одинаково давать правильный ответ. Вот не знаю, тут даже, ну, это хороший вопрос. Тут можно долго порассуждать, вот этим интересно заниматься. А можете
73: Повторите 2 вопрос, пожалуйста.
74: Мне кажется, вот когнитивная перегрузка, как раз это частично относится к тому, что я про полный лог всех действий сказал, что у нас нету полноценного сигнала, у нас есть вся информация, необходимая для того, чтобы мы
75: Понимали, что сделал агент и почему он принял то или иное решение, но какая-то все-таки нужна систематика в этих всех трейсах. И мы должны, не знаю, либо придумывать автоматические системы, которые извлекают всю эту информацию, либо каким
76: То образом задавать изначально на уровне дизайна самой автоматической системы, как должны все эти структурированные знания появляться, вот тем самым снижая когнитивную нагрузку и улучшая
77: Понимание того, что вообще происходит и уменьшает шум.
78: Добрый день, меня Илья зовут. Хотел спросить ваше мнение по поводу коллективной работы научных коллективов, потому что, ну, раньше были какие-то там сложившиеся традиции.
79: Стажёры там были руками, которые сейчас стали агентами, там дальше была какая-то специализация, был лидер исследования, и как-то все это ехало. Вот сейчас фактически исследование делает 1 человек, все, что ему нужно, это кто-то, кто с ним может поговорить, его выслушает. Вот сдесли ует его
80: Как вы видите работу научных команд в агентское поколение? Спасибо. Мне кажется, что здесь большую в большей степени играет роль как раз то, что есть некоторые
81: Круг специалистов и мы хотим, чтобы специалистов становилось больше поэтому мы не просто должны как, ну вот мы как специалист просто работаем мы ещё должны каким-то образом взращивать новое поколение учёных.
82: Которые работают в нашей области, в частности, на что, например, высшее образование нацелено. И вы сегодня ещё послушаете очень интересный доклад, очень тесно связанный с вашим вопросом. Там расскажут гораздо более подробно про как раз вот
83: Ответ на ваш вопрос. И я думаю, что здесь в 1 очередь необходимо
84: Делать так, чтобы новое поколение реально росло и улучшало свои способности. Такая достойная