?
Mathematical methods of reinforcement learning
Russian Mathematical Surveys. 2026. Vol. 81. No. 4(490). P. 3–90.
Беломестный Д. В., Гасников А. В., Гладин Е. Л., Наумов А. А., Rubtsov Artemy, Sapronov Y., Тяпкин Д. Н., Юдин Н. Е.
Язык:
английский
Ключевые слова: Markov Decision Processesдинамическое программирование Беллманаdynamic programmingвычислительная и алгоритмическая сложностьMulti-armed banditssample complexitypolicy gradientpolicy gradient methodsметоды градиента политикиPreference OptimizationDiscounted Markov Decision Process (DMDP)Average Reward Markov Decision Process (AMDP)Constrained Markov Decision Process (CMDP)full-knowledge settinggenerative settingmodel-free reinforcement learningforward model settingуправляемый марковский процессдисконтированный управляемый марковский процессуправляемый марковский процесс с усреднённой наградойуправляемый марковский процесс с ограничениямимногорукий бандит
Лунц В. А., Функциональный анализ и его приложения 2026 Т. 60 № 3 С. 127–129
Доказано, что канонические полуортогональные разложения производной категории диаграммной схемы индуцируют аналогичные разложения подкатегории совершенных комплексов. ...
Добавлено: 3 августа 2026 г.
Чеповский А. М., Мастерская Печати Идей, 2026.
В учебном пособии представлены методы и алгоритмы автоматического анализа корпусов текстов на естественных языках. Предназначено для изучающих методов обработки текстов на естественных языках и создания обучающих массивов текстов.
Для студентов, аспирантов и научных работников, изучающих методы компьютерной лингвистики и обработку текстов. ...
Добавлено: 1 августа 2026 г.
Абызов А. Н., Буутай П. Н., Математика и теоретические компьютерные науки 2026 Т. 4 № 2 С. 4–75
Статья носит обзорно-методический характер и посвящена развитию идей Е.И. Золотарёва, заложенных в его подходе к доказательству квадратичного закона взаимности (1872 г.). Мы рассматриваем расширения подхода Золотарёва на абстрактные числовые кольца, приведенные в работе А. Бруньята и П.Л. Кларка (2015 г.), и на конечные группы, изученные в статье У. Дьюка и К. Хопкинс (2005 г.). Также ...
Добавлено: 30 июля 2026 г.
Уилкокс П., Романов А. Ю., М.: ДМК Пресс, 2025.
Книга, которую вы держите в руках, продолжает серию «Книжная полка истового
инженера», которая издается при поддержке компании YADRO.
Данная книга представляет собой учебник по теоретическим основам продвинутой
функциональной верификации и содержит лучшие практики, используемые в настоящее
время. В ней подробно описана унифицированная методология верификации
(UVM) и раскрыты такие темы, как функциональный виртуальный прототип, функциональное
покрытие, утверждения, формальная верификация, тестбенчи, косимуляция,
эмуляция, аппаратное ...
Добавлено: 30 июля 2026 г.
Mikhaylets E. V., Razorenova A. М., Chernyshev V. L. и др., Scientific Reports 2026 Vol. 16 Article 23560
Добавлено: 29 июля 2026 г.
Попеленский Ф. Ю., Математический сборник 2026 Т. 217 № 2 С. 108–153
В недавней работе В. М. Бухштабера и автора была введена новая структура в когомологиях алгебр Хопфа в терминах спектральной последовательности Бухштабера (Bss). В классической алгебре Стинрода A2 имеется важная подалгебра Хопфа A(1), когомологии которой давно известны. В настоящей работе обсуждаемая структура на этих когомологиях полностью вычислена.
В рамках демонстрации методов Bss решена обратная задача: получено новое ...
Добавлено: 28 июля 2026 г.
Metlov K., Andrei B. Bogatyrëv, Annalen der Physik 2026 Vol. 538 No. 6 Article e70234
Добавлено: 28 июля 2026 г.
Думкин Н. А., Александров Д. В., Прозорский М. А., Труды Института системного программирования РАН 2026 Т. 38 № 1 С. 255–274
Предложен теоретически обоснованный подход к адаптивному восстановлению
видеофрагментов на стороне клиента с использованием методов машинного обучения и анализа сцены.
Метод включает формальную постановку задачи, модель конечного автомата для принятия решений,
функцию стоимости восстановления, а также новый этап в подготовке видео – оценку динамики сцены
с последующей записью признака в HLS-плейлист. Такой признак позволяет повысить точность выбора
методов восстановления фрагментов видео. ...
Добавлено: 27 июля 2026 г.
Меновщиков А. В., Ukhlov A., Rendiconti del Circolo Matematico di Palermo 2026 Vol. 75 Article 91
Добавлено: 27 июля 2026 г.
Меновщиков А. В., Journal of Mathematical Sciences 2026 Vol. 298 P. 608–618
Добавлено: 27 июля 2026 г.
Cham: Springer, 2026.
Добавлено: 26 июля 2026 г.
Добавлено: 23 июля 2026 г.
Писляков В. В., Вестник Томского государственного университета. Филология 2026 № 101 С. 175–192
Исследуется использование паремий в статьях, опубликованных в отечественных научных журналах. В результате поиска по платформе eLIBRARY.RU и постатейного просмотра полных текстов формируется «паремический массив» – набор журнальных статей, вышедших за 2014–2023 гг., в которых встречается одна из десяти исследуемых пословиц. Выделяются только случаи, когда пословицы используются авторами как пришедшиеся к слову изречения, а не как ...
Добавлено: 22 июля 2026 г.
Association for Computing Machinery (ACM), 2026.
Добавлено: 22 июля 2026 г.
Korogod D., Shapeev A., Ivan S. Novikov, Physical Review B: Condensed Matter and Materials Physics 2026 Vol. 114 No. 2 Article 024104
Добавлено: 22 июля 2026 г.
Sozykin K., Rybin N., Chertkov A. и др., Physical Review B: Condensed Matter and Materials Physics 2026 Vol. 113 No. 22 Article 224111
Добавлено: 22 июля 2026 г.
Добавлено: 10 ноября 2025 г.
Сапронов Ю. Ф., Юдин Н. Е., Computational Mathematics and Mathematical Physics 2025 Vol. 65 No. 3 P. 567–581
We continue to develop the concept of studying the ε-optimal policy for Average Reward Markov Decision Processes (AMDP) by reducing it to Discounted Markov Decision Processes (DMDP). Existing research often stipulates that the discount factor must not fall below a certain threshold. Typically, this threshold is close to one, and as is well-known, iterative methods ...
Добавлено: 10 июня 2025 г.
Руденко В. Д., Юдин Н. Е., Васин А. А., Компьютерные исследования и моделирование 2023 Т. 15 № 2 С. 329–353
В данной статье проведен обзор как исторических достижений, так и современных результатов в области марковских процессов принятия решений (Markov Decision Process, MDP) и выпуклой оптимизации. Данный обзор является первой попыткой освещения на русском языке области обучения с подкреплением в контексте выпуклой оптимизации. Рассматриваются фундаментальное уравнение Беллмана и построенные на его основе критерии оптимальности политики — ...
Добавлено: 29 ноября 2024 г.
Гладин Е. Л., Lavrik-Karmazin M., Zainullina K. и др., Proceedings of Machine Learning Research 2023 Vol. 206 P. 11506–11533
Добавлено: 6 ноября 2024 г.
Бурашников Е. П., Operations Research Forum 2024
Добавлено: 21 сентября 2024 г.
Добавлено: 28 мая 2023 г.