?
Mathematical methods of reinforcement learning
Russian Mathematical Surveys. 2026. Vol. 81. No. 4(490). P. 3–90.
Беломестный Д. В., Гасников А. В., Гладин Е. Л., Наумов А. А., Rubtsov Artemy, Sapronov Y., Тяпкин Д. Н., Юдин Н. Е.
Язык:
английский
Ключевые слова: Markov Decision Processesдинамическое программирование Беллманаdynamic programmingвычислительная и алгоритмическая сложностьMulti-armed banditssample complexitypolicy gradientpolicy gradient methodsметоды градиента политикиPreference OptimizationDiscounted Markov Decision Process (DMDP)Average Reward Markov Decision Process (AMDP)Constrained Markov Decision Process (CMDP)full-knowledge settinggenerative settingmodel-free reinforcement learningforward model settingуправляемый марковский процессдисконтированный управляемый марковский процессуправляемый марковский процесс с усреднённой наградойуправляемый марковский процесс с ограничениямимногорукий бандит
Рыбаков М. Н., Shkatov D., Journal of Logic and Computation 2026 Vol. 36 No. 6 Article exag026
Добавлено: 1 сентября 2026 г.
Селянин Ф. И., Moscow Mathematical Journal 2026 Vol. 26 No. 2 P. 167–187
Добавлено: 31 августа 2026 г.
Казарян М. Э., Дунин-Барковский П. И., Бычков Б. С. и др., International Mathematics Research Notices 2026 Vol. 14 Article rnag146
Добавлено: 31 августа 2026 г.
Казарян М. Э., Дунин-Барковский П. И., Бычков Б. С. и др., Communications in Mathematical Physics 2026 Vol. 407 No. 69
Добавлено: 31 августа 2026 г.
Механизм происходящих в мире изменений носит эволюционный, а не экологический характер. Иначе говоря, Человечество столкнулось с кризисом развития, который имеет три независимые составляющие: кризис индустриального общества (фазовый кризис), кризис научного мышления (эпистемный кризис) и кризис формата существования разума (социосистемный кризис). Доклад посвящён аспектам этого триединого кризиса и возможным путям его преодоления, не сводящимся к первичному ...
Добавлено: 31 августа 2026 г.
Bayer A., Кузнецов А. Г., Macrì E., Journal fuer die reine und angewandte Mathematik 2026 Vol. 2026 No. 836 P. 111–162
Добавлено: 30 августа 2026 г.
Bayer A., Кузнецов А. Г., Macrì E., Compositio Mathematica 2026 Vol. 162 No. 1 P. 59–99
Добавлено: 30 августа 2026 г.
Гусева Л. А., Novikov A., Advances in Mathematics 2026 Vol. 503 Article 111211
Добавлено: 30 августа 2026 г.
Полищук А., Rains E., Journal of the Institute of Mathematics of Jussieu 2026 Vol. 25 No. 1 P. 339–373
Добавлено: 30 августа 2026 г.
Kazhdan D., Полищук А., Pure and Applied Mathematics Quarterly 2026 Vol. 22 No. 3 P. 1115–1166
Добавлено: 30 августа 2026 г.
Добавлено: 30 августа 2026 г.
Широков Н. А., Rozenblum G., Israel Journal of Mathematics 2026 P. 1–30
We establish that a generalized H\¨older continuous function on an (m−2)-Ahlfors regular compact set in Rm can be approximated by solutions of an elliptic equation, with the rate of approximation determined by the continuity modulus of the function ...
Добавлено: 29 августа 2026 г.
Avdoshin S.M., Patrushev K. A., Proceedings of the Institute for System Programming of the RAS 2026 No. 4 часть 2 P. 245–256
Добавлено: 27 августа 2026 г.
Добавлено: 27 августа 2026 г.
Мельников И. Е., Пелиновский Е. Н., Nonlinear Dynamics 2026 No. 114 Article 934
Добавлено: 27 августа 2026 г.
Тула: Тульский государственный педагогический университет им. Л.Н. Толстого, 2025.
Сборник содержит материалы, представленные на XXIV Международной конференции «Алгебра, теория чисел, дискретная геометрия и многомасштабное моделирование: современные проблемы, приложения и проблемы истории», посвящённой 110-летию со дня рождения академика Юрия Владимировича Линника и 110-летию со дня рождения профессора Андрея Борисовича Шидловского и 80-летию со дня рождения профессора Геннадия Ивановича Архипова. Материалы конференции будут полезны научным работникам, ...
Добавлено: 27 августа 2026 г.
Добавлено: 10 ноября 2025 г.
Сапронов Ю. Ф., Юдин Н. Е., Computational Mathematics and Mathematical Physics 2025 Vol. 65 No. 3 P. 567–581
We continue to develop the concept of studying the ε-optimal policy for Average Reward Markov Decision Processes (AMDP) by reducing it to Discounted Markov Decision Processes (DMDP). Existing research often stipulates that the discount factor must not fall below a certain threshold. Typically, this threshold is close to one, and as is well-known, iterative methods ...
Добавлено: 10 июня 2025 г.
Руденко В. Д., Юдин Н. Е., Васин А. А., Компьютерные исследования и моделирование 2023 Т. 15 № 2 С. 329–353
В данной статье проведен обзор как исторических достижений, так и современных результатов в области марковских процессов принятия решений (Markov Decision Process, MDP) и выпуклой оптимизации. Данный обзор является первой попыткой освещения на русском языке области обучения с подкреплением в контексте выпуклой оптимизации. Рассматриваются фундаментальное уравнение Беллмана и построенные на его основе критерии оптимальности политики — ...
Добавлено: 29 ноября 2024 г.
Гладин Е. Л., Lavrik-Karmazin M., Zainullina K. и др., Proceedings of Machine Learning Research 2023 Vol. 206 P. 11506–11533
Добавлено: 6 ноября 2024 г.
Бурашников Е. П., Operations Research Forum 2024
Добавлено: 21 сентября 2024 г.
Добавлено: 28 мая 2023 г.
Добавлено: 14 апреля 2023 г.