?
Mathematical methods of reinforcement learning
Russian Mathematical Surveys. 2026. Vol. 81. No. 4(490). P. 3–90.
Беломестный Д. В., Гасников А. В., Гладин Е. Л., Наумов А. А., Rubtsov Artemy, Sapronov Y., Тяпкин Д. Н., Юдин Н. Е.
Язык:
английский
Ключевые слова: Markov Decision Processesдинамическое программирование Беллманаdynamic programmingвычислительная и алгоритмическая сложностьMulti-armed banditssample complexitypolicy gradientpolicy gradient methodsметоды градиента политикиPreference OptimizationDiscounted Markov Decision Process (DMDP)Average Reward Markov Decision Process (AMDP)Constrained Markov Decision Process (CMDP)full-knowledge settinggenerative settingmodel-free reinforcement learningforward model settingуправляемый марковский процессдисконтированный управляемый марковский процессуправляемый марковский процесс с усреднённой наградойуправляемый марковский процесс с ограничениямимногорукий бандит
Медведев В. О., Annals of Global Analysis and Geometry 2026 Vol. 70 No. 2 P. 8–23
Добавлено: 19 сентября 2026 г.
Aleksei Samarin, Alexander Savelev, Aleksei Toropov и др., Pattern Recognition and Image Analysis 2026 Vol. 36 No. 2 P. 323–334
Добавлено: 19 сентября 2026 г.
Aleksei Samarin, Назаренко А. А., Kotenko E. и др., Proceedings of the ACM on Management of Data, USA 2026 Vol. 4 No. 1 P. 1–28
Добавлено: 19 сентября 2026 г.
Aleksei Samarin, Alexander Savelev, Aleksei Toropov и др., Pattern Recognition and Image Analysis 2025 Vol. 35 No. 2 P. 148–158
Добавлено: 19 сентября 2026 г.
Aleksei Samarin, Alexander Savelev, Aleksei Toropov и др., Pattern Recognition and Image Analysis 2026 Vol. 36 No. 2 P. 302–312
Добавлено: 19 сентября 2026 г.
Springer, Cham, 2026.
Добавлено: 19 сентября 2026 г.
Springer, Cham, 2026.
Добавлено: 19 сентября 2026 г.
FRUCT Oy, 2024.
Добавлено: 19 сентября 2026 г.
FRUCT Oy, 2024.
Добавлено: 19 сентября 2026 г.
FRUCT Oy, 2025.
Добавлено: 19 сентября 2026 г.
FRUCT Oy, 2026.
Добавлено: 19 сентября 2026 г.
Добавлено: 10 ноября 2025 г.
Сапронов Ю. Ф., Юдин Н. Е., Computational Mathematics and Mathematical Physics 2025 Vol. 65 No. 3 P. 567–581
We continue to develop the concept of studying the ε-optimal policy for Average Reward Markov Decision Processes (AMDP) by reducing it to Discounted Markov Decision Processes (DMDP). Existing research often stipulates that the discount factor must not fall below a certain threshold. Typically, this threshold is close to one, and as is well-known, iterative methods ...
Добавлено: 10 июня 2025 г.
Руденко В. Д., Юдин Н. Е., Васин А. А., Компьютерные исследования и моделирование 2023 Т. 15 № 2 С. 329–353
В данной статье проведен обзор как исторических достижений, так и современных результатов в области марковских процессов принятия решений (Markov Decision Process, MDP) и выпуклой оптимизации. Данный обзор является первой попыткой освещения на русском языке области обучения с подкреплением в контексте выпуклой оптимизации. Рассматриваются фундаментальное уравнение Беллмана и построенные на его основе критерии оптимальности политики — ...
Добавлено: 29 ноября 2024 г.
Гладин Е. Л., Lavrik-Karmazin M., Zainullina K. и др., Proceedings of Machine Learning Research 2023 Vol. 206 P. 11506–11533
Добавлено: 6 ноября 2024 г.
Бурашников Е. П., Operations Research Forum 2024
Добавлено: 21 сентября 2024 г.
Добавлено: 28 мая 2023 г.
Добавлено: 14 апреля 2023 г.
Марон А. И., Марон М. А., Вестник Московского авиационного института 2022 Т. 29 № 2 С. 158–165
Актуальность исследования обусловлена тем, что уменьшение времени поиска и устранения дефектов пассажирских воздушных судов гражданской авиации позволяет существенно уменьшить задержки вылета и связанные с этим потери авиакомпаний. Как показывает статистика, потери растут экспоненциально с увеличением времени, затрачиваемого на ручной поиск и устранение дефекта, являющегося причиной неисправности, зафиксированной бортовыми системами контроля. Цель статьи заключается в том, ...
Добавлено: 30 сентября 2022 г.
Афанасьев В. Н., М.: Красанд/URSS, 2020.
Данная книга подготовлена на основе курсов лекций по теории управления, читаемых
автором в течение ряда лет студентам департамента прикладной математики Национального
Исследовательского Университета «Высшая школа экономики» и физического факультета
Московского государственного университета имени М. В. Ломоносова. Содержание книги
является существенным развитием отдельных глав книги «Математическая теория конструирования систем управления» (В. Н. Афанасьев, В. Б. Колмановский, В. Р. Носов), изданной ...
Добавлено: 27 августа 2022 г.
Anton Khritankov, Pilkevich A., , in: Web Information Systems Engineering – WISE 2021. 22nd International Conference on Web Information Systems Engineering, WISE 2021, Melbourne, VIC, Australia, October 26–29, 2021, ProceedingsVol. 2: Part II.: Springer, 2021. P. 267–274.
Добавлено: 7 декабря 2021 г.
Андреев Н. А., Смирнов С. Н., Computational Mathematics and Modeling 2021 Vol. 32 P. 22–44
Добавлено: 30 сентября 2021 г.