?
Mathematical methods of reinforcement learning
Russian Mathematical Surveys. 2026. Vol. 81. No. 4(490). P. 3–90.
Беломестный Д. В., Гасников А. В., Гладин Е. Л., Наумов А. А., Rubtsov Artemy, Sapronov Y., Тяпкин Д. Н., Юдин Н. Е.
Язык:
английский
Ключевые слова: Markov Decision Processesдинамическое программирование Беллманаdynamic programmingвычислительная и алгоритмическая сложностьMulti-armed banditssample complexitypolicy gradientpolicy gradient methodsметоды градиента политикиPreference OptimizationDiscounted Markov Decision Process (DMDP)Average Reward Markov Decision Process (AMDP)Constrained Markov Decision Process (CMDP)full-knowledge settinggenerative settingmodel-free reinforcement learningforward model settingуправляемый марковский процессдисконтированный управляемый марковский процессуправляемый марковский процесс с усреднённой наградойуправляемый марковский процесс с ограничениямимногорукий бандит
Avdoshin S.M., Patrushev K. A., Proceedings of the Institute for System Programming of the RAS 2026 No. 4 часть 2 P. 245–256
Добавлено: 27 августа 2026 г.
Добавлено: 27 августа 2026 г.
Мельников И. Е., Пелиновский Е. Н., Nonlinear Dynamics 2026 No. 114 Article 934
Добавлено: 27 августа 2026 г.
Тула: Тульский государственный педагогический университет им. Л.Н. Толстого, 2025.
Сборник содержит материалы, представленные на XXIV Международной конференции «Алгебра, теория чисел, дискретная геометрия и многомасштабное моделирование: современные проблемы, приложения и проблемы истории», посвящённой 110-летию со дня рождения академика Юрия Владимировича Линника и 110-летию со дня рождения профессора Андрея Борисовича Шидловского и 80-летию со дня рождения профессора Геннадия Ивановича Архипова. Материалы конференции будут полезны научным работникам, ...
Добавлено: 27 августа 2026 г.
В статье приводятся результаты практического исследования статистических свойств некоторых последовательностей, являющихся значениями функций специального вида. ...
Добавлено: 26 августа 2026 г.
Eduard Sopin, Назарьин А. И., Бегишев В. О. и др., IEEE Transactions on Vehicular Technology 2026 Vol. 75 No. 6 P. 10995–11007
Добавлено: 26 августа 2026 г.
Джонов А. Т., Авдошин С. М., Информационные технологии 2026 Т. 32 № 8 С. 421–427
В данном систематическом обзоре представлен анализ методологии Вайб-кодинг (Vibe Coding) — современно-го подхода к итеративному процессу разработки программного обеспечения с помощью больших языковых моделей (БЯМ). Инструменты генерации кода транформируют написание ПО, позволяя программисту формулировать задачи и описывать желаемое поведение кода на естественном языке, в то время как БЯМ генерирует соответ-ствующий запросам исходный код. Обзор систематиматизирует ...
Добавлено: 25 августа 2026 г.
Блудов М. В., Journal of Fixed Point Theory and Applications 2026 No. 28 Article 73
Добавлено: 25 августа 2026 г.
Мельман А. С., Евсютин О. О., Journal of the Franklin Institute 2026 Vol. 363 No. 15 Article 109005
Добавлено: 25 августа 2026 г.
L.I. Kuzmina, Osipov , Y. V., Kolokoltseva, T. N., Advances in Water Resources 2026 Vol. 213 Article 105335
Добавлено: 25 августа 2026 г.
Liudmila I. Kuzmina, Osipov, Y. V., International Journal for Computational Civil and Structural Engineering 2026 Vol. 22 No. 2 P. 138–148
Добавлено: 25 августа 2026 г.
L.I.Kuzmina, Osipov Y. V., Mathematical notes, ISSN 0001-4346 2025 Vol. 116 No. 6 P. 1251–1261
Добавлено: 25 августа 2026 г.
IEEE, 2026.
Добавлено: 24 августа 2026 г.
Лукьяненко Д. В., Рагимова А. А., Мухорина А. и др., European Physical Journal: Special Topics 2026 P. 1–24
Добавлено: 20 августа 2026 г.
CEUR-WS.org, 2026.
Добавлено: 20 августа 2026 г.
Добавлено: 20 августа 2026 г.
Добавлено: 10 ноября 2025 г.
Сапронов Ю. Ф., Юдин Н. Е., Computational Mathematics and Mathematical Physics 2025 Vol. 65 No. 3 P. 567–581
We continue to develop the concept of studying the ε-optimal policy for Average Reward Markov Decision Processes (AMDP) by reducing it to Discounted Markov Decision Processes (DMDP). Existing research often stipulates that the discount factor must not fall below a certain threshold. Typically, this threshold is close to one, and as is well-known, iterative methods ...
Добавлено: 10 июня 2025 г.
Руденко В. Д., Юдин Н. Е., Васин А. А., Компьютерные исследования и моделирование 2023 Т. 15 № 2 С. 329–353
В данной статье проведен обзор как исторических достижений, так и современных результатов в области марковских процессов принятия решений (Markov Decision Process, MDP) и выпуклой оптимизации. Данный обзор является первой попыткой освещения на русском языке области обучения с подкреплением в контексте выпуклой оптимизации. Рассматриваются фундаментальное уравнение Беллмана и построенные на его основе критерии оптимальности политики — ...
Добавлено: 29 ноября 2024 г.
Гладин Е. Л., Lavrik-Karmazin M., Zainullina K. и др., Proceedings of Machine Learning Research 2023 Vol. 206 P. 11506–11533
Добавлено: 6 ноября 2024 г.
Бурашников Е. П., Operations Research Forum 2024
Добавлено: 21 сентября 2024 г.
Добавлено: 28 мая 2023 г.
Добавлено: 14 апреля 2023 г.
Марон А. И., Марон М. А., Вестник Московского авиационного института 2022 Т. 29 № 2 С. 158–165
Актуальность исследования обусловлена тем, что уменьшение времени поиска и устранения дефектов пассажирских воздушных судов гражданской авиации позволяет существенно уменьшить задержки вылета и связанные с этим потери авиакомпаний. Как показывает статистика, потери растут экспоненциально с увеличением времени, затрачиваемого на ручной поиск и устранение дефекта, являющегося причиной неисправности, зафиксированной бортовыми системами контроля. Цель статьи заключается в том, ...
Добавлено: 30 сентября 2022 г.