• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • A
  • A
  • A
  • A
  • A
Обычная версия сайта
  • RU
  • EN
  • Национальный исследовательский университет «Высшая школа экономики»
  • Публикации ВШЭ
  • Статьи
  • Mathematical methods of reinforcement learning
  • RU
  • EN
Расширенный поиск
Высшая школа экономики
Национальный исследовательский университет
Приоритетные направления
  • бизнес-информатика
  • государственное и муниципальное управление
  • гуманитарные науки
  • инженерные науки
  • компьютерно-математическое
  • математика
  • менеджмент
  • право
  • социология
  • экономика
по году
  • 2028
  • 2027
  • 2026
  • 2025
  • 2024
  • 2023
  • 2022
  • 2021
  • 2020
  • 2019
  • 2018
  • 2017
  • 2016
  • 2015
  • 2014
  • 2013
  • 2012
  • 2011
  • 2010
  • 2009
  • 2008
  • 2007
  • 2006
  • 2005
  • 2004
  • 2003
  • 2002
  • 2001
  • 2000
  • 1999
  • 1998
  • 1997
  • 1996
  • 1995
  • 1994
  • 1993
  • 1992
  • 1991
  • 1990
  • 1989
  • 1988
  • 1987
  • 1986
  • 1985
  • 1984
  • 1983
  • 1982
  • 1981
  • 1980
  • 1979
  • 1978
  • 1977
  • 1976
  • 1975
  • 1974
  • 1973
  • 1972
  • 1971
  • 1970
  • 1969
  • 1968
  • 1967
  • 1966
  • 1965
  • 1964
  • 1963
  • 1958
  • еще
Тематика
Новости
18 сентября 2026 г.
«Время на содержательные вопросы у нас не лимитировалось»
Международная лаборатория атомистического суперкомпьютерного моделирования и многомасштабного анализа НИУ ВШЭ провела масштабную конференцию «Молекулярная динамика». Участники могли услышать всех докладчиков, а сами докладчики — ответить на любое количество содержательных вопросов. О подготовке конференции и дискуссиях «Вышка.Главное» поговорила с заведующим лабораторией Григорием Смирновым и ее главным научным сотрудником Генри Норманом.
18 сентября 2026 г.
Ученые ВШЭ займутся изучением очарованных адронов в рамках BESIII
Высшая школа экономики стала университетом — участником международной коллаборации BESIII (Beijing Spectrometer III) в области физики высоких энергий. Присоединение к коллаборации стало первым практическим результатом реализации меморандума о сотрудничестве, подписанного в 2025 году между НИУ ВШЭ и Институтом физики высоких энергий (IHEP) в Пекине (КНР).
17 сентября 2026 г.
<a>НИУ ВШЭ представил в Китае исследование о безопасности нейросетей для анализа видео
Ученые Высшей школы экономики презентавали на международной конференции ChinaMM 2026 в Китае исследование о том, как искажения при передаче видео влияют на работу нейросетей. Авторы предложили новый способ проверять устойчивость таких моделей в условиях, близких к реальному использованию видеосервисов.

 

Нашли опечатку?
Выделите её, нажмите Ctrl+Enter и отправьте нам уведомление. Спасибо за участие!

Публикации
  • Книги
  • Статьи
  • Главы в книгах
  • Препринты
  • Верификация публикаций
  • Расширенный поиск
  • Правила использования материалов
  • Наука в ВШЭ

?

Mathematical methods of reinforcement learning

Russian Mathematical Surveys. 2026. Vol. 81. No. 4(490). P. 3–90.
Беломестный Д. В., Гасников А. В., Гладин Е. Л., Наумов А. А., Rubtsov Artemy, Sapronov Y., Тяпкин Д. Н., Юдин Н. Е.
Научное направление: Математика Компьютерные науки
Язык: английский
Полный текст
DOI
Текст на другом сайте
Ключевые слова: Markov Decision Processesдинамическое программирование Беллманаdynamic programmingвычислительная и алгоритмическая сложностьMulti-armed banditssample complexitypolicy gradientpolicy gradient methodsметоды градиента политикиPreference OptimizationDiscounted Markov Decision Process (DMDP)Average Reward Markov Decision Process (AMDP)Constrained Markov Decision Process (CMDP)full-knowledge settinggenerative settingmodel-free reinforcement learningforward model settingуправляемый марковский процессдисконтированный управляемый марковский процессуправляемый марковский процесс с усреднённой наградойуправляемый марковский процесс с ограничениямимногорукий бандит
Похожие публикации
Lecture Notes in Artificial Intelligence
Springer, 2026.
Добавлено: 20 сентября 2026 г.
Some rigidity results for static three-manifolds with boundary and positive scalar curvature
Медведев В. О., Annals of Global Analysis and Geometry 2026 Vol. 70 No. 2 P. 8–23
Добавлено: 19 сентября 2026 г.
Improving the Accuracy of Automatic Wildlife Detection in Nature Reserves Using Infrared Imaging
Aleksei Samarin, Alexander Savelev, Aleksei Toropov и др., Pattern Recognition and Image Analysis 2026 Vol. 36 No. 2 P. 323–334
Добавлено: 19 сентября 2026 г.
IDAP++: Advancing Divergence-Aware Pruning with Joint Filter and Layer Optimization
Aleksei Samarin, Назаренко А. А., Kotenko E. и др., Proceedings of the ACM on Management of Data, USA 2026 Vol. 4 No. 1 P. 1–28
Добавлено: 19 сентября 2026 г.
Automated Feature Engineering-Based Approach for Micrococci Microscopic Image Classification and Taxonomic Characteristics Determination
Aleksei Samarin, Alexander Savelev, Aleksei Toropov и др., Pattern Recognition and Image Analysis 2025 Vol. 35 No. 2 P. 148–158
Добавлено: 19 сентября 2026 г.
Improvement in Microbial Classification Quality Using Synthetic Microscopic Images Generated by Large Visual-Language Models
Aleksei Samarin, Alexander Savelev, Aleksei Toropov и др., Pattern Recognition and Image Analysis 2026 Vol. 36 No. 2 P. 302–312
Добавлено: 19 сентября 2026 г.
Advances in Neural Computation, Machine Learning, and Cognitive Research IX
Springer, Cham, 2026.
Добавлено: 19 сентября 2026 г.
Proceedings of 18th International Conference on Machine Learning and Computing
Springer, Cham, 2026.
Добавлено: 19 сентября 2026 г.
Proceedings of the 35th Conference of Open Innovations Association FRUCT
FRUCT Oy, 2024.
Добавлено: 19 сентября 2026 г.
Proceedings of the 36th Conference of Open Innovations Association FRUCT
FRUCT Oy, 2024.
Добавлено: 19 сентября 2026 г.
Proceedings of the 37th Conference of Open Innovations Association FRUCT
FRUCT Oy, 2025.
Добавлено: 19 сентября 2026 г.
Proceedings of the 39th Conference of Open Innovations Association FRUCT
FRUCT Oy, 2026.
Добавлено: 19 сентября 2026 г.
Weighted mesh algorithms for general Markov decision processes: Convergence and tractability
Беломестный Д. В., Schoenmakers J., Zorina V., Journal of Complexity 2025 Vol. 88 Article 101932
Добавлено: 10 ноября 2025 г.
Optimal Approximation of Average Reward Markov Decision Processes
Сапронов Ю. Ф., Юдин Н. Е., Computational Mathematics and Mathematical Physics 2025 Vol. 65 No. 3 P. 567–581
We continue to develop the concept of studying the ε-optimal policy for Average Reward Markov Decision Processes (AMDP) by reducing it to Discounted Markov Decision Processes (DMDP). Existing research often stipulates that the discount factor must not fall below a certain threshold. Typically, this threshold is close to one, and as is well-known, iterative methods ...
Добавлено: 10 июня 2025 г.
Обзор выпуклой оптимизации марковских процессов принятия решений
Руденко В. Д., Юдин Н. Е., Васин А. А., Компьютерные исследования и моделирование 2023 Т. 15 № 2 С. 329–353
В данной статье проведен обзор как исторических достижений, так и современных результатов в области марковских процессов принятия решений (Markov Decision Process, MDP) и выпуклой оптимизации. Данный обзор является первой попыткой освещения на русском языке области обучения с подкреплением в контексте выпуклой оптимизации. Рассматриваются фундаментальное уравнение Беллмана и построенные на его основе критерии оптимальности политики — ...
Добавлено: 29 ноября 2024 г.
Algorithm for Constrained Markov Decision Process with Linear Convergence
Гладин Е. Л., Lavrik-Karmazin M., Zainullina K. и др., Proceedings of Machine Learning Research 2023 Vol. 206 P. 11506–11533
Добавлено: 6 ноября 2024 г.
Branch-and-Bound and Dynamic Programming Approaches for the Knapsack Problem
Бурашников Е. П., Operations Research Forum 2024
Добавлено: 21 сентября 2024 г.
Structured (min,+)‑convolution and its applications for the shortest/closest vector and nonlinear knapsack problems
D. V. Gribanov, Shumilov I. A., D. S. Malyshev, Optimization Letters 2024 Vol. 18 P. 73–103
Добавлено: 28 мая 2023 г.
Variance Reduction for Policy-Gradient Methods via Empirical Variance Minimization
Беломестный Д. В., Каледин М. Л., Golubev A., /. 2022.
Добавлено: 14 апреля 2023 г.
Построение алгоритмов поиска и устранения дефектов пассажирских воздушных судов гражданской авиации
Марон А. И., Марон М. А., Вестник Московского авиационного института 2022 Т. 29 № 2 С. 158–165
Актуальность исследования обусловлена тем, что уменьшение времени поиска и устранения дефектов пассажирских воздушных судов гражданской авиации позволяет существенно уменьшить задержки вылета и связанные с этим потери авиакомпаний. Как показывает статистика, потери растут экспоненциально с увеличением времени, затрачиваемого на ручной поиск и устранение дефекта, являющегося причиной неисправности, зафиксированной бортовыми системами контроля. Цель статьи заключается в том, ...
Добавлено: 30 сентября 2022 г.
Математическая теория управления непрерывными динамическими системами
Афанасьев В. Н., М.: Красанд/URSS, 2020.
Данная книга подготовлена на основе курсов лекций по теории управления, читаемых автором в течение ряда лет студентам департамента прикладной математики Национального Исследовательского Университета «Высшая школа экономики» и физического факультета Московского государственного университета имени М. В. Ломоносова. Содержание книги является существенным развитием отдельных глав книги «Математическая теория конструирования систем управления» (В. Н. Афанасьев, В. Б. Колмановский, В. Р. Носов), изданной ...
Добавлено: 27 августа 2022 г.
Existence Conditions for Hidden Feedback Loops in Online Recommender Systems
Anton Khritankov, Pilkevich A., , in: Web Information Systems Engineering – WISE 2021. 22nd International Conference on Web Information Systems Engineering, WISE 2021, Melbourne, VIC, Australia, October 26–29, 2021, ProceedingsVol. 2: Part II.: Springer, 2021. P. 267–274.
Добавлено: 7 декабря 2021 г.
Guaranteed Deterministic Approach to Superhedging: A Numerical Experiment
Андреев Н. А., Смирнов С. Н., Computational Mathematics and Modeling 2021 Vol. 32 P. 22–44
Добавлено: 30 сентября 2021 г.
Efficient Algorithm for Finding Roots of Error-Locator Polynomials
Sergei Valentinovich Fedorenko, IEEE Access 2021 Vol. 9 P. 38673–38686
Добавлено: 15 апреля 2021 г.
  • О ВЫШКЕ
  • Цифры и факты
  • Руководство и структура
  • Устойчивое развитие в НИУ ВШЭ
  • Преподаватели и сотрудники
  • Корпуса и общежития
  • Закупки
  • Обращения граждан в НИУ ВШЭ
  • Фонд целевого капитала
  • Противодействие коррупции
  • Сведения о доходах, расходах, об имуществе и обязательствах имущественного характера
  • Сведения об образовательной организации
  • Людям с ограниченными возможностями здоровья
  • Единая платежная страница
  • Работа в Вышке
  • ОБРАЗОВАНИЕ
  • Лицей
  • Довузовская подготовка
  • Олимпиады
  • Прием в бакалавриат
  • Вышка+
  • Прием в магистратуру
  • Аспирантура
  • Дополнительное образование
  • Центр развития карьеры
  • Бизнес-инкубатор ВШЭ
  • Образовательные партнерства
  • Обратная связь и взаимодействие с получателями услуг
  • НАУКА
  • Научные подразделения
  • Исследовательские проекты
  • Мониторинги
  • Диссертационные советы
  • Защиты диссертаций
  • Академическое развитие
  • Конкурсы и гранты
  • Внешние научно-информационные ресурсы
  • РЕСУРСЫ
  • Библиотека
  • Издательский дом ВШЭ
  • Книжный магазин «БукВышка»
  • Типография
  • Медиацентр
  • Журналы ВШЭ
  • Публикации
  • http://www.minobrnauki.gov.ru/
    Министерство науки и высшего образования РФ
  • https://edu.gov.ru/
    Министерство просвещения РФ
  • https://elearning.hse.ru/mooc
    Массовые открытые онлайн-курсы
  • НИУ ВШЭ1993–2026
  • Адреса и контакты
  • Условия использования материалов
  • Политика обработки персональных данных
  • Правила применения рекомендательных технологий в НИУ ВШЭ
  • Карта сайта
Редактору