• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • A
  • A
  • A
  • A
  • A
Обычная версия сайта
  • RU
  • EN
  • Национальный исследовательский университет «Высшая школа экономики»
  • Публикации ВШЭ
  • Статьи
  • Mathematical methods of reinforcement learning
  • RU
  • EN
Расширенный поиск
Высшая школа экономики
Национальный исследовательский университет
Приоритетные направления
  • бизнес-информатика
  • государственное и муниципальное управление
  • гуманитарные науки
  • инженерные науки
  • компьютерно-математическое
  • математика
  • менеджмент
  • право
  • социология
  • экономика
по году
  • 2028
  • 2027
  • 2026
  • 2025
  • 2024
  • 2023
  • 2022
  • 2021
  • 2020
  • 2019
  • 2018
  • 2017
  • 2016
  • 2015
  • 2014
  • 2013
  • 2012
  • 2011
  • 2010
  • 2009
  • 2008
  • 2007
  • 2006
  • 2005
  • 2004
  • 2003
  • 2002
  • 2001
  • 2000
  • 1999
  • 1998
  • 1997
  • 1996
  • 1995
  • 1994
  • 1993
  • 1992
  • 1991
  • 1990
  • 1989
  • 1988
  • 1987
  • 1986
  • 1985
  • 1984
  • 1983
  • 1982
  • 1981
  • 1980
  • 1979
  • 1978
  • 1977
  • 1976
  • 1975
  • 1974
  • 1973
  • 1972
  • 1971
  • 1970
  • 1969
  • 1968
  • 1967
  • 1966
  • 1965
  • 1964
  • 1963
  • 1958
  • еще
Тематика
Новости
31 августа 2026 г.
Ученые НИУ ВШЭ предложили по-новому считать неформальную занятость в России
Действующие подходы Росстата к оценке неформальной занятости в России уже не в полной мере отражают современную ситуацию на рынке труда. К такому выводу в своем исследовании пришли экономисты ИСИЭЗ НИУ ВШЭ. Ученые считают, что новые международные стандарты помогут получать более достоверные данные о рынке труда, а значит, принимать более эффективные государственные решения.
28 августа 2026 г.
МИЭМ ВШЭ и МИЭТ договорились о научном сотрудничестве
26 августа Московский институт электроники и математики им. А.Н. Тихонова (МИЭМ) ВШЭ и Национальный исследовательский университет «Московский институт электронной техники» (МИЭТ) подписали договор о сотрудничестве. Соглашение направлено на развитие совместных исследований в области физики, перспективного материаловедения и электроники, объединяющих экспериментальные и вычислительные подходы, выполнение совместных опытно-конструкторских работ, а также подготовку заявок на российские и международные научные гранты.
25 августа 2026 г.
Исследователи ВШЭ сравнили рекомендательные алгоритмы по правилам спортивного турнира
Исследователи Института искусственного интеллекта и цифровых наук ФКН НИУ ВШЭ разработали подход, который помогает эффективнее подбирать рекомендательные алгоритмы. В нем разные методы попарно соревнуются, а по результатам всех поединков составляется общий рейтинг. Это помогает сократить число алгоритмов, которые нужно проверять при разработке новых сервисов, и сэкономить денежные и временные ресурсы.Исследование было представлено на  32-й конференции ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026).

 

Нашли опечатку?
Выделите её, нажмите Ctrl+Enter и отправьте нам уведомление. Спасибо за участие!

Публикации
  • Книги
  • Статьи
  • Главы в книгах
  • Препринты
  • Верификация публикаций
  • Расширенный поиск
  • Правила использования материалов
  • Наука в ВШЭ

?

Mathematical methods of reinforcement learning

Russian Mathematical Surveys. 2026. Vol. 81. No. 4(490). P. 3–90.
Беломестный Д. В., Гасников А. В., Гладин Е. Л., Наумов А. А., Rubtsov Artemy, Sapronov Y., Тяпкин Д. Н., Юдин Н. Е.
Научное направление: Математика Компьютерные науки
Язык: английский
Полный текст
DOI
Текст на другом сайте
Ключевые слова: Markov Decision Processesдинамическое программирование Беллманаdynamic programmingвычислительная и алгоритмическая сложностьMulti-armed banditssample complexitypolicy gradientpolicy gradient methodsметоды градиента политикиPreference OptimizationDiscounted Markov Decision Process (DMDP)Average Reward Markov Decision Process (AMDP)Constrained Markov Decision Process (CMDP)full-knowledge settinggenerative settingmodel-free reinforcement learningforward model settingуправляемый марковский процессдисконтированный управляемый марковский процессуправляемый марковский процесс с усреднённой наградойуправляемый марковский процесс с ограничениямимногорукий бандит
Похожие публикации
Discrete Markowitz Portfolio Optimization with Open-Source Classical and Quantum-Inspired Solvers: A Cross-Market Walk-Forward Study
Avdoshin S.M., Patrushev K. A., Proceedings of the Institute for System Programming of the RAS 2026 No. 4 часть 2 P. 245–256
Добавлено: 27 августа 2026 г.
Benchmarking Synolitic Graphs for Autism Classification from Multisite Resting-State fMRI
Заикин А. А., Власенко Д. В., Захаров Д. Г. и др., Diagnostics 2026 Vol. 16 No. 17 P. 1–15
Добавлено: 27 августа 2026 г.
Pyramidal solitons: existence, instability, and interactions
Мельников И. Е., Пелиновский Е. Н., Nonlinear Dynamics 2026 No. 114 Article 934
Добавлено: 27 августа 2026 г.
Алгебра, теория чисел, дискретная геометрия и многомасштабное моделирование. Современные проблемы, приложения и проблемы истории. Материалы XXIV Международной конференции, посвящённой 110-летию со дня рождения академика Юрия Владимировича Линника и 110-летию со дня рождения профессора Андрея Борисовича Шидловского и 80-летию со дня рождения профессора Геннадия Ивановича Архипова
Тула: Тульский государственный педагогический университет им. Л.Н. Толстого, 2025.
Сборник содержит материалы, представленные на XXIV Международной конференции «Алгебра, теория чисел, дискретная геометрия и многомасштабное моделирование: современные проблемы, приложения и проблемы истории», посвящённой 110-летию со дня рождения академика Юрия Владимировича Линника и 110-летию со дня рождения профессора Андрея Борисовича Шидловского и 80-летию со дня рождения профессора Геннадия Ивановича Архипова. Материалы конференции будут полезны научным работникам, ...
Добавлено: 27 августа 2026 г.
О подходе к построению последовательности псевдослучайных чисел, основанном на разложениях 𝐸-функций с периодическими коэффициентами
Нестеренко А. Ю., Чирский В. Г., Матвеев В. Ю., Чебышевский сборник 2026 Т. 27 № 2 С. 118–127
В статье приводятся результаты практического исследования статистических свойств некоторых последовательностей, являющихся значениями функций специального вида. ...
Добавлено: 26 августа 2026 г.
Characterizing the Scheduling Performance of 5G NR Base Stations Under Signaling and Data Traffic Constraints
Eduard Sopin, Назарьин А. И., Бегишев В. О. и др., IEEE Transactions on Vehicular Technology 2026 Vol. 75 No. 6 P. 10995–11007
Добавлено: 26 августа 2026 г.
Генерация исходного кода с использованием больших языковых моделей: систематический обзор методологии Вайб-кодинг
Джонов А. Т., Авдошин С. М., Информационные технологии 2026 Т. 32 № 8 С. 421–427
В данном систематическом обзоре представлен анализ методологии Вайб-кодинг (Vibe Coding) — современно-го подхода к итеративному процессу разработки программного обеспечения с помощью больших языковых моделей (БЯМ). Инструменты генерации кода транформируют написание ПО, позволяя программисту формулировать задачи и описывать желаемое поведение кода на естественном языке, в то время как БЯМ генерирует соответ-ствующий запросам исходный код. Обзор систематиматизирует ...
Добавлено: 25 августа 2026 г.
Balanced sets and homotopy invariants of covers
Блудов М. В., Journal of Fixed Point Theory and Applications 2026 No. 28 Article 73
Добавлено: 25 августа 2026 г.
An adaptive image watermarking scheme using cooperation of HBA and RSA metaheuristics
Мельман А. С., Евсютин О. О., Journal of the Franklin Institute 2026 Vol. 363 No. 15 Article 109005
Добавлено: 25 августа 2026 г.
Exact solutions for transport of distributed colloids in porous media
L.I. Kuzmina, Osipov , Y. V., Kolokoltseva, T. N., Advances in Water Resources 2026 Vol. 213 Article 105335
Добавлено: 25 августа 2026 г.
MODEL OF DEEP BED FILTRATION IN A POROUS MEDIUM WITH HETEROGENEOUS POROSITY
Liudmila I. Kuzmina, Osipov, Y. V., International Journal for Computational Civil and Structural Engineering 2026 Vol. 22 No. 2 P. 138–148
Добавлено: 25 августа 2026 г.
Exact Solutions to One-Dimensional Problem of Oil Displacement by Chemical
L.I.Kuzmina, Osipov Y. V., Mathematical notes, ISSN 0001-4346 2025 Vol. 116 No. 6 P. 1251–1261
Добавлено: 25 августа 2026 г.
Proceedings of the 2026 12th International Conference on Control, Decision and Information Technologies (CoDIT) (Italy, Bari, July 13–16, 2026)
IEEE, 2026.
Добавлено: 24 августа 2026 г.
From data to knowledge: artificial intelligence methods for studying comorbidity in electronic health records
Лукьяненко Д. В., Рагимова А. А., Мухорина А. и др., European Physical Journal: Special Topics 2026 P. 1–24
Добавлено: 20 августа 2026 г.
Proceedings of the Generative Code Intelligence Workshop (GeCoIn 2026), co-located with the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026)
CEUR-WS.org, 2026.
Добавлено: 20 августа 2026 г.
MM-PSYCHE: Multimodal Multitask Psychological Characteristic Estimation Through Cross-Domain Semi-Supervised Learning
Рюмина Е. В., Аксёнов А. А., Коряковская Д. О. и др., IEEE Access 2026 Vol. 14 P. 124759–124778
Добавлено: 20 августа 2026 г.
Weighted mesh algorithms for general Markov decision processes: Convergence and tractability
Беломестный Д. В., Schoenmakers J., Zorina V., Journal of Complexity 2025 Vol. 88 Article 101932
Добавлено: 10 ноября 2025 г.
Optimal Approximation of Average Reward Markov Decision Processes
Сапронов Ю. Ф., Юдин Н. Е., Computational Mathematics and Mathematical Physics 2025 Vol. 65 No. 3 P. 567–581
We continue to develop the concept of studying the ε-optimal policy for Average Reward Markov Decision Processes (AMDP) by reducing it to Discounted Markov Decision Processes (DMDP). Existing research often stipulates that the discount factor must not fall below a certain threshold. Typically, this threshold is close to one, and as is well-known, iterative methods ...
Добавлено: 10 июня 2025 г.
Обзор выпуклой оптимизации марковских процессов принятия решений
Руденко В. Д., Юдин Н. Е., Васин А. А., Компьютерные исследования и моделирование 2023 Т. 15 № 2 С. 329–353
В данной статье проведен обзор как исторических достижений, так и современных результатов в области марковских процессов принятия решений (Markov Decision Process, MDP) и выпуклой оптимизации. Данный обзор является первой попыткой освещения на русском языке области обучения с подкреплением в контексте выпуклой оптимизации. Рассматриваются фундаментальное уравнение Беллмана и построенные на его основе критерии оптимальности политики — ...
Добавлено: 29 ноября 2024 г.
Algorithm for Constrained Markov Decision Process with Linear Convergence
Гладин Е. Л., Lavrik-Karmazin M., Zainullina K. и др., Proceedings of Machine Learning Research 2023 Vol. 206 P. 11506–11533
Добавлено: 6 ноября 2024 г.
Branch-and-Bound and Dynamic Programming Approaches for the Knapsack Problem
Бурашников Е. П., Operations Research Forum 2024
Добавлено: 21 сентября 2024 г.
Structured (min,+)‑convolution and its applications for the shortest/closest vector and nonlinear knapsack problems
D. V. Gribanov, Shumilov I. A., D. S. Malyshev, Optimization Letters 2024 Vol. 18 P. 73–103
Добавлено: 28 мая 2023 г.
Variance Reduction for Policy-Gradient Methods via Empirical Variance Minimization
Беломестный Д. В., Каледин М. Л., Golubev A., /. 2022.
Добавлено: 14 апреля 2023 г.
Построение алгоритмов поиска и устранения дефектов пассажирских воздушных судов гражданской авиации
Марон А. И., Марон М. А., Вестник Московского авиационного института 2022 Т. 29 № 2 С. 158–165
Актуальность исследования обусловлена тем, что уменьшение времени поиска и устранения дефектов пассажирских воздушных судов гражданской авиации позволяет существенно уменьшить задержки вылета и связанные с этим потери авиакомпаний. Как показывает статистика, потери растут экспоненциально с увеличением времени, затрачиваемого на ручной поиск и устранение дефекта, являющегося причиной неисправности, зафиксированной бортовыми системами контроля. Цель статьи заключается в том, ...
Добавлено: 30 сентября 2022 г.
  • О ВЫШКЕ
  • Цифры и факты
  • Руководство и структура
  • Устойчивое развитие в НИУ ВШЭ
  • Преподаватели и сотрудники
  • Корпуса и общежития
  • Закупки
  • Обращения граждан в НИУ ВШЭ
  • Фонд целевого капитала
  • Противодействие коррупции
  • Сведения о доходах, расходах, об имуществе и обязательствах имущественного характера
  • Сведения об образовательной организации
  • Людям с ограниченными возможностями здоровья
  • Единая платежная страница
  • Работа в Вышке
  • ОБРАЗОВАНИЕ
  • Лицей
  • Довузовская подготовка
  • Олимпиады
  • Прием в бакалавриат
  • Вышка+
  • Прием в магистратуру
  • Аспирантура
  • Дополнительное образование
  • Центр развития карьеры
  • Бизнес-инкубатор ВШЭ
  • Образовательные партнерства
  • Обратная связь и взаимодействие с получателями услуг
  • НАУКА
  • Научные подразделения
  • Исследовательские проекты
  • Мониторинги
  • Диссертационные советы
  • Защиты диссертаций
  • Академическое развитие
  • Конкурсы и гранты
  • Внешние научно-информационные ресурсы
  • РЕСУРСЫ
  • Библиотека
  • Издательский дом ВШЭ
  • Книжный магазин «БукВышка»
  • Типография
  • Медиацентр
  • Журналы ВШЭ
  • Публикации
  • http://www.minobrnauki.gov.ru/
    Министерство науки и высшего образования РФ
  • https://edu.gov.ru/
    Министерство просвещения РФ
  • https://elearning.hse.ru/mooc
    Массовые открытые онлайн-курсы
  • НИУ ВШЭ1993–2026
  • Адреса и контакты
  • Условия использования материалов
  • Политика обработки персональных данных
  • Правила применения рекомендательных технологий в НИУ ВШЭ
  • Карта сайта
Редактору