• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • A
  • A
  • A
  • A
  • A
Обычная версия сайта
  • RU
  • EN
  • Национальный исследовательский университет «Высшая школа экономики»
  • Публикации ВШЭ
  • Статьи
  • Обзор выпуклой оптимизации марковских процессов принятия решений
  • RU
  • EN
Расширенный поиск
Высшая школа экономики
Национальный исследовательский университет
Приоритетные направления
  • бизнес-информатика
  • государственное и муниципальное управление
  • гуманитарные науки
  • инженерные науки
  • компьютерно-математическое
  • математика
  • менеджмент
  • право
  • социология
  • экономика
по году
  • 2027
  • 2026
  • 2025
  • 2024
  • 2023
  • 2022
  • 2021
  • 2020
  • 2019
  • 2018
  • 2017
  • 2016
  • 2015
  • 2014
  • 2013
  • 2012
  • 2011
  • 2010
  • 2009
  • 2008
  • 2007
  • 2006
  • 2005
  • 2004
  • 2003
  • 2002
  • 2001
  • 2000
  • 1999
  • 1998
  • 1997
  • 1996
  • 1995
  • 1994
  • 1993
  • 1992
  • 1991
  • 1990
  • 1989
  • 1988
  • 1987
  • 1986
  • 1985
  • 1984
  • 1983
  • 1982
  • 1981
  • 1980
  • 1979
  • 1978
  • 1977
  • 1976
  • 1975
  • 1974
  • 1973
  • 1972
  • 1971
  • 1970
  • 1969
  • 1968
  • 1967
  • 1966
  • 1965
  • 1964
  • 1963
  • 1958
  • еще
Тематика
Новости
11 августа 2026 г.
Как интеллектуальный капитал влияет на экспорт регионов
Интеллектуальный капитал (ИК) — знания, кадры и внешние связи — значимо влияет на экспорт российских регионов, но эффект проявляется лишь после накопления определенного уровня ИК и не ослабевает в кризисы, выяснили исследователи НИУ ВШЭ — Пермь. Подробнее — в материале IQ Media.
10 августа 2026 г.
Ученые НИУ ВШЭ выяснили, почему любители сладкого чаще делают импульсивный выбор
Любовь к сладкому может быть связана не только с пищевыми привычками, но и с тем, как человек принимает решения. Исследователи НИУ ВШЭ объяснили, почему любители сладкого ведут себя импульсивно: дело не в стремлении получить все немедленно, а в нежелании мириться с неопределенностью. Результаты могут помочь улучшить терапию зависимостей. Результаты исследования опубликованы в журнале Frontiers in Psychology.
10 августа 2026 г.
«Научный бэкграунд помогает принимать более обоснованные решения»
Преподаватель Института демографии им. А.Г. Вишневского Артур Петросян и в жизни, и в работе ищет неочевидные решения. В интервью проекту «Молодые ученые Вышки» он рассказал о важности масштаба в статистике, практической пользе науки, умении переключаться и поиске неочевидных траекторий в городе и в профессии.

 

Нашли опечатку?
Выделите её, нажмите Ctrl+Enter и отправьте нам уведомление. Спасибо за участие!

Публикации
  • Книги
  • Статьи
  • Главы в книгах
  • Препринты
  • Верификация публикаций
  • Расширенный поиск
  • Правила использования материалов
  • Наука в ВШЭ

?

Обзор выпуклой оптимизации марковских процессов принятия решений

Компьютерные исследования и моделирование. 2023. Т. 15. № 2. С. 329–353.
Руденко В. Д., Юдин Н. Е., Васин А. А.

В данной статье проведен обзор как исторических достижений, так и современных результатов в области марковских процессов принятия решений (Markov Decision Process, MDP) и выпуклой оптимизации. Данный обзор является первой попыткой освещения на русском языке области обучения с подкреплением в контексте выпуклой оптимизации. Рассматриваются фундаментальное уравнение Беллмана и построенные на его основе критерии оптимальности политики — стратегии, принимающие решение по известному состоянию среды на данный момент. Также рассмотрены основные итеративные алгоритмы оптимизации политики, построенные на решении уравнений Беллмана. Важным разделом данной статьи стало рассмотрение альтернативы к подходу QQ-обучения — метода прямой максимизации средней награды агента для избранной стратегии от взаимодействия со средой. Таким образом, решение данной задачи выпуклой оптимизации представимо в виде задачи линейного программирования. В работе демонстрируется, как аппарат выпуклой оптимизации применяется для решения задачи обучения с подкреплением (Reinforcement Learning, RL). В частности, показано, как понятие сильной двойственности позволяет естественно модифицировать постановку задачи RL, показывая эквивалентность между максимизацией награды агента и поиском его оптимальной стратегии. В работе также рассматривается вопрос сложности оптимизации MDP относительно количества троек «состояние–действие–награда», получаемых в результате взаимодействия со средой. Представлены оптимальные границы сложности решения MDP в случае эргодического процесса с бесконечным горизонтом, а также в случае нестационарного процесса с конечным горизонтом, который можно перезапускать несколько раз подряд или сразу запускать параллельно в нескольких потоках. Также в обзоре рассмотрены последние результаты по уменьшению зазора нижней и верхней оценки сложности оптимизации MDP с усредненным вознаграждением (Averaged MDP, AMDP). В заключение рассматриваются вещественнозначная параметризация политики агента и класс градиентных методов оптимизации через максимизацию QQ-функции ценности. В частности, представлен специальный класс MDP с ограничениями на ценность политики (Constrained Markov Decision Process, CMDP), для которых предложен общий прямодвойственный подход к оптимизации, обладающий сильной двойственностью.

Научное направление: Математика Компьютерные науки
Язык: русский
Полный текст
DOI
Текст на другом сайте
Ключевые слова: линейное программированиеlinear programmingвыпуклая оптимизацияQ-Learningconvex optimizationMDPpolicy gradient methodsMDPQ-обучениеметоды градиента политики
Похожие публикации
Трубочкина, Н. К. Основы технологии производства и машинное обучение : учебник для вузов / Н. К. Трубочкина. — Москва : Издательство Юрайт, 2026. — 383 с. — (Высшее образование). — ISBN 978-5-534-22010-0.
Трубочкина Н. К., М.: Издательство «Юрайт», 2026.
Учебник  посвящен формированию у студентов целостного представления о современных производственных процессах и методах их анализа и управления на основе технологий машинного обучения. В условиях четвертой промышленной революции, когда традиционные инженерные дисциплины неразрывно переплетаются с интеллектуальными методами обработки данных, возникает потребность в специалистах, способных интегрировать знания из обеих областей. Настоящий учебник призван удовлетворить эту потребность, предлагая ...
Добавлено: 8 августа 2026 г.
Maps preserving two small values of λ-th upper scrambling index
Kulev Y., Максаев А. М., Промыслов В. В., Linear Algebra and its Applications 2026 Vol. 730 P. 51–72
Добавлено: 7 августа 2026 г.
On the Matchings-Jack and Hypermap-Jack Conjectures for Labelled Matchings and Star Hypermaps
Kanunnikov A., Промыслов В. В., Vassilieva E., Electronic Journal of Combinatorics 2024 Vol. 31 No. 3 Article P3.6
Добавлено: 7 августа 2026 г.
WWW '23 Companion: Companion Proceedings of the ACM Web Conference 2023
Фирсанова В. И., ACM, 2026.
Добавлено: 4 августа 2026 г.
Joint Proceedings of the ESWC 2025 Workshops and Tutorials co-located with 22nd Extended Semantic Web Conference (ESWC 2025), Portorož, Slovenia, June 1-2, 2025.
Фирсанова В. И., Хлусова Я. К., CEUR Workshop Proceedings, 2025.
Добавлено: 4 августа 2026 г.
From hyperbolic to complex Euler integrals
Spiridonov V. P., Belousov N. M., Sarkissian G. A., Analysis and Mathematical Physics 2026 Vol. 16 Article 96
Добавлено: 4 августа 2026 г.
Flexibility criterion for affine horospherical varieties
Гайфуллин С. А., Киктева В. В., Results in Mathematics 2026 Vol. 81 No. 5 Article 146
Добавлено: 3 августа 2026 г.
О полуортогональных разложениях производных категорий диаграммных схем
Лунц В. А., Функциональный анализ и его приложения 2026 Т. 60 № 3 С. 127–129
Доказано, что канонические полуортогональные разложения производной категории диаграммной схемы индуцируют аналогичные разложения подкатегории совершенных комплексов. ...
Добавлено: 3 августа 2026 г.
Mathematical methods of reinforcement learning
Беломестный Д. В., Гасников А. В., Гладин Е. Л. и др., Russian Mathematical Surveys 2026 Vol. 81 No. 4(490) P. 3–90
Добавлено: 3 августа 2026 г.
Чеповский А.М. Анализ корпусов текстов на естественных языках. Математические методы. Учебное пособие – М.: Мастерская Печати Идей, 2026. – 274 с.: илл.
Чеповский А. М., Мастерская Печати Идей, 2026.
В учебном пособии представлены методы и алгоритмы автоматического анализа корпусов текстов на естественных языках. Предназначено для изучающих методов обработки текстов на естественных языках и создания обучающих массивов текстов.  Для студентов, аспирантов и научных работников, изучающих методы компьютерной лингвистики и обработку текстов. ...
Добавлено: 1 августа 2026 г.
Sums Related to Euler's Totient Function
A. Radomskii, Mathematical notes 2026 Vol. 119 No. 6 P. 1136–1147
Добавлено: 31 июля 2026 г.
Квадратичный закон взаимности и его обобщения
Абызов А. Н., Буутай П. Н., Математика и теоретические компьютерные науки 2026 Т. 4 № 2 С. 4–75
Статья носит обзорно-методический характер и посвящена развитию идей Е.И. Золотарёва, заложенных в его подходе к доказательству квадратичного закона взаимности (1872 г.). Мы рассматриваем расширения подхода Золотарёва на абстрактные числовые кольца, приведенные в работе А. Бруньята и П.Л. Кларка (2015 г.), и на конечные группы, изученные в статье У. Дьюка и К. Хопкинс (2005 г.). Также ...
Добавлено: 30 июля 2026 г.
Three Algorithms for Merging Hierarchical Navigable Small World Graphs
Пономаренко А. А., / Series Computer Science "arxiv.org". 2025.
Добавлено: 30 июля 2026 г.
Профессиональная верификация: Руководство по продвинутой функциональной верификации
Уилкокс П., Романов А. Ю., М.: ДМК Пресс, 2025.
Книга, которую вы держите в руках, продолжает серию «Книжная полка истового инженера», которая издается при поддержке компании YADRO. Данная книга представляет собой учебник по теоретическим основам продвинутой функциональной верификации и содержит лучшие практики, используемые в настоящее время. В ней подробно описана унифицированная методология верификации (UVM) и раскрыты такие темы, как функциональный виртуальный прототип, функциональное покрытие, утверждения, формальная верификация, тестбенчи, косимуляция, эмуляция, аппаратное ...
Добавлено: 30 июля 2026 г.
EEG evidence for reproducible neural states during Buddhist Highest Yoga Tantra meditation
Mikhaylets E. V., Razorenova A. М., Chernyshev V. L. и др., Scientific Reports 2026 Vol. 16 Article 23560
Добавлено: 29 июля 2026 г.
Произведения Масси и соотношения в когомологиях алгебр Стинрода
Попеленский Ф. Ю., Математический сборник 2026 Т. 217 № 2 С. 108–153
В недавней работе В. М. Бухштабера и автора была введена новая структура в когомологиях алгебр Хопфа в терминах спектральной последовательности Бухштабера (Bss). В классической алгебре Стинрода A2 имеется важная подалгебра Хопфа A(1), когомологии которой давно известны. В настоящей работе обсуждаемая структура на этих когомологиях полностью вычислена. В рамках демонстрации методов Bss решена обратная задача: получено новое ...
Добавлено: 28 июля 2026 г.
Exploring New Frontiers in Vertical Federated Learning: the Role of Saddle Point Reformulation
Beznosikov A., Kormakov G., Grigorievskiy A. и др., Journal of Optimization Theory and Applications 2026 Vol. 209 Article 18
Добавлено: 17 июня 2026 г.
On Linear Convergence in Smooth Convex-Concave Bilinearly-Coupled Saddle-Point Optimization: Lower Bounds and Optimal Algorithms
Бородич Е. Д., Гасников А. В., Kovalev D., , in: Volume 267: International Conference on Machine Learning, 13-19 July 2025, Vancouver Convention Center, Vancouver, CanadaVol. 267.: [б.и.], 2025. P. 5045–5100.
Добавлено: 18 ноября 2025 г.
On the problem of optimal fair exchange
Колесников А. В., Попова С. Н., / Series arXiv "math". 2024.
Добавлено: 20 декабря 2024 г.
Solving Convex Min-Min Problems with Smoothness and Strong Convexity in One Group of Variables and Low Dimension in the Other
Гладин Е. Л., Алкуса М., Гасников А. В., Automation and Remote Control 2021 Vol. 82 P. 1679–1691
Добавлено: 29 ноября 2024 г.
Vaidya’s method for convex stochastic optimization problems in small dimension
Гладин Е. Л., Гасников А. В., Ermakova E., Mathematical notes 2022 Vol. 112 No. 1 P. 183–190
Добавлено: 29 ноября 2024 г.
Accuracy Certificates for Convex Minimization with Inexact Oracle
Гладин Е. Л., Гасников А. В., Двуреченский П. Е., Journal of Optimization Theory and Applications 2025 Vol. 204 No. 1 Article 1
Accuracy certificates for convex minimization problems allow for online verification of the accuracy of approximate solutions and provide a theoretically valid online stopping criterion. When solving the Lagrange dual problem, accuracy certificates produce a simple way to recover an approximate primal solution and estimate its accuracy. In this paper, we generalize accuracy certificates for the ...
Добавлено: 29 ноября 2024 г.
Метод эллипсоидов для задач выпуклой стохастической оптимизации малой размерности
Гладин Е. Л., Зайнуллина К. Э., Компьютерные исследования и моделирование 2021 Т. 13 № 6 С. 1137–1147
В статье рассматривается задача минимизации математического ожидания выпуклой функции. Задачи такого вида повсеместны в машинном обучении, а также часто возникают в ряде других приложений. На практике для их решения обычно используются процедуры типа стохастического градиентного спуска (SGD). В нашей работе предлагается решать такие задачи с использованием метода эллипсоидов с мини-батчингом. Алгоритм имеет линейную скорость сходимости ...
Добавлено: 29 ноября 2024 г.
Breaking the Heavy-Tailed Noise Barrier in Stochastic Optimization Problems
Пучкин Н. А., Горбунов Э. А., Kutuzov N. и др., , in: Proceedings of The 27th International Conference on Artificial Intelligence and Statistics (AISTATS 2024), 2-4 May 2024, Palau de Congressos, Valencia, Spain. PMLR: Volume 238Vol. 238.: Valencia: PMLR, 2024. P. 856–864.
Добавлено: 22 апреля 2024 г.
  • О ВЫШКЕ
  • Цифры и факты
  • Руководство и структура
  • Устойчивое развитие в НИУ ВШЭ
  • Преподаватели и сотрудники
  • Корпуса и общежития
  • Закупки
  • Обращения граждан в НИУ ВШЭ
  • Фонд целевого капитала
  • Противодействие коррупции
  • Сведения о доходах, расходах, об имуществе и обязательствах имущественного характера
  • Сведения об образовательной организации
  • Людям с ограниченными возможностями здоровья
  • Единая платежная страница
  • Работа в Вышке
  • ОБРАЗОВАНИЕ
  • Лицей
  • Довузовская подготовка
  • Олимпиады
  • Прием в бакалавриат
  • Вышка+
  • Прием в магистратуру
  • Аспирантура
  • Дополнительное образование
  • Центр развития карьеры
  • Бизнес-инкубатор ВШЭ
  • Образовательные партнерства
  • Обратная связь и взаимодействие с получателями услуг
  • НАУКА
  • Научные подразделения
  • Исследовательские проекты
  • Мониторинги
  • Диссертационные советы
  • Защиты диссертаций
  • Академическое развитие
  • Конкурсы и гранты
  • Внешние научно-информационные ресурсы
  • РЕСУРСЫ
  • Библиотека
  • Издательский дом ВШЭ
  • Книжный магазин «БукВышка»
  • Типография
  • Медиацентр
  • Журналы ВШЭ
  • Публикации
  • http://www.minobrnauki.gov.ru/
    Министерство науки и высшего образования РФ
  • https://edu.gov.ru/
    Министерство просвещения РФ
  • https://elearning.hse.ru/mooc
    Массовые открытые онлайн-курсы
  • НИУ ВШЭ1993–2026
  • Адреса и контакты
  • Условия использования материалов
  • Политика конфиденциальности
  • Правила применения рекомендательных технологий в НИУ ВШЭ
  • Карта сайта
Редактору