• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • A
  • A
  • A
  • A
  • A
Обычная версия сайта
  • RU
  • EN
  • Национальный исследовательский университет «Высшая школа экономики»
  • Публикации ВШЭ
  • Статьи
  • Обзор выпуклой оптимизации марковских процессов принятия решений
  • RU
  • EN
Расширенный поиск
Высшая школа экономики
Национальный исследовательский университет
Приоритетные направления
  • бизнес-информатика
  • государственное и муниципальное управление
  • гуманитарные науки
  • инженерные науки
  • компьютерно-математическое
  • математика
  • менеджмент
  • право
  • социология
  • экономика
по году
  • 2027
  • 2026
  • 2025
  • 2024
  • 2023
  • 2022
  • 2021
  • 2020
  • 2019
  • 2018
  • 2017
  • 2016
  • 2015
  • 2014
  • 2013
  • 2012
  • 2011
  • 2010
  • 2009
  • 2008
  • 2007
  • 2006
  • 2005
  • 2004
  • 2003
  • 2002
  • 2001
  • 2000
  • 1999
  • 1998
  • 1997
  • 1996
  • 1995
  • 1994
  • 1993
  • 1992
  • 1991
  • 1990
  • 1989
  • 1988
  • 1987
  • 1986
  • 1985
  • 1984
  • 1983
  • 1982
  • 1981
  • 1980
  • 1979
  • 1978
  • 1977
  • 1976
  • 1975
  • 1974
  • 1973
  • 1972
  • 1971
  • 1970
  • 1969
  • 1968
  • 1967
  • 1966
  • 1965
  • 1964
  • 1963
  • 1958
  • еще
Тематика
Новости
28 августа 2026 г.
МИЭМ ВШЭ и МИЭТ договорились о научном сотрудничестве
26 августа Московский институт электроники и математики им. А.Н. Тихонова (МИЭМ) ВШЭ и Национальный исследовательский университет «Московский институт электронной техники» (МИЭТ) подписали договор о сотрудничестве. Соглашение направлено на развитие совместных исследований в области физики, перспективного материаловедения и электроники, объединяющих экспериментальные и вычислительные подходы, выполнение совместных опытно-конструкторских работ, а также подготовку заявок на российские и международные научные гранты.
25 августа 2026 г.
Исследователи ВШЭ сравнили рекомендательные алгоритмы по правилам спортивного турнира
Исследователи Института искусственного интеллекта и цифровых наук ФКН НИУ ВШЭ разработали подход, который помогает эффективнее подбирать рекомендательные алгоритмы. В нем разные методы попарно соревнуются, а по результатам всех поединков составляется общий рейтинг. Это помогает сократить число алгоритмов, которые нужно проверять при разработке новых сервисов, и сэкономить денежные и временные ресурсы.Исследование было представлено на  32-й конференции ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026).
20 августа 2026 г.
<a>Исследователи НИУ ВШЭ и Сбера научили нейросети лучше угадывать предпочтения пользователей
Институт искусственного интеллекта и цифровых наук ФКН НИУ ВШЭ и Сбер представили новую архитектуру для рекомендательных систем: благодаря объединению двух классов моделей алгоритмы лучше угадывают интересы и потребности пользователей. Препринт работы опубликован на сайте arxiv.org и представлен на летнем фестивале «Урбан ML».

 

Нашли опечатку?
Выделите её, нажмите Ctrl+Enter и отправьте нам уведомление. Спасибо за участие!

Публикации
  • Книги
  • Статьи
  • Главы в книгах
  • Препринты
  • Верификация публикаций
  • Расширенный поиск
  • Правила использования материалов
  • Наука в ВШЭ

?

Обзор выпуклой оптимизации марковских процессов принятия решений

Компьютерные исследования и моделирование. 2023. Т. 15. № 2. С. 329–353.
Руденко В. Д., Юдин Н. Е., Васин А. А.

В данной статье проведен обзор как исторических достижений, так и современных результатов в области марковских процессов принятия решений (Markov Decision Process, MDP) и выпуклой оптимизации. Данный обзор является первой попыткой освещения на русском языке области обучения с подкреплением в контексте выпуклой оптимизации. Рассматриваются фундаментальное уравнение Беллмана и построенные на его основе критерии оптимальности политики — стратегии, принимающие решение по известному состоянию среды на данный момент. Также рассмотрены основные итеративные алгоритмы оптимизации политики, построенные на решении уравнений Беллмана. Важным разделом данной статьи стало рассмотрение альтернативы к подходу QQ-обучения — метода прямой максимизации средней награды агента для избранной стратегии от взаимодействия со средой. Таким образом, решение данной задачи выпуклой оптимизации представимо в виде задачи линейного программирования. В работе демонстрируется, как аппарат выпуклой оптимизации применяется для решения задачи обучения с подкреплением (Reinforcement Learning, RL). В частности, показано, как понятие сильной двойственности позволяет естественно модифицировать постановку задачи RL, показывая эквивалентность между максимизацией награды агента и поиском его оптимальной стратегии. В работе также рассматривается вопрос сложности оптимизации MDP относительно количества троек «состояние–действие–награда», получаемых в результате взаимодействия со средой. Представлены оптимальные границы сложности решения MDP в случае эргодического процесса с бесконечным горизонтом, а также в случае нестационарного процесса с конечным горизонтом, который можно перезапускать несколько раз подряд или сразу запускать параллельно в нескольких потоках. Также в обзоре рассмотрены последние результаты по уменьшению зазора нижней и верхней оценки сложности оптимизации MDP с усредненным вознаграждением (Averaged MDP, AMDP). В заключение рассматриваются вещественнозначная параметризация политики агента и класс градиентных методов оптимизации через максимизацию QQ-функции ценности. В частности, представлен специальный класс MDP с ограничениями на ценность политики (Constrained Markov Decision Process, CMDP), для которых предложен общий прямодвойственный подход к оптимизации, обладающий сильной двойственностью.

Научное направление: Математика Компьютерные науки
Язык: русский
Полный текст
DOI
Текст на другом сайте
Ключевые слова: линейное программированиеlinear programmingвыпуклая оптимизацияQ-Learningconvex optimizationMDPpolicy gradient methodsMDPQ-обучениеметоды градиента политики
Похожие публикации
О подходе к построению последовательности псевдослучайных чисел, основанном на разложениях 𝐸-функций с периодическими коэффициентами
Нестеренко А. Ю., Чирский В. Г., Матвеев В. Ю., Чебышевский сборник 2026 Т. 27 № 2 С. 118–127
В статье приводятся результаты практического исследования статистических свойств некоторых последовательностей, являющихся значениями функций специального вида. ...
Добавлено: 26 августа 2026 г.
Characterizing the Scheduling Performance of 5G NR Base Stations Under Signaling and Data Traffic Constraints
Eduard Sopin, Назарьин А. И., Бегишев В. О. и др., IEEE Transactions on Vehicular Technology 2026 Vol. 75 No. 6 P. 10995–11007
Добавлено: 26 августа 2026 г.
Генерация исходного кода с использованием больших языковых моделей: систематический обзор методологии Вайб-кодинг
Джонов А. Т., Авдошин С. М., Информационные технологии 2026 Т. 32 № 8 С. 421–427
В данном систематическом обзоре представлен анализ методологии Вайб-кодинг (Vibe Coding) — современно-го подхода к итеративному процессу разработки программного обеспечения с помощью больших языковых моделей (БЯМ). Инструменты генерации кода транформируют написание ПО, позволяя программисту формулировать задачи и описывать желаемое поведение кода на естественном языке, в то время как БЯМ генерирует соответ-ствующий запросам исходный код. Обзор систематиматизирует ...
Добавлено: 25 августа 2026 г.
Balanced sets and homotopy invariants of covers
Блудов М. В., Journal of Fixed Point Theory and Applications 2026 No. 28 Article 73
Добавлено: 25 августа 2026 г.
An adaptive image watermarking scheme using cooperation of HBA and RSA metaheuristics
Мельман А. С., Евсютин О. О., Journal of the Franklin Institute 2026 Vol. 363 No. 15 Article 109005
Добавлено: 25 августа 2026 г.
Exact solutions for transport of distributed colloids in porous media
L.I. Kuzmina, Osipov , Y. V., Kolokoltseva, T. N., Advances in Water Resources 2026 Vol. 213 Article 105335
Добавлено: 25 августа 2026 г.
MODEL OF DEEP BED FILTRATION IN A POROUS MEDIUM WITH HETEROGENEOUS POROSITY
Liudmila I. Kuzmina, Osipov, Y. V., International Journal for Computational Civil and Structural Engineering 2026 Vol. 22 No. 2 P. 138–148
Добавлено: 25 августа 2026 г.
Exact Solutions to One-Dimensional Problem of Oil Displacement by Chemical
L.I.Kuzmina, Osipov Y. V., Mathematical notes, ISSN 0001-4346 2025 Vol. 116 No. 6 P. 1251–1261
Добавлено: 25 августа 2026 г.
Proceedings of the 2026 12th International Conference on Control, Decision and Information Technologies (CoDIT) (Italy, Bari, July 13–16, 2026)
IEEE, 2026.
Добавлено: 24 августа 2026 г.
From data to knowledge: artificial intelligence methods for studying comorbidity in electronic health records
Лукьяненко Д. В., Рагимова А. А., Мухорина А. и др., European Physical Journal: Special Topics 2026 P. 1–24
Добавлено: 20 августа 2026 г.
Proceedings of the Generative Code Intelligence Workshop (GeCoIn 2026), co-located with the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026)
CEUR-WS.org, 2026.
Добавлено: 20 августа 2026 г.
MM-PSYCHE: Multimodal Multitask Psychological Characteristic Estimation Through Cross-Domain Semi-Supervised Learning
Рюмина Е. В., Аксёнов А. А., Коряковская Д. О. и др., IEEE Access 2026 Vol. 14 P. 124759–124778
Добавлено: 20 августа 2026 г.
Monomial algebras and G_a^n-equivariant embeddings into toric varieties
Чернов А. Е., European Journal of Mathematics 2026 Vol. 12 Article 48
Добавлено: 19 августа 2026 г.
Proceedings of the 1st Workshop on Linguistic Analysis for Health (HeaLing 2026)
Association for Computational Linguistics, 2026.
Добавлено: 19 августа 2026 г.
Dynamics of Systems, Mechanisms and Machines (Dynamics). International scientific and technical conference
IEEE Advancing Technology for Humanity, 2025.
Добавлено: 19 августа 2026 г.
Hypergraphs from multivariate connectivity: caCOH-based EEG/MEG representation
Власенко Д. В., Саранская И. М., Захаров Д. Г., European Physical Journal: Special Topics 2026 P. 1–16
Гиперграфы предоставляют естественную систему для представления нейрофизиологических взаимодействий, распределённых по наборам датчиков. Ключевой методический вопрос заключается в том, каким образом следует определять гиперрёбра на основе частотно-разрешающих данных электроэнцефалографии и магнитоэнцефалографии (ЭЭГ/МЭГ). Мы предлагаем стратегию построения гиперграфа, в которой гиперрёбра получаются из канонической когерентности (caCOH) — расширения когерентности, которое оценивает степень связи между многомерными пространствами сигналов. Насколько ...
Добавлено: 18 августа 2026 г.
Global shifted potentials for moduli stacks of sheaves on Calabi-Yau four-folds
Borisov D., Katzarkov Ludmil, Sheshmani A. и др., American Journal of Mathematics 2026 Vol. 148 No. 4 P. 1075–1101
Добавлено: 18 августа 2026 г.
Localization in Medical Imaging: A Unified AI Approach for Ovaries, Follicles, and Vertebral Arteries
Мошкин А. С., Fedorov M., Arlazarov V. и др., Algorithms 2026 Vol. 19 No. 7 Article 523
Технологии искусственного интеллекта (ИИ), активно развивающиеся в современной медицине, повышают скорость и качество оказания медицинской помощи. Данная статья преимущественно направлена на демонстрацию применения различных вариантов компьютерного анализа клинических изображений для решения практических задач повышения эффективности рутинной диагностики с использованием ретроспективного анализа, а также на показ потенциала его широкого внедрения (благодаря масштабируемости архитектуры) в практическое здравоохранение ...
Добавлено: 17 августа 2026 г.
Innovation in Medicine and Healthcare
CHEN Y., Howlett R. J., Tanaka S. и др., Springer, 2026.
Добавлено: 16 августа 2026 г.
Mathematical methods of reinforcement learning
Беломестный Д. В., Гасников А. В., Гладин Е. Л. и др., Russian Mathematical Surveys 2026 Vol. 81 No. 4(490) P. 3–90
Добавлено: 3 августа 2026 г.
Exploring New Frontiers in Vertical Federated Learning: the Role of Saddle Point Reformulation
Beznosikov A., Kormakov G., Grigorievskiy A. и др., Journal of Optimization Theory and Applications 2026 Vol. 209 Article 18
Добавлено: 17 июня 2026 г.
On Linear Convergence in Smooth Convex-Concave Bilinearly-Coupled Saddle-Point Optimization: Lower Bounds and Optimal Algorithms
Бородич Е. Д., Гасников А. В., Kovalev D., , in: Volume 267: International Conference on Machine Learning, 13-19 July 2025, Vancouver Convention Center, Vancouver, CanadaVol. 267.: [б.и.], 2025. P. 5045–5100.
Добавлено: 18 ноября 2025 г.
On the problem of optimal fair exchange
Колесников А. В., Попова С. Н., / Series arXiv "math". 2024.
Добавлено: 20 декабря 2024 г.
Solving Convex Min-Min Problems with Smoothness and Strong Convexity in One Group of Variables and Low Dimension in the Other
Гладин Е. Л., Алкуса М., Гасников А. В., Automation and Remote Control 2021 Vol. 82 P. 1679–1691
Добавлено: 29 ноября 2024 г.
  • О ВЫШКЕ
  • Цифры и факты
  • Руководство и структура
  • Устойчивое развитие в НИУ ВШЭ
  • Преподаватели и сотрудники
  • Корпуса и общежития
  • Закупки
  • Обращения граждан в НИУ ВШЭ
  • Фонд целевого капитала
  • Противодействие коррупции
  • Сведения о доходах, расходах, об имуществе и обязательствах имущественного характера
  • Сведения об образовательной организации
  • Людям с ограниченными возможностями здоровья
  • Единая платежная страница
  • Работа в Вышке
  • ОБРАЗОВАНИЕ
  • Лицей
  • Довузовская подготовка
  • Олимпиады
  • Прием в бакалавриат
  • Вышка+
  • Прием в магистратуру
  • Аспирантура
  • Дополнительное образование
  • Центр развития карьеры
  • Бизнес-инкубатор ВШЭ
  • Образовательные партнерства
  • Обратная связь и взаимодействие с получателями услуг
  • НАУКА
  • Научные подразделения
  • Исследовательские проекты
  • Мониторинги
  • Диссертационные советы
  • Защиты диссертаций
  • Академическое развитие
  • Конкурсы и гранты
  • Внешние научно-информационные ресурсы
  • РЕСУРСЫ
  • Библиотека
  • Издательский дом ВШЭ
  • Книжный магазин «БукВышка»
  • Типография
  • Медиацентр
  • Журналы ВШЭ
  • Публикации
  • http://www.minobrnauki.gov.ru/
    Министерство науки и высшего образования РФ
  • https://edu.gov.ru/
    Министерство просвещения РФ
  • https://elearning.hse.ru/mooc
    Массовые открытые онлайн-курсы
  • НИУ ВШЭ1993–2026
  • Адреса и контакты
  • Условия использования материалов
  • Политика обработки персональных данных
  • Правила применения рекомендательных технологий в НИУ ВШЭ
  • Карта сайта
Редактору