?
Mathematical methods of reinforcement learning
Russian Mathematical Surveys. 2026. Vol. 81. No. 4(490). P. 3–90.
Беломестный Д. В., Гасников А. В., Гладин Е. Л., Наумов А. А., Rubtsov Artemy, Sapronov Y., Тяпкин Д. Н., Юдин Н. Е.
Язык:
английский
Ключевые слова: Markov Decision Processesдинамическое программирование Беллманаdynamic programmingвычислительная и алгоритмическая сложностьMulti-armed banditssample complexitypolicy gradientpolicy gradient methodsметоды градиента политикиPreference OptimizationDiscounted Markov Decision Process (DMDP)Average Reward Markov Decision Process (AMDP)Constrained Markov Decision Process (CMDP)full-knowledge settinggenerative settingmodel-free reinforcement learningforward model settingуправляемый марковский процессдисконтированный управляемый марковский процессуправляемый марковский процесс с усреднённой наградойуправляемый марковский процесс с ограничениямимногорукий бандит
Джонов А. Т., Авдошин С. М., Информационные технологии 2026 Т. 32 № 8 С. 421–427
В данном систематическом обзоре представлен анализ методологии Вайб-кодинг (Vibe Coding) — современно-го подхода к итеративному процессу разработки программного обеспечения с помощью больших языковых моделей (БЯМ). Инструменты генерации кода транформируют написание ПО, позволяя программисту формулировать задачи и описывать желаемое поведение кода на естественном языке, в то время как БЯМ генерирует соответ-ствующий запросам исходный код. Обзор систематиматизирует ...
Добавлено: 25 августа 2026 г.
Блудов М. В., Journal of Fixed Point Theory and Applications 2026 No. 28 Article 73
Добавлено: 25 августа 2026 г.
Мельман А. С., Евсютин О. О., Journal of the Franklin Institute 2026 Vol. 363 No. 15 Article 109005
Добавлено: 25 августа 2026 г.
L.I. Kuzmina, Osipov , Y. V., Kolokoltseva, T. N., Advances in Water Resources 2026 Vol. 213 Article 105335
Добавлено: 25 августа 2026 г.
Liudmila I. Kuzmina, Osipov, Y. V., International Journal for Computational Civil and Structural Engineering 2026 Vol. 22 No. 2 P. 138–148
Добавлено: 25 августа 2026 г.
L.I.Kuzmina, Osipov Y. V., Mathematical notes, ISSN 0001-4346 2025 Vol. 116 No. 6 P. 1251–1261
Добавлено: 25 августа 2026 г.
IEEE, 2026.
Добавлено: 24 августа 2026 г.
Лукьяненко Д. В., Рагимова А. А., Мухорина А. и др., European Physical Journal: Special Topics 2026 P. 1–24
Добавлено: 20 августа 2026 г.
CEUR-WS.org, 2026.
Добавлено: 20 августа 2026 г.
Добавлено: 20 августа 2026 г.
Association for Computational Linguistics, 2026.
Добавлено: 19 августа 2026 г.
IEEE Advancing Technology for Humanity, 2025.
Добавлено: 19 августа 2026 г.
Власенко Д. В., Саранская И. М., Захаров Д. Г., European Physical Journal: Special Topics 2026 P. 1–16
Гиперграфы предоставляют естественную систему для представления нейрофизиологических взаимодействий, распределённых по наборам датчиков. Ключевой методический вопрос заключается в том, каким образом следует определять гиперрёбра на основе частотно-разрешающих данных электроэнцефалографии и магнитоэнцефалографии (ЭЭГ/МЭГ). Мы предлагаем стратегию построения гиперграфа, в которой гиперрёбра получаются из канонической когерентности (caCOH) — расширения когерентности, которое оценивает степень связи между многомерными пространствами сигналов. Насколько ...
Добавлено: 18 августа 2026 г.
Borisov D., Katzarkov Ludmil, Sheshmani A. и др., American Journal of Mathematics 2026 Vol. 148 No. 4 P. 1075–1101
Добавлено: 18 августа 2026 г.
Мошкин А. С., Fedorov M., Arlazarov V. и др., Algorithms 2026 Vol. 19 No. 7 Article 523
Технологии искусственного интеллекта (ИИ), активно развивающиеся в современной медицине, повышают скорость и качество оказания медицинской помощи. Данная статья преимущественно направлена на демонстрацию применения различных вариантов компьютерного анализа клинических изображений для решения практических задач повышения эффективности рутинной диагностики с использованием ретроспективного анализа, а также на показ потенциала его широкого внедрения (благодаря масштабируемости архитектуры) в практическое здравоохранение ...
Добавлено: 17 августа 2026 г.
CHEN Y., Howlett R. J., Tanaka S. и др., Springer, 2026.
Добавлено: 16 августа 2026 г.
Богатырев А. Б., Математический сборник 2023 Т. 214 № 3 С. 106–119
Рассматривается клеточное разбиение пространства модулей вещественных кривых рода 2 с отмеченной точкой на единственном вещественном овале. Клетки перечисляются определенными графами, веса которых описывают комплексную структуру на кривой. Показано, что стягивание ребра графа приводит к корневой особенности естественного отображения из весов графа в пространство модулей кривых. ...
Добавлено: 14 августа 2026 г.
Богатырев А. Б., Gendron Q., Успехи математических наук 2023 Т. 78 № 1 С. 209–210
Уравнение Пелля-Абеля — это функциональное уравнение вида P²-DQ² = 1, с заданным многочленом D, свободным от квадратов, и неизвестными многочленами P и Q. Мы показываем, что пространство уравнений Пелля-Абеля с фиксированными степенями D и примитивным решением P является комплексным многообразием. Мы описываем его связные компоненты с помощью эффективно вычислимого инварианта. ...
Добавлено: 14 августа 2026 г.
Богатырев А. Б., Transactions of the Moscow Mathematical Society 2024 Vol. 85 No. 2 P. 323–337
Добавлено: 14 августа 2026 г.
Добавлено: 10 ноября 2025 г.
Сапронов Ю. Ф., Юдин Н. Е., Computational Mathematics and Mathematical Physics 2025 Vol. 65 No. 3 P. 567–581
We continue to develop the concept of studying the ε-optimal policy for Average Reward Markov Decision Processes (AMDP) by reducing it to Discounted Markov Decision Processes (DMDP). Existing research often stipulates that the discount factor must not fall below a certain threshold. Typically, this threshold is close to one, and as is well-known, iterative methods ...
Добавлено: 10 июня 2025 г.
Руденко В. Д., Юдин Н. Е., Васин А. А., Компьютерные исследования и моделирование 2023 Т. 15 № 2 С. 329–353
В данной статье проведен обзор как исторических достижений, так и современных результатов в области марковских процессов принятия решений (Markov Decision Process, MDP) и выпуклой оптимизации. Данный обзор является первой попыткой освещения на русском языке области обучения с подкреплением в контексте выпуклой оптимизации. Рассматриваются фундаментальное уравнение Беллмана и построенные на его основе критерии оптимальности политики — ...
Добавлено: 29 ноября 2024 г.
Гладин Е. Л., Lavrik-Karmazin M., Zainullina K. и др., Proceedings of Machine Learning Research 2023 Vol. 206 P. 11506–11533
Добавлено: 6 ноября 2024 г.