?
RL-ABC: Reinforcement learning for accelerator beamline control
Мы представляем RLABC (Reinforcement Learning for Accelerator Beamline Control) — фреймворк с открытым исходным кодом на языке Python, который автоматически преобразует стандартные конфигурации пучковых линий, используемые в Elegant, в среды для обучения с подкреплением. RLABC интегрируется с широко используемым программным комплексом моделирования динамики пучка Elegant посредством интерфейсов на основе SDDS, что позволяет исследователям применять современные алгоритмы обучения с подкреплением для оптимизации пучковых линий с минимальными затратами на разработку специализированных компонентов, связанных с RL.
Валидация на тестовой пучковой линии, созданной на основе инжекционного комплекса ВЭПП-5 и включающей 37 управляющих параметров, 11 квадруполей и 4 диполя, показала, что разработанный фреймворк успешно обеспечивает применение методов обучения с подкреплением для оптимизации параметров пучковой линии. Агент на основе алгоритма Deep Deterministic Policy Gradient (DDPG) достиг коэффициента прохождения частиц 70%.
Полная версия фреймворка, включая конфигурационные файлы и примеры в формате Jupyter Notebook, доступна как программное обеспечение с открытым исходным кодом с целью упрощения его использования и дальнейшего развития исследований в данной области.