Автоматизація процесу моделювання та прогнозування великих експериментальних даних

Loading...
Thumbnail Image

Date

Journal Title

Journal ISSN

Volume Title

Publisher

Abstract

UA : Робота викладена на 68 сторінках друкованого тексту, містить 38 рисунків, 1 таблицю, 51 джерел, 1 додаток. Об’єкт дослідження: процес моделювання та прогнозування на великих експериментальних наборах даних. Мета роботи: розробити та обґрунтувати методику та програмне рішення для автоматизації повного циклу моделювання та прогнозування великих експериментальних даних із забезпеченням відтворюваності та масштабованості. Методи дослідження: аналітичний, формальний, методи машинного навчання, оптимізація гіперпараметрів, експериментальний. У роботі виконано аналіз проблематики автоматизації ML-процесу для великих даних, спроєктовано архітектуру рішення на Python із використанням Pipeline та ColumnTransformer, ансамблю LightGBM, журналювання експериментів у MLflow. Реалізовано автоматизований конвеєр: зчитування та економне типізування даних, інженерія ознак, крос-валідаційне порівняння моделей, HPO на підвибірці з подальшим донавчанням і ранньою зупинкою, підсумкова оцінка на holdout-вибірці. Експерименти показали покращення метрик при збільшенні навчальної вибірки до ~50k і плато якості надалі, також виявлено важкохвостий характер цільової змінної (RMSE ≫ MAE). Таким чином, практичнною цінністю є відтворюваний шаблон автоматизації ML-експериментів, придатний до розширення.
EN : The work is presented on 68 pages of printed text, 38 figures, 51 references, 1 supplement. The object of the study is the process of modeling and forecasting on large experimental data sets. The aim of the study is to develop and justify a methodology and software solution for automating the full cycle of modeling and forecasting large experimental data with reproducibility and scalability. The methods of research are are analytical, formal, machine learning methods, hyperparameter optimization, experimental. The paper analyzes the problems of automating the ML process for large data, designs a solution architecture in Python using Pipeline and ColumnTransformer, the LightGBM ensemble, and experiment logging in MLflow. An automated pipeline has been implemented: data reading and economical typing, feature engineering, cross-validation model comparison, HPO on a subsample with subsequent retraining and early stopping, and final evaluation on a holdout sample. Experiments showed improvement in metrics when the training sample was increased to ~50k and a plateau in quality thereafter, as well as the heavy-tailed nature of the target variable (RMSE ≫ MAE). Thus, the practical value is a reproducible ML experiment automation template that is suitable for expansion.

Description

Жутовський Г. Є. Автоматизація процесу моделювання та прогнозування великих експериментальних даних : кваліфікаційна робота магістра спеціальності 113 "Прикладна математика" / наук. керівник В. В. Леонтьєва. Запоріжжя : ЗНУ, 2025. 68 с.

Citation

Endorsement

Review

Supplemented By

Referenced By