OBRABOTKAMETALLOV Vol. 28 No. 2 2026 323 MATERIAL SCIENCE функции потерь L2. Максимальная глубина деревьев – 6, скорость обучения (learning rate) – 0,05 для баланса смещения и дисперсии. Метод эффективен на небольших выборках благодаря возможности ранней остановки при тестировании на удерживаемых фолдах [15]. AdaBoost – адаптивный бустинг-ансамбль из 200 деревьев, перераспределяющий веса ошибочно предсказанных образцов, что заставляет алгоритм последовательно фокусироваться на сложных примерах. Вклад последующих деревьев регулируется скоростью обучения 0,05. Сообщается, что AdaBoost демонстрирует высокую обобщающую способность на малых табличных данных [16]. Случайный лес (Random forest) – бэггинг-модель из 200 деревьев решений, обученных на случайных подвыборках данных и случайных наборах признаков. Параметры: максимальная глубина – 15, минимальное количество образцов для разбиения узла (min_samples_split) – 5. В отличие от бустинга случайный лес усредняет результаты независимых деревьев, уменьшая дисперсию и сохраняя интерпретируемость. Оценка ошибки «вне мешка» (out-of-bag) дает объективные показатели перекрестной проверки. Метод устойчив на малых выборках и не страдает от проблем сходимости, характерных для глубокого обучения [17]. Выбор гиперпараметров. Гиперпараметры всех ML-моделей выбраны на основе комбинации рекомендаций из литературы и предварительных экспериментов. Для градиентного бустинга принято 200 деревьев, скорость обучения 0,05 и максимальная глубина 6, что согласуется с рекомендациями Фридмана (2001) для баланса смещения и дисперсии на малых выборках. Для случайного леса использовано 200 деревьев, глубина 15 и минимальное количество образцов для разбиения узла (min_samples_split) 5 – это типичные настройки для табличных наборов данных малого и среднего размера. Для AdaBoost выбрано 200 слабых классификаторов со скоростью обучения 0,05 для обеспечения постепенной сходимости. Формальный поиск по сетке (grid search) не проводился, поскольку исчерпывающая настройка гиперпараметров на малом наборе данных (n = 28) может привести к переобучению на блоках данных для проверки (validation folds). Анализ чувствительности с варьированием количества деревьев (например, 50, 100, 200, 500) также не выполнялся. Однако консервативная скорость обучения 0,05 по своей сути ограничивает предельный вклад поздних деревьев, снижая чувствительность к точному числу деревьев. Вместо системного подбора использованы консервативные значения гиперпараметров, обоснованные в литературе по ансамблевым методам для небольших выборок. Каждая модель машинного обучения оценивалась с применением стратифицированной пятикратной перекрестной проверки (KFold, n_splits = 5, shuffl e = True, random_state = 42). Такой протокол обеспечивает объективную оценку обобщающей способности модели на небольших наборах данных: выборка из 28 наблюдений разделяется на пять непересекающихся блоков данных (folds), каждый из которых поочередно выступает в роли проверочного. Это позволяет тестировать модель на данных, не участвовавших в обучении. Для оценки качества прогнозирования использовались три взаимодополняющие метрики, рассчитываемые по следующим формулам: 2 2 1 2 1 (z ) 1 (z ) n i i i n i i i z R z = = − = − − ∑ ∑ , (4) 2 1 1 (z ) n i i i RMSE z n = = − ∑ , (5) 1 1 n i i i MAE z z n = = − ∑ , (6) где n – количество образцов; zᵢ – фактическое значение; i z – прогнозируемое значение. Коэффициент детерминации R2 измеряет долю дисперсии интенсивности изнашивания, объясняемую моделью. Среднеквадратичная ошибка (RMSE) придает больший вес крупным индивидуальным ошибкам прогнозирования по сравнению со средней абсолютной ошибкой (MAE). Таким образом, эти две метрики взаимодополняют друг друга, позволяя охарактеризовать как систематические отклонения, так и влияние выбросов. Все метрики представлены в виде среднего значения плюс-минус стандартное отклонение по пяти блокам данных (folds).
RkJQdWJsaXNoZXIy MTk0ODM1