Динамический масштабируемый градиентный спуск для стабильного дообучения в задачах классификации

Dynamic Scaled Gradient Descent for Stable Fine-Tuning for Classifications
Nghia Bui, Lijing Wang
2026-04-30

несбалансированность классовколлапс оптимизациидинамический масштабируемый градиентный спускдообучение предобученных моделеймасштабирование градиентов
Дообучение предобученных моделей стало стандартным подходом для адаптации предобученных знаний и повышения точности на новых разреженных и несбалансированных наборах данных. Однако возникают проблемы, когда оптимизация переходит в коллапсное состояние, при котором модель «застревает», что приводит к ухудшению качества и нестабильному обучению. Одной из возможных причин является взаимная нейтрализация градиентов между обучающими примерами. Для решения этой проблемы мы предлагаем новый алгоритм — динамический масштабируемый градиентный спуск (DSGD), который напрямую модифицирует градиенты, возвращаемые обучающими примерами, масштабируя в меньшую сторону градиенты правильно классифицированных примеров с помощью динамического множителя. Эта стратегия обладает как теоретическими, так и эмпирическими преимуществами для повышения стабильности обучения. Эксперименты на различных эталонных наборах данных, охватывающих множественные задачи и крупные предобученные модели, показывают, что наш метод последовательно снижает дисперсию показателей и превосходит по точности существующие подходы.
1
На различных бенчмарках, задачах и больших предварительно обученных моделях DSGD последовательно снижает дисперсию производительности по сравнению с существующими подходами.
2
В представленных экспериментах DSGD также обеспечивает более высокую точность, чем существующие методы.
3
DSGD демонстрирует теоретические и эмпирические преимущества для повышения стабильности обучения при дообучении.
4
Дообучение предварительно обученных моделей на разреженных, несбалансированных наборах данных может приводить к коллапсу из‑за отмены градиентов между примерами, что ухудшает качество и нестабильно обучает модель.
5
В статье предложен алгоритм Dynamic Scaled Gradient Descent (DSGD), который уменьшает масштаб градиентов правильно классифицированных примеров с помощью динамического масштабирующего множителя для снижения отмены градиентов.

Донастройка предварительно обученных классификационных моделей

Стабильность и точность обучения при отмене градиентов во время донастройки, решаемые динамическим масштабированием градиентов по примеру (уменьшение градиентов правильно классифицированных примеров) для снижения дисперсии результатов и повышения точности

Publication Details
Publication Date
2026-04-30
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Nghia Bui
Lijing Wang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%