Динамический масштабируемый градиентный спуск для стабильного дообучения в задачах классификации
Dynamic Scaled Gradient Descent for Stable Fine-Tuning for Classifications
2026-04-30
SCID: 54.1/3zve7pxx
Discuss with AI
несбалансированность классовколлапс оптимизациидинамический масштабируемый градиентный спускдообучение предобученных моделеймасштабирование градиентов
Figures from the paper
Abstract (AI)
Дообучение предобученных моделей стало стандартным подходом для адаптации предобученных знаний и повышения точности на новых разреженных и несбалансированных наборах данных. Однако возникают проблемы, когда оптимизация переходит в коллапсное состояние, при котором модель «застревает», что приводит к ухудшению качества и нестабильному обучению. Одной из возможных причин является взаимная нейтрализация градиентов между обучающими примерами. Для решения этой проблемы мы предлагаем новый алгоритм — динамический масштабируемый градиентный спуск (DSGD), который напрямую модифицирует градиенты, возвращаемые обучающими примерами, масштабируя в меньшую сторону градиенты правильно классифицированных примеров с помощью динамического множителя. Эта стратегия обладает как теоретическими, так и эмпирическими преимуществами для повышения стабильности обучения. Эксперименты на различных эталонных наборах данных, охватывающих множественные задачи и крупные предобученные модели, показывают, что наш метод последовательно снижает дисперсию показателей и превосходит по точности существующие подходы.
Key Findings
1
На различных бенчмарках, задачах и больших предварительно обученных моделях DSGD последовательно снижает дисперсию производительности по сравнению с существующими подходами.
2
В представленных экспериментах DSGD также обеспечивает более высокую точность, чем существующие методы.
3
DSGD демонстрирует теоретические и эмпирические преимущества для повышения стабильности обучения при дообучении.
4
Дообучение предварительно обученных моделей на разреженных, несбалансированных наборах данных может приводить к коллапсу из‑за отмены градиентов между примерами, что ухудшает качество и нестабильно обучает модель.
5
В статье предложен алгоритм Dynamic Scaled Gradient Descent (DSGD), который уменьшает масштаб градиентов правильно классифицированных примеров с помощью динамического масштабирующего множителя для снижения отмены градиентов.
Research Object
Донастройка предварительно обученных классификационных моделей
Research Subject
Стабильность и точность обучения при отмене градиентов во время донастройки, решаемые динамическим масштабированием градиентов по примеру (уменьшение градиентов правильно классифицированных примеров) для снижения дисперсии результатов и повышения точности
Publication Details
Publication Date
2026-04-30
Journal
Publisher
ISSN
Cited by
0
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest