Аддитивная логистическая регрессия: статистический взгляд на бустинг (с обсуждением и ответом авторов)
Additive logistic regression: a statistical view of boosting (With discussion and a rejoinder by the authors)
2000-04-01
SCID: 54.1/u5k7vvdz
Discuss with AI
Аддитивная логистическая регрессияАддитивное моделированиеБустингБиномиальная (Бернулли) правдоподобиеМультиномиальное правдоподобие
Figures from the paper
Abstract (AI)
Бустинг является одним из важнейших недавних достижений в методах классификации. Бустинг работает путем последовательного применения алгоритма классификации к заново взвешенным версиям обучающих данных с последующим формированием взвешенного большинства голосов из последовательности полученных классификаторов. Для многих алгоритмов классификации эта простая стратегия приводит к резкому улучшению качества. Мы показываем, что это, казалось бы, загадочное явление может быть объяснено с точки зрения общеизвестных статистических принципов, а именно аддитивного моделирования и метода максимального правдоподобия. Для задачи с двумя классами бустинг можно рассматривать как приближение аддитивного моделирования на логистической шкале с использованием максимума бернуллиевского правдоподобия в качестве критерия. Мы разрабатываем более прямые приближения и показываем, что они дают результаты, практически идентичные бустингу. Выведены прямые многоклассовые обобщения на основе мультино-мального правдоподобия, которые в большинстве случаев демонстрируют сопоставимую с недавно предложенными многоклассовыми обобщениями бустинга производительность, а в некоторых — значительно превосходят их. Мы предлагаем небольшое изменение в бустинге, которое может сократить вычисления, часто в 10–50 раз. Наконец, мы применяем эти идеи для получения альтернативной формулировки бустинга для деревьев решений. Этот подход, основанный на индукции усеченных деревьев с поиском лучшего узла в первую очередь (best-first truncated tree induction), часто приводит к лучшей производительности и может обеспечить интерпретируемые описания агрегированного правила принятия решений. Он также значительно быстрее вычислительно, что делает его более пригодным для масштабных задач data mining.
Key Findings
1
Небольшая модификация бустинга может сократить вычисления в 10–50 раз.
2
Альтернативная формулировка бустинга для деревьев решений на основе поочередного усечённого разрастания (best-first truncated tree induction) часто обеспечивает лучшую производительность, более высокую скорость и более интерпретируемые агрегированные правила, что делает её пригодной для крупномасштабного анализа данных.
3
Бустинг можно интерпретировать как аддитивное моделирование в логистическом масштабе с максимизацией бернуллиевского правдоподобия для задач с двумя классами.
4
Прямые аппроксимации бустинга, выведенные из этой статистической интерпретации, дают результаты, практически идентичные традиционному бустингу.
5
Обобщения для многоклассовых задач на основе мультиномиального правдоподобия показывают производительность, сопоставимую с недавними методами многоклассового бустинга, а в некоторых случаях превосходят их.
Research Object
Алгоритмы бустинга для классификации (включая AdaBoost и бустинг деревьев решений)
Research Subject
Статистическая интерпретация и аппроксимация бустинга как аддитивной логистической регрессии с использованием (бернуллиевского/мультиномиального) метода максимального правдоподобия, обобщения на многоклассовые задачи, вычислительные модификации и альтернативная схема с усечёнными деревьями (best-first), улучшающие точность и скорость
Publication Details
Publication Date
2000-04-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest