Gradient Boosting
Beispieldaten für eine Gradient-Boosting-Klassifikation Beispieldaten für eine Gradient-Boosting-RegressionDer Gradient-Boosting-Rechner erstellt ein Vorhersagemodell aus einer abhängigen Variable und zwei oder mehr Prädiktorvariablen. Ist die abhängige Variable kategorial, führt numiqo eine Gradient-Boosting-Klassifikation durch. Ist die abhängige Variable metrisch, führt numiqo eine Gradient-Boosting-Regression durch.
Um Gradient Boosting online zu berechnen, öffne Prädiktive Analytik, wähle Gradient Boosting, lege die abhängige Variable fest und wähle die unabhängigen Variablen aus, die als Prädiktoren verwendet werden sollen.
Was ist Gradient Boosting?
Gradient Boosting ist ein Ensemble-Verfahren, das viele kleine Entscheidungsbäume nacheinander aufbaut. Jeder neue Baum konzentriert sich auf die aktuellen Vorhersagefehler des bestehenden Modells. Anschließend wird der neue Baum mit einer Lernrate zum Modell hinzugefügt, sodass die endgültige Vorhersage schrittweise entsteht und nicht aus einem einzelnen großen Baum.
Dies ist das allgemeine Machine-Learning-Verfahren hinter TreeNet-ähnlichen Boosted-Tree-Modellen, die in Predictive-Analytics-Software verwendet werden. In diesem Rechner wird dafür die allgemeine Bezeichnung Gradient Boosting verwendet und kein markengebundener Produktname.
So funktioniert der Gradient-Boosting-Rechner
Der Rechner trainiert flache Entscheidungsbäume auf Pseudo-Residuen. Bei der Regression ist das Pseudo-Residuum die Differenz zwischen dem beobachteten Wert und dem aktuell vorhergesagten Wert. Bei der Klassifikation verwendet der Rechner Klassenwahrscheinlichkeiten und passt Bäume an, die den Score für jede Kategorie verbessern.
- Anfängliche Vorhersage: Die Regression startet mit dem Mittelwert der abhängigen Variable. Die Klassifikation startet mit den Klassenanteilen.
- Sequenzielle Bäume: Jeder Baum wird an den aktuellen Fehler des Modells angepasst.
- Lernrate: Die Lernrate steuert, wie stark jeder neue Baum das bestehende Modell verändert.
- Kleine Bäume: Die maximale Baumtiefe steuert, wie komplex jeder einzelne Baum sein darf.
- Validierungsaufteilung: Der Rechner gibt die Leistung für Validierungszeilen aus, die beim Training zurückgehalten wurden, sofern der ausgewählte Datensatz groß genug ist.
Gradient-Boosting-Ergebnisse
Die Gradient-Boosting-Ausgabe enthält eine Methodentabelle, die Validierungsleistung und die relative Variablenwichtigkeit. Klassifikationsmodelle enthalten zusätzlich eine Konfusionsmatrix. Regressionsmodelle geben RMSE, MAE und R-Quadrat aus.
Validierungsleistung
Die Validierungsleistung schätzt, wie gut das Boosted-Tree-Modell Zeilen vorhersagt, die nicht zum Anpassen der Bäume verwendet wurden. Klassifikationsmodelle geben die Genauigkeit aus. Regressionsmodelle geben RMSE, MAE und R-Quadrat aus.
Konfusionsmatrix
Die Konfusionsmatrix vergleicht die beobachtete Kategorie mit der vorhergesagten Kategorie. Die Zeilen zeigen die tatsächlichen Kategorien, die Spalten die vorhergesagten Kategorien. Der korrekte Prozentsatz pro Zeile zeigt, wie häufig Beobachtungen aus dieser tatsächlichen Kategorie richtig klassifiziert wurden.
Variablenwichtigkeit
Die Variablenwichtigkeit fasst zusammen, wie stark jeder Prädiktor die Aufteilungen der Boosted Trees verbessert. Eine höhere relative Wichtigkeit bedeutet, dass die Variable stärker zur Verringerung des Modellfehlers im Ensemble beigetragen hat. Die Wichtigkeit ist hilfreich, um Prädiktoren zu priorisieren, sollte aber nicht als Nachweis für Kausalität interpretiert werden.
Gradient Boosting vs. Random Forest
Ein Random Forest erstellt viele Bäume unabhängig voneinander und kombiniert deren Vorhersagen. Gradient Boosting erstellt Bäume sequenziell, wobei jeder Baum das aktuelle Modell verbessert. Random Forest ist häufig einfacher abzustimmen, während Gradient Boosting eine hohe Vorhersageleistung erreichen kann, wenn die Anzahl der Bäume, die Lernrate und die Baumtiefe sorgfältig gewählt werden.
Wann sollte Gradient Boosting verwendet werden?
Verwende eine Gradient-Boosting-Klassifikation, wenn die abhängige Variable kategorial ist und eine Gruppenzugehörigkeit vorhergesagt werden soll. Verwende eine Gradient-Boosting-Regression, wenn die abhängige Variable metrisch ist und ein numerischer Wert vorhergesagt werden soll. Typische Anwendungen sind die Vorhersage von Kundenabwanderung, Qualitätsrisiko-Scores, Nachfrageprognosen, Prozessüberwachung und Kundensegmentierung.
Einschränkungen
Zeilen mit fehlenden Werten in den ausgewählten Variablen werden von der Berechnung ausgeschlossen. Die aktuelle Implementierung verwendet flache Bäume im CART-Stil, Aufteilungen nach dem quadratischen Fehler auf Pseudo-Residuen und eine interne Trainings-/Validierungsaufteilung. Vorhersagen für neue Zeilen, Partial-Dependence-Plots oder eine automatisierte Hyperparametersuche sind noch nicht enthalten.