Overfitting ist ein Fehlermodus im maschinellen Lernen, bei dem ein Modell die Trainingsdaten zu genau lernt, einschließlich deren Rauschen und Eigenheiten, auf Kosten des Lernens von Mustern, die auf neue, unbekannte Daten verallgemeinern. Ein überangepasstes Modell zeigt typischerweise einen sehr niedrigen Fehler auf den Daten, mit denen es trainiert wurde, aber einen erheblich höheren Fehler auf zurückgehaltenen Daten - das Gegenteil des beabsichtigten Ziels, ein Modell zu bauen, das bei Beispielen, die es nie gesehen hat, gut abschneidet.
Ursachen
Overfitting tritt tendenziell auf, wenn ein Modell über genügend Kapazität verfügt, das heißt genügend Parameter oder effektive Flexibilität, um idiosynkratische Details eines endlichen Trainingssatzes zu memorieren, anstatt gezwungen zu sein, die einfacheren, allgemeineren Muster dahinter zu finden. Es wird wahrscheinlicher, wenn das Verhältnis von Modellkapazität zur Größe der Trainingsdaten zunimmt, weshalb Overfitting historisch gesehen ein größeres Problem für kleine Datensätze und vergleichsweise einfache Modelle war, als es für heutige große Sprachmodelle erscheinen mag, deren Trainingsmengen enorm sind. Overfitting kann auch lokaler auftreten, zum Beispiel wenn ein Modell nach dem Vortraining auf einem kleinen, schmalen Datensatz feinabgestimmt wird, wobei es einige seiner breiteren Fähigkeiten verlieren kann, während es sich übermäßig an den Feinabstimmungsdatensatz anpasst - ein verwandtes Phänomen, das manchmal als katastrophales Vergessen bezeichnet wird. Zu viele Durchläufe über dieselben Daten, bekannt als zu viele Epochen, ist eine klassische direkte Ursache, da ein Modell mit ausreichender Kapazität sich allmählich vom Lernen allgemeiner Muster zum Memorieren spezifischer Beispiele verschiebt, je länger es auf ihnen trainiert.
Erkennung
Der Standardweg, Overfitting zu erkennen, besteht darin, eine Verlustfunktion auf einem Validierungssatz zu überwachen, einem Teil der Daten, der vom Training zurückgehalten wird, zusammen mit dem Trainingsverlust. Solange beide Verluste gemeinsam fallen, verallgemeinert das Modell; sobald der Trainingsverlust weiter fällt, während der Validierungsverlust stagniert oder steigt, hat das Modell begonnen, überanzupassen. Diese Validierungskurve ist die Grundlage für das frühe Stoppen, eine Technik, die das Training nahe dem Punkt anhält, an dem die Validierungsleistung am besten ist, und für die Auswahl zwischen konkurrierenden Architekturen oder Hyperparametereinstellungen unter Verwendung eines Validierungssatzes, mit dem das Modell nie trainiert wurde.
Abschwächung
Die allgemeine Familie von Techniken zur Verhinderung oder Reduzierung von Overfitting ist als Regularisierung bekannt, die Gewichtsstrafen, Dropout, Datenaugmentierung und einfach das Sammeln von mehr oder vielfältigeren Trainingsdaten umfasst, sodass memoriebare Eigenheiten weniger wichtig werden im Verhältnis zu echten Mustern. Kreuzvalidierung, die Daten wiederholt in verschiedene Trainings- und Validierungspartitionen aufteilt, liefert eine robustere Schätzung, wie gut ein Modell verallgemeinert, als eine einzelne Trainings-Validierungs-Aufteilung, und ist Standardpraxis für kleinere Datensätze, bei denen ein einzelner zurückgehaltener Satz selbst verrauscht wäre.
Overfitting auf Benchmark-Ebene
Eine verwandte, höherstufige Version desselben Problems betrifft, wie das gesamte Feld Fortschritte misst: Wenn Forscher Modelle über Jahre hinweg wiederholt gegen dieselbe öffentliche Benchmark abstimmen, können Ergebnisse auf dieser spezifischen Benchmark verbessert werden, ohne entsprechende reale Gewinne, und beliebte Bewertungssätze riskieren, in aus dem Web gescrapte Trainingsdaten zu gelangen - ein Problem, das als Benchmark- oder Datenkontamination bezeichnet wird. Dies hat zurückgehaltene, kontaminationsresistente Bewertungen und Benchmarks wie ARC-AGI, die ausdrücklich darauf ausgelegt sind, Memorierung zu widerstehen, zunehmend wichtig gemacht, um ehrlich zu messen, ob große Sprachmodelle sich bei echtem Denken verbessern, anstatt sich an vertraute Testverteilungen überanzupassen.