Aus dem Englischen übersetzt

EfficientNet ist eine Familie von convolutional neuronalen Netzen (CNNs) für Computer Vision, die 2019 von Google AI eingeführt wurde und für ihre compound scaling-Methode bekannt ist, die Netzwerktiefe, -breite und -auflösung einheitlich skaliert, um Effizienz und Genauigkeit zu verbessern.

EfficientNet ist eine Familie von Convolutional Neural Networks (CNNs), die für Aufgaben des maschinellen Sehens entwickelt wurde und erstmals 2019 von Forschern bei Google AI veröffentlicht wurde. Ihr charakteristisches Merkmal ist das compound scaling, eine Technik, die alle Dimensionen eines neuronalen Netzwerks - Tiefe, Breite und Auflösung - mithilfe eines einzigen Koeffizienten gleichmäßig skaliert. Dieser Ansatz steht im Gegensatz zu herkömmlichen Verfahren, die nur eine Dimension skalieren, etwa das Hinzufügen von Schichten oder die Vergrößerung der Eingabegröße. EfficientNet-Modelle wurden in Bereichen wie Bildklassifikation, Objekterkennung und semantischer Segmentierung weit verbreitet eingesetzt und sind dafür bekannt, eine hohe Genauigkeit bei geringeren Rechenkosten im Vergleich zu früheren Architekturen zu erzielen.

Die ursprüngliche EfficientNet-Veröffentlichung zeigte, dass compound scaling Modelle mit individuell abgestimmten Dimensionen auf dem ImageNet-Benchmark übertreffen konnte. Durch die sorgfältige Balance des Wachstums über mehrere Achsen hinweg erzielt die Familie Ergebnisse auf dem neuesten Stand der Technik, während die Gleitkommaoperationen (FLOPs) überschaubar bleiben. Die Modelle basieren auf einer Basisarchitektur, die durch neuronale Architektursuche entdeckt wurde, und die Skalierungsmethode baut auf dieser Grundlage auf, um ein Spektrum von Modellen von kompakt bis hochgenau zu erzeugen.

Architektur und compound scaling

Der Kern der Innovation von EfficientNet ist die Methode des compound scaling. Anstatt Tiefe (Anzahl der Schichten), Breite (Anzahl der Kanäle) oder Auflösung (Größe des Eingabebildes) einzeln willkürlich zu erhöhen, skaliert die Methode alle drei gleichzeitig. Für ein Basisnetzwerk werden der Tiefenmultiplikator d, der Breitenmultiplikator w und der Auflösungsmultiplikator r als d = α^φ, w = β^φ und r = γ^φ definiert, wobei φ ein zusammengesetzter Koeffizient ist, der die Gesamtskalierung steuert. Diese Multiplikatoren unterliegen der Bedingung α · β² · γ² ≈ 2, die sicherstellt, dass eine Erhöhung von φ um einen Faktor von φ₀ die gesamten Rechenkosten des Netzwerks um etwa das 2^φ₀-fache wachsen lässt. Die Hyperparameter α, β und γ werden typischerweise über eine kleine Rastersuche festgelegt; die ursprüngliche Veröffentlichung schlug Werte von 1,2, 1,1 bzw. 1,15 vor.

Architektonisch wurde das Basisnetzwerk EfficientNet-B0 mithilfe neuronaler Architektursuche (NAS) gefunden, die den invertierten Engpass-Faltungslayer (als MBConv bezeichnet) - einen Baustein, der zuvor in MobileNet populär gemacht wurde - als hochwirksam identifizierte. Die gesamte EfficientNet-Familie besteht aus gestapelten MBConv-Layern, wobei die genaue Anzahl und Filtergrößen durch die Gleichungen des compound scaling bestimmt werden. Die ursprüngliche Veröffentlichung führte acht Modelle ein, EfficientNet-B0 bis EfficientNet-B7, jeweils mit zunehmender Tiefe, Breite und Auflösung, was zu entsprechenden Verbesserungen der Genauigkeit bei Aufgaben wie Bildklassifikation führt.

Varianten und Anpassungen

Über die ursprünglichen B0-B7-Modelle hinaus wurde EfficientNet durch weitere neuronale Architektursuche für spezialisierte Hardware angepasst. Variationen wurden für Edge-TPUs optimiert, die geringe Latenz und Energieeffizienz priorisieren, sowie für zentrale TPU- oder GPU-Cluster, bei denen der Durchsatz entscheidend ist. Diese Anpassungen tauschen oft leichte Genauigkeitsverluste gegen erhebliche Gewinne bei der Inferenzgeschwindigkeit ein, was sie für Echtzeitanwendungen in eingebetteten Systemen und Cloud-Diensten geeignet macht.

EfficientNet V2 wurde im Juni 2021 veröffentlicht und führte mehrere architektonische Verfeinerungen ein. Das aktualisierte Design integrierte eine breitere Palette von Faltungslayertypen, die durch eine erweiterte NAS-Suche entdeckt wurden, einschließlich fusionierter MBConv-Blöcke. Eine bemerkenswerte Weiterentwicklung war ein neues Trainingsverfahren, das die Eingabebildgröße während des Trainings progressiv erhöht, gekoppelt mit Regularisierungstechniken wie Dropout, RandAugment und Mixup. Die Autoren berichteten, dass dieser Ansatz die Genauigkeitsverschlechterung mildert, die häufig bei progressivem Resizing auftritt, was zu schnellerem Training und verbesserter Endleistung führt. EfficientNet V2 führte auch Varianten wie S, M und L ein, die auf unterschiedliche Ressourcenbeschränkungen abzielen.

Auswirkungen und Anwendungen

EfficientNet hat die nachfolgende Forschung zur Modellskalierung und Architekturgestaltung im Bereich des Deep Learning beeinflusst. Sein Prinzip des compound scaling wurde auf andere Architekturen angewendet, einschließlich Transformatoren, wo es mehrdimensionale Skalierungsstrategien inspiriert hat. In der Praxis werden EfficientNet-Modelle häufig als Backbone-Netzwerke für Objekterkennungssysteme wie You Only Look Once (YOLO) und für Segmentierungsmodelle wie U-Net verwendet, dank ihrer starken Merkmalsextraktionsfähigkeiten und Effizienz. Sie werden auch häufig in Transfer-Learning-Pipelines eingesetzt, bei denen vortrainierte Gewichte auf großen Datensätzen wie ImageNet für domänenspezifische Aufgaben feinabgestimmt werden.

Die Betonung der Recheneffizienz in der Modellfamilie hat sie zu einer beliebten Wahl für die Bereitstellung auf Mobilgeräten und Edge-Hardware gemacht und ergänzt die Arbeit von Unternehmen wie Apple und Qualcomm bei der Optimierung neuronaler Netzwerkinferenz. Ihre Open-Source-Verfügbarkeit, typischerweise unter permissiven Lizenzen, hat eine breite Übernahme sowohl in der Wissenschaft als auch in der Industrie erleichtert und ihren Status als Maßstab für modernes CNN-Design gefestigt.

Einschränkungen und zukünftige Richtungen

Trotz seiner Stärken hat EfficientNet Einschränkungen. Die Methode des compound scaling beruht auf einer groben FLOPs-Näherung und führt möglicherweise nicht immer zum optimalen Kompromiss für spezifische Hardware oder Beschränkungen. Darüber hinaus können die ursprünglichen MBConv-Layer, obwohl effizient, weniger wirksam sein als neuere auf Aufmerksamkeit basierende Mechanismen, die in Transformer-Modellen zu finden sind. Die Forschung hat seitdem hybride Architekturen untersucht, die Faltungsblöcke mit Aufmerksamkeit integrieren, mit dem Ziel, die Effizienz von CNNs mit dem kontextuellen Verständnis von Multi-Head-Attention zu kombinieren. In den letzten Jahren bleibt EfficientNet ein wettbewerbsfähiger Maßstab, aber neuere Modelle integrieren zunehmend Ideen aus neuronaler Architektursuche und automatisierter Skalierung, um die Grenzen von Genauigkeit und Effizienz weiter zu verschieben.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:convolutional-neural-network·computer-vision·model-scaling·google-ai
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte