Edge AI bezeichnet die Ausführung von Anwendungen der künstlichen Intelligenz, meist der Inferenz von Modellen, direkt auf lokalen Geräten wie Smartphones, Kameras, Autos und eingebetteten Sensoren, anstatt Daten zur Verarbeitung an ein entferntes Cloud-Rechenzentrum zu senden. Es steht im Gegensatz zur Cloud-KI, bei der ein Gerät Eingaben an einen Server sendet, der ein großes Modell ausführt, und das Ergebnis über ein Netzwerk zurückerhält.
Motivation
Edge AI wird durch mehrere praktische Einschränkungen vorangetrieben, die Cloud-Inferenz nicht gut löst. Latenzempfindliche Anwendungen wie die kamerabasierte Objekterkennung in einem selbstfahrenden Auto oder die Echtzeit-Sprachverarbeitung können die Round-Trip-Verzögerung eines Netzwerkaufrufs nicht tolerieren. Offline-Betrieb ist wichtig für Geräte ohne zuverlässige Konnektivität. Datenschutz ist ein wichtiger Treiber: Die lokale Verarbeitung von Daten wie Fotos, Sprache oder Gesundheitsdaten bedeutet, dass rohe personenbezogene Daten das Gerät nie verlassen müssen - eine Eigenschaft, die von Telefonherstellern zunehmend vermarktet wird. Kosten und Bandbreite sprechen ebenfalls für den Edge-Bereich, da das kontinuierliche Streamen von Sensordaten in die Cloud für jede Inferenz im großen Maßstab teuer ist. Der Kompromiss ist die Leistungsfähigkeit: Edge-Geräte haben weit weniger Rechenleistung und Speicher als ein GPU-Cluster im Rechenzentrum, daher ist Edge AI stark auf Quantisierung, Modell-Destillation und andere Größenreduktionstechniken angewiesen, um ein leistungsfähiges Modell in einen kleinen Speicher- und Leistungsrahmen zu bringen.
Hardware und Techniken
Edge AI läuft auf spezialisierten stromsparenden Chips: neuronalen Verarbeitungseinheiten in modernen Smartphone-System-on-Chips, dedizierten Inferenzbeschleunigern wie Googles Edge TPU, einem kleineren Verwandten des TPU im Rechenzentrum, sowie zunehmend leistungsfähigen eingebetteten GPUs. Modelle, die am Edge eingesetzt werden, sind typischerweise komprimierte Versionen größerer Modelle: quantisiert auf niedrigere numerische Präzision, etwa 8-Bit- oder 4-Bit-Gewichte statt 16- oder 32-Bit, beschnitten, um unnötige Parameter zu entfernen, oder durch Wissensdestillation aus einem größeren Foundation-Modell in ein kleineres Schüler-Netzwerk erzeugt. Frameworks wie TensorFlow Lite, das auf TensorFlow basiert, und Core ML unterstützen diesen Bereitstellungspfad von einem vollgroßen Modell zu einem edge-optimierten.
Anwendungen und Ausblick
Häufige Edge-AI-Anwendungen umfassen sprachgesteuerte Assistenten auf dem Gerät, die ein Aktivierungswort lokal verarbeiten, bevor sie die Cloud aufrufen, computergestützte Fotografie und Gesichtsentsperrung auf Smartphones, vorausschauende Wartungssensoren in Industrieanlagen sowie Wahrnehmungssysteme in Robotik und selbstfahrenden Autos, die nicht von Netzwerkkonnektivität abhängig sein können. Ab Mitte der 2020er-Jahre erweiterten leistungsfähige kleine Sprachmodelle mit einigen Milliarden Parametern, die durch aggressive Quantisierung und Destillation praktikabel wurden, Edge AI über enge Wahrnehmungsaufgaben hinaus hin zur Ausführung allgemeiner Chat- und Denkmodelle direkt auf Telefonen und Laptops - Teil eines breiteren Branchentrends hin zu generativer KI auf dem Gerät, die von einigen als datenschutz- und kostengetriebenes Gegengewicht zu gehosteten Frontier-Modellen in der Cloud betrachtet wird.