Synthesia ist ein Technologieunternehmen, das sich auf generative künstliche Intelligenz für die Videoproduktion spezialisiert hat. Die Plattform ermöglicht es Nutzern, professionell aussehende Videos mit realistischen KI-Avataren zu erstellen, die einen Text sprechen, ohne dass Kameras, Schauspieler oder traditionelle Videobearbeitungsprogramme erforderlich sind. Das Unternehmen richtet sich in erster Linie an Firmenkunden für Anwendungsfälle wie Mitarbeiterschulungen, interne Kommunikation und Kundenansprache.
Das Unternehmen wurde 2017 von einem Team mit akademischem Hintergrund in KI und Computer Vision gegründet. Das ursprüngliche Konzept entwickelte sich von der Forschung zu maschinellem Lernen und Videosynthese zu einem kommerziellen Produkt, das die Komplexität der Videoerstellung vereinfacht. Der Hauptsitz befindet sich in London, mit Niederlassungen in New York und Los Angeles.
Kerntechnologie
Die Kerntechnologie von Synthesia konzentriert sich auf neuronale Netze, insbesondere auf Deep-Learning-Modelle, die für Sprachanimation und Bildsynthese trainiert werden. Das System verarbeitet ein Textskript, wandelt es mithilfe fortschrittlicher Text-zu-Sprache-Modelle in Sprache um und generiert dann ein Video eines Avatars, der dieses Skript spricht. Die Lippenbewegungen, Gesichtsausdrücke und subtilen Kopfbewegungen des Avatars werden mit dem Audio synchronisiert, wodurch eine überzeugende und natürliche Darstellung entsteht.
Die Plattform basiert auf einem proprietären Stack, der sowohl öffentliche als auch private Forschung in Computer Vision und großen Sprachmodellen nutzt. Zu den wichtigsten Funktionen gehört die Möglichkeit, Videos in über 140 Sprachen aus einer einzigen Textvorgabe zu generieren, indem Untertitel übersetzt und Audio sowie Sprechmuster neu synthetisiert werden. Die zugrunde liegenden Modelle werden kontinuierlich mit proprietären Daten verfeinert, wobei der Schwerpunkt auf Verbesserungen bei Realismus, emotionaler Bandbreite und mehrsprachiger Sprachkompetenz liegt.
Produktentwicklung
Das Hauptprodukt von Synthesia ist seine SaaS-Plattform, die als Abonnementdienst verkauft wird. Das Unternehmen stellte sein vollständiges Videogenerierungsprodukt Ende 2019 der Öffentlichkeit vor, nachdem ausgewählte Designpartner frühzeitig Zugang zur Beta-Version erhalten hatten.
Ein wichtiger Meilenstein wurde 2023 mit dem Wechsel von avatar-basierten Vorlagen zu einer breiteren Funktionenpalette für Bildschirmaufnahmen und Bildschirmbegleitung erreicht, die Video- und Bildschirminhaltserstellung vereint. Das Unternehmen hat außerdem ein Portfolio kuratierter digitaler Schauspieler mit unterschiedlichem Hintergrund entwickelt und ermöglicht es Nutzern nun, benutzerdefinierte Avatare aus einer kurzen Webcam-Aufnahme zu erstellen - eine Funktion, die 2024 eingeführt wurde.
Zu den bedeutenden Produktveröffentlichungen gehören:
- 2019: Öffentliche Beta der Text-zu-Video-Plattform mit einer begrenzten Anzahl von Avataren.
- 2020: Einführung der Mehrsprachunterstützung und unternehmensgerechter Funktionen.
- 2023: Einführung der KI-Avatar-Anpassung und der Synthesia-2.0-Plattform mit verbessertem Editor.
- 2024: Einführung des mobilen Angebots von Synthesia und erweiterter Präsentationsfunktionen.
Geschäft und Finanzierung
Das Unternehmen hat erhebliches Risikokapital eingeworben, was das hohe Marktinteresse an KI-Videotools widerspiegelt. Synthesia sammelte im Dezember 2020 12,5 Millionen US-Dollar in einer Serie-A-Finanzierungsrunde ein, angeführt von einer Risikokapitalgesellschaft, und sicherte sich später im März 2022 eine Serie-B-Runde über 50 Millionen US-Dollar. Im Juni 2023 erreichte das Unternehmen eine Bewertung von 1 Milliarde US-Dollar nach einer Serie-C-Finanzierungsrunde über 90 Millionen US-Dollar. Zu seinen Investoren gehören prominente Firmen wie der Startup-Fonds von OpenAI sowie Risikokapitalgesellschaften, die sich auf Unternehmenssoftware konzentrieren.
Das Geschäftsmodell basiert auf Abonnements mit Preisstufen, die sich nach Nutzung, Anzahl der Avatare und unterstützten Sprachen richten. Bis Anfang 2024 meldete Synthesia über 50.000 Geschäftskunden, darunter mehr als die Hälfte der Fortune-100-Unternehmen. Die Einnahmen stammen sowohl aus Jahresverträgen als auch aus nutzungsbasierten Kontingenten, und das Unternehmen hat sich als profitables Wachstumsunternehmen positioniert, mit Fokus auf nachhaltige Einheitsökonomie.
Forschung und Entwicklung
Das Unternehmen unterhält eine aktive Forschungsabteilung und veröffentlicht Arbeiten in Bereichen wie Talking-Head-Generierung und audio-getriebener Lippen-Synchronisation. Synthesia hat zu Open-Source-Forschung beigetragen, einschließlich der Veröffentlichung von Datensätzen wie den VoxCeleb-basierten Talking-Head-Benchmarks, die von der akademischen Gemeinschaft genutzt werden. Es arbeitet auch mit akademischen Einrichtungen zusammen und verfügt über einen Forschungsbeirat, dem Professoren führender Universitäten angehören.
Im Jahr 2024 kündigte Synthesia sein intern entwickeltes fundamentales Videomodell an, das sich vom früheren 2D-Avatar-Ansatz entfernt und dynamischere und steuerbarere Avatar-Bewegungen ermöglicht. Dieses Modell ist ein Schritt in Richtung des langfristigen Ziels, vollständig interaktive KI-Schauspieler zu schaffen, die innerhalb einer Szene improvisieren und interagieren können.
Verantwortungsvolle KI und Ethik
Angesichts des Potenzials für Missbrauch von Deepfake-Technologie hat Synthesia Governance-Maßnahmen implementiert. Das Unternehmen verfügt über eine KI-Kommission, ein unabhängiges Gremium externer Ethiker, das seine Technologie und Richtlinien überprüft. Es verlangt außerdem eine ausdrückliche Einwilligung für die Erstellung benutzerdefinierter Avatare, verwendet Wasserzeichen-Technologie zur Kennzeichnung KI-generierter Inhalte und hat einen Rahmen für "Verantwortungsvolle KI" veröffentlicht.
Das Unternehmen ist Mitglied der Koalition für synthetische Inhalte und setzt sich für Branchenstandards in Bezug auf Authentizität und Transparenz ein. Diese Maßnahmen sollen Innovation mit der Verhinderung täuschender Nutzungen wie Desinformationskampagnen oder unbefugter Identitätsnachahmung in Einklang bringen.
Auswirkungen und Marktposition
Der Markt für KI-Videogenerierung ist wettbewerbsintensiv, mit Akteuren sowohl bei Text-zu-Video als auch bei Avatar-Generierung. Synthesia zeichnet sich durch seinen Fokus auf Unternehmenszuverlässigkeit, Mehrsprachigkeit und Integration in beliebte Unternehmenswerkzeuge wie Microsoft Azure und Amazon Web Services über seine API aus. Zu den Hauptwettbewerbern gehören andere KI-Avatar-Firmen und in jüngerer Zeit große Technologieunternehmen, die in diesen Bereich eintreten, obwohl Synthesia im Segment der Unternehmensschulungen einen Erstanbieter-Vorteil behält.
Die Technologie des Unternehmens wurde in Sektoren wie Finanzen, Fertigung und Einzelhandel übernommen, wo sie zur Standardisierung von Schulungsinhalten und zur Personalisierung von Kundenkommunikation eingesetzt wird. Laut internen Berichten haben Kunden erhebliche Zeit- und Kosteneinsparungen gemeldet, wobei die Videoproduktionszeiten von Tagen auf Minuten gesunken sind.
Zukunftsaussichten
Synthesia hat öffentliche Ambitionen, über 2D-Video hinaus in immersive Erfahrungen zu expandieren. Diese Pläne umfassen realistischere Avatare für virtuelle Realität und erweiterte Realität sowie die Integration mit Echtzeit-Kommunikationsplattformen. Das Unternehmen erforscht auch die Verwendung von transformer-basierten Modellen für fortgeschrittenes Denken und Charakterdialog, mit dem Ziel, seine Avatare interaktiver und kontextbewusster zu machen.
Ab 2025 skaliert Synthesia weiterhin seine Unternehmensangebote, mit Plänen zur Erweiterung seiner Vertriebsmannschaft und zur Stärkung seines KI-Forschungsteams. Es konzentriert sich auch auf Partnerschaften mit großen Hardware- und Cloud-Anbietern, um Inferenzkosten zu senken und die Echtzeitleistung zu verbessern.