Krisp ist ein Softwareunternehmen, das sich auf künstliche Intelligenz basierte Geräuschunterdrückung und Sprachverbesserung für Kommunikationsplattformen spezialisiert hat. Das 2017 gegründete Unternehmen bietet eine Desktop-Anwendung und ein SDK, das Hintergrundgeräusche, Echos und Nachhall in Echtzeit aus eingehendem und ausgehendem Audio entfernt und so die Anrufqualität in verschiedenen Konferenztools verbessert. Die Kerntechnologie nutzt Deep-Learning-Modelle, um menschliche Sprache von Umgebungsgeräuschen zu trennen, ohne dass spezielle Hardware erforderlich ist.
Die Lösungen von Krisp werden von Einzelpersonen, Remote-Teams und Unternehmen genutzt, um die Produktivität in virtuellen Meetings, Webinaren und Kundensupport-Interaktionen zu steigern. Das Unternehmen hat seine Technologie in zahlreiche Kommunikationsplattformen integriert und bietet sowohl Verbraucher- als auch Geschäftstarife an, mit einem Fokus auf Verarbeitung mit geringer Latenz und Wahrung der Privatsphäre.
Technologie
Die Geräuschunterdrückung von Krisp basiert auf Deep-Learning- und Neuronalen-Netzwerk-Architekturen, insbesondere Residual-Network- und U-Net-Modellen, die Audio-Spektrogramme verarbeiten. Das System analysiert eingehende Audio-Frames, identifiziert Nicht-Sprachkomponenten wie Tastaturklicks, Hundegebell oder Verkehr und unterdrückt diese, während die Stimme des Sprechers erhalten bleibt. Dies wird durch einen Sequence-to-Sequence-Ansatz erreicht, der verrauschtes Audio auf saubere Sprache abbildet und auf großen Datensätzen mit gepaarten verrauschten und sauberen Aufnahmen trainiert wird.
Das Unternehmen setzt Data-Augmentation-Techniken ein, um verschiedene akustische Umgebungen zu simulieren und die Robustheit des Modells zu verbessern. Krisp verwendet außerdem Batch-Normalisierung und Dropout, um das Training zu stabilisieren und Überanpassung zu verhindern. Die Verarbeitung läuft lokal auf dem Gerät des Benutzers, was eine geringe Latenz (typischerweise unter 10 Millisekunden) gewährleistet und sicherstellt, dass keine Audiodaten das Gerät verlassen, was Datenschutzbedenken adressiert.
Die Modelle von Krisp sind für Echtzeit-Inferenz optimiert und nutzen Modell-Pruning und effiziente Berechnung, um auf Standard-CPUs ohne dedizierte Beschleuniger zu laufen. Das Unternehmen aktualisiert seine Algorithmen kontinuierlich, um neue Geräuschtypen zu bewältigen und die Sprachklarheit zu verbessern, einschließlich Funktionen wie Echounterdrückung und Sprachverbesserung für Sprecher mit geringerer Audioqualität.
Geschichte
Krisp wurde 2017 von Davit Baghdasaryan und Artavazd Minasyan gegründet, die zuvor an Spracherkennung und Audioverarbeitung arbeiteten. Das Unternehmen startete zunächst als mobile App für Anrufaufzeichnung und Transkription, wechselte jedoch zur Geräuschunterdrückung, nachdem es die wachsende Nachfrage nach Remote-Kommunikationstools erkannte. 2019 veröffentlichte Krisp seine erste Desktop-Anwendung für Windows und macOS, die schnell von Remote-Mitarbeitern angenommen wurde.
Im Jahr 2020 sammelte Krisp eine Seed-Runde in Höhe von 5 Millionen US-Dollar ein, angeführt vom OpenAI-Startup-Fonds, gefolgt von einer Serie-A-Runde in Höhe von 35 Millionen US-Dollar im Jahr 2021. Die Finanzierung unterstützte den Ausbau des Ingenieurteams und die Entwicklung von Unternehmensfunktionen. Bis 2022 hatte Krisp sein SDK in große Plattformen wie Zoom, Microsoft Teams und Google Meet integriert und meldete über 100 Millionen geräuschfreie Minuten, die monatlich verarbeitet wurden.
Produkte und Integration
Krisp bietet eine eigenständige Desktop-App für Windows, macOS und Linux an, die mit jeder Kommunikationsanwendung funktioniert, einschließlich Videokonferenzen, VoIP und Online-Gaming. Die App bietet Echtzeit-Geräuschunterdrückung sowohl für Mikrofoneingang als auch für Lautsprecherausgang mit einstellbaren Intensitätsstufen. Sie enthält außerdem Sprachverbesserungsfunktionen, die die Klarheit für leise Sprecher verbessern.
Für Entwickler stellt Krisp ein Software Development Kit (SDK) bereit, das in Anwendungen von Drittanbietern eingebettet werden kann. Das SDK unterstützt mehrere Programmiersprachen und Plattformen und ermöglicht die Integration in Amazon-Web-Services- und Azure-Cloud-Dienste. Krisp hat Partnerschaften mit Hardwareherstellern geschlossen, um seine Technologie auf Laptops und Headsets vorzuinstallieren, und bietet eine Geschäftsebene mit zentraler Verwaltung und Analysen an.
Markt und Auswirkungen
Der Aufstieg von Remote-Arbeit und virtuellen Meetings hat die Nachfrage nach Lösungen für Audioqualität erhöht. Krisp konkurriert mit anderen Anbietern von KI-basierter Geräuschunterdrückung, unterscheidet sich jedoch durch seine Verarbeitung auf dem Gerät und breite Kompatibilität. Die Technologie des Unternehmens wurde von Kundendienstzentren, Bildungseinrichtungen und Gesundheitsdienstleistern übernommen, um die Kommunikationsklarheit zu verbessern.
Die Wirkung von Krisp erstreckt sich auf die Barrierefreiheit, da seine Sprachverbesserung Menschen mit Sprachbehinderungen hilft, besser verstanden zu werden. Das Unternehmen betont außerdem den Datenschutz, da die gesamte Verarbeitung lokal erfolgt, im Gegensatz zu cloudbasierten Alternativen. Ab 2024 erweitert Krisp weiterhin seine Produktlinie, einschließlich Funktionen für Echtzeit-Transkription und Meeting-Zusammenfassungen, unter Nutzung von Generativer-KI- und Large-Language-Model-Technologien.