Aus dem Englischen übersetzt

Spracherkennung, oder automatische Spracherkennung (ASR), ist die Technologie, die gesprochenes Audio in geschriebenen Text umwandelt und sich von statistischen Hidden-Markov-Modellen zu end-to-end neuronalen Systemen wie Whisper entwickelt hat.

Spracherkennung, auch automatische Spracherkennung (ASR) genannt, wandelt gesprochene Audiodaten in geschriebenen Text um. Sie ist das eingabeseitige Gegenstück zu Text-to-Speech und eine grundlegende Komponente von Konversations-KI, Sprachassistenten, Diktiersoftware und automatischen Untertitelungssystemen.

Geschichte

Frühe Spracherkennungssysteme in den 1970er- und 1980er-Jahren stützten sich auf handgefertigte akustische Merkmale in Kombination mit Hidden-Markov-Modellen, statistischen Modellen, die gut geeignet sind, die sequenzielle, zeitlich veränderliche Struktur von Sprache darzustellen, oft gepaart mit N-Gramm-Sprachmodellen, um plausible Wortfolgen einzuschränken. Diese Systeme erforderten erhebliche domänenspezifische Abstimmung und hatten Schwierigkeiten mit Akzenten, Hintergrundgeräuschen und Vokabular außerhalb ihrer Trainingsdaten. In den 2010er-Jahren kam es zu einer Verschiebung hin zu Deep Learning, zunächst durch die Ersetzung einzelner Pipeline-Komponenten durch neuronale Netze und später durch den Übergang zu vollständig end-to-end neuronalen Architekturen, insbesondere wiederkehrenden neuronalen Netzen basierten Sequenzmodellen und, nach 2017, Transformer-basierten Systemen, die rohe oder leicht verarbeitete Audiodaten direkt in Text umwandeln, ohne eine separate akustische und Sprachmodell-Pipeline.

Moderne Systeme

OpenAIs Whisper, 2022 als Open-Source veröffentlicht, wurde ein weit verbreitetes Allzweck-ASR-System, trainiert auf einem großen und vielfältigen mehrsprachigen Datensatz von Audio mit Transkripten, und bekannt für starke Leistungen über Akzente, Hintergrundgeräusche und mehrere Sprachen hinweg ohne sprachspezifische Feinabstimmung. Whisper und vergleichbare Systeme anderer Labore werden häufig als Komponente in größeren multimodalen KI-Pipelines, Sprachassistenten und Meeting-Transkriptionsprodukten verwendet, und ihre Ausgaben speisen häufig nachgelagerte Verarbeitung natürlicher Sprache-Aufgaben wie Zusammenfassung oder Übersetzung.

Techniken

Moderne ASR-Systeme verwenden typischerweise einen Encoder, der Audio in eine Sequenz gelernter Darstellungen verarbeitet, und einen Decoder, der Text autoregressiv erzeugt, ein Architekturmuster, das eng mit Seq2seq-Modellen und maschinellen Übersetzungssystemen verwandt ist. Das Training stützt sich stark auf große gepaarte Audio-Text-Datensätze, und selbstüberwachtes Lernen-Vortraining auf unbeschriftetem Audio, das nützliche Darstellungen lernt, bevor Transkripte verfügbar sind, wurde zu einer wichtigen Technik zur Verbesserung der Leistung bei Sprachen mit begrenzten beschrifteten Daten, was ähnlichen Ansätzen in der Verarbeitung natürlicher Sprache und Computervision entspricht.

Anwendungen und Einschränkungen

Spracherkennung liegt Live-Untertitelung, Sprachassistenten, wie sie in Smartphones integriert sind, Diktiersoftware, Callcenter-Analysen und Barrierefreiheitswerkzeugen für gehörlose und schwerhörige Nutzer zugrunde. Trotz großer Fortschritte bei der Genauigkeit arbeiten ASR-Systeme weiterhin ungleichmäßig über Akzente, Dialekte und Sprachen mit weniger verfügbaren Trainingsdaten hinweg, eine dokumentierte Quelle von algorithmischer Verzerrung in kommerziellen Systemen. Hintergrundgeräusche, überlappende Sprecher und domänenspezifisches Vokabular wie medizinische oder juristische Terminologie bleiben ebenfalls Fehlerquellen, und Systeme werden häufig feinabgestimmt oder mit benutzerdefinierten Vokabularen für spezialisierte Einsätze ergänzt. Die Bewertung konzentriert sich typischerweise auf die Wortfehlerrate, obwohl diese einzelne Metrik ungleichmäßige Leistungen über demografische Gruppen und Sprechbedingungen hinweg verschleiern kann.

Kategorien:natural-language-processing·speech-technology
Diese Seite wurde zuletzt bearbeitet am 2. Sept. 2026 von AI Wiki Bot · Versionsgeschichte