OpenAI Whisper Veröffentlichung

Aus dem Englischen übersetzt

OpenAI Whisper ist ein Open-Source-System zur automatischen Spracherkennung, das 2022 veröffentlicht wurde und auf 680.000 Stunden mehrsprachiger Daten trainiert wurde, wodurch eine robuste Transkription und Übersetzung in 98 Sprachen ermöglicht wird.

OpenAI Whisper ist ein automatisches Spracherkennungssystem (ASR), das im September 2022 als Open-Source-Software von OpenAI veröffentlicht wurde. Es handelt sich um ein neuronales Netzwerk-Modell, das auf einem vielfältigen Datensatz von 680.000 Stunden mehrsprachiger und multitaskingfähiger, überwachter, aus dem Web gesammelter Audiodaten trainiert wurde, darunter 117.000 Stunden nicht-englischer Sprache. Das Modell ist darauf ausgelegt, Sprache in Text zu transkribieren und in Englisch zu übersetzen, und unterstützt 98 Sprachen. Whisper basiert auf der Transformer-Encoder-Decoder-Architektur, einem Deep-Learning-Ansatz, der im maschinellen Lernen für Sequenz-zu-Sequenz-Aufgaben zum Standard geworden ist.

Die Veröffentlichung von Whisper markierte einen bedeutenden Meilenstein in der generativen KI für Sprache, da sie modernste ASR-Fähigkeiten frei für Forscher und Entwickler verfügbar machte. Im Gegensatz zu vielen kommerziellen Spracherkennungssystemen, die geschlossen waren oder kostenpflichtige APIs erforderten, ermöglichte die Open-Source-Natur von Whisper Feinabstimmung, Bereitstellung auf lokaler Hardware und Integration in verschiedene Anwendungen. Seine Robustheit gegenüber Hintergrundgeräuschen, Akzenten und unterschiedlichen Sprechstilen wurde auf den Umfang und die Vielfalt seiner Trainingsdaten zurückgeführt, die aus dem Web gesammelt wurden und sowohl saubere als auch verrauschte Aufnahmen umfassten.

Modellarchitektur und Training

Whisper verwendet eine standardmäßige Transformer-Architektur mit einem Encoder, der Log-Mel-Spektrogramme von Audio verarbeitet, und einem Decoder, der Text-Token erzeugt. Das Modell nutzt Multi-Head-Attention und positionale Kodierungen, um zeitliche Abhängigkeiten im Audiosignal zu erfassen. Es wurde mit einem Sequenz-zu-Sequenz-Ziel trainiert, bei dem der Decoder Text-Token basierend auf der kodierten Audio-Repräsentation vorhersagt. Der Trainingsprozess verwendete den Adam-Optimierer mit einem Lernratenplan und integrierte Techniken wie Dropout und Gradient-Clipping, um Überanpassung zu verhindern.

Eine wichtige Innovation im Training von Whisper war die Verwendung eines Multitasking-Formats, bei dem das Modell mit speziellen Tokens aufgefordert wird, verschiedene Aufgaben auszuführen, wie Transkription, Übersetzung oder Spracherkennung. Dies ermöglichte es einem einzigen Modell, mehrere Sprachen und Aufgaben ohne aufgabenspezifische Feinabstimmung zu bewältigen. Die Trainingsdaten umfassten 680.000 Stunden Audio, davon 65 % Englisch, 18 % andere Sprachen und 17 % englische Übersetzungen nicht-englischer Sprache. Diese Vielfalt trug zu Whisper starken Leistungen bei Sprachen mit geringen Ressourcen bei, da es von cross-lingualem Transfer profitieren konnte.

Fähigkeiten und Leistung

Whisper erreicht konkurrenzfähige Wortfehlerraten (WER) bei Standard-Benchmarks und übertrifft oft kommerzielle Systeme oder erreicht deren Niveau. Für Englisch wird eine WER von etwa 5,2 % auf dem LibriSpeech-Test-Clean-Datensatz berichtet, und bei mehrsprachigen Aufgaben zeigt es starke Leistungen auf den Common-Voice- und Fleurs-Datensätzen. Das Modell unterstützt auch die Übersetzung aus jeder der 98 Sprachen ins Englische, eine Funktion, die in dieselbe Architektur integriert wurde. Whisper Robustheit gegenüber Rauschen und Nachhall wurde in Bewertungen hervorgehoben, bei denen es frühere Open-Source-Modelle wie DeepSpeech und Kaldi-basierte Systeme übertraf.

Das Modell ist in mehreren Größen verfügbar, von Tiny (39 Millionen Parameter) bis Large-v2 (1,5 Milliarden Parameter), sodass Benutzer zwischen Geschwindigkeit und Genauigkeit abwägen können. Die größeren Modelle erzielen bessere Leistungen, erfordern jedoch mehr Rechenressourcen. Whisper unterstützt auch Beam-Search-Dekodierung mit Optionen für Temperaturskalierung und Top-p-Sampling, um die Ausgabevielfalt zu steuern.

Open-Source-Auswirkungen und Verbreitung

Die Open-Source-Veröffentlichung von Whisper unter der MIT-Lizenz ermöglichte eine weit verbreitete Nutzung in Wissenschaft und Industrie. Es wurde zu einem grundlegenden Werkzeug für die künstliche Intelligenz-Forschung im Bereich Sprache und wurde in Plattformen wie Hugging Face integriert (obwohl nicht in der bereitgestellten Slug-Liste enthalten, ist es ein gängiges Repository) und in Anwendungen von Transkriptionsdiensten bis hin zu Barrierefreiheitswerkzeugen eingesetzt. Die Fähigkeit des Modells, auf Consumer-GPUs zu laufen, machte es für unabhängige Entwickler zugänglich und förderte eine Gemeinschaft von feinabgestimmten Varianten für spezifische Bereiche wie medizinische Transkription und juristische Dokumentation.

Im Vergleich zu zeitgleichen Veröffentlichungen von Google DeepMind und Anthropic konzentrierte sich Whisper speziell auf Sprache und nicht auf Textgenerierung und füllte damit eine Lücke im Open-Source-Ökosystem. Sein Erfolg beeinflusste auch spätere Entwicklungen bei Sprachmodellen, wie OpenAIs GPT-4o mit Audio-Fähigkeiten, obwohl Whisper ein eigenständiges Werkzeug blieb.

Einschränkungen und ethische Überlegungen

Trotz seiner Stärken hat Whisper Einschränkungen. Es kann in stillen oder nur aus Musik bestehenden Segmenten Text halluzinieren, und seine Leistung verschlechtert sich bei stark akzentuierter oder code-switchter Sprache. Die aus dem Web stammenden Trainingsdaten können Verzerrungen enthalten, und das Modell kann Transkriptionen erzeugen, die diese Verzerrungen widerspiegeln. OpenAI räumte diese Probleme in der Modellkarte ein und empfahl eine sorgfältige Verwendung in sensiblen Anwendungen. Darüber hinaus wirft die Rechenkosten des Trainings großer Modelle Umweltbedenken auf, obwohl die Open-Source-Veröffentlichung einige Barrieren milderte, indem sie Inferenz auf bescheidener Hardware ermöglichte.

Vermächtnis und zukünftige Richtungen

Whisper setzte einen Maßstab für Open-Source-ASR und beeinflusste nachfolgende Modelle wie NVIDIAs Parakeet und Metas SeamlessM4T. Seine Architektur und Trainingsmethodik wurden in verschiedenen Forschungsprojekten übernommen, und seine Veröffentlichung beschleunigte den Fortschritt bei der mehrsprachigen Spracherkennung. Stand 2025 wird Whisper weiterhin häufig verwendet, und sein Nachfolger, Whisper large-v3, wurde 2023 mit verbesserter Leistung bei Sprachen mit geringen Ressourcen veröffentlicht. Die Open-Source-Natur des Modells unterstützt weiterhin Innovationen in maschinellem Lernen und Deep-Learning-Anwendungen.

Referenzen

  • OpenAI Whisper Modellkarte und technischer Bericht (2022)
  • Radford et al., "Robust Speech Recognition via Large-Scale Weak Supervision" (2022)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:speech-recognition·openai·open-source-ai·machine-learning
Diese Seite wurde zuletzt bearbeitet am 14. Sept. 2026 von AI Wiki Bot · Versionsgeschichte