Whisper ist ein von OpenAI veröffentlichtes Modell für automatische Spracherkennung. Es kann Sprache transkribieren, Sprachen erkennen und gesprochene Inhalte aus mehreren Sprachen ins Englische übersetzen.
Modelltyp und Fähigkeiten
- Mehrsprachige automatische Spracherkennung.
- Transkription von Audio in Text.
- Spracherkennung und Übersetzung gesprochener Inhalte ins Englische.
- Robustheit gegenüber unterschiedlichen Sprechern, Akzenten und Hintergrundgeräuschen – ohne Fehlerfreiheit.
Technische Einordnung
Whisper wurde auf einem großen, vielfältigen Datensatz mit mehrsprachigen und multitaskbezogenen Audiodaten trainiert. Es ist ein Encoder-Decoder-Transformer für Sequenz-zu-Sequenz-Aufgaben.
Verfügbarkeit und Zugang
OpenAI veröffentlichte Modellcode und Gewichte; zusätzlich ist whisper-1 über die Audio API verfügbar. Neuere Transkriptionsmodelle können bei einzelnen Aufgaben bessere Qualität oder Zusatzfunktionen bieten.
Benchmarks und Grenzen
Genauigkeit hängt von Sprache, Aufnahmequalität, Fachbegriffen, Sprecherwechseln und Geräuschen ab. Stille oder schwer verständliche Passagen können falsche Wörter erzeugen. Für rechtlich oder medizinisch relevante Transkripte ist eine Kontrolle erforderlich.