Sprachverständlichkeit analysieren und optimieren

Die technische Übertragung von Sprache ist oft von Störgeräuschen und Hall überlagert, beispielsweise bei Bahnhofsdurchsagen, im Bereich der Mobiltelefonie oder bei Infotainmentsystemen im Auto. Bei Medienproduktionen und im Broadcasting-Bereich wird teils subjektiv entschieden, ob Sprache für Zuhörende ausreichend gut verständlich ist.

Wir entwickeln Signalverarbeitungsverfahren, die in unterschiedlichen Anwendungen für bessere Sprachverständlichkeit und eine geringere Höranstrengung sorgen.

Die Softwarelösungen des Fraunhofer IDMT in Oldenburg ...

Die Entwicklungen des Fraunhofer IDMT orientieren sich an den Bedarfen des Marktes und konnten bereits mehrfach über Lizenzierungen in verschiedene Branchenlösungen eingebracht werden.

Dabei fließen durch starke Kooperationen konkrete Forschungsergebnisse der Oldenburger Hörforschung, zum Beispiel der Carl von Ossietzky Universität und des Exzellenzclusters »Hearing4All«, in die Lösungen ein. Dadurch erreichen wir mit unseren Lösungen ein individuell optimiertes Klangerlebnis für Menschen mit und ohne Hörbeeinträchtigung.

Sprache im Audiosignal erkennen

Die Sprachaktivitätserkennung (»Speech Activity Detection«, SAD) des Fraunhofer IDMT identifiziert zuverlässig Sprechanteile in Audiosignalen. Beispielsweise erleichtert die Technologie den Workflow von Tonschaffenden, da Sprache beim Editieren auch ohne das Anhören aller Passagen leicht gefunden wird. Als Feature »Dialog Detection« hielt die Technologie Einzug in Steinbergs Postproduktions-Software Nuendo. Sie kommt ebenfalls in weiteren Lösungen des Oldenburger Institutsteils zum Einsatz, wie in der hauseigene Sprach- und Sprechererkennung, bei Störgeräuschbefreiungsalgorithmen oder als Privacy Filter. Die SAD kann eingesetzt werden, damit in der Audioverarbeitung nichtsprachliche Anteile herausgefiltert werden. Umgekehrt kann sie dafür sorgen, dass Sprache gar nicht erst aufgezeichnet wird und so die Privatsphäre von Nutzerinnen und Nutzern, zum Beispiel im öffentlichen Raum, geschützt ist.

»Dialog Detection« in Steinbergs Nuendo 12 mit Algorithmen des Fraunhofer IDMT in Oldenburg
© Steinberg Media Technologies GmbH
Die »Dialog Detection« in Steinbergs Nuendo 12: Algorithmen des Fraunhofer IDMT in Oldenburg erkennen unabhängig von Hintergrundgeräuschen zuverlässig Sprachaktivität im Audiosignal.

Analyse und Bewertung von Sprachverständlichkeit

mit der LEAP-Technologie (Listening Effort Prediction for Acoustic Parameters)

Die Forschenden am Fraunhofer IDMT in Oldenburg haben durch Verknüpfung von maschinellem Lernen und psychoakustischer Modellierung neue Technologien entwickelt, um die Höranstrengung für einzelne Audiopassagen objektiv und in Echtzeit zu messen und zu visualisieren. Dadurch kann beispielsweise eine gleichbleibend gute Sprachverständlichkeit in Medienproduktionen und -streams überprüft werden. In verschiedenen Produktionslösungen unterstützt die Technologie bereits Tonschaffende bei der Postproduktion, etwa als Plug-in »LE-Meter« von NUGEN Audio, als »Speech Intelligibility Meter« in der hardwarebasierten Audiomessplattform von RTW oder der Produktionslösung Nuendo des Anbieters Steinberg.

Die Algorithmen basieren auf aktuellen Forschungserkenntnissen am Hörstandort Oldenburg. Sie wurden in den letzten Jahren mehrfach evaluiert und anhand formaler Hörtests mit Probandinnen und Probanden verschiedener Altersklassen validiert. 

Das vom Fraunhofer IDMT entwickelte »LE-Meter«, das in das Plug-in »DialogCheck« von NUGEN integriert ist.
© NUGEN Audio Limited
Das vom Fraunhofer IDMT entwickelte »LE-Meter«, das in das Plug-in »DialogCheck« von NUGEN integriert ist, ermöglicht Toningenieurinnen und -ingenieuren die Visualisierung und Optimierung der Höranstrengung und Sprachverständlichkeit während der Postproduktion.

Optimierung der Sprachverständlichkeit

mit den PSIO-Technologien (Personal Speech Intelligibility Optimization)

Verschiedene Signalverarbeitungsverfahren des Fraunhofer IDMT können kombiniert werden, um die Sprachverständlichkeit zu verbessern. Die zuvor erläuterten Echtzeit-Vorhersagemodelle erkennen Sprachaktivität und identifizieren die objektive Höranstrengung für ein Audiosignal (z. B. ein ausgestrahltes Video). Sprachseparationstechnologien trennen Sprachinhalte von Hintergrundgeräuschen und teilen sie in zwei Klangobjekte auf, die unabhängig voneinander bearbeitet werden können. Hintergrundmusik und Soundeffekte könnten beispielsweise nach persönlichen Hörpräferenzen oder -bedürfnissen reduziert werden, um eine bessere Verständlichkeit von Dialogen zu erzielen.

Die Technologien eignen sich optimal für den Einsatz in der Medienproduktion, sowohl bei Live-Ausstrahlungen als auch in der Postproduktion. Auch Mediatheken, Streaming-Dienste oder Kommunikationsdienstleister können ihren Kunden Mehrwerte bieten, wie z.B. alternative Sound Tracks mit verbesserter Verständlichkeit bis hin zu personalisierbaren Lösungen in Endgeräten. 

Zusätzlich kann die adaptive Signalverarbeitung das Sprachsignal verbessern, wenn die technische Übertragung von Sprache von Störgeräuschen und Hall überlagert ist. Gerade wenn es darauf ankommt, zum Beispiel in Einsatzleitzentralen, Durchsagesystemen (Public Address Systems) oder Konferenz- und Telefonielösungen, sollte kein Wort verloren gehen.

Die Quellentrennungstechnologien trennen Sprachinhalte von Hintergrundgeräuschen und teilen sie in zwei Klangobjekte auf.
© Fraunhofer IDMT/Anika Bödecker
Die Quellentrennungstechnologien des Fraunhofer IDMT trennen Sprachinhalte von Hintergrundgeräuschen und teilen sie in zwei Klangobjekte auf.

Klangeinstellung nach persönlichen Vorlieben

Eine weitere Technologie des Fraunhofer IDMT ermöglicht die individuelle Anpassung von Sprach- und Hintergrundgeräuschen anhand eigener Klangpräferenzen, um ein personalisiertes Hörerlebnis zu schaffen. In Form eines besonders einfachen und eleganten Verfahrens kann Klang und Dynamik personalisiert werden, ohne dass sich die Anwendenden mit komplexen Sub-Menüs oder Parametern beschäftigen müssen.

Die sogenannte »YourSound« Technologie wird bereits für die individuelle Konfiguration von Medienwiedergaben in Automobilen und Kopfhörern eingesetzt. Einmal über eine intuitive Bedienoberfläche eingestellt, wirken sich die personalisierten Parameter positiv auf den Gesamtklang aus. Dadurch ergibt sich ein besseres Hörerlebnis, egal bei welcher Wiedergabelautstärke und Fahrsituation. Der Klang von Musik und Filmen ist dank der Fraunhofer-Algorithmen optimal an die individuellen Soundvorlieben angepasst.

Sprachanteile und Hintergrundgeräusche können unabhängig voneinander nach persönlichen Klangvorlieben optimiert werden.
© Fraunhofer IDMT/Leona Hofmann
Sprachanteile und Hintergrundgeräusche können unabhängig voneinander nach persönlichen Klangvorlieben optimiert werden.

Anwendungsbeispiele aus dem Markt

 

Presseinformation / 22.10.2025

Optimale Verständlichkeit in Film/Fernsehen

Das »Speech Intelligibility Meter« wurde in eine internationale Broadcastlösung integriert.

 

Presseinformation / 27.5.2025

Verständliche Dialoge für alle

Das »Listening Effort Meter« hilft bei der Postproduktion, um schlechte Sprachverständlichkeit zu vermeiden.

 

Presseinformation / 1.6.2023

Erstklassiger Klang für jedes Ohr

Die Technologie zur Personalisierung des Klangs konnte nun erfolgreich in Consumer-Kopfhörer implementiert werden.

 

Presseinformation / 7.7.2022

Intuitive Klangpersonalisierung im Fahrzeug

Unser technologisches Konzept wurde im Multimedia-System von Fahrzeugen der Mercedes-Benz Group AG integriert.

 

Presseinformation / 23.5.2022

Sehen, wann gesprochen wird

Neue Algorithmen wurden in das Tool »Dialog Detection« in Steinbergs Audio-Postproduktions-Software Nuendo eingebracht.

 

Presseinformation / 10.12.2020

Bei Nuscheln rot!

Das »Intelligibility Meter« ermöglicht die objektive Messung und Anzeige von Sprachverständlichkeit bei der Medienproduktion.

Einfach erklärt: Bewertung und Optimierung von Sprachverständlichkeit

 

Video

Sprachverständlichkeit analysieren und optimieren

Was genau meinen wir, wenn wir von einer »besseren Sprachverständlichkeit« sprechen? Dr. Jan Rennies-Hochmuth erklärt, wie die Analyse, Bewertung und Verbesserung von Sprachverständlichkeit funktioniert.

 

Video

Quellentrennung am Fraunhofer IDMT

Um den Dialog nun vom Hintergrund zu trennen und eine bessere Sprachverständlichkeit in einer neuen Tonspur zu erzeugen, nutzen wir die Technologie der Quellentrennung. Wie das funktioniert, erklärt Dr. Jan Rennies-Hochmuth.

 

Podcast

Pilotfolge »Hör mal wer da spricht«

Dr. Jan Rennies-Hochmuth vom Fraunhofer IDMT in Oldenburg über die Verbesserung der Sprachverständlichkeit von Dialogen in Film und Fernsehen

Weiterführende Informationen

 

Dein Sound, in jeder Situation

Jeder Mensch hört anders gut. Mit dem »YourSound-Verfahren« lässt sich der Klang von Audio-Devices optimal personalisieren – so einfach wie nie zuvor!

 

Voice Filtering

Zuverlässige Unterscheidung von Sprechenden in wenigen Sekunden

 

SI-Live

Echtzeit-Monitoring von Sprachverständlichkeit für eine bessere Kommunikation mit Telefon- und Videokonferenzsystemen.

 

Das Hearable für den smarten Industriearbeitsplatz

Ein kleines Hearable im Ohr soll die Zusammenarbeit zwischen Menschen und Maschinen verbessern können.

 

Presseinformation / 4.11.2021

Besser verstehen

Tonmeistertagung 2021: Das Fraunhofer IDMT stellt Lösungen für die Analyse, Bewertung und Verbesserung von Sprachverständlichkeit vor.

 

AdaptDRC

Softwarelösung zur Echtzeit-Optimierung von Sprachverständlichkeit im Störgeräusch

 

SITA - Besser verstehen statt lauter drehen

SITA adressiert die wesentlichen Faktoren für schlechte Sprachverständlichkeit in der gesamten Distributionskette und will für eine größtmögliche Vielfalt von Zielgruppen, Anwendungen und Hörsituationen mit Hilfe innovativer Softwaretechnologien vorhandenen Barrieren auflösen.

Lizenzierung unserer Technologien

Sie haben Interesse, unsere Technologie in Ihr Produkt zu integrieren? Sie möchten unsere Expertise nutzen? Bitte nehmen Sie Kontakt mit uns auf!

Alle Branchenlösungen auf einen Blick

Hier finden Sie ausführliche Informationen zu all unseren Lösungen des Oldenburger Institutsteils Hör, Sprach- und Audiotechnologie HSA.

Individuelle Klangqualität und gute Sprachverständlichkeit

Informieren Sie sich zu unserer weiteren Forschung und Entwicklung.