Inhalt anzeigen
- Tiefe
- Fortgeschritten
Podcast, Hörbuch und Radio im ganzen Haus — was Sprachwiedergabe anders macht
Warum funktioniert ein MultiRoom-System, das für Musik gut ist, bei Podcasts und Hörbüchern oft nicht — und was ist an Sprache technisch anders?
Musik erträgt einen schlechten Kompromiss, Sprache nicht. Bei Musik ist ein Wiedergabefehler graduell — es klingt dünner, dumpfer, ungleichmäßiger, und man hört weiter. Bei Sprache ist er binär: Man versteht das Wort oder man versteht es nicht, und dann spult man zurück oder schaltet ab. Deshalb ist ein System, das Podcasts in Küche und Bad zuverlässig verständlich macht, fast zwangsläufig auch ein gutes Musiksystem. Der umgekehrte Schluss gilt nicht.
Wenn Du in der Küche Musik hörst und der Ton nicht ganz sauber ist, stört das kaum — Du erkennst das Lied trotzdem. Wenn Du dort einen Podcast hörst und ein Wort untergeht, fehlt Dir der halbe Satz. Genau das passiert in Bädern, Küchen und Fluren besonders leicht, weil dort viel Fliese und Glas ist und der Schall lange nachklingt. Lauter drehen hilft nicht, weil das Nachklingen mitwächst. Was hilft, sind mehr und näher platzierte Lautsprecher. Das ist der ganze Trick, und er kostet weniger, als man denkt.
Warum Lauterdrehen nicht hilft
Der reflexartige Griff bei schlecht verständlicher Sprache ist der Lautstärkeregler, und er ist der einzige Hebel, der in einem halligen Raum sicher nicht wirkt. Der Grund ist einfach: Mit dem Pegel wächst der Direktschall und der Nachhall gleichermaßen. Ihr Verhältnis — und genau daran hängt die Verständlichkeit — bleibt unverändert.
Was hilft, ist der kürzere Weg zum Ohr: mehr Lautsprecher, näher an den Aufenthaltsorten, gleichmäßiger verteilt. Damit steigt der Direktschallanteil an jedem Punkt, ohne dass am Raum etwas geändert wird. Und weil dieselbe Maßnahme auch die Lautstärkeunterschiede zwischen den Ecken eines Raums verkleinert, fällt sie doppelt positiv aus.
Die Kennzahlen dahinter — das Klarheitsmaß C50, der Sprachübertragungsindex STI und die Rolle des Störgeräuschs — stehen im Eintrag Sprachverständlichkeit und werden hier nicht wiederholt; die Grenze zwischen Direktschall- und Hallfeld behandelt der Hallradius. Diese Seite nennt bewusst keine Zielwerte, weil die Zahlen dort selbst noch am Normtext zu prüfen sind.
Die Podcast-Räume sind die halligsten des Hauses
Das ist der unangenehme Zufall dieses Themas. Gehört wird Sprache beim Tun: beim Duschen, beim Kochen, beim Anziehen, beim Wäschelegen, beim Werkeln. Also im Bad, in der Küche, im Flur, in der Ankleide, im Hauswirtschaftsraum, in der Werkstatt, in der Garage.
Und das sind genau die Räume mit Fliese, Glas, Stein und wenig Textil — also die mit der längsten Nachhallzeit und dem kleinsten Hallradius im ganzen Haus. Das Wohnzimmer, in dem Teppich, Sofa und Vorhänge liegen, ist akustisch der einfachste Raum, und dort läuft meistens Musik.
Für die Planung dreht das eine verbreitete Reihenfolge um. Bad und Küche sind akustisch anspruchsvoller als das Wohnzimmer, nicht anspruchsloser. Wer sie als „nur Hintergrundbeschallung, da reicht wenig" abhakt, legt genau dort zu wenig hin, wo die schwierigere Aufgabe wartet.
Störgeräusche sind hier der Normalfall
Zur Raumakustik kommt der zweite Einfluss, und er ist in diesen Räumen kein Sonderfall, sondern der Regelbetrieb: Dusche, Föhn, Dunstabzugshaube, Spülmaschine, laufendes Wasser, draußen der Rasenmäher. Verständlichkeit ist immer auch ein Abstand zum Grundgeräusch, und dieser Abstand bricht in genau den Momenten zusammen, in denen die Nutzung stattfindet.
Daraus folgt eine Anforderung, die im Zonenkonzept selten steht: Pegelreserve in den Nebenräumen. Nicht, um dort laut zu hören, sondern um in den zwei Minuten, in denen der Föhn läuft, überhaupt noch etwas verstehen zu können. Eine Zone, die bei halber Stellung schon am Anschlag ist, hat diese Reserve nicht.
Das Abstrahlverhalten wird zur Verständlichkeitsfrage
Bei Musik ist eine stark gebündelte Quelle eine Frage des Geschmacks und der Sitzposition. Bei Sprache wird sie zur Funktionsfrage, und zwar aus einem konkreten Grund: Außerhalb des Bündelungsbereichs fehlen zuerst die hohen Frequenzen. Bei Musik klingt es dort dumpfer. Bei Sprache gehen die Konsonanten verloren — und die Konsonanten sind es, die die Information übertragen; die Vokale übertragen den Pegel.
Wer in der Küche einen Podcast hört, bewegt sich dabei ausnahmslos: Herd, Spüle, Kühlschrank, Arbeitsplatte. Mit einer eng abstrahlenden Deckenquelle läuft man dabei ständig in den Verständlichkeitsbereich hinein und wieder heraus. Breit abstrahlende Quellen sind im Sprachfall also nicht „gleichmäßiger verteilt", sondern die Voraussetzung dafür, dass die Nutzung überhaupt funktioniert. Wie sich Bündelung beschreiben und ablesen lässt, steht beim Bündelungsmaß und bei Horn und Waveguide.
Sprache ist einkanalig — und das ist eine gute Nachricht
Podcasts, Hörbücher und Nachrichten sind faktisch Monoinhalte: eine oder mehrere Stimmen in der Mitte, kaum Stereoinformation. Für die MultiRoom-Planung ist das ein handfester Vorteil.
In Zonen, in denen Stereo ohnehin nicht funktioniert — Flur, Bad, Durchgangsräume, alles mit einem einzelnen Lautsprecher —, ist Sprache das materialgerechte Programm. Es fehlt schlicht nichts. Eine Einzellautsprecher-Zone ist damit für Sprachwiedergabe kein Kompromiss, den man erklären muss, sondern die passende Lösung.
Umgekehrt heißt das auch: Wer in einer solchen Zone Musik als Hauptnutzung plant, hat ein Problem, das durch bessere Geräte nicht kleiner wird. Die Entscheidung, welche Zone welches Programm bekommt, gehört deshalb vor die Gerätewahl.
Lautheitssprünge zwischen Produktionen
Podcasts sind in der Produktionsqualität heterogen wie kaum ein anderes Format — professionell gemasterte Sendungen stehen neben Aufnahmen aus dem Wohnzimmer. Der Lautheitsunterschied zwischen zwei Folgen ist regelmäßig größer als der zwischen zwei Musikalben.
Es gibt dafür eine Empfehlung, und sie ist aufschlussreicher, als ihr Titel vermuten lässt. Das technische Dokument AESTD1008 der Audio Engineering Society vom September 2021 nennt für Inhalte mit messbarem Sprachanteil eine Verteil-Lautheit von −18 LUFS, für titelnormalisierte Musik −16 LUFS und für den lautesten Titel eines albumnormalisierten Bestands −14 LUFS. Nach Formaten aufgeschlüsselt: Nachrichten und Wortbeiträge −18, Popmusik −16, Mischformate und Sport −17, Hörspiel −18 LUFS.
Der interessante Teil ist die Begründung für den Abstand. Formale Hörtests zeigten, dass Sprache, die auf dieselbe gemessene Lautheit normalisiert wird wie Musik, typischerweise 2 bis 3 dB lauter empfunden wird — das Messverfahren nach ITU-R BS.1770 bewertet Sprache und Musik nicht gleich. Deshalb empfiehlt das Dokument ausdrücklich, Musik 2 bis 3 Lautheitseinheiten höher zu normalisieren als Sprache.
Zwei Dinge folgen daraus für die Anlage. Erstens: Der Sprung zwischen Musik und Wortbeitrag ist kein Zufall, sondern hat einen bekannten Betrag — und wer eine feste Maximallautstärke je Zone setzt, setzt sie für eines von beidem falsch. Zweitens, und das ist die Einschränkung: Das Dokument richtet sich an Verteiler, also an Streamingdienste und Onlineradios, ausdrücklich nicht an die Produktion und ausdrücklich nicht an Bild-mit-Ton-Inhalte. Ob eine einzelne Podcastproduktion in der Nähe dieser Werte liegt, sagt es nicht.
Zeitversatz fällt bei Sprache sofort auf
Zwei benachbarte Zonen, die minimal versetzt spielen: Bei Musik entsteht ein verwaschener, unangenehmer, aber erträglicher Eindruck. Bei Sprache entsteht ein Echo auf der Stimme — und Sprache mit Echo ist sofort unverständlich, weil jeder Laut sich über den folgenden legt. Der Mechanismus ist derselbe wie beim Nachhall, nur dass die zweite Quelle hier ein Lautsprecher ist und keine Wand.
Daraus wird ein sehr konkreter Prüfschritt für die Inbetriebnahme: Wer wissen will, ob die Gruppensynchronisation einer Anlage wirklich sauber ist, prüft sie im Übergangsbereich zwischen zwei Zonen mit einem Sprachbeitrag, nicht mit Musik. Musik verzeiht an dieser Stelle so viel, dass ein Fehler unentdeckt bleibt, bis der erste Podcast läuft.
Warum verschiedene Übertragungswege verschieden große Zeitversätze erzeugen und wo die Grenze zwischen einer gepufferten Zuspielung und einer Echtzeitübertragung verläuft, behandelt Multiroom-Plattform oder Audio over IP. Wie sich Laufzeiten gezielt ausgleichen lassen, steht bei Delay; warum zwei zeitversetzte Quellen zusätzlich den Klang verfärben, beim Kammfiltereffekt.
Der ehrliche Vergleich: Handy, Kopfhörer, System
Bei Musik konkurriert ein MultiRoom-System mit fast nichts — niemand beschallt seine Küche ernsthaft mit dem Handylautsprecher. Bei Sprache konkurriert es mit dem Handy in der Tasche und mit dem Kopfhörer, und beides ist kostenlos und schon da. Diese Frage verdient deshalb eine Antwort und keine Werbung.
Wofür das System spricht. Die Ohren bleiben frei — Türklingel, Kind, Gespräch, überkochender Topf; man bleibt im Raum anwesend. Das Gerät darf weggelegt werden, was in Bad, Küche und Garten mehr wert ist, als es klingt. Und die Verständlichkeit ist bei niedrigerer Lautstärke besser, weil ein ordentlich platzierter Lautsprecher gegen Nachhall und Störgeräusche antritt, wofür einem Handylautsprecher schlicht der Grundton und der Pegel fehlen. Dazu kommt, was nur ein System kann: zu zweit denselben Beitrag hören, und ihn beim Gang durchs Haus mitnehmen, ohne ein Gerät in der Hand zu halten.
Wo es ehrlich verliert. Außer Haus ist Schluss — Pendeln, Bahn, Spaziergang bleiben Kopfhörer-Territorium, und das System ist dort keine Ergänzung, sondern schlicht nicht vorhanden. Der Kopfhörer hat außerdem ein Argument, das mit Technik nichts zu tun hat: Privatsphäre. Podcastinhalte sind persönlicher als Musik. Wer Sendungen über Therapie, Politik, Gesundheit oder Kriminalfälle hört, will nicht zwangsläufig, dass die halbe Familie mithört — und ein Lautsprecher im Flur trifft diese Entscheidung für alle im Haus mit. Drittens ist die Bedienung ungleich: Die Podcast-App auf dem Handy kann alles, eine MultiRoom-Oberfläche meistens deutlich weniger.
Das System ist damit eine Ergänzung, kein Ersatz. Wer das anders verkauft, wird nach zwei Wochen widerlegt, weil der Nutzer dann wieder zum Handy greift.
Der praktische Knackpunkt liegt nicht in der Akustik
Der größte Unterschied zu Musik ist gar kein akustischer. Bei Musik ist der Einstiegspunkt egal, bei einem Wortbeitrag ist er alles. Wer morgens im Bad zwanzig Minuten gehört hat, will im Auto an derselben Stelle weiterhören und abends in der Küche ebenfalls. Diese Fortschritts-Synchronisation über Geräte hinweg gibt es bei Musik nicht, und sie entscheidet in der Praxis darüber, ob ein System für Sprachwiedergabe taugt.
Dazu kommen Bedienfunktionen, die in musikzentrierten Oberflächen schlicht nicht vorgesehen sind: dreißig Sekunden zurück, Kapitelmarken, Wiedergabegeschwindigkeit, eine Warteschlange, „später hören". Die MultiRoom-Plattformen sind um Musik herum gebaut, und was davon je Plattform vorhanden ist, unterscheidet sich erheblich.
Grenzen und Sonderfälle
Tiefbass ist für Sprache gleichgültig, die Abstimmung nicht. Für einen Podcast braucht niemand einen Subwoofer. Eine auf Fülle gezogene Abstimmung macht Stimmen jedoch dröhnig, und eine Zielkurve, die leiser Musikwiedergabe schmeichelt, ist für Sprache nicht automatisch richtig. Ein System, das je Zone oder je Quelle unterschiedlich abgestimmt werden kann, hat hier einen echten Vorteil — ob eine konkrete Plattform das kann, ist eine Produktfrage.
Warum Dialoge bei leisem Hören zuerst leiden, ist eine Eigenschaft des Gehörs und nicht des Raums; das behandelt Menschliches Hören und Lautheit.
Die Zielwerte für Sprachzonen sind offen. Der Glossareintrag Sprachverständlichkeit führt die Frage nach den AVITECT-Korridoren für C50, STI und den zulässigen Grundgeräuschpegel als offenen Punkt. Diese Seite kann deshalb begründen, was zu tun ist, aber nicht, bis zu welchem Zahlenwert.
Diese Seite erklärt das Warum, nicht das Wie. Wie eine Zone zugeschnitten, gruppiert und bedient wird, entscheiden die MultiRoom-Kapitel; hier steht, was an Sprache anders ist und warum sich das auf diese Entscheidungen auswirkt.
In der Planung
Ein offener Wohn-Ess-Koch-Bereich, dazu Bad, Ankleide und Flur. Die Bauherren hören morgens Nachrichten, tagsüber Podcasts, abends Musik.
Die Konzeptfrage steht vor jeder Zonenaufteilung: In welchen Räumen ist Sprache eine wesentliche Nutzung — und nicht nur ein gelegentlicher Nebengebrauch? Wo die Antwort ja lautet, ist Sprache der bestimmende Fall für die Auslegung dieser Zone, nicht Musik. Das ist eine andere Reihenfolge als üblich und die einzige Entscheidung dieser Seite, die wirklich zählt.
Das Verfahren, das daraus folgt, hat drei Teile: mehr und kleinere Quellen näher an den Aufenthaltsorten statt einer lauten Hauptquelle; Quellen, die breit abstrahlen, damit der Verständlichkeitsbereich nicht an einer Stelle endet, an der man regelmäßig steht; und ein nüchterner Blick auf den Grundgeräuschpegel, der sich manchmal banal senken lässt. Die Absorptionsfläche, die diese Räume ohnehin gut vertragen, kommt hinzu — siehe Absorption und Nachhallzeit.
Die Gerätewahl steht am Ende, und die Antwort ist häufiger eine Frage der Anzahl und der Platzierung als der Baugröße. Und eine Prüfung gehört in die Inbetriebnahme: einmal einen Wortbeitrag über zwei benachbarte Zonen laufen lassen und im Übergangsbereich zuhören. Das dauert zwei Minuten und findet Fehler, die Musik nicht zeigt.
Verknüpfte Inhalte
Die Kennzahlen der Verständlichkeit — C50, STI, Störgeräusch — stehen bei Sprachverständlichkeit; die Aufteilung des Schallfelds behandeln Direktschall und Diffusfeld und der Hallradius. Warum Dialoge bei leisem Hören zuerst leiden, erklärt Menschliches Hören und Lautheit. Die Werkzeuge gegen den Nachhall sind Absorption und Nachhallzeit, die Beschreibung der Bündelung das Bündelungsmaß und Horn und Waveguide. Warum ein Zeitversatz zwischen zwei Zonen entsteht und wie er sich ausgleichen lässt, klären Multiroom-Plattform oder Audio over IP, Audio over IP, Delay und der Kammfiltereffekt. Als Profilfrage im Hörprofil führt der HiFi-Guide das Thema im Kapitel Wie hörst Du Musik? ein.
Quellen
Die Lautheitswerte, die Formatzuordnung und die Feststellung, dass Sprache bei gleicher gemessener Lautheit 2 bis 3 dB lauter empfunden wird als Musik, stammen aus dem technischen Dokument AESTD1008 der Audio Engineering Society vom 24. September 2021, das im Volltext eingesehen wurde; das zugrunde liegende Messverfahren ist in ITU-R BS.1770 festgelegt und hier nur über den Katalog erfasst. Die raumakustischen Kennzahlen sind im Glossareintrag Sprachverständlichkeit belegt und werden auf dieser Seite bewusst ohne Zahlenwerte verwendet, weil die dortigen Normzuordnungen selbst noch am Normtext zu prüfen sind. Der Zuschnitt der Seite und die Haltung zum Vergleich mit Handy und Kopfhörer gehen auf einen internen Entscheid zurück.