Zum Inhalt
Tastatur
  • Hilfe anzeigen?
  • Untermenü öffnen↓ / Space
  • Untermenü schließenEsc
  • Studio finden→ Studio
Tiefe
Fortgeschritten

Binaurale Wiedergabe von Mehrkanalton über Kopfhörer

Wie kommt Mehrkanalton über zwei Kopfhörerwandler an das Ohr — und woran hängt es, ob die nachgebildeten Richtungen überzeugen?

Ein Kopfhörer hat zwei Wandler, ein Filmton fünf, elf oder mehr Kanäle. Die Brücke dazwischen ist eine Rechnung: Ein Renderer setzt an jede Position des gemeinten Lautsprecherlayouts eine virtuelle Quelle, filtert sie mit der kopfbezogenen Übertragungsfunktion für genau diese Richtung und fasst alles zu zwei Ohrsignalen zusammen. Was Du hörst, ist also die Nachbildung eines Kinos, das nie im Zimmer stand — und wie überzeugend sie ausfällt, hängt an drei Größen, die mit dem Preis des Kopfhörers wenig zu tun haben.

Im Kino stehen Lautsprecher rundherum und teilweise an der Decke. Mit Kopfhörern hast Du zwei kleine Wandler, links und rechts, und trotzdem soll der Hubschrauber von schräg oben hinten kommen. Möglich wird das, weil Dein Gehör Richtungen ohnehin nur aus dem Unterschied zwischen den beiden Ohrsignalen abliest. Ein Rechenwerk verbiegt den Ton deshalb genau so, wie ihn ein Lautsprecher an dieser Stelle verbogen hätte, bevor er in die Kopfhörer geht. Links, rechts und ringsum klappt das ordentlich. Oben und hinten bleibt es eine Wette, weil das Rechenwerk mit fremden Ohren rechnet und nicht mit Deinen.

Was nachgebildet wird: ein Lautsprecherlayout

Der Ausgangspunkt ist immer eine Menge von Richtungen. Wie ein Filmton oder eine Musikproduktion diese Richtungen mitbringt, legt die Rundfunknorm ITU-R BS.2051 in drei Formen fest, die auch nebeneinander in einer Produktion vorkommen dürfen:

  • kanalbasiert — jeder Kanal gehört zu einer festen Lautsprecherposition. Die Norm listet die Layouts von System A (0+2+0, also gewöhnliches Stereo) bis System J (4+7+0) mit Azimut und Elevation je Kanal auf; das vertraute 5.1 ist darin System B (0+5+0).
  • objektbasiert — die Elemente liegen einzeln vor, dazu Metadaten, die ihre Position beschreiben und sich über die Zeit ändern dürfen. Ein Renderer erzeugt daraus die Signale, die zum jeweiligen Abspielsystem passen.
  • szenenbasiert — beschrieben wird das Schallfeld als Ganzes, ohne jeden Bezug auf Lautsprecher. Ausgespielt wird es später auf ein Ziel-Layout oder eben auf Kopfhörer; die bekannteste Ausprägung ist Ambisonics.

Für die Kopfhörerwiedergabe führt dieselbe Norm eine eigene Ausgabekonfiguration: System Z mit den beiden Kanälen für linkes und rechtes Ohr. Bemerkenswert daran ist eine Leerstelle in der Tabelle — für diese beiden Kanäle stehen bei Azimut und Elevation keine Winkel, sondern der Vermerk, dass die Angaben hier nicht anwendbar sind. Genau das ist der Kern der Sache: Ein Kopfhörerkanal hat keine Richtung. Die Richtung entsteht erst in der Filterung, und was gefiltert wird, ist die Position, die ein Lautsprecher gehabt hätte.

Daraus folgt die Reihenfolge, die den Rest dieser Seite bestimmt. Zuerst steht fest, welches Layout gemeint ist. Dann rechnet ein Renderer für jede dieser Positionen ein Ohrsignalpaar. Erst danach kommt der Kopfhörer ins Spiel, und der bestimmt nur noch, wie sauber die beiden fertigen Signale ans Trommelfell kommen.

Der Raum ist eine getrennte Entscheidung

Die reine Richtungsfilterung liefert eine Szene ohne jede Umgebung — sauber geortet und trotzdem oft eigentümlich nah, weil kein einziges Echo dazugehört. Deshalb legen viele Verfahren zusätzlich die Akustik eines gedachten Raums darüber: frühe Reflexionen und Nachhall eines Kinos oder eines Regieraums, gerechnet für jede virtuelle Lautsprecherposition. Erst dieser Zusatz schiebt die Szene aus dem Kopf heraus nach vorn.

Der Preis dafür ist ein fremder Raum. Was hinzugerechnet wird, ist die Akustik eines Saals, den Du nicht kennst, und sie lässt sich nicht mehr abziehen. Wer eine Aufnahme genau beurteilen will, schaltet den Zusatz deshalb ab; wer entspannt einen Film sehen will, lässt ihn meist an.

Wovon das Ergebnis abhängt

Die Filterdaten passen selten zu Deinen Ohren

Ein Renderer arbeitet mit einem mitgelieferten Satz kopfbezogener Übertragungsfunktionen, gewonnen an einem Messkopf oder als Mittelwert vieler Probanden. Wie weit fremde Daten reichen, ist gemessen und im Eintrag HRTF im Einzelnen belegt: Die Ortung nach links und rechts übersteht sie weitgehend, während Verwechslungen zwischen vorn und hinten sowie zwischen oben und unten deutlich zunehmen. Die Ursache liegt in der Mechanik — Laufzeit und Pegel hängen an der Kopfbreite, die sich von Mensch zu Mensch wenig unterscheidet, die Klangfärbung dagegen an der Form der Ohrmuschel, die sich stark unterscheidet.

Für Mehrkanalton heißt das etwas sehr Konkretes: Die Surroundkanäle funktionieren, die Höhenkanäle sind die Wette. Wer eine Kopfhörer-Virtualisierung beurteilen will, hört deshalb zuerst auf die Höhe — dort zeigt sich die schwächste Stelle des Verfahrens, und wie grob das Gehör Höhe ohnehin auflöst, führt die vertikale Ortung aus.

Einige Hersteller passen ihr Profil inzwischen an den Kunden an, meist über Fotos oder eine Vermessung der Ohren. Das verbessert den Datensatz, während das Verfahren und seine Grenzen bleiben, wo sie sind.

Wie viel der Renderer über die Richtungen weiß

Der zweite Hebel liegt vor der Filterung. Bekommt der Renderer die Objekte mit ihren Positionsmetadaten, kennt er jede Richtung genau und kann sie einzeln behandeln. Bekommt er eine fertige Kanalmischung, kennt er nur die Positionen des Layouts, für das gemischt wurde. Und bekommt er einen Stereo-Downmix, weil die Kette irgendwo vorher zusammengefaltet hat, dann gibt es keine Richtungen mehr, die sich nachbilden ließen — was dann als „räumlich" ausgegeben wird, ist eine Verbreiterung ohne Information dahinter.

Deshalb entscheidet der Weg des Signals mit über das Ergebnis, und die Trägerformate sind der Ort, an dem dieser Weg festgelegt wird. Welche Fassung eines Films tatsächlich mit Objekten ankommt und welche nur als Kernmischung, behandeln die Dolby-Atmos-Trägerformate.

Wo gerechnet wird

Binaural rechnen kann fast jede Station der Kette: die App im Zuspielgerät, ein Streaming-Empfänger, das AV-Gerät in seinem Kopfhörermodus, eine Spielkonsole oder der Kopfhörer selbst mit eigenem Rechenwerk. Die Norm bildet genau das ab — im Empfangsgerät steht die binaurale Ausgabe neben der Ausgabe auf ein Lautsprecherlayout, als Aufgabe des Geräts und nicht der Produktion.

Der praktische Befund daraus ist der wichtigste Satz dieser Seite: Gerechnet werden darf an genau einer Stelle. Läuft die Virtualisierung im Zuspieler und im Kopfhörer gleichzeitig, filtert die zweite Rechnung ein Signal, in dem die Richtungsmerkmale schon eingebrannt sind. Das Ergebnis wird dumpf, die Ortung verwischt, und die Ursache ist von außen unsichtbar, weil beide Geräte für sich genommen funktionieren. Wenn eine Anlage über Kopfhörer schlechter klingt als erwartet, lohnt dieser Blick vor jedem Gerätetausch.

Häufige Missverständnisse

„Binaural heißt Kunstkopf." Ein Kunstkopf ist der aufgenommene Weg zu zwei Ohrsignalen, hier geht es um den gerechneten. Beide zielen auf dasselbe Signalpaar, unterscheiden sich aber in einem entscheidenden Punkt: Die Aufnahme hat eine Kopfhaltung fest eingebrannt, die Rechnung kann einer Kopfdrehung folgen. Wie das im Einzelnen abläuft, steht beim Binauralton.

„Dafür brauche ich ein bestimmtes Tonformat." Die Nachbildung setzt an den Richtungen an, gleich woher sie kommen — aus Kanälen eines Layouts, aus Objekten mit Metadaten oder aus einer szenenbasierten Beschreibung. Ein objektbasiertes Format liefert dem Renderer mehr Information und damit meist das bessere Ergebnis, es ist aber keine Voraussetzung. Umgekehrt garantiert das Logo auf der Verpackung nichts, solange nicht feststeht, was tatsächlich beim Renderer ankommt.

„Damit kann ich mir die Deckenlautsprecher sparen." Für einen Hörer allein am Abend ist die Nachbildung ernsthaft geeignet, und die Decke bleibt unberührt — für Mietwohnungen ist das oft die einzige Lösung. Sobald zwei Menschen auf dem Sofa sitzen, gilt die Rechnung nur noch für den einen, der den Kopfhörer aufhat. Und die Richtung, die im Heimkino den Ausschlag gibt, ist ausgerechnet die unsicherste.

Abgrenzung zum szenenbasierten Ton

Ambisonics und die Kopfhörer-Virtualisierung werden oft in einem Atemzug genannt und liegen doch auf verschiedenen Seiten der Kette. Ambisonics ist eine Darstellungsform: eine Beschreibung des Schallfelds an einem Punkt, die noch offenlässt, worauf sie später ausgespielt wird. Die binaurale Wiedergabe ist die Ausgabeseite: zwei Ohrsignale, gleich aus welcher Darstellungsform sie entstanden sind. Die Norm sagt es an einer Stelle unmissverständlich — szenenbasierte Signale lassen sich auf ein Ziel-Lautsprecherlayout oder auf Kopfhörer rendern.

Praktisch begegnen sich beide deshalb häufig, ohne dasselbe zu sein: Der Ton einer 360-Grad-Videoplattform kommt szenenbasiert an und wird binaural ausgegeben. Für die Wiedergabe zu Hause zählt trotzdem der zweite Teil, denn dort steht die Frage, welches Gerät die zwei Ohrsignale errechnet.

In der Planung

Eine Mietwohnung, Betondecke, Höhenkanäle sind nicht zu haben, und abends soll trotzdem ein Film laufen, ohne die Nachbarn zu wecken. Die Frage kommt als Gerätefrage an: Welcher Kopfhörer kann Atmos?

Vorher ist zu klären, wer hört und wie oft. Für eine Person, die zwei- bis dreimal die Woche allein einen Film sieht, ist der Kopfhörerweg eine ernsthafte zweite Lösung neben der Anlage. Für einen Haushalt, der abends zu dritt vor dem Fernseher sitzt, ist er es nicht — dann gehört das Geld in den Grundton der vorhandenen Lautsprecher.

Daraus folgt die Verfahrensfrage: An welcher Stelle wird gerechnet? Wer ohnehin über den Fernseher oder einen Streaming-Empfänger zuspielt, lässt dort rendern und schaltet die Virtualisierung im Kopfhörer ab. Wer den AV-Prozessor als Mittelpunkt nutzt, prüft, ob dessen Kopfhörermodus das Mehrkanalsignal überhaupt binaural aufbereitet oder nur zusammenfaltet — und ob dabei eine Raumkorrektur mitläuft, die gegen einen Raum rechnet, den es auf diesem Weg nicht gibt.

Am Ende steht das Gerät, und es entscheidet weniger, als der Kunde erwartet: Gebraucht wird ein Kopfhörer, der die zwei fertigen Signale sauber überträgt und dessen elektrische Passung zum Ausgang stimmt; was dabei zu beachten ist, steht im Kopfhörer-Wiedergabeweg. Eine zweite Virtualisierung im Kopfhörer ist an dieser Stelle kein Mehrwert, und drahtlose Zuspielung bringt eine Verzögerung mit, die beim Film sofort auffällt.

Grenzen und Sonderfälle

Ein Platz, ein Hörer. Die Rechnung gilt für den Kopf, der den Kopfhörer aufhat. Über Lautsprecher lässt sich dasselbe Ziel mit der Übersprechkompensation verfolgen, und dann kehrt die Platzbindung als Sweet Spot zurück.

Der Tiefton bleibt eine halbe Sache. Ein Kopfhörer kann tief hinunter Pegel liefern und trotzdem nicht das erzeugen, was ein Subwoofer im Raum an Körper und Möbeln anregt. Der Effektkanal einer Filmmischung verliert dadurch einen Teil seiner Wirkung, unabhängig davon, wie gut die Richtungen nachgebildet sind.

Pegel und Dynamik verschieben sich. Eine Mehrkanalmischung ist für einen Raum mit Pegelreserve gemischt. Am Ohr fehlt der Abstand, und leise Passagen verleiten zum Aufdrehen. Was die verschiedenen Lautstärkeautomatiken einer Filmtonkette hier anrichten, ist von außen schwer zu durchschauen.

Vergleichen ist schwer. Zwei Verfahren lassen sich kaum sauber gegeneinander hören, weil sie meist an verschiedene Geräte, Formate und Lautstärken gebunden sind. Ein Urteil aus einem Forum sagt deshalb noch weniger über die eigene Erfahrung aus als bei Lautsprechern — dort steht wenigstens der Raum als gemeinsame Größe dazwischen.

Verknüpfte Inhalte

Was Kopf, Ohrmuschel und Oberkörper mit einem Signal machen und wie weit fremde Filterdaten reichen, steht bei der HRTF; der aufgenommene Weg zu denselben zwei Ohrsignalen beim Binauralton. Die layoutunabhängige Beschreibung eines Schallfelds führt Ambisonics aus, den Weg über Lautsprecher die Übersprechkompensation. Warum gewöhnliches Stereo Richtungen zwischen zwei Lautsprechern erzeugt, erklärt die Phantomschallquelle, warum Höhe die unsicherste Richtung ist, die vertikale Ortung. Was am System für den Kopfhörer vorzusehen ist, behandelt der Kopfhörer-Wiedergabeweg; welche Fassung eines Films mit Objekten ankommt, die Dolby-Atmos-Trägerformate.

Quellen

Die Einteilung in kanal-, objekt- und szenenbasierten Ton, die Lautsprecherlayouts von System A bis System J und der Kopfhörer als eigene Ausgabekonfiguration System Z stammen aus der Empfehlung ITU-R BS.2051-3 vom Mai 2022, die für diese Seite im Volltext eingesehen wurde; dort steht auch, dass szenenbasierte Signale wahlweise auf ein Lautsprecherlayout oder auf Kopfhörer gerendert werden und dass diese Rechnung im Empfangsgerät stattfindet. Das zugehörige Metadatenmodell ist als ITU-R BS.2076 genormt, von dem nur der Verzeichniseintrag geprüft wurde. Die Wahrnehmungsaussagen — Robustheit der Horizontalortung, Zunahme der Vorn-hinten- und Oben-unten-Verwechslungen bei fremden Filterdaten — sind in den verlinkten Glossareinträgen mit ihren Primärquellen belegt und werden hier nicht wiederholt.

Tastaturkürzel