Zum Inhalt
Tastatur
  • Hilfe anzeigen?
  • Untermenü öffnen↓ / Space
  • Untermenü schließenEsc
  • Studio finden→ Studio
Tiefe
Fortgeschritten

HRTF (kopfbezogene Übertragungsfunktion) und binaurales Hören

Was ist eine HRTF — und warum hört Dein Gehör aus zwei Ohrsignalen eine Richtung heraus?

Die kopfbezogene Übertragungsfunktion beschreibt, wie Kopf, Ohrmuschel und Oberkörper ein Schallsignal auf dem Weg zum Trommelfell verändern — und zwar für jede Einfallsrichtung anders. Genau diese richtungsabhängige Filterwirkung ist das Material, aus dem Dein Gehör die Richtung einer Schallquelle errechnet. Binaurales Hören ist der Vorgang selbst: Ortung aus dem Vergleich zweier Ohrsignale.

Deine beiden Ohren bekommen nie ganz denselben Schall: Was von links kommt, erreicht das linke Ohr früher und lauter, weil der Kopf dazwischen im Weg ist. Und Deine Ohrmuscheln färben den Klang je nachdem, ob etwas von vorne, von oben oder von hinten kommt — deshalb hörst Du einen Vogel über Dir, ohne hinzusehen. Dein Gehirn hat diese Färbungen ein Leben lang gelernt, und zwar die von Deinen eigenen Ohren. Wenn ein Kopfhörer Dir vorspielt, ein Hubschrauber sei über Dir, rechnet er genau solche Färbungen ins Signal hinein — nur eben die von jemand anderem, meist von einem nachgebauten Kopf aus dem Labor. Deshalb klappt links und rechts gut, oben und hinten weniger gut.

Ausführliche Erklärung

Aus zwei Ohrsignalen entsteht ein einziger Richtungseindruck, und mehr Material hat das Gehör nicht. Alles, was es über die Richtung einer Quelle wissen kann, muss im Unterschied zwischen diesen beiden Signalen stecken — und dieser Unterschied entsteht an Deinem eigenen Körper, bevor der Schall das Trommelfell erreicht.

Was Kopf und Körper aus dem Signal machen

Der Kopf ist rund 17 Zentimeter breit. Kommt der Schall von der Seite, legt er bis zum abgewandten Ohr einen längeren Weg zurück; der Laufzeitunterschied liegt in der Größenordnung einer halben Millisekunde. Der Kopf schattet außerdem ab, aber das nur bei kurzen Wellenlängen: Bei 2 Kilohertz ist eine Schallwelle 17 Zentimeter lang und der Kopf damit ein echtes Hindernis, bei 200 Hertz sind es 1,7 Meter und die Welle läuft praktisch ungestört um ihn herum. Deshalb liefert tiefer Schall vor allem einen Laufzeit-, hoher Schall vor allem einen Pegelunterschied. Beschrieben hat dieses Paar von Merkmalen der britische Physiker John William Strutt, Lord Rayleigh, 1907 im Philosophical Magazine.

Beide Merkmale sagen allerdings nur etwas über den Winkel zur Kopfachse — und der ist mehrdeutig. Eine Quelle schräg vorn links und eine schräg hinten links liefern denselben Laufzeit- und Pegelunterschied; dasselbe gilt für oben und unten. Alle diese Punkte liegen auf einem Kegel um die Ohrachse, dem Verwechslungskegel. Für die Auflösung innerhalb dieses Kegels reicht der Ohrvergleich nicht.

Warum die Ohrmuschel die zweite Hälfte erledigt

Hier kommt die Ohrmuschel ins Spiel. Ihre Falten und Kanten sind wenige Zentimeter groß, und Wellenlängen in dieser Größenordnung — also im oberen Frequenzbereich ab einigen Kilohertz — werden an ihnen reflektiert und überlagern sich mit dem direkten Anteil. Je nachdem, aus welcher Richtung der Schall eintrifft, entstehen dabei Anhebungen und Auslöschungen an anderen Stellen des Spektrums. Diese Klangfärbung ist das Richtungsmerkmal für oben, unten, vorn und hinten; wie genau das Gehör die Höhe daraus abliest und wie grob es dabei auflöst, steht bei der vertikalen Ortung. Schulter und Rumpf steuern bei tieferen Frequenzen eigene Reflexionen bei.

Die Summe aus allem — Laufzeit, Kopfschatten, Ohrmuschelfärbung, Rumpfreflexionen — für eine bestimmte Richtung und ein bestimmtes Ohr ist die kopfbezogene Übertragungsfunktion. Zu einem Menschen gehört deshalb ein ganzer Satz solcher Funktionen: je Ohr und je Richtung eine. Im Zeitbereich heißt dieselbe Größe kopfbezogene Impulsantwort, kurz HRIR; es ist dieselbe Information in anderer Darstellung.

Weil sich Ohrmuscheln von Mensch zu Mensch stark in Form und Faltung unterscheiden, ist dieser Satz für jeden ein anderer — und Dein Gehör hat sich über Jahre auf Deinen eingestellt.

Wie eine HRTF gemessen und gespeichert wird

Gemessen wird mit Mikrofonen in den Gehörgängen — eines realen Menschen oder eines Messkopfs mit nachgebildeten Ohrmuscheln. Der bekannteste frei verfügbare Datensatz stammt von Bill Gardner und Keith Martin, die 1994 am MIT Media Laboratory einen KEMAR-Messkopf vermessen haben: ein Lautsprecher in 1,4 Metern Abstand, 710 Positionen von 40 Grad unter bis 90 Grad über der Ohrebene, angeregt mit Maximalfolgen und aufgezeichnet mit 44,1 Kilohertz. Herausgekommen ist für jede Position ein Paar von Impulsantworten — links und rechts.

Für den Austausch solcher Datensätze gibt es seit 2015 ein genormtes Format: SOFA, standardisiert von der Audio Engineering Society als AES69 und seither zweimal fortgeschrieben. Eine SOFA-Datei hält HRTFs ebenso wie binaurale Raumimpulsantworten. Praktisch heißt das: Wenn ein Kopfhörer oder eine Software „eigene HRTF-Profile laden" anbietet, ist meistens genau dieses Dateiformat gemeint.

Wo HRTFs in Geräten arbeiten

Drei Anwendungen begegnen Dir im Wohnbereich. Erstens die Kopfhörer-Virtualisierung: Sie faltet jeden Tonkanal mit der HRTF für die Richtung, aus der er kommen soll, und gibt das Ergebnis auf beide Hörer. Der Kopfhörer ist dafür der ideale Fall, weil er jedem Ohr ohnehin sein eigenes Signal gibt.

Zweitens die Virtualisierung über Lautsprecher — die Höhen- und Surround-Effekte einer Soundbar ohne Treiber in diese Richtungen. Hier kommt ein zweiter Schritt dazu, denn über Lautsprecher hört jedes Ohr beide Kanäle. Dolby beschreibt für seine Soundbar-Virtualisierung genau diese Kombination: HRTF-Verarbeitung und Übersprechkompensation, gerechnet für einen Sitzplatz.

Drittens die binaurale Aufnahme mit einem Kunstkopf, bei der die Filterwirkung nicht gerechnet, sondern beim Aufnehmen physisch mitgenommen wird — wie das im Einzelnen abläuft, steht beim Binauralton.

Warum fremde HRTFs die Ortung verwaschen

Individuell vermessen wird in der Praxis fast nie. Geräte rechnen mit einem Durchschnittsprofil oder mit den Daten eines Messkopfs — also mit fremden Ohren. Wie weit das reicht, hat eine Arbeitsgruppe um Elizabeth Wenzel am NASA Ames Research Center 1993 untersucht: Sechzehn unerfahrene Hörer sollten Richtungen benennen, einmal im Freifeld und einmal über Kopfhörer, virtualisiert mit der HRTF einer fremden Person.

Das Ergebnis fällt in zwei Hälften auseinander, und genau diese Teilung ist der Punkt. Rechnet man die Verwechslungen heraus, war die Ortung bei zwölf der sechzehn Hörer so genau wie im Freifeld — die Horizontalrichtung überstand die fremde HRTF also gut. Die Verwechslungen selbst nahmen dagegen deutlich zu: vorn gegen hinten, oben gegen unten. Die Autoren führen das darauf zurück, dass die interauralen Merkmale robust sind, während die spektralen Merkmale verzerrt werden, die eine Richtung auf dem Verwechslungskegel festlegen. Das passt zur Mechanik: Laufzeit und Pegel hängen an der Kopfbreite, die sich von Mensch zu Mensch wenig unterscheidet, die Klangfärbung dagegen an der Ohrmuschelform, die sich stark unterscheidet.

Für die Beurteilung virtualisierter Wiedergabe heißt das: Eine glaubwürdige Breite ist realistisch, eine stabile Höhe und ein sicheres Hinten sind es weniger. Wer im Vorführraum zuerst auf die Höhe achtet, prüft die schwächste Stelle des Verfahrens.

Häufiges Missverständnis

„HRTF ist ein Klangeffekt, den man einschalten kann." Die HRTF ist ein Messdatensatz, kein Verfahren. Sie beschreibt Ohren, so wie ein Frequenzgang einen Lautsprecher beschreibt. Was Geräte einschalten, ist eine Verarbeitung, die diesen Datensatz anwendet — bei Kopfhörern die Faltung, bei Lautsprechern zusätzlich die Übersprechkompensation. Der Unterschied wird praktisch, sobald ein Hersteller HRTF-Anpassung bewirbt: Verbessert wird dann der Datensatz, nicht das Verfahren, und die Grenzen des Verfahrens bleiben, wo sie sind.

Ein zweiter Irrtum sitzt umgekehrt: „Ohne persönlich vermessene HRTF klingt Virtualisierung nicht." Die Studienlage ist differenzierter: Die Horizontalabbildung übersteht eine fremde HRTF weitgehend, Höhe und die Unterscheidung vorn/hinten leiden. Wer den Kopfhörer für die räumliche Weite eines Konzertmitschnitts nutzt, hat davon wenig; wer die Deckenlautsprecher eines Kinos ersetzen will, stößt an die Grenze.

Nicht zu verwechseln mit

  • Binaurale Raumimpulsantwort (BRIR): enthält zusätzlich den Raum mit seinen Reflexionen und dem Nachhall. Die HRTF beschreibt allein den Weg um Kopf und Ohr; erst zusammen mit einem Raum entsteht der Eindruck, in einem bestimmten Saal zu sitzen.
  • Übersprechkompensation: das Rechenverfahren, das Lautsprechern die Kopfhörer-Trennung verschafft. Es braucht eine HRTF als Grundlage und ist selbst keine.
  • Frequenzgang eines Kopfhörers: eine Eigenschaft des Wandlers, gemessen am Messkopf. Er sagt nichts über die Ohren dessen, der ihn aufsetzt.
  • Phantomschallquelle: der Ortungseindruck zwischen zwei realen Lautsprechern. Er entsteht aus Pegel- und Laufzeitunterschieden der Kanäle, ohne dass ein Gerät eine HRTF anwenden müsste.

In der Planung

Ein Kunde wohnt in einer Mietwohnung mit Betondecke und möchte Höhenkanäle, ohne bohren zu dürfen. Im Gespräch fällt der Satz, ein neuer Kopfhörer könne „Atmos mit HRTF".

Bevor ein Gerät ins Spiel kommt, ist zu klären, wer hört und auf wie vielen Plätzen. Für eine Person, die abends allein Filme sieht, ist der Kopfhörerweg ernsthaft geeignet — jedes Ohr bekommt sein eigenes Signal, die Virtualisierung arbeitet unter besten Bedingungen, und die Decke bleibt unberührt. Für zwei Plätze auf dem Sofa fällt dieselbe Antwort anders aus: Über Lautsprecher braucht die Virtualisierung zusätzlich die Übersprechkompensation, und die stimmt nur an dem Platz, für den sie gerechnet wurde — der zweite Sitzplatz hört etwas anderes.

Erst danach kommt die Verfahrensfrage, und die entscheidet sich am Anspruch an die Höhe. Wenn der Kunde vor allem Weite und Umhüllung sucht, hält die Virtualisierung, was sie verspricht. Wenn er den Regeneffekt von oben erwartet, gehört der ehrliche Hinweis dazu, dass genau diese Richtung die unsicherste ist, weil sie an fremden Ohrmuscheln hängt. Manchmal ist die richtige Empfehlung dann, den Höhenanspruch zurückzustellen und das Budget in die Grundtonlage zu stecken — und die Geräteauswahl kommt zuletzt, nicht zuerst.

Verknüpfte Inhalte

Wie zwei Lautsprecher trotz Übersprechen eine Richtung erzeugen, steht bei der Phantomschallquelle; wie man das Übersprechen rechnerisch entfernt, bei der Übersprechkompensation. Warum die zuerst eintreffende Wellenfront die Ortung bestimmt, erklärt das Gesetz der ersten Wellenfront. Warum ausgerechnet die Höhe die unsicherste Richtung ist, vertieft die vertikale Ortung; wie eine Aufnahme die Filterwirkung gleich mitnimmt, der Binauralton. Wo die Platzbindung solcher Verfahren herkommt, zeigt der Sweet Spot; wie virtualisierende Geräte im Wohnzimmer aussehen, die Soundbar.

Quellen

Die Zuschreibung des Merkmalpaars Laufzeit- und Pegelunterschied geht auf Lord Rayleighs Aufsatz „On our perception of sound direction" von 1907 zurück; für diese Seite wurde nur der bibliografische Datensatz geprüft, nicht der Volltext. Die Angaben zur Messung stammen von der Begleitseite des KEMAR-Datensatzes, den Bill Gardner und Keith Martin 1994 am MIT Media Laboratory aufgenommen haben. Format und Normung (SOFA, AES69) stehen auf der Projektseite der SOFA-Konventionen; der Normtext selbst antwortete auf zwei Abrufversuche mit einer Sperre und ist ungesichtet. Die Befunde zu fremden HRTFs — genaue Horizontalortung, deutlich mehr Vorn-hinten- und Oben-unten- Verwechslungen — stammen aus der Arbeit von Elizabeth Wenzel und Kollegen im Journal of the Acoustical Society of America von 1993, aus deren vollständiger Zusammenfassung; der Volltext liegt hinter einer Bezahlschranke. Dass virtualisierende Soundbars HRTF-Verarbeitung und Übersprechkompensation kombinieren und für den Sitzplatz rechnen, gibt Dolby in seinem Weißbuch zu Soundbar-Anwendungen von 2018 an.

Tastaturkürzel