Zum Inhalt
Tastatur
  • Hilfe anzeigen?
  • Untermenü öffnen↓ / Space
  • Untermenü schließenEsc
  • Studio finden→ Studio
Tiefe
Fortgeschritten

Szenenbasierter Ton und Ambisonics höherer Ordnung

Was ist szenenbasierter Ton — und warum ist Ambisonics kein Heimkino-Format?

Szenenbasierter Ton ist die dritte Darstellungsform neben Kanal und Objekt: Der Inhalt liegt als Satz von Koeffizientensignalen vor, die zusammen das Schallfeld an einem Punkt beschreiben. Erst bei der Wiedergabe errechnet ein Renderer daraus die Signale für die Lautsprecher, die tatsächlich vorhanden sind — oder für Kopfhörer. Ambisonics höherer Ordnung ist der bekannteste Fall dieser Form.

Denk an den Unterschied zwischen einem normalen Foto und einem 360-Grad-Panorama. Das Foto zeigt einen festen Ausschnitt — so speichert klassischer Filmton den Klang fertig für bestimmte Lautsprecher. Das Panorama speichert die ganze Umgebung, und erst beim Ansehen wird der passende Ausschnitt berechnet, egal auf welchem Bildschirm. Genauso speichert diese Technik den Klang rund um einen Punkt, und Dein Gerät rechnet aus, was davon aus jedem Lautsprecher oder Kopfhörer kommen soll. Im Wohnzimmer begegnet Dir das selten — aber wenn Du am Handy ein 360-Grad-Video ansiehst und sich der Ton beim Drehen mitdreht, ist genau das am Werk.

Ausführliche Erklärung

Die ITU-Empfehlung BS.2051 kennt drei Darstellungsformen für Ton: kanalbasiert, objektbasiert und szenenbasiert. Die ersten beiden erklärt die Seite zum objektbasierten Ton; hier geht es um die dritte, die im Handel fast nie erwähnt wird und trotzdem zur Systematik gehört.

Was ein Koeffizientensignal ist

Ein Kanal hat eine Adresse (den Lautsprecher hinten links), ein Objekt hat eine Position (schräg über Dir). Ein Koeffizientensignal hat beides nicht. Es ist das Gewicht einer räumlichen Grundform — mathematisch einer Kugelflächenfunktion —, und erst alle Signale zusammen beschreiben das Schallfeld an einem Punkt: Das erste erfasst den Schalldruck ungerichtet, die nächsten drei die Anteile entlang der drei Raumachsen, weitere verfeinern die Richtungsauflösung.

Daraus ergibt sich auch der Name: Je mehr solcher Grundformen verwendet werden, desto feiner löst die Szene Richtungen auf. Die Zahl der Signale wächst mit dem Quadrat — die erste Ordnung kommt mit vier Signalen aus, die zweite braucht neun, die dritte sechzehn. Alles oberhalb der ersten Ordnung heißt Ambisonics höherer Ordnung. Das Prinzip ist deutlich älter als jedes Heimkino-Format: Michael Gerzon beschrieb es 1973 im Journal of the Audio Engineering Society.

Warum die Darstellung vom Layout unabhängig bleibt

Kanalbasierter Ton legt sich in der Produktion auf ein Layout fest, objektbasierter Ton beschreibt einzelne Elemente mit Positionsangabe. Szenenbasierter Ton speichert das Ergebnis am Hörpunkt selbst — und überlässt der Wiedergabeseite, wie sie es herstellt. Die Norm nennt die Produktion ausdrücklich von der Wiedergabe entkoppelt: Dieselbe Szene lässt sich auf zwei Lautsprecher rendern, auf zweiundzwanzig oder auf Kopfhörer, ohne dass jemand neu mischt.

Eine zweite Eigenschaft folgt aus derselben Mathematik: Die ganze Szene lässt sich vor dem Rendern drehen, mit wenig Rechenaufwand und ohne Qualitätsverlust. Genau deshalb hat die Form ihren Platz dort gefunden, wo sich der Hörer dreht — unter einer VR-Brille und im 360-Grad-Video, wo der Kopf die Blickrichtung laufend ändert und der Ton folgen muss.

Wo die Form heute vorkommt — und wo nicht

Im Alltag steckt szenenbasierter Ton vor allem in drei Ecken. Erstens im 360-Grad-Video: Googles Spezifikation für räumliches Audio schreibt dafür Ambisonics vor, in der Praxis erster Ordnung mit vier Kanälen und festgelegter Kanalreihenfolge; ein zusätzliches kopffestes Stereopaar für Musik und Kommentar ist vorgesehen. Zweitens in der VR, aus demselben Grund. Drittens in der Produktion: Eine Szene, die einmal als Schallfeld vorliegt — etwa aus einem Ambisonics-Mikrofon mit mehreren Kapseln —, lässt sich später auf jedes Ziel rendern, ohne die Aufnahme zu wiederholen.

Als Filmton im Wohnzimmer kommt die Form dagegen nicht an. Disc und Streaming liefern kanal- oder objektbasierte Tonspuren; eine Lieferkette, die eine szenenbasierte Spur bis in den AV-Receiver bringt, gibt es im Heimkino heute nicht. Wenn Dir Ambisonics zu Hause begegnet, dann eingebettet: Die App auf dem Handy oder der VR-Brille rendert die Szene selbst und gibt fertigen Stereo- oder Kopfhörerton aus.

Einen Berührungspunkt mit dem Heimkino gibt es trotzdem, nur an anderer Stelle: Trinnov führt sein Remapping nach eigener Angabe auf die Ambisonics-Forschung der Firmengründer zurück. Das ist Mathematik im Prozessor, die vorhandene Kanäle auf reale Lautsprecherpositionen umrechnet — keine szenenbasierte Tonspur, die ins Haus käme.

Häufiges Missverständnis

„Ambisonics ist ein Konkurrenzformat zu Dolby Atmos, das sich nicht durchgesetzt hat." Der Vergleich sitzt auf der falschen Ebene. Atmos ist ein vermarktetes Format samt Lieferkette von der Mischung bis zum Wohnzimmer; szenenbasierter Ton ist eine Darstellungsform, so wie „kanalbasiert" eine ist. Die Norm stellt alle drei Formen nebeneinander und erlaubt sogar, sie im selben Programm zu mischen. Und durchgesetzt hat sich Ambisonics durchaus — nur nicht im Heimkino, sondern dort, wo seine Stärke zählt: überall, wo sich der Hörer zur Szene dreht.

Nicht zu verwechseln mit

  • Objektbasierter Ton: getrennte Elemente mit Positions-Metadaten, die ein Renderer verteilt. Die Szene kennt keine Elemente mehr, nur das Feld, das sie gemeinsam erzeugen.
  • Upmixer: errechnet aus einer fertigen kanalbasierten Mischung Signale für mehr Lautsprecher. Es entsteht keine layoutunabhängige Beschreibung, nur eine breitere Verteilung.
  • Wellenfeldsynthese: will das Schallfeld physisch über große Lautsprecherzeilen in einer Fläche nachbauen. Ambisonics beschreibt das Feld an einem Punkt und rendert es auf wenige Lautsprecher.
  • Binaurale Aufnahme (Kunstkopf): zwei Kanäle mit fest eingebrannter Kopfperspektive. Eine Ambisonics-Szene wird erst beim Abspielen auf die aktuelle Kopfdrehung gerechnet.

In der Planung

Ein Kunde plant einen Kinoraum und nutzt daneben eine VR-Brille; im Beratungsgespräch fällt die Frage, ob der neue Prozessor „Ambisonics können" muss. Auf welchem Weg erreichen die Inhalte den Raum? Filmton kommt kanal- oder objektbasiert an — dafür ist die Prozessorwahl ohnehin ausgelegt. Die 360-Grad- und VR-Inhalte rendert die jeweilige App auf dem Abspielgerät selbst und liefert fertigen Ton aus. Damit beantwortet sich die Verfahrensfrage von allein: Es gibt keine Stelle in der Kette, an der der Prozessor eine szenenbasierte Spur decodieren müsste. Auf die Geräteliste hat der Begriff also keinen Einfluss: Begegnet er Dir als Kaufargument, brauchst Du ihm für diesen Raum nicht zu folgen.

Verknüpfte Inhalte

Was Kanäle und Objekte unterscheidet und was ein Renderer tut, steht auf der Seite zum objektbasierten Ton; was die Ziffern eines Aufbaus bedeuten, bei der Kanal-Notation. Wie aus einer fertigen Mischung mehr Kanäle werden, erklärt der Upmixer — das Gegenstück aus der Alltagspraxis. Den Heimkino-Berührungspunkt der Ambisonics-Forschung behandelt die Seite zum Trinnov-Remapping.

Quellen

Die Definition des szenenbasierten Tons — Koeffizientensignale als Gewichte räumlich orthogonaler Basisfunktionen, Rendern auf Layout oder Kopfhörer, Produktion von der Wiedergabe entkoppelt, Ambisonics höherer Ordnung als Beispiel — stammt aus der Empfehlung ITU-R BS.2051-2 vom Juli 2018. Kanalzahl je Ordnung, Kanalreihenfolge und das kopffeste Stereopaar im 360-Grad-Video stehen in Googles Spezifikation für räumliches Audio. Die Ursprungsarbeit ist Michael Gerzons Aufsatz „Periphony: With-Height Sound Reproduction" von 1973; der Volltext liegt hinter der AES-Bezahlschranke und wurde für diese Seite nicht eingesehen, die Seite stützt keine Aussage darauf.

Tastaturkürzel