Zum Inhalt
Tastatur
  • Hilfe anzeigen?
  • Untermenü öffnen↓ / Space
  • Untermenü schließenEsc
  • Studio finden→ Studio
Tiefe
Fortgeschritten

Videokompression im Transport (JPEG XS, JPEG 2000, H.264/H.265)

Welches Kompressionsverfahren darf in einer AV-over-IP-Strecke stehen — und was kostet mich die Entscheidung an Verzögerung, Bandbreite und Bildqualität?

Ein 4K-Bild mit 60 Hz und voller Farbauflösung erzeugt mehr Daten, als ein Zehn-Gigabit-Netz durchlässt. Deshalb komprimiert jede AV-over-IP-Strecke — die Frage ist nicht ob, sondern wie stark und mit welchem Verfahren. Und diese Entscheidung ist keine Bildqualitätsfrage allein: Sie legt fest, wie viel Verzögerung in der Kette steckt, wie sich ein gestörtes Paket auswirkt und wie oft das Signal auf dem Weg noch angefasst werden darf.

Ein Video besteht aus vielen Einzelbildern. Um es durch eine Leitung zu bekommen, wird es kleiner gerechnet — ähnlich wie ein Foto, das man als kleinere Datei speichert. Dabei gibt es zwei Wege. Der eine behandelt jedes Bild für sich: Das geht schnell, spart aber weniger. Der andere merkt sich, was sich von Bild zu Bild geändert hat: Das spart enorm, braucht aber Zeit, weil das Gerät mehrere Bilder gleichzeitig ansehen muss. Diese Zeit merkst Du, wenn Du eine Taste drückst und das Bild erst danach reagiert — oder wenn der Ton nicht mehr zu den Lippen passt.

Die eigentliche Trennlinie: einzeln oder aufeinander bezogen

Die vier Namen in der Überschrift verstellen den Blick auf die einzige Unterscheidung, aus der sich alles ableiten lässt.

Intra-Frame-Verfahren codieren jedes Bild für sich. Der Encoder braucht kein anderes Bild, um zu arbeiten, und der Decoder auch nicht. JPEG XS und JPEG 2000 gehören zu dieser Gruppe. Die Folge ist eine sehr kurze Verzögerung — im günstigsten Fall beginnt die Übertragung, bevor das Bild überhaupt fertig eingelesen ist.

Inter-Frame-Verfahren beziehen Bilder aufeinander. Sie speichern ein vollständiges Bild und danach nur noch die Unterschiede, oft über Gruppen von mehreren Dutzend Bildern hinweg. H.264 und H.265 arbeiten so. Die Ersparnis ist gewaltig, weil sich zwischen zwei aufeinander folgenden Bildern meistens wenig ändert. Der Preis ist ebenso systematisch: Der Encoder muss mehrere Bilder puffern, bevor er senden kann, und der Decoder ebenfalls, bevor er anzeigen kann.

Alles Weitere folgt aus dieser Bauweise, und zwar drei Dinge:

Erstens die Verzögerung, wie eben beschrieben. Zweitens das Verhalten bei Störungen: Geht bei einem Intra-Verfahren ein Paket verloren, ist ein Bild oder ein Bildausschnitt betroffen und das nächste wieder sauber. Bei einem Inter-Verfahren betrifft der Verlust auch alle Bilder, die auf das beschädigte aufbauen — das ist der Grund für die typischen, über Sekunden nachwirkenden Blockmuster. Drittens die Mehrfachcodierung: Jeder weitere Durchlauf durch einen Encoder addiert die Verzögerung und die Artefakte. Bei Intra-Verfahren ist das verkraftbar, bei Inter-Verfahren summiert es sich schnell zu einer sichtbaren Verschlechterung.

Die vier Verfahren, mit belegten Zahlen

JPEG XS — gebaut für die Verzögerung, nicht für die Ersparnis

JPEG XS ist als Normenreihe ISO/IEC 21122 in fünf Teilen veröffentlicht. Bemerkenswert an diesem Verfahren ist sein Auslegungsziel: Das JPEG-Komitee benennt ausdrücklich nicht maximale Kompressionseffizienz als Zweck, sondern sehr geringe Verzögerung und geringe Implementierungskomplexität, und positioniert JPEG XS als Ersatz für unkomprimiertes Video.

Die Zahlen dazu: Das Komitee gibt eine Ende-zu-Ende-Verzögerung von wenigen Zeilen an, also einem Bruchteil eines Bildes. Der zugehörige IETF-Entwurf für das RTP-Transportformat wird konkreter und nennt eine Spanne von einer kleinen Anzahl Zeilen bis unter eine einzelne Zeile. Typische Kompressionsverhältnisse liegen bei visuell verlustfreier Qualität im Bereich von 2:1 bis 10:1, je nach Ausgangsmaterial.

Zur Einordnung: Eine Zeile eines 4K-Bildes bei 60 Hz dauert grob 7,7 Mikrosekunden. Eine Verzögerung von „wenigen Zeilen" liegt damit in einer Größenordnung, die sich in der Bedienung einer Anlage nicht mehr bemerkbar macht.

JPEG 2000 — der Standard der Rundfunkzuführung

JPEG 2000 ist das ältere Intra-Verfahren und in der Rundfunkzuführung seit Langem etabliert. Für die Übertragung über IP gibt es eine Empfehlung des Video Services Forum, TR-01 vom April 2013, und die ist für die Einordnung nützlicher als der Normtext selbst, weil sie die zulässigen Betriebspunkte festlegt.

Vorgeschrieben ist dort das Broadcast Contribution Single Tile Profile nach ITU-T T.800 Amd 3, bei dem jedes Halbbild oder Vollbild als ein einziges Tile codiert wird. Die Bitraten sind eng gefasst: Für SD mindestens 25 und höchstens 200 Mbit/s, für HD mindestens 75 und höchstens 200 Mbit/s, für 3G-Material mindestens 100 und höchstens 400 Mbit/s. Das Bild wird dabei mit 4:2:2-Farbunterabtastung bei 10 Bit codiert — also bereits mit reduzierter Farbauflösung, bevor die eigentliche Kompression greift.

Zur Verzögerung enthält TR-01 einen aufschlussreichen Hinweis: Weil die genauen Codestream-Größen beider Halbbilder eines Vollbildes vor dem Senden feststehen müssen, ist beim Zeilensprungverfahren auf der Encoderseite eine zusätzliche Feldperiode Pufferverzögerung zu erwarten, und zwar zusätzlich zur eigentlichen Codierverzögerung. Das ist die Sorte Detail, die in Werbeunterlagen fehlt und in der Anlage zählt.

H.264 und H.265 — die Ersparnis kostet Zeit

H.264 (ITU-T H.264, zugleich ISO/IEC 14496-10) und H.265 (ITU-T H.265, zugleich ISO/IEC 23008-2, erstmals 2013) sind die Verfahren, die aus dem Fernsehen, den Streamingdiensten und den Videoportalen bekannt sind. Sie sind Inter-Frame-Verfahren und sparen entsprechend viel: Das Fraunhofer Heinrich-Hertz-Institut, das an der Entwicklung beider Standards beteiligt war, gibt für H.265 gegenüber H.264 rund 50 % Bitratenersparnis bei gleicher subjektiver Bildqualität an.

Für die AV-Verteilung im Haus sind sie die Verfahren mit dem größten Bandbreitengewinn und der größten Verzögerung. Wie groß die Verzögerung ausfällt, hängt an der Umsetzung — an der Länge der Bildgruppe, an der Verwendung rückwärts bezogener Bilder, an der Puffergröße im Decoder. Deshalb steht hier keine Zahl.

Was Verzögerung in einer Anlage tatsächlich bedeutet

Der Begriff „Latenz" wird gern verwendet, ohne zu sagen, woran man sie merkt. Es sind drei verschiedene Dinge, und sie haben verschiedene Toleranzen.

Die Reaktion auf Bedienung. Zwischen dem Druck auf eine Taste und der sichtbaren Reaktion liegt die Verzögerung der ganzen Kette. Das stört nicht bei einem Film, sehr wohl aber bei allem, was Rückmeldung braucht — Menüs, Videospiele, eine Kamera, deren Bild jemand steuert.

Die Zeitlage von Ton und Bild. Hier gibt es belastbare Zahlen: Die Empfehlung ITU-R BT.1359-1 nennt Erkennbarkeitsschwellen von etwa +45 ms bis −125 ms und Akzeptanzschwellen von etwa +90 ms bis −185 ms, wobei ein positiver Wert bedeutet, dass der Ton dem Bild vorauseilt. Die Asymmetrie ist bemerkenswert und hat eine natürliche Ursache: Ton erreicht uns in der Wirklichkeit immer nach dem Bild, weil Schall langsamer ist als Licht — Ton, der zu früh kommt, fällt deshalb viel schneller auf. Für die Anlage heißt das: Ein Bildweg, der Zeit kostet, ist nicht das Problem, solange der Ton mitgezogen wird. Zum Problem wird er, wenn Bild und Ton verschiedene Wege nehmen.

Der Gleichlauf mehrerer Bildschirme. Zwei Displays, die dasselbe zeigen und nebeneinander sichtbar sind, müssen dasselbe zur selben Zeit zeigen. Innerhalb einer Plattform ist das gelöst; über Plattformgrenzen hinweg — ein Bildschirm am Netz, einer über eine direkte Strecke — ist es das nicht.

Daraus folgt die Regel, die in der Planung wirklich zählt: Nicht die absolute Verzögerung entscheidet, sondern ihr Unterschied zwischen zwei Wegen, die gleichzeitig sichtbar oder hörbar sind. Eine Anlage, deren Wege alle dieselbe Verzögerung haben, bleibt unauffällig, selbst wenn diese Verzögerung beträchtlich ist. Eine Anlage, in der ein Weg schnell und ein zweiter langsam ist, wird an ihrem Unterschied gemessen — und sobald dieser Unterschied die Schwellen oben überschreitet, ist er sichtbar oder hörbar.

Wann welche Klasse vertretbar ist

Die Zuordnung ist keine Rangfolge von gut nach schlecht, sondern eine Zuordnung von Anforderung zu Verfahren.

Anforderung im RaumPassende KlasseWarum
Kino, Referenzbild, große Flächeunkomprimiert oder Intra mit geringem VerhältnisFläche und Sitzabstand machen Artefakte sichtbar; Nachbearbeitung im Prozessor verträgt keine Vorschädigung
Bedienung mit Rückmeldung, SpieleIntra, kurze Verzögerungdie Reaktionszeit ist das Kriterium, nicht die Bandbreite
Wohnbereich, Nebenraum, Kücheleicht komprimiert (Intra)Betrachtungsabstand und Fläche verzeihen; 1-Gigabit-Netz reicht
Anzeige ohne Interaktion, FernanzeigeInter (H.264/H.265)Verzögerung ist gleichgültig, Bandbreite entscheidet

Der praktische Bezugspunkt dazu: Eine verbreitete Plattform der mittleren Klasse arbeitet über Gigabit-Ethernet und nennt für 4K60 eine Mindestbitrate von 350 Mbit/s bei einem festen Bereich von 200 bis 950 Mbit/s. Gegen die rund 11,9 Gbit/s, die dasselbe Bild unkomprimiert erzeugt, entspricht das etwa 13:1 bis 34:1 — also deutlich mehr Kompression, als das JPEG-Komitee für visuell verlustfreie Qualität angibt. Am oberen Ende der Skala nennt die SDVoE Alliance für ihre Plattform eine Transportverzögerung unter 100 Mikrosekunden. Die Herleitung der Datenrate und die Plattformübersicht stehen bei AV over IP und werden hier nicht wiederholt.

Grenzen und Sonderfälle

Kompressionsverhältnisse sind nicht vergleichbar, solange das Ausgangsformat offen ist. Ein Verhältnis von 10:1 auf ein 4:2:2-Signal mit 10 Bit ist etwas anderes als 10:1 auf ein 4:4:4-Signal mit 8 Bit — das erste hat bereits vor der Kompression Farbinformation verloren. Wer zwei Angaben vergleichen will, braucht beide Ausgangsformate dazu.

„Visuell verlustfrei" ist eine Aussage über Wahrnehmung, nicht über Daten. Das Bild kommt nicht identisch an; es sieht unter den angenommenen Betrachtungsbedingungen so aus. Ändern sich die Bedingungen — größere Fläche, kürzerer Abstand, Standbild mit feiner Struktur —, ändert sich die Aussage mit.

Kaskadierte Codierung ist der unterschätzte Fall. Ein Signal, das aus einem Streamingdienst kommt (dort bereits mit H.265 codiert), anschließend über eine AV-over-IP-Strecke läuft (erneut codiert) und in einem Videoprozessor skaliert wird, hat drei Verarbeitungsstufen hinter sich. Jede einzelne mag unauffällig sein; die Summe ist es nicht zwangsläufig.

Das Netz gehört zur Rechnung. Die Bitrate der Strecke ist nur die halbe Anforderung; die andere Hälfte sind die Multicast-Eigenschaften des Switches. Was dort verlangt wird, steht bei AV over IP, die Mechanik der Gruppenverteilung im künftigen Eintrag zu Multicast und IGMP.

Bild und Ton getrennt geführt. Läuft der Ton über eine eigene Audioplattform und das Bild über die Netzverteilung, entstehen zwei Wege mit unterschiedlicher Verzögerung — genau der Fall, den die Zeitlage-Empfehlung oben adressiert. Die Ausgleichsmöglichkeiten behandelt Delay; die Tonseite der Technik steht bei Audio over IP.

In der Planung

Ein Haus mit Kino im Untergeschoss, Fernsehern in Wohnzimmer, Küche und Außenbereich sowie einer Kamera am Eingang, deren Bild auf jedem Gerät erscheinen soll.

Die Konzeptfrage lautet nicht „welcher Codec", sondern: Welcher Raum setzt den Maßstab, und welche Wege sind gleichzeitig wahrnehmbar? Der Kinoraum setzt den Maßstab für die Bildqualität; die Kombination aus Küche und angrenzendem Wohnzimmer setzt den Maßstab für den Gleichlauf, weil man von einem Raum in den anderen sehen kann.

Daraus folgt die Verfahrensfrage mit genau einer Achse, und sie ist dieselbe wie bei der Netzverteilung insgesamt: Wie viel Kompression ist im Kino zulässig? Aus dieser Antwort folgen Transport, Switch-Klasse und ein erheblicher Teil des Budgets. Die Kamera am Eingang ist dabei kein Gegenargument — sie darf ruhig stark komprimiert übertragen werden, weil niemand sie neben dem Filmbild betrachtet.

Erst danach kommen die Geräte, und dann lohnt eine Zwischenfrage, die regelmäßig übersehen wird: Muss der Kinoweg überhaupt durch das Netz? Eine direkte Strecke zum Projektor umgeht die Kompressionsfrage vollständig, und der Projektor sieht ohnehin immer dieselbe Quelle.

Verknüpfte Inhalte

Die übergeordnete Seite ist AV over IP — dort stehen die Datenratenrechnung, die Plattformen und die Anforderungen an den Switch. Warum eine Multiroom-Plattform etwas völlig anderes ist als eine AV-over-IP-Strecke, klärt Multiroom-Plattform oder Audio over IP; die Tonseite derselben Technik behandelt Audio over IP. Die Punkt-zu-Punkt-Alternative ohne Kompression ist HDBaseT, die direkte Kabelstrecke behandeln die HDMI-Kabelklassen. Wie sich Verzögerungen ausgleichen lassen, steht bei Delay; warum Plattform, Transport und Medium getrennt gehören, bei Signalwege und ihre Ebenen.

Quellen

Die Auslegungsziele, die Normteile und die Verzögerungs- und Kompressionsangaben zu JPEG XS stammen vom JPEG-Komitee und aus dem IETF-Entwurf für das RTP-Transportformat; letzterer ist ein Arbeitsdokument und kein verabschiedeter Standard. Profil, Bitraten, Farbunterabtastung und der Hinweis auf die zusätzliche Feldperiode Pufferverzögerung bei JPEG 2000 stehen in der Empfehlung TR-01 des Video Services Forum vom 15. April 2013. Die Bitratenersparnis von H.265 gegenüber H.264 ist eine Angabe des Fraunhofer Heinrich-Hertz-Instituts, das an der Entwicklung beider Standards beteiligt war; die Normtexte selbst wurden nicht eingesehen. Die Schwellen für die Zeitlage von Ton und Bild stammen aus der Empfehlung ITU-R BT.1359-1 aus dem Jahr 1998, die im Volltext eingesehen wurde. Bitraten einer leicht komprimierten Plattform und die Verzögerungsangabe der oberen Klasse sind Herstellerangaben.

Tastaturkürzel