Inhalt anzeigen
- Tiefe
- Fortgeschritten
Dither bei der Quantisierung
Was ist Dither — und warum wird einem Audiosignal vor dem Runden absichtlich Rauschen zugemischt?
Dither ist ein schwaches Rauschen, das einem Audiosignal absichtlich zugemischt wird, bevor sein Wert auf eine gröbere Stufung gerundet wird. Ohne diese Beimischung hängt der Rundungsfehler unmittelbar vom Signal ab und wird bei leisen Passagen als Verzerrung hörbar; mit ihr wird daraus ein gleichmäßiges Rauschen, das dem Signal nicht mehr folgt.
Immer wenn Musik in eine Datei oder in ein kleineres Zahlenformat gerundet wird, bleibt ein winziger Rest übrig. Rundet ein Gerät stur, folgt dieser Rest der Musik und wird an leisen Stellen als Zerren oder Kratzen hörbar. Deshalb mischt man vorher ein sehr leises Zischen dazu, das den Rest durcheinanderbringt. Danach ist der Fehler ein ruhiges Grundrauschen, wie es jeder Verstärker ohnehin hat — und ruhiges Rauschen überhört Dein Ohr mühelos, während es krummes Zerren sofort bemerkt. Bei normaler Lautstärke hörst Du davon nichts: Das Rauschen liegt weit unter dem, was in einem ruhigen Wohnraum ohnehin an Geräusch da ist.
Ausführliche Erklärung
Ohne Dither ist der Fehler kein Rauschen
Quantisierung rundet jeden Abtastwert auf die nächstgelegene Stufe. Was dabei übrig bleibt, ist der Quantisierungsfehler; er wird höchstens eine halbe Stufe groß und wiederholt sich periodisch mit dem Eingangswert. Eine solche Stufe heißt in Datenblättern und Messnormen niederwertigstes Bit, englisch abgekürzt LSB. Solange das Signal groß und unruhig genug ist im Vergleich zu einer Stufe, verhält sich dieser Rest wie ein zufälliges Rauschen — so beschreibt es das klassische Modell, das der Ingenieur Bernard Widrow 1956 in seiner Dissertation am MIT ausgearbeitet hat. Auf diesem Modell beruht die vertraute Rechnung, nach der jedes zusätzliche Bit den Abstand zum Rauschen um rund sechs Dezibel vergrößert.
Bei kleinen oder einfachen Signalen versagt das Modell, und zwar deutlich. Der Fehler ist rechnerisch eine feste Funktion des Eingangs, und was fest mit dem Signal zusammenhängt, kommt am Ausgang als Verzerrung heraus. Der Übersichtsaufsatz von Stanley Lipshitz, Robert Wannamaker und John Vanderkooy von der Audio Research Group der University of Waterloo führt das an einem simulierten Sinus von einem Kilohertz und vier Stufen Spitze-Spitze vor: Im Spektrum des Ausgangs stehen scharfe Linien bei Vielfachen der Sinusfrequenz. Dazu kommen Linien, die zu keiner Harmonischen passen, weil Verzerrungsprodukte oberhalb der halben Abtastrate in den hörbaren Bereich zurückfallen.
Zwei Dinge werden daraus hörbar. Erstens die Verzerrung selbst, die dem Signal folgt und deshalb genau dann auftritt, wenn sonst wenig los ist. Zweitens die Rauschmodulation: Der Störteppich schwankt mit dem Pegel, statt ruhig zu liegen. Das Ohr bemerkt beides sehr viel eher als ein gleichmäßiges Rauschen desselben Pegels, und genau darum geht es beim Dither.
Was beigemischt wird — und wie viel
Das Dither-Signal wird vor dem Quantisierer addiert. Es ist nicht irgendein Rauschen: Seine Wahrscheinlichkeitsverteilung entscheidet darüber, welche Eigenschaften des Fehlers vom Signal unabhängig werden. Die Waterloo-Gruppe hat zwei Fälle durchgerechnet, die bis heute die praktisch relevanten sind.
Ein gleichverteiltes Rauschen von einer Quantisierungsstufe Spitze-Spitze macht den mittleren Fehler für jeden Eingangswert null. Die Verzerrung verschwindet damit, die Kennlinie ist begradigt. Die Leistung des Fehlers bleibt aber vom Signal abhängig und schwankt zwischen null und dem Dreifachen des Modellwerts — die Rauschmodulation bleibt also, und die Autoren bezeichnen sie ausdrücklich als hörbar unerwünscht.
Ein dreieckverteiltes Rauschen von zwei Stufen Spitze-Spitze entsteht, indem man zwei unabhängige gleichverteilte Rauschsignale von je einer Stufe addiert. Damit sind Mittelwert und Leistung des Gesamtfehlers für jeden Eingangswert gleich; die Fehlerleistung liegt konstant beim Dreifachen des Modellwerts. Die Arbeit weist dieses Dither als eindeutig und optimal in einem klar umrissenen Sinn aus: Unter allen Dither-Signalen, die sowohl die eingangsabhängige Verzerrung als auch die Rauschmodulation beseitigen, kostet es den kleinsten Zuwachs an Rauschen. Für die meisten Anwendungen mit Mehrbit-Requantisierung empfehlen die Autoren genau diese Form.
In Gerätemenüs und Datenblättern stehen für die beiden Formen meist die englischen Abkürzungen: RPDF für die gleichverteilte (rectangular probability density function) und TPDF für die dreieckverteilte (triangular probability density function). Wer im Menü eines Zuspielers oder einer Software vor dieser Wahl steht, wählt für Audio TPDF.
| Verfahren | Verzerrung | Rauschmodulation | Fehlerleistung |
|---|---|---|---|
| ohne Dither | bleibt | bleibt | im Modell einfach, in Wahrheit signalabhängig |
| gleichverteilt, eine Stufe | beseitigt | bleibt | schwankt zwischen null und dem Dreifachen |
| dreieckverteilt, zwei Stufen | beseitigt | beseitigt | konstant das Dreifache |
Dass diese Wahl nicht bloß eine Lehrmeinung ist, zeigt die Messnorm: AES17 schreibt für Messungen an digitalem Audiogerät ein Dither mit dreieckiger Verteilung und zwei Stufen Spitze-Spitze vor, erzeugt aus der Summe zweier gleichverteilter Zufallsfolgen von je einer Stufe. Wer Messwerte vergleicht, vergleicht damit Ketten, die dasselbe Dither gesehen haben.
Der Preis in Dezibel
Die dreifache Fehlerleistung sind rund 4,8 Dezibel mehr Rauschen. Bei 16 Bit rückt der rechnerische Störabstand damit von etwa 96 auf gut 91 Dezibel — die Größe, die auf der Seite zu Abtastrate und Bittiefe als theoretischer Grenzwert steht, ist also der Wert vor dem Dither, den eine reale Kette knapp verfehlt.
Klar ist damit auch der Einwand: Ein Verfahren, das den Störabstand um fast fünf Dezibel verschlechtert, klingt zunächst nach einem schlechten Geschäft. Er hält nur nicht stand, weil das Ohr Fehlerarten unterschiedlich bewertet. Ein gleichmäßiges, vom Signal unabhängiges Rauschen wird als Grundgeräusch eingeordnet und ausgeblendet; eine dem Signal folgende Verzerrung und ein mit dem Pegel atmender Störteppich fallen dagegen auf, weil sie sich bewegen. In den Hörversuchen der Waterloo-Gruppe fand sich mit dreieckverteiltem Dither kein Fall, in dem der Fehler hörbar von einem stetigen weißen Rauschen zu unterscheiden war — die Autoren bezeichnen diese Versuche allerdings selbst als informell und halten formale Tests für nötig.
Rauschformung verteilt das Rauschen um
Rauschformung, meist Noise Shaping genannt, ist der nächste Schritt und ein anderer Hebel: Sie verringert die Fehlerenergie nicht, sondern verschiebt sie über die Frequenz. Eine Rückkopplung um den Quantisierer drückt Energie aus dem Bereich, in dem das Gehör am empfindlichsten ist, in die oberen Oktaven. Die Gesamtleistung steigt dabei sogar, der hörbare Anteil sinkt trotzdem. Dieselben drei Autoren haben 1991 Filter veröffentlicht, deren Verlauf an der Hörschwelle ausgerichtet ist.
Das Prinzip steckt auch in der Messnorm: AES17 erlaubt neben dem Standard-Dither eines mit zur Höhe hin steigender spektraler Dichte. Unbewertet gemessen ist die Amplitude beider identisch, bewertet gemessen fällt das geformte besser aus — weil in der Mitte des Hörbereichs weniger Energie liegt und das Bewertungsfilter oben abfällt. Genau diese Differenz zwischen unbewerteter und bewerteter Messung ist der ganze Gewinn der Rauschformung. Eine einzelne Störabstandszahl im Datenblatt bildet ihn deshalb nicht ab: Über die Verteilung des Rauschens im Hörbereich schweigt sie.
Warum Geräte nicht subtraktiv dithern
Es gibt eine Bauform, bei der das Dither-Signal am Ausgang wieder abgezogen wird. Sie ist theoretisch die sauberste: Der Gesamtfehler wird vollständig unabhängig vom Eingang, und der Rauschzuwachs bleibt kleiner. Dafür muss die Gegenstelle genau dieselbe Zufallsfolge kennen. In einer Wiedergabekette aus Streamer, Prozessor und Wandler ist das nicht gegeben, und deshalb ist alles, was hier praktisch vorkommt, die nicht subtraktive Form — jene, für die die Zahlen oben gelten.
Häufiges Missverständnis
„Dither fügt Rauschen hinzu, macht die Sache also schlechter." Der Pegel des Störteppichs steigt tatsächlich, und zwar messbar. Was sinkt, ist seine Hörbarkeit: Aus einem Fehler, der dem Signal folgt und mit ihm atmet, wird ein stehendes Grundrauschen. Wer nur auf die Zahl im Datenblatt sieht, sieht die Verschlechterung und nicht den Gewinn — was ein guter Grund ist, Störabstandsangaben ohne die Frage nach dem Verfahren mit Vorsicht zu lesen.
„Dither ist Studiosache." Die Beimischung gehört überall dorthin, wo eine Wortbreite kleiner wird, und das passiert auch nach der Produktion: wenn ein Zuspieler eine 24-Bit-Datei für einen Eingang mit 16 Bit aufbereitet, wenn eine Raumkorrektur oder eine Lautstärkeregelung intern mit großer Wortbreite rechnet und das Ergebnis am Ende auf die Wortbreite des Wandlers zurückführt. Jede dieser Stellen ist eine Requantisierung mit denselben Eigenschaften wie die erste.
„Bei 24 Bit kann man sich das sparen." Der Gedanke geht in die richtige Richtung; seine übliche Begründung stimmt trotzdem nicht. Bei großer Wortbreite liegt der Rundungsfehler unter dem Eigenrauschen der analogen Schaltung — und dieses Rauschen wirkt selbst als Dither, sofern es groß genug ist. Der Übersichtsaufsatz nennt genau das als praktischen Normalfall analoger Signale und Wandlerschaltungen. Die Beimischung ist dann keine Pflichtübung mehr; entscheidend bleibt sie dort, wo rein digital gerechnet und gerundet wird, denn dort gibt es kein Eigenrauschen, das die Arbeit übernimmt.
Nicht zu verwechseln mit
- Quantisierungsrauschen: Der Fehler selbst, den das Runden hinterlässt. Dither ist das Mittel, das ihn in echtes Rauschen verwandelt — die beiden Begriffe stehen also auf verschiedenen Seiten desselben Vorgangs. Was die Wortbreite mit dem Störabstand zu tun hat, steht bei Abtastrate und Bittiefe.
- Rauschformung (Noise Shaping): Verteilt die Fehlerenergie über die Frequenz um, statt dem Signal etwas beizumischen. Beides wird gemeinsam eingesetzt und bleibt trotzdem getrennt zu betrachten.
- Jitter: Ein Fehler auf der Zeitachse — die Abtastwerte kommen zum falschen Zeitpunkt, nicht mit dem falschen Wert. Die Zusammenhänge dazu stehen bei Jitter.
- Abtastratenwandlung: Ändert die Zahl der Abtastwerte je Sekunde, nicht die Stufung ihrer Werte, siehe Abtastratenwandler.
- Dithering im Bild: Dieselbe Idee, anderer Gegenstand — dort bricht ein feines Rauschen die sichtbaren Stufenkanten in Farbverläufen auf, siehe Bittiefe im Videosignal.
In der Planung
Ein Kunde meldet, dass leise Klavierausklänge und Filmdialoge in ruhigen Szenen „rau" klingen, während laute Passagen tadellos sind. Das Muster passt zu einem ungeditherten Rundungsschritt, weil dessen Fehler genau dann relativ groß wird, wenn das Signal klein ist.
Die erste Frage ist trotzdem keine Gerätefrage, sondern die nach der Kette: An welcher Stelle wird die Wortbreite überhaupt kleiner? In einer typischen Anlage kommen dafür drei Stellen infrage — der Zuspieler, wenn er eine hochauflösende Datei für einen Eingang mit kleinerer Wortbreite aufbereitet; die Signalverarbeitung im Verstärker, wenn Raumkorrektur, Bassmanagement und Lautstärkeregelung ihr Ergebnis auf die Wortbreite des Wandlers zurückführen; und eine Zwischenstrecke, die auf ein Format mit fester Wortbreite umsetzt.
Dann das Verfahren: An der gefundenen Stelle gehört ein Dither dazu, oder die Wortbreite bleibt dort besser unangetastet. Häufig ist der schnellste Weg, die Verkleinerung ganz zu vermeiden — die Quelle in der Wortbreite ausgeben zu lassen, die der nachfolgende Eingang annimmt, statt sie zweimal umrechnen zu lassen. Und zuletzt kommt das Gerät: Welches Glied die Umsetzung übernimmt und ob es dabei dithert, lässt sich meist nur über die Einstellungen und den Support des Herstellers klären.
Verknüpfte Inhalte
Warum die Wortbreite überhaupt einen Störabstand ergibt und was die Zahlen 16 und 24 Bit in der Praxis bedeuten, steht bei Abtastrate und Bittiefe im Audiosignal. Wie viel von diesem Abstand im Wohnraum nutzbar ist, führt der Dynamikumfang aus, und wo die untere Grenze im Raum tatsächlich liegt, der Grundgeräuschpegel. Wo im Gerät gerundet wird, klären DSP und DAC.
Quellen
Die Aussagen zu den Dither-Verteilungen, zu den Momenten des Gesamtfehlers und zum Zuwachs von 4,8 Dezibel stammen aus dem Übersichtsaufsatz von Lipshitz, Wannamaker und Vanderkooy im Journal der Audio Engineering Society vom Mai 1992, der für diese Seite am Objekt gelesen wurde. Die Festlegung des Mess-Dithers auf eine dreieckige Verteilung mit zwei Stufen Spitze-Spitze und die zulässige Form mit steigender spektraler Dichte stehen in AES17, § 4.2.5; gelesen wurde die Revision von 1998 in der Fassung von 2004. Das klassische Modell der ungeditherten Quantisierung geht auf Bernard Widrow (1956) zurück.