Was eine Audiodatei tatsächlich speichert
Drei Zahlen beschreiben eine Aufnahme, und für jede einzelne Datei gelten nur zwei davon. Die Abtastrate gibt an, wie oft der Klang gemessen wurde: 44,1 kHz bei CDs, 48 kHz bei allem, was aus einem Video stammt. Die Bittiefe gibt an, wie genau jede Messung festgehalten wird, und sie hat nur in einem unkomprimierten Format Bedeutung – 16 Bit ist der CD-Standard, 24 Bit lässt Reserven für die Weiterverarbeitung, 32 Bit Gleitkomma ist fürs Mischen. Die Bitrate hat nur in einem komprimierten Format Bedeutung: Sie gibt an, wie viele Bits pro Sekunde der Encoder verwenden durfte.
Deshalb verhalten sich die Dateigrößen so unterschiedlich. Die Größe einer WAV ist reine Rechnung – Abtastrate mal Bittiefe mal Kanäle –, eine Minute 16-Bit-Stereo mit 44,1 kHz sind also etwa 10 MB, egal was darin ist, Stille eingeschlossen. Die Größe einer MP3 hängt von der gewählten Bitrate ab: rund 1,4 MB pro Minute bei 192 kbps und die Hälfte bei 96. WAV ist ein Arbeitsformat, kein Format zum Anhören – und dieser Unterschied ist der Grund, in beide Richtungen umzuwandeln.
Eine MP3 in WAV umzuwandeln stellt nichts wieder her, und nichts wird das je tun. Der Encoder hat beim Erstellen der MP3 Details verworfen; eine daraus gebaute WAV hält genau diesen Schaden in voller Auflösung fest. Wozu die Umwandlung dient: den Verlust nicht weiter wachsen zu lassen – ab der WAV kosten Bearbeiten, Schneiden und erneutes Speichern nichts mehr. Dasselbe gilt für FLAC, eine verlustfreie Kompression: eine kleinere Art, genau die Samples zu speichern, die es bekommen hat, keine Art, sie zu verbessern. Eine MP3, aus der eine FLAC gemacht wurde, ist eine große Datei, die eine MP3 enthält.
Jeder Durchgang durch einen verlustbehafteten Encoder verwirft mehr, und es kommt nie zurück. AAC in MP3, OGG in MP3 oder eine MP3 in eine andere umzuwandeln, ist ein solcher Durchgang. Mit der Bitrate der Quelle oder darüber zu kodieren – jede Seite hier zeigt sie Ihnen, sobald Sie die Datei ablegen –, hält diesen Verlust klein; weit darüber zu gehen, verschwendet nur Bits darauf, die Fehler des ersten Encoders zu speichern. Wenn Sie mehrere Dinge mit einer Aufnahme vorhaben, wandeln Sie zuerst in WAV um, erledigen die Arbeit und kodieren am Ende einmal.
Schneiden und Zusammenfügen müssen überhaupt nicht neu kodieren. Komprimierter Klang wird in kleinen Frames gespeichert – etwa 26 Millisekunden bei einer MP3 –, und Audio schneiden kopiert diese Frames, statt sie zu dekodieren. Eine geschnittene MP3 ist also Bit für Bit die MP3, die sie war, und eine lange Aufnahme wird ungefähr so schnell geschnitten, wie sie sich lesen lässt. Der Preis: Ein kopierter Schnitt beginnt an der nächsten Frame-Grenze, ein paar Hundertstelsekunden vor oder nach der gewählten Stelle; wenn Sie „Exakter Schnitt“ aktivieren, wird neu kodiert, um genau das gewünschte Sample zu treffen. Audio zusammenfügen arbeitet genauso – Dateien mit gleichem Codec, gleicher Abtastrate und gleicher Kanalzahl werden durch Kopieren verbunden, abweichende Dateien werden dekodiert und passend zur ersten neu kodiert.
Angleichen ist keine Lautheitsnormalisierung, und Kompression ist es auch nicht. Lautstärke ändern misst den lautesten Moment der Datei und hebt alles um genau diesen einen Betrag an, sodass der Spitzenpegel knapp unter der Obergrenze liegt. Das ist Spitzenpegel-Normalisierung, und sie ist die richtige Lösung für eine Aufnahme, die durchgehend einfach zu leise ist. Sie ist nicht die LUFS-Messung, die Podcast- und Streaming-Plattformen vorgeben und die die empfundene Lautheit über ein ganzes Programm gewichtet – zwei Dateien, die auf denselben Spitzenpegel normalisiert sind, können trotzdem deutlich unterschiedlich laut klingen. Und wenn die ganze Datei angehoben wird, bewegen sich leise und laute Stellen gemeinsam, eine Aufnahme, die zwischen beidem schwankt, lässt sich so also nicht ausgleichen. Das ist Dynamikkompression: eine andere Aufgabe, und keine, die diese Tools erledigen.
Wo ein Browser wirklich das falsche Werkzeug ist
Ihre Aufnahme privat zu halten, ist das, wofür diese Tools gebaut sind – an Verarbeitungsmöglichkeiten bringt Ihnen das überhaupt nichts. Diese Tools wandeln um, schneiden, fügen zusammen und stellen den Pegel ein. Sie bearbeiten keinen Klang.
Keine Reparatur und keine Klanggestaltung. Es gibt keine Rauschunterdrückung, keine Brumm- oder Knackentfernung, keinen EQ, keinen De-Esser, keine Dynamikkompression, keine Ein- und Ausblendungen und kein Mehrspur-Mischen. Es gibt auch keine Überblendungen zwischen zusammengefügten Stücken, weshalb ein Schnitt mitten in lauter Musik knacken kann. Audacity ist kostenlos, läuft auf jedem Desktop und erledigt all das richtig – ein rauschendes Interview oder eine Aufnahme, hinter der ein Kühlschrank brummt, gehört in Audacity und nicht hierher.
Spitzenpegel werden gemessen, Lautheit nicht. Lautstärke ändern zeigt den Spitzenpegel vorher und nachher an und hält alles zurück, was die Obergrenze überschreiten würde, aber es gibt keinen True-Peak-Limiter und kein LUFS-Ziel. Wenn Sie nach einer Vorgabe liefern – −16 LUFS für einen Podcast, −14 für eine Streaming-Plattform –, brauchen Sie ein Tool, das Lautheit misst, nicht Spitzenpegel.
Tags werden nicht übernommen. Titel, Interpreten, Albumcover und Kapitel werden bei einer Umwandlung hier noch nicht übertragen: Der Klang kommt durch, die Metadaten der Bibliothek nicht. Um eine Musikbibliothek umzuwandeln, erspart Ihnen ein Desktop-Programm, das die Tags dabei neu schreibt, Stunden des Nachtaggens.
Eine Datei, ein Klick. Achthundert Sprachmemos umzuwandeln ist eine Shell-Schleife um ffmpeg, das kostenlos ist und in einer Minute erledigt, woran ein klickender Mensch einen ganzen Nachmittag säße.
Und manches kann kein Browser. Geschützte Käufe – alte .m4p-Dateien, Apple-Music-Downloads, alles aus einem Abo – lassen sich hier nicht öffnen, und beim Entfernen dieses Schutzes helfen wir nicht. MP3 selbst trägt höchstens zwei Kanäle mit bis zu 48 kHz, eine Surround-Quelle oder eine mit höherer Abtastrate wird unterwegs also heruntergemischt.
Die Wahl zwischen ähnlich klingenden Tools
Audio komprimieren oder WAV in MP3? Sie können dieselbe Datei erzeugen, aber nur einer ist der richtige Weg. WAV in MP3 ist eine erste Kodierung aus einer unkomprimierten Quelle, die günstigste Kodierung überhaupt. Audio komprimieren nimmt alles und kodiert es mit einer Bitrate Ihrer Wahl neu – bei einer WAV ist das dieselbe Aufgabe, bei einer MP3 aber ein zweiter verlustbehafteter Durchgang. Es warnt Sie, wenn die gewünschte Bitrate die Datei nicht kleiner machen kann – genau das passiert, wenn Sie eine MP3 mit 128 kbps auf 192 komprimieren.
„Komprimieren“ bedeutet beim Audio zweierlei, und nur eins davon gibt es hier. Audio komprimieren macht die Datei kleiner, indem es die Bitrate senkt. Dynamikkompression macht die leisen Stellen im Verhältnis zu den lauten lauter – das meint ein Podcast-Produzent mit dem Wort. Weder Audio komprimieren noch Lautstärke ändern tut das Zweite – Lautstärke ändern verschiebt die ganze Datei um einen einzigen Betrag.
AAC in MP3 oder M4A in MP3? Fast dieselbe Seite. Eine .aac-Datei ist ein nackter AAC-Stream, eine .m4a ist AAC in einer MP4-Verpackung, die zusätzlich Cover und Kapitel enthalten kann; beide Seiten lesen beides, und der Klang darin ist identisch. Die M4A-Seite ist für iPhone-Sprachmemos geschrieben, die bereits Mono-AAC mit niedriger Bitrate sind und bei der Ausgabe 128 kbps Mono brauchen.
MP3 in WAV oder FLAC in MP3? Entgegengesetzte Richtungen, und beide sind Einbahnstraßen. MP3 in WAV erstellt eine Arbeitskopie, die Sie ohne weiteren Verlust bearbeiten können; der Klang wird nicht besser, und die Datei wird etwa zehnmal so groß. FLAC in MP3 erstellt eine handliche Kopie eines Masters, den Sie behalten sollten, denn aus einer MP3 wird nie wieder die FLAC, aus der sie stammt.
Audio schneiden oder Audio zusammenfügen? Audio schneiden entfernt Stücke aus einer Datei – auch aus der Mitte – und fügt den Rest zusammen. Audio zusammenfügen setzt getrennte Dateien hintereinander, in einer Reihenfolge, die Sie per Ziehen festlegen. Ein Interview, das in drei Teilen aufgenommen wurde, mit einem Husten im zweiten, ist beides: Husten herausschneiden, dann die drei zusammenfügen.