Lo que realmente guarda un archivo de sonido
Tres números describen una grabación, y solo dos de ellos se aplican a un archivo concreto. La frecuencia de muestreo es la frecuencia con que se midió el sonido: 44.1 kHz en los CD, 48 kHz en todo lo que viene de un video. La profundidad de bits es la precisión con que se anota cada medición, y solo tiene sentido en un formato sin comprimir: 16 bits es el estándar del CD, 24 bits deja margen para seguir procesando, 32 bits de coma flotante es para mezclar. La tasa de bits solo tiene sentido en uno comprimido: es cuántos bits por segundo pudo gastar el codificador.
Por eso los tamaños se comportan de forma tan distinta. El tamaño de un WAV es pura aritmética —frecuencia por profundidad por canales—, así que un minuto en estéreo de 16 bits a 44.1 kHz pesa unos 10 MB contenga lo que contenga, silencio incluido. El tamaño de un MP3 depende de la tasa de bits que elegiste: unos 1.4 MB por minuto a 192 kbps, y la mitad a 96. El WAV es un formato de trabajo, no de escucha, y esa diferencia es la razón para convertir en uno u otro sentido.
Convertir un MP3 a WAV no restaura nada, y nunca lo hará. El codificador descartó detalle cuando se creó el MP3; un WAV hecho a partir de él guarda ese daño a resolución completa. La conversión sirve para que la pérdida no siga avanzando: a partir de un WAV, editar, cortar y volver a guardar no cuesta nada. Lo mismo vale para el FLAC, que es compresión sin pérdida: una forma más liviana de guardar exactamente las muestras que recibió, no una forma de mejorarlas. Un MP3 convertido en FLAC es un archivo pesado que contiene un MP3.
Cada pasada por un codificador con pérdida descarta más, y eso nunca vuelve. Convertir AAC a MP3, OGG a MP3 o un MP3 en otro es una de esas pasadas. Codificar a la tasa de bits de la fuente o por encima —que cada página te muestra al soltar el archivo— mantiene esa pérdida pequeña; subir mucho más solo gasta bits en guardar los errores del primer codificador. Si vas a hacerle varias cosas a una grabación, conviértela primero a WAV, haz el trabajo y codifica una sola vez al final.
Cortar y unir no tienen por qué recodificar. El sonido comprimido se guarda en pequeños bloques (frames) —unos 26 milisegundos en un MP3—, y Cortar audio copia esos bloques en lugar de decodificarlos, así que un MP3 cortado es bit por bit el MP3 que era, y una grabación larga se corta casi tan rápido como se puede leer. El precio es que un corte copiado empieza en el límite de bloque más cercano, unas centésimas de segundo antes o después del punto que elegiste; al marcar “Corte exacto” se recodifica para caer en la muestra que pediste. Unir audios funciona igual: los archivos que comparten códec, frecuencia de muestreo y número de canales se unen copiando, y los que difieren se decodifican y se recodifican para que coincidan con el primero.
Nivelar no es normalizar la sonoridad, y comprimir tampoco. Ajustar volumen mide el momento más fuerte del archivo y sube todo en esa misma cantidad, para que el pico quede justo por debajo del techo. Eso es normalización de picos, y es la solución correcta para una grabación que simplemente suena demasiado baja de principio a fin. No es la medición LUFS que especifican las plataformas de pódcast y streaming, que pondera la sonoridad percibida a lo largo de todo un programa: dos archivos normalizados al mismo pico pueden seguir sonando claramente distintos. Y subir el archivo entero mueve juntas las partes bajas y las fuertes, así que no puede equilibrar una grabación que oscila entre ambas. Eso es compresión de rango dinámico: un trabajo distinto, y no uno que hagan estas herramientas.
Cuándo un navegador es de verdad la herramienta equivocada
Mantener tu grabación privada es el propósito de estas herramientas, y eso no te da absolutamente nada extra en cuanto a procesamiento. Estas herramientas convierten, cortan, unen y ajustan el nivel. No editan sonido.
Sin reparación ni modelado. No hay reducción de ruido, ni eliminación de zumbidos o clics, ni ecualizador, ni de-esser, ni compresión de rango dinámico, ni fundidos, ni mezcla multipista. Tampoco hay transiciones entre las partes unidas, y por eso un corte en medio de música fuerte puede producir un clic. Audacity es gratuito, funciona en cualquier computadora y hace todo eso bien: una entrevista con siseo, o una grabación con un refrigerador zumbando detrás, pide Audacity y no esto.
Se miden los picos; la sonoridad no. Ajustar volumen indica el pico antes y después y se detiene antes de cualquier cosa que supere el techo, pero no hay limitador de pico real ni objetivo LUFS. Si tienes que entregar según una especificación —−16 LUFS para un pódcast, −14 para una plataforma de streaming—, necesitas una herramienta que mida sonoridad, no picos.
Las etiquetas no viajan. Los títulos, artistas, portadas y capítulos todavía no se trasladan en una conversión aquí: pasa el sonido y los metadatos de la biblioteca no. Para convertir una biblioteca de música, un gestor de escritorio que reescriba las etiquetas sobre la marcha te ahorrará horas de volver a etiquetar.
Un archivo, un clic. Convertir ochocientas notas de voz es un bucle de shell con ffmpeg, que es gratuito y hace en un minuto lo que a una persona haciendo clic le llevaría una tarde.
Y hay cosas que ningún navegador puede hacer. Las compras protegidas —los antiguos archivos .m4p, las descargas de Apple Music, cualquier cosa de una suscripción— no se pueden abrir aquí, y quitar esa protección no es algo en lo que ayudemos. El propio MP3 admite como máximo dos canales y hasta 48 kHz, así que una fuente envolvente o de alta frecuencia se reduce por el camino.
Cómo elegir entre herramientas que suenan parecido
Comprimir audio o WAV a MP3. Pueden producir el mismo archivo, y solo una lo hace en el orden correcto. WAV a MP3 es una primera codificación desde una fuente sin comprimir, la codificación más barata que existe. Comprimir audio toma cualquier archivo y lo recodifica a la tasa de bits que elijas: desde un WAV es el mismo trabajo, pero desde un MP3 es una segunda pasada con pérdida. Te avisa cuando la tasa de bits que pediste no puede hacer el archivo más liviano, que es lo que pasa cuando comprimes un MP3 de 128 kbps a 192.
“Comprimir” significa dos cosas en audio, y aquí solo está una. Comprimir audio hace el archivo más liviano bajando la tasa de bits. La compresión de rango dinámico sube las partes bajas en relación con las fuertes, que es lo que entiende por esa palabra un productor de pódcast. Ni Comprimir audio ni Ajustar volumen hacen lo segundo: Ajustar volumen mueve todo el archivo en una sola cantidad.
AAC a MP3 o M4A a MP3. Casi la misma página. Un archivo .aac es un flujo AAC sin envoltorio y un .m4a es AAC dentro de una caja MP4 que además puede llevar portada y capítulos; las dos páginas leen ambos, y el sonido de dentro es idéntico. La página de M4A está pensada para las notas de voz del iPhone, que ya son AAC mono a una tasa de bits baja y conviene sacar a 128 kbps en mono.
MP3 a WAV o FLAC a MP3. Direcciones opuestas, y las dos sin vuelta atrás. MP3 a WAV crea una copia de trabajo que puedes editar sin perder nada más; no mejora el sonido, y el archivo crece unas diez veces. FLAC a MP3 crea una copia portátil de un original que deberías conservar, porque un MP3 nunca se puede volver a convertir en el FLAC del que salió.
Cortar audio o Unir audios. Cortar audio quita trozos de un archivo —incluidos trozos del medio— y une lo que queda. Unir audios pone archivos separados uno tras otro, en el orden que definas arrastrándolos. Una entrevista grabada en tres partes con una tos en la segunda son los dos trabajos: corta la tos y luego une las tres.