Qué contiene un documento y qué hace cada conversión con ello
Un .docx es un ZIP de archivos XML, y la mayor parte de lo que lo convierte en un documento no es el texto. Hay estilos (definiciones con nombre, como Título 1, que comparten muchos párrafos) y hay formato directo, cuando alguien seleccionó una línea y pulsó negrita. Se ven idénticos y se comportan de forma completamente distinta al convertir: un estilo sobrevive como estilo, y un fragmento con formato directo sobrevive solo como el formato que produjo. Junto a ellos están las definiciones de numeración, el control de cambios, los comentarios, las notas al pie, los encabezados y pies de página, los cuadros de texto, las fuentes incrustadas y las propiedades del documento, cada uno guardado aparte del texto de los párrafos.
Los números de las listas son el ejemplo más claro. Word no guarda “1.” como texto; guarda una referencia a una definición de numeración y calcula el número al dibujar la página. Por eso los extractores de texto que recorren el XML de los párrafos pierden todos los números y te entregan una lista sin numerar. DOCX a TXT, en cambio, los reconstruye (“1.”, “1.1”, “a)”, “iii.”), incluidas las listas que se reinician o continúan a lo largo del documento.
El control de cambios y los comentarios son una decisión, no un accidente. Un documento en revisión contiene tanto el texto eliminado como el insertado, en el mismo archivo, marcados. DOCX a TXT lo lee como si se hubieran aceptado todos los cambios: conserva las inserciones y omite las eliminaciones. Los comentarios no se incluyen, que suele ser lo que quieres cuando el texto sin formato va a publicarse. Las notas al pie y al final salen como marcas [1] con las notas reunidas al final, los encabezados y pies de página se pueden activar, y los cuadros de texto aparecen una sola vez cada uno en orden de lectura, en lugar de repetirse o perderse.
Lo que fija una conversión a PDF es la paginación. En un procesador de textos, dónde termina la página cuatro se recalcula cada vez que se abre el archivo, con las fuentes y el controlador de impresora de quien lo abre; por eso un documento llega con la tabla partida en dos páginas en el equipo de quien lo recibe y no en el tuyo. Un PDF no recalcula nada: los saltos de página se decidieron una vez, al convertir, y ahora son un hecho del archivo. Word a PDF, ODT a PDF y RTF a PDF obtienen esos saltos de una maquetación completa de procesador de textos y no de un navegador que la imita, y por eso los cuadros de texto, las formas, los encabezados y los pies de página quedan donde los puso el autor.
Lo que pierde es la posibilidad de editar y de reacomodar el texto. Los estilos se vuelven formato visual, el esquema se convierte en marcadores y el texto ya no se reacomoda a la pantalla de un celular. Las fuentes incrustadas en el documento se usan tal cual; una fuente que no está incrustada ni disponible para el conversor se reemplaza por la equivalente métricamente compatible más cercana, así que las líneas siguen cortándose en los mismos lugares aunque las letras sean distintas.
Los libros electrónicos no tienen páginas que conservar. EPUB, MOBI y AZW3 son adaptables (la app de lectura decide dónde termina cada página, con el tamaño de letra que elegiste), así que “la página 40” no es una propiedad del libro, y la paginación de tu PDF se crea al convertir, a partir del tamaño de página y los márgenes que elijas. Lo que sí está en el archivo es la estructura de capítulos y el índice, y eso se convierte en enlaces y marcadores reales del PDF. AZW3 incluye una hoja de estilos y a menudo fuentes incrustadas, así que sale con el aspecto que diseñó la editorial; los MOBI antiguos no tienen hoja de estilos, y por eso un MOBI convertido se ve más sencillo que el mismo libro en la app de Kindle: la app agregaba una tipografía que el archivo nunca tuvo.
RTF es texto de principio a fin, y por eso sobrevive a décadas de software. Su problema es la codificación de caracteres: RTF es anterior a Unicode y guarda el texto en páginas de códigos antiguas (centroeuropea, cirílica, griega, japonesa), y de ahí viene el mojibake de los RTF mal convertidos. Aquí cada una se decodifica correctamente, junto con el texto Unicode moderno.
Cuándo un navegador no es la herramienta adecuada
Algunas de estas herramientas mantienen tu archivo totalmente privado y otras lo envían a un servidor, y vale la pena ser exactos sobre cuáles. PDF a texto, TXT a PDF, DOCX a TXT, HTML a DOCX y Markdown a HTML nunca envían nada: el archivo se lee, se convierte y se escribe aquí mismo, y nada sale. Word a PDF, ODT a PDF, RTF a PDF, HTML a PDF, Markdown a PDF y los tres conversores de libros electrónicos hacen la conversión en nuestro servidor, porque reproducir la maquetación de un procesador de textos, o paginar un libro como corresponde, no es algo que una página web pueda simular. Lo que se envía varía: los documentos de Word, ODT y RTF van tal cual, mientras que los archivos Markdown y los libros electrónicos primero se desempaquetan y se arman como una página web, y lo que se envía es esa página armada. En todos los casos viaja por una conexión cifrada, se convierte y se elimina en cuanto tu descarga está lista: no se guarda, no se registra ni se comparte nada. Cada una de ellas recurre además a su propio conversor si el servidor no está disponible, y te avisa cuando lo hace y de lo que esa alternativa no pudo conservar.
Formatos que no abrimos. Los archivos binarios .doc antiguos de Word 97–2003 se convierten sin problema en Word a PDF, porque el servidor los lee directamente, pero DOCX a TXT, que funciona en el navegador, no puede y necesita un .docx. A los documentos protegidos con contraseña hay que quitarles la contraseña en el programa que la puso. Los libros de Kindle protegidos con DRM no los puede abrir ningún conversor en ningún lugar (para eso es la protección), y tampoco el formato KFX, más reciente, de Amazon, que solo lee la app de Kindle.
Trabajo con documentos largos. Los documentos maestros, los campos de referencia cruzada, los índices, las tablas de autoridades generadas automáticamente, la combinación de correspondencia y los gestores de citas son funciones de un procesador de textos, y un conversor no es un procesador de textos. Instala LibreOffice: es gratis, lee todos los formatos de esta página y, para estas tareas, es simplemente el programa indicado.
Lotes y automatización. Estas herramientas funcionan cuando una persona hace clic. Convertir mil archivos de forma programada es trabajo para la línea de comandos, y las herramientas gratuitas son excelentes: LibreOffice en modo headless convierte cualquier cosa que Writer pueda abrir, Pandoc pasa entre Markdown, HTML, DOCX, LaTeX y una docena de formatos más con más control que cualquier formulario web, y Calibre procesa libros electrónicos en masa y convierte entre todos los formatos de libro electrónico sin protección que existen.
Un diseño fiel en la dirección contraria. Convertir un PDF muy elaborado de nuevo en un documento editable es un problema de inferencia, no una conversión, y nada lo hace a la perfección: ni nosotros ni los caros productos de escritorio. Si el documento original todavía existe, edita ese.
Cómo elegir entre herramientas que suenan parecido
Markdown a PDF frente a Markdown a HTML. El mismo analizador, distinto destino. Markdown a PDF te da un documento paginado con la tipografía, el tamaño de página y los márgenes que elijas, los títulos como marcadores del PDF y un índice que salta a la página correcta: para imprimir, adjuntar o archivar. Markdown a HTML te da una página independiente con estilos o un fragmento sin estilos para pegar en un CMS: para publicar. Si quieres tu Markdown en Word, pasa por Markdown a HTML y luego por HTML a DOCX.
Word a PDF frente a ODT a PDF frente a RTF a PDF. Por dentro es la misma conversión; solo cambia lo que les das. Word a PDF para .docx. ODT a PDF para cualquier archivo de LibreOffice, OpenOffice o una descarga de Google Docs como “OpenDocument”. RTF a PDF para WordPad, TextEdit y las cartas e informes que todavía generan los sistemas empresariales. Elegir la página que coincide con tu extensión importa menos de lo que crees; lo que importa es que ninguna de ellas es TXT a PDF, que para empezar no tiene formato que conservar.
TXT a PDF frente a Markdown a PDF. TXT a PDF compone tu texto como texto: una tipografía, tus márgenes, ninguna interpretación. Markdown a PDF lee el # y el * como instrucciones y produce títulos, listas, tablas, código resaltado y un esquema de marcadores. Si le das un archivo Markdown a TXT a PDF, obtienes un PDF de los asteriscos.
EPUB, MOBI y AZW3 a PDF. Las tres aceptan más de lo que sugiere su nombre, así que cualquiera abrirá tu archivo; las páginas son distintas porque los libros lo son. EPUB y AZW3 (KF8) incluyen hojas de estilos y a menudo fuentes incrustadas, y salen con aspecto de libro diseñado. MOBI es el contenedor más antiguo, con un formato mínimo, y su PDF convertido es sencillo a propósito. Si un archivo de Kindle contiene ambos diseños, se usa el más reciente.
HTML a DOCX frente a Markdown a HTML. HTML a DOCX primero maqueta el código, así que el CSS resuelto (fuentes, tamaños, colores, espaciado, bordes) se escribe en el documento como formato real de Word, con estilos de título de Word, listas reales y tablas reales, en lugar de cuadros fijados en su sitio. Markdown a HTML es lo que produce ese código en primer lugar. Ninguna de las dos ejecuta JavaScript, nunca.
DOCX a TXT frente a PDF a texto. Ambas te dan texto sin formato, y leen cosas muy distintas. Un .docx todavía sabe qué es un párrafo, una lista y una tabla, así que DOCX a TXT puede reconstruir los números de las listas y mantener juntas las filas de las tablas. Un PDF solo sabe dónde se pintó cada carácter, así que PDF a texto deduce las líneas y los párrafos a partir de la posición: bien, pero nunca con la misma fidelidad estructural. Si tienes tanto el documento original como un PDF de él, extrae el texto del documento.
DOCX a TXT frente a guardar como .txt desde Word. La exportación a texto sin formato de Word pierde la numeración de las listas, destroza las tablas y toma sus propias decisiones sobre la codificación. DOCX a TXT reconstruye la numeración, escribe las tablas como filas separadas por tabuladores que se pegan en una hoja de cálculo o como columnas alineadas que siguen alineadas incluso en chino y japonés, y guarda en UTF-8 con los finales de línea que elijas.