Pular para o conteúdo

Ferramentas de documentos que mantêm a formatação

Nove ferramentas para documentos, currículos e e-books, grátis e sem cadastro. Cinco delas enviam o arquivo para o nosso servidor, que o exclui assim que o seu download fica pronto, e cada uma avisa isso na própria página.

9 ferramentas, sem cadastro, sem marca d'água

Para enviar algo em PDF, Word para PDF cuida de arquivos .docx, ODT para PDF e RTF para PDF cuidam do que outros editores de texto geram, e Markdown para PDF transforma um README num documento bem diagramado. Para um livro que é seu, EPUB para PDF, MOBI para PDF e AZW3 para PDF. No caminho inverso — tirar o texto de um arquivo Word ou de um PDF, ou transformar uma página web em algo editável — DOCX para TXT, PDF para texto e HTML para DOCX fazem isso sem o arquivo sair do seu navegador. Para escrever um currículo do zero, o Gerador de currículo o monta em qualquer um de 54 modelos. As notas abaixo explicam o que um documento realmente carrega e o que sobrevive a cada conversão.

Criar documentos

1 ferramenta

Monte um currículo a partir de um formulário, no modelo que você escolher.

O que um documento carrega e o que cada conversão faz com isso

Um .docx é um ZIP de arquivos XML, e a maior parte do que faz dele um documento não é o texto. Há estilos — definições com nome, como Título 1, compartilhadas por vários parágrafos — e há formatação direta, quando alguém selecionou uma linha e clicou em negrito. Os dois parecem idênticos e se comportam de forma completamente diferente numa conversão: um estilo sobrevive como estilo, e um trecho com formatação direta sobrevive só como a formatação que produziu. Junto deles ficam as definições de numeração, as alterações controladas, os comentários, as notas de rodapé, os cabeçalhos e rodapés, as caixas de texto, as fontes incorporadas e as propriedades do documento, cada um guardado separado do texto dos parágrafos.

Os números das listas são o exemplo mais claro. O Word não guarda “1.” como texto; guarda uma referência a uma definição de numeração e calcula o número ao desenhar a página. Por isso, extratores de texto que percorrem o XML dos parágrafos descartam todos os números e entregam uma lista sem numeração. O DOCX para TXT os reconstrói — “1.”, “1.1”, “a)”, “iii.” — inclusive em listas que recomeçam ou continuam ao longo do documento.

Alterações controladas e comentários são uma decisão, não um acidente. Um documento em revisão guarda tanto o texto excluído quanto o inserido, no mesmo arquivo, marcados. O DOCX para TXT o lê como se todas as alterações tivessem sido aceitas: inserções mantidas, exclusões deixadas de fora. Comentários não são incluídos, o que normalmente é o que você quer quando o texto simples vai para algum lugar público. Notas de rodapé e de fim aparecem como marcadores [1], com as notas reunidas no final, cabeçalhos e rodapés podem ser ativados, e caixas de texto aparecem uma vez cada, na ordem de leitura, em vez de se repetirem ou se perderem.

O que a conversão para PDF fixa é a paginação. Num editor de texto, onde termina a página quatro é recalculado toda vez que o arquivo é aberto, usando as fontes e o driver de impressora de quem o abriu — e é por isso que um documento chega com a tabela dividida em duas páginas do lado de quem recebe e não do seu. Um PDF não tem esse recálculo: as quebras de página foram decididas uma vez, na conversão, e agora são um fato do arquivo. Word para PDF, ODT para PDF e RTF para PDF obtêm essas quebras de um layout completo de editor de texto, e não de um navegador tentando imitar um, e é por isso que caixas de texto, formas, cabeçalhos e rodapés ficam onde o autor os colocou.

O que ela perde é a edição e o refluxo do texto. Estilos viram formatação visual, a estrutura de tópicos vira marcadores, e o texto deixa de se reajustar à tela de um celular. Fontes incorporadas ao documento são usadas como estão; uma fonte que não está incorporada nem disponível para o conversor é trocada pela equivalente mais próxima com as mesmas métricas, então as linhas continuam quebrando nos mesmos lugares, mesmo com o desenho das letras diferente.

E-books não têm páginas a preservar. EPUB, MOBI e AZW3 são refluíveis — o app de leitura decide onde cada página termina, no tamanho de fonte que você escolheu — então “página 40” não é uma propriedade do livro, e a paginação do seu PDF é criada na conversão, a partir do tamanho de página e das margens que você escolher. O que está no arquivo é a estrutura de capítulos e o sumário, e eles viram links e marcadores de verdade no PDF. O AZW3 traz uma folha de estilos e muitas vezes fontes incorporadas, então sai com a cara que a editora projetou; arquivos MOBI antigos não têm folha de estilos nenhuma, e é por isso que um MOBI convertido parece mais simples do que o mesmo livro no app Kindle — o app adicionava uma tipografia que o arquivo nunca teve.

O RTF é texto do começo ao fim, e é por isso que ele sobrevive a décadas de software. O problema é a codificação de caracteres: o RTF é anterior ao Unicode e guarda o texto em páginas de código antigas — da Europa Central, cirílico, grego, japonês — e é daí que vêm os caracteres embaralhados de um RTF mal convertido. Aqui cada uma delas é decodificada corretamente, junto com o texto Unicode moderno.

Quando o navegador realmente é a ferramenta errada

Algumas destas ferramentas mantêm o seu arquivo totalmente privado e outras o entregam a um servidor, e vale ser exato sobre quais. PDF para texto, TXT para PDF, DOCX para TXT, HTML para DOCX e Markdown para HTML nunca enviam nada — o arquivo é lido, convertido e gravado aqui mesmo, e nada sai. Word para PDF, ODT para PDF, RTF para PDF, HTML para PDF, Markdown para PDF e os três conversores de e-book fazem a conversão no nosso servidor, porque reproduzir o layout de página de um editor de texto, ou paginar um livro direito, não é algo que uma página web consiga simular. O que é enviado varia: documentos Word, ODT e RTF vão como estão, enquanto arquivos Markdown e e-books são desempacotados e montados primeiro como uma página web, e é essa página montada que é enviada. Em todos os casos, ele trafega por uma conexão criptografada, é convertido e é excluído assim que o seu download fica pronto — nada fica armazenado, registrado ou compartilhado. Cada uma delas também recorre ao próprio conversor se o servidor estiver fora do ar, avisa quando isso acontece e diz o que a alternativa não conseguiu manter.

Formatos que não abrimos. Arquivos .doc binários antigos, do Word 97–2003, são convertidos sem problema no Word para PDF, porque o servidor os lê diretamente — mas o DOCX para TXT, que funciona no navegador, não consegue, e pede um .docx. Documentos protegidos por senha precisam ter a senha removida no programa que a definiu. Livros Kindle protegidos por DRM não podem ser abertos por nenhum conversor em lugar nenhum — é para isso que a proteção existe — e o formato KFX, mais novo, da Amazon também não, pois só o app Kindle o lê.

Trabalho com documentos longos. Documentos mestres, campos de referência cruzada, índices remissivos, índices de autoridades gerados automaticamente, mala direta e gerenciadores de citações são recursos de editor de texto, e um conversor não é um editor de texto. Instale o LibreOffice — é gratuito, lê todos os formatos desta página e, para esses trabalhos, é simplesmente o programa certo.

Lotes e automação. Estas ferramentas funcionam quando uma pessoa clica. Converter mil arquivos de forma agendada é trabalho para a linha de comando, e as ferramentas gratuitas são excelentes: o LibreOffice em modo headless converte qualquer coisa que o Writer abre, o Pandoc transita entre Markdown, HTML, DOCX, LaTeX e uma dúzia de outros formatos com mais controle do que qualquer formulário web, e o Calibre lida com e-books em massa e converte entre todos os formatos de e-book sem proteção que existem.

Layout fiel na direção oposta. Transformar um PDF muito elaborado de volta num documento editável é um problema de inferência, não uma conversão, e nada faz isso com perfeição — nem nós, nem os caros programas para desktop. Se o documento original ainda existe, edite ele.

Como escolher entre ferramentas de nome parecido

Markdown para PDF ou Markdown para HTML. Mesmo interpretador, destino diferente. Markdown para PDF entrega um documento paginado, com fonte, tamanho de página e margens que você escolhe, títulos como marcadores do PDF e um sumário que leva à página certa — para imprimir, anexar ou arquivar. Markdown para HTML entrega uma página independente com estilo ou um trecho puro para colar num CMS — para publicar. Se você quer Markdown no Word, passe pelo Markdown para HTML e depois pelo HTML para DOCX.

Word para PDF, ODT para PDF ou RTF para PDF. Por baixo, é a mesma conversão; a diferença é só o que você envia. Word para PDF para .docx. ODT para PDF para qualquer coisa do LibreOffice, do OpenOffice ou de um “Fazer download como OpenDocument” do Google Docs. RTF para PDF para o WordPad, o TextEdit e as cartas e relatórios que sistemas empresariais ainda geram. Escolher a página que corresponde à sua extensão importa menos do que você imagina — o que importa é que nenhuma delas é o TXT para PDF, que não tem formatação nenhuma para preservar.

TXT para PDF ou Markdown para PDF. TXT para PDF compõe o seu texto como texto: uma fonte, as suas margens, nenhuma interpretação. Markdown para PDF lê o # e o * como instruções e gera títulos, listas, tabelas, código destacado e uma estrutura de marcadores. Mande um arquivo Markdown para o TXT para PDF e você recebe um PDF dos asteriscos.

EPUB, MOBI e AZW3 para PDF. Os três aceitam mais do que o nome sugere, então qualquer um deles abre o seu arquivo; as páginas diferem porque os livros diferem. EPUB e AZW3 (KF8) trazem folhas de estilo e muitas vezes fontes incorporadas, e saem com cara de projetados. MOBI é o contêiner mais antigo, com formatação mínima, e o PDF convertido é propositalmente simples. Se um arquivo Kindle contém os dois layouts, o mais novo é usado.

HTML para DOCX ou Markdown para HTML. HTML para DOCX monta o layout da marcação primeiro, então o CSS resolvido — fontes, tamanhos, cores, espaçamentos, bordas — é gravado no documento como formatação real do Word, com estilos de título do Word, listas de verdade e tabelas de verdade, em vez de caixas fixadas no lugar. Markdown para HTML gera a marcação em primeiro lugar. Nenhum dos dois executa JavaScript, nunca.

DOCX para TXT ou PDF para texto. Os dois entregam texto simples, e estão lendo coisas muito diferentes. Um .docx ainda sabe o que é um parágrafo, uma lista e uma tabela, então o DOCX para TXT consegue reconstruir os números das listas e manter as linhas das tabelas juntas. Um PDF só sabe onde cada caractere foi desenhado, então o PDF para texto deduz linhas e parágrafos pela posição — bem, mas nunca com a mesma fidelidade estrutural. Se você tem o documento original e um PDF dele, extraia do documento.

DOCX para TXT ou salvar como .txt no Word. A exportação de texto simples do próprio Word descarta a numeração das listas, bagunça as tabelas e tem opiniões próprias sobre codificação. O DOCX para TXT reconstrói a numeração, grava as tabelas como linhas separadas por tabulação, que colam numa planilha, ou como colunas alinhadas que continuam alinhadas até em chinês e japonês, e salva em UTF-8 com as quebras de linha que você pedir.

A base destas ferramentas

Os motores de código aberto que fazem o trabalho de fato e as especificações que eles implementam.

  • LibreOfficeMPL-2.0 — faz as conversões do Office, sem interface, no nosso servidor.
  • docxMIT — gera arquivos Word no navegador.
  • markdown-itMIT — interpreta Markdown, segundo a especificação CommonMark.
  • foliate-jsMIT — abre e-books EPUB, MOBI e KF8.
  • pdf-libMIT — compõe os PDFs do Gerador de currículo, com as fontes incorporadas e o texto selecionável.
  • Google FontsOFL-1.1 — fornece as trinta fontes usadas nos modelos de currículo, do Inter ao EB Garamond.
  • LucideISC — desenha os ícones de contato nos modelos de currículo.
  • EPUB 3.3Specification — é o padrão do W3C que as ferramentas de e-book leem.

Perguntas frequentes

Meus documentos ficam armazenados em algum lugar?

Depende da ferramenta, e cada uma diz na própria página. PDF para texto, TXT para PDF, DOCX para TXT, HTML para DOCX e Markdown para HTML nunca enviam nada — funcionam dentro desta aba. As conversões que geram um PDF diagramado — Word, ODT, RTF, HTML, Markdown e os três formatos de e-book — enviam o arquivo para o nosso servidor por uma conexão criptografada, porque precisam de um layout de página de verdade; ele é convertido e excluído na hora, e nada fica armazenado, registrado ou compartilhado.

Por que o PDF não fica exatamente igual ao meu documento?

Quase sempre por causa das fontes. Se uma fonte não está incorporada ao arquivo e não está disponível para o conversor, é usada a substituta mais próxima com as mesmas métricas — as mesmas larguras, então nada muda de lugar, mas com letras de desenho diferente. Incorpore as fontes antes de converter se o design precisa ser exato, ou use fontes amplamente disponíveis.

Posso converter um livro Kindle que comprei?

Só se ele não tiver proteção DRM. Os livros da loja Kindle são criptografados e nenhum conversor consegue abri-los; a ferramenta detecta um arquivo protegido e avisa você, em vez de gerar páginas de lixo. Livros sem DRM — do próprio autor, do Projeto Gutenberg, de uma editora que os vende assim — são convertidos normalmente.

Existe limite de tamanho de arquivo ou limite diário?

Não há conta nem limite diário. As ferramentas que funcionam no navegador são limitadas pela memória do seu dispositivo. Documentos enviados para o nosso servidor têm limite de 40 MB, e a página avisa claramente se o seu arquivo passa disso, em vez de falhar no meio.

Vai ter marca d'água?

Não. Nada aqui carimba um aviso de versão de teste no seu documento, limita o número de páginas ou piora o resultado. Os anúncios na página é que mantêm tudo gratuito.

Meu arquivo é .doc, não .docx. Funciona?

No Word para PDF, sim — o servidor lê o antigo formato binário .doc diretamente, sem precisar salvar de novo. As ferramentas que funcionam no navegador não conseguem: .doc é um formato totalmente diferente, não uma variante do .docx, e decodificá-lo numa aba não compensa o download. Abra-o uma vez no Word ou no LibreOffice, salve como .docx, e tudo aqui passa a aceitá-lo.