Converter PDF em HTML
Transforme um PDF em um único arquivo HTML com a cara do original e que não precisa de mais nada — sem folha de estilos, sem fontes, sem pasta de imagens.
- Nunca armazenado
- Sem fila, sem espera
- Sem cadastro, sem marca d'água
Como funciona
Adicione seu PDF
Solte o documento que você quer como página web.
Converta
Cada página é reconstruída como um bloco posicionado, com suas ilustrações e seu texto.
Baixe
Um único arquivo .html que você pode abrir, hospedar ou mandar por e-mail do jeito que está.
Um arquivo, nenhuma dependência, layout fixo
O que sai é um único arquivo .html, sem nada ao lado. Cada imagem é embutida como data URI, a folha de estilos fica no head e nenhuma fonte é buscada de lugar algum — então a página abre igualzinho em um computador sem conexão com a internet, que é o único tipo de exportação HTML que vale a pena ter. O custo é aritmético: codificar dados binários de imagem como texto os deixa cerca de um terço maiores, então um PDF de 10 MB cheio de digitalizações vira algo perto de 14 MB de HTML, e o navegador precisa interpretar tudo isso antes de mostrar qualquer coisa.
O layout é fixo, não responsivo, e isso é uma escolha, não um esquecimento. Cada página é uma caixa com as dimensões exatas do PDF em pontos, e cada linha de texto é um span com posição absoluta nas coordenadas originais, levando junto o tamanho e a cor. Nada se reorganiza, nunca — no celular você vê a página inteira reduzida, não uma coluna de texto legível. Há uma folha de estilos de impressão incluída, então imprimir o HTML quebra as páginas certinho nos limites originais.
Como nenhuma fonte viaja com o arquivo, o texto é exibido na Helvetica ou na Arial que o computador de quem lê tiver. Tamanho e posição ficam certos, o desenho das letras não, então uma linha pode ficar um pouco mais larga que a ilustração por trás dela. Há um truque esperto que vale conhecer: quando as palavras de uma página fazem parte da ilustração desenhada em vez de serem texto real, a camada de texto é gravada mesmo assim, só que transparente — assim a página continua selecionável e pesquisável sem as palavras aparecerem duas vezes.
Links dentro do PDF chegam como texto simples em vez de âncoras, títulos chegam como spans posicionados em vez de elementos de título, e não existe uma ordem de leitura digna do nome. O resultado é uma imagem fiel de um documento que por acaso é feito de HTML — não é uma marcação estruturada e semântica, e não deve ser usado onde um leitor de tela ou um buscador precise entender o conteúdo.
Quando você precisa de outra coisa
O pdf2htmlEX é a ferramenta que faz isso direito. Ele extrai e incorpora as próprias fontes do PDF como fontes web, então o texto não só fica na posição certa, como também sai no tipo de letra e na largura certos, e ele reconstrói as ilustrações vetoriais como vetores em vez de achatar a página em uma imagem. O resultado é muito mais fiel e muito mais complicado. O pdftohtml -s -c in.pdf out.html do Poppler é o meio-termo rápido.
Se o que você realmente quer é uma página web, e não a imagem de uma página — algo que se adapte ao celular, que o Google consiga ler, que um leitor de tela consiga navegar —, nenhum conversor de PDF para HTML vai entregar isso, porque a estrutura necessária foi jogada fora quando o PDF foi criado. Converta em Word no modo de texto corrido e exporte a partir dali, ou volte ao arquivo que deu origem ao PDF.
Perguntas frequentes
É mesmo um arquivo só?
Sim. Cada imagem é embutida como data URI e os estilos ficam dentro do próprio arquivo, então não há pasta de recursos para manter junto, e ele abre igualzinho sem conexão com a internet.
O texto é selecionável?
Sim. O texto é gravado como texto HTML de verdade, posicionado sobre as ilustrações, então pode ser selecionado, pesquisado e lido por um leitor de tela.
Ele se adapta à tela do celular?
Não, e essa é a troca, sendo honestos: cada página mantém o layout exato, então o resultado se parece com o PDF, e não com um site responsivo. Se você quer texto que se reorganize na tela, use o PDF para Word ou o PDF para texto.
Meu PDF fica armazenado em algum lugar?
Não. Nada fica armazenado em nenhum momento.
Posso imprimir?
Sim — há uma folha de estilos de impressão incluída, então cada página sai em sua própria folha, sem as sombras que aparecem na tela.
Bom saber: O layout é fixo, não responsivo: as páginas mantêm as dimensões exatas e não se reorganizam em telas pequenas. As ilustrações das páginas são incorporadas como imagem rasterizada, então documentos muito grandes geram arquivos HTML grandes. Links dentro do PDF viram texto simples.
Coloque esta ferramenta no seu site
Grátis para qualquer blog, página de turma ou artigo de ajuda. Cole um único trecho de código e seus visitantes podem usá-la direto na sua página.
Mais Ferramentas PDF
HTML para PDF
HTML em PDF, exatamente como o navegador imprime
PDF para texto
Texto simples para copiar e editar
PDF para Word
Converta em .docx editável, com OCR para digitalizações
PDF para PDF/A
Formato de arquivamento para guardar por muito tempo
PDF para Excel
Tabelas em uma planilha de verdade
PDF para PowerPoint
Slides editáveis a partir de qualquer PDF