PDF → Markdown

Tire o texto de um PDF.
Como Markdown, não como bagunça.

Um PDF não tem títulos: ele tem instruções para pintar glifos em certas coordenadas.

Então a estrutura é reconstruída a partir do tamanho da fonte e do espaçamento. E a gente diz onde isso é chute.

Solte um arquivo aqui.

Ou escolha pelo botão. Ou cole com Ctrl+V. Dezenas de uma vez está tudo bem.

.pdf / 25 MB por arquivo / roda no seu navegador, nada é enviado

Outros formatos: .docx .doc DOCX → MD · .xlsx Excel → MD · .csv .tsv .txt CSV → MD · .html .htm HTML → MD · .pptx .ppt .odp PPTX → MD

Ajustes
Marcadores
Marcas de página

Como funciona

  1. 01Solte um PDF na caixa acima. Ele é analisado pelo pdf.js da Mozilla, e tanto a biblioteca quanto as fontes vêm deste site: nada é pedido a nenhuma CDN.
  2. 02O texto é extraído página por página, na ordem de leitura. O tamanho da fonte decide o que é título; os vãos verticais, onde os parágrafos quebram; a letra pequena colada na borda de cima ou de baixo é tratada como cabeçalho ou rodapé e descartada.
  3. 03Ligue as marcas de página se quiser um comentário HTML entre as páginas. Depois copie o Markdown ou baixe o .md.

O que ele aceita

  • Qualquer PDF com camada de texto real: exportado do Word, do LaTeX, do Pages ou do Imprimir em PDF de um navegador
  • Texto em chinês, japonês e coreano, pelas tabelas CMap que este site já traz
  • Títulos deduzidos do tamanho da fonte, em três níveis relativos
  • Listas com marcadores e numeradas, detectadas pelos caracteres iniciais
  • Palavras cortadas por hífen no fim da linha, remontadas em uma só
  • Marcas opcionais de separação de página, e até 500 páginas por arquivo

O que ele não faz

  • PDFs digitalizados não produzem nada. Se nenhum texto for encontrado, avisamos que o arquivo provavelmente é uma digitalização.
  • Sem OCR. Ler fotografia de texto exige uma ferramenta completamente diferente.
  • Layouts de várias colunas, tabelas complexas e fórmulas são, no máximo, uma tentativa
  • PDFs criptografados ou protegidos por senha são recusados: aqui não há onde digitar senha
  • Imagens, cores e a posição exata desaparecem; o Markdown não tem como guardá-los
  • Arquivos acima de 25 MB, ou documentos com mais de 500 páginas

O que costumam perguntar

Porque não há nada para extrair. Uma digitalização é a fotografia de uma página: as letras são pixels, não caracteres. Lê-las exige OCR, que esta ferramenta não faz, e preferimos dizer isso a te entregar um arquivo vazio sem explicação.