PDF → Markdown
Tire o texto de um PDF.
Como Markdown, não como bagunça.
Um PDF não tem títulos: ele tem instruções para pintar glifos em certas coordenadas.
Então a estrutura é reconstruída a partir do tamanho da fonte e do espaçamento. E a gente diz onde isso é chute.
Solte um arquivo aqui.
Ou escolha pelo botão. Ou cole com Ctrl+V. Dezenas de uma vez está tudo bem.
.pdf / 25 MB por arquivo / roda no seu navegador, nada é enviado
Outros formatos: .docx .doc DOCX → MD · .xlsx Excel → MD · .csv .tsv .txt CSV → MD · .html .htm HTML → MD · .pptx .ppt .odp PPTX → MD
Ajustes
Marcadores
Marcas de página
Como funciona
- 01Solte um PDF na caixa acima. Ele é analisado pelo pdf.js da Mozilla, e tanto a biblioteca quanto as fontes vêm deste site: nada é pedido a nenhuma CDN.
- 02O texto é extraído página por página, na ordem de leitura. O tamanho da fonte decide o que é título; os vãos verticais, onde os parágrafos quebram; a letra pequena colada na borda de cima ou de baixo é tratada como cabeçalho ou rodapé e descartada.
- 03Ligue as marcas de página se quiser um comentário HTML entre as páginas. Depois copie o Markdown ou baixe o .md.
O que ele aceita
- Qualquer PDF com camada de texto real: exportado do Word, do LaTeX, do Pages ou do Imprimir em PDF de um navegador
- Texto em chinês, japonês e coreano, pelas tabelas CMap que este site já traz
- Títulos deduzidos do tamanho da fonte, em três níveis relativos
- Listas com marcadores e numeradas, detectadas pelos caracteres iniciais
- Palavras cortadas por hífen no fim da linha, remontadas em uma só
- Marcas opcionais de separação de página, e até 500 páginas por arquivo
O que ele não faz
- PDFs digitalizados não produzem nada. Se nenhum texto for encontrado, avisamos que o arquivo provavelmente é uma digitalização.
- Sem OCR. Ler fotografia de texto exige uma ferramenta completamente diferente.
- Layouts de várias colunas, tabelas complexas e fórmulas são, no máximo, uma tentativa
- PDFs criptografados ou protegidos por senha são recusados: aqui não há onde digitar senha
- Imagens, cores e a posição exata desaparecem; o Markdown não tem como guardá-los
- Arquivos acima de 25 MB, ou documentos com mais de 500 páginas
O que costumam perguntar
Porque não há nada para extrair. Uma digitalização é a fotografia de uma página: as letras são pixels, não caracteres. Lê-las exige OCR, que esta ferramenta não faz, e preferimos dizer isso a te entregar um arquivo vazio sem explicação.