PDF → Markdown

Saca el texto de un PDF.
Como Markdown, no como un caos.

Un PDF no tiene títulos: tiene instrucciones para pintar glifos en unas coordenadas.

Así que reconstruimos la estructura a partir del tamaño de letra y el espaciado. Y decimos dónde eso es una conjetura.

Suelta un archivo aquí.

O elígelo con el botón. O pégalo con Ctrl+V. Docenas a la vez está bien.

.pdf / 25 MB por archivo / corre en tu navegador, nada se sube

Otros formatos: .docx .doc DOCX → MD · .xlsx Excel → MD · .csv .tsv .txt CSV → MD · .html .htm HTML → MD · .pptx .ppt .odp PPTX → MD

Ajustes
Viñetas
Marcas de página

Cómo funciona

  1. 01Suelta un PDF en la caja de arriba. Se analiza con pdf.js de Mozilla, y tanto la biblioteca como sus fuentes se sirven desde este sitio: no se pide nada a ninguna CDN.
  2. 02El texto se extrae página a página en orden de lectura. El tamaño de letra decide qué es un título; los huecos verticales, dónde rompen los párrafos; la letra pequeña pegada al borde superior o inferior se trata como encabezado o pie y se descarta.
  3. 03Activa las marcas de página si quieres un comentario HTML entre páginas. Luego copia el Markdown o descarga el .md.

Qué admite

  • Cualquier PDF con capa de texto real: exportado desde Word, LaTeX, Pages o el Imprimir a PDF de un navegador
  • Texto en chino, japonés y coreano, mediante las tablas CMap que este sitio incluye
  • Títulos deducidos del tamaño de letra, en tres niveles relativos
  • Listas con viñetas y numeradas, detectadas por sus caracteres iniciales
  • Palabras partidas con guion al final de línea, reunidas en una sola
  • Marcas de separación de página opcionales, y hasta 500 páginas por archivo

Qué no hace

  • Los PDF escaneados no dan nada. Si no se encuentra texto, te diremos que el archivo es probablemente un escaneo.
  • Sin OCR. Leer fotografías de texto necesita otra herramienta por completo.
  • Las maquetaciones a varias columnas, las tablas complejas y las fórmulas son, como mucho, un intento
  • Los PDF cifrados o protegidos con contraseña se rechazan: aquí no hay dónde escribir una contraseña
  • Las imágenes, los colores y la posición exacta desaparecen; Markdown no tiene manera de guardarlos
  • Archivos de más de 25 MB, o documentos de más de 500 páginas

Lo que suele preguntarse

Porque no hay nada que extraer. Un escaneo es la fotografía de una página: las letras son píxeles, no caracteres. Leerlas necesita OCR, que esta herramienta no hace, y preferimos decirlo antes que darte un archivo vacío sin explicación.