Extraer texto de un PDF

Extrae todo el texto de un PDF, previsualízalo, cópialo o descárgalo como archivo .txt. No se sube nada, todo ocurre en tu dispositivo.

Haz clic para elegir un archivo PDF, o arrástralo hasta aquí

Se queda en tu dispositivo, no se sube nada.

Cómo funciona

Un PDF no guarda párrafos, frases ni siquiera palabras: guarda fragmentos de glifos posicionados, es decir, "coloca estas formas de caracteres en estas coordenadas con esta fuente". Esta herramienta usa pdf.js, el motor de PDF de Firefox, para recorrer el flujo de contenido de cada página y recopilar cada una de esas operaciones de texto mediante getTextContent(). Los fragmentos se unen con espacios y se colapsan los saltos de línea, página por página, hasta formar el texto plano que ves. Los marcadores de página opcionales simplemente registran dónde empieza cada página.

Ese modelo de almacenamiento explica las dos sorpresas típicas de la extracción. Primero, el orden de lectura: pdf.js devuelve los fragmentos más o menos en el orden en que aparecen en el archivo, que en diseños de varias columnas o tablas no siempre coincide con el orden en que un humano los leería. Segundo, y más importante: un PDF escaneado no contiene texto alguno. Un escáner produce una fotografía de la página, así que a menos que alguien haya aplicado OCR, no hay glifos que extraer, y esta herramienta lo indicará correctamente en vez de inventar caracteres a partir de píxeles. Una prueba rápida: si puedes seleccionar y copiar texto en tu lector de PDF habitual, la extracción funcionará aquí; si el cursor solo dibuja un recuadro de selección sobre la página, es un escaneo.

La extracción ocurre en el momento en que sueltas el archivo, en un hilo local. Abre las herramientas de desarrollador y observa la pestaña Red: ningún contrato ni informe médico sale nunca de tu navegador.

¿Se suben mis archivos PDF a algún sitio?

No. El texto se extrae completamente dentro de tu navegador con JavaScript. Tus archivos nunca salen de tu dispositivo ni tocan un servidor.

¿Funciona con un PDF escaneado?

No, por sí solo no. Esta herramienta lee el texto que ya está incrustado en el PDF; una página escaneada es solo una imagen, así que no hay texto que extraer a menos que ya se haya pasado por OCR.

¿El formato, como columnas o tablas, se mantiene limpio?

En general sí, pero los diseños complejos (páginas con varias columnas, tablas) pueden salir en un orden de lectura inesperado, ya que los PDF no guardan el texto en una estructura estricta de arriba abajo.

¿Puedo extraer texto de un PDF protegido con contraseña?

Todavía no. La herramienta no puede leer PDF protegidos con contraseña o cifrados y mostrará un error, quita la contraseña primero con un lector de PDF.

Del blog: Por Qué la Compresión de PDF Funciona Genial en Escaneos y Casi Nada en Informes