Extraer texto de un PDF

Selecciona un PDF para recopilar su texto incrustado. La herramienta no aplica OCR a páginas escaneadas ni a texto guardado como imagen.

No se envía ningún byte de tus archivos a Lutrakit.

Cargando

Extraer el texto que ya contiene un PDF

Convierte el texto integrado de un PDF en un archivo de texto plano para buscar, citar o editar. La extracción no reconoce palabras dentro de imágenes escaneadas.

Cómo usarlo

  1. Selecciona un PDF que tenga una capa de texto.
  2. Activa los separadores de página si necesitas localizar el origen de cada fragmento; inicialmente están desactivados. Elige el nombre de salida.
  3. Extrae y descarga el TXT, y compara un párrafo, las columnas y los caracteres especiales con el PDF.

Ejemplo

Punto de partida
Un PDF con el texto extraíble Hola en la página 1 y Mundo en la página 2, sin separadores de página.
Qué esperar
Un TXT con Hola, una línea en blanco y Mundo. El modo con separadores añade encabezados numerados para identificar las páginas.

Antes de empezar

  • El límite de entrada es de 100 MiB. Un escaneo que solo contiene imágenes necesita OCR en otra herramienta antes de poder extraer sus palabras aquí.
  • TXT no conserva fuentes, imágenes ni la disposición de tablas. El orden depende de la estructura del PDF; revisa las columnas y la codificación de caracteres antes de reutilizarlo.