Extraer texto de un PDF
Selecciona un PDF para recopilar su texto incrustado. La herramienta no aplica OCR a páginas escaneadas ni a texto guardado como imagen.
No se envía ningún byte de tus archivos a Lutrakit.
Cargando
Cargando
Extraer el texto que ya contiene un PDF
Convierte el texto integrado de un PDF en un archivo de texto plano para buscar, citar o editar. La extracción no reconoce palabras dentro de imágenes escaneadas.
Cómo usarlo
- Selecciona un PDF que tenga una capa de texto.
- Activa los separadores de página si necesitas localizar el origen de cada fragmento; inicialmente están desactivados. Elige el nombre de salida.
- Extrae y descarga el TXT, y compara un párrafo, las columnas y los caracteres especiales con el PDF.
Ejemplo
- Punto de partida
- Un PDF con el texto extraíble Hola en la página 1 y Mundo en la página 2, sin separadores de página.
- Qué esperar
- Un TXT con Hola, una línea en blanco y Mundo. El modo con separadores añade encabezados numerados para identificar las páginas.
Antes de empezar
- El límite de entrada es de 100 MiB. Un escaneo que solo contiene imágenes necesita OCR en otra herramienta antes de poder extraer sus palabras aquí.
- TXT no conserva fuentes, imágenes ni la disposición de tablas. El orden depende de la estructura del PDF; revisa las columnas y la codificación de caracteres antes de reutilizarlo.