PDF To Images
PDF To Images
Sección titulada «PDF To Images»Tipo: pdf-to-images · Paquete: PDF Activities v1.1.0 · Salida: List
Convierte las páginas de un PDF en archivos PNG. Es el puente entre un PDF escaneado (sin texto seleccionable) y las actividades que trabajan sobre imágenes: OCR y las de visión.
Cómo funciona
Sección titulada «Cómo funciona»Renderiza cada página indicada a un PNG dentro de outputDir (se crea si no existe) y devuelve la lista de rutas de los archivos creados, en orden de página.
Los archivos se llaman <prefix>_<página>.png con el número de página a tres cifras — por ejemplo factura_001.png, factura_002.png. Si no indicas prefix, se usa el nombre del PDF de origen sin extensión.
El dpi decide la calidad del render: más DPI mejora la precisión del OCR, a costa de tiempo y tamaño de archivo. Por defecto 200, que suele ser un buen equilibrio para documentos.
Parámetros requeridos
Sección titulada «Parámetros requeridos»| Parámetro | Editor | Descripción |
|---|---|---|
path | expresión | Ruta del PDF de origen. |
outputDir | expresión | Carpeta donde se guardan los PNG. Se crea si no existe. |
Parámetros opcionales
Sección titulada «Parámetros opcionales»| Parámetro | Editor | Descripción |
|---|---|---|
pages | expresión | Páginas a renderizar: "all" (def.) o un rango como "1-3,5,7-9". |
dpi | expresión | Resolución del render. Por defecto 200. Entre 36 y 1200. |
prefix | expresión | Prefijo del nombre de los archivos. Por defecto, el nombre del PDF sin extensión. |
Devuelve una List con las rutas de los PNG creados, una por página renderizada.
Ejemplo
Sección titulada «Ejemplo»Leer un PDF escaneado pasándolo por OCR página a página:
PDF To Images path = = rutaEscaneado outputDir = "C:/temp/paginas" dpi = 300 → output: imagenesFor Each collection = = imagenes itemVariable = imagen └─ activities: OCR Recognize File path = = imagen language = "spa" → output: texto Log message = = textoRenderizar solo la primera página:
PDF To Images path = = ruta outputDir = "C:/temp" pages = "1" prefix = "portada" → output: imagenesActividades relacionadas
Sección titulada «Actividades relacionadas»- OCR Recognize File — leer el texto de las imágenes generadas.
- PDF Get Words — si el PDF sí tiene texto, obtén las palabras con coordenadas que cuadran con estas imágenes al mismo DPI.
- PDF Get Text — extraer texto sin pasar por imagen.