Ir al contenido

PDF To Images

Tipo: pdf-to-images  ·  Paquete: PDF Activities v1.1.0  ·  Salida: List

Convierte las páginas de un PDF en archivos PNG. Es el puente entre un PDF escaneado (sin texto seleccionable) y las actividades que trabajan sobre imágenes: OCR y las de visión.

Renderiza cada página indicada a un PNG dentro de outputDir (se crea si no existe) y devuelve la lista de rutas de los archivos creados, en orden de página.

Los archivos se llaman <prefix>_<página>.png con el número de página a tres cifras — por ejemplo factura_001.png, factura_002.png. Si no indicas prefix, se usa el nombre del PDF de origen sin extensión.

El dpi decide la calidad del render: más DPI mejora la precisión del OCR, a costa de tiempo y tamaño de archivo. Por defecto 200, que suele ser un buen equilibrio para documentos.

ParámetroEditorDescripción
pathexpresiónRuta del PDF de origen.
outputDirexpresiónCarpeta donde se guardan los PNG. Se crea si no existe.
ParámetroEditorDescripción
pagesexpresiónPáginas a renderizar: "all" (def.) o un rango como "1-3,5,7-9".
dpiexpresiónResolución del render. Por defecto 200. Entre 36 y 1200.
prefixexpresiónPrefijo del nombre de los archivos. Por defecto, el nombre del PDF sin extensión.

Devuelve una List con las rutas de los PNG creados, una por página renderizada.

Leer un PDF escaneado pasándolo por OCR página a página:

PDF To Images path = = rutaEscaneado outputDir = "C:/temp/paginas" dpi = 300 → output: imagenes
For Each collection = = imagenes itemVariable = imagen
└─ activities:
OCR Recognize File path = = imagen language = "spa" → output: texto
Log message = = texto

Renderizar solo la primera página:

PDF To Images path = = ruta outputDir = "C:/temp" pages = "1" prefix = "portada" → output: imagenes
  • OCR Recognize File — leer el texto de las imágenes generadas.
  • PDF Get Words — si el PDF tiene texto, obtén las palabras con coordenadas que cuadran con estas imágenes al mismo DPI.
  • PDF Get Text — extraer texto sin pasar por imagen.