Ir al contenido

IDP Load Document

Tipo: idp-load-document  ·  Paquete: IDP Activities v1.18.0  ·  Salida: object

Carga un documento y devuelve su texto y cada palabra con su posición en la página. Si el PDF tiene capa de texto la lee directamente; si no la tiene, lo escanea con Azure Document Intelligence. Las dos rutas devuelven la misma estructura.

Es la entrada del pipeline documental: lo que sale de aquí alimenta a AI Extract.

En modo auto (el de por defecto) mide la capa de texto del PDF:

  • Tiene texto → lo lee con la capa de texto. Es exacto y no cuesta nada.
  • No tiene texto (o es una imagen) → lo manda a Azure Document Intelligence.

La decisión queda en el log, con la media de caracteres por página que midió y el umbral, para que puedas ver por qué eligió lo que eligió.

ParámetroEditorDescripción
pathexpresiónRuta del documento: un PDF o una imagen (.jpg, .png, .tif, .bmp).
ParámetroEditorDescripción
modeenumauto (por defecto), text (solo capa de texto, nunca llama al cloud) o azure-di (siempre escanea).
pagesexpresiónPáginas a leer: "all" (por defecto) o un rango como "1-3,5,7-9".
endpointexpresiónURL del recurso de Azure Document Intelligence. Requerido salvo en modo text.
credentialcredencialCredencial de Zoan Cloud con la API key de Azure. Requerida salvo en modo text.
dpiexpresiónResolución en la que se expresan las coordenadas. Por defecto 200.
minCharsPerPageexpresiónUmbral de la autodetección. Por defecto 16.

Devuelve un object con esta forma:

CampoTipoQué es
pathstringLa ruta que se cargó.
sourcestringPor qué ruta entró: text o azure-di.
dpiintEl dpi en el que están las coordenadas.
pageCountintNúmero de páginas leídas.
textstringTodo el texto del documento, con cada línea numerada ([12] ...). Es lo que se le pasa al modelo, y lo que le permite citar de qué línea sacó cada valor.
linesListUna entrada por línea: index, page, x, y, width, height, text. Es lo que usa IDP Ground para leer la caja de la línea que el modelo citó.
markdownstringEl texto original sin numerar — el markdown del servicio en la ruta de escaneo, o el texto reconstruido en la de capa de texto. Por si lo quieres sin los números de línea.
pagesListUna entrada por página: page, width, height, text.
wordsListUna entrada por palabra: text, page, x, y, width, height, confidence.

source no está para que el playbook se ramifique, sino para poder explicar un resultado malo: la confianza de la capa de texto y la del OCR no significan lo mismo.

Todas las palabras salen en píxeles al dpi que pidas, con origen arriba-izquierda, venga el documento de donde venga. Si renderizas la misma página con PDF To Images al mismo dpi, las cajas caen exactamente encima:

IDP Load Document path = = rutaDoc dpi = 200 → output: doc
PDF To Images path = = rutaDoc dpi = 200 outputDir = = carpeta → output: imagenes

Cargar una hoja de vida y extraer sus campos:

IDP Load Document path = = rutaDoc
mode = auto
endpoint = = "https://mi-recurso.cognitiveservices.azure.com"
credential = = credential("azure-di-key")
dpi = 200
→ output: doc
Log message = = "leido por " + doc["source"]
AI Extract credential = = credential("anthropic-key")
prompt = = doc["text"]
schema = {…}
→ output: equipo

Recorrer las palabras (para resaltar, medir o localizar un valor):

Foreach items = = doc["words"] itemVariable = palabra
Log message = = palabra["text"] + " en x=" + toString(palabra["x"])

Por defecto es 16 caracteres por página, y significa “la capa de texto está prácticamente vacía” — porque la señal de un escaneo es que no tiene texto, no que tenga poco. El margen que queda cubre los escáneres que estampan una marca de agua o un pie de página como texto real.

Un umbral generoso (100 o más) manda al cloud cualquier documento digital corto —una portada, un acta de una línea, un certificado— que se leería gratis y perfecto por la capa de texto.

Súbelo solo si tus escaneos llegan con una capa de texto propia en la que no confías (por ejemplo, un OCR previo de mala calidad).

MensajeQué pasó
'endpoint' is required to scan a documentEl documento se detectó como escaneado pero no hay recurso de Azure configurado. Configúralo, o usa mode = text si el documento sí tiene capa de texto.
The credential does not contain an Azure Document Intelligence API keyLa credencial existe pero está vacía o guarda otra cosa.
the text layer is empty (aviso)Pediste mode = text sobre un escaneo. Usa auto o azure-di.
  • AI Extract — extraer campos del documento cargado.
  • PDF To Images — renderizar las páginas para dibujar las cajas encima.
  • OCR — ruta on-prem para clientes sin cloud.