Volver a casos
Extracción de datos6 febrero 2026

Extracción documental para operaciones

Los documentos de campo atraviesan una línea de extracción sensible a la confianza y producen registros fiables sin perder la evidencia original.

Nota del caso

La implementación se trató como un sistema operativo pequeño: primero visibilidad, después ownership y solo entonces automatización.

75% menos copiar-pegarField servicesInbox
Imagen editorial de Extracción documental para operaciones

Caso de uso

Extracción documental para operaciones

Los documentos de campo atraviesan una línea de extracción sensible a la confianza y producen registros fiables sin perder la evidencia original. Una operación de servicios de campo dependía de un flujo constante de formularios PDF y adjuntos. El equipo copiaba cliente, ubicación, fecha, servicio, notas y referencias a un registro, y volvía a buscar el documento original cuando algún valor no cuadraba.

Resultado: Los documentos rutinarios se convierten en registros útiles con mucha menos manipulación, mientras los campos dudosos pasan a una vía de corrección. Cada valor conserva su fuente, confianza y decisión de revisión.

Mapa del flujo

Workflow de documento a registro estructurado

El workflow conserva el archivo original, extrae campos y envia dudas a revision.

Bucle de confianza y correcciónInicio1. Recibir adjuntoInbox | upload | metadataSupabase2. Guardar originalPDF original | link carpetaGoogle Drive3. Extraer camposOCR | parser | datos normalizadosPython/FastAPI4. Interpretar dudasNotas | servicio | fechasOpenRouter5. Puntuar confianzaConfianza por campoConfianzasuficiente?NoSi6b. Cola revisionCampos con baja confianza7b. Pedir revisionArchivo | valores extraidosResend/emailReintento6a. Actualizar trackerRegistro operativo7a. Avisar opsRegistro listo | excepcionesResend/emailFin

Base de datos principal: Supabase

Todo el workflow usa Supabase como fuente de verdad: guarda cada registro, su estado y los eventos clave para ver que paso, reintentar fallos y depurar sin buscar en cada herramienta.

Iconos de herramientas

SupabasePython/FastAPIOpenRouterResend/emailGoogle Drive

Racional del sistema

La extracción solo sirve si la incertidumbre es visible

El flujo no asume que todos los PDF estén limpios. Extrae los campos sencillos, conserva el archivo original y envía los valores dudosos a revisión.

La fuente queda conectada

Cada registro estructurado enlaza al documento original, acelerando disputas y correcciones.

Confianza por campo

Un documento puede estar casi listo aunque un campo necesite revision; no hace falta reprocesarlo entero.

Revisión por excepción

La revisión humana se reserva para los valores de baja confianza, no para cada adjunto repetido.

Add-ons que encajan encima

Intake adjuntos email
Archivo Drive/SharePoint
Cambio proveedor OCR
Validacion campos
Dashboard reviewer
Deteccion duplicados
Update ERP/CRM
SLA excepciones
Clasificador documentos
Export audit

El punto de partida

Una operación de servicios de campo dependía de un flujo constante de formularios PDF y adjuntos. El equipo copiaba cliente, ubicación, fecha, servicio, notas y referencias a un registro, y volvía a buscar el documento original cuando algún valor no cuadraba.

El diagnostico se hizo sobre volumen real, herramientas conectadas, puntos de decision y excepciones. La pregunta no era solo que automatizar, sino que prueba demostraria que el proceso habia terminado bien. La prueba operativa importo tanto como la automatizacion.

La implementación

Ductio creo un intake documental que guarda el archivo original, extrae campos requeridos, normaliza valores, puntua confianza por campo y envia registros low-confidence a revision antes de actualizar el tracker.

La implementacion separo reglas, contexto libre, decisiones humanas y efectos externos. Asi el sistema podia mejorar el trabajo diario sin convertir cada excepcion en una caja negra. IA como apoyo dentro del proceso, no como piloto automático.

Qué se usó

La selección de herramientas se hizo desde el proceso, no desde una preferencia técnica previa. El criterio fue que cada pieza tuviera un owner claro, integración estable y una forma sencilla de revisar errores.

En la práctica se combinó Inbox, Google Drive, OCR/extracción, Supabase, OpenRouter, Review dashboard. Las herramientas visibles para el equipo quedaron cerca de su trabajo diario, mientras la lógica de integración quedó documentada y separada de decisiones comerciales sensibles.

InboxGoogle DriveOCR/extracciónSupabaseOpenRouterReview dashboard

La mejora se vio en el trabajo diario.

En lugar de presentar el resultado como un dashboard, el equipo lo notó en tres escenas concretas: menos preparación manual, menos búsqueda de contexto y menos dudas sobre quién tenía que actuar.

Copy-paste: Transferencia manual de campos pasó de Alto a Bajo.

Revisión: Items que revisa una persona pasó de Todos a Excepciones.

Calidad: Registros estructurados pasó de Irregular a Limpia.

Prueba antes/después

Qué cambió en la operación

Antes

1Adjunto recibido
2Persona abre PDF
3Campos copiados manualmente
4Tracker actualizado
5Valores dudosos corregidos despues
6Archivo original buscado si hay disputa

Después

1Intake adjunto
2Archivo fuente retenido
3OCR/extraccion
4Normalizacion
5Confidence scoring
6Cola revision
7Update tracker
8Link fuente

Artefactos visibles

  • JSON de campos extraidos
  • Vista de confianza
  • Cola de revision
  • Link documento original
  • Payload update tracker
  • Decision log de excepciones

Controles

  • Campos low-confidence a revision
  • Documento original retenido
  • Confianza por campo guardada
  • Sin overwrite sin aprobacion
  • Decision de reviewer ligada al registro

Qué cambió después

Los documentos rutinarios se convierten en registros útiles con mucha menos manipulación, mientras los campos dudosos pasan a una vía de corrección. Cada valor conserva su fuente, confianza y decisión de revisión.

El resultado no fue solo ahorrar minutos. El equipo gano una secuencia comun para revisar entradas, entender contexto, decidir, actuar y comprobar que el workflow habia quedado registrado. 75% menos copiar-pegar

El workflow en una línea

01Adjunto02Storage03OCR/IA04Confidence05Database06Dashboard

Cómo se construyó

Los adjuntos se guardan en una carpeta documental, pasan por OCR/extraccion, OpenRouter ayuda con texto ambiguo, Python/FastAPI normaliza campos y Supabase/review dashboard decide si actualizar tracker o pedir revision.

El stack fue pragmático: Inbox, Google Drive, OCR/extracción, Supabase, OpenRouter, Review dashboard. No se eligieron herramientas para impresionar, sino por ownership, integración y mantenimiento. El resultado es un sistema que el equipo puede entender y operar.

Lo que quedó entregado

Implementado
  • Inbox/upload intake
  • Retencion archivo fuente
  • Extraccion OCR
  • Normalizacion campos
  • Confidence scoring
  • Cola excepciones
  • Tracker update
  • Audit con link fuente
Beneficios
  • La entrada manual bajó de forma clara en documentos repetidos.
  • Campos de baja confianza quedan visibles para revision en vez de contaminar el tracker.
  • Operaciones ganó una vista semanal más limpia.
  • Cada registro estructurado mantiene link al documento original.
  • Reviewers revisan excepciones, no cada adjunto.
  • La calidad de datos mejora porque las reglas de normalizacion son consistentes.
  • Los responsables trabajan primero las excepciones en lugar de revisar una pila indiferenciada de adjuntos.
Siguiente paso

Mapear un workflow parecido.

Abrir brief
Ductio
DuctioSYSTEMS
Planes de automatización con IA para equipos que necesitan herramientas conectadas, flujos monitorizados y traspasos mantenibles.
Foco operativo

Operaciones CRM, reporting, aprobaciones, gestión documental y herramientas internas asistidas por IA.

Copyright © 2026 Ductio. All rights reserved.