Curia
Document Intelligence

OCR seguro

Postura de OCR externo, cola asíncrona, Gemini 2.5 Flash primario y Mistral OCR de respaldo.

El OCR de Curia convierte documentos escaneados e imágenes en texto procesable para búsqueda, resúmenes y chat fundamentado. En v1 el OCR no corre dentro del Worker: se orquesta de forma asíncrona y se apoya en proveedores externos autorizados.

Arquitectura de carga

  • La API emite un upload intent con URL firmada para R2.
  • El navegador sube directamente a R2; el Worker no bufferiza archivos multipart grandes.
  • La API registra metadata del documento y eventos append-only de procesamiento.
  • La cola contiene identificadores, R2 key y contador de intentos; nunca bytes crudos ni texto OCR.

Proveedores

El OCR inicial usa proveedores externos autorizados: Gemini 2.5 Flash como primario y Mistral OCR como respaldo. Antes de procesar documentos, Curia debe aplicar los controles de consentimiento, confidencialidad, DPA/no-retención/no-entrenamiento, región/ruta y estado ARCO activo definidos por la política del tenant.

Mistral OCR solo se usa ante fallas explícitamente elegibles para fallback. Azure AI Document Intelligence y Microsoft Foundry quedan fuera del camino OCR salvo decisión posterior que reabra esa evaluación.

Metadatos de auditoría

Curia conserva metadata operativa segura: proveedor, request id, modelo o versión API, región/ruta, hashes, tiempos, estimación de uso/costo, razón de fallback y clase de falla. No deben registrarse respuesta cruda del proveedor, texto OCR, nombres, RFC, CURP, direcciones, prompts ni documentos en logs, telemetry o nombres de eventos.

Límite de sanitización pre-OCR

Los PDFs escaneados e imágenes no pueden sanitizarse de forma significativa antes del OCR sin redacción local/privada. Por eso el envío externo requiere política de confidencialidad y consentimiento del tenant; después del OCR, el texto extraído debe pasar por sanitización de PII antes de llamadas LLM externas cuando aplique.

On this page