OCR seguro
Postura de OCR externo, cola asíncrona, Gemini 2.5 Flash primario y Mistral OCR de respaldo.
El OCR de Curia convierte documentos escaneados e imágenes en texto procesable para búsqueda, resúmenes y chat fundamentado. En v1 el OCR no corre dentro del Worker: se orquesta de forma asíncrona y se apoya en proveedores externos autorizados.
Arquitectura de carga
- La API emite un upload intent con URL firmada para R2.
- El navegador sube directamente a R2; el Worker no bufferiza archivos multipart grandes.
- La API registra metadata del documento y eventos append-only de procesamiento.
- La cola contiene identificadores, R2 key y contador de intentos; nunca bytes crudos ni texto OCR.
Proveedores
El OCR inicial usa proveedores externos autorizados: Gemini 2.5 Flash como primario y Mistral OCR como respaldo. Antes de procesar documentos, Curia debe aplicar los controles de consentimiento, confidencialidad, DPA/no-retención/no-entrenamiento, región/ruta y estado ARCO activo definidos por la política del tenant.
Mistral OCR solo se usa ante fallas explícitamente elegibles para fallback. Azure AI Document Intelligence y Microsoft Foundry quedan fuera del camino OCR salvo decisión posterior que reabra esa evaluación.
Metadatos de auditoría
Curia conserva metadata operativa segura: proveedor, request id, modelo o versión API, región/ruta, hashes, tiempos, estimación de uso/costo, razón de fallback y clase de falla. No deben registrarse respuesta cruda del proveedor, texto OCR, nombres, RFC, CURP, direcciones, prompts ni documentos en logs, telemetry o nombres de eventos.
Límite de sanitización pre-OCR
Los PDFs escaneados e imágenes no pueden sanitizarse de forma significativa antes del OCR sin redacción local/privada. Por eso el envío externo requiere política de confidencialidad y consentimiento del tenant; después del OCR, el texto extraído debe pasar por sanitización de PII antes de llamadas LLM externas cuando aplique.