El screening de compliance con IA es el proceso automatizado de verificar personas y entidades contra listas de sanciones internacionales (OFAC, ONU, UE), PEPs y antecedentes penales usando fuzzy matching multicapa que reduce el due diligence de horas a menos de 200ms por consulta. En nodo. operamos dos plataformas en producción: screening contra 44,000 entidades en 7 listas de sanciones y verificación de antecedentes penales contra 2.7 millones de causas judiciales chilenas.

En nodo. construimos dos plataformas de compliance en producción: una de screening contra 7 listas internacionales de sanciones con 44,000 entidades, y una de screening de antecedentes penales contra 2.7 millones de causas judiciales chilenas que involucran 3.9 millones de personas. Este artículo detalla la arquitectura, los algoritmos y las lecciones aprendidas.

7
Listas de sanciones
44K
Entidades vigiladas
2.7M
Causas judiciales

¿Por qué el matching exacto no funciona en screening de compliance?

Según un reporte de LexisNexis Risk Solutions (2024), las instituciones financieras gastan un promedio de USD $49.9 millones anuales en compliance AML/KYC. Un estudio de Accenture estima que el 95% de las alertas de screening son falsos positivos, generando costos operativos masivos. Y según Fenergo (2024), las multas globales por incumplimiento de compliance superaron USD $6.6 mil millones en 2024.

El matching exacto de nombres no funciona en compliance. Los nombres en listas de sanciones vienen transliterados de idiomas como árabe, ruso, chino y farsi, cada uno con múltiples variantes. "Mohammed" puede aparecer como "Muhammad", "Mohamed", "Mohamad" o "Muhammed". Un sistema que solo hace matching exacto pierde, según nuestras métricas, el 30-40% de las coincidencias reales.

El fuzzy matching en compliance usa múltiples algoritmos en cascada para maximizar recall sin destruir precision:

Algoritmos de distancia de strings

La base: Levenshtein distance mide el número mínimo de ediciones (inserción, eliminación, sustitución) para transformar un string en otro. Para compliance, normalizamos el threshold por largo de string: una distancia de 2 es aceptable para "Mohammed" (8 caracteres) pero no para "Li" (2 caracteres). Complementamos con Jaro-Winkler similarity, que da más peso a las coincidencias al inicio del string, donde los prefijos de nombres tienden a ser más estables entre transliteraciones.

Matching fonético

Algoritmos como Double Metaphone convierten nombres a representaciones fonéticas que capturan cómo suenan, no cómo se escriben. En nodo. implementamos una variante adaptada para nombres hispanos que maneja la ñ, acentos y patrones como "ll" vs "y".

Tokenización y matching parcial

"Juan Carlos González Pérez" debe matchear con "González Pérez, Juan C." a pesar del orden invertido y la abreviación. Usamos token set ratio (rapidfuzz): compara tokens comunes ignorando el orden, resolviendo, según nuestras métricas, el 70% de los problemas de formato de nombre.

¿Cómo funciona una plataforma de screening contra sanciones internacionales?

La plataforma de screening de sanciones de nodo. procesa 7 listas internacionales de forma consolidada:

OFAC SDN (EE.UU.): ~12,000 entidades. Actualización diaria.

EU Sanctions List: ~4,500 entidades. Actualización semanal.

UN Security Council: ~800 entidades. Actualización irregular.

OFAC Non-SDN: ~8,000 entidades. Incluye listas sectoriales.

UK Sanctions List: ~3,200 entidades. Post-Brexit, diverge de EU.

Listas PEP Chile: ~5,500 personas. Fuentes: Servel, CMF, Contraloría.

Listas regionales LATAM: ~10,000 entidades. GAFI, UAF Chile.

La arquitectura tiene tres capas: ingestión (descarga y parseo de listas en XML, CSV, JSON), indexación (normalización, representaciones fonéticas, indexación con pg_trgm), y matching (pipeline de 4 etapas con pre-filtro fonético, fuzzy matching, scoring compuesto y clasificación final).

Pipeline de matching en 4 etapas

PIPELINE DE SCREENING — 4 ETAPAS Normalización Unicode · casing transliteración Blocking Reducir candidatos de 44K → ~50 Fuzzy Match Levenshtein · Jaro token set ratio Scoring Umbral configurable por lista y riesgo Input: nombre → Normalizado → Candidatos → Scores → Match / No match Latencia total: <200ms por consulta
  1. Pre-filtro por bloque fonético: reduce el espacio de búsqueda de 44,000 a ~200-500 candidatos usando Double Metaphone. Latencia: menos de 5ms.
  2. Matching fuzzy multi-algoritmo: aplica Levenshtein, Jaro-Winkler y token set ratio a los candidatos. Genera un score compuesto ponderado. Latencia: 20-50ms.
  3. Scoring con contexto: ajusta el score usando metadata: país de nacimiento, fecha de nacimiento, tipo de documento. Un match de nombre al 85% con fecha de nacimiento exacta sube a 95%. Latencia: menos de 5ms.
  4. Clasificación: score mayor a 90% se marca como hit confirmado. Entre 70-90% se marca como potencial hit para revisión humana. Menor a 70% se descarta. Latencia: menos de 1ms.

Latencia total end-to-end: 30-60ms por consulta individual. Para batch processing de 10,000 nombres: menos de 8 minutos con paralelización en 4 workers.

¿Cómo automatizar el screening de antecedentes penales en Chile?

La segunda plataforma de nodo. hace screening contra el registro de causas judiciales penales de Chile. La escala es diferente: 2.7 millones de causas que involucran 3.9 millones de personas (muchas aparecen en múltiples causas).

Desafíos del sistema penal chileno

Arquitectura de la solución

Para 3.9M de registros con latencia aceptable, pre-computamos índices invertidos de trigramas y bloques fonéticos. La consulta busca primero en el índice (menos de 10ms) y aplica matching detallado solo a los candidatos (50-200 registros). Un batch de 5,000 empleados procesa en menos de 4 minutos con resultados clasificados: sin coincidencias (verde), revisión (amarillo), confirmado (rojo). Tasa de falsos positivos debajo del 5%.

¿Cómo reducir los falsos positivos en screening de compliance?

El problema más subestimado del compliance screening no es encontrar matches: es gestionar los que no lo son. En un batch típico de 10,000 personas contra nuestras 7 listas de sanciones, se generan entre 300-500 alertas, de las cuales, según nuestras métricas, el 85-90% son falsos positivos. Sin un sistema de gestión, un analista de compliance tarda 3-5 minutos por alerta en determinar si es real. Con 400 alertas, eso son 20-33 horas de trabajo manual.

La plataforma de nodo. automatiza la resolución del 60% de los falsos positivos usando reglas determinísticas (mismo nombre pero diferente país y fecha de nacimiento = auto-descarte) y un modelo entrenado con 15,000 decisiones históricas. El analista humano solo revisa los casos ambiguos, reduciendo el tiempo de resolución de 33 horas a menos de 5.

¿Qué requisitos regulatorios debe cumplir un sistema de compliance con IA?

Las regulaciones exigen: auditabilidad completa (registro con timestamp, fuentes, scores y decisión, retención mínima 5 años), actualización de listas (OFAC actualiza diariamente; usar la lista de ayer es incumplimiento), documentación de metodología (el regulador puede pedir que expliques tus algoritmos y thresholds), y screening continuo (re-screening automático cada vez que las listas se actualizan, no solo al onboarding).

¿Cómo implementar IA en compliance y screening?

El compliance screening con IA no es simplemente "buscar nombres en una lista". Es un problema de ingeniería que combina NLP, algoritmos de matching, procesamiento batch, gestión de falsos positivos y cumplimiento regulatorio. Los sistemas manuales no escalan. Los sistemas automatizados sin fuzzy matching inteligente fallan en recall. El punto óptimo requiere múltiples capas de matching con scoring contextual y revisión humana para los casos ambiguos.

En nodo. tenemos dos plataformas de compliance en producción procesando decenas de miles de consultas mensuales. Si tu empresa necesita automatizar due diligence, screening de sanciones o verificación de antecedentes, podemos construir una solución adaptada a tu contexto regulatorio.