velo
ES EN PT
Solicitar POC

· 3 min de lectura · NETBRAND CORP

Anonimización de PII on-premise para texto clínico: qué es y cuándo la necesitas

Qué significa detectar y anonimizar datos personales on-premise en historias clínicas, en qué se diferencia de una API en la nube y las señales de que la necesitas.

¿Qué significa "anonimización de PII on-premise"?

Es software que detecta información personal identificable (PII) y datos de salud en texto, PDFs, imágenes y audio, y luego los redacta, tokeniza o reemplaza, todo en hardware que tú controlas. Nada se envía a la nube de un proveedor para ser analizado.

En un entorno clínico la entrada suele ser una epicrisis, una evolución, una remisión o un formato escaneado. La salida es el mismo documento, o texto limpio, donde nombres, identificadores, direcciones y fechas se trataron según una política.

¿En qué se diferencia de una API de anonimización en la nube?

Una API en la nube te pide enviar el documento crudo para limpiarlo. Con los contratos adecuados puede ser aceptable, pero saca de tu perímetro la versión más sensible del dato, que es justo lo que muchas IPS, EPS y grupos de investigación quieren evitar.

Las herramientas on-premise lo invierten: el documento crudo nunca sale. Solo sale, si acaso, el resultado transformado.

¿Qué debe detectar un buen sistema en una historia clínica colombiana?

  • Nombres de pacientes, acompañantes y profesionales, incluidos los apellidos que se repiten en la narrativa.
  • Identificadores: cédula, tarjeta de identidad, NIT, número de historia, número de autorización; la lista completa está en Cédula, historia, EPS y direcciones: los identificadores colombianos que el NER genérico no detecta.
  • Direcciones y ubicaciones, con la nomenclatura local ("Cra 7 # 45-12"), barrios y municipios.
  • Fechas de ingreso, egreso y control, y edades.
  • Datos de contacto: celulares, fijos y correos.
  • Instituciones: IPS, clínicas, hospitales y EPS.

Los modelos genéricos de reconocimiento de entidades detectan nombres razonablemente bien, pero fallan con los formatos locales. Los sistemas de producción combinan un modelo NER clínico en español, reglas para identificadores locales y, opcionalmente, una segunda pasada con un LLM local.

¿Cuándo la necesitas?

¿Qué preguntarle a un proveedor?

  1. ¿El motor corre totalmente sin internet, incluida la validación de la licencia?
  2. ¿Qué identificadores de mi país soporta sin configuración?
  3. ¿Puedo elegir por tipo de entidad si redactar, tokenizar, sintetizar o desplazar fechas?
  4. ¿La bóveda de reversión se guarda solo de mi lado?
  5. ¿Puedo medir el recall por tipo de entidad sobre mis propios documentos?

Dónde encaja Velo

Velo es un motor de detección y anonimización de PII on-premise para texto clínico en Colombia, Estados Unidos y Brasil. Corre en el Velo Nodo, un computador de IA compacto, o en tu propio clúster Docker o Kubernetes. Puedes ver una epicrisis anonimizándose en vivo o solicitar un POC.

Este artículo es información general, no asesoría legal.