# Cómo hacer un POC de anonimización: 100 a 200 documentos reales y recall por entidad

Un plan práctico para evaluar herramientas de anonimización sobre tus propias historias clínicas: muestreo, anotación, métricas por tipo de entidad y el criterio de aceptación que tu comité necesita.

Published 2026-09-22 by NETBRAND CORP · https://netbrandcorp.com/es/blog/poc-anonimizacion-medir-recall/

> **En resumen:** toma 100 a 200 documentos reales de tus fuentes más frecuentes, anota a mano cada identificador, corre cada herramienta candidata sobre el mismo set y compara el recall por tipo de entidad. Acuerda el umbral de aceptación con tu comité de privacidad antes de empezar.

## Por qué con tus propios documentos

Los benchmarks públicos usan otros hospitales, otras plantillas y a menudo casos sintéticos, muchos en español de España. Tus exportaciones de historia clínica tienen sus propios encabezados, abreviaturas y formatos de identificador. El único número que predice el comportamiento en producción es el que se mide sobre tus documentos.

## Paso 1: muestrear

- Toma documentos de las fuentes con más volumen: epicrisis, evoluciones, remisiones, formatos escaneados.
- Mezcla PDF nativos y escaneados en la proporción en que realmente los recibes.
- Entre 100 y 200 documentos suele bastar para ver dónde falla una herramienta; agrega más para tipos de documento poco frecuentes.

## Paso 2: anotar

Dos personas anotan de forma independiente y luego resuelven los desacuerdos. Para cada fragmento registra el tipo de entidad: nombre, cédula, historia, EPS, dirección, fecha, teléfono, correo, institución y cualquier tipo propio que te importe. Mantén la guía de anotación corta y por escrito.

## Paso 3: correr las candidatas

Corre cada herramienta sobre el mismo set, on-premise, con la misma configuración que usarías en producción. Guarda las detecciones crudas, no solo la salida redactada, para poder calificarlas.

## Paso 4: calificar por tipo de entidad

- **Recall:** de los identificadores que marcó una persona, ¿cuántos encontró la herramienta? Es la métrica de privacidad.
- **Precisión:** de lo que marcó la herramienta, ¿cuánto era realmente un identificador? Es la métrica de utilidad; la sobre-redacción destruye el sentido clínico.
- Reporta ambas **por tipo de entidad**. Un puntaje global esconde las fallas que importan.

## Paso 5: acordar el criterio de aceptación

Escríbelo antes de ver resultados. Por ejemplo: recall de 99% o más en identificadores directos, medido sobre el set de validación, más muestreo humano mensual en producción. El marco legal está en [Pseudonimizar vs. anonimizar: qué dicen la Ley 1581, HIPAA, GDPR y la LGPD](https://netbrandcorp.com/es/blog/pseudonimizar-vs-anonimizar-ley-1581-hipaa-gdpr-lgpd/).

## Paso 6: decidir la política por entidad

Cuando confíes en la detección, decide qué pasa con cada tipo: tokenizar nombres, desplazar fechas, generalizar edades y municipios, redactar cédulas. Esa política, las métricas y el plan de muestreo son el documento que firma tu comité.

## Hazlo con Velo

Un [POC de Velo](https://netbrandcorp.com/es/#poc) sigue exactamente este plan, en tu sede, en una a tres semanas, y termina con el recall por tipo de entidad y un informe para tu comité. Para la arquitectura que el POC protege, ver [Cómo enviar historias clínicas a un LLM en la nube sin enviar al paciente](https://netbrandcorp.com/es/blog/gateway-privacidad-llm-historias-clinicas/).

*Este artículo es información general, no asesoría legal.*
