# Cómo enviar historias clínicas a un LLM en la nube sin enviar al paciente

El patrón de gateway de privacidad: extraer texto, tokenizar los datos personales localmente, enviar solo tokens al modelo y re-hidratar la respuesta dentro de tu red.

Published 2026-09-22 by NETBRAND CORP · https://netbrandcorp.com/es/blog/gateway-privacidad-llm-historias-clinicas/

> **En resumen:** pon un gateway de privacidad entre tus documentos y el modelo. Extrae el texto, reemplaza cada identificador por un token consistente, guarda el mapa en una bóveda local, envía solo el texto tokenizado al LLM en la nube y devuelve los valores reales a la respuesta dentro de tu red.

## ¿Por qué no enviar el PDF?

Un PDF que parece redactado puede seguir filtrando: la capa de texto bajo los recuadros negros, los metadatos, los adjuntos embebidos, firmas escaneadas, logos de la IPS y encabezados repetidos. Enviar texto extraído y sanitizado elimina todos esos canales de una vez. Si el modelo necesita ver el layout, envía una imagen rasterizada de la página ya redactada, sin capa de texto ni metadatos.

## ¿Por qué tokens y no [REDACTADO]?

Si todos los identificadores se convierten en el mismo marcador, el modelo pierde la estructura de la nota: no distingue al paciente del médico tratante ni del hijo. Los tokens consistentes conservan esa estructura:

- `María Fernanda Rojas Cárdenas` pasa a ser `NOMBRE_1` en todo el documento.
- `Dra. Luisa Mejía Ortiz` pasa a ser `NOMBRE_3`.
- `14/03/2026` pasa a ser `FECHA_1`.

El modelo puede razonar sobre "el plan de egreso de NOMBRE_1" y su respuesta usará los mismos tokens.

## El pipeline, paso a paso

1. **Ingesta:** los PDF nativos se leen directamente; los escaneados pasan por OCR local.
2. **Detección:** reglas para identificadores colombianos (cédula, historia, EPS, direcciones), un modelo NER clínico en español y, opcionalmente, una segunda pasada con un LLM local.
3. **Transformación:** tokenizar o sintetizar por tipo de entidad; desplazar las fechas con un mismo offset por paciente para conservar los intervalos.
4. **Bóveda:** guardar el mapa token-valor cifrado, solo de tu lado.
5. **Envío:** solo el texto transformado va al modelo en la nube.
6. **Re-hidratación:** reemplazar los tokens de la respuesta por los valores reales, localmente.
7. **Auditoría:** registrar qué se detectó y muestrear salidas para revisión humana.

## ¿El texto tokenizado es anónimo?

No. Mientras exista una bóveda que pueda revertir los tokens, lo que viaja es dato pseudonimizado. La historia clínica es dato sensible bajo la Ley 1581 de 2012 y documento reservado según la Resolución 1995 de 1999; lo desarrollamos en [Pseudonimizar vs. anonimizar: qué dicen la Ley 1581, HIPAA, GDPR y la LGPD](https://netbrandcorp.com/es/blog/pseudonimizar-vs-anonimizar-ley-1581-hipaa-gdpr-lgpd/). En la práctica se combina el gateway con controles contractuales del proveedor de nube: retención cero, acuerdo de tratamiento de datos y región de procesamiento definida.

## ¿Qué hace que esto pase una revisión de privacidad?

Un número. Por ejemplo: recall de 99% o más en identificadores directos, medido sobre tu propio set de validación anotado, más muestreo humano periódico. En [Cómo hacer un POC de anonimización: 100 a 200 documentos reales y recall por entidad](https://netbrandcorp.com/es/blog/poc-anonimizacion-medir-recall/) explicamos cómo obtenerlo.

## Míralo funcionando

El [portal de Velo](https://netbrandcorp.com/es/) muestra este flujo exacto: una epicrisis tokenizándose bajo tu scroll, [el recorrido hacia la nube y de vuelta](https://netbrandcorp.com/es/#nube) y un control para re-hidratar manteniendo presionado. También puedes [pegar tu propia nota](https://netbrandcorp.com/es/#probar); se procesa en tu navegador.

*Este artículo es información general, no asesoría legal.*
