# Como enviar prontuários a um LLM na nuvem sem enviar o paciente

O padrão de gateway de privacidade: extrair o texto, tokenizar os dados pessoais localmente, enviar só tokens ao modelo e re-hidratar a resposta dentro da sua rede.

Published 2026-09-22 by NETBRAND CORP · https://netbrandcorp.com/pt/blog/gateway-privacidade-llm-prontuarios/

> **Em resumo:** coloque um gateway de privacidade entre os seus documentos e o modelo. Ele extrai o texto, troca cada identificador por um token consistente, guarda o mapa em um cofre local, envia só o texto tokenizado ao LLM na nuvem e devolve os valores reais à resposta dentro da sua rede.

## Por que não enviar o PDF?

Um PDF que parece mascarado ainda pode vazar: a camada de texto sob as tarjas pretas, os metadados, anexos embutidos, assinaturas digitalizadas, logotipos e cabeçalhos repetidos. Enviar texto extraído e sanitizado elimina todos esses canais de uma vez. Se o modelo precisar do layout, envie uma imagem rasterizada da página já mascarada, sem camada de texto nem metadados.

## Por que tokens e não [MASCARADO]?

Se todo identificador vira o mesmo marcador, o modelo perde a estrutura da nota: não distingue o paciente do médico responsável nem do filho. Tokens consistentes preservam essa estrutura:

- `Maria Fernanda Rocha Cardoso` vira `NOME_1` em todo o documento.
- `Dra. Luísa Mendes Ortiz` vira `NOME_3`.
- `14/03/2026` vira `DATA_1`.

O modelo consegue raciocinar sobre "o plano de alta de NOME_1" e a resposta usará os mesmos tokens.

## O pipeline, passo a passo

1. **Ingestão:** PDFs nativos são lidos diretamente; os digitalizados passam por OCR local.
2. **Detecção:** regras para identificadores brasileiros (CPF, CNS, prontuário, CRM, CEP), um modelo NER clínico e, opcionalmente, uma segunda passada com um LLM local.
3. **Transformação:** tokenizar ou sintetizar por tipo de entidade; deslocar as datas com um mesmo deslocamento por paciente para preservar os intervalos.
4. **Cofre:** guardar o mapa token-valor criptografado, só do seu lado.
5. **Envio:** só o texto transformado vai para o modelo na nuvem.
6. **Re-hidratação:** trocar os tokens da resposta pelos valores reais, localmente.
7. **Auditoria:** registrar o que foi detectado e amostrar saídas para revisão humana.

## O texto tokenizado é anônimo?

Não. Enquanto existir um cofre capaz de reverter os tokens, o que trafega é dado pseudonimizado. Pela LGPD, dado anonimizado só deixa de ser dado pessoal quando o processo não pode ser revertido; detalhamos em [Pseudonimizar vs. anonimizar: o que dizem a LGPD, a HIPAA, o GDPR e a lei colombiana](https://netbrandcorp.com/pt/blog/pseudonimizar-vs-anonimizar-lgpd-hipaa-gdpr/). Na prática, o gateway é combinado com controles contratuais do provedor de nuvem: retenção zero, acordo de tratamento de dados e região de processamento definida.

## O que faz isso passar em uma revisão de privacidade?

Um número. Por exemplo: recall de 99% ou mais em identificadores diretos, medido no seu próprio conjunto de validação anotado, mais amostragem humana periódica. Em [Como fazer um POC de anonimização: 100 a 200 documentos reais e recall por entidade](https://netbrandcorp.com/pt/blog/poc-anonimizacao-medir-recall/) explicamos como obtê-lo.

## Veja funcionando

O [portal do Velo](https://netbrandcorp.com/pt/) mostra exatamente esse fluxo: um sumário de alta sendo tokenizado conforme você rola, [o percurso até a nuvem e de volta](https://netbrandcorp.com/pt/#nube) e um controle para re-hidratar segurando o botão. Você também pode [colar a sua própria nota](https://netbrandcorp.com/pt/#probar); ela é processada no seu navegador.

*Este artigo é informação geral, não aconselhamento jurídico.*
