Sistema de Georreferenciamento SINAN × CNEFE
Este painel associa cada caso notificado ao SINAN (Sistema de Informação de Agravos de Notificação) a um endereço geolocalizado da base CNEFE (Cadastro Nacional de Endereços para Fins Estatísticos, IBGE) e ao respectivo setor censitário — transformando bases de notificação em dados espacialmente analisáveis para a vigilância epidemiológica.
Passo a passo
Todos os controles de configuração ficam no menu à esquerda.
-
Escolha o método de processamento.
Match probabilístico usa a base CNEFE local; GeocodeBr usa o pacotegeocodebr. Para o Distrito Federal, o match probabilístico aciona automaticamente o pipeline determinístico de 18 fases. -
Carregue o arquivo da base de notificações.
Formatos aceitos: CSV, TXT, XLSX e XLS, com até 500 MB. -
Informe o formato do arquivo.
Em Arquivo SINAN, as colunas são padronizadas automaticamente. Em Declarar colunas de endereço, indique quais colunas do seu arquivo correspondem a código único, logradouro, número, município, bairro, RA e complemento — útil para bases que não seguem o layout do SINAN. -
Selecione a UF.
Define qual tabela do CNEFE será consultada e qual pipeline será executado. Em arquivos no formato SINAN, a UF também é detectada automaticamente a partir da colunaSG_UF. -
Defina o escopo do processamento.
A UF inteira, ou um município específico pelo código IBGE de 6 dígitos. -
Ajuste o limite de similaridade.
Valor mínimo de similaridade para que um match probabilístico seja aceito nas fases 4 e 5. Valores mais altos são mais conservadores: menos casos georreferenciados, com maior confiança em cada um. Não afeta o pipeline do Distrito Federal, que é determinístico. -
Clique em Processar Dados.
O andamento aparece em uma barra de progresso com a fase em execução. Ao terminar, o painel abre automaticamente a aba Resumo.
Depois do processamento, as demais abas ficam disponíveis:
- Resumo — método utilizado, escopo processado, tempo de execução e total de registros, com os botões de download.
- Métricas Detalhadas — distribuição de casos por município ou RA; cobertura e matches por fase no DF; qualidade, tipo de endereço e estatísticas de similaridade nas demais UFs.
- Gráficos — distribuição de similaridade dos casos processados.
- Mapa de Coordenadas — visualização interativa dos casos georreferenciados, como pontos ou densidade de kernel (KDE).
- Triagem de Endereços — revisão manual, caso a caso, dos registros de baixa similaridade, escolhendo entre os candidatos rankeados. Indisponível para o DF, cujo pipeline é determinístico e não gera candidatos alternativos.
Metodologia
O georreferenciamento funciona como uma cascata de tentativas: as fases são aplicadas em sequência, da mais determinística e confiável para a mais aproximada. Um caso só é avaliado por uma fase se não obteve match em nenhuma das fases anteriores — e o rótulo da fase que o resolveu fica gravado no resultado, permitindo auditar a confiabilidade de cada registro individualmente.
O método aplicado depende da Unidade Federativa selecionada:
Distrito Federal
- Pipeline próprio, otimizado para o volume e a formatação de endereços do DF (quadras, conjuntos e lotes).
- Compara bigramas de identificador e valor — por exemplo QNM → 12 — com filtro de Região Administrativa e desempate pela menor distância de número.
- Fases seguintes tratam variações de abreviação, letra de quadra, chácaras, identificadores raros e ausência de RA informada.
- Casos sem match em nenhuma fase recebem o centroide da Região Administrativa, sinalizados como tal.
Demais Unidades Federativas
- Fases 1 a 3 — determinísticas: endereço completo idêntico, logradouro idêntico ignorando o número, e nome de logradouro idêntico restrito a um único bairro.
- Fases 4 e 5 — probabilísticas: similaridade Jaro-Winkler entre o endereço notificado e os candidatos do CNEFE.
- Cada fase roda primeiro nos casos com município informado e depois, para quem sobrou, nos casos sem município — sem exigir correspondência territorial.
- As fases probabilísticas também alimentam a lista de candidatos rankeados usada na aba de Triagem.
GeocodeBr
-
Geocodificação pelo pacote
geocodebr, como alternativa ao record linkage probabilístico. - Retorna precisão do match, endereço encontrado, desvio em metros e setor censitário.
- Selecionável no campo Método de processamento, no menu à esquerda.
O critério exato de cada fase, o rótulo gravado no resultado e a referência à linha correspondente no código estão descritos na Documentação das Fases de Matching.
Fontes de dados
Base de endereços de referência usada na geocodificação, com coordenadas, setor censitário e município de cada endereço cadastral. Mantida localmente em um banco DuckDB, com uma tabela por UF. Conheça o CNEFE no site do IBGE.
Regiões Administrativas no Distrito Federal e municípios nas demais UFs, usadas na associação territorial, no contorno do mapa e no fallback por centroide.
Referências
- CNEFE — Cadastro Nacional de Endereços para Fins Estatísticos (IBGE) Página oficial da base de endereços usada como referência na geocodificação.
- Tuberculose — Cenários de Risco e Determinantes Sociais Eixo do Programa Cenários do qual este painel é uma entrega.
- Repositório do sistema no GitHub Código-fonte, instruções de instalação e documentação técnica.
- Documentação das Fases de Matching Critério de match, rótulo gravado e referência no código, fase a fase.
Resumo do Processamento
Métricas Detalhadas - Match Probabilístico
Estatísticas de Similaridade
Processe os dados primeiro para ver as métricas detalhadas.
Distribuição de Similaridade
Processe os dados primeiro para ver os gráficos.
Visualização Geográfica dos Dados Processados
Processe os dados primeiro para visualizar o mapa de coordenadas.
Triagem de Endereços com Baixa Similaridade
Processe os dados primeiro para acessar a triagem de endereços.