Resumo
Em 18 de maio de 2026, entre 08h17 e 11h16 (horário de Brasília), o portal de acesso dos usuários ficou inacessível por aproximadamente 3 horas, com taxas de erro no endpoint de perfil atingindo entre 80% e 97%. O incidente foi causado pela saturação de disco em um componente de infraestrutura de filas de mensagens, que ao atingir o limite configurado bloqueou automaticamente todos os publicadores de mensagens. O alerta de disco havia sido disparado na sexta-feira anterior, mas foi enviado apenas para um único endereço de e-mail e não chegou à equipe de plantão, permitindo que o problema se agravasse ao longo do final de semana.
Impacto
Todos os usuários do portal enfrentaram timeouts de login e erros 502 durante o período. Além do portal, outros produtos que dependiam do mesmo serviço de identidade foram afetados, incluindo fluxos de criação de novos usuários, reset de senha e login em outros sistemas internos.
Causa Raiz
A causa raiz foi a saturação do espaço em disco de um dos nós do cluster de filas de mensagens. Quando o espaço livre caiu abaixo do limite configurado, o próprio sistema ativou automaticamente um bloqueio de publicação de mensagens como mecanismo de proteção contra perda de dados. Com o bloqueio ativo, um componente intermediário da rota de autenticação passou a enfileirar requisições em vez de processá-las, gerando latências de até 23 segundos nas chamadas de autenticação. O alerta havia sido emitido na sexta-feira às 10h16 — três dias antes da interrupção — mas estava configurado para notificar apenas um único endereço de e-mail não monitorado ativamente, o que permitiu que a condição persistisse sem intervenção durante todo o final de semana.
Resolução
A equipe identificou o problema no cluster de filas de mensagens às 11h05. Foram realizados o reinício do cluster e a expansão do disco. Após essas ações, a latência retornou ao normal às 11h15 e todos os serviços afetados se estabilizaram.
Lições Aprendidas