Projeto

Observability Control Plane

experência aaplicável em laboratórios e projetos de produção

#gitops#flux#elastic search#kibana#grafana#prometheus#jagger#open telemetry#otel collector#azure diagnostic settigs

Impacto: Meu aprendizado em observabilidade durante meu processo de carreira.

Objetivo

Reunir em um so lugar o que fui aprendendo sobre observabilidade ao longo da carreira: o que testei em laboratorio, o que chegou a produção e o que mudou na forma como eu enxergo o tema.

Stack

  • Grafana e Prometheus
  • Elastic Search e Kibana
  • OpenTelemetry e OTel Collector
  • Jaeger
  • Azure Diagnostic Settings e Log Analytics
  • GitOps com Flux

Como acompanhar

Os registros ficam no Diario do projeto, logo abaixo. Cada post traz um recorte especifico: o problema que apareceu, a decisão que tomei e o que ficou de aprendizado.

Diario do projeto

maio de 2025

Dashboard de porcentagem de uso de logs

Medir a proporção de log por origem em todos os ambientes

Conteudo protegido por senha.

julho de 2025

Grafana reiniciando e alertas com fonte de dados quebrada

Reinício de pod por sidecar mal delimitado e regras órfãs no banco

Conteudo protegido por senha.

25 de mar. de 2026

Dashboard APIM

Saber em minutos se o gargalo é da API ou do gateway

Conteudo protegido por senha.

abril de 2026

Serviço reiniciando sem motivo aparente

Pods encerrados por limite de memória, fora do recorte do dashboard

Conteudo protegido por senha.

junho de 2026

Correção dos dashboards de cronjob e job

Painel que reportava execução de job de forma incorreta

Conteudo protegido por senha.

junho de 2026

Indisponibilidade do Grafana em todos os ambientes

Atualização automática de plugin, sem passar por commit nem revisão

Conteudo protegido por senha.

julho de 2026

Alternativa ao Explore do Grafana

Dashboards segregados por produto, entregues como código

Conteudo protegido por senha.