OBSERVABILIDAD Y SRE

Si os enteráis de un problema porque escribe un cliente, la observabilidad no está funcionando.

Diseñamos, desplegamos y mejoramos plataformas de observabilidad para que tu equipo pueda detectar, entender y resolver problemas de infraestructura con mayor rapidez.

EL PROBLEMA

Hay empresas que descubren un problema de infraestructura cuando el cliente se lo comunica.

Y ese es precisamente el problema. La observabilidad no consiste en instalar Grafana, llenar una pantalla de gráficas y configurar 200 alertas. Consiste en poder responder rápidamente a preguntas bastante más importantes.

¿Está funcionando correctamente mi plataforma?

¿Qué se está degradando?

¿Dónde está el cuello de botella?

¿Qué cambió antes del incidente?

¿Estamos cerca de un límite de capacidad?

¿Este problema afecta realmente al usuario?

¿Puede mi equipo diagnosticarlo sin pasar dos horas buscando?

Si responder a estas preguntas requiere investigar manualmente cada vez que ocurre algo, probablemente existe un problema de observabilidad.

NO EMPEZAMOS POR LA HERRAMIENTA

Empezamos por entender qué necesitas saber de tu infraestructura.

No todas las empresas necesitan el mismo stack. Una infraestructura tradicional puede necesitar Zabbix; Kubernetes suele apoyarse en Prometheus y Grafana; y otro equipo puede tener ya buenas herramientas que simplemente necesitan orden, cobertura y alertas más útiles.

Nuestra función no es venderte una herramienta concreta. Es ayudarte a construir una observabilidad que tenga sentido para tu infraestructura y para tu equipo.
APLICACIONES
MÉTRICAS · LOGS · EVENTOS
OBSERVABILIDAD
DASHBOARDS · ALERTAS · DIAGNÓSTICO

TECNOLOGÍAS

Elegimos las piezas por lo que necesitas ver, no por una lista de logos.

Zabbix

Monitorización de servidores, servicios, disponibilidad, infraestructura tradicional y determinados componentes de red.

Prometheus + Grafana

Recogida de métricas, alertas y dashboards especialmente útiles para Kubernetes y arquitecturas cloud-native.

KubeBolt

Visibilidad operacional sobre Kubernetes para ayudar a entender qué ocurre dentro del clúster.

Kubernetes

Observación del estado, recursos, capacidad y comportamiento de nodos y cargas de trabajo.

Azure · AWS · GCP

Los servicios nativos de cada proveedor cloud pueden formar parte del diseño cuando aportan contexto y encajan con el entorno.

Tu stack actual

No hace falta empezar de cero. Auditamos, ordenamos y mejoramos las herramientas que ya utiliza tu equipo.

QUÉ PODEMOS HACER

Desde saber qué falta hasta dejar el sistema desplegado y documentado.

Assessment de observabilidad

Revisamos qué estás midiendo, qué no puedes ver y dónde existen puntos ciegos. El resultado es una lista priorizada de mejoras.

Diseño del stack

Definimos qué herramientas y componentes tienen sentido para tu infraestructura, tu equipo y el coste que puedes asumir.

Despliegue

Instalamos y configuramos la recogida de datos, su almacenamiento, visualización y reglas básicas de operación.

Dashboards

Creamos vistas que ayudan a operar la plataforma y a responder preguntas concretas, no pantallas llenas de gráficas decorativas.

Alertas

Diseñamos avisos para detectar problemas reales, con contexto suficiente y evitando ruido innecesario.

Observabilidad Kubernetes

Damos visibilidad sobre nodos, pods, workloads, recursos, errores, capacidad y comportamiento del clúster.

SLI y SLO

Definimos indicadores y objetivos que expresan, de forma medible, si el servicio funciona como esperan sus usuarios. Podemos empezar con dos o tres que de verdad importen.

Runbooks

Documentamos qué comprobar y qué hacer ante problemas conocidos para que la respuesta no dependa de la memoria de una persona.

Gestión de incidentes

Establecemos un proceso claro para detectar, diagnosticar, mitigar y revisar incidentes.

Postmortems

Analizamos qué ocurrió, qué factores contribuyeron y qué cambios pueden reducir la probabilidad de repetición.

OBSERVABILIDAD KUBERNETES

Kubernetes genera muchísima información. El problema es saber cuál importa.

Agrupamos las señales para que el equipo pueda pasar del síntoma al diagnóstico sin recorrer cada recurso del clúster a mano.

KUBERNETES

Estado de las cargas

Pods, deployments, disponibilidad, reinicios, CrashLoopBackOff y OOMKilled.

KUBERNETES

Recursos y capacidad

CPU, memoria, requests, limits, nodos, capacidad y scheduling.

KUBERNETES

Dependencias del clúster

Almacenamiento, networking, errores y salud de los componentes que sostienen los workloads.

El objetivo no es monitorizar Kubernetes por monitorizarlo. Es entender qué ocurre cuando la plataforma empieza a comportarse de forma diferente.

ALERT FATIGUE

300 alertas no significan que tengas una infraestructura bien monitorizada.

Cuando todo genera una notificación, el equipo deja de distinguir lo urgente de lo que solo merece seguimiento. Una alerta útil indica qué ha pasado, dónde, desde cuándo, qué impacto puede tener y con qué comprobación conviene empezar.

INFO

Algo ha cambiado.

Conviene registrarlo o revisarlo, pero no requiere intervención inmediata.

WARNING

Algo puede convertirse en un problema.

El equipo debe vigilar la tendencia o actuar antes de que afecte al servicio.

CRITICAL

Alguien debería intervenir.

Existe un impacto real o un riesgo inmediato que necesita una acción clara.

OBSERVABILITY VS SRE

Primero entiendes qué pasa. Después utilizas esa información para mejorar la fiabilidad.

01 · OBSERVABILITY

OBSERVABILITY

¿Qué está pasando?
  • Métricas
  • Logs
  • Eventos
  • Dashboards
  • Alertas
  • Visibilidad Kubernetes
  • Detección
02 · SRE

SRE

¿Qué hacemos con esa información?
  • SLI y SLO
  • Runbooks
  • Gestión de incidentes
  • Postmortems
  • Planificación de capacidad
  • Mejora de fiabilidad
PASODETECTAR
PASOENTENDER
PASODIAGNOSTICAR
PASORESPONDER
PASORECUPERAR
PASOAPRENDER

CUÁNDO HABLAR CON NOSOTROS

Situaciones que suelen indicar que falta visibilidad, criterio o proceso.

Tus clientes detectan los problemas antes que tú.

Tienes Grafana, pero nadie mira Grafana.

Recibes tantas alertas que el equipo termina ignorándolas.

Investigar un incidente lleva demasiado tiempo.

Kubernetes se ha convertido en una caja negra.

La infraestructura depende demasiado del conocimiento de una única persona.

Has crecido, pero la monitorización sigue siendo la misma que cuando eras pequeño.

No sabes realmente qué deberías monitorizar.

CÓMO TRABAJAMOS

Un proceso fácil de seguir y pensado para dejar capacidad dentro de tu equipo.

La infraestructura, la configuración y el conocimiento se quedan en manos del cliente. No creamos dependencia artificial.

  1. Entendemos tu infraestructura.
  2. Revisamos qué puedes ver actualmente y qué no.
  3. Priorizamos los puntos críticos.
  4. Diseñamos o mejoramos el stack.
  5. Implementamos métricas, dashboards y alertas.
  6. Documentamos.
  7. Transferimos el conocimiento a tu equipo.

TRES FORMAS DE EMPEZAR

Elige el punto de entrada que encaja con tu situación actual.

Assessment de observabilidad

Para empresas que no saben exactamente qué necesitan. Analizamos el entorno actual, los puntos ciegos, las alertas y la cobertura.

Solicitar assessment

Implementación de observabilidad

Para empresas que necesitan desplegar o reconstruir su stack: diseño, implementación, dashboards, alertas y documentación.

Hablar de la implementación

SRE Foundations

Para equipos que ya tienen observabilidad y quieren empezar con SLI, SLO, runbooks, gestión de incidentes y postmortems.

Empezar con SRE

RESULTADO

Cuando algo empiece a ir mal, deberías saberlo.

  • Menos puntos ciegos.
  • Menos ruido.
  • Menor tiempo de diagnóstico.
  • Mejor conocimiento de producción.
  • Mayor capacidad para anticipar problemas.
  • Mejor respuesta ante incidentes.

OBSERVABILIDAD Y SRE

¿Qué está ocurriendo realmente dentro de tu plataforma?

Podemos revisar tu situación actual, detectar los principales puntos ciegos y recomendarte el punto de entrada más razonable. Sin obligarte a cambiar de stack. Sin desplegar herramientas porque sí.