Infra Monitor

CargaÍndiceSLAMTTRTickets

Servidores

Alertas activas

Relevo de turno

Nodo de monitorización · 10 servidores en supervisión

Técnico:

Notas de relevo

Clasificación

Cargando…

Guía rápida del panel

Objetivo: mantener el SLA (disponibilidad) por encima del 90 %. Cada avería abierta lo hace bajar, y más rápido cuanto más tardes: la columna «Escala en» de las alertas indica cuánto falta para que empeore.

Cómo trabajar

  1. Mira la alerta más roja. Las alertas muestran síntomas: el origen real puede estar en otro servidor.
  2. Escribe hosts. «A → B» significa que A depende de B: si B falla, A va lento.
  3. Entra en el servidor sospechoso con ssh nombre y escribe tail (últimas líneas de su registro). Si dice «upstream X timed out», el problema está en X: ve allí.
  4. Con la pista, aplica la solución. Si te pierdes, escribe pista (cuesta algo de SLA).

Qué hace cada comando

ssh hostEntra en un servidor; los comandos siguientes se aplican a él. También puedes indicar el host al final: df db-01.
dfEspacio en disco. Por encima del 90 % hay problema.
topProcesos que más CPU y memoria consumen, con su número (PID).
tailÚltimas líneas del registro: el servidor cuenta ahí qué le pasa.
statusEstado del servicio principal (activo, caído, reiniciándose).
pingTiempo de respuesta del servidor.
netstatConexiones de red por origen (se activa más adelante).
grep textoBusca un texto en los registros de todos los servidores (se activa más adelante).

Las soluciones están en «Guía de averías». Esc alterna la vista de informe. El panel se pausa si cambias de ventana. help lista los comandos y nuevo empieza otra jornada.

La carga de trabajo aumenta con los tickets cerrados: más incidencias a la vez, herramientas nuevas y menos margen. Al principio hay pocas averías y sencillas para que puedas practicar; cada tipo nuevo viene con una nota en el terminal.

AveríaCómo reconocerlaSolución
Disco llenoDisco > 80 %; tail dice «No space left»logrotate
Servicio caídostatus muestra «inactive (dead)»start
Certificado caducadoWeb o correo; tail dice «certificate expired»certbot
Fuga de memoriaMEM sube sin parar; top muestra el servicio con %MEM altorestart
Proceso desbocadoCPU alta; top muestra un proceso con mucha CPUkill PID
Tráfico anómaloCPU alta sin proceso culpable; netstat muestra una IP con miles de conexionesblock IP
Cambio de configuración fallidostatus dice «auto-restart»; tail menciona un cambio recienterollback (reiniciar no lo arregla)

Aplicar una solución que no corresponde no hace nada y resta SLA. Reiniciar a ciegas puede ocultar el problema unos segundos, pero vuelve.

Índice de rendimiento: 100 puntos por ticket cerrado, bonus por rapidez y -25 por cada pista. Al cerrar el turno queda registrado en el informe de clasificación.