Nodo de monitorización · 10 servidores en supervisión
Técnico:
Notas de relevo
Clasificación
Objetivo: mantener el SLA (disponibilidad) por encima del 90 %. Cada avería abierta lo hace bajar, y más rápido cuanto más tardes: la columna «Escala en» de las alertas indica cuánto falta para que empeore.
Cómo trabajar
hosts. «A → B» significa que A depende de B: si B falla, A va lento.ssh nombre y escribe tail (últimas líneas de su registro). Si dice «upstream X timed out», el problema está en X: ve allí.pista (cuesta algo de SLA).Qué hace cada comando
ssh host | Entra en un servidor; los comandos siguientes se aplican a él. También puedes indicar el host al final: df db-01.
|
df | Espacio en disco. Por encima del 90 % hay problema. |
top | Procesos que más CPU y memoria consumen, con su número (PID). |
tail | Últimas líneas del registro: el servidor cuenta ahí qué le pasa. |
status | Estado del servicio principal (activo, caído, reiniciándose). |
ping | Tiempo de respuesta del servidor. |
netstat | Conexiones de red por origen (se activa más adelante). |
grep texto | Busca un texto en los registros de todos los servidores (se activa más adelante). |
Las soluciones están en «Guía de averías». Esc alterna la vista de informe. El panel se pausa si cambias de ventana. help lista los comandos y nuevo empieza otra jornada.
La carga de trabajo aumenta con los tickets cerrados: más incidencias a la vez, herramientas nuevas y menos margen. Al principio hay pocas averías y sencillas para que puedas practicar; cada tipo nuevo viene con una nota en el terminal.
| Avería | Cómo reconocerla | Solución |
|---|---|---|
| Disco lleno | Disco > 80 %; tail dice «No space left» | logrotate
|
| Servicio caído | status muestra «inactive (dead)» | start
|
| Certificado caducado | Web o correo; tail dice «certificate expired» | certbot
|
| Fuga de memoria | MEM sube sin parar; top muestra el servicio con %MEM alto | restart
|
| Proceso desbocado | CPU alta; top muestra un proceso con mucha CPU | kill PID
|
| Tráfico anómalo | CPU alta sin proceso culpable; netstat muestra una IP con miles de conexiones | block IP
|
| Cambio de configuración fallido | status dice «auto-restart»; tail menciona un cambio reciente | rollback (reiniciar no lo arregla) |
Aplicar una solución que no corresponde no hace nada y resta SLA. Reiniciar a ciegas puede ocultar el problema unos segundos, pero vuelve.
Índice de rendimiento: 100 puntos por ticket cerrado, bonus por rapidez y -25 por cada pista. Al cerrar el turno queda registrado en el informe de clasificación.