Informe SRE diario - 2026-07-31

Resumen operativo de almasrv.thehomelesssherlock.com para las últimas 24 horas, generado el 31 de julio de 2026 a las 06:01 UTC. El servidor ejecuta el kernel 5.14.0-570.58.1.el9_6.x86_64.

Estado general

DEGRADED. Los 13 endpoints supervisados están disponibles y no hay contenedores en estado no saludable o reiniciándose. No obstante, existe presión activa sobre SSH con conexiones descartadas por MaxStartups, y n8n no pudo iniciar su ejecutor interno de tareas Python. También se registró una interrupción transitoria de la integración AppSec entre Traefik y CrowdSec, sin evidencia de indisponibilidad en la comprobación final.

Indicadores principales

Indicador Valor Evaluación
Disponibilidad HTTP 13 de 13 endpoints disponibles OK
Uptime 3 semanas, 1 día, 5 horas y 28 minutos Estable
Carga media 3.35 / 3.05 / 2.81 Sin umbral de CPU disponible para determinar saturación
Memoria 16 GiB usados de 22 GiB; 6 GiB disponibles Vigilar tendencia
Swap 1.8 GiB usados de 4 GiB Uso significativo
Disco raíz 127 GiB de 199 GiB, 64% OK
Disco /opt 17 GiB de 50 GiB, 34% OK
Docker 76 ejecutándose, 0 no saludables, 0 reiniciándose y 14 detenidos Operación principal estable
Protección SSH Fail2ban activo; 7 bloqueos actuales, 490 históricos Presión elevada de sondeos
Certificado más próximo 37 días restantes Preventivo
OAuth de OpenClaw Válido durante aproximadamente 100 horas OK, renovación próxima

Incidentes críticos

No se detectaron incidentes críticos activos. Todos los endpoints comprobados devolvieron HTTP 200 y Docker no reportó contenedores no saludables ni ciclos de reinicio.

Servicios degradados e impacto

Acceso SSH bajo limitación

El registro muestra que sshd permanece bajo limitación de MaxStartups, con un contador creciente de conexiones descartadas. También se observaron intentos con usuarios inexistentes, versiones de protocolo incompatibles y errores durante la negociación previa a la autenticación. Fail2ban está activo, pero la presión de conexiones puede provocar el rechazo de sesiones SSH legítimas cuando se supera el límite de conexiones simultáneas no autenticadas.

n8n: ejecutor Python no disponible

n8n informó que no pudo iniciar el ejecutor interno de tareas Python porque Python 3 no está disponible en el entorno. El endpoint /healthz respondió correctamente en 77 ms, por lo que el servicio web está operativo; el impacto se limita a flujos que dependan de ese ejecutor. La propia aplicación recomienda usar ejecutores externos en producción.

Latencia de activación en servicios bajo demanda

Memos, Vikunja y One-Time Secret necesitaron un segundo intento y completaron la comprobación tras aproximadamente 8.8 a 9.1 segundos de tiempo total. Las solicitudes exitosas del último intento fueron rápidas, entre aproximadamente 154 y 530 ms. Esto es compatible con activación bajo demanda o una transición temporal, no con una caída confirmada.

Integraciones de Traefik

Traefik registró múltiples errores appsecQuery:unreachable para el complemento de CrowdSec durante un intervalo breve alrededor de las 00:02 UTC, además de dos cancelaciones al consultar el servicio de autenticación alrededor de las 00:10 UTC. La comprobación posterior de Traefik y del proveedor de autenticación fue satisfactoria, por lo que el evento se considera transitorio. Durante el intervalo afectado pudo reducirse temporalmente la inspección AppSec o fallar alguna validación de autenticación.

Riesgos preventivos

  • Memoria y swap: hay 6 GiB de memoria disponible, pero la swap está ocupada en un 45%. Los mayores consumidores identificados incluyen opencode-host, procesos Chromium, Celery y Kopia. No hay evidencia de agotamiento activo, aunque conviene revisar la tendencia y la presión de memoria.
  • Contenedores detenidos: 10 de los 14 contenedores no ejecutados están gestionados por Sablier y no deben considerarse caídos sin evidencia adicional. Entre los no gestionados por Sablier, memos-proxy terminó con código 137 recientemente; requiere correlación con su ciclo de activación y con posibles límites de memoria.
  • SELinux: se repitieron denegaciones para mandb sobre las capacidades sys_resource y sys_admin. No se observó impacto en servicios públicos, pero el volumen de mensajes genera ruido y puede ocultar eventos más relevantes.
  • Certificados TLS: los 47 dominios activos incluidos en la revisión tienen certificados vigentes. Los más próximos vencen en 37 días, todavía fuera de una ventana crítica, pero deben permanecer bajo renovación automática supervisada.
  • OAuth de OpenClaw: la autorización es válida y supera el umbral de aviso de 72 horas, pero vence el 4 de agosto de 2026. La renovación debe planificarse antes de entrar en la ventana crítica de 24 horas.
  • Disco: el sistema raíz está al 64% y /opt al 34%. No existe presión inmediata de capacidad.

Acciones recomendadas

  1. Investigar la presión sostenida sobre SSH, validar si existen accesos legítimos rechazados por MaxStartups y ajustar límites o controles perimetrales únicamente después de revisar la tasa y el origen de las conexiones.
  2. Verificar la conectividad y salud de CrowdSec AppSec desde Traefik, incluyendo resolución interna, disponibilidad del servicio y comportamiento ante fallos, para confirmar que el episodio fue transitorio.
  3. Configurar n8n con ejecutores externos para producción o instalar explícitamente la dependencia requerida si se mantiene el modo interno. Definir también el tiempo de espera de tareas para evitar cambios de comportamiento en futuras versiones.
  4. Revisar los códigos de salida recientes de memos-proxy y vikunja, correlacionándolos con Sablier, límites de memoria y eventos de activación. Repetir las pruebas para determinar si los segundos intentos son recurrentes.
  5. Supervisar memoria disponible, actividad de swap y consumo por proceso. Evitar reinicios o terminaciones preventivas sin confirmar presión real de memoria.
  6. Analizar las denegaciones de SELinux para mandb y corregir la configuración o política específica si procede; no desactivar SELinux como solución general.
  7. Programar la reautenticación de OpenClaw antes del 4 de agosto y comprobar que la renovación automática de los certificados con 37 días restantes funciona correctamente.

Contexto operativo

Los contenedores detenidos gestionados por Sablier se interpretan como servicios bajo demanda, no como indisponibilidades. Memos y Vikunja estaban detenidos cerca de la hora del informe, pero sus endpoints respondieron correctamente después de un reintento.

La denegación de acceso de Nextcloud a server-status corresponde a una ruta administrativa restringida y no indica una caída. Paperless presentó reintentos iniciales al esperar por su base de datos, pero las tareas de correo posteriores finalizaron correctamente. Los errores de autenticación SSH y de negociación de protocolo se clasifican principalmente como tráfico hostil o incompatible; son relevantes por su volumen y por la activación de MaxStartups, no como evidencia de una intrusión exitosa.