Informe SRE diario - 2026-08-03
Resumen operativo de almasrv.thehomelesssherlock.com para las 24 horas anteriores, generado el 3 de agosto de 2026 a las 06:00 UTC. La comprobación de disponibilidad finalizó a las 06:01 UTC.
Estado general
OK. Los 13 endpoints supervisados respondieron correctamente, no hay contenedores Docker marcados como no saludables o en reinicio y no se confirma impacto activo sobre los servicios. Existen riesgos preventivos que requieren atención, principalmente la próxima caducidad de la autorización OAuth de OpenClaw y el uso elevado de swap.
Indicadores principales
| Indicador | Valor | Evaluación |
|---|---|---|
| Disponibilidad externa | 13 de 13 endpoints operativos | OK |
| Uptime | 3 semanas, 4 días, 5 horas y 28 minutos | Estable |
| Carga media | 2,55 / 2,48 / 2,47 | Sin impacto confirmado |
| Memoria | 15 GiB usados de 22 GiB; 7,3 GiB disponibles | Con margen disponible |
| Swap | 3,8 GiB usados de 4,0 GiB | Riesgo preventivo |
| Disco raíz | 127 GiB de 199 GiB; 64 % utilizado | OK |
Volumen /opt |
17 GiB de 50 GiB; 35 % utilizado | OK |
| Docker | 75 activos, 0 no saludables, 0 reiniciando y 15 detenidos | OK con revisión pendiente |
| Certificados TLS | 47 dominios activos; mínimo de 34 días restantes | Sin vencimiento inmediato |
| Protección SSH | Fail2ban activo; 14 bloqueos actuales | Operativa |
Incidentes críticos
No se identificaron incidentes críticos ni interrupciones activas durante la ventana analizada. Todos los endpoints comprobados terminaron con HTTP 200 y Docker no registra contenedores no saludables o en bucle de reinicio.
Servicios degradados e impacto
No hay degradación activa confirmada. Sin embargo, tres comprobaciones necesitaron un segundo intento:
- Memos: disponible tras dos intentos; latencia acumulada de 8,896 segundos.
- Vikunja: disponible tras dos intentos; latencia acumulada de 8,818 segundos.
- One-Time Secret: disponible tras dos intentos; latencia acumulada de 8,847 segundos.
Los tiempos acumulados incluyen el intervalo configurado entre reintentos. Los tres servicios respondieron finalmente con HTTP 200. Memos, Vikunja y One-Time Secret aparecen además entre los contenedores detenidos administrados por Sablier, por lo que el comportamiento es compatible con un arranque bajo demanda; no constituye por sí solo una caída.
También se observó que memos-proxy terminó con código 137 cinco horas antes del resumen. El endpoint de Memos continúa operativo, por lo que no se acredita impacto actual, aunque conviene verificar si ese proxy sigue siendo necesario dentro de la arquitectura.
Riesgos preventivos
- OAuth de OpenClaw: la autorización de Codex caduca el 4 de agosto de 2026 a las 10:06 UTC, con aproximadamente 28 horas restantes. Todavía no hay impacto, pero la ventana de renovación es corta.
- Swap casi agotada: se utilizan 3,8 GiB de los 4,0 GiB disponibles. Los principales consumidores incluyen procesos Python, MySQL/MariaDB, OpenCode, Celery y Chromium. La memoria disponible sigue siendo de 7,3 GiB, por lo que debe comprobarse si el uso de swap es histórico o continúa creciendo.
- Autenticación SSH: Fail2ban está activo, pero se registraron múltiples intentos contra usuarios inexistentes y fallos del control de clave pública y del segundo factor. El patrón es coherente con sondeos externos, aunque debe validarse que la configuración PAM no solicite códigos para cuentas inexistentes o sin secreto configurado.
- Contenedores detenidos: 11 de los 15 contenedores no activos están administrados por Sablier y no deben considerarse caídos sin evidencia adicional. Entre los cuatro restantes hay terminaciones normales y códigos 137 o 143 que conviene correlacionar con paradas programadas y presión de memoria.
- Resolución DNS: se registraron dos fallos aislados al consultar el resolvedor externo. No existe evidencia de afectación sostenida, pero una repetición podría impactar descubrimiento de servicios o tráfico saliente.
- Certificados TLS: los certificados con menor margen corresponden a
spintools.proywww.spintools.pro, ambos con 34 días restantes. No es una urgencia inmediata, pero debe confirmarse la renovación automática.
Acciones recomendadas
- Renovar la autorización OAuth de OpenClaw antes del 4 de agosto a las 10:06 UTC y ejecutar después una prueba funcional de Codex.
- Analizar la presión de memoria y swap, revisando tendencia, actividad de paginación y crecimiento de los procesos Python, MySQL/MariaDB, Celery, Chromium y OpenCode.
- Validar los arranques bajo demanda de Sablier para Memos, Vikunja y One-Time Secret, confirmando que el primer acceso completa dentro del objetivo de latencia esperado.
- Revisar
memos-proxyy los demás contenedores no administrados por Sablier para distinguir paradas previstas de terminaciones por falta de memoria o apagado forzado. - Auditar la cadena PAM de SSH para evitar solicitudes innecesarias de segundo factor a usuarios inexistentes, manteniendo Fail2ban y la autenticación por clave pública.
- Comprobar el resolvedor DNS externo y establecer seguimiento si vuelven a aparecer errores de consulta.
- Verificar la renovación automática de TLS para los dominios con 34 días restantes.
Contexto operativo
- Host ejecutando kernel
5.14.0-570.58.1.el9_6.x86_64. - Fail2ban para SSH permanece activo, con 9.584 fallos acumulados, 535 bloqueos totales y 14 direcciones bloqueadas en el momento del informe.
- Los mensajes SSH del journal reflejan principalmente intentos fallidos de autenticación y conexiones interrumpidas. No se aportan evidencias de acceso exitoso no autorizado.
- N8N bloqueó una solicitud automatizada a un recurso no permitido; el endpoint de salud respondió correctamente en 141 ms.
- Paperless completó correctamente las tareas programadas y de correo mostradas en el periodo.
- OpenClaw registró lecturas fallidas de archivos ausentes o fuera de su entorno aislado. No se ha confirmado impacto sobre el gateway, pero los mensajes deberían revisarse si se repiten.
- El uso de disco mantiene margen suficiente: 36 % libre en la raíz y 65 % libre en
/opt.
Comments ()