Informe SRE diario - 2026-08-24
Resumen operativo de almasrv.thehomelesssherlock.com para las últimas 24 horas, generado el 24 de agosto de 2026 a las 06:01 UTC. La comprobación cubre recursos del host, contenedores, certificados TLS, seguridad SSH, registros del sistema y 13 endpoints HTTP.
Estado general
DEGRADED: los 13 endpoints monitorizados están disponibles y no hay contenedores en estado no saludable o reiniciándose. Sin embargo, la integración OAuth de OpenClaw con OpenAI Codex está expirada y los intentos de renovación reciben respuestas 401; las tareas programadas afectadas agotan además sus candidatos de respaldo. El host también tiene el 100 % de la swap ocupada, aunque conserva 6,3 GiB de memoria disponible y no se ha confirmado impacto general por memoria.
Indicadores principales
| Indicador | Valor | Evaluación |
|---|---|---|
| Disponibilidad HTTP | 13 de 13 endpoints activos | OK |
| Contenedores Docker | 80 activos, 0 no saludables, 0 reiniciándose | OK |
| Carga media | 1,81 / 2,11 / 2,44 | Sin impacto confirmado |
| Memoria | 16 GiB usados de 22 GiB; 6,3 GiB disponibles | Vigilar |
| Swap | 4,0 GiB usados de 4,0 GiB | Riesgo elevado |
| Disco raíz | 141 GiB de 199 GiB; 71 % | Vigilar crecimiento |
Volumen /opt |
20 GiB de 50 GiB; 40 % | OK |
| Uptime | 6 semanas, 4 días y 5 horas | Estable |
| Certificado más próximo | 30 días restantes | Renovación preventiva |
| Protección SSH | Fail2ban activo; 16 bloqueos actuales | Operativa |
Incidentes críticos
OAuth de OpenClaw Codex expirado
La credencial OAuth expiró el 4 de agosto de 2026. A las 06:00 UTC, OpenClaw volvió a intentar renovarla y recibió respuestas 401. Los candidatos configurados para OpenAI Codex fallaron por autenticación y la cadena de respaldo terminó sin un siguiente candidato disponible.
Impacto activo: las tareas programadas que requieren OpenAI Codex no pueden completarse mediante esa integración. No hay evidencia de que este fallo afecte a los demás servicios web o a la disponibilidad general del host.
Servicios degradados e impacto
- OpenClaw: degradado para cargas que dependen de OpenAI Codex debido al fallo de autenticación confirmado.
- One-Time Secret: respondió correctamente con HTTP 200, pero necesitó dos intentos y registró una latencia observada de 9.045 ms incluyendo el reintento. Se trata de degradación transitoria, no de una caída confirmada.
- Paperless: el servicio está disponible y sus tareas periódicas se completan. Los errores corresponden a un PDF individual malformado y posteriormente rechazado por duplicidad; el impacto está limitado a ese documento.
- Memos: el endpoint público respondió con HTTP 200 pese a que
memosaparece detenido bajo gestión bajo demanda ymemos-proxyterminó con código 137. No se observa indisponibilidad externa en la comprobación actual.
Riesgos preventivos
- Swap saturada: los 4 GiB están ocupados. Los principales consumidores registrados incluyen procesos MySQL/MariaDB, Python, Next.js, Celery y Chromium. La memoria disponible evita declarar una emergencia, pero aumenta el riesgo de latencia y presión de memoria ante nuevos picos.
- Capacidad del disco raíz: el 71 % está utilizado. Quedan 59 GiB, por lo que no existe riesgo inmediato de agotamiento, pero conviene controlar la tendencia.
- Certificados TLS: dos dominios activos tienen 30 días restantes y otros se sitúan entre 31 y 32 días. No hay certificados vencidos, pero debe verificarse la renovación automática.
- Intentos SSH: Fail2ban está activo y ha registrado 474 fallos, 51 bloqueos acumulados y 16 bloqueos actuales. Los eventos observados corresponden principalmente a usuarios inexistentes, fallos PAM, protocolos incompatibles y escaneo automatizado.
- Configuración PAM: se repiten fallos del control de clave pública y avisos del segundo factor para usuarios inexistentes o sin configuración. Aunque son compatibles con sondeos externos, la secuencia PAM merece revisión para reducir ruido y evitar comportamientos inesperados.
- SELinux: se generó una ráfaga repetitiva de denegaciones para
mandbsobre capacidades privilegiadas. No se ha demostrado impacto en servicios, pero el volumen dificulta la lectura del journal. - Contenedores detenidos: hay 14 contenedores no activos. La mayoría están gestionados bajo demanda o llevan semanas detenidos sin evidencia de impacto. Los códigos 137 y 143 deben correlacionarse con paradas planificadas antes de considerarlos incidentes.
Acciones recomendadas
- Restaurar OpenClaw Codex: ejecutar la reautenticación indicada por la plataforma y validar una tarea programada completa, incluida la selección de modelo y el comportamiento de respaldo.
- Analizar la swap: revisar presión de memoria, actividad de paginación y evolución por proceso; priorizar MySQL/MariaDB, Python, Next.js, Celery y Chromium antes de reiniciar o ajustar servicios.
- Verificar One-Time Secret: repetir pruebas de latencia desde el host y desde el exterior para determinar si el segundo intento fue un evento aislado.
- Correlacionar
memos-proxy: confirmar si su salida con código 137 fue parte de una activación bajo demanda, una parada planificada o presión de memoria. - Comprobar renovación TLS: validar el próximo ciclo automático para los certificados con 30 a 32 días restantes y alertar si el margen baja sin renovación.
- Revisar SSH y PAM: confirmar que la política de clave pública y segundo factor coincide con el diseño esperado, manteniendo Fail2ban activo.
- Diagnosticar SELinux: analizar los dos identificadores de denegación de
mandby corregir la ejecución o política correspondiente sin desactivar SELinux globalmente.
Contexto operativo
El servidor utiliza el kernel 5.14.0-570.58.1.el9_6.x86_64 y mantiene más de seis semanas de actividad continua. Traefik, Authentik, n8n, Nextcloud, Paperless, OnlyOffice, Memos, Vikunja, Karakeep, RSS, One-Time Secret, Dozzle y Beszel devolvieron HTTP 200.
Los contenedores administrados por Sablier pueden permanecer detenidos hasta recibir demanda; por tanto, su estado no constituye por sí mismo una caída. Del mismo modo, las numerosas entradas SSH y las denegaciones repetidas de SELinux son principalmente ruido operativo o eventos preventivos mientras no exista evidencia de acceso autorizado fallido o interrupción de servicio.
Comments ()