Informe SRE diario - 2026-08-30
Resumen operativo de almasrv.thehomelesssherlock.com para las últimas 24 horas, generado el 30 de agosto de 2026 a las 06:01 UTC. El servidor ejecuta el kernel 5.14.0-570.58.1.el9_6.x86_64.
Estado general
DEGRADED. Los 13 endpoints supervisados están disponibles y no hay contenedores en estado unhealthy o restarting. Sin embargo, existe un fallo operativo confirmado en OpenClaw: la autorización OAuth de OpenAI Codex está caducada y los intentos de renovación reciben respuestas 401, lo que impide ejecutar correctamente tareas programadas que dependen de ese proveedor. Además, la swap está completamente utilizada, aunque todavía hay 7,7 GiB de memoria disponible y no se ha confirmado impacto directo sobre los servicios.
Indicadores principales
| Indicador | Valor | Evaluación |
|---|---|---|
| Disponibilidad externa | 13 de 13 endpoints operativos | OK |
| Uptime | 5 días, 16 horas y 15 minutos | OK |
| Carga | 4,45 / 3,52 / 3,22 | Requiere correlación con CPU |
| Memoria | 15 GiB usados de 22 GiB; 7,7 GiB disponibles | Estable |
| Swap | 4,0 GiB usados de 4,0 GiB | Riesgo |
| Disco raíz | 145 GiB de 199 GiB; 73% | Sin presión inmediata |
| Docker | 84 running, 0 unhealthy, 0 restarting y 14 exited | Operativo |
| TLS más próximo | remote.sherlockhomeless.net, 30 días restantes |
Advertencia preventiva |
| Protección SSH | Fail2ban activo; 11 bloqueos actuales | Operativo |
Incidentes criticos
- OpenClaw Codex OAuth: la autorización caducó el 4 de agosto de 2026. A las 06:00 UTC se confirmaron fallos de renovación con HTTP 401.
- Impacto activo: las tareas programadas de OpenClaw que solicitaron los modelos Codex fallaron. El intento de fallback también terminó sin un candidato disponible debido al mismo problema de autenticación.
- Alcance: el fallo está limitado a las funciones que dependen de esa autorización. No hay evidencia de indisponibilidad general del host ni de los 13 servicios incluidos en la comprobación externa.
Servicios degradados e impacto
- OpenClaw: degradado para las ejecuciones dependientes de OpenAI Codex; requiere reautenticación.
- Memos: respondió con HTTP 200, pero necesitó dos intentos y acumuló 8.701 ms de latencia observada. El contenedor
memosestaba detenido bajo gestión de Sablier y el endpoint terminó disponible, por lo que no se clasifica como caída. - One-Time Secret: respondió con HTTP 200 tras dos intentos y 8.870 ms de latencia observada. Su contenedor figura detenido bajo gestión de Sablier; el comportamiento es compatible con activación bajo demanda y no demuestra una interrupción.
- Resto de endpoints: Traefik, Authentik, n8n, Nextcloud, Paperless, OnlyOffice, Vikunja, Karakeep, RSS, Dozzle y Beszel respondieron correctamente en el primer intento.
Riesgos preventivos
- Swap saturada: los 4 GiB están ocupados. Los principales consumidores identificados incluyen procesos
mysqld,bundle,gunicorn,python3,mariadbdyruby. La memoria disponible evita declarar presión crítica, pero la situación puede aumentar la latencia durante picos de trabajo. - Renovación TLS:
remote.sherlockhomeless.netvence en 30 días. Los siguientes certificados más próximos tienen entre 32 y 38 días de vigencia. No hay certificados activos vencidos en el alcance informado. - Capacidad del disco raíz: el 73% está utilizado. Quedan 55 GiB, por lo que no existe presión inmediata, pero conviene mantener seguimiento de la tendencia.
- Contenedores finalizados: hay 14 contenedores en estado exited. Diez aparecen gestionados por Sablier y no deben considerarse caídos sin evidencia adicional. Entre los no gestionados figura
memos-proxycon salida 137 reciente, aunque Memos estaba accesible al finalizar la comprobación. - Finalizaciones forzadas: Docker registró varios casos en los que un contenedor no terminó durante los 10 segundos posteriores a SIGTERM y tuvo que ser detenido por la fuerza. El resumen no aporta el nombre asociado al identificador, por lo que debe correlacionarse antes de atribuir impacto.
- DNS: se registraron dos fallos puntuales al consultar el servidor DNS externo. No se observó una caída sostenida y todas las verificaciones HTTP terminaron correctamente.
- Exposición SSH: Fail2ban está activo, con 1.677 intentos fallidos acumulados, 142 bloqueos totales y 11 bloqueos actuales. Los errores de intercambio de claves, usuarios inexistentes y clientes incompatibles son consistentes con sondeos externos y no demuestran una intrusión.
Acciones recomendadas
- Reautenticar OpenClaw Codex de inmediato mediante el procedimiento
codex-reauthy verificar después una ejecución programada completa, incluido el mecanismo de fallback. - Investigar la ocupación de swap correlacionando consumo por proceso, presión de memoria, fallos de página y latencia de aplicaciones. Evitar vaciar la swap sin validar primero el margen real de memoria.
- Revisar Memos y One-Time Secret para confirmar que los retrasos corresponden exclusivamente al arranque bajo demanda de Sablier y ajustar los umbrales de monitorización si ese tiempo es esperado.
- Correlacionar el contenedor finalizado con código 137 y los eventos repetidos de parada forzada para descartar límites de memoria, timeouts de apagado o ciclos de activación anómalos.
- Validar la renovación automática de TLS para
remote.sherlockhomeless.netantes de que entre en una ventana inferior a 21 días. - Revisar los fallos DNS aislados y confirmar redundancia o resolución alternativa si vuelven a aparecer en la siguiente ventana diaria.
- Mantener vigilancia sobre SSH y revisar únicamente anomalías sostenidas o accesos exitosos inesperados; los sondeos rechazados actuales no justifican elevar por sí solos el estado.
Contexto operativo
El host mantiene 84 contenedores en ejecución, sin contenedores unhealthy ni reinicios activos. La partición /opt utiliza el 41% de 50 GiB, /boot el 44% y /boot/efi el 4%. Los montajes overlay de Docker no se incluyeron en el resumen.
Los registros SSH de la ventana contienen tres cierres durante el intercambio de claves, dos rechazos del verificador de clave pública, intentos contra los usuarios inexistentes config y support, y un cliente que anunció una versión de protocolo incompatible. Estos eventos se consideran ruido de Internet mientras no exista evidencia de autenticación exitosa o actividad posterior no autorizada.
En conjunto, la plataforma pública permanece disponible. La prioridad operativa es restaurar la autenticación de OpenClaw y, en segundo lugar, reducir la incertidumbre asociada a la swap saturada y a las finalizaciones forzadas de contenedores.
Comments ()