Informe SRE diario - 2026-08-17
Resumen operativo de almasrv.thehomelesssherlock.com para las últimas 24 horas, generado el 17 de agosto de 2026 a las 06:00 UTC. El servidor ejecuta el kernel 5.14.0-570.58.1.el9_6.x86_64.
Estado general
DEGRADED. Los 13 endpoints supervisados están disponibles y no hay contenedores en estado unhealthy o reiniciándose. Sin embargo, OpenClaw presenta un fallo operativo confirmado: la credencial OAuth de OpenAI Codex está caducada y los intentos de renovación devuelven HTTP 401, impidiendo completar las tareas que dependen de ese proveedor.
Indicadores principales
| Indicador | Valor | Evaluación |
|---|---|---|
| Disponibilidad externa | 13 de 13 endpoints disponibles | OK |
| Uptime | 5 semanas, 4 días, 5 horas y 28 minutos | Estable |
| Carga media | 2.33 / 2.16 / 2.36 | Sin evidencia de saturación activa |
| Memoria | 16 GiB usados de 22 GiB; 5.7 GiB disponibles | Vigilar |
| Swap | 4.0 GiB usados de 4.0 GiB | Riesgo elevado |
| Disco raíz | 129 GiB de 199 GiB; 65% | OK |
Volumen /opt |
19 GiB de 50 GiB; 37% | OK |
| Docker | 77 activos, 0 unhealthy, 0 reiniciándose y 13 detenidos | Operativo |
| Protección SSH | Fail2ban activo; 12 bloqueos actuales y 751 acumulados | Operativo |
| Certificado más próximo | thehomelesssherlock.com: 29 días restantes |
Advertencia preventiva |
Incidentes críticos
OAuth de OpenClaw para OpenAI Codex caducado
La credencial expiró el 4 de agosto de 2026 a las 10:06 UTC. A las 06:00 UTC del periodo analizado, OpenClaw registró respuestas HTTP 401 durante la renovación y agotó los candidatos de fallback configurados.
Impacto activo: las tareas programadas o sesiones de OpenClaw que requieren OpenAI Codex no pueden ejecutarse correctamente. El incidente está limitado a esta integración; no hay evidencia de una caída general del servidor ni de los endpoints web supervisados.
Servicios degradados e impacto
- OpenClaw: degradado por fallo de autenticación OAuth confirmado. Requiere reautenticación mediante la acción operativa
codex-reauth. - Vikunja: el contenedor aparece detenido con código 2, pero el endpoint respondió HTTP 200 en el segundo intento. La comprobación acumuló 8.767 segundos, compatible con activación bajo demanda o una indisponibilidad transitoria. No se declara caída.
- OneTimeSecret: el contenedor gestionado bajo demanda aparece detenido con código 1, mientras que el endpoint respondió HTTP 200 en el segundo intento tras 8.824 segundos. No existe evidencia de caída activa, aunque conviene revisar el motivo del código de salida.
- Karakeep: el contenedor gestionado por Sablier estaba detenido, pero el servicio respondió HTTP 200 en el primer intento. Se considera comportamiento bajo demanda, no incidente.
- Traefik: registró referencias transitorias a contenedores ya eliminados y una cancelación puntual en ForwardAuth. Las comprobaciones posteriores de Traefik y Authentik devolvieron HTTP 200, por lo que no se observa impacto persistente.
Riesgos preventivos
- Swap completamente ocupada: los 4 GiB están en uso. La memoria disponible todavía es de 5.7 GiB, por lo que no se confirma presión crítica actual, pero existe mayor riesgo de latencia y degradación ante nuevos picos. Los mayores consumidores de swap observados incluyen procesos
mysqld, Python,mariadbd, Next.js, Chromium y Celery. - Certificado próximo al umbral:
thehomelesssherlock.comvence en 29 días. El resto de los certificados activos informados conserva al menos 37 días. - Denegaciones de SELinux: se repitieron eventos para
mandby se registraron denegaciones relacionadas con transiciones de procesos de Docker. No hay evidencia de impacto general, pero los eventos de Docker deben correlacionarse con los despliegues realizados alrededor de las 19:56 UTC. - Contenedores con salidas no limpias: además de servicios bajo demanda, se observaron códigos 137, 143 y 2, así como eventos en los que Docker tuvo que forzar la terminación después de esperar una salida ordenada.
- Latencia de activación bajo demanda: Vikunja y OneTimeSecret necesitaron un segundo intento y cerca de nueve segundos de tiempo acumulado. Permanecen disponibles, pero el tiempo de arranque puede afectar la experiencia de la primera solicitud.
- Intentos SSH automatizados: se registraron usuarios inexistentes, fallos PAM, conexiones reiniciadas y timeouts previos a la autenticación. Fail2ban permanece activo, por lo que estos eventos representan actividad hostil bloqueada y ruido operativo, no una intrusión confirmada.
- Calidad de logs de Docker: aparecieron errores puntuales al decodificar archivos de log por caracteres nulos. Esto puede reducir la fiabilidad del diagnóstico si se repite.
Acciones recomendadas
- Reautenticar OpenClaw de inmediato mediante
codex-reauthy validar una tarea real contra OpenAI Codex, incluyendo el flujo de fallback. - Investigar la ocupación total de swap, correlacionando el consumo por PID con sus contenedores o servicios. Evitar liberar la swap de forma abrupta sin confirmar que existe memoria suficiente y una ventana controlada.
- Revisar Vikunja y OneTimeSecret para confirmar que sus códigos de salida son compatibles con la gestión de Sablier y medir el tiempo de arranque en frío.
- Validar las denegaciones de SELinux asociadas a Docker y
mandb. Corregir etiquetas o políticas específicas si procede, sin desactivar SELinux globalmente. - Confirmar la renovación automática de TLS para
thehomelesssherlock.comantes de entrar en una ventana inferior a 14 días. - Identificar el contenedor que no termina dentro del plazo y revisar su manejo de
SIGTERM, tiempo de gracia y posibles bloqueos durante el apagado. - Supervisar SSH y la integridad de los logs, verificando que los bloqueos de Fail2ban continúan aumentando de forma coherente y que no se repiten los errores de decodificación de Docker.
Contexto operativo
El plano de servicio permanece disponible: todas las comprobaciones HTTP finalizaron con código 200. N8n respondió en 124 ms, Beszel en 88 ms, Memos en 137 ms, Paperless en 247 ms y OnlyOffice en 266 ms. Nextcloud respondió en 486 ms. Los endpoints protegidos por Authentik completaron correctamente su redirección al flujo de autenticación.
Paperless procesó correctamente sus tareas programadas y comprobaciones de correo durante el periodo, sin errores operativos relevantes. No se registraron errores destacados para N8n, Nextcloud ni el relay de correo.
Los 13 contenedores detenidos no deben interpretarse conjuntamente como 13 servicios caídos: diez figuran como gestionados por Sablier y varios endpoints asociados respondieron correctamente. Los contenedores detenidos desde hace semanas y los códigos de salida históricos constituyen contexto de mantenimiento, salvo que exista una expectativa explícita de ejecución continua.
Comments ()