Informe SRE diario - 2026-08-17

Resumen operativo de almasrv.thehomelesssherlock.com para las últimas 24 horas, generado el 17 de agosto de 2026 a las 06:00 UTC. El servidor ejecuta el kernel 5.14.0-570.58.1.el9_6.x86_64.

Estado general

DEGRADED. Los 13 endpoints supervisados están disponibles y no hay contenedores en estado unhealthy o reiniciándose. Sin embargo, OpenClaw presenta un fallo operativo confirmado: la credencial OAuth de OpenAI Codex está caducada y los intentos de renovación devuelven HTTP 401, impidiendo completar las tareas que dependen de ese proveedor.

Indicadores principales

Indicador Valor Evaluación
Disponibilidad externa 13 de 13 endpoints disponibles OK
Uptime 5 semanas, 4 días, 5 horas y 28 minutos Estable
Carga media 2.33 / 2.16 / 2.36 Sin evidencia de saturación activa
Memoria 16 GiB usados de 22 GiB; 5.7 GiB disponibles Vigilar
Swap 4.0 GiB usados de 4.0 GiB Riesgo elevado
Disco raíz 129 GiB de 199 GiB; 65% OK
Volumen /opt 19 GiB de 50 GiB; 37% OK
Docker 77 activos, 0 unhealthy, 0 reiniciándose y 13 detenidos Operativo
Protección SSH Fail2ban activo; 12 bloqueos actuales y 751 acumulados Operativo
Certificado más próximo thehomelesssherlock.com: 29 días restantes Advertencia preventiva

Incidentes críticos

OAuth de OpenClaw para OpenAI Codex caducado

La credencial expiró el 4 de agosto de 2026 a las 10:06 UTC. A las 06:00 UTC del periodo analizado, OpenClaw registró respuestas HTTP 401 durante la renovación y agotó los candidatos de fallback configurados.

Impacto activo: las tareas programadas o sesiones de OpenClaw que requieren OpenAI Codex no pueden ejecutarse correctamente. El incidente está limitado a esta integración; no hay evidencia de una caída general del servidor ni de los endpoints web supervisados.

Servicios degradados e impacto

  • OpenClaw: degradado por fallo de autenticación OAuth confirmado. Requiere reautenticación mediante la acción operativa codex-reauth.
  • Vikunja: el contenedor aparece detenido con código 2, pero el endpoint respondió HTTP 200 en el segundo intento. La comprobación acumuló 8.767 segundos, compatible con activación bajo demanda o una indisponibilidad transitoria. No se declara caída.
  • OneTimeSecret: el contenedor gestionado bajo demanda aparece detenido con código 1, mientras que el endpoint respondió HTTP 200 en el segundo intento tras 8.824 segundos. No existe evidencia de caída activa, aunque conviene revisar el motivo del código de salida.
  • Karakeep: el contenedor gestionado por Sablier estaba detenido, pero el servicio respondió HTTP 200 en el primer intento. Se considera comportamiento bajo demanda, no incidente.
  • Traefik: registró referencias transitorias a contenedores ya eliminados y una cancelación puntual en ForwardAuth. Las comprobaciones posteriores de Traefik y Authentik devolvieron HTTP 200, por lo que no se observa impacto persistente.

Riesgos preventivos

  • Swap completamente ocupada: los 4 GiB están en uso. La memoria disponible todavía es de 5.7 GiB, por lo que no se confirma presión crítica actual, pero existe mayor riesgo de latencia y degradación ante nuevos picos. Los mayores consumidores de swap observados incluyen procesos mysqld, Python, mariadbd, Next.js, Chromium y Celery.
  • Certificado próximo al umbral: thehomelesssherlock.com vence en 29 días. El resto de los certificados activos informados conserva al menos 37 días.
  • Denegaciones de SELinux: se repitieron eventos para mandb y se registraron denegaciones relacionadas con transiciones de procesos de Docker. No hay evidencia de impacto general, pero los eventos de Docker deben correlacionarse con los despliegues realizados alrededor de las 19:56 UTC.
  • Contenedores con salidas no limpias: además de servicios bajo demanda, se observaron códigos 137, 143 y 2, así como eventos en los que Docker tuvo que forzar la terminación después de esperar una salida ordenada.
  • Latencia de activación bajo demanda: Vikunja y OneTimeSecret necesitaron un segundo intento y cerca de nueve segundos de tiempo acumulado. Permanecen disponibles, pero el tiempo de arranque puede afectar la experiencia de la primera solicitud.
  • Intentos SSH automatizados: se registraron usuarios inexistentes, fallos PAM, conexiones reiniciadas y timeouts previos a la autenticación. Fail2ban permanece activo, por lo que estos eventos representan actividad hostil bloqueada y ruido operativo, no una intrusión confirmada.
  • Calidad de logs de Docker: aparecieron errores puntuales al decodificar archivos de log por caracteres nulos. Esto puede reducir la fiabilidad del diagnóstico si se repite.

Acciones recomendadas

  1. Reautenticar OpenClaw de inmediato mediante codex-reauth y validar una tarea real contra OpenAI Codex, incluyendo el flujo de fallback.
  2. Investigar la ocupación total de swap, correlacionando el consumo por PID con sus contenedores o servicios. Evitar liberar la swap de forma abrupta sin confirmar que existe memoria suficiente y una ventana controlada.
  3. Revisar Vikunja y OneTimeSecret para confirmar que sus códigos de salida son compatibles con la gestión de Sablier y medir el tiempo de arranque en frío.
  4. Validar las denegaciones de SELinux asociadas a Docker y mandb. Corregir etiquetas o políticas específicas si procede, sin desactivar SELinux globalmente.
  5. Confirmar la renovación automática de TLS para thehomelesssherlock.com antes de entrar en una ventana inferior a 14 días.
  6. Identificar el contenedor que no termina dentro del plazo y revisar su manejo de SIGTERM, tiempo de gracia y posibles bloqueos durante el apagado.
  7. Supervisar SSH y la integridad de los logs, verificando que los bloqueos de Fail2ban continúan aumentando de forma coherente y que no se repiten los errores de decodificación de Docker.

Contexto operativo

El plano de servicio permanece disponible: todas las comprobaciones HTTP finalizaron con código 200. N8n respondió en 124 ms, Beszel en 88 ms, Memos en 137 ms, Paperless en 247 ms y OnlyOffice en 266 ms. Nextcloud respondió en 486 ms. Los endpoints protegidos por Authentik completaron correctamente su redirección al flujo de autenticación.

Paperless procesó correctamente sus tareas programadas y comprobaciones de correo durante el periodo, sin errores operativos relevantes. No se registraron errores destacados para N8n, Nextcloud ni el relay de correo.

Los 13 contenedores detenidos no deben interpretarse conjuntamente como 13 servicios caídos: diez figuran como gestionados por Sablier y varios endpoints asociados respondieron correctamente. Los contenedores detenidos desde hace semanas y los códigos de salida históricos constituyen contexto de mantenimiento, salvo que exista una expectativa explícita de ejecución continua.