Informe SRE diario - 2026-09-07

Resumen operativo de almasrv.thehomelesssherlock.com para las últimas 24 horas, con datos del sistema generados el 7 de septiembre de 2026 a las 06:00 UTC y comprobaciones de disponibilidad completadas a las 06:01 UTC.

Estado general

CRITICAL — La infraestructura web comprobada permanece disponible, con 13 de 13 endpoints operativos. Sin embargo, OpenClaw presenta un fallo operativo confirmado: la autorización OAuth de OpenAI Codex está caducada, la renovación devuelve HTTP 401 y las tareas programadas no pueden utilizar ninguno de los modelos configurados. El impacto está limitado actualmente a los procesos de OpenClaw dependientes de Codex.

Indicadores principales

Indicador Valor Evaluación
Disponibilidad HTTP 13/13 endpoints disponibles OK
Uptime 5 días, 13 horas y 44 minutos OK
Carga media 4,73 / 3,74 / 3,23 Requiere tendencia y contexto de CPU
Memoria 14 GiB usados de 22 GiB; 7,8 GiB disponibles OK
Swap 4,0 GiB usados de 4,0 GiB Riesgo elevado
Disco raíz 144 GiB de 199 GiB; 73% Vigilar crecimiento
Disco de aplicaciones 22 GiB de 50 GiB; 44% OK
Docker 86 activos, 0 no saludables, 0 reiniciando, 14 detenidos Sin inestabilidad global
Protección SSH Activa; 12 bloqueos actuales y 49 acumulados Operativa
Certificado más próximo 30 días restantes Advertencia preventiva

Incidentes críticos

Autorización OAuth de OpenClaw caducada

La credencial OAuth de OpenAI Codex figura como caducada desde el 4 de agosto de 2026. A las 06:00 UTC se registraron respuestas HTTP 401 al intentar renovarla. El mecanismo de conmutación probó los dos modelos configurados y terminó sin candidato disponible.

Impacto activo: las tareas programadas y sesiones de OpenClaw que dependen de OpenAI Codex pueden fallar. No hay evidencia de impacto sobre los 13 servicios web incluidos en las comprobaciones de disponibilidad.

Servicios degradados e impacto

  • Memos: la comprobación necesitó dos intentos y registró una latencia total observada de 8.974 ms. El endpoint terminó respondiendo con HTTP 200. Su contenedor aparecía detenido 36 minutos antes, pero está administrado bajo demanda por Sablier; el comportamiento es compatible con un arranque en frío y no constituye una caída confirmada.
  • One-Time Secret: respondió con HTTP 200 tras dos intentos y 8.839 ms de latencia observada. El contenedor administrado por Sablier figuraba detenido con código 1, pero la prueba funcional posterior fue satisfactoria. Existe degradación transitoria, no indisponibilidad activa.
  • OpenClaw: degradación funcional crítica limitada a las operaciones dependientes de Codex, debido al fallo de autenticación confirmado.
  • SELinux y Docker: se repite aproximadamente cada hora una denegación de transición de seguridad asociada a Docker. No hay contenedores marcados como no saludables o reiniciando, por lo que el impacto funcional no está confirmado.

Riesgos preventivos

  • Swap agotada: los 4,0 GiB están ocupados casi por completo. Aunque quedan 7,8 GiB de memoria disponible, la presión histórica de memoria puede aumentar la latencia y dificultar la absorción de picos. Los mayores consumidores de swap incluyen procesos MySQL/MariaDB, Python, Gunicorn, Celery y Ruby.
  • Renovación ACME: Traefik no pudo renovar el certificado de opencode.sherlockhomeless.net porque no encontró registros DNS A o AAAA válidos. No se ha confirmado impacto activo, pero la renovación seguirá fallando mientras persista la inconsistencia DNS.
  • Certificados próximos al umbral: los certificados de grafana.sherlockhomeless.net, wiki.sherlockhomeless.net, pastebin.sherlockhomeless.net, opengist.sherlockhomeless.net y ots.sherlockhomeless.net tienen 30 días restantes. Aún son válidos, pero deben verificarse sus renovaciones automáticas.
  • Disco raíz al 73%: quedan 56 GiB disponibles. No existe presión inmediata, aunque conviene vigilar imágenes, capas, volúmenes y registros de Docker.
  • Configuración PAM de SSH: se repiten errores relacionados con comprobaciones de clave pública y ausencia de configuración de segundo factor para intentos dirigidos a root. La mayoría coincide con sondeos externos, pero debe confirmarse que no afecte a accesos administrativos legítimos.
  • Ruido de registros Docker: aparecen advertencias periódicas por errores al decodificar archivos de log. No se observa impacto directo, pero podrían reducir la fiabilidad del análisis automatizado.

Acciones recomendadas

  1. Restaurar OpenClaw de inmediato: ejecutar el procedimiento de reautenticación de Codex, validar la renovación OAuth y repetir manualmente una tarea programada afectada.
  2. Investigar la swap: revisar presión de memoria, actividad de paginación y procesos residentes antes de liberar swap o reiniciar servicios. Determinar si MySQL/MariaDB y los procesos de aplicación necesitan límites o ajustes de memoria.
  3. Corregir el DNS de OpenCode: crear o restaurar los registros A/AAAA necesarios, o retirar el dominio de la configuración ACME si ya no debe publicarse. Confirmar después una renovación de prueba.
  4. Analizar la denegación SELinux: consultar el evento identificado por sealert, relacionarlo con el contenedor o tarea que se ejecuta cada hora y corregir etiquetas o permisos sin desactivar SELinux globalmente.
  5. Validar servicios bajo demanda: medir por separado el tiempo de arranque de Memos y One-Time Secret, y ajustar los tiempos de espera de monitorización si la latencia observada es normal para Sablier.
  6. Comprobar renovaciones TLS: verificar que los cinco certificados situados en 30 días entren correctamente en el siguiente ciclo automático.
  7. Revisar el flujo SSH/PAM: confirmar que el segundo factor y la validación de claves estén alineados con la política de acceso a root, manteniendo Fail2ban activo y sin interpretar los sondeos bloqueados como accesos exitosos.

Contexto operativo

El host ejecuta el kernel 5.14.0-570.58.1.el9_6.x86_64. Docker mantiene 86 contenedores activos, sin contenedores no saludables ni reinicios continuos. De los 14 contenedores detenidos, 10 están administrados por Sablier y pueden permanecer apagados hasta recibir tráfico; por tanto, su estado detenido no implica por sí solo una incidencia.

Las solicitudes rechazadas por Nextcloud contra recursos internos fueron bloqueadas por la configuración del servidor web, por lo que representan controles de acceso funcionando según lo esperado. Los trabajos revisados de Paperless finalizaron correctamente. Fail2ban está activo pese al volumen de sondeos SSH: registra 876 fallos acumulados, 49 bloqueos totales y 12 direcciones bloqueadas en el momento del informe.