Informe SRE diario - 2026-09-08

Resumen operativo de almasrv.thehomelesssherlock.com para las 24 horas comprendidas entre el 7 de septiembre de 2026 a las 06:00 UTC y el 8 de septiembre de 2026 a las 06:00 UTC. El resumen del servidor se generó a las 06:00:58 UTC y las comprobaciones de salud finalizaron a las 06:01:36 UTC.

Estado general

CRITICAL: la infraestructura web permanece accesible, con 13 de 13 endpoints respondiendo, pero la integración OAuth de OpenClaw con OpenAI Codex está expirada y el refresco devuelve HTTP 401. El fallo impide ejecutar correctamente las tareas programadas que dependen de esos modelos y agotó las alternativas configuradas.

No se observa una caída general del host, de Docker ni de los servicios publicados. La criticidad está limitada al fallo operativo confirmado de OpenClaw.

Indicadores principales

Indicador Valor Evaluación
Disponibilidad externa 13/13 endpoints activos Sin caídas detectadas
Uptime 6 días, 13 horas y 44 minutos Host operativo
Carga media 2.80 / 2.86 / 2.88 Estable durante las ventanas medidas
Memoria 14 GiB usados de 22 GiB; 7.7 GiB disponibles Capacidad disponible, con presión de swap
Swap 4.0 GiB usados de 4.0 GiB 100% ocupada
Disco raíz 144 GiB de 199 GiB; 73% Sin agotamiento inmediato
Disco /opt 22 GiB de 50 GiB; 44% Capacidad suficiente
Docker 85 activos, 0 unhealthy, 0 reiniciando, 15 detenidos Plataforma estable; revisar paradas no gestionadas
Protección SSH 1.078 fallos, 6 bloqueos actuales, 55 bloqueos acumulados Fail2ban activo
TLS más próximo 29 días restantes Renovación preventiva requerida

Incidentes críticos

OAuth de OpenClaw expirado

  • Estado: fallo activo y confirmado.
  • Evidencia: el token OAuth figura expirado desde el 4 de agosto de 2026 y los intentos de refresco realizados a las 06:00 UTC devolvieron HTTP 401.
  • Impacto: las tareas programadas de OpenClaw que requieren OpenAI Codex no pueden completar la autenticación. Los intentos con los modelos configurados fallaron y no quedó otra alternativa disponible.
  • Alcance: no afecta a la disponibilidad general de los 13 endpoints supervisados.

Servicios degradados e impacto

Vikunja y One-Time Secret

Ambos endpoints respondieron con HTTP 200, pero necesitaron un segundo intento. La latencia total observada fue de 8.728 segundos para Vikunja y 8.939 segundos para One-Time Secret. Esto indica disponibilidad recuperada con retraso, compatible con activación bajo demanda o una respuesta inicial transitoria; no constituye una caída confirmada.

Traefik y autenticación delegada

Traefik registró varios errores transitorios de ForwardAuth al consultar Authentik, con cancelación del contexto. En la comprobación final, tanto Traefik como Authentik respondieron con HTTP 200. El impacto observado parece intermitente y no hay evidencia de indisponibilidad sostenida, aunque pueden haberse producido fallos puntuales de acceso.

Interacción entre Docker y SELinux

SELinux bloqueó repetidamente una transición nnp_transition solicitada por Docker, aproximadamente una vez por hora y con varios mensajes duplicados por evento. No se identificó un endpoint caído ni un contenedor unhealthy como consecuencia directa, pero el bloqueo representa una anomalía operativa activa que debe correlacionarse con la creación o activación de contenedores.

Riesgos preventivos

  • Swap agotada: los 4 GiB están ocupados aunque todavía hay 7.7 GiB de memoria disponible. Los mayores consumidores registrados incluyen varias instancias de MySQL/MariaDB, procesos Python, Gunicorn, Celery y Ruby. La situación puede reflejar presión de memoria anterior o páginas inactivas, pero reduce el margen ante nuevos picos.
  • Certificados próximos al umbral: los certificados de grafana.sherlockhomeless.net, wiki.sherlockhomeless.net, pastebin.sherlockhomeless.net, opengist.sherlockhomeless.net y ots.sherlockhomeless.net tienen 29 días restantes.
  • Renovación ACME fallida: Traefik no pudo renovar el certificado de opencode.sherlockhomeless.net porque no encontró registros DNS A ni AAAA válidos. No se ha confirmado impacto sobre un dominio activo, pero la configuración debe corregirse o retirarse.
  • Contenedores detenidos: 11 de los 15 contenedores no activos están gestionados por Sablier y no deben considerarse caídos sin evidencia adicional. Los cuatro restantes son changedetection-browser, stirling-pdf, it-tools y memos-proxy; conviene confirmar si sus paradas son intencionadas.
  • Ruido y configuración SSH: se repiten fallos del control de clave pública y avisos por ausencia de configuración de Google Authenticator para intentos dirigidos a root. También se observaron intentos contra usuarios inexistentes. Fail2ban está activo, por lo que estos registros no demuestran una intrusión, pero dificultan distinguir errores legítimos de sondeos automatizados.
  • Uso del disco raíz: el 73% no implica agotamiento inmediato, aunque resulta aconsejable mantener una tendencia y alertas antes de alcanzar umbrales operativos.

Acciones recomendadas

  1. Reautenticar OpenClaw de inmediato mediante el procedimiento codex-reauth y comprobar que una tarea programada completa su ejecución sin HTTP 401 ni agotamiento del fallback.
  2. Analizar la ocupación de swap y la evolución de memoria por servicio, especialmente las instancias de MySQL/MariaDB, Python, Gunicorn y Celery. Evitar vaciar la swap o reiniciar procesos sin verificar primero el margen de RAM y el impacto.
  3. Investigar los AVC de SELinux, identificar el contenedor o flujo que solicita nnp_transition y aplicar una corrección específica. No desactivar SELinux como solución general.
  4. Revisar Vikunja y One-Time Secret para confirmar si el primer intento fallido y la latencia cercana a nueve segundos corresponden al arranque bajo demanda. Ajustar timeouts o precalentamiento si afecta a usuarios.
  5. Validar Authentik y Traefik durante los intervalos de cancelación de ForwardAuth, correlacionando disponibilidad, reinicios, red Docker y tiempos de respuesta.
  6. Preparar la renovación TLS de los cinco certificados con 29 días restantes y corregir o eliminar la configuración ACME de opencode.sherlockhomeless.net según deba seguir publicado o retirado.
  7. Revisar las paradas no gestionadas y la política SSH: confirmar el estado deseado de los cuatro contenedores fuera de Sablier y depurar la configuración PAM para reducir errores repetitivos sin debilitar la autenticación.

Contexto operativo

El host utiliza el kernel 5.14.0-570.58.1.el9_6.x86_64. No hay contenedores marcados como unhealthy ni en ciclo de reinicio. Los servicios supervisados de Traefik, Authentik, n8n, Nextcloud, Paperless, OnlyOffice, Memos, Vikunja, Karakeep, RSS, One-Time Secret, Dozzle y Beszel respondieron con HTTP 200.

Las paradas de contenedores gestionados por Sablier se consideran comportamiento bajo demanda mientras sus endpoints continúen respondiendo. Los errores SSH observados corresponden principalmente a intentos fallidos o usuarios no válidos; con seis direcciones bloqueadas actualmente, la protección está actuando y no existe evidencia aportada de acceso no autorizado.