Informe SRE diario - 2026-08-04

Resumen operativo de almasrv.thehomelesssherlock.com para las últimas 24 horas, generado el 4 de agosto de 2026 a las 06:01 UTC. El servidor ejecuta el kernel 5.14.0-570.58.1.el9_6.x86_64 y acumula 3 semanas y 5 días de disponibilidad continua.

Estado general

DEGRADED. Los 13 endpoints supervisados responden con HTTP 200 y Docker no registra contenedores unhealthy ni en reinicio. Sin embargo, existe un fallo operativo confirmado en crowdsec-firewall-bouncer.service, acompañado de errores repetidos de conectividad entre Traefik y el componente AppSec de CrowdSec. El impacto observado se limita a una degradación de la capa adicional de protección; no hay evidencia de indisponibilidad de las aplicaciones.

Indicadores principales

Indicador Valor Evaluación
Endpoints supervisados 13 de 13 disponibles OK
Carga media 1,96 / 2,31 / 2,44 Sin evidencia de saturación
Memoria 15 GiB usados de 22 GiB; 6,7 GiB disponibles Estable
Swap 1,8 GiB usados de 4 GiB Vigilar tendencia
Disco raíz 127 GiB de 199 GiB, 64% OK
Volumen /opt 18 GiB de 50 GiB, 35% OK
Docker 75 activos, 0 unhealthy, 0 reiniciando, 15 detenidos Operativo
Certificado TLS más próximo 33 días restantes Sin vencimiento inmediato
Fail2ban SSH Activo; 28 bloqueos actuales Operativo

Incidentes críticos

No se observa un incidente crítico con impacto activo sobre los servicios publicados. Todas las comprobaciones sintéticas finalizaron correctamente y no hay contenedores marcados como unhealthy o reiniciándose.

La credencial OAuth de OpenClaw está etiquetada como crítica por proximidad al vencimiento, pero seguía siendo válida durante la generación del informe. Se trata de un riesgo preventivo urgente, no de una interrupción activa.

Servicios degradados e impacto

CrowdSec y Traefik AppSec

crowdsec-firewall-bouncer.service falló repetidamente con resultado exit-code. Traefik también registró múltiples eventos appsecQuery:unreachable para el plugin de CrowdSec.

  • Impacto confirmado: degradación de la integración de filtrado y AppSec de CrowdSec.
  • Impacto no observado: no se detectó caída del proxy ni de los endpoints publicados.
  • Control compensatorio: Fail2ban para SSH permanece activo, aunque no sustituye la protección de CrowdSec sobre otros flujos.

Latencia transitoria en comprobaciones

vikunja.sherlockhomeless.net y ots.sherlockhomeless.net necesitaron un segundo intento y completaron la comprobación en aproximadamente 8,7 y 8,9 segundos, respectivamente. Ambos devolvieron HTTP 200, por lo que no se consideran caídos, pero el resultado apunta a latencia o disponibilidad transitoria que debe vigilarse.

Contenedores detenidos

Once de los contenedores no activos están gestionados por Sablier y pueden permanecer detenidos bajo demanda. No se clasifican como caídas sin evidencia adicional. Los endpoints de Memos, Vikunja y Karakeep respondieron correctamente pese a que aparecen instancias detenidas en el inventario.

Entre los contenedores no gestionados por Sablier, memos-proxy terminó con código 137 poco antes del informe. El endpoint de Memos continuó disponible, por lo que no se confirma impacto de usuario, aunque conviene validar si la terminación fue esperada.

Riesgos preventivos

  • OAuth de OpenClaw: vencimiento previsto para el 4 de agosto de 2026 a las 10:06 UTC, con 4 horas y 5 minutos restantes al generar el informe. Requiere reautenticación urgente mediante codex-reauth.
  • Swap: se utilizan 1,8 GiB de 4 GiB. Los principales consumidores observados incluyen opencode-host, kopia, procesos Chromium y trabajadores Celery. Hay memoria disponible, pero debe comprobarse si el uso de swap sigue creciendo o corresponde a páginas inactivas.
  • TLS: los certificados más próximos al vencimiento conservan 33 días. No existe riesgo inmediato, aunque debe confirmarse que la renovación automática funciona.
  • SELinux: se registraron denegaciones repetidas para mandb sobre capacidades privilegiadas. No hay impacto funcional demostrado, pero el volumen de eventos puede ocultar señales más relevantes.
  • SSH: continúan los sondeos, negociaciones inválidas e intentos contra usuarios inexistentes. Fail2ban está activo, con 9.895 fallos acumulados y 563 bloqueos históricos.
  • Errores adicionales: el resumen contiene siete patrones de panic por acceso fuera de rango sin contexto suficiente, además de un error de ejecución en rsyslog del servicio de correo. Requieren atribución antes de determinar impacto.
  • n8n: se observaron una terminación administrativa de conexión PostgreSQL y una configuración no recomendada del task runner de Python. El endpoint de salud respondió en 114 ms, por lo que no existe una caída activa.

Acciones recomendadas

  1. Reautenticar OpenClaw de inmediato con codex-reauth y verificar que la nueva fecha de expiración quede reflejada antes de las 10:06 UTC.
  2. Restaurar crowdsec-firewall-bouncer.service, revisar su error de salida y confirmar conectividad con los componentes de CrowdSec.
  3. Validar la integración AppSec de Traefik mediante una prueba controlada y determinar el comportamiento del proxy cuando el servicio de CrowdSec no está disponible.
  4. Revisar los eventos recientes de Docker para memos-proxy, Vikunja y Karakeep, diferenciando activación bajo demanda, despliegue planificado y terminaciones por presión de memoria.
  5. Investigar la latencia transitoria de Vikunja y OTS, correlacionando los primeros intentos fallidos con arranque bajo demanda, logs del proxy y tiempos del backend.
  6. Analizar las denegaciones de SELinux con los identificadores de alerta proporcionados por el sistema; no desactivar SELinux como medida correctiva general.
  7. Atribuir los errores sin contexto, especialmente los panic, el fallo de rsyslog y los avisos de n8n, y crear alertas solo si se confirma recurrencia o impacto.

Contexto operativo

  • El servidor lleva 3 semanas, 5 días, 5 horas y 28 minutos sin reiniciarse.
  • Nextcloud rechazó intentos externos de acceso a archivos de configuración. Las denegaciones indican que el control de acceso funcionó y no constituyen una caída.
  • Paperless mostró reintentos iniciales de conexión a base de datos, pero posteriormente ejecutó tareas programadas correctamente y su endpoint respondió con HTTP 200.
  • Los errores SSH predominantes corresponden a resets durante el intercambio de claves, protocolos incompatibles e intentos sobre usuarios inexistentes. Este ruido es compatible con sondeo automatizado y no demuestra acceso exitoso.
  • Traefik registró una referencia puntual a un contenedor ya inexistente, compatible con una condición de carrera durante cambios del ciclo de vida de Docker.
  • Los 47 dominios TLS activos revisados conservan entre 33 y 84 días de vigencia.