Informe SRE diario - 2026-08-05
Resumen operativo de almasrv.thehomelesssherlock.com para las últimas 24 horas, generado el 5 de agosto de 2026 a las 06:00:58 UTC; las comprobaciones de disponibilidad finalizaron a las 06:01:26 UTC.
Estado general
DEGRADED. Los 13 endpoints supervisados están disponibles y no hay contenedores reiniciándose ni marcados como no saludables. Sin embargo, existe un fallo operativo confirmado: la autorización OAuth de OpenClaw para Codex expiró el 4 de agosto a las 10:06:52 UTC. Además, Traefik registró referencias a middlewares de CrowdSec inexistentes, lo que requiere validar la protección efectiva de los routers afectados.
Indicadores principales
| Indicador | Valor | Evaluación |
|---|---|---|
| Disponibilidad HTTP | 13 de 13 endpoints disponibles | OK |
| Uptime | 3 semanas, 6 días, 5 horas y 28 minutos | Estable |
| Carga media | 2,08 / 2,40 / 2,46 | Sin impacto confirmado |
| Memoria | 14 GiB usados de 22 GiB; 8,2 GiB disponibles | Con margen |
| Swap | 3,9 GiB usados de 4,0 GiB | Riesgo elevado |
| Disco raíz | 128 GiB usados de 199 GiB; 65% | OK |
| Docker | 77 activos, 0 no saludables, 0 reiniciándose y 13 detenidos | Estable con revisión pendiente |
| Certificados TLS | 47 dominios activos; mínimo observado: 32 días restantes | Sin vencimiento inmediato |
| Protección SSH | Fail2ban activo; 27 bloqueos actuales y 590 acumulados | Operativa |
Incidentes críticos
OAuth de OpenClaw para Codex expirado
La credencial OAuth expiró el 4 de agosto de 2026 a las 10:06:52 UTC. Se trata de un fallo operativo confirmado que puede impedir las funciones de OpenClaw dependientes de Codex hasta completar una nueva autenticación. La acción indicada por el sistema es codex-reauth.
Servicios degradados e impacto
- OpenClaw/Codex: integración degradada por autorización expirada. No hay evidencia en este informe de una caída general de OpenClaw, pero las operaciones que requieran Codex no deben considerarse funcionales hasta verificar la reautenticación.
- Traefik/CrowdSec: Traefik registró múltiples errores porque los middlewares
crowdsec-bouncer@fileycrowdsec-bouncer-api@fileno existían al procesar varios routers. Los endpoints comprobados continúan respondiendo, por lo que no se confirma una indisponibilidad general; sí queda pendiente comprobar si esos routers conservan la capa de protección prevista. - Vikunja: el contenedor administrado bajo demanda figuraba detenido con código 2, pero el endpoint respondió con HTTP 200 tras dos intentos. La latencia total observada fue de 8.827 ms, compatible con activación bajo demanda o recuperación transitoria; no se declara caída.
- One-Time Secret: el endpoint respondió con HTTP 200 tras dos intentos y 8.890 ms de latencia total. El contenedor administrado por Sablier estaba detenido, por lo que no se considera una caída sin evidencia adicional.
Riesgos preventivos
- Swap casi agotada: se utilizan aproximadamente 3,9 GiB de 4,0 GiB. Los mayores consumidores identificados incluyen procesos de MySQL/MariaDB, Python, navegadores Chromium, Celery y OpenCode. Aunque quedan 8,2 GiB de memoria disponible, la ocupación persistente de swap puede introducir latencia y ocultar presión de memoria anterior.
- Configuración de seguridad del proxy: las referencias de Traefik a middlewares de CrowdSec inexistentes pueden dejar routers inválidos o sin la política de filtrado esperada. La disponibilidad HTTP por sí sola no confirma que la protección esté aplicada.
- Denegaciones SELinux: se registraron bloqueos repetidos para
mandbsobre capacidades administrativas y de recursos, además de una denegación relacionada con transiciones de procesos de Docker. No se ha confirmado impacto en producción, pero deben analizarse antes de crear excepciones. - Ruido y ataques SSH: Fail2ban está activo, pero el sistema acumula 10.210 fallos y mantiene 27 direcciones bloqueadas. Los errores de intercambio de claves, usuarios inexistentes y fallos PAM son coherentes con sondeos externos; no demuestran por sí mismos una intrusión.
- Segundo factor SSH: apareció un intento para
rootsin configuración disponible de Google Authenticator. Debe confirmarse que la política PAM esperada no permita rutas de autenticación inconsistentes. - Contenedores no administrados detenidos:
changedetection-browser,stirling-pdfeit-toolsllevan detenidos alrededor de diez días. No hay endpoints fallidos asociados en las comprobaciones actuales, pero conviene confirmar si su estado es intencional. - Renovación TLS: los certificados de
spintools.proywww.spintools.protienen 32 días restantes. No es una incidencia actual, aunque ya están dentro de una ventana razonable de seguimiento de renovación automática.
Acciones recomendadas
- Reautenticar OpenClaw con Codex mediante la acción
codex-reauthy ejecutar después una prueba funcional de la integración. - Restaurar o corregir las definiciones de
crowdsec-bouncer@fileycrowdsec-bouncer-api@file; recargar Traefik y verificar que cada router afectado incorpora el middleware previsto. - Revisar la presión de memoria y la actividad de swap por proceso, especialmente en las instancias de MySQL/MariaDB y Python; confirmar si la swap sigue creciendo o corresponde a páginas inactivas antiguas.
- Analizar las denegaciones SELinux de
mandby Docker con las herramientas de diagnóstico de SELinux. No desactivar la política ni generar permisos amplios sin validar primero la operación bloqueada. - Validar la configuración PAM y del segundo factor para SSH, en particular el comportamiento ante usuarios inexistentes y la ausencia de configuración para
root. - Confirmar que los contenedores administrados por Sablier se activan correctamente bajo demanda y revisar por separado los tres contenedores detenidos que no están bajo su gestión.
- Supervisar la renovación automática de los certificados con 32 días restantes y alertar si no se renuevan antes de entrar en una ventana inferior a 14 días.
Contexto operativo
- El host utiliza el kernel
5.14.0-570.58.1.el9_6.x86_64. - Los sistemas de archivos mantienen capacidad disponible: raíz al 65%,
/optal 35% y/bootal 44%. - No hay contenedores Docker marcados como no saludables ni en bucle de reinicio.
- Varios contenedores detenidos están administrados por Sablier y pueden permanecer apagados hasta recibir tráfico. Su estado detenido no constituye por sí mismo una indisponibilidad.
- Las respuestas HTTP de Traefik, Authentik, n8n, Nextcloud, Paperless, OnlyOffice, Memos, Vikunja, Karakeep, RSS, One-Time Secret, Dozzle y Beszel fueron satisfactorias.
- Los errores SSH más frecuentes fueron 20 reinicios de conexión durante el intercambio de claves y cinco rechazos del control de clave pública. Fail2ban permaneció activo durante el periodo.
- Los accesos anómalos observados contra Nextcloud devolvieron HTTP 404 y no aportan evidencia de compromiso.
Comments ()