Informe SRE diario - 2026-08-06
Resumen operativo de almasrv.thehomelesssherlock.com para las últimas 24 horas. Los datos del sistema se generaron el 6 de agosto de 2026 a las 06:00:59 UTC y las comprobaciones de disponibilidad finalizaron a las 06:01:35 UTC.
Estado general
DEGRADED. Los 13 endpoints supervisados están disponibles y no hay contenedores unhealthy o reiniciándose. Sin embargo, existe un fallo operativo confirmado en OpenClaw: la autorización OAuth de OpenAI Codex está caducada y los intentos de renovación devuelven HTTP 401. Esto está provocando fallos activos en tareas programadas que requieren esos modelos.
El impacto permanece acotado a las cargas de OpenClaw dependientes de Codex; no se observa una caída general de la plataforma ni de los servicios web monitorizados.
Indicadores principales
| Indicador | Valor | Evaluación |
|---|---|---|
| Disponibilidad HTTP | 13 de 13 endpoints disponibles | OK |
| Contenedores Docker | 75 en ejecución, 0 unhealthy, 0 reiniciándose | OK |
| Contenedores detenidos | 15, de los cuales 11 están gestionados bajo demanda por Sablier | Revisión selectiva |
| Carga del sistema | 3.16 / 2.66 / 2.56 | Sin impacto confirmado |
| Memoria RAM | 22 GiB totales, 14 GiB usados, 7.7 GiB disponibles | OK |
| Swap | 4.0 GiB usados, 15 MiB libres | Riesgo preventivo |
| Disco raíz | 128 GiB de 199 GiB usados, 65% | OK |
Volumen /opt |
18 GiB de 50 GiB usados, 35% | OK |
| Certificado más próximo | 31 días restantes | Vigilar renovación |
| Protección SSH | Fail2ban activo, 20 direcciones bloqueadas actualmente | Operativo |
| Tiempo encendido | 4 semanas, 5 horas y 28 minutos | Estable |
Incidentes críticos
OAuth de OpenClaw Codex caducado
La credencial OAuth caducó el 4 de agosto de 2026 a las 10:06:52 UTC. Durante la ventana analizada, OpenClaw recibió respuestas HTTP 401 al intentar renovarla. Los registros confirman errores en tareas programadas y el fallo sucesivo de los candidatos de modelo configurados para Codex.
- Impacto activo: las tareas de OpenClaw que requieren autenticación con OpenAI Codex no pueden completarse.
- Alcance: no hay evidencia de afectación a los 13 endpoints HTTP supervisados.
- Acción requerida: ejecutar la reautenticación de Codex y validar posteriormente una tarea programada real.
Servicios degradados e impacto
OpenClaw
El servicio presenta una degradación funcional por autenticación. El mecanismo de selección intentó alternativas de modelo, pero los candidatos registrados fallaron por el mismo problema de autorización. La disponibilidad del contenedor por sí sola no elimina este impacto, ya que la operación solicitada no puede ejecutarse.
Comprobaciones con reintento
memos.sherlockhomeless.net, vikunja.sherlockhomeless.net y ots.sherlockhomeless.net necesitaron dos intentos y registraron una duración total cercana a 8.9 segundos, incluyendo el intervalo entre reintentos. Finalmente devolvieron HTTP 200.
Esto representa una señal de disponibilidad intermitente o arranque bajo demanda, pero no una caída activa. Memos y Vikunja figuran además entre los servicios gestionados por Sablier, por lo que un contenedor detenido no debe interpretarse por sí solo como incidente.
Autenticación frontal
Traefik registró dos cancelaciones de contexto al consultar el servicio de autenticación. Las verificaciones posteriores de Traefik y Authentik finalizaron correctamente con HTTP 200, por lo que se consideran eventos transitorios sin impacto sostenido demostrado.
Riesgos preventivos
- Swap prácticamente agotada: quedan 15 MiB libres de 4 GiB. La RAM aún dispone de 7.7 GiB, por lo que no hay evidencia de presión crítica inmediata, pero la ocupación puede reflejar páginas antiguas o procesos con alta huella histórica. Los principales consumidores registrados incluyen instancias de MySQL, Python, MariaDB, Celery, Chromium y Next.js.
- Renovación TLS: los certificados de
spintools.proywww.spintools.proson los más próximos a vencer, con 31 días restantes. No existe caducidad activa. - Exposición SSH: Fail2ban está activo, con 10.489 fallos acumulados, 610 bloqueos acumulados y 20 bloqueos actuales. Los errores de usuarios inexistentes, PAM y negociación SSH son compatibles con sondeos automatizados y no demuestran acceso exitoso.
- Configuración PAM de root: se registraron intentos contra root sin una configuración TOTP disponible. Aunque los intentos fueron rechazados, conviene confirmar que este comportamiento coincide con la política de acceso prevista.
- Alertas repetitivas de SELinux: SELinux bloqueó repetidamente capacidades solicitadas por
mandb. No se observa impacto sobre servicios de producción, pero el volumen de mensajes reduce la señal útil del diario. - Terminaciones forzadas: algunos contenedores registran códigos de salida 137 o 143 y existen eventos donde Docker tuvo que forzar la detención tras el tiempo de espera. No hay reinicios activos, pero deben correlacionarse con operaciones programadas antes de descartarlos.
- Contenedores no gestionados por Sablier: cuatro contenedores detenidos no aparecen en el grupo bajo demanda. Entre ellos,
memos-proxyterminó con código 137 dos horas antes del informe, aunque el endpoint de Memos respondió correctamente.
Acciones recomendadas
- Reautenticar OpenClaw Codex de inmediato y ejecutar una tarea programada controlada para confirmar que la renovación funciona y que ya no se producen respuestas 401.
- Revisar la ocupación de swap y la memoria residente de los principales consumidores. Evitar liberar swap de forma indiscriminada; priorizar la identificación de procesos obsoletos, duplicados o con crecimiento anómalo.
- Analizar los reintentos de Memos, Vikunja y One-Time Secret, correlacionándolos con eventos de Sablier, tiempos de arranque y disponibilidad del proxy para determinar si la latencia es esperada.
- Investigar la salida 137 de
memos-proxyy las terminaciones forzadas de Docker, verificando si fueron detenciones administrativas, límites de recursos o fallos no planificados. - Validar la renovación automática de TLS para los dominios con 31 días restantes y confirmar una siguiente fecha de renovación antes de alcanzar el umbral operativo.
- Revisar las denegaciones de SELinux asociadas a
mandby corregir la causa sin deshabilitar SELinux ni crear excepciones amplias. - Auditar la política SSH y PAM, en particular el tratamiento de root y usuarios inexistentes, manteniendo Fail2ban activo y verificando que no existan autenticaciones exitosas no reconocidas.
Contexto operativo
El servidor ejecuta el kernel 5.14.0-570.58.1.el9_6.x86_64. El almacenamiento mantiene margen suficiente: la raíz está al 65%, /boot al 44%, /boot/efi al 4% y /opt al 35%.
No se detectaron endpoints caídos, contenedores unhealthy ni contenedores en bucle de reinicio. Los servicios n8n, Nextcloud, Paperless, OnlyOffice, Authentik, Traefik, Karakeep, RSS, Dozzle y Beszel respondieron en el primer intento. Los mensajes SSH y las denegaciones repetidas de SELinux constituyen principalmente ruido operativo o riesgos de mantenimiento; no deben confundirse con el fallo funcional confirmado de OpenClaw.
Comments ()