Informe SRE diario - 2026-08-28

Resumen operativo de almasrv.thehomelesssherlock.com para las últimas 24 horas, generado el 28 de agosto de 2026 a las 06:00 UTC. La comprobación de salud se completó a las 06:01 UTC.

Estado general

DEGRADED. Los 13 endpoints supervisados están disponibles y no hay contenedores marcados como no saludables o reiniciándose. No obstante, existe un fallo operativo activo en OpenClaw: la autenticación OAuth de OpenAI Codex está caducada, la renovación devuelve HTTP 401 y las tareas programadas que dependen de ese proveedor no pueden ejecutarse. Adicionalmente, la swap está completamente ocupada, aunque todavía hay 7,8 GiB de memoria disponible y no se observa impacto confirmado por falta de memoria.

Indicadores principales

Indicador Valor Evaluación
Disponibilidad HTTP 13 de 13 endpoints disponibles OK
Uptime 3 días, 16 horas y 15 minutos OK
Carga media 2,83 / 2,40 / 2,75 Sin umbral de CPU disponible para determinar saturación
Memoria 14 GiB usados de 22 GiB; 7,8 GiB disponibles OK con vigilancia
Swap 4,0 GiB usados de 4,0 GiB Riesgo preventivo
Disco raíz 145 GiB usados de 199 GiB; 73% OK con vigilancia
Disco /opt 21 GiB usados de 50 GiB; 41% OK
Docker 84 en ejecución, 0 no saludables, 0 reiniciándose OK
Certificados TLS 50 dominios activos; vencimiento más próximo en 32 días OK con seguimiento
Protección SSH Fail2ban activo; 18 bloqueos actuales OK

Incidentes críticos

OAuth de OpenClaw para OpenAI Codex caducado

La credencial OAuth figura como caducada desde el 4 de agosto de 2026. A las 06:00 UTC, el gateway recibió respuestas HTTP 401 al intentar renovarla. El proveedor principal y su alternativa fallaron por autenticación, sin otro candidato disponible.

Impacto activo: las tareas programadas y sesiones de OpenClaw que requieren los modelos de OpenAI Codex no pueden completarse. El incidente está limitado a esa integración; no afecta a la disponibilidad confirmada de los 13 servicios web comprobados.

Servicios degradados e impacto

  • One-Time Secret: respondió correctamente, pero necesitó dos intentos y registró una latencia observada de 8.745 ms. El segundo intento completó la solicitud en aproximadamente 419 ms. Esto indica una degradación transitoria, no una caída activa.
  • Traefik y Authentik: se registraron dos cancelaciones de contexto al consultar el servicio de autenticación. En la comprobación posterior, tanto Traefik como Authentik devolvieron HTTP 200. No hay impacto persistente confirmado.
  • Memos: el proxy auxiliar terminó con código 137 poco antes del informe, pero el endpoint público de Memos respondió HTTP 200. No se declara indisponibilidad mientras la comprobación externa continúe siendo satisfactoria.
  • Contenedores bajo demanda: varios servicios administrados por Sablier aparecen detenidos. Este estado es compatible con su operación bajo demanda y no constituye una caída sin evidencia adicional.

Riesgos preventivos

  • Swap al 100%: los 4 GiB están ocupados. Los principales consumidores incluyen procesos de bases de datos, Ruby, Python y Gunicorn. Aunque quedan 7,8 GiB de memoria disponible, la swap llena puede elevar la latencia y reducir el margen ante picos de carga.
  • Renovación ACME fallida: Traefik no pudo renovar el certificado de opencode.sherlockhomeless.net porque no encontró registros DNS A o AAAA válidos. No se ha confirmado impacto actual, pero la configuración debe corregirse si el dominio sigue en uso.
  • Uso del disco raíz: el 73% de ocupación no es crítico, pero conviene mantener seguimiento de tendencia y alertas antes de alcanzar niveles operativamente peligrosos.
  • Eventos SELinux: se repitieron denegaciones para mandb y para transiciones de procesos iniciadas por Docker. Los servicios comprobados permanecen disponibles, pero las denegaciones pueden ocultar incompatibilidades de política o impedir operaciones futuras.
  • Volcado de núcleo de Node.js: se registró un coredump de un proceso Node durante la ventana. No hay datos suficientes para asociarlo de forma concluyente con un servicio concreto.
  • Certificados próximos: el certificado con menor margen vence en 32 días. No requiere intervención de emergencia, pero debe verificarse que la renovación automática funcione.
  • Presión SSH continua: Fail2ban está activo y ha contabilizado 1.290 fallos, 112 bloqueos acumulados y 18 bloqueos vigentes. Los errores de intercambio y autenticación observados son compatibles con sondeos externos y no demuestran por sí solos un fallo de protección.

Acciones recomendadas

  1. Reautenticar OpenClaw con Codex de inmediato y ejecutar una prueba de la tarea programada para confirmar que la renovación y los candidatos de respaldo vuelven a funcionar.
  2. Investigar la ocupación completa de swap: revisar presión de memoria, actividad de intercambio y límites de los procesos principales antes de considerar liberar swap o reiniciar cargas.
  3. Corregir el DNS de opencode.sherlockhomeless.net si el servicio debe permanecer publicado; en caso contrario, retirar su router y solicitud ACME para evitar renovaciones fallidas.
  4. Revisar la intermitencia de One-Time Secret y correlacionar el primer intento fallido con logs del contenedor, proxy y red.
  5. Analizar las denegaciones SELinux con los identificadores registrados y validar cualquier ajuste de política en modo controlado, sin desactivar SELinux.
  6. Identificar el proceso Node.js que generó el coredump y comprobar si guarda relación con terminaciones por código 137 o con reinicios forzados de contenedores.
  7. Verificar la automatización TLS para los dominios con vencimiento entre 32 y 40 días y mantener alertas escalonadas de renovación.

Contexto operativo

El host ejecuta el kernel 5.14.0-570.58.1.el9_6.x86_64. La plataforma Docker mantiene 84 contenedores en ejecución, sin estados no saludables ni ciclos de reinicio en el momento del informe.

Los errores repetidos de Paperless corresponden al rechazo de un PDF duplicado ya registrado como documento existente. Se trata de una validación funcional de la aplicación y no de una degradación de la plataforma.

También aparecen contenedores detenidos desde hace días o semanas. La mayoría están administrados por Sablier y deben considerarse inactivos bajo demanda, no caídos. Los endpoints de Memos y Karakeep respondieron correctamente pese a que sus contenedores figuraban recientemente detenidos, lo que confirma que el estado puntual del inventario no equivale por sí solo a indisponibilidad externa.