Contacta con nosotros

Temario del curso

Infraestructura como Código de EXO

  • Vista general de patrones de despliegue de EXO: nodos individuales, multinode y clústeres RDMA.
  • Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) con gestión de configuraciones.
  • Uso de Nix flakes para compilaciones reproducibles de EXO y entornos de desarrollador.
  • Escritura de playbooks de Ansible o scripts de shell para aprovisionamiento no supervisado de clústeres.

Compilaciones Reproducibles e Integración con CI

  • Fijar dependencias y compilar el panel de control en tuberías de CI.
  • Ejecutar pruebas básicas de EXO en ejecutores de GitHub Actions o GitLab CI.
  • Crear imágenes base y flujos de trabajo de reversión basados en instantáneas para VMs de macOS y Linux.
  • Versionar tarjetas de modelos personalizados junto con el código de la aplicación.

Descubrimiento de Clústeres y Automatización de Redes

  • Configuración de mDNS y DNS estático para un descubrimiento confiable de nodos libp2p.
  • Automatización de la creación de perfiles de red y gestión del puente Thunderbolt en macOS.
  • Uso de espacios de nombres personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción.
  • Reglas de firewall y segmentación de red para entornos multiinquilino.

Gestión del Ciclo de Vida de Almacenamiento y Modelos

  • Diseño de estrategias EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS.
  • Montaje de comparticiones NFS o SAN como repositorios de modelos solo lectura para un aprovisionamiento rápido.
  • Colección de basura de cachés obsoletos y políticas de retención de pesos versionados.
  • Automatización de la precarga de modelos y comprobaciones de salud antes de actualizaciones progresivas.

Supervisión y Alertas

  • Envío de registros de EXO a un sistema de registro centralizado (ELK, Loki o Splunk).
  • Construcción de paneles de control Grafana a partir de la salida EXO_TRACING_ENABLED.
  • Configuración de alertas sobre cambios en la membresía del clúster, eventos OOM y picos de latencia de inferencia.
  • Correlacionar telemetría de hardware macmon con regresiones en el rendimiento del modelo.

Actualización, Reversión y Recuperación ante Desastres

  • Preparación de actualizaciones de binarios EXO en un nodo piloto antes del despliegue generalizado.
  • Reversión a nivel de modelo: cambio entre versiones cuantizadas sin necesidad de volver a descargar.
  • Copia de seguridad y restauración del estado del clúster, espacios de nombres personalizados y pesos en caché.
  • Documentación de libros de recuperación para escenarios de reconstrucción total del clúster.

Endurecimiento de Seguridad y Cumplimiento

  • Aplicación de TLS en la capa del proxy inverso (nginx, traefik) para el panel de control y la API.
  • Implementación de límites de tasa de API y lista blanca de IPs para puntos finales de EXO.
  • Aislamiento de clústeres mediante VLANs y políticas de red de confianza cero.
  • Auditoría de accesos y mantenimiento de un inventario de modelos desplegados y sus versiones.

Requerimientos

  • Experiencia con prácticas de DevOps (CI/CD, IaC, orquestación de contenedores)
  • Familiaridad con la administración de sistemas macOS o Linux y gestión de paquetes.
  • Comprensión de conceptos de redes, DNS y almacenamiento.

Audiencia

  • Ingenieros de DevOps.
  • Arquitectos de infraestructura.
  • SREs responsables de cargas de trabajo de IA locales.
 21 Horas

Número de participantes


Precio por participante

Reseñas (2)

Próximos cursos

Categorías Relacionadas