Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Infraestructura como Código de EXO
- Vista general de patrones de despliegue de EXO: nodos individuales, multinode y clústeres RDMA.
- Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) con gestión de configuraciones.
- Uso de Nix flakes para compilaciones reproducibles de EXO y entornos de desarrollador.
- Escritura de playbooks de Ansible o scripts de shell para aprovisionamiento no supervisado de clústeres.
Compilaciones Reproducibles e Integración con CI
- Fijar dependencias y compilar el panel de control en tuberías de CI.
- Ejecutar pruebas básicas de EXO en ejecutores de GitHub Actions o GitLab CI.
- Crear imágenes base y flujos de trabajo de reversión basados en instantáneas para VMs de macOS y Linux.
- Versionar tarjetas de modelos personalizados junto con el código de la aplicación.
Descubrimiento de Clústeres y Automatización de Redes
- Configuración de mDNS y DNS estático para un descubrimiento confiable de nodos libp2p.
- Automatización de la creación de perfiles de red y gestión del puente Thunderbolt en macOS.
- Uso de espacios de nombres personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción.
- Reglas de firewall y segmentación de red para entornos multiinquilino.
Gestión del Ciclo de Vida de Almacenamiento y Modelos
- Diseño de estrategias EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS.
- Montaje de comparticiones NFS o SAN como repositorios de modelos solo lectura para un aprovisionamiento rápido.
- Colección de basura de cachés obsoletos y políticas de retención de pesos versionados.
- Automatización de la precarga de modelos y comprobaciones de salud antes de actualizaciones progresivas.
Supervisión y Alertas
- Envío de registros de EXO a un sistema de registro centralizado (ELK, Loki o Splunk).
- Construcción de paneles de control Grafana a partir de la salida EXO_TRACING_ENABLED.
- Configuración de alertas sobre cambios en la membresía del clúster, eventos OOM y picos de latencia de inferencia.
- Correlacionar telemetría de hardware macmon con regresiones en el rendimiento del modelo.
Actualización, Reversión y Recuperación ante Desastres
- Preparación de actualizaciones de binarios EXO en un nodo piloto antes del despliegue generalizado.
- Reversión a nivel de modelo: cambio entre versiones cuantizadas sin necesidad de volver a descargar.
- Copia de seguridad y restauración del estado del clúster, espacios de nombres personalizados y pesos en caché.
- Documentación de libros de recuperación para escenarios de reconstrucción total del clúster.
Endurecimiento de Seguridad y Cumplimiento
- Aplicación de TLS en la capa del proxy inverso (nginx, traefik) para el panel de control y la API.
- Implementación de límites de tasa de API y lista blanca de IPs para puntos finales de EXO.
- Aislamiento de clústeres mediante VLANs y políticas de red de confianza cero.
- Auditoría de accesos y mantenimiento de un inventario de modelos desplegados y sus versiones.
Requerimientos
- Experiencia con prácticas de DevOps (CI/CD, IaC, orquestación de contenedores)
- Familiaridad con la administración de sistemas macOS o Linux y gestión de paquetes.
- Comprensión de conceptos de redes, DNS y almacenamiento.
Audiencia
- Ingenieros de DevOps.
- Arquitectos de infraestructura.
- SREs responsables de cargas de trabajo de IA locales.
21 Horas
Reseñas (2)
El conocimiento y experiencia del consultor ya que se abordan los temas teóricos aplicándolos a la realidad de los procesos. El curso contiene un programa de mucho valor en la gestión de las tecnologías de información.
Luis Castro Gamboa - Cooperativa De Ahorro Y Credito Ande No. 1 R.L.
Curso - Site Reliability Engineering (SRE) Foundation®
Que fue muy claro en cada especificación