Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a EXO y Clustering de IA Local
- Visión general del framework EXO y el ecosistema exo-explore
- Comparación entre inferencia centralizada en la nube e inferencia local distribuida
- Arquitectura: descubrimiento de dispositivos libp2p, backend MLX, dashboard y capas API
- Requisitos de hardware: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, almacenamiento compartido
Instalación de EXO en macOS
- Configuración de Xcode, Metal ToolChain y prerequisitos de macOS
- Instalación de uv, Node.js y Rust nightly toolchain
- Instalación del fork macmon pinning para monitoreo de Apple Silicon
- Clonado del repositorio y construcción del dashboard con npm
- Ejecución de EXO desde el código fuente y verificación del dashboard en localhost:52415
Instalación de EXO en Linux
- Instalación de dependencias mediante apt o Homebrew en Linux
- Configuración de uv, Node.js 18+ y Rust nightly
- Construcción del dashboard y ejecución de EXO en modo solo CPU
- Estructura de directorios: rutas XDG Base Directory para configuración, datos, caché y registros
Descubrimiento automático de dispositivos y formación de clústeres
- Comprensión del auto-descubrimiento basado en libp2p en redes locales
- Configuración de namespaces personalizados con EXO_LIBP2P_NAMESPACE para aislamiento del clúster
- Verificación de la membresía de nodos en la vista de clúster del dashboard
- Gestión de fallos de descubrimiento y problemas de segmentación de red
Habilitación de RDMA sobre Thunderbolt 5
- Arquitectura de RDMA y la afirmación de reducción de latencia del 99 por ciento
- Habilitación de RDMA en el modo de recuperación de macOS con rdma_ctl
- Requisitos de cables y restricciones de topología de puertos en Mac Studio
- Emparejamiento de versiones de macOS en todos los nodos del clúster
- Resolución de problemas de descubrimiento RDMA y configuración DHCP
Implementación de modelos avanzados
- Uso del dashboard para cargar y fragmentar modelos DeepSeek v3.1, Qwen3-235B y la familia Llama
- Vista previa de ubicaciones de instancia con el punto final /instance/previews API
- Creación de instancias de modelos con segmentación por pipeline o tensor-parallel
- Configuración de tarjetas de modelo personalizadas desde el hub HuggingFace
Monitoreo y resolución de problemas
- Lectura de registros EXO y comprensión del rastreo distribuido
- Interpretación de la salud del clúster en la vista de clúster del dashboard
- Diagnóstico de fallos de nodos trabajadores y comportamiento de reconexión
- Uso de EXO_TRACING_ENABLED para análisis de cuellos de botella de rendimiento
Mantenimiento del clúster y actualizaciones
- Actualización de binarios EXO y procedimientos de reconstrucción del dashboard
- Migración de cachés de modelos y gestión de modelos pre-descargados sobre NFS
- Eliminación ordenada de nodos y reequilibrio de cargas de trabajo
Requerimientos
- Comprensión de los fundamentos de redes (IP, segmentación de subredes, firewalls)
- Experiencia con la administración de la línea de comandos de macOS o Linux
- Conocimiento sobre gestión de paquetes de Python (pip/uv) y herramientas de Node.js
Público objetivo
- Administradores de sistemas
- Ingenieros de DevOps
- Arquitectos de infraestructura de IA responsables del despliegue de LLM en instalaciones propias
21 Horas