Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 21 horas
Temario del curso
Introducción a la Escalabilidad de Ollama
- Arquitectura de Ollama y consideraciones de escalado
- Cuellos de botella comunes en implementaciones multiusuario
- Buenas prácticas para la preparación de la infraestructura
Asignación de Recursos y Optimización de GPU
- Estrategias eficientes para la utilización de CPU/GPU
- Consideraciones de memoria y ancho de banda
- Restricciones de recursos a nivel de contenedor
Implementación con Contenedores y Kubernetes
- Contenerización de Ollama con Docker
- Ejecución de Ollama en clústeres de Kubernetes
- Equilibrado de carga y descubrimiento de servicios
Escalado Automático y Agrupación (Batching)
- Diseño de políticas de escalado automático para Ollama
- Técnicas de inferencia por lotes para la optimización del rendimiento
- Compromisos entre latencia y rendimiento
Optimización de Latencia
- Perfiles de rendimiento de la inferencia
- Estrategias de caché y calentamiento de modelos
- Reducción de la sobrecarga de E/S y comunicaciones
Monitoreo y Observabilidad
- Integración de Prometheus para métricas
- Creación de tableros con Grafana
- Alertas y respuesta a incidentes para la infraestructura de Ollama
Gestión de Costos y Estrategias de Escalado
- Asignación de GPU consciente de costos
- Consideraciones sobre implementación en la nube frente a local (on-prem)
- Estrategias para un escalado sostenible
Resumen y Próximos Pasos
Requerimientos
- Experiencia en administración de sistemas Linux
- Comprensión de la contenerización y la orquestación
- Conocimiento sobre la implementación de modelos de aprendizaje automático
Público Objetivo
- Ingenieros DevOps
- Equipos de infraestructura de ML
- Ingenieros de fiabilidad de sitios (SRE)