Contenido avanzado

Linux en Producción ▶
Docker en Producción ▶
Podman en Producción ▶
Containerd en Producción ▶
01. Qué es containerd y su rol como runtime de bajo nivel 02. Arquitectura de containerd — núcleo y plugins 03. containerd vs Docker vs CRI-O — el panorama de runtimes 04. Instalación y configuración de containerd 05. Namespaces internos de containerd (distinto de namespaces de Linux) 06. Container Runtime Interface (CRI) — el contrato con Kubernetes 07. containerd como runtime de kubelet 08. crictl — CLI para depurar containerd vía CRI 09. Configuración de containerd para Kubernetes (config.toml) 10. Sandbox/pause container — cómo containerd gestiona Pods 11. ctr — CLI de bajo nivel de containerd 12. Pull y gestión de imágenes con containerd 13. Snapshotters — overlayfs y alternativas 14. Content store — almacenamiento de contenido de imágenes 15. Garbage collection de imágenes y contenido no usado 16. runc y la interfaz OCI Runtime 17. Runtimes alternativos — Kata Containers, gVisor (runsc) 18. RuntimeClass en Kubernetes — múltiples runtimes en el mismo cluster 19. Configuración de runtime seguro para cargas no confiables 20. Seccomp, AppArmor y containerd 21. Plugins de containerd — extensibilidad 22. Configuración de registries y mirrors 23. Métricas de containerd (Prometheus) 24. Troubleshooting con ctr y crictl 25. Logs y debugging de containerd 26. Actualización de containerd sin downtime de Pods 27. Rendimiento — tuning de containerd a gran escala 28. Migración de dockershim a containerd 29. containerd en entornos air-gapped 30. Proyecto final: runtime de contenedores completo con containerd listo para producción 📄 PDF completo
Velero en Producción ▶
Longhorn en Producción ▶
Kafka en Producción ▶

Inteligencia Artificial

MLOps en Producción ▶
LLMOps en Producción ▶
01. Qué es LLMOps y en qué se diferencia de MLOps clásico 02. Arquitectura de una aplicación LLM en producción 03. Elegir entre modelo propietario (API) vs modelo open-source autoalojado 04. Tokens, contexto y costos — unidades económicas de un LLM 05. Entornos: desarrollo, staging y producción para apps LLM 06. Prompt engineering — principios básicos 07. Versionado de prompts como código 08. Plantillas de prompts y variables dinámicas 09. Few-shot prompting y ejemplos en el prompt 10. Prompt injection — riesgos y mitigaciones 11. Qué es RAG y por qué se usa en producción 12. Embeddings y bases de datos vectoriales 13. Chunking — estrategias de división de documentos 14. Re-ranking y mejora de relevancia de recuperación 15. Actualización del índice — RAG con datos frescos 16. Evaluación de LLMs — métricas y desafíos 17. LLM-as-judge — usar un modelo para evaluar a otro 18. Datasets de evaluación (golden sets) 19. Testing de regresión para prompts y modelos 20. A/B testing de prompts y modelos en producción 21. Serving de LLMs — vLLM y motores de inferencia 22. Cuantización de modelos LLM 23. Streaming de respuestas — UX y arquitectura 24. Caching de respuestas y prompts 25. Fine-tuning vs prompting — cuándo usar cada uno 26. Observabilidad de aplicaciones LLM — tracing de llamadas 27. Guardrails — filtrado de contenido y validación de salidas 28. Gestión de costos a escala — rate limiting y budgets 29. Agentes LLM en producción — orquestación de herramientas 30. Proyecto final: plataforma LLMOps completa lista para producción 📄 PDF completo
Kubeflow en Producción ▶
GPUs en Kubernetes ▶
Ollama y LLMs Self-Hosted ▶
RAG en Producción ▶
01. Anatomía de un pipeline RAG en producción 02. Ingesta de documentos — fuentes y formatos 03. Parsers y extracción de contenido (PDF, HTML, Office) 04. Preprocesamiento y limpieza de texto 05. Metadata y enriquecimiento de fragmentos 06. Comparación de bases de datos vectoriales (Pinecone, Weaviate, Qdrant, pgvector) 07. Índices ANN — HNSW y IVF 08. Filtrado por metadata en búsquedas vectoriales 09. Namespaces y multi-tenancy en bases vectoriales 10. Escalado y sharding de índices vectoriales 11. Búsqueda híbrida — combinar vectorial y léxica (BM25) 12. Query expansion y reformulación de consultas 13. Recuperación multi-hop 14. Filtros de contexto y ventana de recuperación 15. Recuperación con múltiples índices (routing) 16. Construcción del prompt final con contexto recuperado 17. Manejo de contexto que no cabe en la ventana del modelo 18. Citas y trazabilidad de fuentes en la respuesta 19. Manejo de 'no sé' — evitar alucinaciones sin contexto suficiente 20. RAG conversacional — memoria y contexto multi-turno 21. Métricas de evaluación de RAG — faithfulness, relevance 22. RAGAS y frameworks de evaluación automatizada 23. Evaluación de la etapa de recuperación vs generación 24. Testing de regresión para sistemas RAG 25. Feedback de usuarios y mejora continua 26. RAG multi-modal — imágenes y tablas 27. Agentic RAG — recuperación como herramienta de un agente 28. Costos de un sistema RAG a escala 29. Seguridad — control de acceso a nivel de documento 30. Proyecto final: sistema RAG completo listo para producción 📄 PDF completo
Agentes de IA para DevOps ▶
01. Qué es un agente de IA y en qué se diferencia de un chatbot simple 02. El ciclo ReAct — razonar, actuar, observar 03. Tool calling — cómo un LLM invoca herramientas externas 04. Frameworks de agentes (LangGraph, CrewAI, AutoGen) 05. Model Context Protocol (MCP) — estandarizando el acceso a herramientas 06. Agentes que generan IaC (Terraform, Kubernetes manifests) 07. Agentes de troubleshooting — diagnóstico automatizado de incidentes 08. Agentes para análisis de logs y correlación de eventos 09. Agentes de capacity planning y optimización de costos 10. Riesgos de dar acceso de escritura a un agente sobre infraestructura real 11. Agentes de revisión de código (code review automatizado) 12. Agentes que generan y corrigen pipelines de CI/CD 13. Agentes para triage de fallos de build 14. Agentes de generación de tests automatizados 15. Integración de agentes con GitHub/GitLab (PRs, issues) 16. Arquitecturas multi-agente — por qué dividir tareas entre agentes 17. Patrones de orquestación — supervisor, pipeline, debate 18. Comunicación entre agentes 19. Delegación de tareas y especialización de agentes 20. Memoria compartida entre agentes de un mismo sistema 21. Principio de menor privilegio aplicado a agentes 22. Human-in-the-loop — aprobación antes de ejecutar acciones críticas 23. Sandboxing de acciones de un agente 24. Auditoría y logging de decisiones de un agente 25. Prevención de bucles infinitos y consumo descontrolado de recursos 26. Observabilidad de agentes — tracing de decisiones y herramientas invocadas 27. Evaluación de agentes — más allá de evaluar una única respuesta 28. Costos de ejecutar agentes con múltiples pasos e iteraciones 29. Casos de uso reales — cuándo un agente aporta valor real en DevOps 30. Proyecto final: plataforma de agentes de IA para DevOps lista para producción 📄 PDF completo
Observabilidad de IA ▶
01. Por qué la observabilidad tradicional no es suficiente para sistemas de IA 02. Los tres pilares aplicados a IA — logs, métricas y trazas 03. Qué hace única a la observabilidad de IA — calidad y semántica 04. OpenTelemetry y estandarización de trazas para IA 05. Arquitectura de un stack de observabilidad de IA 06. Trazas de extremo a extremo en una aplicación LLM/agente 07. Spans anidados — de la petición del usuario a cada llamada al modelo 08. Herramientas de tracing especializadas (LangSmith, Langfuse, Arize) 09. Correlación de trazas entre microservicios y llamadas al LLM 10. Sampling de trazas — qué capturar a gran escala 11. Métricas de negocio vs métricas técnicas en sistemas de IA 12. Monitoreo de calidad de respuesta en producción 13. Detección de drift de datos y de modelo en tiempo real 14. Métricas de seguridad — tasa de bloqueo de guardrails, intentos de jailbreak 15. Dashboards efectivos para sistemas de IA 16. Observabilidad de costos — tokens, llamadas, por usuario/feature 17. Atribución de costos en sistemas multi-modelo 18. Latencia — percentiles y su impacto en experiencia de usuario 19. Observabilidad de uso de GPU y recursos de inferencia 20. Presupuestos y alertas de costos 21. Definir alertas significativas para sistemas de IA 22. Detección de anomalías en el comportamiento del modelo 23. Runbooks para incidentes específicos de IA 24. On-call para sistemas de IA — qué es diferente 25. Post-mortems de incidentes de IA 26. Feedback humano como señal de observabilidad 27. Observabilidad para cumplimiento y auditoría (compliance) 28. Observabilidad multi-agente — visibilidad de sistemas complejos 29. Cultura de observabilidad — de reactivo a proactivo 30. Proyecto final: stack de observabilidad de IA completo listo para producción 📄 PDF completo
Seguridad en IA ▶
01. Por qué la IA introduce una superficie de ataque distinta al software tradicional 02. OWASP Top 10 para aplicaciones LLM 03. Modelado de amenazas para sistemas de IA 04. El ciclo de vida de ML y dónde puede introducirse cada riesgo 05. Diferencia entre seguridad DEL modelo y seguridad CON el modelo 06. Prompt injection avanzado — directo vs indirecto 07. Jailbreaking — técnicas y por qué funcionan 08. Ataques adversariales sobre modelos de clasificación/visión 09. Data poisoning — envenenamiento de datos de entrenamiento 10. Ataques de evasión en producción 11. Model inversion — reconstruir datos de entrenamiento 12. Membership inference — saber si un dato se usó para entrenar 13. Model extraction — robo del modelo mediante consultas 14. Fuga de PII en respuestas generadas 15. Técnicas de privacidad diferencial en ML 16. Arquitectura de defensa en capas para aplicaciones LLM 17. Filtrado de entrada — sanitización de prompts 18. Filtrado de salida — validación de respuestas antes de entregarlas 19. Guardrails basados en clasificadores vs basados en reglas 20. Rate limiting y throttling como defensa 21. Seguridad de la cadena de suministro de modelos (model supply chain) 22. Riesgos de modelos y datasets de terceros no verificados 23. Escaneo de vulnerabilidades en dependencias de ML 24. Seguridad de API keys y credenciales de modelos 25. Aislamiento y sandboxing de cargas de trabajo de inferencia 26. Red teaming de sistemas de IA 27. Detección de abuso y uso malicioso en producción 28. Respuesta a incidentes de seguridad específicos de IA 29. Cumplimiento normativo de seguridad de IA (EU AI Act, marcos regulatorios) 30. Proyecto final: postura de seguridad de IA completa lista para producción 📄 PDF completo
AIOps: IA para Operaciones de TI ▶
01. Qué es AIOps y qué problema resuelve en operaciones de TI modernas 02. AIOps vs monitoreo tradicional basado en umbrales 03. Las cuatro capacidades centrales de AIOps (correlación, anomalías, causa raíz, 04. Fuentes de datos para AIOps — métricas, logs, trazas, eventos, topología 05. Plataformas de AIOps — comerciales vs open source 06. El problema de la fatiga de alertas 07. Deduplicación y agrupación de alertas similares 08. Correlación de eventos basada en topología 09. Correlación temporal — eventos que ocurren juntos 10. Supresión inteligente de alertas durante incidentes conocidos 11. Detección de anomalías estadística vs basada en ML 12. Baselines dinámicos — aprender el comportamiento normal 13. Detección de anomalías estacionales (día/semana/mes) 14. Anomalías multivariadas — correlación entre varias métricas 15. Falsos positivos — el reto central de la detección de anomalías 16. Qué es el análisis de causa raíz (RCA) automatizado 17. Grafos de dependencia de servicios para RCA 18. Análisis de logs con NLP para encontrar la causa 19. Ranking de causas probables — priorizar hipótesis 20. Limitaciones del RCA automatizado — cuándo confiar y cuándo no 21. Mantenimiento predictivo de infraestructura 22. Forecasting de capacidad con series temporales 23. Predicción de fallos antes de que ocurran 24. Remediación automatizada — de la detección a la acción 25. Runbooks automatizados disparados por IA 26. Integración de AIOps con el stack de observabilidad existente 27. Entrenar modelos de AIOps con datos históricos de incidentes 28. Medir el éxito de una iniciativa de AIOps — métricas de impacto 29. Adopción organizacional — de reactivo a impulsado por IA 30. Proyecto final: plataforma de AIOps completa lista para producción 📄 PDF completo
IA en la Nube ▶
01. Por qué usar servicios de IA gestionados en la nube en vez de construir todo propio 02. Los tres grandes: AWS, Azure, GCP — panorama general de sus ofertas de IA 03. Modelos de servicio: IaaS, PaaS y modelos totalmente gestionados para IA 04. Elegir entre API gestionada vs infraestructura gestionada vs self-hosted 05. Vendor lock-in en IA — riesgos y mitigaciones 06. Amazon Bedrock — acceso gestionado a modelos fundacionales 07. Amazon SageMaker — plataforma de ML de extremo a extremo 08. SageMaker endpoints — despliegue de modelos para inferencia 09. AWS y GPUs — instancias EC2 para IA (P4, P5, Inferentia, Trainium) 10. Servicios de IA especializados de AWS (Textract, Transcribe, Rekognition) 11. Azure OpenAI Service — acceso gestionado a modelos de OpenAI 12. Azure Machine Learning — plataforma de ML de Microsoft 13. Azure AI Search — búsqueda vectorial e híbrida gestionada 14. Content Safety y guardrails nativos en Azure AI 15. Integración de Azure AI con el ecosistema Microsoft (Copilot, Power Platform) 16. Vertex AI — plataforma unificada de ML de Google Cloud 17. Modelos Gemini vía Vertex AI 18. Vertex AI Search y Vertex AI Agent Builder 19. TPUs — el hardware de IA propio de Google 20. Model Garden — catálogo de modelos en Vertex AI 21. Comparar el costo real entre proveedores para una misma carga de trabajo de IA 22. Abstracciones multi-cloud — LiteLLM y capas de compatibilidad 23. Latencia y ubicación de datos — elegir la región correcta 24. Bases de datos vectoriales gestionadas en la nube 25. Estrategias de failover entre proveedores de IA 26. Seguridad y cumplimiento de IA en la nube (IAM, VPC, cifrado) 27. Monitoreo y costos en servicios de IA gestionados 28. CI/CD para despliegues de IA en la nube 29. Casos de uso — cuándo cada proveedor tiene ventaja real 30. Proyecto final: arquitectura de IA en la nube completa lista para producción 📄 PDF completo
Python para IA ▶
01. Por qué Python domina el ecosistema de IA y ML 02. Entornos virtuales y gestión de dependencias para proyectos de IA 03. Jupyter Notebooks — desarrollo interactivo para IA 04. Tipado con type hints en código de IA 05. Gestores de paquetes modernos (uv, poetry) para proyectos de ML 06. Arrays de NumPy — la base de la computación numérica en Python 07. Broadcasting en NumPy 08. Operaciones vectorizadas vs bucles — por qué importa el rendimiento 09. Álgebra lineal con NumPy — vectores y matrices 10. Tipos de datos y precisión numérica en NumPy 11. DataFrames de Pandas — estructura central para datos tabulares 12. Limpieza y preprocesamiento de datos con Pandas 13. Agrupación y agregación de datos (groupby) 14. Combinar datasets — merge, join y concat 15. Series temporales con Pandas 16. Tensores de PyTorch — la estructura central de deep learning 17. Autograd — diferenciación automática en PyTorch 18. Construir una red neuronal simple con PyTorch 19. DataLoaders — alimentar datos al proceso de entrenamiento 20. Mover cómputo entre CPU y GPU con PyTorch 21. Consumir APIs de LLM desde Python — el patrón básico 22. Programación asíncrona en Python para llamadas a APIs de IA 23. Manejo de reintentos y rate limits en clientes de API 24. Streaming de respuestas con Python 25. Validación de datos con Pydantic para aplicaciones de IA 26. Testing de código que involucra modelos de IA 27. Logging y debugging de pipelines de IA en Python 28. Empaquetar un proyecto de IA para distribución 29. Reproducibilidad — semillas aleatorias y determinismo 30. Proyecto final: pipeline de IA en Python completo listo para producción 📄 PDF completo

Seguridad

Falco en Producción ▶
Trivy en Producción ▶
Kyverno en Producción ▶
01. Qué es Kyverno y comparación con OPA/Gatekeeper 02. Arquitectura de Kyverno — admission controller, background scanning 03. Instalación de Kyverno (Helm) 04. Tipos de políticas — validate, mutate, generate, verifyImages 05. ClusterPolicy vs Policy (namespaced) 06. Reglas de validación — sintaxis básica 07. Validación de labels y annotations obligatorios 08. Bloqueo de imágenes con tag 'latest' 09. Exigir resource limits en Pods 10. Validación con expresiones CEL 11. Políticas de mutación — inyección automática de configuración 12. Generación automática de recursos (NetworkPolicy por namespace) 13. Sincronización de recursos generados (generateExisting, sync) 14. Casos de uso de mutación — defaults seguros 15. Orden de ejecución — validate vs mutate vs generate 16. Verificación de firmas de imágenes (Cosign/Sigstore) 17. Verificación de SBOM y atestaciones 18. Políticas de Pod Security Standards con Kyverno 19. Bloqueo de registries no autorizados 20. Integración con Notation/Notary 21. Modos de política — Enforce vs Audit 22. Background scanning de recursos existentes 23. Exclusiones y excepciones (PolicyException) 24. Rendimiento del admission webhook 25. Reportes de políticas (PolicyReport) 26. Kyverno como reemplazo de OPA/Gatekeeper — migración 27. Gestión de políticas a escala (múltiples clusters con GitOps) 28. Testing de políticas antes de producción 29. RBAC y gobernanza de quién puede modificar políticas 30. Proyecto final: framework de políticas completo con Kyverno listo para producción 📄 PDF completo
Cert-manager en Producción ▶
Cilium en Producción ▶
Seguridad en IA ▶
01. Por qué la IA introduce una superficie de ataque distinta al software tradicional 02. OWASP Top 10 para aplicaciones LLM 03. Modelado de amenazas para sistemas de IA 04. El ciclo de vida de ML y dónde puede introducirse cada riesgo 05. Diferencia entre seguridad DEL modelo y seguridad CON el modelo 06. Prompt injection avanzado — directo vs indirecto 07. Jailbreaking — técnicas y por qué funcionan 08. Ataques adversariales sobre modelos de clasificación/visión 09. Data poisoning — envenenamiento de datos de entrenamiento 10. Ataques de evasión en producción 11. Model inversion — reconstruir datos de entrenamiento 12. Membership inference — saber si un dato se usó para entrenar 13. Model extraction — robo del modelo mediante consultas 14. Fuga de PII en respuestas generadas 15. Técnicas de privacidad diferencial en ML 16. Arquitectura de defensa en capas para aplicaciones LLM 17. Filtrado de entrada — sanitización de prompts 18. Filtrado de salida — validación de respuestas antes de entregarlas 19. Guardrails basados en clasificadores vs basados en reglas 20. Rate limiting y throttling como defensa 21. Seguridad de la cadena de suministro de modelos (model supply chain) 22. Riesgos de modelos y datasets de terceros no verificados 23. Escaneo de vulnerabilidades en dependencias de ML 24. Seguridad de API keys y credenciales de modelos 25. Aislamiento y sandboxing de cargas de trabajo de inferencia 26. Red teaming de sistemas de IA 27. Detección de abuso y uso malicioso en producción 28. Respuesta a incidentes de seguridad específicos de IA 29. Cumplimiento normativo de seguridad de IA (EU AI Act, marcos regulatorios) 30. Proyecto final: postura de seguridad de IA completa lista para producción 📄 PDF completo
Keycloak en Producción ▶
01. Qué es Keycloak y el problema de gestión de identidad que resuelve 02. Conceptos centrales: Realms, Clients, Users, Roles 03. OAuth2 y OpenID Connect — los protocolos detrás de Keycloak 04. Instalación de Keycloak en modo producción 05. Keycloak vs otras soluciones de IAM (Auth0, Okta, Cognito) 06. Creación y configuración de un Realm 07. Tipos de Clients — confidential vs public 08. Flujos de autenticación (Authorization Code, Client Credentials) 09. Configuración de redirect URIs y seguridad de clients 10. Client scopes y mappers 11. Gestión de usuarios — creación, atributos, credenciales 12. Roles — realm roles vs client roles 13. Grupos y herencia de roles 14. Federación de identidad — LDAP y Active Directory 15. Identity brokering — login con proveedores externos (Google, GitHub) 16. Access tokens, refresh tokens e ID tokens 17. Estructura de un JWT y cómo validarlo 18. Tiempo de vida de tokens y rotación 19. Token introspection y revocación 20. Fine-grained authorization — políticas y permisos 21. Proteger una API backend con Keycloak 22. Integración con aplicaciones frontend (SPA) 23. Adaptadores de Keycloak vs librerías estándar OIDC 24. Single Sign-On (SSO) entre múltiples aplicaciones 25. Single Logout (SLO) y gestión de sesiones 26. Alta disponibilidad de Keycloak — clustering 27. Keycloak en Kubernetes 28. Backup y disaster recovery de Keycloak 29. Monitoreo y auditoría de eventos de Keycloak 30. Proyecto final: plataforma de identidad con Keycloak lista para producción 📄 PDF completo

Orquestación

Kubernetes en Producción ▶
Nomad en Producción ▶
Docker Swarm en Producción ▶
OpenShift en Producción ▶
Rancher en Producción ▶
01. Qué es Rancher y gestión multi-cluster 02. Arquitectura — management cluster, downstream clusters, agents 03. Instalación de Rancher (Helm, Docker) 04. RKE2 vs K3s vs clusters importados — qué gestiona Rancher 05. Rancher UI — dashboard y navegación 06. Creación de clusters con RKE2 desde Rancher 07. Importar clusters existentes (EKS, GKE, AKS) 08. Node pools y node templates 09. Actualización de versión de Kubernetes vía Rancher 10. Cluster Tools — monitoring, logging, alerting integrados 11. Rancher Authentication — Local, LDAP, SAML, OIDC 12. RBAC en Rancher — roles globales, de cluster, de proyecto 13. Projects — agrupación de namespaces 14. Pod Security en Rancher (PSA integration) 15. Cluster/Project Templates para estandarizar 16. Qué es Fleet y su relación con Rancher 17. GitRepo — despliegue declarativo desde Git 18. Fleet targets — seleccionar clusters por label 19. Bundles y BundleDeployments 20. Fleet vs ArgoCD/Flux — cuándo usar cada uno 21. Rancher App Catalog — Helm charts curados 22. Instalación de apps desde el catálogo 23. Repositorios de Helm personalizados en Rancher 24. Rancher Extensions — UI plugins 25. Backup y restore con Rancher Backup Operator 26. Alta disponibilidad de Rancher (HA install) 27. Actualización de Rancher sin downtime 28. Monitoreo de Rancher con Prometheus integrado 29. Troubleshooting de clusters downstream 30. Proyecto final: plataforma multi-cluster completa con Rancher lista para producción 📄 PDF completo
EKS en Producción ▶
GKE en Producción ▶
Azure en Producción ▶

Redes

Istio en Producción ▶
Service Mesh en Producción ▶
01. Qué es un service mesh — conceptos generales 02. Cuándo SÍ necesitas un service mesh (y cuándo no) 03. Comparativa: Istio vs Linkerd vs Consul Connect vs Cilium 04. Sidecar-based vs sidecar-less (eBPF) — modelos arquitectónicos 05. Service Mesh Interface (SMI) — estandarización 06. Arquitectura de Linkerd — linkerd2-proxy (Rust) 07. Instalación y onboarding de Linkerd 08. mTLS automático en Linkerd 09. Traffic split y canary con Linkerd 10. Linkerd viz — observabilidad integrada 11. Arquitectura de Consul Connect 12. Consul Connect — service discovery multi-datacenter 13. Cilium Service Mesh — eBPF sin sidecar 14. Cilium — Network Policies avanzadas con eBPF 15. Comparativa de rendimiento: sidecar vs sidecar-less 16. Mesh y arquitectura de microservicios — buenas prácticas 17. API Gateway vs Service Mesh — dónde termina uno y empieza el otro 18. Service mesh y Kubernetes Gateway API 19. Zero-trust networking con service mesh 20. Mesh expansion — VMs fuera de Kubernetes 21. Migración entre implementaciones de service mesh 22. Mesh federation — múltiples meshes interconectados 23. Coexistencia de múltiples meshes en un mismo cluster 24. Adopción incremental — servicio por servicio 25. Evaluación de madurez de un mesh en producción 26. Costo total de propiedad (TCO) de un service mesh 27. Equipo y gobernanza de una plataforma de mesh 28. Señales de que tu mesh necesita rediseño 29. Roadmap de adopción de service mesh en una organización 30. Proyecto final: elegir y justificar la estrategia de service mesh para una organización 📄 PDF completo
Consul en Producción ▶
Flannel en Producción ▶
01. El problema de networking que resuelve Flannel en Kubernetes 02. Qué es CNI y dónde encaja Flannel 03. Modelo de red de Kubernetes — requisitos que Flannel debe cumplir 04. Arquitectura de Flannel — flanneld y el subnet lease 05. Flannel vs otros plugins CNI (Calico, Cilium, Weave) 06. Qué es una red overlay y por qué Flannel la usa 07. Backend VXLAN — el backend por defecto 08. Backend host-gw — rendimiento sin encapsulación 09. Backend UDP — el backend original (y por qué evitarlo) 10. Elegir el backend apropiado según el entorno 11. Instalación de Flannel en un cluster de Kubernetes 12. El ConfigMap de configuración de Flannel 13. Asignación de subredes por nodo 14. Integración de Flannel con etcd o el almacén de Kubernetes 15. Flannel con kubeadm — configuración típica 16. Cómo viaja un paquete entre Pods de distintos nodos con VXLAN 17. MTU y fragmentación de paquetes con overlay networking 18. Rutas y la tabla de rutas que Flannel configura 19. Flanneld — logs y diagnóstico del daemon 20. Interacción de Flannel con iptables y kube-proxy 21. Diagnóstico de conectividad Pod-a-Pod fallida con Flannel 22. Problemas comunes de MTU y su solución 23. Qué NO resuelve Flannel — ausencia de NetworkPolicy 24. Combinar Flannel con Calico solo para NetworkPolicy (Canal) 25. Limitaciones de escalabilidad de Flannel en clusters grandes 26. Seguridad de red con Flannel — qué cubre y qué no 27. Monitoreo de la red de Flannel 28. Migración desde Flannel hacia otro CNI 29. Cuándo Flannel es la elección correcta para producción 30. Proyecto final: red de cluster con Flannel lista para producción 📄 PDF completo
Calico ▶

Automatización

Ansible en Producción ▶
Python en Producción ▶
Terraform en Producción ▶
Pulumi en Producción ▶
01. Qué es Pulumi y el enfoque de IaC con lenguajes reales 02. Arquitectura — engine, providers, state 03. Instalación y primer proyecto Pulumi 04. Pulumi vs Terraform — diferencias de enfoque 05. Lenguajes soportados — elegir el SDK adecuado 06. Recursos — declaración y ciclo de vida 07. Inputs y Outputs — el modelo asíncrono de Pulumi 08. Stacks — entornos múltiples de un mismo proyecto 09. Configuración y secretos por stack 10. Dependencias entre recursos — explícitas e implícitas 11. Component Resources — encapsular infraestructura reutilizable 12. ComponentResource vs recursos nativos del provider 13. Pulumi Packages — publicar componentes reutilizables 14. Programación real — loops, condicionales, funciones 15. Testing de infraestructura (unit tests con el SDK) 16. Pulumi Service backend — state gestionado 17. Self-managed backends — S3, Azure Blob, GCS 18. Locking de state y concurrencia 19. Import de recursos existentes 20. Refresh y detección de drift 21. Pulumi en pipelines de CI/CD 22. Pulumi Deployments — CI/CD gestionado nativo 23. Políticas con CrossGuard (Policy as Code) 24. Automation API — Pulumi programático 25. Preview y diff antes de aplicar cambios 26. Gestión de múltiples clouds con un solo proyecto 27. RBAC y equipos en Pulumi Service 28. Migración de Terraform a Pulumi 29. Rendimiento — paralelismo y optimización de despliegues grandes 30. Proyecto final: infraestructura completa con Pulumi lista para producción 📄 PDF completo
Kustomize en Producción ▶
01. Qué es Kustomize y el enfoque template-free 02. kustomization.yaml — estructura básica 03. Instalación y uso (kubectl -k, standalone binary) 04. Bases y overlays — el patrón fundamental 05. Kustomize vs Helm — cuándo usar cada uno 06. commonLabels y commonAnnotations 07. namePrefix y nameSuffix 08. namespace transformer 09. images — sobrescritura de tags de imagen 10. replicas — ajuste de réplicas por overlay 11. strategicMergePatch — fundamentos 12. JSONPatch (RFC 6902) — patches precisos 13. patchesStrategicMerge vs patches (sintaxis moderna) 14. Patches condicionales por target (labelSelector, annotationSelector) 15. Inline patches vs patches en archivos separados 16. ConfigMapGenerator — generación de ConfigMaps 17. SecretGenerator — generación de Secrets 18. Opciones de generadores — disableNameSuffixHash 19. Generadores desde archivos externos (envs, files) 20. Generadores personalizados (KRM functions) 21. Estructura de directorios recomendada (base/overlays) 22. Components — piezas reutilizables entre overlays 23. Remote bases — referenciar bases desde un repositorio Git 24. Composición de múltiples bases 25. Validación de manifiestos generados (kustomize build | kubectl apply --dry-run) 26. Kustomize con ArgoCD/Flux (GitOps) 27. Gestión de secretos con Kustomize (SOPS, Sealed Secrets) 28. Testing de overlays antes de aplicar 29. Migración de Helm a Kustomize (o combinación de ambos) 30. Proyecto final: estructura de despliegue multi-entorno completa con Kustomize lista para producción 📄 PDF completo
CI/CD en Producción ▶
Jenkins en Producción ▶
GitHub en Producción ▶
Bitbucket en Producción ▶
ArgoCD en Producción ▶
Flux en Producción ▶
01. Qué es Flux y el modelo GitOps Toolkit 02. Arquitectura — controllers especializados (source, kustomize, helm, notification) 03. Instalación de Flux (flux bootstrap) 04. Flux CLI — comandos fundamentales 05. Flux vs ArgoCD — diferencias de enfoque 06. GitRepository — fuente desde Git 07. HelmRepository — fuente desde repositorios Helm 08. OCIRepository — fuente desde registries OCI 09. Bucket — fuente desde object storage 10. Autenticación de sources (SSH, tokens, credenciales) 11. Kustomization CRD — aplicar manifiestos desde un source 12. HelmRelease — gestión de Helm charts 13. Dependencias entre Kustomizations 14. Intervalos de reconciliación y drift detection 15. Health checks y readiness en Kustomizations 16. Patrón de repositorios — monorepo vs multi-repo 17. Estructura recomendada (clusters/, infrastructure/, apps/) 18. Multi-tenancy con Flux — tenants aislados 19. Promoción entre entornos (dev → staging → prod) 20. Flux y Kustomize — integración nativa 21. Image Reflector Controller — escaneo de nuevas versiones 22. Image Automation Controller — actualización automática de tags 23. Políticas de selección de imágenes (semver, alfabético) 24. Notification Controller — alertas hacia Slack/Teams 25. Webhooks — receivers para triggers externos 26. RBAC y seguridad en Flux 27. Troubleshooting de reconciliación fallida 28. Monitoreo de Flux con Prometheus/Grafana 29. Actualización de Flux sin downtime 30. Proyecto final: plataforma GitOps completa con Flux lista para producción 📄 PDF completo
Artifactory en Producción ▶

Observabilidad

Monitorización en Producción ▶
Elasticsearch en Producción ▶
Loki en Producción ▶
Grafana Alloy en Producción ▶
01. Qué es Grafana Alloy y su rol como colector unificado 02. Arquitectura de componentes — el modelo de pipeline de Alloy 03. Alloy configuration language (River/HCL-like syntax) 04. Instalación de Alloy (binario, Helm, Docker) 05. Alloy vs Grafana Agent vs OpenTelemetry Collector 06. Componentes prometheus.scrape y discovery 07. Relabeling en Alloy 08. Remote write hacia Prometheus/Mimir 09. Recolección de métricas de Kubernetes con Alloy 10. Componentes de procesamiento (prometheus.relabel, prometheus.remote_write) 11. Componentes loki.source — recolección de logs 12. Pipelines de procesamiento de logs (loki.process) 13. Envío de logs hacia Loki (loki.write) 14. Migración de configuración de Promtail a Alloy 15. Recolección de logs de Kubernetes con Alloy 16. Componentes OTel — otelcol.receiver, otelcol.processor 17. Recolección de trazas distribuidas con Alloy 18. Exportación hacia Tempo 19. Correlación de logs, métricas y trazas (LGTM stack) 20. Alloy como Collector OpenTelemetry nativo 21. Clustering de Alloy — modo distribuido 22. Escalado horizontal y balanceo de carga de recolección 23. Alta disponibilidad de Alloy 24. Monitoreo del propio Alloy (self-monitoring) 25. Troubleshooting de pipelines de Alloy 26. Gestión de secretos en configuración de Alloy 27. Despliegue de Alloy con GitOps 28. Migración completa desde stack legacy a Alloy 29. Rendimiento y tuning de componentes 30. Proyecto final: pipeline de observabilidad completo con Grafana Alloy 📄 PDF completo

Conviértete en DevOps Engineer

Ver los cursos
AWS Azure GCP Docker Kubernetes Terraform Ansible GitHub Rancher Kafka

Cursos

Empezamos por las bases. Cada curso está pensado para practicar.

{ py }
Disponible ahora

Python desde cero

Curso de fundamentos para dar tus primeros pasos en programación: variables, estructuras de control, funciones y clases — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 8 lecciones interactivas
Empezar el curso
⚙️
Disponible ahora

Ansible desde cero

Fundamentos de Ansible: arquitectura sin agentes, inventario, comandos ad-hoc, playbooks, variables y facts, handlers, roles y Ansible Vault — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 8 lecciones interactivas
Empezar el curso
🌍
Disponible ahora

Terraform desde cero

Fundamentos de Terraform: infraestructura como código, providers y recursos, variables y outputs, state, plan/apply, módulos y workspaces — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 8 lecciones interactivas
Empezar el curso
🐳
Disponible ahora

Docker desde cero

Fundamentos de Docker: contenedores, imágenes, Dockerfile, docker build, volúmenes, redes/puertos y Docker Compose — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 8 lecciones interactivas
Empezar el curso
$ _
Disponible ahora

Terminal & Linux básico

Fundamentos de la terminal: navegación, archivos, permisos, procesos, redirección, variables de entorno y usuarios — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 8 lecciones interactivas
Empezar el curso
{ k8s }
Disponible ahora

Kubernetes desde cero

Fundamentos de Kubernetes: Pods, kubectl, Deployments, Services, ConfigMaps, volúmenes, namespaces y manifiestos YAML — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 8 lecciones interactivas
Empezar el curso
{ git }
Disponible ahora

GitHub desde cero

Fundamentos de Git y GitHub: commits, branches, merge, pull requests, .gitignore y comandos avanzados — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 9 lecciones interactivas
Empezar el curso
↻
Disponible ahora

CI/CD desde cero

Integración y entrega continua: GitHub Actions, Jenkins, Jenkinsfile, build y test automatizado, deploy automático y buenas prácticas — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 9 lecciones interactivas
Empezar el curso
◉
Disponible ahora

Monitoreo y Observabilidad desde cero

Prometheus, PromQL, exporters, Grafana, paneles, alertas y logs — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 9 lecciones interactivas
Empezar el curso
{ aws }
Disponible ahora

AWS desde cero

IAM, EC2, S3, VPC, Security Groups, RDS y CloudWatch — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 9 lecciones interactivas
Empezar el curso
{ az }
Disponible ahora

Azure desde cero

Azure AD, Máquinas Virtuales, Storage, VNet, Network Security Groups, Azure SQL y Azure Monitor — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 9 lecciones interactivas
Empezar el curso
{ gcp }
Disponible ahora

Google Cloud desde cero

IAM, Compute Engine, Cloud Storage, VPC, Firewall rules, Cloud SQL y Cloud Monitoring — con ejercicios prácticos en cada lección.

▸ Nivel: Principiante ▸ 9 lecciones interactivas
Empezar el curso