39 artículos publicados
CNCF comparte su experiencia migrando su pipeline de métricas de gostatsd a OpenTelemetry, explicando las motivaciones y proceso de esta transición. El artículo documenta cómo modernizar infraestructura de observabilidad en sistemas a gran escala, adoptando el estándar abierto de OpenTelemetry para estandarizar la recopilación de métricas.
Se ha descubierto una vulnerabilidad crítica (CVE-2026-85706) con puntuación CVSS 10 en las APIs de Commits y Repository Files de GitLab Community y Enterprise Edition que permite a atacantes no autenticados leer archivos arbitrarios del servidor. La falla está siendo explotada activamente en la naturaleza y afecta a millones de desarrolladores que utilizan GitLab para gestionar sus repositorios.
Kubernetes v1.37 introduce características de seguridad de almacenamiento críticas: modos de permisos para emptyDir y opciones de bind mount. Estas capacidades permiten a desarrolladores e ingenieros de seguridad implementar políticas rigurosas directamente en Kubernetes, como prohibir la eliminación de archivos entre contenedores o la ejecución de binarios arbitrarios desde volúmenes escribibles, sin necesidad de soluciones complicadas.
OpenBao, el fork de código abierto de HashiCorp Vault mantenido por la Linux Foundation, se integra perfectamente con CloudNativePG para gestionar secretos de infraestructura en Kubernetes de forma independiente del proveedor. Esta combinación proporciona un sistema auto-sanador y sin dependencias de vendor lock-in para la administración segura de credenciales.
Kubernetes v1.37 promueve la característica Pod-Level Resource Managers a estado Beta, permitiendo que el Kubelet tome decisiones de asignación de hardware basadas en declaraciones de recursos a nivel de pod. Esta mejora resuelve el dilema entre asignar recursos exclusivos NUMA-aligned a todos los contenedores o renunciar completamente al alineamiento NUMA, habilitando modelos de asignación híbrida para cargas de trabajo modernas con sidecars ligeros.
Kubernetes v1.37 promociona Memory QoS a Beta, habilitándolo por defecto en nodos Linux con cgroup v2. La característica permite al kernel gestionar mejor la memoria de los contenedores mediante la configuración de parámetros como memory.high y memory.low. Los operadores de clusters pueden controlar el comportamiento mediante nuevos campos de configuración del kubelet sin riesgo, ya que por defecto no se aplica throttling ni reserva de memoria.
Changed Block Tracking (CBT) para controladores CSI en Kubernetes ha pasado de Alpha a Beta con el lanzamiento de v1.0.0 del proyecto external-snapshot-metadata en marzo de 2026. La principal novedad es la promoción de SnapshotMetadataService CRD de v1alpha1 a v1beta1, requiriendo actualización de manifiestos y código cliente, con soporte mínimo para Kubernetes 1.33 y CSI spec 1.10.
Se lanza Cilium 1.20, la segunda versión mayor del año 2026, con mejoras significativas en Gateway API, soporte para TCPRoute/UDPRoute, y IPAM de ENI para IPv6. Esta versión consolida la madurez de Cilium como solución de networking y seguridad en entornos Kubernetes de producción.
Kubernetes v1.37 ha graduado el soporte de histogramas nativos de Prometheus a fase Beta, habilitándolo por defecto. Esta característica proporciona observabilidad de alta resolución y baja cardinalidad para métricas de latencia y duración, reduciendo significativamente el almacenamiento de telemetría y la sobrecarga de scraping comparado con los histogramas clásicos.
El artículo analiza cómo los equipos de plataforma necesitan adaptar su infraestructura para soportar cargas de trabajo de IA distribuida, más allá de simplemente provisionar GPUs. Explora los cuellos de botella que emergen cuando el entrenamiento se extiende a múltiples nodos en un cluster.
Kubernetes v1.37 introduce en fase Alpha un mecanismo de desalojo de workloads de menor prioridad para liberar recursos en nodos saturados, permitiendo que los Pods de mayor prioridad que solicitan escalado dinámico de CPU y memoria completen sus redimensionamientos in-place. Esta característica cierra una brecha crítica en la asignación de recursos que existía desde la adopción del redimensionamiento in-place en v1.35.
La CNCF publica una guía práctica sobre recuperación ante desastres en Kubernetes que va más allá de tener simples copias de seguridad. El documento presenta tres escenarios de fallo reproducibles en un portátil, con orientación específica derivada de cada caso de uso.
Kubernetes 1.37 introduce cinco nuevas condiciones de nodo estándar (DrainInProgress, Drained, MaintenancePlanned, MaintenanceInProgress, GracefulNodeShutdownInProgress) para describir de forma unificada el estado del ciclo de vida de los nodos durante drenaje, mantenimiento y apagado graceful. Esta adición estandariza la forma en que los administradores pueden monitorear y gestionar operaciones de mantenimiento en el cluster.
Un análisis sobre cómo gestionar y monitorizar el uso de GPUs en entornos Kubernetes multiusuario, abordando la transparencia de costos y la asignación de recursos. El artículo explora soluciones para proporcionar métricas seguras y autoservicio que permitan a los equipos entender y optimizar su consumo de infraestructura GPU.
Kubernetes v1.37 marca un hito importante en la evolución del planificador de cargas de trabajo con la graduación a Beta de las APIs Workload y PodGroup, permitiendo gang scheduling avanzado. La versión introduce la nueva API CompositePodGroup para expresar restricciones topológicas multinivel y políticas de preemption en grupos complejos de Pods, nativa para workloads como JobSet y LeaderWorkerSet. Se añaden nuevas APIs de integración de controladores y la librería workloadbuilder para simplificar la adopción en extensiones out-of-tree.
El artículo aborda cómo obtener visibilidad en GitHub Actions sin modificar los archivos de workflow, permitiendo identificar cuellos de botella como trabajos lentos, inestables o en cola. Una solución práctica para organizaciones que enfrentan el crecimiento descontrolado de acciones y necesitan monitoreo efectivo de sus pipelines de integración continua.
Karmada, el proyecto de orquestación Kubernetes multi-clúster y multi-nube, ha alcanzado madurez de producción en la CNCF. Este hito es significativo para empresas globales que escalan entrenamiento e inferencia de IA en infraestructuras híbridas y distribuidas.
China Merchants Bank ganó un concurso de caso de uso de CNCF al desarrollar una plataforma cloud native que unifica el entrenamiento e inferencia de IA en Kubernetes. La solución aumentó la utilización promedio de aceleradores de computación del 35% a más del 60% y redujo el costo de inferencia por millón de tokens en más del 60%.
La administración federal suiza está reemplazando sistemas operativos Microsoft en aproximadamente 3.000 equipos, marcando un movimiento significativo hacia alternativas de código abierto a nivel gubernamental. Esta iniciativa refleja las tendencias globales de soberanía digital y reducción de dependencia de proveedores tecnológicos estadounidenses en infraestructuras críticas.
Kubernetes v1.37 promueve la característica KubeletInUserNamespace a fase beta, permitiendo que todos los componentes del nodo (kubelet, runtimes CRI y OCI, plugins CNI y kube-proxy) se ejecuten como usuario no privilegiado utilizando espacios de nombres de usuario de Linux. Esta mejora de seguridad, que comenzó como experimento en 2018, mitiga vulnerabilidades históricas de escape de contenedores que podrían comprometer privilegios root en el host.
El artículo examina cómo Kubernetes, aunque es una tecnología consolidada, presenta nuevos desafíos y complejidades en el contexto de las cargas de trabajo de IA. Aunque muchos equipos ya han adoptado Kubernetes como base de producción, la integración con sistemas de IA modernos renueva la sensación de intimidación inicial.
El artículo analiza cómo las cargas de trabajo de IA en producción requieren una infraestructura heterogénea que va más allá de GPUs, integrando CPUs y otros componentes. La ingeniería de plataformas de IA debe considerar el flujo completo de datos y procesamiento, no solo la aceleración de modelos.
Kubernetes 1.37 marca un hito importante con la graduación a GA de Dynamic Resource Allocation (DRA) Extended Resource support, permitiendo a los drivers DRA satisfacer solicitudes de recursos tradicionales sin requerir plugins de dispositivos adicionales. La versión incluye también mejoras en el estado de ResourceClaims con datos de interfaz de red estandarizados, facilitando la adopción gradual de DRA en clústeres existentes sin modificar cargas de trabajo actuales.
Una nueva técnica permite multiplexar aproximadamente 250 sesiones de agentes con estado en ocho Pods de Kubernetes, manteniendo intactos sus estados en memoria y sistema de archivos. El repositorio demuestra una sobresubscripción de 30x+ entre actores y workers, mejorando significativamente la eficiencia de recursos en aplicaciones de IA escalables.
El artículo presenta cinco contenedores Docker que permiten reemplazar herramientas en línea de terceros por soluciones autoalojadas y controladas localmente. Esta aproximación mejora la privacidad y la confiabilidad al transformar utilidades desechables en aplicaciones permanentes que el usuario gestiona completamente.
Artículo que aborda la migración de deployments desde el namespace por defecto en Kubernetes, un problema común en la gestión de clusters. Proporciona estrategias y mejores prácticas para realizar esta operación de forma segura sin interrumpir los servicios en producción.
AWS presenta una solución integrada para automatizar el ciclo completo de experimentación en equipos de desarrollo, reduciendo la complejidad y los costos asociados con pruebas continuas. La plataforma combina Kiro, el agente DevOps de AWS y LaunchDarkly para acelerar la iteración, medición y validación de cambios contra comportamiento real de usuarios.
AWS presenta una solución para automatizar completamente las actualizaciones de versiones de servicios gestionados utilizando AWS DevOps Agent y Kiro. El flujo detecta eventos de fin de soporte, valida rutas de actualización, aplica cambios de código y genera pull requests para revisión humana.
Kubernetes v1.37 introduce soporte nativo para escalar cargas de trabajo hasta cero réplicas mediante HorizontalPodAutoscaler, ahora en Beta y habilitado por defecto. Esta característica, anteriormente disponible solo como componente externo o mediante feature gates Alpha, permite optimizar costos eliminando Pods inactivos en trabajos como consumidores de colas y procesadores batch que usan recursos costosos como CPUs o GPUs dedicadas.
Un análisis crítico sobre cómo la IA está generando más código del que los equipos pueden revisar realísticamente, cuestionando si automatizar la revisión de código eliminaría beneficios menos obvios como el aprendizaje en equipo y la transferencia de conocimiento. El artículo argumenta que el problema no es que la IA haya roto el proceso de revisión, sino que posiblemente hemos estado usando la revisión de código para resolver los problemas equivocados.
El artículo explora la integración entre Metal3 y KubeVirtBMC, que permite gestionar máquinas virtuales de KubeVirt utilizando las mismas herramientas y flujos de trabajo que se emplean para servidores bare metal. Esta combinación amplía significativamente las capacidades de orquestación de infraestructura en entornos Kubernetes.
Kubernetes v1.37 introduce RangeStream en beta, una característica de etcd v3.7 que reduce significativamente el uso de memoria del servidor API al leer grandes colecciones de objetos. La función divide las respuestas en chunks transmitidos por streaming en lugar de ensamblar la página completa en memoria, mejorando la previsibilidad del consumo y evitando problemas de OOM en operaciones concurrentes.
El artículo analiza las distintas etapas de madurez en platform engineering, desde equipos sin plataforma formal hasta soluciones de autoservicio consolidadas. Explora cómo las organizaciones evolucionan desde scripts dispersos y conocimiento tribal hacia plataformas escalables que empoderan a los equipos de desarrollo.
Kubernetes v1.37 marca la disponibilidad general de Storage Version Migration (SVM), una característica que resuelve el problema de mantener recursos con esquemas de almacenamiento obsoletos. Esta API permite migrar automáticamente recursos a versiones de almacenamiento más nuevas sin interferencia manual, facilitando la depreciación segura de versiones antiguas de APIs en clusters Kubernetes.
OpenTelemetry ha logrado oficialmente el estado de proyecto graduado en la Cloud Native Computing Foundation, equiparándose con proyectos de renombre como Kubernetes y Prometheus. Este hito representa una validación importante para la plataforma de observabilidad y marca un nuevo capítulo en su desarrollo y adopción en la comunidad cloud-native.
El artículo aborda los desafíos de observabilidad en Kubernetes, donde la naturaleza dinámica de los workloads y la complejidad de las dependencias hacen difícil entender los sistemas en producción. Se explora cómo pasar de simples métricas a una comprensión profunda del comportamiento de aplicaciones distribuidas en clusters de Kubernetes.
AWS presenta una solución para automatizar la gestión de fallos en Amazon EKS mediante agentes que recopilan automáticamente logs de pods, eventos y métricas de nodos. Esta herramienta reduce significativamente el tiempo de respuesta ante incidentes (MTTR) y elimina la necesidad de depuración manual, especialmente crítica cuando los pods se eliminan o los nodos fallan.
Kubernetes 1.37 lanza a disponibilidad general una nueva tecnología de identidad de producción que integra emisión de certificados X.509 directamente en el núcleo de Kubernetes. Pod Certificates y Cluster Trust Bundles complementan los tradicionales JWT de cuentas de servicio, permitiendo TLS y mTLS nativos para autenticación segura entre cargas de trabajo.
Artículo sobre técnicas de autoescalado predictivo para cargas de trabajo GPU en Kubernetes, basado en un caso real de incident postmortem donde un servicio crítico colapsó por falta de escalado anticipado. La solución propone anticiparse a los picos de tráfico mediante predicción para evitar degradación de servicio y errores en producción.