Kubernetes autoscaling for AI inference in 2026: HPA vs KEDA vs external metrics
CPU-based autoscaling scales GPU inference too late. A 2026 config guide to HPA, KEDA, external metrics and Karpenter, with YAML for queue-depth and scale-to-zero scaling of LLM inference on Kubernetes.