About This Resource

A Kubernetes-native framework for distributed language model inference. It coordinates model serving components and request routing for deployments that span multiple compute resources.