KServe Deep Dive: Evolving Model Serving for the Generative AI Era
Yuan Tang
Senior Principal Software Engineer, Red Hat AI
Project Lead: KServe, Argo, and Kubeflow
Co-chair: K8s WG Serving and WG AI Conformance
Co-chair: CNCF TAG Workloads Foundation
Agenda
01
02
03
04
05
What is KServe
History
Open Source Community
Architecture
Key Features
What is KServe?
Highly scalable, standard, cloud agnostic model inference platform on Kubernetes
Why KServe?
Provides performant, standardized inference protocol across ML frameworks.
Supports modern serverless inference workload with autoscaling including Scale to Zero on GPU.
Provides high scalability, density packing and intelligent routing using ModelMesh
Simple and pluggable production serving for production ML serving including prediction, pre/post processing, monitoring and explainability.
Advanced deployments with canary rollout, experiments, ensembles and transformers.
GenAI capabilities: Envoy AI Gateway, KEDA, LMCache. Model Cache, vLLM multi-node inference
4
#IBMTechXchange
History of KServe
5
From Kubeflow/KFServing to KServe
#IBMTechXchange
History of KServe
6
Kubeflow Ecosystem
#IBMTechXchange
Community: Maintainers and Contributors
7
19 maintainers and 300+ contributors!
#IBMTechXchange
Community: Adopters
8
30+ companies varying from vendors to end users!
#IBMTechXchange
KServe Architecture
9
#IBMTechXchange
KServe Feature: Serving Runtimes
10
Pluggable, reusable, extensible runtimes
#IBMTechXchange
KServe Feature: Serving Runtimes
11
Hugging Face runtime
#IBMTechXchange
KServe Feature: Serving Runtimes
12
Custom runtime:
Predictor definition
#IBMTechXchange
KServe Feature: Serving Runtimes
13
Custom runtime:
InferenceService
#IBMTechXchange
KServe Feature: Pre/Post Processing
14
Transforms image via torchvision
#IBMTechXchange
KServe Feature: Pre/Post Processing
15
v1 REST API
#IBMTechXchange
KServe Feature: Pre/Post Processing
16
v2 gRPC API
#IBMTechXchange
KServe Feature: Inference Graph
17
TBA
#IBMTechXchange
KServe Feature: Model Storage
18
Supported storage formats
#IBMTechXchange
KServe Feature: Model Storage
19
PVC example
#IBMTechXchange
KServe Feature: Model Storage
20
S3 example
#IBMTechXchange
KServe Feature: Model Storage - ModelCars
21
Efficient model pulling from OCI image registry
#IBMTechXchange
KServe Feature: Model Storage - ModelCars
22
#IBMTechXchange
KServe Feature: Model Storage - ModelCars
23
Build Image with Model
Specify StorageURI
#IBMTechXchange
KServe Feature: Model Storage
24
Custom Storage Initializer
#IBMTechXchange
KServe Feature: Model Storage
25
ClusterStorageContainer
Custom container spec for a list of supported URI formats
#IBMTechXchange
KServe Feature: Model Storage
26
Custom model-registry:// protocol
#IBMTechXchange
KServe Feature: Request Batching
27
#IBMTechXchange
KServe Feature: Autoscaling
28
Knative autoscaling
#IBMTechXchange
KServe Feature: Autoscaling
29
Send traffic in 30 seconds spurts maintaining 5 in-flight requests
hey -z 30s -c 5 …
#IBMTechXchange
KServe Feature: Autoscaling
30
Scale down to zero
#IBMTechXchange
KServe Feature: Explainer / TrustyAI
31
Pluggable explainer runtimes
“Why did my model produce this inference result?”
#IBMTechXchange
KServe Feature: Monitoring
32
Prometheus Metrics
Supported serving runtimes exports prometheus metrics on a specified port in the inference service's pod
#IBMTechXchange
KServe Feature: Monitoring
33
Prometheus Metrics��
#IBMTechXchange
KServe Feature: Monitoring
34
Grafana Dashboards
#IBMTechXchange
KServe Feature: Canary Rollout
35
#IBMTechXchange
KServe Feature: GitOps Friendly
36
ArgoCD includes custom health checks for KServe CRDs
#IBMTechXchange
KServe Feature: Deployment Mode
37
Knative vs. Standard
#IBMTechXchange
GenAI Feature: LMCache Integration
38
Key-Value (KV) cache offloading
with vLLM + LMCache
Check out LMCache session at 3:30 at Lake Louise (Lobby Level)
#IBMTechXchange
GenAI Feature: Model Cache
39
#IBMTechXchange
GenAI Feature: Model Cache
40
#IBMTechXchange
GenAI Feature: KEDA Autoscaling
41
TBA
#IBMTechXchange
GenAI Feature: Multi-node Inference
42
TBA
#IBMTechXchange
GenAI Feature: Rate Limiting with Envoy AI Gateway
43
#IBMTechXchange
GenAI Feature: Rate Limiting with Envoy AI Gateway
44
#IBMTechXchange
GenAI Feature: llm-d Integration
45
#IBMTechXchange
GenAI Feature: llm-d Integration
46
#IBMTechXchange
GenAI Feature: llm-d Integration
47
Check out llm-d session at 3pm at Lake Louise (Lobby Level)!
#IBMTechXchange
GenAI Feature: KServe + llm-d + Envoy AI Gateway
48
#IBMTechXchange
Future of KServe
49
Community Collaboration
#IBMTechXchange
Stay Connected!
Email: terrytangyuan@gmail.com
LinkedIn/X/GitHub: @TerryTangYuan
Bluesky: @terrytangyuan.xyz
50
#IBMTechXchange