diff --git a/charts/llm-d-modelservice/Chart.yaml b/charts/llm-d-modelservice/Chart.yaml index 08bd7a5b..a31e0463 100644 --- a/charts/llm-d-modelservice/Chart.yaml +++ b/charts/llm-d-modelservice/Chart.yaml @@ -13,7 +13,7 @@ type: application # This is the chart version. This version number should be incremented each time you make changes # to the chart and its templates, including the app version. # Versions are expected to follow Semantic Versioning (https://semver.org/) -version: "v0.4.2" +version: "v0.4.3" # This is the version number of the application being deployed. This version number should be # incremented each time you make changes to the application. Versions are not expected to # follow Semantic Versioning. They should reflect the version the application is using. diff --git a/charts/llm-d-modelservice/values.schema.json b/charts/llm-d-modelservice/values.schema.json index da4b17f6..a31f967a 100644 --- a/charts/llm-d-modelservice/values.schema.json +++ b/charts/llm-d-modelservice/values.schema.json @@ -4,7 +4,7 @@ "properties": { "accelerator": { "additionalProperties": false, - "description": " Supported types: nvidia, intel-i915, intel-xe, intel-gaudi, amd, google", + "description": " Supported types: nvidia, intel-i915, intel-xe, intel-gaudi, amd, google, cpu", "properties": { "dra": { "default": false, @@ -83,6 +83,35 @@ "required": [], "title": "intel-i915", "type": "array" + }, + "intel-xe": { + "items": { + "anyOf": [ + { + "additionalProperties": false, + "properties": { + "name": { + "default": "VLLM_WORKER_MULTIPROC_METHOD", + "required": [], + "title": "name", + "type": "string" + }, + "value": { + "default": "spawn", + "required": [], + "title": "value", + "type": "string" + } + }, + "required": [], + "type": "object" + } + ], + "required": [] + }, + "required": [], + "title": "intel-xe", + "type": "array" } }, "required": [], diff --git a/charts/llm-d-modelservice/values.schema.tmpl.json b/charts/llm-d-modelservice/values.schema.tmpl.json index d55d1313..baba661c 100644 --- a/charts/llm-d-modelservice/values.schema.tmpl.json +++ b/charts/llm-d-modelservice/values.schema.tmpl.json @@ -4,7 +4,7 @@ "properties": { "accelerator": { "additionalProperties": false, - "description": " Supported types: nvidia, intel-i915, intel-xe, intel-gaudi, amd, google", + "description": " Supported types: nvidia, intel-i915, intel-xe, intel-gaudi, amd, google, cpu", "properties": { "dra": { "default": false, @@ -83,6 +83,35 @@ "required": [], "title": "intel-i915", "type": "array" + }, + "intel-xe": { + "items": { + "anyOf": [ + { + "additionalProperties": false, + "properties": { + "name": { + "default": "VLLM_WORKER_MULTIPROC_METHOD", + "required": [], + "title": "name", + "type": "string" + }, + "value": { + "default": "spawn", + "required": [], + "title": "value", + "type": "string" + } + }, + "required": [], + "type": "object" + } + ], + "required": [] + }, + "required": [], + "title": "intel-xe", + "type": "array" } }, "required": [], diff --git a/charts/llm-d-modelservice/values.yaml b/charts/llm-d-modelservice/values.yaml index 75277ab3..14596c97 100644 --- a/charts/llm-d-modelservice/values.yaml +++ b/charts/llm-d-modelservice/values.yaml @@ -74,7 +74,7 @@ modelArtifacts: multinode: false # Global accelerator configuration -# Supported types: nvidia, intel-i915, intel-xe, intel-gaudi, amd, google +# Supported types: nvidia, intel-i915, intel-xe, intel-gaudi, amd, google, cpu accelerator: # Type of accelerator to use type: nvidia @@ -101,6 +101,9 @@ accelerator: value: "1" - name: VLLM_WORKER_MULTIPROC_METHOD value: "spawn" + intel-xe: + - name: VLLM_WORKER_MULTIPROC_METHOD + value: "spawn" # ResourceClaimTemplate configurations for DRA (used when dra: true) # Each accelerator type can have its own claim template configuration resourceClaimTemplates: diff --git a/examples/output-cpu.yaml b/examples/output-cpu.yaml index f7c87744..721e055c 100644 --- a/examples/output-cpu.yaml +++ b/examples/output-cpu.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: cpu-sim-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -16,7 +16,7 @@ kind: Deployment metadata: name: cpu-sim-llm-d-modelservice-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: @@ -106,7 +106,7 @@ kind: Deployment metadata: name: cpu-sim-llm-d-modelservice-prefill labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: diff --git a/examples/output-dra.yaml b/examples/output-dra.yaml index 37c7ab0b..47995f6e 100644 --- a/examples/output-dra.yaml +++ b/examples/output-dra.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: dra-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -16,7 +16,7 @@ kind: Deployment metadata: name: dra-llm-d-modelservice-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: @@ -116,7 +116,7 @@ kind: ResourceClaimTemplate metadata: name: intel-gaudi-claim-template-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm llm-d.ai/role: decode diff --git a/examples/output-gaudi.yaml b/examples/output-gaudi.yaml index 98cd89aa..b332abdd 100644 --- a/examples/output-gaudi.yaml +++ b/examples/output-gaudi.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: gaudi-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -16,7 +16,7 @@ kind: Deployment metadata: name: gaudi-llm-d-modelservice-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: diff --git a/examples/output-heterogeneous-pd.yaml b/examples/output-heterogeneous-pd.yaml index 559509c0..8d483c0f 100644 --- a/examples/output-heterogeneous-pd.yaml +++ b/examples/output-heterogeneous-pd.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: heterogeneous-pd-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -16,7 +16,7 @@ kind: Deployment metadata: name: heterogeneous-pd-llm-d-modelservice-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: @@ -132,7 +132,7 @@ kind: Deployment metadata: name: heterogeneous-pd-llm-d-modelservice-prefill labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: @@ -226,7 +226,7 @@ kind: ResourceClaimTemplate metadata: name: nvidia-claim-template-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm llm-d.ai/role: decode diff --git a/examples/output-pd-mnnvl.yaml b/examples/output-pd-mnnvl.yaml index 89725079..1db450d6 100644 --- a/examples/output-pd-mnnvl.yaml +++ b/examples/output-pd-mnnvl.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: pd-mnnvl-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -16,7 +16,7 @@ kind: Deployment metadata: name: pd-mnnvl-llm-d-modelservice-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: @@ -132,7 +132,7 @@ kind: Deployment metadata: name: pd-mnnvl-llm-d-modelservice-prefill labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: diff --git a/examples/output-pd.yaml b/examples/output-pd.yaml index aa4fe9ab..c3bb4193 100644 --- a/examples/output-pd.yaml +++ b/examples/output-pd.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: pd-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -16,7 +16,7 @@ kind: Deployment metadata: name: pd-llm-d-modelservice-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: @@ -128,7 +128,7 @@ kind: Deployment metadata: name: pd-llm-d-modelservice-prefill labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: diff --git a/examples/output-pvc-hf.yaml b/examples/output-pvc-hf.yaml index 610aed6d..79dc6ca8 100644 --- a/examples/output-pvc-hf.yaml +++ b/examples/output-pvc-hf.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: pvc-hf-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -16,7 +16,7 @@ kind: Deployment metadata: name: pvc-hf-llm-d-modelservice-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: @@ -128,7 +128,7 @@ kind: Deployment metadata: name: pvc-hf-llm-d-modelservice-prefill labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: diff --git a/examples/output-pvc.yaml b/examples/output-pvc.yaml index 3bdac481..a53c7a99 100644 --- a/examples/output-pvc.yaml +++ b/examples/output-pvc.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: pvc-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -16,7 +16,7 @@ kind: Deployment metadata: name: pvc-llm-d-modelservice-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: @@ -127,7 +127,7 @@ kind: Deployment metadata: name: pvc-llm-d-modelservice-prefill labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: diff --git a/examples/output-requester.yaml b/examples/output-requester.yaml index 966c71c0..57152eac 100644 --- a/examples/output-requester.yaml +++ b/examples/output-requester.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: requester-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -143,7 +143,7 @@ kind: Deployment metadata: name: requester-llm-d-modelservice-prefill labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: diff --git a/examples/output-xpu-pd.yaml b/examples/output-xpu-pd.yaml index f6976495..66adf0c9 100644 --- a/examples/output-xpu-pd.yaml +++ b/examples/output-xpu-pd.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: xpu-pd-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -16,7 +16,7 @@ kind: Deployment metadata: name: xpu-pd-llm-d-modelservice-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: @@ -159,7 +159,7 @@ kind: Deployment metadata: name: xpu-pd-llm-d-modelservice-prefill labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: diff --git a/examples/output-xpu.yaml b/examples/output-xpu.yaml index bd53f052..3b750803 100644 --- a/examples/output-xpu.yaml +++ b/examples/output-xpu.yaml @@ -6,7 +6,7 @@ kind: ServiceAccount metadata: name: xpu-llm-d-modelservice labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm --- @@ -16,7 +16,7 @@ kind: Deployment metadata: name: xpu-llm-d-modelservice-decode labels: - helm.sh/chart: llm-d-modelservice-v0.4.2 + helm.sh/chart: llm-d-modelservice-v0.4.3 app.kubernetes.io/version: "v0.3.0" app.kubernetes.io/managed-by: Helm spec: @@ -93,6 +93,9 @@ spec: - name: HF_HOME value: /model-cache + - name: VLLM_WORKER_MULTIPROC_METHOD + value: "spawn" + ports: - containerPort: 8200 protocol: TCP