feat: 完成 issue #8 ⑥ K8s/Helm 部署底座 + 昇腾适配层
This commit is contained in:
@@ -0,0 +1,36 @@
|
||||
apiVersion: v1
|
||||
kind: ConfigMap
|
||||
metadata:
|
||||
name: {{ include "iaop.fullname" . }}-backend
|
||||
labels:
|
||||
{{- include "iaop.labels" . | nindent 4 }}
|
||||
data:
|
||||
# 推理后端适配层配置(PRD 5.6:切换后端仅改 values.inference.backend)。
|
||||
# 该配置与 core/inference-backend/config/backends.template.yaml 同构,
|
||||
# 由推理服务容器在启动时读取。
|
||||
backends.yaml: |
|
||||
template: ti-cl4
|
||||
version: 1.0.0
|
||||
backend: {{ .Values.inference.backend }}
|
||||
inference:
|
||||
model: {{ .Values.inference.model | quote }}
|
||||
endpoint: http://{{ include "iaop.fullname" . }}:{{ .Values.service.port }}/v1
|
||||
timeout_seconds: {{ .Values.inference.timeoutSeconds }}
|
||||
runtime: {{ .Values.inference.runtime | quote }}
|
||||
device: {{ .Values.inference.device | quote }}
|
||||
max_tokens: {{ .Values.inference.maxTokens }}
|
||||
temperature: {{ .Values.inference.temperature }}
|
||||
{{- if eq .Values.inference.backend "npu" }}
|
||||
# 昇腾适配层专用字段(CANN 工具链版本;gpu 后端忽略)
|
||||
cann_version: {{ .Values.inference.cannVersion | default "" | quote }}
|
||||
{{- end }}
|
||||
resources:
|
||||
requests:
|
||||
cpu: {{ .Values.resources.requests.cpu | quote }}
|
||||
memory: {{ .Values.resources.requests.memory | quote }}
|
||||
limits:
|
||||
cpu: {{ .Values.resources.limits.cpu | quote }}
|
||||
memory: {{ .Values.resources.limits.memory | quote }}
|
||||
rollingUpdate:
|
||||
maxUnavailable: {{ .Values.rollingUpdate.maxUnavailable }}
|
||||
maxSurge: {{ .Values.rollingUpdate.maxSurge }}
|
||||
Reference in New Issue
Block a user