feat: 完成 issue #8 ⑥ K8s/Helm 部署底座 + 昇腾适配层

This commit is contained in:
2026-08-04 22:04:18 +08:00
parent 691a812fcf
commit e620d4937e
20 changed files with 1013 additions and 0 deletions
@@ -0,0 +1,36 @@
apiVersion: v1
kind: ConfigMap
metadata:
name: {{ include "iaop.fullname" . }}-backend
labels:
{{- include "iaop.labels" . | nindent 4 }}
data:
# 推理后端适配层配置(PRD 5.6:切换后端仅改 values.inference.backend)。
# 该配置与 core/inference-backend/config/backends.template.yaml 同构,
# 由推理服务容器在启动时读取。
backends.yaml: |
template: ti-cl4
version: 1.0.0
backend: {{ .Values.inference.backend }}
inference:
model: {{ .Values.inference.model | quote }}
endpoint: http://{{ include "iaop.fullname" . }}:{{ .Values.service.port }}/v1
timeout_seconds: {{ .Values.inference.timeoutSeconds }}
runtime: {{ .Values.inference.runtime | quote }}
device: {{ .Values.inference.device | quote }}
max_tokens: {{ .Values.inference.maxTokens }}
temperature: {{ .Values.inference.temperature }}
{{- if eq .Values.inference.backend "npu" }}
# 昇腾适配层专用字段(CANN 工具链版本;gpu 后端忽略)
cann_version: {{ .Values.inference.cannVersion | default "" | quote }}
{{- end }}
resources:
requests:
cpu: {{ .Values.resources.requests.cpu | quote }}
memory: {{ .Values.resources.requests.memory | quote }}
limits:
cpu: {{ .Values.resources.limits.cpu | quote }}
memory: {{ .Values.resources.limits.memory | quote }}
rollingUpdate:
maxUnavailable: {{ .Values.rollingUpdate.maxUnavailable }}
maxSurge: {{ .Values.rollingUpdate.maxSurge }}