You need to enable JavaScript to run this app.
文档中心
容器服务

容器服务

复制全文
下载 pdf
升级集群
集群升级检查项
复制全文
下载 pdf
集群升级检查项
本文主要介绍升级集群时容器服务(VKE)的各检查项详细信息。
控制面检查
分类
检查项
异常原因
影响说明
修复建议
集群资源配额
vpc 子网状态检查
未查询到私有网络(VPC)子网信息,请确认集群网络是否已经被删除。
子网信息异常会导致集群不可用。
请确认集群的网络配置是否正确。详情请参见 集群基本信息
vpc-cni 子网剩余 IP 数量检查
VPC-CNI 网络模型集群的子网剩余 IP 数量不足。
子网剩余子网 IP 不足,会导致升级任务失败。
增加新子网网段,或释放部分 IP。详情请参见 修改 API Server 子网
节点健康状态
集群节点状态检查
集群中存在异常状态的节点。
集群存在异常节点时,为防止 Kubernetes 集群出现异常,不允许执行集群升级。
请先修复异常节点,将节点恢复为 Ready 状态。请根据控制台提示信息,排查节点异常原因并修复。
废弃 API 检查
PodGroup 废弃版本资源检查
集群中存在废弃版本的 PodGroup 资源。
Kubernetes v1.28 以上版本更新了 PodGroup 的 apiGroups(scheduling.sigs.Kubernetes.io更新为scheduling.x-Kubernetes.io),升级后会导致使用这些资源的服务不可用。
请在集群升级至 v1.28 及以上版本后, 基于scheduling.x-Kubernetes.io apiGroups 重新创建所需的 PodGroup 资源。详情请参见 GitHub 内容
废弃 Kubernetes API 资源检查
集群使用了已废弃的 Kubernetes API。
集群的部分服务使用已废弃的 Kubernetes API,升级后会导致这些服务不可用。
请参考 容器服务 Kubernetes 发布记录 中的 API 版本变更/弃用,对已废弃的 Kubernetes API 进行适配。
审计日志废弃 Kubernetes API 检查
未查询到集群审计日志 Topic,请检查集群审计日志是否已开启。
集群的部分服务可能使用已废弃的 Kubernetes API,升级集群后可能会导致服务不可用。
请参考 容器服务 Kubernetes 发布记录 中的 API 版本变更/弃用,对已废弃的 Kubernetes API 进行适配。如果已经处理则忽略此警告项。
审计日志移除 Kubernetes API 检查
未查询到集群审计日志 Topic,请检查集群审计日志是否已开启。
集群的部分服务可能使用已废弃的 Kubernetes API,升级集群后可能会导致服务不可用。
请参考 容器服务 Kubernetes 发布记录 中的 API 版本变更/弃用,对已废弃的 Kubernetes API 进行适配。如果已经处理则忽略此警告项。
Kubernetes 集群近 30 天废弃 API 检查
集群近 30 天使用了已废弃或已删除的 Kubernetes API。
集群的部分服务可能使用已废弃的 Kubernetes API,升级集群后可能会导致服务不可用。
请参考 容器服务 Kubernetes 发布记录 中的 API 版本变更/弃用,对已废弃的 Kubernetes API 进行适配。如果已经处理则忽略此警告项。
vpc-cni 兼容性检查
未查询到集群审计日志 Topic,请检查集群审计日志是否创建并开启。
vpc-cni 组件使用了目标 Kubernetes 版本会移除的 API 资源。若不处理,升级后会导致 vpc-cni 组件异常,无法创建Pod。
连接集群 后执行命令:kubectl rollout restart daemonset cello -n kube-system,重启 vpc-cni 组件,使其获取最新版本的 endpointslices 资源。完成重启后忽略此条告警项。
审计日志状态检查
集群审计日志未开启,请开启集群审计日志。
审计日志未开启或开启未满 24 小时,会影响对已废弃/移除的 Kubernetes API 检查。集群中可能存在对这些 API 的访问,升级后可能导致集群中部分服务不可用。
建议开启 集群审计 并满 24 小时后再次执行控制面升级检查。
集群组件状态
kubernetes 版本检查
集群当前版本不满足升级条件。
集群当前版本过低或者已是最新版本时,均不允许升级。
集群 Kubernetes 版本要满足如下条件:
  • 当前版本 >= Kubernetes v1.20。
  • 当前版本 < 目标升级版本。
集群状态检查
集群状态异常。
请先恢复集群状态。非 Running 状态可能会导致升级失败。
说明
集群状态中Updating是一个特殊状态, Updating[ClusterVersionUpgrading]代表集群已经在进行版本升级中, Updating[Progressing]代表集群在更新中,此状态不允许再进行集群升级。
提交工单 联系技术支持,修复集群状态。
kube-apiserver 组件运行状态检查
集群控制面 kube-apiserver 组件异常。
集群无法提供 API 服务。
提交工单 联系技术支持,恢复 kube-apiserver 服务状态。
Etcd 服务状态检查
集群控制面 ETCD 服务状态异常。
ETCD 服务异常可能导致集群无法提供 API 服务。
提交工单 联系技术支持,恢复 ETCD 服务状态。
kube-controller-manager 运行状态检查
集群控制面 kube-controller-manager 服务异常。
会导致集群ReplicationController 服务异常。
提交工单 联系技术支持,恢复 kube-controller-manager 服务状态。
cloud-controller-manager 组件运行状态检查
集群控制面 cloud-controller-manager 服务异常。
会导致集群无法管理火山引擎云资源,集群无法按照预期提供服务。
提交工单 联系技术支持,恢复 cloud-controller-manager 服务状态。
kube-scheduler 运行状态检查
集群控制面 kube-scheduler 服务异常。
集群内资源调度异常,无法正常创建 Pod。
提交工单 联系技术支持,恢复 kube-scheduler 服务状态
kube-proxy 组件运行状态检查
Flannel 网络模型集群的网络插件 kube-proxy 服务异常。
集群网络异常,将会造成升级失败。
提交工单 联系技术支持,恢复 kube-proxy 服务状态。
vpc-cni 组件运行状态检查
VPC-CNI 网络模型集群的 vpc-cni 组件 cello 服务异常。
集群网络异常,将会造成升级失败。
说明
cello 是 vpc-cni 组件对应 Pod 中的一个容器,主要用于管理节点的辅助弹性网卡,并为 Pod 分配私网 IP。
在 kube-system 命名空间下, 查看 cello 服务的具体运行信息,并按照获取的信息尝试自行恢复 cello 状态。若无法自行恢复,您可以 提交工单 联系技术支持解决。
scheduler-controller-manager 组件运行状态检查
集群控制面 scheduler-controller-manager 服务异常。
集群无法提供 API 服务。
提交工单 联系技术支持,恢复 scheduler-controller-manager 服务状态。
general-webhook 组件运行状态检查
集群控制面 general-webhook 服务异常。
可能会造成集群 API 请求异常。
提交工单 联系技术支持,恢复 general-webhook 服务状态。
Addon 兼容性检查
组件(Addon)兼容性检查不通过。
请先升级相关组件的版本, 防止在升级集群后影响组件功能的使用,从而造成集群异常。
升级组件到最新版本。详情请参见 升级组件
Addon 运行状态检查
  • 集群中存在节点的情况下,托管组件状态异常,或非托管组件异常。
  • 集群中无可用节点的情况下,非托管组件异常。
集群中存在异常组件时,不允许升级集群。
请先恢复异常组件的状态。详情请参见 组件 FAQ
集群 CLB 状态检查
集群关联创建的传统型负载均衡(CLB)实例异常。
集群关联创建的 CLB 实例异常会导致集群不可用,从而导致集群升级失败。
请前往 传统型负载均衡控制台 恢复 CLB 实例的状态。
集群控制面组件资源水位检查
集群控制面组件水位过高。
集群控制面组件水位过高,可能导致升级过程中出错,对业务造成影响。
提交工单 联系技术支持人员进行扩容,或等待集群控制面水位恢复到正常水位后再进行集群升级操作。
废弃 addon 升级拦截检查
检测到 Kubernetes v1.36 版本起不再支持的组件,升级被拦截。
集群安装了目标 Kubernetes 版本不再支持的组件,直接升级可能导致相关能力不可用或后续安全修复缺失。
请在升级控制面 Kubernetes 版本前迁移到推荐替代能力,或删除、替换相关组件后再升级。如需继续使用,请 提交工单 确认兼容性与风险。
例如自 Kubernetes v1.36 版本起不在支持 ingress-nginx 组件,请参考 产品公告 获取迁移方案。
集群配置检查
集群特殊运维操作检查
集群处于特殊运维状态,开启了 Debug 模式。
检查集群之前是否做过特殊的运维操作,如果集群仍然处于 该特殊运维状态,可能会造成集群升级失败。
提交工单 联系技术支持,解除特殊运维状态。
节点池弹性扩缩容功能是否开启
节点池开启了弹性扩缩容。
升级集群期间,节点池弹性扩缩容功能暂不可用,因此不允许开启该功能。
请关闭所有节点池的弹性伸缩功能。详情请参见 编辑节点池
节点 Kubelet 版本检查
节点 Kubelet 版本与集群版本不一致。
当节点 Kubelet 版本与集群版本不一致时,直接升级控制面 可能会导致节点异常。
请将节点 Kubelet 版本恢复到与集群版本保持一致后再执行控制面升级。详情请参见 节点升级
Kubelet 配置参数检查
请检查节点池配置,移除废弃的参数配置。
Kubelet 参数配置不合法,升级集群后,可能会导致新建节点不可用。
请参考检查结果,对非法的 Kubelet 配置进行修改,移除废弃掉的参数配置。详情请参见 配置节点 kubelet 参数
节点池配置参数检查
使用了 veLinux 2.0 (或 ubuntu 22.04)操作系统的节点池在低于 Kubernetes v1.30 版本中采用 cgroup v1 进行节点初始化。
使用 veLinux 2.0 (或 ubuntu 22.04)操作系统的节点池在 Kubernetes v1.30 及以上版本中扩容的新节点采用 cgroup v2 进行节点初始化,因此可能会导致业务在新节点上不可用。
若希望 veLinux 2.0 (或 ubuntu 22.04)操作系统的新节点继续使用 cgroup v1 进行节点初始化,请 提交工单 联系技术支持人员。
节点 cgroup 版本检查
节点 cgroup 版本检查未通过。
Kubernetes v1.36 版本不支持 cgroup v1 节点,直接升级控制面可能导致节点或业务异常。
请先将命中的节点迁移到 cgroup v2,并确认所有非 VCI 节点 kubelet metrics 可访问后再执行控制面升级。目前 VKE 支持的节点迁移方案请参见 FAQ,如有其他迁移方案,请 提交工单 确认。
节点池和节点配置兼容性检查
节点或节点池配置不兼容目标 Kubernetes 版本。
集群节点或节点池配置中存在目标 Kubernetes 版本不兼容项,升级控制面后已有节点、新扩容节点或节点升级流程可能不可用。
请修改命中的节点或节点池配置后再升级控制面,若需要继续保留相关配置,请 提交工单 确认兼容性与风险。
节点检查
分类
检查项
异常原因
影响说明
修复建议
节点健康状态
节点状态检查
当前节点状态异常。
节点状态异常, 不允许升级。
请先将节点恢复到 Running 状态后重试。请根据控制台提示信息,排查节点异常原因并修复。
节点升级检查
节点 Kubernetes 版本检查
当前节点版本不支持升级。
节点 Kubernetes 版本未通过校验,不允许升级。
当前节点的 Kubernetes 版本必须小于目标升级版本。
节点 Containerd 版本检查
节点 Containerd 版本未通过校验。
节点 Containerd 版本未通过校验,不允许升级。
当前节点的 Containerd 版本必须小于目标 Containerd 升级版本。
操作系统检查
当前节点的操作系统不在支持范围内。
节点的操作系统未通过校验,不允许升级。
节点操作系统必须为 debian、ubuntu、devuan、velinux、centos、fedora、rhel 之一,否则请 提交工单 联系技术支持。
内核参数检查
内核参数校验失败。
节点的内核参数未通过校验,不允许升级。
请关闭节点的内核 swap 参数。您可以执行swapoff -a命令关闭。
挂载点检查
节点存在不可访问的挂载点。
影响节点升级时对文件的读写操作,不允许升级。
修复节点所有挂载点的权限,使其能够被正常访问。
关键目录权限检查
节点/upgrade目录不支持读写操作。
影响节点升级时对文件的读写操作,不允许升级。
修复节点/upgrade目录权限,使其支持读写操作。
内存使用检查
节点内存使用过高,超过阈值 90%。
影响节点升级任务下发及备份旧数据,不允许升级。
请将节点的内存水位降低到 90% 以下。您可以驱逐一部分 Pod 负载,或者在业务低峰期选择升级。
关键目录磁盘使用检查
节点/tmp目录可用空间过小。
影响节点升级任务下发及备份旧数据,不允许升级。
清理节点/tmp目录下的文件,确保/tmp目录可用空间大于 500 MiB。
依赖包的安装检查
节点存在依赖包未安装。
可能导致集群基础功能异常,不允许升级。
使用yumapt命令检查 socat、ebtables-nft、conntrack 等依赖包是否正常安装,并根据检查结果进行修复。
基础服务检查
节点基础服务异常。
节点基础服务异常,会引发集群基础功能异常,不允许升级。
检查 systemd、journald、chronyd、 Kubelet、Containerd、yum/apt-get 等基础服务是否正常,并根据检查结果进行修复。
DNS 解析检查
节点 DNS 解析域名失败。
当前节点 DNS 配置无法正常解析对象存储(TOS)地址,不允许升级。
检查节点 DNS 配置,使主机可以正常解析 TOS 地址:https://<bucket_name>.<tos_endpoint>的访问。
说明
  • <bucket_name>:存储桶名称。
  • <tos_endpoint>
TOS 对外服务的访问域名,详情请参见 地域和访问域名(Endpoint)
完整的 TOS 地址示例:https://vke-sh.tos-cn-shanghai.ivolces.com
TOS 连通性检查
节点访问 TOS 失败。
节点升级安装包下载异常,不允许升级。
检查 节点安全组配置,放行对目标 TOS 地址:https://<bucket_name>.<tos_endpoint>的访问。
InPlacePodVerticalScaling 特性检查
集群已开启 InPlacePodVerticalscaling 特性,为避免与节点升级流程冲突,当前升级被拦截。
集群开启 InPlacePodVerticalscaling 特性时,为避免与节点升级流程冲突,默认强制拦截升级。
说明
仅在 Kubernetes v1.30 升级至 v1.32 时出现。
如果不想被拦截,请通过节点轮转方式处理,例如扩容新节点并基于 InPlacePodVerticalscaling 特性实现在不重建 Pod 的情况下迁移工作负载,然后再缩容节点,用 "滚动替换" 代替 "原地修改"。如有问题,请 提交工单 联系技术支持。
节点负载
节点可分配资源检查
节点可分配的 CPU 或内存资源过小。
节点可调度资源过小(CPU < 100 m;内存 < 200 MiB)会导致节点升级失败。
清理节点上无用的、测试的、状态异常的负载,释放节点的 Request 资源,保证升级任务 Pod 正常下发。详情请参见 删除容器组
节点 MaxPOD 检查
已达到节点配置的 Max Pod 上限。
已达到节点配置的 Max Pod 上限,无法再创建 Pod,将会导致升级任务的 Pod 无法下发。
请删除节点的的部分 Pod,保证节点升级任务 Pod 可以正常下发。详情请参见 删除容器组
节点可用资源检查
节点实际可用的 CPU 或内存资源过小。
节点实际可用资源过小(CPU < 100 m;内存 < 200 MiB)会导致节点升级失败。
请清理节点上高负载的 Pod,释放部分资源,保证升级任务的 Pod 正常执行。
最近更新时间:2026.07.03 17:05:03
这个页面对您有帮助吗?
有用
有用
无用
无用