# 云容器引擎 CCE > 提供高可靠的企业级容器应用管理服务 ## 服务公告 - [最新公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0001.md): 以下为CCE发布的最新公告,请您关注。更多历史公告请详见产品变更公告、集群版本公告及漏洞公告。 - [CCE服务委托变更说明](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0133.md): 为了提高CCE使用委托的安全性,提供更精细化的权限控制能力,华为云CCE服务对依赖的委托进行了调整升级:委托权限隔离与权限最小化:按使用场景拆分委托权限,降低单点凭据泄露风险,并严格遵循最小权限原则,精准控制各组件的访问范围。自定义委托:支持集群与插件使用自定义委托,满足用户自定义权限管控需求。当首次创建或升级至对应版本的集群/插件时,系 - [关于CCE集群default-secret密钥权限变更的说明](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0113.md): 发布时间:2026/01/30为了持续提升云容器引擎(CCE)集群的安全性,遵循权限最小化原则,我们决定对集群内默认创建的密钥default-secret的权限进行调整。default-secret是CCE在每个命名空间下自动创建的类型为kubernetes.io/dockerconfigjson的密钥。其data字段包含了用于访问SWR - [华为云CCE服务NGINX Ingress维护策略更新](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0110.md): 发布时间:2025/12/10Kubernetes贡献者社区近日发布重磅博客《Ingress NGINX 退役:你需要了解的内容》,由SIG Network与安全响应委员会联合宣布:Ingress NGINX Controller正式进入退役流程。CCE对NGINX Ingress控制器插件的维护策略作出如下调整:维护策略:自即日起至20 - [华为云CCE服务节点操作系统EulerOS 2.9即将于2025/12/31 00:00(北京时间)正式停止维护通知](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0109.md): 发布时间:2025/11/28CCE服务节点操作系统EulerOS 2.9即将在2025年12月31日停止服务与支持。更多信息,请参见镜像服务说明。2025年12月31日以后,EulerOS 2.9的使用者将无法获得包括问题修复和功能更新在内的任何软件维护和支持。EulerOS 2.9操作系统停止维护后,云容器引擎将不再支持新建Euler - [华为云CCE集群容器运行时Docker支持策略变化通知](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0107.md): 发布时间:2025/11/20Kubernetes社区已在v1.24版本移除dockershim,默认不再支持Docker容器运行时。CCE服务考虑到仍然有部分用户使用Docker,延长支持至v1.33版本。为保持与社区技术路线同步,并提升集群运行的稳定性与资源效率,CCE对容器运行时的支持策略作出如下调整:新建CCE集群:Kuberne - [CCE服务老版控制台访问入口正式下线通知](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0102.md): 发布时间:2025/05/13华为云CCE服务新版控制台已于2023年9月上线,老版控制台访问入口计划于2025/5/30 00:00(北京时间)切换至新版控制台,并计划在2025/11/30正式下线老版控制台。届时您将无法访问老版控制台,请前往新版CCE控制台进行操作。 - [关于CentOS停止维护的通知](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0098.md): 发布时间:2024/10/23CentOS官方已计划停止维护CentOS操作系统,云容器引擎上CentOS公共镜像来源于CentOS官方,当CentOS操作系统停止维护后,云容器引擎将会同时停止对该操作系统的支持。本文主要介绍CentOS操作系统停止维护带来的影响,并针对影响提供应对策略。2020年12月08日,CentOS官方宣布了停止 - [华为云容器服务CCE Autopilot数据面账单变更公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0097.md): 发布时间:2024/09/14华为云计划于2024/09/18 22:00:00(北京时间)对CCE Autopilot数据面CPU、内存资源账单进行调整,调整后CCE Autopilot数据面资源账单的产品类型将从云容器引擎CCE调整为云容器实例CCI,此次调整资源单价保持不变,已出历史账单不变,不会对您的业务使用造成影响,具体调整如下 - [华为云容器服务CCE Autopilot于2024年9月30日00:00(北京时间)转商](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0096.md): 发布时间:2024/08/29华为云计划于2024年9月30日00:00(北京时间)将容器服务CCE Autopilot正式转商用。服务正式商用后将收取集群管理费用,其余费用与公测期间保持一致,更多收费说明请参见按需计费区域单价。更多关于CCE Autopilot的产品介绍,请参见什么是Autopilot集群。如您有任何问题,可随时通过工 - [集群网络、存储功能可靠性加固说明](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0091.md): 发布时间:2024/04/26当IAM服务发生区域性故障时,存在低概率触发鉴权异常,从而影响集群内工作负载存储卷挂载、负载均衡对接等功能。最新的集群版本针对该类故障场景进行了优化和加固,为确保您的业务稳定运行,建议您尽快将账号下的集群升级至目标版本。同时满足以下条件:集群版本范围:已EOS版本:v1.19及以下所有版本1.21版本(于20 - [关于CCE集群Docker支持策略公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0088.md): 发布时间:2024/02/19Kubernetes社区已在v1.24版本移除dockershim,默认不再支持Docker容器运行时。当前v1.27.1-r0至v1.27.5-r0、v1.28.1-r0至v1.28.3-r0版本的集群不支持创建Docker容器运行时的节点。考虑到当前仍然有部分用户使用Docker,CCE将继续支持创建Do - [ServiceAccount Token安全性提升说明](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0076.md): 发布时间:2022/11/24Kubernetes 1.21及以上版本的集群中,Pod将不再自动挂载永久Token,默认使用TokenRequest API获得Token,并使用投射卷(Projected Volume)挂载到Pod中。使用这种方法获得的Token具有固定的生命周期(默认有效期为1小时),在到达有效期之前,Kubelet会 - [Helm V2 升级Helm V3 公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0077.md): 发布时间:2022/08/30因控制台模板管理功能所依赖的开源软件Helm已从 V2 演进至 V3 版本,即日起平台会自动将集群中 Helm V2 格式实例转换为 Helm V3 格式。部分 Helm V2 功能在 Helm V3 上有了更好的解决方案,但可能存在与原有方式不兼容的情况,需要您根据Helm V3 与 Helm V2 的差异 - [CCE Turbo集群正式发布,敬请购买使用](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0079.md): 发布时间:2021/03/31CCE Turbo集群是全面基于云原生基础设施构建的云原生2.0的容器引擎服务,具备软硬协同、网络无损、安全可靠、调度智能的优势,为用户提供一站式、高性价比的全新容器服务体验。详情请参见购买CCE集群。 - [Everest插件优化密钥认证功能公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0080.md): 发布时间:2021/02/02Everest插件在1.2.0版本优化了使用OBS存储时的密钥认证功能,请在Everest插件升级完成后(从低于1.2.0的版本升级到1.2.0及以上版本),重启集群中使用OBS的全部工作负载,否则工作负载使用OBS存储能力将受影响!关于Everest插件的版本说明,请参见CCE容器存储插件(Everest) - [1.30版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0119.md): 发布时间:2026/07/23华为云CCE集群Kubernetes v1.30集群版本即将于2026/10/30 00:00(北京时间)正式停止维护。详情请参见CCE服务Kubernetes版本策略。停止维护后现有集群仍可运行,但不再获得安全更新、漏洞修复或技术支持,同时也无法再选择该版本创建新集群。若您账号下存在Kubernetes v - [1.29版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0112.md): 发布时间:2025/12/31华为云CCE集群Kubernetes v1.29集群版本即将于2026/06/30 00:00(北京时间)正式停止维护。详情请参见CCE服务Kubernetes版本策略。停止维护后现有集群仍可运行,但不再获得安全更新、漏洞修复或技术支持,同时也无法再选择该版本创建新集群。若您账号下存在Kubernetes v - [1.28版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0106.md): 发布时间:2025/09/12华为云CCE集群1.28集群版本即将于2026/02/28 00:00(北京时间)正式停止维护。停止维护后现有集群仍可运行,但不再获得安全更新、漏洞修复和技术支持,同时也无法再选择该版本创建新集群。若您账号下存在1.28及之前的集群版本,为了保证您的服务权益,建议尽快升级到在维的商用版本。定期升级可确保安全漏 - [1.27版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0103.md): 发布时间:2025/05/13华为云CCE集群1.27版本即将于2025/10/30 00:00(北京时间)正式停止维护,届时针对CCE集群1.27以及之前的版本,华为云将不再支持新集群创建。若您账号下存在1.27及之前的集群版本,为了保证您的服务权益,建议尽快升级到最新的商用版本。关于如何升级集群,请参见CCE集群升级指导。关于CCE集 - [1.25版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0101.md): 发布时间:2024/12/31华为云CCE集群1.25版本即将于2025/03/31 00:00(北京时间)正式停止维护,届时针对CCE集群1.25以及之前的版本,华为云将不再支持新集群创建。若您账号下存在1.25及之前的集群版本,为了保证您的服务权益,建议尽快升级到最新的商用版本。关于如何升级集群,请参见CCE集群升级指导。关于CCE集 - [1.23版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0090.md): 发布时间:2024/04/25华为云CCE集群1.23版本即将于2024/09/30 00:00(北京时间)正式停止维护,届时针对CCE集群1.23以及之前的版本,华为云将不再支持新集群创建。若您账号下存在1.23及之前的集群版本,为了保证您的服务权益,建议尽快升级到最新的商用版本。关于如何升级集群,请参见CCE集群升级指导。关于CCE集 - [1.21版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0087.md): 发布时间:2024/01/22华为云CCE集群1.21版本即将于2024/04/30 00:00(北京时间)正式停止维护,届时针对CCE集群1.21以及之前的版本,华为云将不再支持新集群创建。若您账号下存在1.21及之前的集群版本,为了保证您的服务权益,建议尽快升级到最新的商用版本。关于如何升级集群,请参见CCE集群升级指导。关于CCE集 - [1.19版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0081.md): 发布时间:2023/07/07华为云CCE集群1.19版本即将于2023/09/30 00:00(北京时间)正式停止维护,届时针对CCE集群1.19以及之前的版本,华为云将不再支持新集群创建。若您账号下存在1.19及之前的集群版本,为了保证您的服务权益,建议尽快升级到最新的商用版本。关于如何升级集群,请参见CCE集群升级指导。关于CCE集 - [1.17版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0082.md): 发布时间:2022/11/29根据CCE发布的Kubernetes版本策略中的版本策略,计划从2023年1月31日起,CCE将对1.17版本集群停止维护。在此之后,您仍可以使用您的1.17版本集群,但CCE将不再提供对该版本的技术支持,包含支持新的功能、社区bugfix回合、漏洞修复、升级等。建议您在版本停止维护前及时将集群升级到最新版本 - [1.15版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0083.md): 发布时间:2022/06/22根据CCE发布的Kubernetes版本策略中的版本策略,计划从2022年9月30日起,CCE将对1.15版本集群停止维护。建议您将集群升级到最新版本,升级操作请参见集群升级。 - [1.13版本集群停止维护公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0084.md): 发布时间:2022/03/11根据CCE发布的Kubernetes版本策略中的版本策略,从2022年3月11日起,CCE将对1.13版本集群停止维护。建议您将集群升级到最新版本,升级操作请参见集群升级。 - [CCE不再支持1.13及之前版本集群的创建公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0085.md): 发布时间:2020/12/08根据CCE发布的Kubernetes版本策略中的版本策略,从2021年3月1日之后,CCE将不再支持1.13及之前版本集群的创建及维护。建议您将集群升级到最新版本,升级操作请参见集群升级。 - [Kubernetes 1.9的集群版本升级公告](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0086.md): 发布时间:2020/12/07根据CCE发布的Kubernetes版本策略中的版本策略,CCE将在近期停止Kubernetes 1.9的集群版本的维护,为了能够更好地方便您使用云容器引擎服务,确保您使用稳定又可靠的Kubernetes版本,如果您仍在使用1.9.7或1.9.10版本集群,请尽快升级到较新版本集群,CCE预计将在2021年4 - [漏洞修复策略](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0011.md): 高危漏洞:Kubernetes社区发现漏洞并发布修复方案后,CCE一般在1个月内进行修复,修复策略与社区保持一致。操作系统紧急漏洞按照操作系统修复策略和流程对外发布,一般在一个月内提供修复方案,用户自行修复。Kubernetes社区发现漏洞并发布修复方案后,CCE一般在1个月内进行修复,修复策略与社区保持一致。操作系统紧急漏洞按照操作系统 - [Docker文件复制逃逸漏洞公告(CVE-2026-17106)](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0138.md): CVE-2026-17106(CopyEscape)是Docker软件中的一个高危漏洞。当执行docker cp命令时,Docker CLI在处理容器归档数据并执行文件提取时,对动态变化的文件结构缺少有效校验。攻击者可以利用文件系统竞态条件(TOCTOU)与有缺陷的符号链接检查相结合,绕过路径安全检查,进而实现向宿主机任意写入或覆盖文件的 - [NGINX Ingress控制器漏洞公告(CVE-2026-42533)](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0137.md): 该漏洞是一个NGINX模块的堆缓冲区溢出漏洞,对于命中触发配置的NGINX服务,该漏洞会导致Worker进程崩溃并重启,造成DoS攻击。在特定条件下,攻击者还可能实现远程代码执行(RCE)。Kubernetes社区Ingress NGINX控制器从v1.13.3开始使用NGINX 1.27.1,该版本位于CVE-2026-42533的受影 - [Linux Kernel rtmutex UAF本地提权/容器逃逸漏洞公告(CVE-2026-43499)](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0134.md): 近日,Linux内核被披露存在一个潜伏长达15年的本地权限提升漏洞,漏洞编号CVE-2026-43499,代号“GhostLock”。该漏洞存在于Linux内核的实时互斥锁(rtmutex)子系统中,本地低权限攻击者可通过利用futex系统中的竞态条件,获取悬空指针,最终在受影响系统上实现本地权限提升与容器逃逸等危害。CVE-2026-4 - [HTTP/2 Bomb 远程拒绝服务漏洞公告(CVE-2026-49975)](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0132.md): 近日,业界披露了一个影响广泛的HTTP/2协议实现漏洞,被命名为“HTTP/2 Bomb”。该漏洞源于HTTP/2协议中HPACK压缩机制与流控制机制的组合设计缺陷,允许未经身份验证的远程攻击者以极低的带宽发起攻击,造成目标服务器内存耗尽,进而导致服务完全不可用。CCE的NGINX Ingress控制器插件和Envoy Gateway插件 - [NGINX Ingress控制器漏洞公告(CVE-2026-42945)](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0121.md): 该漏洞是一个NGINX模块的堆缓冲区溢出漏洞,对于命中触发配置的NGINX服务,该漏洞会导致Worker进程崩溃并重启,造成DoS攻击。对于关闭了ASLR地址空间随机化的Nginx服务,可以被RCE攻击。Kubernetes社区Ingress NGINX控制器从v1.13.3开始使用NGINX 1.27.1,该版本位于CVE-2026-4 - [Linux内核权限提升漏洞公告(CVE-2026-43284、CVE-2026-43500)](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0118.md): 近期,业界公开了一个Linux内核高危本地权限提升(LPE)漏洞。它是继不久前的Copy Fail(CVE-2026-31431)之后,又一个利用内核页面缓存(Page Cache)写原语实现提权的逻辑漏洞,该漏洞被命名为Dirty Frag,可导致容器逃逸、权限提升,详情如下:CVE-2026-43284(xfrm/ESP路径):攻击者 - [Linux内核权限提升漏洞公告(CVE-2026-31431)](https://support.huaweicloud.com/bulletin-cce/cce_bulletin_0062.md): 近期,互联网披露 CVE-2026-31431 Linux Copy Fail 本地提权漏洞。由于Linux 内核加密子系统 authencesn模块中存在逻辑缺陷,攻击者通过 AF_ALG 套接字暴露的内核加密 API,配合 splice()系统调用,可实现对 setuid 二进制文件(如 /usr/bin/su)页缓存的 4 字节任意 - [NGINX Ingress控制器漏洞公告(CVE-2026-1580、CVE-2026-24512、CVE-2026-24513、CVE-2026-24514)](https://support.huaweicloud.com/bulletin-cce/CVE-2026-24514.md): Kubernetes社区近日公布了四个安全漏洞(CVE-2026-1580、CVE-2026-24512、CVE-2026-24513、CVE-2026-24514),这些漏洞可能允许攻击者执行任意代码或拒绝服务,详情如下:CVE-2026-1580是NGINX Ingress控制器中发现的一个高危安全漏洞。Ingress对象中的“ngi - [runc容器逃逸漏洞公告(CVE-2025-31133、CVE-2025-52565、CVE-2025-52881)](https://support.huaweicloud.com/bulletin-cce/CVE-2025-31133.md): runc是一个基于OCI标准实现的一个轻量级容器运行工具,是Docker、Containerd、Kubernetes等容器软件的核心基础组件。近日,runc社区披露了三个高危级别的漏洞(CVE-2025-31133、CVE-2025-52565、CVE-2025-52881),在启动新容器时存在容器逃逸、信息泄露和拒绝服务风险。CVE-2 - [Kubernetes安全漏洞公告(CVE-2025-5187)](https://support.huaweicloud.com/bulletin-cce/CVE-2025-5187.md): Kubernetes社区近日公布了一个安全漏洞(CVE-2025-5187),Node可以通过添加OwnerReference来删除自身。在Kubernetes的NodeRestriction准入控制器中存在一个漏洞:Node的user可以给自己的Node节点添加指向集群范围资源(cluster-scoped resource)的Owne - [Kubernetes安全漏洞公告(CVE-2025-7342)](https://support.huaweicloud.com/bulletin-cce/CVE-2025-7342.md): Kubernetes安全响应委员会披露了Kubernetes Image Builder中的一个安全漏洞(CVE-2025-7342),这些漏洞可能允许攻击者获得对虚拟机(VM)的root访问权限。使用Kubernetes Image Builder构建的镜像中启用了默认SSH用户名密码(builder用户),这可能允许攻击者获得虚拟机( - [Grafana安全漏洞公告(CVE-2025-4123)](https://support.huaweicloud.com/bulletin-cce/CVE-2025-4123.md): Grafana是一款开源的数据可视化和监控工具,广泛应用于各种企业和组织,用于收集、分析和展示来自不同数据源的指标和日志数据。在Grafana的自定义前端插件处理中发现了一个漏洞。该漏洞允许攻击者通过利用客户端路径遍历和开放重定向问题来执行跨站脚本(XSS)攻击,从而导致任意JavaScript执行和潜在的用户重定向到恶意网站。如果启用了 - [NVIDIA Container Toolkit容器逃逸漏洞公告(CVE-2025-23266、CVE-2025-23267)](https://support.huaweicloud.com/bulletin-cce/CVE-2025-23266.md): NVIDIA Container Toolkit是一个由NVIDIA提供的开源工具包,它允许您在容器化环境中利用NVIDIA GPU进行加速计算。工具包包括一个容器运行时库和实用程序,用于自动配置容器以利用NVIDIA GPU。在NVIDIA Container Toolkit v1.17.7及更早版本的环境中,攻击者通过运行一个恶意镜像 - [NGINX Ingress控制器漏洞公告(CVE-2025-1974、CVE-2025-1097、CVE-2025-1098、CVE-2025-24513、CVE-2025-24514)](https://support.huaweicloud.com/bulletin-cce/CVE-2025-1974.md): Kubernetes社区近日公布了五个安全漏洞(CVE-2025-1974、CVE-2025-1097、CVE-2025-1098、CVE-2025-24513、CVE-2025-24514),这些漏洞可能允许攻击者执行任意代码或拒绝服务,详情如下:CVE-2025-1974是NGINX Ingress控制器中发现的一个高危安全漏洞。该漏 - [Kubernetes安全漏洞公告(CVE-2025-0426)](https://support.huaweicloud.com/bulletin-cce/CVE-2025-0426.md): CVE-2025-0426是Kubernetes中的一个拒绝服务(DoS)漏洞,影响kubelet的只读HTTP端口。当攻击者向该端点发送大量/checkpoint接口请求时,可能会导致节点磁盘空间被迅速填满,从而引发节点拒绝服务。漏洞影响范围如下:kubelet v1.32.0 ~ v1.32.1kubelet v1.31.0 ~ v1 - [Kubernetes安全漏洞公告(CVE-2024-10220)](https://support.huaweicloud.com/bulletin-cce/CVE-2024-10220.md): Kubernetes社区近日公布了一个安全漏洞(CVE-2024-10220),该漏洞使得具有创建Pod权限的攻击者能够通过部署配置了gitRepo卷的Pod来执行容器外的任意命令。攻击者可以利用目标Git仓库中的钩子(hooks)目录,实现容器逃逸并执行攻击命令。受影响的集群版本如下: 续费管理”页面操作,只有订单状态是“使用中”的资源才能执行包年/包月转按需。可在“到期转按需项”页签查询已经设置到期转按需的资源。可对“ - [续费概述](https://support.huaweicloud.com/price-cce/cce_03_0013.md): 包年/包月的集群或节点到期后会影响服务正常运行。如果您想继续使用,需要在指定的时间内为集群或节点进行续费,否则集群及节点等资源会自动释放,数据丢失且不可恢复。续费操作仅适用于包年/包月的集群或节点,按需计费的资源不需要续费,只需要保证账户余额充足即可。包年/包月的集群或节点在到期前续费成功,所有资源得以保留,且运行不受影响。关于包年/包月 - [手动续费](https://support.huaweicloud.com/price-cce/cce_03_0014.md): 包年/包月的集群和节点从购买到被自动删除之前,您可以随时为其进行续费,以延长资源的使用时间。您也可以选择批量续费操作,即一次性为多台包年/包月的云服务器续费。操作如下:登录ECS控制台。在弹性云服务器列表页,勾选待续费的多台包年/包月云服务器。单击云服务器列表上方常用操作栏的“更多 > 续费”。在费用中心续费资源的方法适合所有资源,包括集 - [自动续费](https://support.huaweicloud.com/price-cce/cce_03_0015.md): 自动续费可以减少手动续费的管理成本,避免因忘记手动续费而导致资源被自动删除。自动续费的规则如下所述:以资源的到期日计算第一次自动续费日期和计费周期。资源自动续费周期以您选择的续费时长为准。例如,您选择了3个月,即在每次到期前自动续费3个月。在资源到期前均可开通自动续费,到期前7日凌晨3:00首次尝试自动续费,如果扣款失败,每天凌晨3:00 - [费用账单](https://support.huaweicloud.com/price-cce/cce_03_0016.md): 您可以在“费用中心 > 账单管理”查看资源的费用账单,以了解该资源在某个时间段的使用量和计费信息。包年/包月计费模式的资源完成支付后,会实时上报一条账单到计费系统进行结算。按需计费模式的资源按照固定周期上报使用量到计费系统进行结算。按需计费模式产品根据使用量类型的不同,分为按小时、按天、按月三种周期进行结算,具体扣费规则可以参考按需产品周 - [欠费说明](https://support.huaweicloud.com/price-cce/cce_03_0017.md): 您在使用云服务时,系统会在订单的结算周期结束后生成账单并执行扣款。如果结算时账户余额不足,您的账户将进入欠费状态。欠费后,可能会影响云服务资源的正常运行,请及时充值。华为云为客户提供充分的时间进行续费与充值,当您的包年/包月资源到期未续订或按需资源欠费时会依次进入宽限期和保留期,详情请参见宽限期保留期。包年/包月对于包年/包月资源,用户已 - [停止计费](https://support.huaweicloud.com/price-cce/cce_03_0018.md): 当不再使用云服务资源时,您可以将其退订或删除,从而避免持续产生费用。对于包年/包月计费模式的资源,例如包年/包月的集群、包年/包月的节点(弹性云服务器)等,用户在购买时会一次性付费,服务将在到期后自动停止使用。如果在计费周期内不再使用包年/包月资源,您可以执行退订操作,系统将根据资源是否属于五天无理由退订、是否使用代金券和折扣券等条件返还 - [计费FAQ](https://support.huaweicloud.com/price-cce/cce_03_0024.md): 云容器引擎CCE如何定价/收费?CCE集群的计费方式如何由按需改为包年包月?CCE创建的节点是否支持按需转包周期?华为云支持哪几种开具发票模式?CCE是否支持余额不足提醒?CCE是否支持账户余额变动提醒?包周期的CCE集群到期可以直接删除吗?如何退订我的云容器引擎? ## Kubernetes基础知识 - [概述](https://support.huaweicloud.com/basics-cce/kubernetes.md): Kubernetes是一个开源的容器编排部署管理平台,用于管理云平台中多个主机上的容器化应用。Kubernetes的目标是让部署容器化的应用简单并且高效,Kubernetes提供了应用部署、规划、更新、维护的一种机制。对应用开发者而言,可以把Kubernetes看成一个集群操作系统。Kubernetes提供服务发现、伸缩、负载均衡、自愈甚 - [基本概念](https://support.huaweicloud.com/basics-cce/kubernetes_0037.md): 云容器引擎(Cloud Container Engine,简称CCE)提供高度可扩展的、高性能的企业级Kubernetes集群。借助云容器引擎,您可以在云上轻松部署、管理和扩展容器化应用程序。云容器引擎提供Kubernetes原生API,支持使用kubectl,且提供图形化控制台,让您能够拥有完整的端到端使用体验。使用CCE前,建议先了解 - [容器](https://support.huaweicloud.com/basics-cce/kubernetes_0002.md): 容器技术起源于Linux,是一种内核虚拟化技术,提供轻量级的虚拟化,以便隔离进程和资源。尽管容器技术已经出现很久,却是随着Docker的出现而变得广为人知。Docker是第一个使容器能在不同机器之间移植的系统。它不仅简化了打包应用的流程,也简化了打包应用的库和依赖,甚至整个操作系统的文件系统能被打包成一个简单的可移植的包,这个包可以被用来 - [Kubernetes](https://support.huaweicloud.com/basics-cce/kubernetes_0003.md): Kubernetes是一个很容易地部署和管理容器化的应用软件系统,使用Kubernetes能够方便对容器进行调度和编排。对应用开发者而言,可以把Kubernetes看成一个集群操作系统。Kubernetes提供服务发现、伸缩、负载均衡、自愈甚至选举等功能,让开发者从基础设施相关配置等解脱出来。Kubernetes可以把大量的服务器看做一台 - [使用Kubectl命令操作集群](https://support.huaweicloud.com/basics-cce/kubernetes_0036.md): kubectl是Kubernetes集群的命令行工具,您可以将kubectl安装在任意一台机器上,通过kubectl命令操作Kubernetes集群。CCE集群的kubectl安装请参见通过kubectl连接集群。连接后您可以执行kubectl cluster-info查看集群的信息,如下所示。执行kubectl get nodes可以查 - [Pod:Kubernetes中的最小调度对象](https://support.huaweicloud.com/basics-cce/kubernetes_0006.md): 容器组(Pod)是Kubernetes创建或部署的最小单位。一个Pod封装一个或多个容器(Container)、存储资源(Volume)、一个独立的网络IP以及管理控制容器运行方式的策略选项。Pod使用主要分为两种方式:Pod中运行一个容器。这是Kubernetes最常见的用法,您可以将Pod视为单个封装的容器,但是Kubernetes是 - [Liveness Probe:健康检查机制](https://support.huaweicloud.com/basics-cce/kubernetes_0010.md): Kubernetes提供了自愈的能力,具体就是能感知到容器崩溃,然后能够重启这个容器。但是有时候例如Java程序内存泄漏了,程序无法正常工作,但是JVM进程却是一直运行的,对于这种应用本身业务出了问题的情况,Kubernetes提供了Liveness Probe机制,通过检测容器响应是否正常来决定是否重启,这是一种很好的健康检查机制。毫无 - [Label:组织Pod的利器](https://support.huaweicloud.com/basics-cce/kubernetes_0011.md): 当资源变得非常多的时候,如何分类管理就非常重要了,Kubernetes提供了一种机制来为资源分类,那就是Label(标签)。Label非常简单,但是却很强大,Kubernetes中几乎所有资源都可以用Label来组织。Label的具体形式是key-value的标记对,可以在创建资源的时候设置,也可以在后期添加和修改。以Pod为例,当Pod - [Namespace:资源分组](https://support.huaweicloud.com/basics-cce/kubernetes_0012.md): Label虽然好,但只用Label的话,那Label会非常多,有时候会有重叠,而且每次查询之类的动作都带一堆Label非常不方便。Kubernetes提供了Namespace来做资源组织和划分,使用多Namespace可以将包含很多组件的系统分成不同的组。Namespace也可以用来做多租户划分,这样多个团队可以共用一个集群,使用的资源用 - [无状态负载(Deployment)](https://support.huaweicloud.com/basics-cce/kubernetes_0014.md): Pod是Kubernetes创建或部署的最小单位,但是Pod是被设计为相对短暂的一次性实体,Pod可以被驱逐(当节点资源不足时)、随着集群的节点崩溃而消失。Kubernetes提供了Controller(控制器)来管理Pod,Controller可以创建和管理多个Pod,提供副本管理、滚动升级和自愈能力,其中最为常用的就是Deployme - [有状态负载(StatefulSet)](https://support.huaweicloud.com/basics-cce/kubernetes_0015.md): Deployment控制器下的Pod都有个共同特点,那就是每个Pod除了名称和IP地址不同,其余完全相同。需要的时候,Deployment可以通过Pod模板创建新的Pod;不需要的时候,Deployment就可以删除任意一个Pod。但是在某些场景下,这并不满足需求,比如有些分布式的场景,要求每个Pod都有自己单独的状态时,比如分布式数据库 - [普通任务(Job)和定时任务(CronJob)](https://support.huaweicloud.com/basics-cce/kubernetes_0016.md): Job和CronJob是负责批量处理短暂的一次性任务(short lived one-off tasks),即仅执行一次的任务,它保证批处理任务的一个或多个Pod成功结束。Job:是Kubernetes用来控制批处理型任务的资源对象。批处理业务与长期伺服业务(Deployment、StatefulSet)的主要区别是批处理业务的运行有头有 - [守护进程集(DaemonSet)](https://support.huaweicloud.com/basics-cce/kubernetes_0017.md): DaemonSet(守护进程集)在集群的每个节点上运行一个Pod,且保证只有一个Pod,非常适合一些系统层面的应用,例如日志收集、资源监控等,这类应用需要每个节点都运行,且不需要太多实例,一个比较好的例子就是Kubernetes的kube-proxy。DaemonSet跟节点相关,如果节点异常,属于该节点的DaemonSet Pod也不会 - [亲和与反亲和调度](https://support.huaweicloud.com/basics-cce/kubernetes_0018.md): 在守护进程集(DaemonSet)中讲到使用nodeSelector选择Pod要部署的节点,其实Kubernetes还支持更精细、更灵活的调度机制,那就是亲和(affinity)与反亲和(anti-affinity)调度。Kubernetes支持节点和Pod两个层级的亲和与反亲和。通过配置亲和与反亲和规则,可以允许您指定硬性限制或者偏好, - [ConfigMap](https://support.huaweicloud.com/basics-cce/kubernetes_0020.md): ConfigMap是一种用于存储应用所需配置信息的资源类型,用于保存配置数据的键值对,可以用来保存单个属性,也可以用来保存配置文件。通过ConfigMap可以方便地做到配置解耦,使得不同环境有不同的配置。下面示例创建了一个名为configmap-test的ConfigMap,ConfigMap的配置数据在data字段下定义。ConfigM - [Secret](https://support.huaweicloud.com/basics-cce/kubernetes_0021.md): Secret是一种加密存储的资源对象,您可以将认证信息、证书、私钥等保存在Secret中,而不需要把这些敏感数据暴露到镜像或者Pod定义中,从而更加安全和灵活。Secret与ConfigMap非常像,都是key-value键值对形式,使用方式也相同,不同的是Secret会加密存储,所以适用于存储敏感信息。Secret与ConfigMap相 - [容器网络](https://support.huaweicloud.com/basics-cce/kubernetes_0023.md): Kubernetes本身并不负责网络通信,但提供了容器网络接口CNI(Container Network Interface),具体的网络通信交由CNI插件来实现。开源的CNI插件非常多,像Flannel、Calico等。针对Kubernetes网络,CCE为不同网络模型的集群提供不同的网络插件实现,用于负责集群内网络通信。Kuberne - [Service](https://support.huaweicloud.com/basics-cce/kubernetes_0024.md): Pod创建完成后,如何访问Pod呢?直接访问Pod会有如下几个问题:Pod会随时被Deployment这样的控制器删除重建,那访问Pod的结果就会变得不可预知。Pod的IP地址是在Pod启动后才被分配,在启动前并不知道Pod的IP地址。应用往往都是由多个运行相同镜像的一组Pod组成,逐个访问Pod也变得不现实。举个例子,假设有这样一个应用 - [Ingress](https://support.huaweicloud.com/basics-cce/kubernetes_0025.md): Service是基于四层TCP和UDP协议转发的,而Ingress可以基于七层的HTTP和HTTPS协议转发,可以通过域名和路径做到更细粒度的划分,如下图所示。要想使用Ingress功能,必须在Kubernetes集群上安装Ingress Controller。Ingress Controller有很多种实现,最常见的就是Kubernet - [就绪探针(Readiness Probe)](https://support.huaweicloud.com/basics-cce/kubernetes_0026.md): 一个新Pod创建后,Service就能立即选择到它,并会把请求转发给Pod,那问题就来了,通常一个Pod启动是需要时间的,如果Pod还没准备好(可能需要时间来加载配置或数据,或者可能需要执行一个预热程序之类),这时把请求转给Pod的话,Pod也无法处理,造成请求失败。为解决上述问题,Kubernetes提供了就绪探针(Readiness - [网络策略(NetworkPolicy)](https://support.huaweicloud.com/basics-cce/kubernetes_0027.md): 网络策略(NetworkPolicy)是Kubernetes设计用来限制Pod访问的对象,相当于从应用的层面构建了一道防火墙,进一步保证了网络安全。NetworkPolicy支持的能力取决于集群的网络插件的能力。默认情况下,如果命名空间中不存在任何策略,则所有进出该命名空间中的Pod的流量都被允许。NetworkPolicy的Ingres - [Volume](https://support.huaweicloud.com/basics-cce/kubernetes_0029.md): 容器中的文件在磁盘上是临时存放的,当容器重建时,容器中的文件将会丢失,另外当在一个Pod中同时运行多个容器时,常常需要在这些容器之间共享文件,这也是容器不好解决的问题。 Kubernetes抽象出了Volume来解决这两个问题,也就是存储卷,Kubernetes的Volume是Pod的一部分,Volume不是单独的对象,不能独立创建,只能 - [PV、PVC和StorageClass](https://support.huaweicloud.com/basics-cce/kubernetes_0030.md): 上一章节介绍的HostPath是一种持久化存储,但是HostPath与节点为强绑定关系,当其所在节点发生故障并导致Pod被调度至其他节点时,由于数据仅保存在原节点本地,Pod可能无法挂载原有数据,存在数据丢失的风险。在Kubernetes中,如果希望Pod在重新调度(例如节点故障或升级)后依然能够访问之前的数据,就必须使用具备持久化能力的 - [ServiceAccount](https://support.huaweicloud.com/basics-cce/kubernetes_0032.md): Kubernetes中所有的访问,无论外部内部,都会通过API Server处理,访问Kubernetes资源前需要经过认证与授权。Authentication:用于识别用户身份的认证,Kubernetes分外部服务账号和内部服务账号,采取不同的认证机制,具体请参见认证与ServiceAccount。Authorization:用于控制用 - [RBAC](https://support.huaweicloud.com/basics-cce/kubernetes_0033.md): Kubernetes中完成授权工作的就是RBAC机制,RBAC授权规则是通过四种资源来进行配置。Role:角色,其实是定义一组对Kubernetes资源(命名空间级别)的访问规则。RoleBinding:角色绑定,定义了用户和角色的关系。ClusterRole:集群角色,其实是定义一组对Kubernetes资源(集群级别,包含全部命名空间 - [弹性伸缩](https://support.huaweicloud.com/basics-cce/kubernetes_0034.md): 在Pod的编排与调度章节介绍了Deployment这类控制器来控制Pod的副本数量,通过调整replicas的大小就可以达到给应用手动扩缩容的目的。但是在某些实际场景下,手动调整一是繁琐,二是速度没有那么快,尤其是在应对流量洪峰需要快速弹性时无法做出快速反应。Kubernetes支持Pod和集群节点的自动弹性伸缩,通过设置弹性伸缩规则,当 ## 快速入门 - [在CCE集群中部署NGINX无状态工作负载](https://support.huaweicloud.com/qs-cce/cce_qs_0003.md): 无状态工作负载(Deployment)是Kubernetes中的一种工作负载类型,通常适用于不需要考虑数据一致性和持久性的应用程序,例如Web服务器、应用服务器等典型应用场景。在无状态工作负载中,每个应用实例都是独立的,且实例之间没有运行状态的差异,因此即使某个实例发生故障,它负责接受的请求也可以被重新分配给其他健康的实例,从而保证服务的 - [在CCE集群中部署WordPress有状态工作负载](https://support.huaweicloud.com/qs-cce/cce_qs_0004.md): 有状态工作负载(StatefulSet)是Kubernetes中用于管理有状态应用的一种工作负载类型。与无状态工作负载不同,有状态工作负载需要保持数据的一致性和持久性,且每个应用实例具有独立的标识符,需要按顺序部署和扩展。典型的有状态应用场景包括数据库(如MySQL)、消息队列(如Kafka)等。本文将使用WordPress博客应用及My - [在CCE集群中通过Helm模板部署应用程序](https://support.huaweicloud.com/qs-cce/cce_qs_0007.md): Helm是一个Kubernetes应用程序包管理器,它可以简化部署、升级和管理Kubernetes应用程序的过程。Helm使用Charts(一种定义Kubernetes资源的打包格式)来封装Kubernetes部署的所有元素,包括应用程序代码、依赖项、配置文件和部署指令,使得复杂的Kubernetes应用能够以更加高效且一致的方式进行分发 ## 用户指南 - [高危操作一览](https://support.huaweicloud.com/usermanual-cce/cce_10_0054.md): 业务部署或运行过程中,用户可能会触发不同层面的高危操作,导致不同程度上的业务故障。为了能够更好地帮助用户预估及避免操作风险,本文将从集群/节点、网络与负载均衡、日志、云硬盘多个维度出发,为用户展示哪些高危操作会导致怎样的后果,以及为用户提供相应的误操作解决方案。 - [集群概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0430.md): 云容器引擎(Cloud Container Engine,简称CCE)是一个企业级的Kubernetes集群托管服务,支持容器化应用的全生命周期管理,为您提供高度可扩展的、高性能的云原生应用部署和管理方案。CCE Standard集群:是云容器引擎服务的标准版本集群,提供商用级容器集群服务,并完全兼容开源Kubernetes集群标准功能。 - [Kubernetes 1.36版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0131.md): 云容器引擎(CCE)严格遵循社区一致性认证,现已支持Kubernetes 1.36集群版本特性。本文介绍Kubernetes 1.36版本的变更说明。新增特性及特性增强API变更与弃用CCE对Kubernetes 1.36版本的增强参考链接Kubelet细粒度API授权(GA)在Kubernetes 1.36中,Kubelet细粒度API - [Kubernetes 1.35版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0117.md): 云容器引擎(CCE)严格遵循社区一致性认证,现已支持Kubernetes 1.35集群版本特性。本文介绍Kubernetes 1.35版本的变更说明。新增特性及特性增强API变更与弃用CCE对Kubernetes 1.35版本的增强参考链接PreferSameNode traffic distribution (GA)在Kubernete - [Kubernetes 1.34版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0108.md): 云容器引擎(CCE)严格遵循社区一致性认证,现已支持Kubernetes 1.34集群版本特性。本文介绍Kubernetes 1.34版本的变更说明。新增特性及特性增强API变更与弃用CCE对Kubernetes 1.34版本的增强参考链接RecoverVolumeExpansionFailure (GA)在Kubernetes 1.34 - [Kubernetes 1.33版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0105.md): 云容器引擎(CCE)严格遵循社区一致性认证,现已支持Kubernetes 1.33集群版本特性。本文介绍Kubernetes 1.33版本的变更说明。新增特性及特性增强API变更与弃用CCE对Kubernetes 1.33版本的增强参考链接允许微调CPU Manager的资源分配策略(GA)在Kubernetes 1.33中,CPUMan - [Kubernetes 1.32版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0104.md): 云容器引擎(CCE)严格遵循社区一致性认证,现已支持Kubernetes 1.32集群版本特性。本文介绍Kubernetes 1.32版本的变更说明。新增特性及特性增强API变更与弃用CCE对Kubernetes 1.32版本的增强参考链接SizeMemoryBackedVolumes(GA)在Kubernetes 1.32中,SizeM - [Kubernetes 1.31版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0099.md): 云容器引擎(CCE)严格遵循社区一致性认证,现已支持Kubernetes 1.31集群版本特性。本文介绍Kubernetes 1.31版本的变更说明。新增特性及特性增强API变更与弃用CCE对Kubernetes 1.31版本的增强参考链接StatefulSet起始序号(GA)在Kubernetes 1.31中,StatefulSetSt - [Kubernetes 1.30版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0095.md): 云容器引擎(CCE)严格遵循社区一致性认证,现已支持Kubernetes 1.30集群版本特性。本文介绍Kubernetes 1.30版本的变更说明。新增特性及特性增强API变更与弃用CCE对Kubernetes 1.30版本的增强参考链接Webhook匹配表达式(GA)在Kubernetes1.30版本中,Webhook匹配表达式特性进 - [Kubernetes 1.29版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0089.md): 云容器引擎(CCE)严格遵循社区一致性认证,现已支持Kubernetes 1.29集群版本特性。本文介绍Kubernetes 1.29版本的变更说明。新增特性及特性增强API变更与弃用非兼容变更CCE对Kubernetes 1.29版本的增强参考链接Service的负载均衡IP模式(Alpha)在Kubernetes1.29版本,Serv - [(停止维护)Kubernetes 1.28版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0068.md): 云容器引擎(CCE)严格遵循社区一致性认证,现已支持Kubernetes 1.28集群版本特性。本文介绍Kubernetes 1.28版本的变更说明。重要说明新增特性及特性增强API变更与弃用特性门禁及命令行参数CCE对Kubernetes 1.28版本的增强参考链接在Kubernetes 1.28版本,调度框架发生变化,减少无用的重试, - [(停止维护)Kubernetes 1.27版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0059.md): 云容器引擎(CCE)严格遵循社区一致性认证,现已支持Kubernetes 1.27集群版本特性。本文介绍Kubernetes 1.27版本相对于1.25版本所做的变更说明。主要特性弃用和移除CCE对Kubernetes 1.27版本的增强参考链接Kubernetes 1.27版本SeccompDefault特性已进入稳定阶段如需使用Sec - [(停止维护)Kubernetes 1.25版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0058.md): 云容器引擎(CCE)严格遵循社区一致性认证。本文介绍Kubernetes 1.25版本相对于1.23版本所做的变更说明。主要特性弃用和移除CCE对Kubernetes 1.25版本的增强参考链接Kubernetes 1.25版本Pod Security Admission进入稳定阶段,并移除PodSecurityPolicyPodSecu - [(停止维护)Kubernetes 1.23版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0027.md): 云容器引擎(CCE)严格遵循社区一致性认证。本文介绍CCE发布Kubernetes 1.23版本所做的变更说明。社区1.23 ReleaseNotesFlexVolume废弃,建议使用CSI。HorizontalPodAutoscaler v2版本GA,HorizontalPodAutoscaler API v2在1.23版本中逐渐稳定。 - [(停止维护)Kubernetes 1.21版本说明](https://support.huaweicloud.com/usermanual-cce/cce_bulletin_0026.md): 云容器引擎(CCE)严格遵循社区一致性认证。本文介绍CCE发布Kubernetes 1.21版本所做的变更说明。社区1.21 ReleaseNotesCronJob现在已达到稳定状态,版本号变为batch/v1。不可变的Secret和ConfigMap现在已升级到稳定状态。向这些对象添加了一个新的不可变字段,以拒绝更改。此拒绝可保护集群免 - [(停止维护)Kubernetes 1.19版本说明](https://support.huaweicloud.com/usermanual-cce/cce_whsnew_0010.md): 云容器引擎(CCE)严格遵循社区一致性认证。本文介绍CCE发布Kubernetes 1.19版本所做的变更说明。社区1.19 ReleaseNotes增加对vSphere in-tree卷迁移至vSphere CSI驱动的支持。in-tree vSphere Volume插件将不再使用,并在将来的版本中删除。apiextensions.k - [(停止维护)Kubernetes 1.17版本说明](https://support.huaweicloud.com/usermanual-cce/cce_whsnew_0007.md): 云容器引擎(CCE)严格遵循社区一致性认证。本文介绍CCE发布Kubernetes 1.17版本所做的变更说明。apps/v1beta1和apps/v1beta2下所有资源不再提供服务,使用apps/v1替代。extensions/v1beta1下daemonsets、deployments、replicasets不再提供服务,使用app - [(停止维护)Kubernetes 1.15版本说明](https://support.huaweicloud.com/usermanual-cce/cce_whsnew_0006.md): 云容器引擎(CCE)严格遵循社区一致性认证。本文介绍CCE发布Kubernetes 1.15版本所做的变更说明。为了能够更好地方便您使用容器服务,确保您使用稳定又可靠的Kubernetes版本,请您务必在维护周期结束之前升级您的Kubernetes集群。CCE针对Kubernetes v1.15版本提供了全链路的组件优化和升级,v1.15 - [(停止维护)Kubernetes 1.13版本说明](https://support.huaweicloud.com/usermanual-cce/cce_whsnew_0009.md): 云容器引擎(CCE)严格遵循社区一致性认证。本文介绍CCE发布Kubernetes 1.13版本所做的变更说明。社区v1.11与v1.13版本之间的CHANGELOGv1.12到v1.13的变化:https://github.com/kubernetes/kubernetes/blob/master/CHANGELOG/CHANGELOG - [(停止维护)Kubernetes 1.11版本说明](https://support.huaweicloud.com/usermanual-cce/cce_whsnew_0004.md): 云容器引擎(CCE)严格遵循社区一致性认证。本文介绍CCE发布Kubernetes 1.11版本所做的变更说明。社区v1.9与v1.11版本之间的CHANGELOGv1.10到v1.11的变化:https://github.com/kubernetes/kubernetes/blob/master/CHANGELOG/CHANGELOG- - [(停止维护)Kubernetes 1.9及之前版本说明](https://support.huaweicloud.com/usermanual-cce/cce_whsnew_0008.md): 云容器引擎(CCE)严格遵循社区一致性认证。本文介绍CCE发布Kubernetes 1.9及之前版本所做的变更说明。 - [CCE补丁版本发布记录](https://support.huaweicloud.com/usermanual-cce/cce_10_0405.md): v1.36版本v1.35版本v1.34版本v1.33版本v1.32版本v1.31版本v1.30版本v1.29版本更早版本更多更早的集群版本说明如下:除EulerOS 2.5操作系统外,CCE v1.25集群的节点均默认采用Containerd容器运行时,且v1.25以上集群将不再支持EulerOS 2.5操作系统。 - [集群类型对比](https://support.huaweicloud.com/usermanual-cce/cce_10_0342.md): CCE支持多种类型的集群创建,以满足您各种业务需求,如下为集群类型之间的区别,可帮助您选择合适的集群: - [不同集群规格的资源数据量说明](https://support.huaweicloud.com/usermanual-cce/cce_10_1112.md): 随着业务规模的不断扩张,单个Kubernetes集群节点数量的限制直接影响了业务的扩展性和灵活性。在现有集群中部署更多服务或实例时,可能会遇到集群资源不足的问题,导致服务部署失败或性能下降。不同集群规格的资源数据量可能存在瓶颈,您可以根据表1选择和业务规模适配的集群规格,满足大规模业务部署的需求,提升集群的资源利用率和业务承载能力。除节点 - [购买Standard/Turbo集群](https://support.huaweicloud.com/usermanual-cce/cce_10_0028.md): Standard/Turbo集群提供企业级的Kubernetes集群托管服务,支持容器化应用的全生命周期管理,能够实现高度可扩展的、高性能的云原生应用部署和管理方案。您可以通过云容器引擎控制台非常方便快速地创建Standard/Turbo集群。创建完成后,集群控制节点将由云容器引擎服务托管,您只需创建工作节点,帮助您降低集群运维成本,可实 - [在CCE Turbo分布式集群中使用边缘云资源](https://support.huaweicloud.com/usermanual-cce/cce_10_0840.md): 云资源根据部署位置、服务范围和功能特性,可以分为两种类型:中心云资源:集群部署在大型数据中心,提供全局覆盖、高弹性、全功能的云计算服务,如ECS、OBS等。边缘云资源:分布式部署在靠近数据源或终端用户的物理/虚拟设备,提供低延迟、本地化计算能力,如CloudPond等。CCE Turbo集群可以通过开启对分布式云(HomeZone/Clo - [使用KMS进行Secret落盘加密](https://support.huaweicloud.com/usermanual-cce/cce_10_0922.md): Secret落盘加密是Kubernetes提供的一种静态数据加密机制,通过配置EncryptionConfiguration,在Secret资源写入持久化存储(如etcd)时自动对其进行信封加密,确保敏感信息(如密码、证书、API密钥)不以明文形式存储。CCE基于华为云密码安全中心(DEW)的密钥管理服务(KMS),为托管集群提供开箱即用 - [nftables、iptables与IPVS如何选择](https://support.huaweicloud.com/usermanual-cce/cce_10_0349.md): kube-proxy是Kubernetes集群的关键组件,负责Service和其后端容器Pod之间进行负载均衡转发。CCE当前支持nftables(1.35及以上版本)、iptables和IPVS的服务转发模式,各有优缺点。nftables是Linux内核内置的新一代数据包过滤与管理框架,旨在替代传统iptables,解决其性能瓶颈与扩展 - [连接集群概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0961.md): 连接集群是指与集群进行通信并执行集群管理任务的过程。CCE集群是由多个节点组成的分布式系统,集群内部资源(如Pods、Services、Deployments 等)通常需要通过一些工具和方法进行集中管理和操作。连接集群的过程就是通过kubectl命令行工具、CloudShell、X509证书等与集群进行交互,进行资源创建、配置、监控和调试 - [通过kubectl连接集群](https://support.huaweicloud.com/usermanual-cce/cce_10_0107.md): kubectl是Kubernetes提供的一种命令行工具,它用于与Kubernetes集群进行交互,帮助用户管理集群中的资源、查看集群状态、部署应用程序、进行调试等操作。通过kubectl,您可以方便地在命令行界面上执行集群管理任务。如果客户端需要通过kubectl连接到CCE集群,可以选择两种访问方式:内网访问:客户端通过内网IP地址与 - [通过KooCLI+kubectl连接集群](https://support.huaweicloud.com/usermanual-cce/cce_10_1143.md): CCE现已在华为云命令行工具服务(Koo Command Line Interface,KooCLI)中集成了凭据插件,kubectl可通过执行凭据插件获得用户的IAM凭据来访问集群。该种方式避免了在本地保存用户静态证书,并且支持审计精准追溯至具体操作用户。CCE集群版本在v1.29.15-r80、v1.30.14-r80、v1.31.1 - [通过CloudShell连接集群](https://support.huaweicloud.com/usermanual-cce/cce_10_0671.md): CloudShell是一款用于管理与运维云资源的网页版Shell工具,它能够为用户提供一个即时的、预配置的环境。通过CloudShell连接集群,您无需在本地安装、配置或维护kubectl等工具,即可直接管理和操作集群,能够有效降低环境配置的复杂性。本文将以CCE Standard集群为例,介绍如何通过CloudShell连接CCE集群。 - [通过X509证书连接集群](https://support.huaweicloud.com/usermanual-cce/cce_10_0175.md): X509证书是CCE集群中身份验证和通信加密的核心机制。通过X509证书连接集群,能够确保只有经过授权的客户端可以访问集群,同时加密通信数据,防止传输过程中的窃听或篡改,从而保障通信的安全性、身份的真实性以及访问的合法性。如果您需要通过X509证书连接集群,需提前在控制台获取集群证书,并使用该证书配置客户端以访问CCE集群。下载的证书包含 - [通过自定义域名访问集群](https://support.huaweicloud.com/usermanual-cce/cce_10_0367.md): 主题备用名称(Subject Alternative Name,缩写SAN)允许将多种值(包括IP地址、域名等)与证书关联。SAN通常在TLS握手阶段被用于客户端校验服务端的合法性:服务端证书是否被客户端信任的CA所签发,且证书中的SAN是否与客户端实际访问的IP地址或DNS域名匹配。当客户端无法直接访问集群内网私有IP地址或者弹性公网I - [配置集群API Server公网访问](https://support.huaweicloud.com/usermanual-cce/cce_10_0864.md): 您可以为Kubernetes集群的API Server绑定弹性公网IP(EIP),使集群API Server具备公网访问能力。EIP需要涉及一定费用,具体请参见EIP价格计算器。通过绑定EIP实现公网访问,集群存在风险,建议绑定的EIP配置DDoS高防服务或配置API Server访问策略。绑定EIP将会短暂重启集群API Server并 - [吊销集群访问凭证](https://support.huaweicloud.com/usermanual-cce/cce_10_0744.md): 在多租户场景下,CCE会为每个用户生成一个独立的集群访问凭证(kubeconfig或X509证书),该凭证包含了用户身份及授权信息,以便其可以连接到相应的集群并执行授权范围内的操作。这种方式可以确保不同用户之间的隔离和安全性,同时也方便了管理和授权。但该凭证的有效时间一般为固定值,当持有该凭证的员工离职或已授权的凭证疑似泄露等场景发生时, - [管理集群概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0962.md): 在CCE Standard/Turbo集群中,管理集群是保障容器化应用高效、稳定运行的重要环节。CCE Standard/Turbo集群提供了一套完备的集群管理功能体系,涵盖集群配置、资源调度、安全管控及生命周期管理等全方位管理维度。您可依据实际业务需求,灵活选择相应操作对集群进行配置优化与运维管理,从而保障容器化应用的稳定运行与高效性能 - [修改CCE集群配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0213.md): 集群配置参数是分布式系统中用于定义节点行为、资源分配、通信规则、扩展策略等的底层规则集,会影响集群的性能、稳定性、扩展性和容错能力。通过调整CCE集群的配置参数,您可以对核心组件进行深度配置。集群配置参数主要分为以下几类,您可以根据需求进行调整。您可以通过以下方式进行配置。存量集群修改集群配置参数您可以通过API接口修改CCE集群配置参数 - [开启集群过载控制](https://support.huaweicloud.com/usermanual-cce/cce_10_0602.md): 集群过载是指系统的负载(如请求量、资源使用量等)超过了其自身的处理能力,导致系统性能下降甚至崩溃。而过载控制是一种动态调整机制,可以根据控制节点的资源压力,限制系统外部请求的并发量,从而维护控制节点和集群的稳定性和可靠性。在CCE Standard/Turbo集群中,您可以通过开启集群过载控制、监控集群过载情况、设置集群过载告警等操作,有 - [更新集群证书](https://support.huaweicloud.com/usermanual-cce/cce_10_1080.md): 通常情况下,Kubernetes集群依赖于多个证书链和凭据,这些证书的有效期管理和及时更新对于确保集群及其工作负载的安全性和完整性至关重要。CCE在创建集群时,会自动生成集群证书,用于保障CCE控制平面组件(kube-apiserver、etcd、kube-controller-manager、kube-scheduler等)与集群节点之 - [变更集群规格](https://support.huaweicloud.com/usermanual-cce/cce_10_0403.md): 集群规格是指集群支持管理的最大节点数量。当集群规格不能满足您的诉求时,可通过“变更集群规格”修改集群规模。方式说明适用场景自动升配开启后,当集群控制面负载过高或节点规模超出当前规格管理上限时,系统自动提升集群规格无突发高并发业务的中小规模集群,业务负载动态变化、节点规模持续增长的场景手动升配主动将集群规格变更为更大规格业务规模可预测、需要 - [更改集群节点的默认安全组](https://support.huaweicloud.com/usermanual-cce/cce_10_0426.md): 集群在创建时可指定自定义节点安全组,方便统一管理节点的网络安全策略。对于已创建的集群,支持修改集群默认的节点安全组。一个安全组关联的实例数量建议不超过1000个,否则可能引起安全组性能下降。更多关于安全组的限制请参考安全组限制。不支持指定控制节点的安全组,同时请谨慎修改集群控制节点的安全组规则,详情请参见集群安全组规则配置。请确认选择的安 - [删除集群](https://support.huaweicloud.com/usermanual-cce/cce_10_0212.md): 按需计费的集群支持直接删除,详情请参见删除按需计费的集群。包周期的集群不能直接删除,需进行集群退订(对于未超期集群)或释放(对于已超期未续费集群),详情请参见退订/释放包周期的集群。删除集群不会删除集群下包周期的资源,相关资源在集群删除后将会继续计费,请妥善处理。删除集群会删除集群下工作负载与服务,相关业务将无法恢复。在执行操作前,请确保 - [禁止删除集群](https://support.huaweicloud.com/usermanual-cce/cce_10_0927.md): 在实际使用过程中,您可能会遇到许多误删除集群的场景。例如,如果您的账号为多人协作使用,其他用户可能会误删除不属于自己的集群。因此,您可以为重要的集群设置禁止删除的保护措施,防止通过控制台或API误删除集群,避免集群中的重要数据丢失。如果您需要删除集群,请参见删除集群。 - [休眠/唤醒按需计费集群](https://support.huaweicloud.com/usermanual-cce/cce_10_0214.md): 当按需计费的集群暂时不需要使用时,您可以将其设置为休眠状态,有助于节省成本并减少资源浪费。集群休眠后,将无法在此集群上创建和管理工作负载等资源。集群唤醒过程中,可能会由于资源不足导致控制节点启动失败,从而导致集群唤醒失败,请过一段时间再次唤醒。集群唤醒后,需要3~5分钟进行数据初始化。建议您等待集群稳定运行后再进行业务下发。休眠按需计费集 - [续费包年/包月集群](https://support.huaweicloud.com/usermanual-cce/cce_10_0304.md): 包周期的集群超期未续费将会被系统删除,删除后集群内的节点以及运行的业务都将销毁。如果您想继续使用,则需要在指定的时间内为集群进行续费。本节以计费模式为包年/包月的集群为例,介绍如何为包周期集群续费。除本节介绍的方法外,您还可以选择开通自动续费,具体请参加开通自动续费。您已选择操作的资源(高亮显示)和其他资源有关联关系,请确认是否同时操作。 - [按需计费集群转包周期](https://support.huaweicloud.com/usermanual-cce/cce_10_0368.md): 当前在CCE中购买集群时支持按需计费和包年/包月(按周期)两种计费方式。按需计费购买的集群可以转为包年/包月计费的集群。如果您需要将按需计费的节点转为包年/包月计费,请参见按需节点转包年/包月。如果您在购买按需计费的集群后,想更换为包年/包月计费,可按如下步骤进行操作:包年/包月包年/包月集群续费 - [升级前须知](https://support.huaweicloud.com/usermanual-cce/cce_10_0302.md): 升级前,您可以在CCE控制台确认您的集群是否可以进行升级操作。确认方法请参见集群升级。升级集群前,您需要知晓以下事项:请务必慎重并选择合适的时间段进行升级,以减少升级对您的业务带来的影响。集群升级前,请参考Kubernetes版本发布说明了解每个集群版本发布的特性以及差异,否则可能因为应用不兼容新集群版本而导致升级后异常。例如,您需要检查 - [集群升级](https://support.huaweicloud.com/usermanual-cce/cce_10_0197.md): 云容器引擎(CCE)严格遵循社区一致性认证,每年发布3个Kubernetes版本,每个版本发布后提供至少24个月的维护周期,CCE保证维护周期内的Kubernetes版本的稳定运行。为了保障您的服务权益,请您务必在维护周期结束之前升级您的Kubernetes集群,您可在集群列表页面确认集群的Kubernetes版本,以及当前是否有新的版本 - [节点池升级](https://support.huaweicloud.com/usermanual-cce/cce_10_1119.md): 当CCE发布新版本的操作系统镜像或更新节点池配置时,已有节点无法自动更新,您需要手动对节点进行升级。如果CCE未发布新版本的操作系统镜像或节点池配置未发生更新,则不涉及节点池升级,页面中会显示“暂无可升级OS节点”。默认节点池和非默认节点池操作方式存在差异。该操作会通过重置节点的方式升级操作系统,节点上已运行的工作负载业务可能会由于单实例 - [集群状态检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0568.md): 集群升级后,需要检查集群状态是否为运行中状态。系统会自动为您检查集群状态是否正常,您可以根据诊断结果前往集群列表页面进行确认。当集群状态异常时,请联系技术支持人员。 - [节点状态检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0569.md): 集群升级后,需要检查节点状态是否为运行中状态。系统会自动为您检查集群内节点的状态,您可以根据诊断结果前往节点列表页面进行确认。集群节点异常时,建议您通过重置节点来解决,若无法解决,请联系技术支持人员。 - [跳过节点检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0567.md): 集群升级后,需要检测集群内是否有跳过升级的节点,这些节点可能会影响正常使用。系统会为您检查集群内是否存在跳过升级的节点,您可以根据诊断结果前往节点列表页进行确认。跳过的节点含有标签upgrade.cce.io/skipped=true。对于升级详情页面中跳过的节点,请在升级完毕后重置节点。重置节点会重置所有节点标签,可能影响工作负载调度, - [业务检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0561.md): 集群升级完毕,由用户验证当前集群正在运行的业务是否正常。业务不同,验证的方式也有所不同,建议您在升级前确认适合您业务的验证方式,并在升级前后均执行一遍。常见的业务确认方式有:业务界面可用监控平台无异常告警与事件关键应用进程无错误日志API拨测正常等若集群升级后您的在线业务有异常,请联系技术支持人员。 - [新建节点检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0565.md): 检查集群是否可以正常创建节点。若集群升级后您的集群无法创建节点,请联系技术支持人员。 - [新建Pod检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0566.md): 检查集群升级后,存量节点是否能新建Pod。检查集群升级后,新建节点是否能新建Pod。基于新建节点检查创建了新节点后,通过创建DaemonSet类型工作负载,在每个节点上创建Pod。建议您使用日常测试的镜像作为基础镜像。您可参照如下YAML部署最小应用Pod。该测试YAML将DaemonSet部署在default命名空间下,使用nginx: - [集群跨版本业务迁移](https://support.huaweicloud.com/usermanual-cce/cce_10_0210.md): 本章介绍在CCE中如何将老版本集群的业务迁移到新版本集群。适用于需要大幅度跨版本集群升级(如1.19.* 升级到1.28.*版本)的需求,可以接受新建新版本集群而进行业务迁移的升级方式。创建与老版本集群同规格同配置的集群,创建方法请参见购买Standard/Turbo集群。添加同规格节点,并且在节点上配置之前的手动配置项,创建方法请参见创 - [升级前检查项](https://support.huaweicloud.com/usermanual-cce/cce_10_0549.md): 集群升级前,系统将自动进行全面的升级前检查,当集群不满足升级前检查条件时将无法继续升级。为了能够更好地避免升级风险,本文提供全量的升级前检查问题及解决方案,帮助您对可能存在的升级故障进行预处理。 - [节点限制检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0431.md): 当前检查项包括以下内容:检查节点是否可用检查节点操作系统是否支持升级检查节点是否含有非预期的节点池标签检查K8s节点名称是否与云服务器保持一致检查到节点状态异常,请优先恢复若检查发现节点不可用,请登录CCE控制台,单击集群名称进入集群控制台,前往“节点管理”页面并切换至“节点”页签查看节点状态,请确保节点处于“运行中”状态。节点处于“安装 - [升级管控检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0432.md): 检查集群是否处于升级管控中。CCE基于以下几点原因,可能会暂时限制该集群的升级功能:基于用户提供的信息,该集群被识别为核心重点保障的生产集群。正在或即将进行其他运维任务,例如控制节点3AZ改造等。集群中存在容器运行时为Docker但OS与节点池配置不同的节点,您可以重置这部分节点后再次执行升级前检查。请根据界面日志联系技术支持人员了解限制 - [插件检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0433.md): 当前检查项包括以下内容:检查插件状态是否正常检查插件是否支持目标版本问题场景一:插件状态异常请登录CCE控制台,单击集群名称进入集群控制台,前往“插件中心”处查看并处理处于异常状态的插件。查看插件状态请登录CCE控制台,单击集群名称进入集群控制台,前往“插件中心”处查看并处理处于异常状态的插件。问题场景二:集群升级的目标版本已经不支持该插 - [Helm模板检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0434.md): 检查当前HelmRelease记录中是否含有目标集群版本不支持的K8s废弃API,可能导致升级后helm模板不可用。将HelmRelease记录中K8s废弃API转换为源版本和目标版本均兼容的API。该检查项解决方案已在升级流程中自动兼容处理,此检查不再限制。您无需关注并处理。 - [节点池检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0436.md): 检查节点池状态是否正常。检查升级后节点池操作系统或容器运行时是否支持。问题场景:节点池状态异常请登录CCE控制台,单击集群名称进入集群控制台,前往“节点管理”页面查看问题节点池状态。若该节点池状态处于伸缩中,请等待节点池伸缩完毕。查看节点池状态请登录CCE控制台,单击集群名称进入集群控制台,前往“节点管理”页面查看问题节点池状态。若该节点 - [安全组检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0437.md): 检查Node节点安全组规则中,协议端口为ICMP:全部,源地址为控制节点安全组的规则是否被删除。仅VPC网络模型的集群执行该检查项,非VPC网络模型的集群将跳过该检查项。优先级:填写为1。策略:选择“允许”。类型:选择“IPv4”。协议端口:选择“基本协议/ICMP”,端口号选择“全部”。源地址:选择“安全组”并设置为控制节点安全组。控制 - [残留待迁移节点检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0439.md): 检查节点是否需要迁移。该问题由于节点拉包组件异常或节点由比较老的版本升级而来,导致节点上缺少关键的系统组件导致。解决方案一请登录CCE控制台,单击集群名称进入集群控制台,前往“节点管理”页面,单击对应节点的“更多 > 重置节点”,详情请参见重置节点。节点重置完毕后,重试检查任务。重置节点会重置所有节点标签,可能影响工作负载调度,请在重置节 - [K8s废弃资源检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0440.md): 检查集群是否存在对应版本已经废弃的资源。问题场景一: 1.25及以上集群中的Service存在废弃的annotation:tolerate-unready-endpoints报错日志信息如下:some check failed in cluster upgrade: this cluster has deprecated service - [兼容性风险检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0441.md): 请您阅读版本兼容性差异,并确认不受影响。补丁升级不涉及版本兼容性差异。 - [节点上CCE Agent版本检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0442.md): 检测当前节点的CCE包管理组件cce-agent是否为最新版本。问题场景一: 错误信息为“you cce-agent no update, please restart it”。该问题是由于cce-agent没有重启导致,需要登录节点手动重启cce-agent。解决方式:登录节点执行:systemctl restart cce-agent - [节点CPU使用率检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0443.md): 检查节点CPU使用量是否超过90%。请在业务低峰时进行集群升级。请检查该节点的Pod部署数量是否过多,适当驱逐该节点上Pod到其他空闲节点。 - [节点磁盘检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0445.md): 当前检查项包括以下内容:检查节点关键数据盘使用量是否满足升级要求检查/tmp目录是否存在500MB可用空间节点升级过程中需要使用磁盘存储升级组件包,使用/tmp目录存储临时文件。问题场景一:控制节点磁盘使用量不满足升级要求请联系技术支持人员排查处理。请联系技术支持人员排查处理。问题场景二:用户节点磁盘使用量不满足升级要求请执行以下检查命令 - [节点DNS检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0446.md): 当前检查项包括以下内容:检查当前节点DNS配置是否能正常解析OBS地址检查当前节点是否能访问存储升级组件包的OBS地址节点升级过程中,需要从OBS拉取升级组件包。此项检查失败,请联系技术人员支持。 - [节点关键目录文件权限检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0447.md): 检查根目录权限是否正确。问题场景一: 错误信息为“user paas must have at least read and execute permissions on the root directory”。解决方案:节点根目录权限被修改导致paas用户没有根目录的读权限,这会导致升级时组件重启失败,建议将根目录权限修正为默认权限55 - [节点Kubelet检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0448.md): 检查节点kubelet服务是否运行正常。问题场景:kubelet状态异常kubelet异常时,节点显示不可用,请参考集群可用,但节点状态为“不可用”修复节点后,重试检查任务。kubelet异常时,节点显示不可用,请参考集群可用,但节点状态为“不可用”修复节点后,重试检查任务。 - [节点内存检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0449.md): 检查节点内存使用量是否超过90%。请在业务低峰时进行集群升级。请登录节点通过top命令查询进程的内存占用情况,并根据实际情况调整运行在节点上的业务。 - [节点时钟同步服务器检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0450.md): 检查节点时钟同步服务器ntpd或chronyd是否运行正常。问题场景一:ntpd运行异常请登录该节点,执行systemctl status ntpd命令查询ntpd服务运行状态。若回显状态异常,请执行systemctl restart ntpd命令后重新查询状态。以下为正常回显:ntpd运行状态若重启ntpd服务无法解决该问题,请联系技术 - [节点OS检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0451.md): 检查节点操作系统内核版本是否为CCE支持的版本。问题场景一:节点镜像非CCE标准镜像CCE节点运行依赖创建时的初始标准内核版本,CCE基于该内核版本做了全面的兼容性测试,非标准的内核版本可能在节点升级中因兼容性问题导致节点升级失败,详情请参见高危操作及解决方案。当前CCE不建议该类节点进行升级,建议您在升级前重置节点至标准内核版本。CCE - [节点CPU数量检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0452.md): 检查您的集群控制节点的CPU核心数量,要求控制节点的核心数量大于2核。当前您的控制节点CPU数量为2,可能会导致集群升级失败。请联系技术支持人员,将该集群控制节点扩容至4核及以上。 - [ASM网格版本检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0454.md): 当前检查项包括以下内容:检查集群是否使用ASM网格服务检查当前ASM版本是否支持目标集群版本先升级对应的ASM网格版本,再进行集群升级,ASM网格版本与集群版本适配规则如下表。ASM网格版本与集群版本适配规则ASM网格版本集群版本1.3v1.13、v1.15、v1.17、v1.191.6v1.15、v1.171.8v1.15、v1.17、 - [节点Ready检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0455.md): 检查集群内节点是否Ready。问题场景一:节点状态显示不可用请登录CCE控制台,单击集群名称进入集群控制台,前往“节点管理”,筛选出状态不可用的节点后,请参照控制台提供的“修复建议”修复该节点后重试检查。请登录CCE控制台,单击集群名称进入集群控制台,前往“节点管理”,筛选出状态不可用的节点后,请参照控制台提供的“修复建议”修复该节点后重 - [节点journald检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0456.md): 检查节点上的journald状态是否正常。请登录该节点,执行systemctl is-active systemd-journald命令查询journald服务运行状态。若回显状态异常,请执行systemctl restart systemd-journald命令后重新查询状态。以下为正常回显:若重启journald服务无法解决该问题,请 - [节点干扰ContainerdSock检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0457.md): 检查节点上是否存在干扰的Containerd.Sock文件。该文件影响Euler操作系统下的容器运行时启动。问题场景:节点使用的docker为定制的Euler-docker而非社区的docker - [内部错误异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0458.md): 该检查非常规检查项,表示升级前检查流程中出现了内部错误。该问题出现后,请您优先重试升级前检查;若重试升级前检查仍失败,请您提交工单,联系技术支持人员。 - [节点挂载点检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0459.md): 检查节点上是否存在不可访问的挂载点。问题场景:节点上存在不可访问的挂载点节点存在不可访问的挂载点,通常是由于该节点或节点上的Pod使用了网络存储nfs(常见的nfs类型有obsfs、sfs等),且节点与远端nfs服务器断连,导致挂载点失效,所有访问该挂载点的进程均会出现D状态卡死。如上图所示,则为/root/foo和/root/bar这两 - [K8s节点污点检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0460.md): 检查节点上是否存在集群升级需要使用到的污点。问题场景:该节点为集群升级过程中跳过的节点。若该节点的VERSION与其他节点不同,则该节点为升级过程中跳过的节点,请在合适的时间重置节点后,重试检查。重置节点会重置所有节点标签,可能影响工作负载调度,请在重置节点前检查并保留您手动为该节点打上的标签。 - [everest插件版本限制检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0478.md): 检查集群当前everest插件版本是否存在兼容性限制。检测到当前everest版本存在兼容性限制,无法随集群升级,请联系技术支持人员。 - [cce-hpa-controller插件限制检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0479.md): 检查cce-hpa-controller插件的目标版本是否存在兼容性限制。检测到目标cce-hpa-controller插件版本存在兼容性限制,需要集群安装能提供metrics api的插件,例如metrics-server;请您在集群中安装相应metrics插件之后重试检查 - [增强型CPU管理策略检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0480.md): 检查当前集群版本和要升级的目标版本是否支持增强型CPU管理策略。问题场景:当前集群版本使用增强型CPU管理策略功能,要升级的目标集群版本不支持增强型CPU管理策略功能。升级到支持增强型CPU管理策略的集群版本,支持增强型CPU管理策略的集群版本如下表所示: - [用户节点组件健康检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0484.md): 检查用户节点的容器运行时组件和网络组件等是否健康。问题场景一:CNI Agent is not active如果您的集群版本在1.17.17以下,或者1.17.17以上且是隧道网络,请登录该节点,执行systemctl status canal命令查询canal服务运行状态,若回显状态异常,请执行systemctl restart can - [控制节点组件健康检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0485.md): 检查集群中的Kubernetes组件、容器运行时组件、网络组件等组件,要求在升级前以上组件运行正常。请您优先重试升级前检查;若重试检查仍失败时,请您提交工单,联系技术支持人员进行处理。 - [K8s组件内存资源限制检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0486.md): 检查K8s组件例如etcd、kube-controller-manager等组件是否资源超出限制。方案一:适当减少K8s资源。方案二:扩大集群规格,详情请参见变更集群规格。 - [K8s废弃API检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0487.md): 系统会扫描过去一天的审计日志,检查用户是否调用目标K8s版本已废弃的API或者API存在废弃的特性。由于审计日志的时间范围有限,该检查项仅作为辅助手段,集群中可能已使用即将废弃的API,但未在过去一天的审计日志中体现,请您充分排查。由于审计日志的时间范围有限,该检查项仅作为辅助手段,集群中可能已使用即将废弃的API,但未在过去一天的审计日 - [节点NetworkManager检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0489.md): 检查节点上的NetworkManager状态是否正常。请登录该节点,执行systemctl is-active NetworkManager命令查询NetworkManager服务运行状态。若回显状态异常,请执行systemctl restart NetworkManager命令后重新查询状态。如果上述操作无法解决,建议您进行重置节点操作 - [节点ID文件检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0490.md): 检查节点的ID文件内容是否符合格式。 - [节点配置一致性检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0491.md): 在升级集群版本至v1.19及以上版本时,将对您的节点上的Kubernetes组件的配置进行检查,检查您是否后台修改过配置文件。/opt/cloud/cce/kubernetes/kubelet/kubelet/opt/cloud/cce/kubernetes/kubelet/kubelet_config.yaml/opt/cloud/cc - [节点配置文件检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0492.md): 检查节点上关键组件的配置文件是否存在。当前检查文件列表如下:建议您进行重置节点操作,参考重置节点。如果您不想重置节点,请联系技术支持人员恢复配置文件后进行升级。 - [CoreDNS配置一致性检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0493.md): 检查当前CoreDNS关键配置Corefile是否同Helm Release记录存在差异,差异的部分可能在插件升级时被覆盖,影响集群内部域名解析。您可在明确差异配置后,单独升级CoreDNS插件。若要保留差异部分配置,您可采用以下方法之一:(推荐)将“parameterSyncStrategy”参数配置为“inherit”,差异配置将自动 - [节点Sudo检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0494.md): 检查当前节点sudo命令,sudo相关文件是否正常。问题场景一:sudo命令执行失败集群原地升级过程中依赖sudo命令正常可用,请登录节点执行如下命令,排查sudo命令可用性。sudo echo hello如果sudo命令不存在,请您从其他节点复制sudo命令到该节点。集群原地升级过程中依赖sudo命令正常可用,请登录节点执行如下命令,排 - [节点关键命令检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0495.md): 检查节点升级依赖的一些关键命令是否能正常执行。问题场景一:rpm包管理器命令执行失败检查到包管理器命令rpm命令执行失败,请登录节点排查下列命令的可用性。rpm -qa如果上述命令不可用,可通过以下命令恢复:rpm --rebuilddb如果上述操作无法解决,可以尝试重置节点解决,参考重置节点。检查到包管理器命令rpm命令执行失败,请登录 - [节点sock文件挂载检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0496.md): 检查节点上的Pod是否直接挂载docker/containerd.sock文件。升级过程中Docker/Containerd将会重启,宿主机sock文件发生变化,但是容器内的sock文件不会随之变化,二者不匹配,导致您的业务无法访问Docker/Containerd。Pod重建后sock文件重新挂载,可恢复正常。通常K8S集群用户基于如下 - [HTTPS类型负载均衡证书一致性检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0497.md): 检查HTTPS类型负载均衡所使用的证书,是否在ELB服务侧被修改。该问题的出现,一般是由于用户在CCE中创建HTTPS类型Ingress后,直接在ELB证书管理功能中修改了Ingress引用的证书,导致CCE集群中存储的证书内容与ELB侧不一致,进而导致升级后ELB侧证书被覆盖。该secret_id即为集群中对应Secret的metada - [节点挂载检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0498.md): 本文档提供了对节点挂载检查异常处理的排障指导,帮助用户解决在CCE节点中可能遇到的节点存储配置问题。检查子项1:挂载点冲突检查(checkMountPath)检查内容确保这些关键路径没有被意外挂载,CCE需要使用这些路径的子目录,如果路径本身已被挂载,节点重启或节点组件升级重启时可能因路径无法访问而导致异常:当存在vgpaas-share - [节点paas用户登录权限检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0499.md): 检查paas用户是否有登录权限。执行以下命令查看paas用户是否有登录权限:如果paas用户权限中带有"nologin"或者"false",说明paas用户没有登录权限,需要先恢复paas用户的登录权限。执行以下命令恢复paas用户权限之后重新检查: - [ELB IPv4私网地址检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0500.md): 检查集群内负载均衡类型的Service所关联的ELB实例是否包含IPv4私网IP。解决方案一:删除关联无IPv4私网地址ELB的负载均衡型Service。解决方案二:为无IPv4私网IP地址的ELB绑定一个私网IP。步骤如下:方法一:通过升级前检查的日志信息中,获取对应的ELB ID。然后前往ELB控制台通过ELB ID进行筛选。elbs - [检查历史升级记录是否满足升级条件](https://support.huaweicloud.com/usermanual-cce/cce_10_0501.md): 检查集群的历史升级记录,要求您的集群原始版本满足升级到目标集群版本的条件。该问题一般由于您的集群从比较老的版本升级而来,升级风险较大,建议您优先考虑集群迁移若您仍然想要升级该集群,请您提交工单,联系技术支持人员进行评估。 - [检查集群管理平面网段是否与主干配置一致](https://support.huaweicloud.com/usermanual-cce/cce_10_0502.md): 检查集群管理平面网段是否与主干配置一致。该问题由于您的局点做过管理面网段配置修改,导致主干配置中的管理平面网段不一致;请您提交工单,联系技术支持人员修改配置之后重启检查。 - [CCE AI套件(NVIDIA GPU)插件检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0503.md): 检查到本次升级涉及CCE AI套件(NVIDIA GPU)插件,可能影响新建GPU节点时GPU驱动的安装。由于当前CCE AI套件(NVIDIA GPU)插件的驱动配置由您自行配置,需要您验证两者的兼容性。建议您在测试环境验证安装升级目标版本的GPU插件,并配置当前GPU驱动后,测试创建节点是否正常使用。您可以执行以下步骤确认CCE AI - [节点系统参数检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0504.md): 检查您节点上系统参数是否符合预期。场景一:如您的BMS节点上bond0网络的MTU值非默认值1500,将出现该检查异常。非默认参数可能导致业务丢包,请改回默认值。请按照如下步骤修改:先关闭bond0网卡。sudo ip link set dev bond0 down关闭bond0网卡将导致业务断流,请评估风险后谨慎执行。修改MTU值为15 - [残留packageversion检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0505.md): 检查当前集群中是否存在残留的packageversion。检查提示您的集群中存在残留的CRD资源10.12.1.109,该问题一般由于CCE早期版本节点删除后,对应的CRD资源未被清除导致。您可以尝试手动执行以下步骤:若其状态仍然处于运行态,停止该组件或关机节点。 - [节点命令行检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0506.md): 检查节点中是否存在升级所必须的命令。该问题一般由于节点上缺少集群升级流程中使用到的关键命令,可能会导致集群升级失败。报错信息如下:以上报错代表您的节点上缺少了chage、chown、chmod、mkdir、in、touch、pidof等命令,请安装对应命令之后重新检查。 - [节点交换区检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0507.md): 检查集群CCE节点的上是否开启了交换区。CCE节点默认关闭swap交换区,请您确认手动开启交换区的原因,并确定关闭影响;若确定无影响后请执行swapoff -a命令关闭交换区之后重新检查。 - [NGINX Ingress控制器插件升级检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0508.md): 检查项一:检查集群中是否存在未指定Ingress类型(annotations中未添加kubernetes.io/ingress.class: nginx)的Nginx Ingress路由。检查项二:检查Nginx Ingress Controller后端指定的DefaultBackend Service是否存在。检查项三:检查Nginx - [云原生监控插件升级检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0509.md): 在集群升级过程中,云原生监控插件从3.9.0之前的版本升级至3.9.0之后的版本时,存在兼容性问题,需检查该插件是否已开启grafana开关。由于云原生监控插件在3.9.0之后的版本,不再聚合grafana的能力,因此升级前需要重新安装开源版本grafana插件。重新安装grafana不会影响已有的数据。手动创建的grafana的服务(s - [Containerd Pod重启风险检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0510.md): 检查当前集群内使用containerd的节点在升级containerd组件时,节点上运行的业务容器是否可能发生重启,造成业务影响。检测到您的节点上的containerd服务存在重启风险;请确保在业务影响可控的前提下(如业务低峰期)进行集群升级,以消减业务容器重启带来的影响;如需帮助,请提交工单联系运维人员获取支持。 - [CCE AI套件(NVIDIA GPU)插件关键参数检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0511.md): 检查CCE AI套件(NVIDIA GPU)插件中部分配置是否被侵入式修改,被侵入式修改的插件可能导致升级失败。 - [GPU/NPU Pod重建风险检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0512.md): 检查当前集群升级重启kubelet时,节点上运行的GPU/NPU业务容器是否可能发生重建,造成业务影响。请确保在业务影响可控的前提下(如业务低峰期)进行集群升级,以消减业务容器重建带来的影响;如需帮助,请您提交工单联系运维人员获取支持。 - [ELB监听器访问控制配置项检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0513.md): 检查当前集群Service是否通过annotation配置了ELB监听器的访问控制。若有配置访问控制则检查相关配置项是否正确。如果配置项存在错误,请参考为负载均衡类型的Service配置黑名单/白名单访问策略进行重新配置。 - [控制节点子网配额检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0515.md): 检查本次升级集群子网剩余可用IP数量是否支持滚动升级。该问题一般因为您选择的集群子网的IP数量不够,无法支持滚动升级。根据可用IP数判断:可用IP数 < 3:确认为子网IP配额不足,请执行下方解决方案。可用IP数 ≥ 3: 非子网IP配额问题,请排查其他原因,或提交工单联系运维人员支撑。适用场景:使用默认节点子网的节点闲置,删除该节点后可 - [节点运行时检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0516.md): 该告警通常发生在低版本集群升级到v1.27及以上集群。CCE不建议您在1.27以上版本集群中继续使用docker,并计划在未来移除对docker的支持。如果您的节点当前使用的运行时不是containerd,您可以通过节点重置功能将节点的运行时重置为containerd。如果您仍想在1.27以上集群中创建并使用docker节点,可跳过该告警 - [节点池运行时检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0517.md): 该告警通常发生在低版本集群升级到v1.27及以上集群。CCE不建议您在1.27以上版本集群中继续使用docker,并计划在未来移除对docker的支持。如果您的节点池当前选择的运行时不是containerd,您可以通过更新节点池功能将节点池的运行时修改为containerd。详情请参见将节点容器运行时从Docker迁移到Container - [检查节点镜像数量异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0518.md): 检查到您的节点上镜像数量过多(>1000个),可能导致docker启动过慢,影响docker标准输出,影响nginx等功能的正常使用。当节点上镜像数量过多时,您可以清除节点上残留的无用镜像。您可以使用以下命令删除悬空镜像,悬空镜像是指无标签()的镜像,通常是在构建或更新过程中遗留下来的。使用Docker容器运行时的节点:doc - [OpenKruise插件兼容性检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0519.md): 检查集群升级时,OpenKruise插件是否存在兼容性问题。Kubernetes社区在1.24版本移除了对dockershim的支持。CCE为兼顾用户使用docker运行时的习惯,在CCE的v1.25及以上的集群版本引入了cri-dockerd用于替换原来的dockershim,OpenKruise社区在v1.7.x版本后实现了对cri- - [Secret落盘加密特性兼容性检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0520.md): 检查本次升级的目标版本是否支持Secret落盘加密特性,若不支持则不允许开启Secret落盘加密特性的集群升级至该版本。CCE从v1.27版本开始支持Secret落盘加密特性,开放该特性的版本号如下:v1.27集群:v1.27.10-r0及以上v1.28集群:v1.28.8-r0及以上v1.29集群:v1.29.4-r0及以上其他更高版本 - [Ubuntu内核与GPU驱动兼容性提醒](https://support.huaweicloud.com/usermanual-cce/cce_10_0521.md): 检查到集群中同时使用CCE AI套件(NVIDIA GPU)插件和Ubuntu节点,提醒客户存在可能的兼容性问题。当Ubuntu内核版本在5.15.0-113-generic上时,GPU插件必须使用535.161.08及以上的驱动版本。您在升级后新创或者重置Ubuntu节点时,可能遇到该问题,请编辑CCE AI套件(NVIDIA GPU) - [排水任务检查异常处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0522.md): 检查到集群中存在未完成的排水任务,此时升级可能会导致升级完成后触发排水动作,将运行中的Pod进行驱逐。请将drainage资源进行删除,删除之后再次触发升级前检查。 - [节点镜像层数量异常检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0523.md): 检查到您的节点上镜像层数量过多(>5000层),可能导致docker/containerd启动过慢,影响docker/containerd标准输出。如果您集群中使用了nginx,可能会出现转发变慢等问题。请登录节点手动删除用不到的镜像,防止后续升级异常。 - [检查集群是否满足滚动升级条件](https://support.huaweicloud.com/usermanual-cce/cce_10_0524.md): 检查到您的集群暂时不满足滚动升级条件。该检查失败一般由于资源租户的资源配额不足引起,无法支持滚动升级;请联系运维人员扩充资源之后重新检查。 - [轮转证书文件数量检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0525.md): 检查您节点上的证书数量过多(>1000),由于升级过程中会批量处理证书文件,证书文件过多可能导致节点升级过慢,节点上Pod被驱逐等。方案一:优先建议您重置节点,详情请参考重置节点。方案二:修复节点上证书轮转异常问题。登录节点,并进入节点证书目录。cd /opt/cloud/cce/kubernetes/kubelet/pki/删除节点上残 - [Ingress与ELB配置一致性检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0526.md): 检查到您集群中Ingress配置与ELB配置不一致,请确认是否在ELB侧修改过Ingress自动创建的监听器、转发策略、转发规则、后端云服务器组、后端云服务器和证书配置。升级后会覆盖您在ELB自行修改的内容,请整改后再进行集群升级。根据诊断分析中的日志排查哪些资源需要整改,常见场景是在Ingress对接的监听器下配置了其他的转发策略,导致 - [集群网络组件的NetworkPolicy开关检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0527.md): 检查您集群网络组件的NetworkPolicy开关配置,如果您在集群控制节点上对NetworkPolicy开关进行过手动修改,那么升级过程中该配置会被刷新成默认值。根据诊断分析中的日志排查网络组件canal-controller的NetworkPolicy开关是否确实需要关闭。例如,集群通过云专线访问云外地址时,云外交换机不支持ip-op - [集群与节点池配置管理检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0528.md): 检查当前集群中网络组件配置(eni)中节点预热容器网卡回收阈值(nic-max-above-warm-target)是否超过允许设置的最大值。根据错误信息确认受影响的范围,例如:以上错误信息中说明存在两处eni/nic-max-above-warm-target配置异常:nodepool id(1786cd55-xxxx-xxxx-aac - [控制节点时区检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0529.md): 检查到您集群中控制节点实际时区与集群时区不一致,滚动升级后控制节点上的时区会变为集群时区。如果您集群中存在Cronjob,则可能会导致Cronjob在升级后触发一次非预期的执行。请在升级前关闭Cronjob后再次执行升级前检查,升级完成后开启Cronjob。 - [SnatIPRanges升级后变化检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0530.md): 检查SnatIPRanges在升级前后是否发生变化。仅CCE Turbo集群涉及。在CCE Turbo集群中,SnatIPRanges配置中的网段是云服务的保留网段。新建Pod时,系统会将SnatIPRanges配置写入到Pod的路由表中,用于Pod访问其他相关云服务。您可以通过以下命令查看集群中的SnatIPRanges:您也可以在Po - [插件配置一致性校验](https://support.huaweicloud.com/usermanual-cce/cce_10_0531.md): 如果您未通过CCE控制台的“插件中心”或更新插件API修改配置,而是直接修改插件的配置参数(一般是ConfigMap),则在插件升级时,这些手动修改的配置可能会被覆盖,从而影响业务运行。非强制升级场景若插件版本同时兼容升级前和升级后的集群版本,您可自行决定是否在集群升级时同步升级插件版本。若检查发现插件存在配置不一致但无需强制升级,您可选 - [VPC容器预留网段升级检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0532.md): 检查集群的VPC容器网段预留开关是否开启。建议您开启此开关,避免后续新增子网网段与容器网段发生冲突。v1.28.15-r70、v1.29.15-r30、v1.30.14-r30、v1.31.10-r30、v1.32.6-r30、v1.33.5-r20及以上版本的集群支持开启VPC容器网段预留功能,不支持的集群版本请升级到目标版本后再开启。 - [集群升级风险提示](https://support.huaweicloud.com/usermanual-cce/cce_10_1144.md): 该检查项为您提示本次升级需要注意的项目,请对照场景进行自检,确认无误后可跳过该检查项,继续升级。本次升级采用控制节点滚动升级方式,升级后控制节点IP地址将发生变更,可能会对部分业务场景存在影响。请根据以下场景进行自检确认:业务依赖检查:请确认是否在您的业务中使用了固定的控制节点IP。如果是,建议您调整业务配置,避免在业务中直接使用固定的控 - [集群管理最佳实践](https://support.huaweicloud.com/usermanual-cce/cce_10_0881.md): 本文将为您介绍与集群相关的最佳实践,包括集群规划、创建、管理和维护等方面,帮助您优化集群的性能、提高可靠性和安全性,从而更好地满足业务需求。 - [节点概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0180.md): 节点是容器集群组成的基本元素。节点取决于业务,既可以是虚拟机,也可以是物理机。每个节点都包含运行Pod所需要的基本组件,包括Kubelet、Kube-proxy 、Container Runtime等。CCE创建的Kubernetes集群包含控制节点和Node节点,本章讲述的节点特指Node节点,Node节点是集群的计算节点,即运行容器化 - [容器运行时说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0462.md): 容器运行时是Kubernetes最重要的组件之一,负责管理镜像和容器的生命周期。Kubelet通过Container Runtime Interface (CRI) 与容器运行时交互,以管理镜像和容器。CCE支持用户选择Containerd(1.23及以上版本集群支持)和Docker容器运行时,其中Containerd调用链更短,组件更少 - [节点操作系统说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0476.md): 本文为您提供当前已经发布的集群版本与操作系统版本的对应关系。v1.35及以上版本的集群默认采用nftables转发模式,该模式要求操作系统内核版本≥5.13,而Huawei Cloud EulerOS 1.1、EulerOS 2.9、EulerOS 2.10、CentOS 7.6的内核版本均不满足该要求,因此集群版本≥1.35时不再支持上 - [节点规格说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0719.md): 您可以通过本节快速浏览CCE支持的节点规格清单及相关特性,帮助您选择合适的机型规格。不同区域支持的节点规格(flavor)不同,且节点规格存在新增、售罄下线等情况,建议您在使用前登录CCE控制台,在创建节点界面查看您需要的节点规格是否支持。对于CCE Turbo集群,由于Pod需要占用节点弹性网卡/辅助弹性网卡,每个节点可以创建最大Pod - [创建节点](https://support.huaweicloud.com/usermanual-cce/cce_10_0363.md): 已创建至少一个集群。如果您需要使用密钥对登录节点,请新建一个密钥对,用于远程登录节点时的身份认证。创建方法请参见创建密钥对。若您使用密码登录节点,则可忽略此操作。若您使用密码登录节点,则可忽略此操作。创建节点过程中依赖OBS等周边服务,因此节点所在子网的DNS配置不可修改。集群开启IPv4/IPv6双栈时,所选节点子网不允许开启DHCP无 - [纳管节点](https://support.huaweicloud.com/usermanual-cce/cce_10_0198.md): CCE集群支持两种添加节点的方式:创建节点和纳管节点,纳管节点是指将已有的ECS/BMS加入到CCE集群中,所纳管节点的计费模式支持按需计费和包年/包月两种类型。纳管时,如果您选择将所选弹性云服务器的操作系统重置为CCE提供的标准公共镜像,您需要重新设置密码或密钥,原有的密码或密钥将会失效。所选弹性云服务器挂载的系统盘、数据盘都会在纳管时 - [登录节点](https://support.huaweicloud.com/usermanual-cce/cce_10_0185.md): 在进行节点故障排除、节点性能监控或执行自定义脚本等操作时,您可以登录相应的ECS实例。使用SSH方式登录时,请确认节点安全组已放通SSH端口(默认为22)。详情请参见配置安全组规则。通过公网使用SSH方式登录时要求该节点(弹性云服务器 ECS)已绑定弹性公网IP。只有运行中的弹性云服务器才允许用户登录。Linux操作系统用户名为root。 - [管理节点标签](https://support.huaweicloud.com/usermanual-cce/cce_10_0004.md): 节点标签可以给节点打上不同的标签,给节点定义不同的属性,通过这些标签可以快速地了解各个节点的特点。节点标签的主要使用场景有两类。节点管理:通过节点标签管理节点,给节点分类。工作负载与节点的亲和与反亲和:通过为节点添加标签,您可以使用节点亲和性将Pod调度到特定节点,或使用反亲和性避免将其调度到特定节点,具体操作详情请参见设置节点亲和调度( - [管理节点污点](https://support.huaweicloud.com/usermanual-cce/cce_10_0352.md): 污点(Taint)能够使节点排斥某些特定的Pod,从而避免Pod调度到该节点上。在CCE控制台上同样可以管理节点的污点,且可以批量操作。填写需要操作污点的“键”和“值”,选择污点的效果,单击“确定”。节点污点是与“效果”相关联的键值对。以下是可用的效果:NoSchedule:不能容忍此污点的 Pod 不会被调度到节点上;现有 Pod 不会 - [重置节点](https://support.huaweicloud.com/usermanual-cce/cce_10_0003.md): 您可以通过重置节点修改节点的配置,比如修改节点操作系统、登录方式等。重置节点会重装节点操作系统,并重新安装节点上Kubernetes软件。如果您在使用过程中修改了节点上的配置等操作导致节点不可用,可以通过重置节点进行修复。v1.13及以上版本的CCE Standard集群、CCE Turbo集群支持重置节点。v1.15及以上版本的鲲鹏集群 - [移除节点](https://support.huaweicloud.com/usermanual-cce/cce_10_0338.md): 在集群中移除节点会将该节点移出集群,然后重装节点的操作系统,并清理节点上的CCE组件。移除不会删除节点对应的服务器。移除前请确认您的正常业务运行不受影响,请谨慎操作。节点移出集群后会继续开机运行,并继续产生费用。若节点在CCE集群移除后重装操作系统失败,请手动完成失败节点的操作系统重装,并在重装后登录节点执行清理脚本完成CCE组件清理,具 - [同步云服务器](https://support.huaweicloud.com/usermanual-cce/cce_10_0184.md): 集群中的每一个节点对应一台云服务器,集群节点创建成功后,您仍可以根据需求,修改云服务器的名称或变更规格。由于规格变更对业务有影响,建议一台成功完成后再对下一台进行规格变更。CCE节点的部分信息是独立于弹性云服务器ECS维护的,当您在ECS控制台修改云服务器的名称、弹性公网IP,以及变更计费方式或变更规格后,需要通过同步云服务器功能将信息同 - [节点排水](https://support.huaweicloud.com/usermanual-cce/cce_10_0605.md): 您可以通过控制台、kubectl命令行或API使用节点排水功能,系统会将节点设置为不可调度,然后安全地将节点上所有符合节点排水规则说明的Pod驱逐,后续新建的Pod都不会再调度到该节点。在节点故障场景下,该功能可帮助您快速排空节点,将故障节点进行隔离,原节点上被驱逐的Pod将会由工作负载controller转移到其他正常可调度的节点上。为 - [删除/退订节点](https://support.huaweicloud.com/usermanual-cce/cce_10_0186.md): 当您不再需要该节点继续工作时,请您在CCE控制台的节点列表中执行删除按需节点或退订包年/包月节点的标准化操作,请勿使用kubectl delete node的方式手动移除节点,以免带来不符合预期的效果。在CCE集群中删除/退订节点会将该节点以及节点内运行的业务都销毁,请您在操作前提前进行排水和数据备份,确保正常业务运行不受影响。删除节点会 - [按需节点转包年/包月](https://support.huaweicloud.com/usermanual-cce/cce_10_0407.md): 当前在CCE中购买节点时支持按需计费和包年/包月(按周期)两种计费方式。按需计费购买的节点可以转为按周期计费的节点。按需节点池中的节点转为包年/包月时,需要将集群升级到v1.19.16-r40、v1.21.11-r0、v1.23.9-r0、v1.25.4-r0及以上版本。当按需节点池中的节点转为包年/包月后,该节点不支持弹性缩容。按需计费 - [包年/包月节点修改自动续费配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0837.md): 购买包年/包月计费模式的节点后,您可以根据需求为您的节点开通自动续费,或者修改已有的自动续费配置。选择续费时长:支持设置每次续费的时长,每次续费最短为1个月,最长为1年。自动续费次数:勾选后,可设置自定义的续费次数,超出该次数后将不再自动续费。不设置自动续费次数时,默认为不限次数。如果节点上绑定了EIP等资源,您可以通过勾选该资源决定是否 - [节点关机](https://support.huaweicloud.com/usermanual-cce/cce_10_0036.md): 集群中的节点关机后,该节点以及节点内的业务将停止运行,且该节点将被设置为不可调度状态。节点关机前,请先确认您的正常业务运行将不受影响,请谨慎操作。大部分节点关机后不再收费,特殊实例(包含本地硬盘,如磁盘增强型,超高I/O型等)关机后仍然正常收费,具体请参见ECS计费模式。节点关机会涉及Pod迁移,可能会影响业务,请在业务低峰期操作。操作过 - [节点滚动升级](https://support.huaweicloud.com/usermanual-cce/cce_10_0276.md): 节点滚动升级就是先创建新节点,然后将工作负载迁移到新的节点上,再删除旧节点。迁移流程如图1所示。现有节点和工作负载待迁移的节点必须在同一集群。当前仅支持在Kubernetes v1.13.10及以后集群版本执行此操作。默认节点池DefaultPool不支持修改配置。给需要迁移工作负载的节点打上Taint(污点)。kubectl taint - [节点预留资源策略说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0178.md): 节点的部分资源需要运行一些必要的Kubernetes系统组件和Kubernetes系统资源,使该节点可作为您的集群的一部分。 因此,您的节点资源总量与节点在Kubernetes中的可分配资源之间会存在差异。节点的规格越大,在节点上部署的容器可能会越多,所以Kubernetes自身需预留更多的资源。为了保证节点的稳定性,CCE集群节点上会根 - [默认数据盘空间分配说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0341.md): 本章节将详细介绍节点数据盘空间分配的情况,以便您根据业务实际情况配置数据盘大小。v1.23.18-r0、v1.25.13-r0、v1.27.10-r0、v1.28.8-r0、v1.29.4-r0以下版本的集群中,节点会添加一块默认数据盘供容器运行时和Kubelet组件使用,您可以根据需要自定义默认数据盘的空间分配。v1.23.18-r0、 - [节点可创建的最大Pod数量说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0348.md): 根据集群类型不同,节点可创建的最大Pod数量计算方式如下:在创建CCE集群时,如果网络模型选择VPC网络,根据VPC网络模型的Pod IP地址分配规则(详见Pod IP地址管理),您需要选择每个节点可供分配的Pod IP数量(即alpha.cce/fixPoolMask参数)。该参数会影响节点上可以创建最大Pod的数量,因为使用容器网络时 - [CCE节点kubelet和runtime组件路径与社区原生配置差异说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0883.md): 为保证节点的系统稳定性,CCE将Kubernetes和容器运行时的相关组件单独存储在数据盘中。其中Kubernetes使用/mnt/paas/kubernetes目录,容器运行时使用/mnt/paas/runtime目录,并使用软链接的方式与社区默认路径保持一致。CCE节点kubelet和runtime默认路径与社区原生的配置差异可能带来 - [将节点容器运行时从Docker迁移到Containerd](https://support.huaweicloud.com/usermanual-cce/cce_10_0601.md): Kubernetes社区已经在v1.24版本中移除Dockershim,为保持与社区技术路线同步,并提升集群运行的稳定性与资源效率,强烈建议您将节点容器运行时从Docker逐步迁移至官方推荐的Containerd,以确保未来与Kubernetes版本的兼容性和持续支持。Containerd是Kubernetes支持的行业标准容器运行时,与 - [将节点迁移到cgroup v2](https://support.huaweicloud.com/usermanual-cce/cce_10_1136.md): Kubernetes社区在v1.25已正式GA支持cgroup v2,其采用统一层级结构,资源管理能力更强,且兼容Kubernetes后续新特性。自Kubernetes v1.31起,cgroup v1已进入维护模式,不再接收新功能;自Kubernetes v1.35起,cgroup v1已被标记为正式废弃。若您的集群版本为v1.31及以 - [可优化的节点系统参数列表](https://support.huaweicloud.com/usermanual-cce/cce_10_0409.md): CCE提供默认的节点系统参数在某些用户场景下可能出现性能瓶颈,因此用户可对部分节点系统参数进行自定义优化,节点系统参数如可优化的节点系统参数列表所示。修改节点系统参数具有一定的风险,需要您对Linux命令和Linux系统知识具有较高程度的了解,避免误操作引起节点故障。表1中的参数已经过测试验证,请勿自行修改其他参数以免引起节点故障。修改节 - [修改节点日志缓存内存占用量上限RuntimeMaxUse](https://support.huaweicloud.com/usermanual-cce/cce_10_0410.md): Journald是Linux中的日志系统,负责把日志信息写入二进制文件,并默认使用/run/log/journal目录作为日志缓存目录。Journald的配置文件位于节点/etc/systemd/journald.conf目录,其中RuntimeMaxUse参数表示日志缓存的最大内存占用量。若不配置RuntimeMaxUse,长时间运行会 - [修改最大文件句柄数](https://support.huaweicloud.com/usermanual-cce/cce_10_0411.md): 最大文件句柄数即打开文件数的最大限制,Linux系统中包含两个文件句柄限制:一个是系统级的,即所有用户的进程同时打开文件数的上限;一种是用户级的,即单个用户进程打开文件数的上限。但是在容器中,还有另一个文件句柄限制,即容器内部单进程最大文件句柄数。修改节点系统参数的命令仅在使用公共镜像时有效,使用私有镜像时本文中提供的命令仅供参考。登录节 - [修改节点内核参数](https://support.huaweicloud.com/usermanual-cce/cce_10_0412.md): 由于默认的Linux内核参数不一定符合所有用户场景,用户可通过修改节点上的/etc/sysctl.conf配置文件来更改内核参数。修改节点系统参数的命令仅在使用公共镜像时有效,使用私有镜像时本文中提供的命令仅供参考。节点重启后需执行sysctl -p用于刷新参数值。登录节点修改节点系统参数可能会在后续节点重置、升级过程中丢失,可能影响业务 - [修改节点进程 ID数量上限kernel.pid_max](https://support.huaweicloud.com/usermanual-cce/cce_10_0401.md): 进程 ID(PID)是节点上的一种基础资源,容易在尚未超出其它资源约束的时候触及进程ID数量上限,进而导致节点不稳定。您可以根据实际业务需求调整进程ID数量上限。CCE在2022年1月底将1.17及以上集群的节点公共操作系统EulerOS 2.5、CentOS 7.6、Ubuntu 18.04镜像kernel.pid_max默认值调整为4 - [配置节点故障检测策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0659.md): 节点故障检查功能依赖CCE节点故障检测插件,该插件实例会运行在每个节点上,对节点上的故障事件进行监控。本文介绍如何开启节点故障检测能力。集群中已安装CCE节点故障检测插件。当前支持以下配置:启用/停用:自定义某个检查项的开启或关闭。目标节点:检查项默认运行在全部节点,您可根据自身场景需求,通过节点标签自定义筛选满足条件的节点。如果设置多个 - [创建节点时执行安装前/后脚本](https://support.huaweicloud.com/usermanual-cce/cce_10_4659.md): 在创建节点时,对于需要在节点上安装一些工具或者进行安全加固等操作时,可以使用安装前/后脚本实现。本文为您提供正确使用安装前/后脚本的指导,帮助您了解和使用安装前/后脚本。如果有进阶的安装脚本使用需求,可以将脚本存放在OBS中,避免脚本字符数超限等问题,详情请参见创建节点时使用OBS桶实现自定义脚本注入。请避免使用执行耗时过长的安装前/后脚 - [云服务器事件处理建议](https://support.huaweicloud.com/usermanual-cce/cce_10_0946.md): 在云容器引擎CCE中,您可以采用弹性云服务器ECS实例作为Node节点来构建高可用的Kubernetes集群。在日常运维中,华为云会对ECS实例所在底层宿主机的软硬件故障进行预测和主动规避。当宿主机上的故障风险无法规避时,为避免因ECS实例的资源可用性或性能受损对您的业务造成更大的影响,系统会对受影响的ECS实例生成云服务器事件并进行上报 - [节点管理最佳实践](https://support.huaweicloud.com/usermanual-cce/cce_10_0884.md): 本文将为您介绍与节点管理相关的最佳实践,包括节点创建、管理和维护等方面,从而更好地满足业务需求。 - [节点池概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0081.md): 为帮助您更好地管理Kubernetes集群内的节点,云容器引擎CCE引入节点池概念。节点池是集群中具有相同配置的一组节点,一个节点池包含一个节点或多个节点。您可以在CCE控制台创建新的自定义节点池,借助节点池基本功能方便快捷地创建、管理和销毁节点,而不会影响整个集群。新节点池中所有节点的参数和类型都彼此相同,您无法在节点池中配置单个节点, - [新版节点池切换说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0918.md): 升级后的节点池,不仅融合了按需和包年/包月节点的灵活性,更在原有的全量能力基础上进一步增强配置管理,为您的资源管理带来更高效、更灵活的体验。灵活的资源配置:节点池提供更加灵活的节点类型,允许您根据即时需求创建按需节点,也可以选择成本效益更高的包年/包月节点。多元的实例选择:您可以基于业务需求,通过CPU和内存等参数筛选多种实例规格(如GP - [节点池多规格计费说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0648.md): 若节点池中选择了多个规格时,控制台中显示的是节点池默认规格的价格,在节点池创建或扩缩容过程中,将以实际创建的规格进行计费。示例,某一按需节点池中添加了两个规格类型,其中默认规格A价格(包含云硬盘价格)为0.5735元/小时,另一规格B价格为1.0015元/小时。节点池创建场景创建节点池时,节点数量设置为10,则实际将创建10个默认规格A的 - [创建节点池](https://support.huaweicloud.com/usermanual-cce/cce_10_0012.md): 本章介绍了如何添加运行节点池以及对节点池执行操作。要了解节点池的工作原理,请参阅节点池概述。基础配置节点配置:配置节点云服务器的规格与操作系统,为节点上的容器应用提供基本运行环境。节点配置参数参数参数说明节点类型请根据不同的业务诉求选择节点类型,然后您可以在节点规格列表中进一步选择合适的规格。CCE Standard集群支持以下类型:弹性 - [扩缩容节点池](https://support.huaweicloud.com/usermanual-cce/cce_10_0658.md): 节点池创建完成后,节点数量为0,此时无法运行业务,您需要继续扩容节点,保证节点资源可以支撑业务运行。当节点资源过剩时,您可以缩容节点,节省资源成本。默认节点池不支持扩缩容,如需调整节点数量,请通过创建节点(扩容)或删除/退订节点(缩容)。扩容节点即增加节点池中的节点数量,您可以指定每次扩容的节点规格和节点数。如果出现扩容节点失败(如资源不 - [为节点池中的每个节点自动创建弹性公网IP](https://support.huaweicloud.com/usermanual-cce/cce_10_0964.md): 为了优化节点绑定弹性公网IP(EIP)的过程,减少手动操作带来的不便和效率低下问题,您可以在创建节点池时配置自动创建EIP,新增节点池中的节点即可自动完成EIP绑定,确保每个节点具备外网访问能力。通过节点池自动创建的EIP默认与节点生命周期相同,CCE在创建EIP绑定ECS服务器的时候,会配置“EIP随实例释放”的策略(包周期EIP不支持 - [更新节点池](https://support.huaweicloud.com/usermanual-cce/cce_10_0653.md): 仅v1.19及以上版本的集群支持修改容器运行时、操作系统、系统盘/数据盘大小、数据盘空间分配、安装前/后执行脚本配置。修改节点池容器运行时、操作系统、安装前/后执行脚本时,修改后的配置仅对新增节点生效,存量节点如需同步配置,需要手动重置存量节点。节点池配置修改后,部分参数的生效机制不同,您可以在修改后的规格确认环节进行确认。基础配置基础配 - [更新弹性伸缩配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0727.md): 开启弹性伸缩功能可根据弹性伸缩策略自动伸缩,否则只能手动修改节点池下的节点数量。为保证节点池弹性伸缩功能的正常使用,需要在集群中安装CCE集群弹性引擎。若未安装CCE集群弹性引擎插件,单击“安装插件”,请根据业务需求配置插件参数后单击安装,并等待插件安装完成。插件配置详情请参见CCE集群弹性引擎。若已安装CCE集群弹性引擎插件,则可直接配 - [节点池配置管理](https://support.huaweicloud.com/usermanual-cce/cce_10_0652.md): 当集群默认的节点配置无法满足业务需求时,您可以在节点池维度自定义调整节点的kubelet、kube-proxy、容器运行时等组件的参数,对核心组件进行深度配置。通过精细调整这些参数,可以确保资源的高效利用,同时满足应用的负载需求。节点池支持的配置参数如下:kubelet组件配置kube-proxy组件配置容器运行时Docker配置(仅使用 - [纳管节点至节点池](https://support.huaweicloud.com/usermanual-cce/cce_10_0886.md): 如果您需要在购买ECS云服务器后将其添加到集群中的某个节点池中,或者将节点池的某个节点从集群里移除后将其重新添加到节点池,您可以通过纳管节点实现以上诉求。纳管时,会将所选弹性云服务器的操作系统重置为CCE提供的标准镜像,以确保节点的稳定性。所选弹性云服务器挂载的系统盘、数据盘都会在纳管时清理LVM信息,包括卷组(VG)、逻辑卷(LV)、物 - [复制节点池](https://support.huaweicloud.com/usermanual-cce/cce_10_0655.md): 通过CCE控制台可以方便地复制现有节点池的配置,从而创建新的节点池。新创建的节点池中无节点,需创建完成后手动扩容或开启弹性伸缩后添加节点。复制节点池操作仅复制节点池创建操作相关的节点规格、操作系统、存储网络等资源配置,以及标签、污点等高级配置;后置的弹性伸缩配置以及组件配置管理参数不会被继承。 - [同步节点池](https://support.huaweicloud.com/usermanual-cce/cce_10_0654.md): 在节点池配置更新后,节点池中的已有节点无法自动同步部分配置,您可以手动同步节点配置。在“节点管理”页面中操作在“集群升级”页面中操作批量同步过程中请勿删除或重置节点,否则可能导致节点池配置同步失败。该操作涉及重置节点,节点上已运行的工作负载业务可能会由于单实例部署、可调度资源不足等原因产生中断,请您合理评估升级风险,并挑选业务低峰期进行, - [升级操作系统](https://support.huaweicloud.com/usermanual-cce/cce_10_0660.md): 当CCE发布新版本的操作系统镜像时,已有节点无法自动升级,您可以手动进行批量升级。在“节点管理”页面中操作在“集群升级”页面中操作该操作会通过重置节点的方式升级操作系统,节点上已运行的工作负载业务可能会由于单实例部署、可调度资源不足等原因产生中断,请您合理评估升级风险,并挑选业务低峰期进行,或对关键业务应用设置PDB策略(Pod Disr - [节点自愈功能](https://support.huaweicloud.com/usermanual-cce/cce_10_1166.md): 节点自愈是CCE提供的节点故障自动恢复能力。当节点发生指定类型的故障且持续时间超过阈值时,系统将自动触发自愈任务,通过重启节点等方式尝试修复故障,减少人工干预,提升集群可用性。高级自愈依赖以下条件:已创建Kubernetes集群,且集群版本满足以下要求:v1.30集群:v1.30.14-r100及以上版本v1.31集群:v1.31.14- - [迁移节点](https://support.huaweicloud.com/usermanual-cce/cce_10_0656.md): 您可以将同一个集群下节点在节点池间进行迁移,具体迁移场景如表1。迁移场景迁移场景是否支持迁移操作步骤原节点池待迁移的目标节点池自定义节点池默认节点池(DefaultPool)支持迁移将自定义节点池中的节点迁移到默认节点池默认节点池(DefaultPool)自定义节点池v1.23及以上版本的集群支持将默认节点池中的节点迁移到自定义节点池自定 - [删除节点池](https://support.huaweicloud.com/usermanual-cce/cce_10_0657.md): 删除节点池,会先删除节点池中的节点,节点删除后,原有节点上的工作负载实例会自动迁移至其他节点池的可用节点。对于包周期(包年/包月)预付费的节点池不能直接删除,请先移除节点池下全部的节点。删除节点会导致与节点关联的本地持久存储卷类型的PVC/PV数据丢失,无法恢复,且PVC/PV无法再正常使用。删除节点时使用了本地持久存储卷的Pod会从删除 - [节点池管理最佳实践](https://support.huaweicloud.com/usermanual-cce/cce_10_0887.md): 本文将为您介绍与节点池管理相关的最佳实践,包括节点池创建、管理和弹性伸缩等方面,从而更好地满足业务需求。 - [超节点概述](https://support.huaweicloud.com/usermanual-cce/cce_10_1086.md): 超节点是指通过高速互联网络技术,由单台或多台高性能AI服务器组建而成的 “超级计算节点”,专门用于处理AI大模型训练与推理等对算力要求极高的任务。华为CloudMatrix 384超节点通过自主研发的Unified Bus(UB)网络,将384颗Snt9b23 NPU与192颗Kunpeng CPU无缝互联,能够构建高计算密度的异构算力单 - [管理超节点池和超节点](https://support.huaweicloud.com/usermanual-cce/cce_10_1087.md): CCE Standard/Turbo集群通过超节点池的形式管理超节点(Snt9b23)。在CCE中,可以通过超节点池查看超节点的规格等信息,并对超节点内单节点进行标签管理、污点管理、节点排水等操作。已在ModelArts服务中购买轻量算力集群,并已创建相应的超节点池和超节点,具体请参见轻量算力集群资源开通。CCE暂未开放超节点及超节点池的 - [工作负载概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0006.md): 工作负载是在Kubernetes上运行的应用程序。无论您的工作负载是单个组件还是协同工作的多个组件,您都可以在Kubernetes上的一组Pod中运行它。在Kubernetes中,工作负载是对一组Pod的抽象模型,用于描述业务的运行载体,包括Deployment、StatefulSet、DaemonSet、Job、CronJob等多种类型 - [创建无状态负载(Deployment)](https://support.huaweicloud.com/usermanual-cce/cce_10_0047.md): 无状态负载(Deployment)是指在运行中不会保持任何数据或状态的应用,这些应用每个实例都是相同的,可以随时创建、销毁或替换,而不会影响应用的功能,非常适合一些不需要存储数据的应用,如Web前端服务器或一些微服务。您可以使用无状态工作负载很容易地管理应用程序的生命周期,包括更新、回滚、扩容等操作。在创建工作负载前,您需要存在一个可用集 - [创建有状态负载(StatefulSet)](https://support.huaweicloud.com/usermanual-cce/cce_10_0048.md): 有状态负载(StatefulSet)是指那些在运行过程中需要保存数据或状态的应用,例如数据库、缓存服务、消息队列等。与无状态工作负载不同,有状态负载存在以下特点:固定标识符:有状态工作负载中的每个Pod都有一个固定的标识符,这个标识符与Pod的名字相关联,格式通常为-<序号>,例如一个名为web的Statef - [创建守护进程集(DaemonSet)](https://support.huaweicloud.com/usermanual-cce/cce_10_0216.md): 守护进程集(DaemonSet)是Kubernetes提供的工作负载类型之一,它可以确保全部(或者某些)节点上始终运行着一个Pod实例。一旦有新的节点加入集群,DaemonSet控制器就会自动在这个新节点上创建一个新的Pod。反之,当某个节点从集群中移除时,该节点上的Pod会被自动清理掉。DaemonSet适用于多种场景,特别是在需要在集 - [创建普通任务(Job)](https://support.huaweicloud.com/usermanual-cce/cce_10_0150.md): 普通任务(Job)是Kubernetes中用于管理批处理任务的工作负载,通常用于执行一次性或有限次的短任务。不同于长期运行的业务(如通过Deployment或StatefulSet管理的业务),Job会创建一个或者多个Pod,这些Pod具有明确的开始和结束阶段,如果Job没有达到指定的任务目标,它将继续重试执行Pod,直到达到目标。您可以 - [创建定时任务(CronJob)](https://support.huaweicloud.com/usermanual-cce/cce_10_0151.md): 定时任务(CronJob)是Kubernetes中用于定期执行任务的一种工作负载,类似于Linux系统的crontab,使用Cron格式进行编写, 并周期性地在给定的调度时间执行Job。CronJob适用于多种场景,帮助您自动化和管理任务,确保任务按时执行,减轻人工管理的负担。例如:定期备份:可以使用CronJob定期执行备份任务,例如数 - [安全运行时与普通运行时](https://support.huaweicloud.com/usermanual-cce/cce_10_0463.md): 相比于普通运行时,安全运行时可以让您的每个容器(准确地说是Pod)都运行在一个单独的微型虚拟机中,拥有独立的操作系统内核,以及虚拟化层的安全隔离。通过使用安全运行时,不同容器之间的内核、计算资源、网络都是隔离开的,保护了Pod的资源和数据不被其他Pod抢占和窃取。CCE Turbo集群和VPC网络CCE Standard集群支持使用普通运 - [设置容器与节点时区同步](https://support.huaweicloud.com/usermanual-cce/cce_10_0354.md): 创建工作负载时,支持设置容器使用节点相同的时区。您可以在创建工作负载时打开时区同步配置。您可以通过以下方式进行设置。设置以下参数:主机路径 (HostPath):/etc/localtime挂载路径:/etc/localtime权限:只读挂载时区配置文件主机路径 (HostPath):/etc/localtime挂载路径:/etc/loc - [设置镜像拉取策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0353.md): 创建工作负载会从镜像仓库拉取容器镜像到节点上,当前Pod重启、升级时也会拉取镜像。默认情况下容器镜像拉取策略imagePullPolicy是IfNotPresent,表示如果节点上有这个镜像就直接使用节点已有镜像,如果没有这个镜像就会从镜像仓库拉取。容器镜像拉取策略还可以设置为Always,表示无论节点上是否有这个镜像,都会从镜像仓库拉取 - [使用第三方镜像](https://support.huaweicloud.com/usermanual-cce/cce_10_0009.md): 第三方镜像是指由除官方镜像仓库和SWR镜像仓库外,其他组织或个人提供的容器镜像。这些镜像通常包含自定义应用程序、工具或特定版本的操作系统,能够满足用户特定的业务需求。在Standard/Turbo集群中,用户可以通过密钥认证的方式拉取第三方镜像,进而创建工作负载,满足业务需要。更多信息,请参见使用私有仓库。使用第三方镜像时,请确保Stan - [使用SWR企业版镜像仓库镜像](https://support.huaweicloud.com/usermanual-cce/cce_10_0948.md): CCE支持拉取SWR企业版镜像仓库的镜像来创建工作负载。SWR企业版镜像仓库必须经过认证(账号密码)才能访问,而CCE中容器拉取镜像是使用密钥认证方式,这就要求在拉取镜像前先创建镜像仓库的密钥。使用SWR企业版镜像仓库镜像时,请确保工作负载运行的节点可访问对应的企业版镜像仓库实例。单击集群名称进入集群,在左侧导航栏选择“配置与密钥”,在右 - [配置镜像免密下载](https://support.huaweicloud.com/usermanual-cce/cce_10_1091.md): 在容器化应用部署过程中,通常需要配置imagePullSecrets来确保容器镜像能够从私有仓库中被正确拉取。然而,这一过程不仅操作繁琐,还存在安全风险,因为长期有效的凭据容易泄露,而临时凭据则需要定期更新。为了解决这一问题,CCE引入了免密下载容器镜像的功能。配置镜像免密后,您在创建CCE工作负载时,无需显式指定imagePullSec - [设置容器规格](https://support.huaweicloud.com/usermanual-cce/cce_10_0163.md): CCE支持在创建工作负载时为添加的容器设置资源的需求量和限制,最常见的可设定资源是CPU和内存(RAM)大小。此外Kubernetes还支持其他类型的资源,可通过YAML设置。在CPU配额和内存配额设置中,申请与限制的含义如下:申请(Request):根据申请值调度该实例到满足条件的节点去部署工作负载。限制(Limit):根据限制值限制工 - [设置容器生命周期](https://support.huaweicloud.com/usermanual-cce/cce_10_0105.md): 容器生命周期函数是Kubernetes提供的核心机制,用于在容器运行的关键阶段插入自定义逻辑。这些函数为容器化应用提供了精细化的过程控制能力,使应用能够更好地适应云原生环境的动态特性。CCE提供的生命周期函数如下,更多信息,请参见Container Lifecycle Hooks。启动命令:容器启动时执行的命令,用于定义容器的主进程。该进 - [设置容器健康检查](https://support.huaweicloud.com/usermanual-cce/cce_10_0112.md): 健康检查是指容器运行过程中,根据用户需要,定时检查容器健康状况。若未配置健康检查机制,当容器内的应用程序发生异常时,Pod无法感知该异常,也不会自动执行重启操作进行恢复。这样可能导致Pod状态显示为“运行中”,但实际上容器内的应用已处于不可用或异常状态。Kubernetes提供了三种健康检查探针,监测容器中应用的运行状态,以确保系统的稳定 - [设置环境变量](https://support.huaweicloud.com/usermanual-cce/cce_10_0113.md): 容器环境变量(如DB_HOST=db.example.com)是运行容器时动态传入的配置参数,允许在不重新构建镜像的情况下,灵活调整应用的行为和设置。其主要作用包括:动态配置应用:允许在不修改容器镜像的情况下,通过注入不同的变量值(如DB_HOST=prod.db.com或DB_HOST=test.db.com)改变应用行为。即使容器因调 - [设置性能管理配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0055.md): 应用性能管理APM是一种用于实时监控和管理云端应用性能与故障的云服务,能帮助运维人员快速发现应用的性能瓶颈,快速定位故障根源,为用户体验保驾护航。如图1所示,对于部署在Standard/Turbo集群中的Java类工作负载,您只需安装APM探针,无需修改代码,即可实现应用的全方位监控,快速定位出错与慢接口,重现调用参数,识别系统瓶颈,大幅 - [工作负载升级与回退](https://support.huaweicloud.com/usermanual-cce/cce_10_0397.md): 创建工作负载后,CCE支持对其进行升级以及升级后回退操作。通过灵活的升级与回退机制,您可在不中断服务的情况下平滑切换至新版本,若升级过程中出现异常,也可快速恢复至此前的稳定状态。升级与回退机制适用于多种类型的工作负载,具体如下:升级机制:适用于Deployment、StatefulSet和DaemonSet类型工作负载。回退机制:适用于D - [设置容忍策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0728.md): 容忍度(Toleration) 允许调度器将Pod调度至带有对应污点的节点上。 容忍度需要和节点污点相互配合,每个节点上都可以拥有一个或多个污点,对于未设置容忍度的Pod,调度器会根据节点上的污点效果进行选择性调度,可以用来避免Pod被分配到不合适的节点上。更多关于容忍度的使用示例请参见污点和容忍度。污点可以指定多种效果,对应的容忍策略对 - [设置标签与注解](https://support.huaweicloud.com/usermanual-cce/cce_10_0386.md): 为了满足多维度的元数据管理需求,Kubernetes提供了标签(Labels)和注解(Annotations)两种元数据机制。它们都以键值对(key-value)的形式为资源附加元数据,但设计目的和使用场景有本质区别:标签(Labels):主要用于标识和分类Kubernetes对象,采用结构化键值对(如app=frontend)的形式,支 - [工作负载调度策略概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0232.md): 在Kubernetes中,工作负载调度的基本单位是Pod。创建工作负载时,调度器会自动对工作负载中的Pod进行合理分配,例如将Pod分散到资源充足的节点上。虽然调度器的默认行为已经能够满足许多基本需求,但在一些特定场景下,用户可能需要更精细地控制Pod的部署位置。为了实现这一点,Kubernetes允许用户在工作负载定义中配置调度策略。例 - [设置指定节点调度(nodeSelector)](https://support.huaweicloud.com/usermanual-cce/cce_10_0891.md): 在Kubernetes中,如果您希望将工作负载调度到指定的节点上,最简单的方式是在工作负载中配置nodeSelector字段。在nodeSelector字段中设置希望调度的目标节点标签后,Kubernetes就只会将该工作负载调度到拥有指定标签的节点上。节点在创建时会自动添加一些标签,您也可以根据这些标签进行调度,详情请参见节点固有标签。 - [设置节点亲和调度(nodeAffinity)](https://support.huaweicloud.com/usermanual-cce/cce_10_0892.md): Kubernetes在调度工作负载时支持将节点作为亲和对象,将工作负载调度至具有指定标签和标签值的节点上。例如,某些节点支持使用GPU算力,则可以使用节点亲和调度,确保高性能计算的Pod最终运行在GPU节点上。您可以通过不同的方式配置节点亲和性调度策略,将Pod调度到满足条件的节点。本文示例中,集群内已创建GPU节点,并设置标签为gpu= - [设置工作负载亲和/反亲和调度(podAffinity/podAntiAffinity)](https://support.huaweicloud.com/usermanual-cce/cce_10_0893.md): 工作负载亲和/反亲和调度是Kubernetes提供的任务调度方式,可以使用工作负载作为亲和对象,灵活地将新建的工作负载调度到与其相关或无关的节点上,可以有效地提高集群的利用率。例如,通信频繁的前端应用Pod和后端应用Pod可优先调度到同一个节点或同一个可用区,减少网络延迟。工作负载亲和/反亲和的示意如下:首先,拓扑域(根据topology - [登录容器实例](https://support.huaweicloud.com/usermanual-cce/cce_10_00356.md): 如果在使用容器的过程中遇到非预期的问题,您可登录容器进行调试。在CloudShell中使用kubectl时,kubectl的权限由登录用户的权限决定。CloudShell暂不支持委托账号和子项目。同一用户在使用CloudShell组件连接CCE集群或容器时,限制同时打开的实例上限数量为15个。CloudShell中kubectl证书有效期 - [管理工作负载](https://support.huaweicloud.com/usermanual-cce/cce_10_0007.md): 工作负载创建后,您可以对其执行升级、编辑YAML、查看日志、查看监控、回退、删除等操作。工作负载/任务管理操作描述监控可以通过CCE控制台查看工作负载和容器组的CPU和内存占用情况,以确定需要的资源规格。普通任务与定时任务无法查看监控。日志可查看工作负载的日志信息。定时任务无法直接查看负载日志信息,需通过定时任务拉起的普通任务查看日志信息 - [管理自定义资源](https://support.huaweicloud.com/usermanual-cce/cce_10_0833.md): 自定义资源定义(Custom Resource Definition,CRD) 是对Kubernetes API的扩展,当默认的Kubernetes资源无法满足业务需求时,您可以通过CRD对象来定义新的资源类别。 根据CRD的定义,您可以在集群中创建自定义资源(Custom Resource,CR)来满足业务需求。 CRD允许用户创建新的 - [PodSecurityPolicy配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0275.md): Pod安全策略(Pod Security Policy) 是集群级别的资源,它能够控制Pod规约中与安全性相关的各个方面。 PodSecurityPolicy对象定义了一组Pod运行时必须遵循的条件及相关字段的默认值,只有Pod满足这些条件才会被系统接受。v1.17.17版本的集群默认启用Pod安全策略准入控制组件,并创建名为psp-gl - [Pod Security Admission配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0466.md): 在使用Pod Security Admission前,需要先了解Kubernetes的Pod安全性标准(Security Standards)。Pod安全性标准(Security Standards) 为 Pod 定义了不同的安全性策略级别。这些标准能够让你以一种清晰、一致的方式定义如何限制Pod行为。而Pod Security Admi - [使用AppArmor限制容器对资源的访问](https://support.huaweicloud.com/usermanual-cce/cce_10_1006.md): AppArmor(Application Armor)是Linux内核的一个安全模块,通常在Ubuntu等操作系统中使用,AppArmor允许系统管理员将每个程序与一个安全配置文件关联,从而限制程序的功能。简单来说,AppArmor是与SELinux类似的一个访问控制系统,通过它可以指定程序可以读、写或运行哪些文件,是否可以打开网络端口等 - [工作负载最佳实践](https://support.huaweicloud.com/usermanual-cce/cce_10_0894.md): 本文主要为您介绍工作负载相关实践。 - [调度概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0702.md): CCE支持多种资源与任务调度策略,有助于提升应用性能和集群整体资源利用率。本文将重点介绍CPU资源调度、GPU/NPU异构资源调度以及Volcano调度的主要功能。CCE提供CPU管理策略,可为应用分配完整的物理CPU核,从而提升性能并降低调度延迟。CCE为集群中的GPU异构资源提供调度能力,从而实现资源的精细化分配与高效利用,满足不同类 - [CPU管理策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0351.md): 默认情况下,kubelet使用CFS 配额来执行Pod的CPU约束。 当节点上运行了很多CPU密集的Pod时,工作负载可能会迁移到不同的CPU核, 这取决于调度时Pod是否被扼制,以及哪些CPU核是可用的。许多应用对这种迁移不敏感,因此无需任何干预即可正常工作。有些应用对CPU敏感,CPU敏感型应用有如下特点。对CPU throttlin - [增强型CPU管理策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0552.md): 在Kubernetes默认提供的CPU管理策略中有none和static两种:none: 默认不开启CPU管理策略,表示现有的调度行为。static:开启静态绑核的CPU管理策略,允许为节点上具有某些资源特征的 Pod(Guaranteed pod)赋予增强的 CPU 亲和性和独占性。增强型CPU管理策略(enhanced-static) - [选择GPU节点驱动版本](https://support.huaweicloud.com/usermanual-cce/cce_10_0846.md): 使用GPU加速型云服务器时,需要安装正确的Nvidia基础设施软件,才可以使用GPU实现计算加速功能。在使用GPU前,您需要根据GPU型号,选择兼容配套软件包并安装。本文将介绍如何选择GPU节点的驱动版本及配套的CUDA Toolkit。一般情况下,使用GPU资源时您将会使用以下软件包,并且软件包版本需要保持配套:驱动GPU工作的硬件驱动 - [CCE推荐的GPU驱动版本列表](https://support.huaweicloud.com/usermanual-cce/cce_10_0847.md): 对于CCE集群,各系统推荐使用驱动版本如下表,若使用非CCE推荐驱动版本,需要您自行验证机型、系统及驱动版本间的配套兼容性。您可以根据您的应用所使用的CUDA Toolkit版本,对照CUDA Toolkit与NVIDIA驱动的版本兼容性列表,选择合适的NVIDIA驱动版本。当前GPU驱动支持列表仅针对1.2.28及以上版本的CCE AI - [通过节点池升级节点的GPU驱动版本](https://support.huaweicloud.com/usermanual-cce/cce_10_0849.md): 如果您使用的CUDA库无法与当前的NVIDIA驱动版本匹配,您需要升级节点的驱动版本才可以正常使用GPU节点。建议您以节点池为粒度进行节点NVIDIA驱动版本的管理,创建应用时可调度到指定驱动版本的节点池,在升级驱动时,也可以根据节点池分批次控制升级。关于集群粒度的驱动升级,请参见插件管理。通过节点池升级存量节点的NVIDIA驱动,本质上 - [通过节点标签配置GPU驱动版本](https://support.huaweicloud.com/usermanual-cce/cce_10_1113.md): 当您需要对单个节点进行差异化驱动配置时,可通过为节点添加特定标签,并在ConfigMap中定义对应的驱动策略,实现精细化的节点级驱动定制。 - [手动更新GPU节点驱动版本](https://support.huaweicloud.com/usermanual-cce/cce_10_0848.md): 一般情况下,您可以通过CCE AI套件(NVIDIA GPU)插件配置节点的驱动文件路径,节点重启后会自动安装驱动。您也可以手动更新驱动的方式进行更新。手动更新GPU节点的驱动版本为临时方案,适用于需要对某个节点进行差异化配置的场景,但节点重启后将自动重置为CCE AI套件(NVIDIA GPU)插件配置中指定的版本。如果需要稳定升级GP - [使用Kubernetes默认GPU调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0345.md): Standard/Turbo集群支持使用Kubernetes默认GPU调度模式。该模式基于Device Plugin机制,通过资源类型实现对GPU的标准化管理。当节点安装了CCE AI套件(NVIDIA GPU)插件后,CCE可以自动识别节点上的GPU数量,并在调度时通过resources.limits字段为Pod分配资源(如nvidia - [GPU虚拟化概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0644.md): CCE GPU虚拟化采用自研xGPU虚拟化技术,能够动态对GPU设备显存与算力进行划分,单个GPU卡最多虚拟化成20个GPU虚拟设备。相对于静态分配来说,虚拟化的方案更加灵活,最大程度保证业务稳定的前提下,可以完全由用户自己定义使用的GPU量,提高GPU利用率。CCE提供的GPU虚拟化功能优势如下:灵活:精细配置GPU算力占比及显存大小, - [准备GPU虚拟化资源](https://support.huaweicloud.com/usermanual-cce/cce_10_0645.md): CCE GPU虚拟化采用自研xGPU虚拟化技术,能够动态对GPU设备显存与算力进行划分,单个GPU卡最多虚拟化成20个GPU虚拟设备。本文介绍如何在GPU节点上实现GPU的调度和隔离能力。集群中需要同时安装CCE AI套件(NVIDIA GPU)插件和Volcano调度器插件。集群级别的GPU虚拟化:开启GPU配置 > GPU虚拟化,开启 - [使用GPU虚拟化](https://support.huaweicloud.com/usermanual-cce/cce_10_0646.md): 本文介绍如何使用GPU虚拟化能力实现算力和显存隔离,高效利用GPU设备资源。已完成GPU虚拟化资源准备。如果您需要通过命令行创建,需要使用kubectl连接到集群,详情请参见通过kubectl连接集群。单个GPU卡最多虚拟化成20个GPU虚拟设备。init容器不支持使用GPU虚拟化资源。GPU虚拟化支持显存隔离、显存与算力隔离两种隔离模式 - [GPU虚拟化兼容Kubernetes默认GPU调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0742.md): 开启GPU虚拟化后,除显存隔离模式(设置volcano.sh/gpu-mem.128Mi参数)、算显隔离模式(同时设置volcano.sh/gpu-mem.128Mi和volcano.sh/gpu-core.percentage参数)外,工作负载还支持Kubernetes默认GPU调度(设置nvidia.com/gpu参数)。开启GPU虚 - [GPU虚拟化多卡均分调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0965.md): 在AI训练、推理和科学计算中,单张GPU常因算力或显存不足无法满足需求,因此需要多张GPU卡协同工作。然而,使用多张GPU卡协同工作时,直接分配整张GPU可能导致资源浪费,尤其是当任务仅需使用部分显存或算力时。GPU虚拟化的多卡均分调度功能允许任务跨多张GPU卡分配显存和计算力,实现更高效的资源利用。多卡均分调度是一种资源调度策略,可将任 - [GPU虚拟化优先级抢占调度](https://support.huaweicloud.com/usermanual-cce/cce_10_1025.md): 任务优先级(通过PriorityClass定义)用于标识任务相对于其他任务的重要性。启用GPU虚拟化任务优先级抢占功能后,Volcano调度器将优先保障高优先级GPU虚拟化任务的调度。即当集群虚拟化GPU资源不足时,调度器主动驱逐低优先级业务,保障高优先级业务可以正常调度。待资源充足后,再重新调度低优先级业务。此外,该功能支持两个维度的资 - [GPU虚拟化Burst调度](https://support.huaweicloud.com/usermanual-cce/cce_10_1007.md): Burst调度是一种GPU弹性资源调度策略,在保障Pod固定算力占用的同时,可动态按比例抢占节点闲置算力,实现资源利用率最大化。Burst调度机制在保持算显隔离架构原有显存调度策略不变的前提下,仅对算力资源(如vCPU/GPU核心)的分配逻辑进行动态优化。GPU虚拟服务会按照申请GPU资源的容器数量为每张显卡设置时间片,用于为容器分配GP - [GPU监控指标说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0955.md): CCE AI套件(NVIDIA GPU)插件提供GPU监控指标,并集成了dcgm-exporter组件(要求插件版本2.7.32+),引入更丰富的GPU可观测性场景。本文介绍CCE AI套件(NVIDIA GPU)插件指标的详细信息。如果您安装了云原生监控插件来采集CCE AI套件(NVIDIA GPU)插件产生的GPU监控指标,且云原生 - [实现GPU基础、虚拟化及Pod级资源指标的全面监控](https://support.huaweicloud.com/usermanual-cce/cce_10_0741.md): 监控GPU资源指标能够优化计算性能、快速定位故障并合理分配资源,从而提升GPU利用率、降低运维成本。通过Prometheus和Grafana,您可以实现对GPU资源的全面监测,精确捕捉资源使用情况。本文将对Prometheus和Grafana的配置流程进行详细介绍。关于GPU指标更多信息,请参见CCE提供的GPU监控指标。集群中已安装云原 - [实现DCGM指标的全面监控](https://support.huaweicloud.com/usermanual-cce/cce_10_0956.md): 对运维人员来说,实现对Kubernetes的大规模GPU设备可监测能力至关重要。通过监测GPU相关指标能够了解整个集群的GPU使用情况、健康状态、工作负载性能等,从而实现对异常问题的快速诊断、优化GPU资源的分配、提升资源利用率等。除运维人员以外,其他人员(例如数据科学家、AI算法工程师等)也能通过相关监控指标了解业务的GPU使用情况,以 - [基于GPU监控指标配置工作负载弹性伸缩](https://support.huaweicloud.com/usermanual-cce/cce_10_0844.md): 在Standard/Turbo集群中,用户可以通过GPU监控指标为使用GPU资源的工作负载配置弹性伸缩(HPA),使应用在业务高峰期自动扩容、低负载时缩容,从而优化资源利用率并降低成本。Kubernetes默认仅支持CPU和内存作为HPA的弹性伸缩指标。在使用GPU资源时,如需基于GPU利用率、显存等指标进行伸缩,可通过Prometheu - [GPU虚拟化节点弹性伸缩配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0928.md): 当集群中GPU虚拟化资源不足时,支持自动进行GPU节点的弹性伸缩。本文将指导您如何创建GPU虚拟化节点的弹性伸缩策略。已创建一个v1.27及以上版本的集群。在集群中安装CCE AI套件(NVIDIA GPU)(2.1.8、2.7.5及以上版本)、Volcano调度器(1.10.5及以上版本)及CCE集群弹性引擎(1.27.150、1.28 - [GPU故障处理](https://support.huaweicloud.com/usermanual-cce/cce_10_0779.md): 在Kubernetes的环境中,GPU资源的管理复杂度高、故障诊断和恢复难度大,且宕机成本高。当某个GPU资源出现故障时,CCE集群会迅速上报,并根据事件信息提供单GPU故障后自动隔离功能,此时其他正常的GPU可以继续提供服务,尽可能减少业务上的损失。本文将介绍GPU常见的异常事件、隔离结果以及对应的解决方案,以便您快速响应故障,最大限度 - [故障GPU的Pod自动驱逐功能](https://support.huaweicloud.com/usermanual-cce/cce_10_1023.md): GPU卡故障是指由于硬件损坏、驱动异常、通信失败或环境因素等原因,导致GPU无法正常提供计算服务的现象。当GPU卡发生故障时,可能导致Pod启动失败、任务中断、资源浪费等问题,对AI任务和高性能应用影响尤为显著。为了最小化GPU卡故障对业务的影响,CCE提供了故障GPU的Pod自动驱逐功能。开启该功能后,如果CCE AI套件(NVIDIA - [NPU整卡调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0346.md): NPU整卡调度是指在调度NPU资源时,以NPU芯卡为单位进行资源分配的调度策略。每个Pod在运行时会独占一个或多个完整的NPU芯片,不会与其他任务共享NPU芯片的计算资源。使用NPU整卡调度存在以下优势:性能稳定:独占整个物理NPU芯片,可以有效避免多任务竞争带来的资源抖动,保障模型训练/推理的稳定性和一致性。提升训练效率:对于大规模模型 - [节点内NPU拓扑亲和调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0980.md): 节点内NPU拓扑感知调度是一种基于昇腾AI处理器硬件拓扑特性的智能资源管理技术,通过优化资源分配和网络路径选择,有效减少计算资源碎片和网络拥塞,最大化提升NPU算力利用率。该技术可显著提升AI训练和推理任务的执行效率,实现昇腾计算资源的高效调度与管理。在CCE Standard/Turbo集群中,节点内NPU拓扑感知调度需要多个组件配合完 - [超节点拓扑亲和调度(待下线)](https://support.huaweicloud.com/usermanual-cce/cce_10_0982.md): 本文使用的是HyperJob方式,即将下线。推荐您使用Volcano Job方式。在AI大规模训练和推理场景中,随着计算资源的分布式扩展,Pod间网络通信常面临带宽瓶颈和高延迟问题,尤其是关联度高的Pod之间频繁的跨节点通信,会显著降低系统性能和响应速度。为此,Volcano调度器支持使用超节点拓扑亲和调度能力。超节点由48个节点组成,其 - [NPU静态虚拟化概述](https://support.huaweicloud.com/usermanual-cce/cce_10_1009.md): NPU静态虚拟化是将物理机中配置的NPU(昇腾AI产品)切分为多个虚拟NPU(vNPU),并挂载至容器中使用,以实现对硬件资源的灵活切分与动态管理。NPU算力切分具有以下优势:资源高效利用:单台服务器的NPU可被划分为多个vNPU,供不同用户按需申请,降低算力使用成本。资源强隔离:基于容器化技术,确保不同用户的vNPU资源完全隔离,避免计 - [自动实现NPU静态虚拟化](https://support.huaweicloud.com/usermanual-cce/cce_10_1010.md): 在CCE中,通过CCE AI套件(Ascend NPU)插件的ascend-vnpu-manager组件可以实现节点池粒度的NPU静态虚拟化,以生成虚拟NPU(vNPU),从而实现资源的高效利用。启用NPU虚拟化功能后,系统会根据配置中指定的模板,对节点池内的NPU芯片进行自动切分,从而实现标准化、批量化的虚拟化部署。集群中已安装CCE - [手动实现NPU静态虚拟化](https://support.huaweicloud.com/usermanual-cce/cce_10_0994.md): 在CCE中,可通过手动配置实现对每张NPU卡的资源分配,提供更高的灵活性。然而,该方式的配置过程相对复杂,更适合对NPU资源使用有精细化需求的场景(如特定算力分配、资源隔离要求严格的业务)。集群中已有支持虚拟化的NPU芯片,具体请参见适用的NPU芯片类型。集群中已安装CCE AI套件(Ascend NPU)插件,且版本在2.1.15及以上 - [使用FlexNPU实现NPU资源虚拟化与隔离](https://support.huaweicloud.com/usermanual-cce/cce_10_11112.md): FlexNPU是面向华为昇腾(Ascend)硬件生态设计的算力虚拟化与弹性管理系统,可在Kubernetes集群中实现物理NPU的细粒度切分、多Pod共享与强隔离调度。 通过Device Plugin机制与Volcano调度器集成,实现NPU资源的声明式管理和按需分配。本文介绍如何使用NPU虚拟化能力实现算力和显存隔离,高效利用NPU设备 - [NPU指标说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0970.md): 当CCE AI套件(ASCEND NPU)插件版本为2.1.55及以上时,支持使用npu-exporter组件。npu-exporter是一个用于监控和收集昇腾AI处理器相关指标的组件,可以获取并上报昇腾AI芯片的各种运行时数据,包括昇腾AI处理器的数量、网口实时接收速率等,这些数据统称为NPU指标。通过监控NPU指标,您可以实时掌握NP - [实现NPU指标的全面监控](https://support.huaweicloud.com/usermanual-cce/cce_10_0971.md): 当集群中包含NPU节点时,监控NPU指标可以帮助用户识别性能瓶颈、优化资源利用率、快速定位异常,从而提升系统的整体稳定性和效率。在CCE Standard和Turbo集群中,您可以使用npu-exporter组件将dcmi/hccn tool采集的NPU指标数据上传至云原生监控系统,实现NPU资源的实时监控与告警,从而提升系统的可靠性和性 - [NPU故障处理](https://support.huaweicloud.com/usermanual-cce/cce_10_1134.md): 当vLLM推理服务持续无响应超过3分钟时,服务将进入停滞状态,导致现有推理任务中断,无法继续输出Token。此问题通常由vNPU硬件连接状态残留或服务进程阻塞引起。您需要使用root用户权限登录相应的Pod,并按照以下步骤进行处理:终止vLLM服务进程。执行以下命令,确认是否存在与推理相关的 `vllm` 和 `python` 进程。ps - [Volcano调度概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0721.md): Volcano是一个基于Kubernetes的批处理平台,提供了机器学习、深度学习、生物信息学、基因组学及其他大数据应用所需要而Kubernetes当前缺失的一系列特性,提供了高性能任务调度引擎、高性能异构芯片管理、高性能任务运行管理等通用计算能力。Volcano Scheduler是负责Pod调度的组件,它由一系列action和plug - [使用Volcano调度工作负载](https://support.huaweicloud.com/usermanual-cce/cce_10_0722.md): Volcano是一个基于Kubernetes的批处理平台,提供了高性能任务调度引擎、高性能异构芯片管理、高性能任务运行管理等通用计算能力,通过接入AI、大数据、基因、渲染等诸多行业计算框架服务终端用户,并针对计算型应用提供了作业调度、作业管理、队列管理等多项功能。一般情况下,Kubernetes在调度工作负载时会使用自带的默认调度器,若需 - [装箱调度(Binpack)](https://support.huaweicloud.com/usermanual-cce/cce_10_0773.md): 装箱调度(Binpack)是一种优化算法,以最小化资源使用量为目标,将资源合理地分配给每个任务,使所有资源都可以实现最大化的利用价值。在集群工作负载的调度过程中使用Binpack调度策略,调度器会优先将Pod调度到资源消耗较多的节点,减少各节点空闲资源碎片,提高集群资源利用率。已创建v1.19及以上版本的集群,详情请参见购买Standar - [重调度(Descheduler)](https://support.huaweicloud.com/usermanual-cce/cce_10_0766.md): 集群中的调度是将pending状态的Pod分配到节点运行的过程,在CCE集群之中,Pod的调度依赖于集群中的调度器(kube-scheduler或者Volcano调度器)。调度器是通过一系列算法计算出Pod运行的最佳节点,但是Kubernetes集群环境是存在动态变化的,例如某一个节点需要维护,这个节点上的所有Pod会被驱逐到其他节点,但 - [节点池亲和性调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0767.md): 在替换节点池、节点滚动升级等场景中,需要使用新节点池替换旧节点池。在这些场景下,为做到业务不感知,可以在业务触发变更时,将业务的Pod软亲和调度到新的节点池上。这种软亲和调度会尽量将新创建的Pod或者重调度的Pod调度到新的节点池,如果新节点池资源不足,或者新节点池无法调度,也要能将Pod调度到旧节点池上。节点池替换、节点滚动升级等场景中 - [负载感知调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0789.md): Volcano调度器提供节点CPU、Memory的负载感知调度能力,感知集群内节点CPU、Memory的负载情况,将Pod优先调度到负载较低的节点,实现节点负载均衡,避免出现因单个节点负载过高而导致的应用程序或节点故障。已创建v1.29及以上版本的集群,详情请参见购买Standard/Turbo集群。已安装Volcano 1.22.24及 - [资源利用率优化调度配置案例](https://support.huaweicloud.com/usermanual-cce/cce_10_0813.md): Volcano调度分为两个阶段,分别为节点过滤和节点优选,过滤阶段筛选出符合调度条件的节点,优选阶段对所有符合调度条件的节点打分,最终选取得分最高的节点进行调度。Volcano提供多种调度策略进行节点打分优选,每种调度策略可以根据实际业务场景调整对应的权重值,提高或降低该策略在节点打分过程中的影响性。Volcano插件支持的节点调度策略如 - [优先级调度与抢占](https://support.huaweicloud.com/usermanual-cce/cce_10_0775.md): 优先级表示一个作业相对于其他作业的重要性,Volcano兼容Kubernetes中的Pod优先级定义(PriorityClass)。启用该能力后,调度器将优先保障高优先级业务调度。集群资源不足时,调度器主动驱逐低优先级业务,保障高优先级业务可以正常调度。已创建v1.19及以上版本的集群,详情请参见购买Standard/Turbo集群。已安 - [应用扩缩容优先级策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0746.md): 通过应用扩缩容优先级策略,您可以精细调整Pod在不同类型节点上的扩容和缩容顺序,实现资源管理的最优化。在使用默认扩缩容优先级策略的情况下,扩容过程中Pod优先被调度到包周期的节点,其次被调度到按需计费的节点,最后被调度到virtual-kubelet节点(弹性至CCI);缩容过程中优先删除virtual-kubelet节点(弹性至CCI) - [公平调度(DRF)](https://support.huaweicloud.com/usermanual-cce/cce_10_0777.md): DRF(Dominant Resource Fairness)是主资源公平调度策略,应用于大批量提交AI训练和大数据作业的场景,可增强集群业务的吞吐量,整体缩短业务执行时间,提高训练性能。已创建v1.19及以上版本的集群,详情请参见购买Standard/Turbo集群。已安装Volcano插件,详情请参见Volcano调度器。在实际业务中 - [组调度(Gang)](https://support.huaweicloud.com/usermanual-cce/cce_10_0778.md): 组调度(Gang)满足了调度过程中“All or nothing”的调度需求,避免Pod的任意调度导致集群资源的浪费,主要应用于AI、大数据等多任务协作场景。启用该能力后,可以解决分布式训练任务之间的资源忙等待和死锁等痛点问题,大幅度提升整体训练性能。已创建v1.19及以上版本的集群,详情请参见购买Standard/Turbo集群。已安装 - [网络拓扑感知调度概述](https://support.huaweicloud.com/usermanual-cce/cce_10_1126.md): 随着各种AI大模型的快速兴起和广泛应用,分布式AI训练/推理作业(包括数据并行、张量并行、流水线并行、专家并行、PD分离等多种模式)逐渐成为算力基础设施的核心工作负载。通常,这些作业的子任务会在多个算力节点上运行,而整个计算过程高度依赖于各子任务间的数据交换,如梯度汇聚和模型分发。此时,节点间的网络传输性能往往成为瓶颈,显著影响整体计算效 - [多级网络拓扑调度](https://support.huaweicloud.com/usermanual-cce/cce_10_1127.md): 目前,分布式AI训练/推理任务正逐渐成为算力基础设施的核心工作负载,但由于高度依赖各子任务间的数据交换,面临着网络传输性能的瓶颈,导致计算效率难以显著提升。这一问题的主要原因在于数据中心网络拓扑的复杂性,通常由多层交换机构成的层级架构组成,且类型多样,包括IB、RoCE、NVSwitch等。跨层级交换机的通信路径越长,延迟越高,吞吐量越低 - [多维多级网络拓扑调度](https://support.huaweicloud.com/usermanual-cce/cce_10_1128.md): 在大规模训练作业中,通常会将一个大作业切分成多个分片,例如模型并行的各分片、数据并行的副本组。相较于分片与分片之间,每个分片内部具有更强的网络通信性能诉求。在分布式推理任务中,也可能存在不同角色的子任务,例如常见的Prefill角色和Decode角色。这些角色内部的任务之间存在频繁通信需求。在大模型训练或分布式推理场景下,整个训练/推理任 - [多级网络拓扑装箱调度](https://support.huaweicloud.com/usermanual-cce/cce_10_1129.md): 通过多级网络拓扑亲和调度和分组亲和调度能力,Volcano已有效缓解了数据中心分布式AI训练/推理作业的网络通信性能问题。然而,随着各种新工作负载的不断到来和旧工作负载的陆续结束,各HyperNode的资源碎片化问题日趋严重,即集群虽有充足的可用资源,但却分散在不同HyperNode中,导致对通信性能要求高的新作业不能被调度,或只能被分散 - [多维组调度(Gang)](https://support.huaweicloud.com/usermanual-cce/cce_10_1130.md): 组调度(Gang)满足了调度过程中“All or nothing”的调度需求,避免Pod的任意调度导致集群资源的浪费,主要应用于AI、大数据等多任务协作场景。启用该能力后,可以解决分布式训练任务之间的资源忙等待和死锁等痛点问题,大幅度提升整体训练性能。随着AI任务的演进,AI任务可以进一步细分为不同维度的子任务,例如分布式训练任务中的多个 - [超节点拓扑亲和调度](https://support.huaweicloud.com/usermanual-cce/cce_10_1131.md): 在大规模AI训练和推理场景中,CCE服务支持接入超节点算力作为容器节点,以加速AI计算任务的运行。超节点由48个包含多张NPU卡的节点组成,内部NPU通过特定的网络连接方式形成超平面网络,提供更快的网络传输速率。针对使用超节点的特殊集群场景,Volcano提供了超节点拓扑感知调度能力,通过将关联度高的计算任务调度至同一超节点内,显著提升了 - [Volcano异构资源碎片整理](https://support.huaweicloud.com/usermanual-cce/cce_10_11252.md): 碎片整理(Repack)是Volcano面向异构资源的运行时碎片整理能力。通过不改变工作负载资源请求,调整现有Pod的节点分布,将分散的空闲资源集中到部分节点,释放完整节点容量。本文介绍Repack的功能配置及操作示例。Repack解决的是“集群仍有空闲卡,但资源布局无法满足目标工作负载”这一运行时容量问题。集群长期经历任务结束、扩缩容、 - [分组Pod故障迁移](https://support.huaweicloud.com/usermanual-cce/cce_10_1132.md): 在数据中心分布式AI训练/推理场景下,作业实例具有强协同依赖性、长时间运行性和资源独占性(如NPU、GPU)等特点,而数据中心很有可能出现节点宕机、网络分区等故障。当集群出现故障并直接影响某些Pod运行时,重启整个作业是代价高昂的,有可能导致整个作业一直处于运行、失败、重启的循环中,永远无法顺利完成;而只迁移这些受直接影响的Pod,虽然代 - [队列资源管理调度(Capacity)](https://support.huaweicloud.com/usermanual-cce/cce_10_0991.md): 在Kubernetes集群中,多个团队或业务(如AI训练、大数据分析、在线服务)需要共享计算资源,且不同任务对资源的需求和优先级各不相同。如果所有任务直接竞争资源,则会导致:资源争抢:高负载任务挤占其他任务的CPU/内存,引发性能下降。不公平调度:关键业务可能因资源不足而延迟,低优先级任务却占用过多资源。缺乏隔离:某租户的异常任务(如内存 - [层级队列](https://support.huaweicloud.com/usermanual-cce/cce_10_0992.md): 在多租户场景中,队列是实现公平调度、资源隔离和任务优先级控制的核心机制。而在实际应用中,不同队列往往隶属于不同部门,部门之间存在层级关系,传统平级队列的资源管理无法满足实际需要。为此,Volcano调度器引入层级队列,通过将队列按层级结构组织,实现不同层级间的资源分配、共享与抢占。通过这一功能,用户可以在层级队列的基础上实现更细粒度的资源 - [NUMA亲和性调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0425.md): NUMA节点是Non-Uniform Memory Access(非统一内存访问)架构中的一个基本组成单元,每个节点包含自己的处理器和本地内存,这些节点在物理上彼此独立,但通过高速互连总线连接在一起,形成一个整体系统。NUMA节点能够通过提供更快的本地内存访问来提高系统性能,但通常一个Node节点是多个NUMA节点的集合,在多个NUMA节 - [应用紧凑型缩容功能](https://support.huaweicloud.com/usermanual-cce/cce_10_1024.md): 紧凑型缩容功能是指在工作负载缩容过程中,控制器会根据节点上NPU的碎片状态,优先释放导致NPU碎片的Pod。该策略通过释放出更完整、连续的NPU资源块,提升集群的NPU利用率并降低资源浪费。在具体实现上,Volcano调度器会依据设定的紧凑型缩容策略,对由Deployment(也间接包括ReplicaSet)及其他指定工作负载类型管理的P - [云原生混部概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0707.md): 随着云原生技术迅速发展,海量应用正在走向云原生化。从2021年到2022年,Kubernetes集群中的云原生应用总数同比增长30%+,Kubernetes正在成为云时代的“操作系统”。但随着进一步调研发现,应用部署在Kubernetes集群后,大部分用户节点的CPU利用率不足15%。在调研不同类型客户,排除一些闲置资源、套餐活动等干扰因 - [开启云原生混部](https://support.huaweicloud.com/usermanual-cce/cce_10_0708.md): 已创建一个CCE Standard集群或CCE Turbo集群,且版本满足以下要求:v1.23集群:v1.23.9-r0及以上v1.25集群:v1.25.4-r0及以上v1.23集群:v1.23.9-r0及以上v1.25集群:v1.25.4-r0及以上集群中已安装1.10.0及以上版本的Volcano插件。开启云原生混部后,Volcano - [动态资源超卖](https://support.huaweicloud.com/usermanual-cce/cce_10_0384.md): 当前很多业务有波峰和波谷,部署服务时,为了保证服务的性能和稳定性,通常会按照波峰时需要的资源申请,但是波峰的时间可能很短,这样在非波峰时段就有资源浪费。另外,由于在线作业SLA要求较高,为了保证服务的性能和可靠性,通常会申请大量的冗余资源,因此,会导致资源利用率很低、浪费比较严重。将这些申请而未使用的资源(即申请量与使用量的差值)利用起来 - [基于Pod实例画像的资源超卖](https://support.huaweicloud.com/usermanual-cce/cce_10_0942.md): Volcano新增基于Pod实例画像的超卖量算法。该算法持续采集并累积节点上Pod的CPU和内存利用率,统计Pod资源用量的概率分布特征,进而计算出节点资源用量的概率分布特征,从而在一定的置信度下给出节点资源用量的评估值。基于Pod实例画像的超卖量算法会同时考虑节点资源使用的整体水位和起伏变化,计算出相对稳定的超卖量,减少资源竞争几率,避 - [CPU Burst弹性限流](https://support.huaweicloud.com/usermanual-cce/cce_10_0700.md): 若Pod中容器设置了CPU Limit值,则该容器CPU使用将会被限制在Limit值以内,形成对CPU的限流。频繁的CPU限流会影响业务性能,增大业务长尾响应时延,对于时延敏感型业务的影响尤为明显。CPU Burst提供了一种可以短暂突破CPU Limit值的弹性限流机制,以降低业务长尾响应时间。其原理是业务在每个CPU调度周期内使用的C - [出口网络带宽保障](https://support.huaweicloud.com/usermanual-cce/cce_10_0701.md): 出口网络带宽保障通过设置网络优先级实现,具有如下优点:平衡在线业务与离线业务对出口网络带宽的使用,保证在线业务有足够的网络带宽,在线业务触发阈值时,压缩离线业务带宽使用。在线业务所占用的网络资源较少时,离线业务可使用更多带宽;在线业务所占用的网络资源较多时,降低离线业务资源占用量,从而优先保障在线业务的网络带宽。使用出口网络带宽保障特性需 - [低优先级工作负载CPU限流](https://support.huaweicloud.com/usermanual-cce/cce_10_1138.md): 在混部环境中,高优先级(在线)和低优先级(离线)工作负载被部署在同一节点上,以提高资源利用率。然而,离线工作负载可能会消耗过多CPU资源,从而影响在线工作负载的性能。CPU限流功能限制离线工作负载的CPU使用,可以保护在线工作负载的性能。CPU限流功能根据节点可分配CPU和实时CPU使用情况,动态调整BestEffort的CPU配额。其功 - [网络概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0010.md): CCE集群网络架构基于Kubernetes原生网络模型,结合华为云的基础设施能力,构建了覆盖节点、容器、服务三层的立体化通信体系。其核心目标是实现集群内/外流量的高效转发、服务发现与网络隔离,支持从中小型应用到大规模微服务架构的全场景需求。您可以从如下角度了解集群网络:集群网络构成:集群由多个节点组成,并且每个节点上运行着多个Pod(容器 - [容器网络模型对比](https://support.huaweicloud.com/usermanual-cce/cce_10_0281.md): 容器网络为集群内Pod分配IP地址并提供网络服务,CCE支持如下几种网络模型,您可在创建集群时进行选择。云原生网络2.0模型是自研的新一代容器网络模型,深度整合了虚拟私有云VPC的弹性网卡(Elastic Network Interface,简称ENI)和辅助弹性网卡(Sub Network Interface,简称Sub-ENI)的能力 - [云原生网络2.0模型说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0284.md): 云原生网络2.0是自研的新一代容器网络模型,深度整合了虚拟私有云VPC的弹性网卡(Elastic Network Interface,简称ENI)和辅助弹性网卡(Sub Network Interface,简称Sub-ENI)的能力,将Pod直接绑定弹性网卡或辅助弹性网卡,使每个Pod在VPC内均拥有独立的IP地址,且支持ELB直通容器、 - [添加/删除CCE Turbo集群的默认容器子网](https://support.huaweicloud.com/usermanual-cce/cce_10_0906.md): 当创建CCE Turbo集群时设置的容器子网太小,无法满足业务扩容需求时,您通过扩展集群容器子网的方法来解决。本文介绍如何为CCE Turbo集群添加容器子网。仅支持v1.19及以上版本的CCE Turbo集群。v1.27.16-r50、v1.28.15-r40、v1.29.15-r0、v1.30.14-r0、v1.31.10-r0、v1 - [在CCE Turbo集群中为Pod配置固定IP](https://support.huaweicloud.com/usermanual-cce/cce_10_0603.md): 在云原生网络2.0下,会为每个Pod分配用户VPC网络下的一张网卡,支持为StatefulSet工作负载的Pod(容器网卡)固定IP,适用于需要针对具体IP地址做访问控制、服务注册、服务发现、日志审计等场景。例如,当有一个需要访问云上数据库的StatefulSet类型业务,需要对云上数据库进行严格的访问控制,只允许该业务进行访问,则可固定 - [在CCE Turbo集群中为Pod配置EIP](https://support.huaweicloud.com/usermanual-cce/cce_10_0734.md): 云原生网络2.0网络模式下,Pod使用的是VPC的弹性网卡/辅助弹性网卡,可直接绑定弹性公网IP。为方便用户在CCE内直接为Pod关联弹性公网IP,用户只需在创建Pod时,配置annotation(yangtse.io/pod-with-eip: "true"),弹性公网IP就会随Pod自动创建并绑定至该Pod。您已创建一个CCE Tur - [在CCE Turbo集群中为Pod配置固定EIP](https://support.huaweicloud.com/usermanual-cce/cce_10_0651.md): 在云原生网络2.0下,支持为StatefulSet工作负载或直接创建的Pod分配固定的公网IP(EIP)。仅以下指定版本的CCE Turbo集群支持用户配置Pod固定EIP:v1.19集群:v1.19.16-r20及以上版本v1.21集群:v1.21.10-r0及以上版本v1.23集群:v1.23.8-r0及以上版本v1.25集群:v1. - [在CCE Turbo集群中为IPv6双栈网卡的Pod配置共享带宽](https://support.huaweicloud.com/usermanual-cce/cce_10_0604.md): 默认情况下具有IPv6双栈网卡的Pod只具备IPv6私网访问能力,如果需要访问公网,则需要为该IPv6双栈网卡的Pod配置共享带宽。仅支持CCE Turbo集群,且需要满足以下条件:集群已开启IPv6双栈。集群版本为v1.23.8-r0、v1.25.3-r0及以上。集群已开启IPv6双栈。集群版本为v1.23.8-r0、v1.25.3-r - [获取CCE Turbo集群中Pod使用的网卡信息](https://support.huaweicloud.com/usermanual-cce/cce_10_1062.md): 在CCE Turbo集群中,每个Pod会绑定独立的弹性网卡(ENI)/辅助弹性网卡(Sub-ENI),该过程由网络模型插件自动执行,如果集群中的Pod数量较多,网卡的数量也会同步增加。在某些场景中,您可能因为业务需求需要获取Pod使用的网卡信息。例如,进行网络监控或故障排除时,了解Pod的网卡ID可以帮助您更精确地定位问题,或者在某些场景 - [不同方法配置工作负载安全组的对比](https://support.huaweicloud.com/usermanual-cce/cce_10_1078.md): 在CCE Turbo集群中,Pod使用VPC的弹性网卡或辅助弹性网卡,可以直接绑定安全组。CCE Turbo提供了多维度的安全组绑定解决方案,您可以根据业务场景选择合适的配置方式。为工作负载绑定安全组存在多种配置方式(如注解、安全组策略、节点池配置、容器网络配置),当您同时使用多种配置方式时,只生效优先级最高的配置方式(下表中优先级数字越 - [使用注解为Pod绑定安全组](https://support.huaweicloud.com/usermanual-cce/cce_10_0897.md): 云原生网络2.0网络模式下,Pod使用的是VPC的弹性网卡/辅助弹性网卡,支持配置安全组的能力,您可以通过Pod添加annotation的方式为Pod绑定安全组。支持以下场景的安全组配置:为工作负载绑定安全组存在多种配置方式(如注解、安全组策略、节点池配置、容器网络配置),当您同时使用多种配置方式时,只生效优先级最高的配置方式,优先级详情 - [使用安全组策略为工作负载绑定安全组](https://support.huaweicloud.com/usermanual-cce/cce_10_0288.md): 云原生网络2.0网络模式下,Pod使用的是VPC的弹性网卡/辅助弹性网卡,可直接绑定安全组,绑定弹性公网IP。为方便用户在CCE内直接为Pod关联安全组,CCE新增了一个名为SecurityGroup的自定义资源对象。通过SecurityGroup资源对象,用户可对工作负载实现自定义的安全隔离诉求。为工作负载绑定安全组存在多种配置方式(如 - [使用节点池配置为节点池上的Pod绑定默认的安全组](https://support.huaweicloud.com/usermanual-cce/cce_10_1079.md): 云原生网络2.0网络模式下,Pod使用的是VPC的弹性网卡/辅助弹性网卡,可直接绑定安全组,CCE Turbo支持为节点池上的Pod配置默认的安全组。适用于以下场景:节点池维度的访问控制:如果您的业务是按照节点池维度划分的,您可以采用此方案进行节点池维度的安全访问控制,请结合您的业务合理规划不同节点池上的Pod默认安全组的安全规则。扩展单 - [使用容器网络配置为命名空间/工作负载绑定子网及安全组](https://support.huaweicloud.com/usermanual-cce/cce_10_0196.md): CCE Turbo集群支持以命名空间或工作负载粒度设置容器所在的容器子网及安全组,该功能通过名为NetworkAttachmentDefinition的CRD资源实现。如您想为指定的命名空间或工作负载配置指定的容器子网和安全组,可创建自定义容器网络配置(NetworkAttachmentDefinition),并将该容器网络配置与相应的命 - [VPC网络模型说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0283.md): VPC网络模型将虚拟私有云VPC的路由方式与底层网络深度整合,适用于高性能场景,但节点数量受限于虚拟私有云VPC的路由配额。在VPC网络模型中,容器网段独立于节点网段进行单独设置。在Pod IP地址分配时,集群中的每个节点会被分配固定大小的Pod IP地址段,用于给该节点上运行的Pod分配IP地址。由于VPC网络模型没有隧道封装的消耗,容 - [扩展VPC网络集群的容器网段](https://support.huaweicloud.com/usermanual-cce/cce_10_0680.md): 当创建CCE集群时设置的容器网段太小,无法满足业务扩容需求时,您可以通过扩展集群容器网段的方法来解决。本文介绍如何为集群添加容器网段。仅支持v1.19.16-r0及以上版本的“VPC网络”模型集群。新增的容器网段不能与服务网段、VPC网段及已有的容器网段冲突。新增容器网段后,建议您继续完成全链路的网络连通性排查,优先确保集群内通信正常,再 - [删除VPC网络集群的容器网段](https://support.huaweicloud.com/usermanual-cce/cce_10_1019.md): 在使用VPC集群时,用户可能在最初规划容器子网时未能充分考虑未来需求,导致容器网段规划不合理。或者,在新增容器子网后发现配置有误,需要进行修改或删除。本文将指导您如何删除容器网段,实现容器网络配置的灵活调整。该功能当前正陆续上线中,仅部分局点支持。VPC集群删除容器网段功能约束限制如下:该功能对集群版本要求:v1.28.15-r60及以上 - [容器隧道网络模型说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0282.md): 容器隧道网络是在主机网络平面的基础上,通过隧道封装技术来构建一个独立的容器网络平面。CCE集群容器隧道网络使用了VXLAN作为隧道封装协议,并使用了Open vSwitch作为后端虚拟交换机。VXLAN是一种将以太网报文封装成UDP报文进行隧道传输的协议,而Open vSwitch是一款开源的虚拟交换机软件,提供网络隔离和数据转发等功能。 - [在Pod中配置主机网络(hostNetwork)](https://support.huaweicloud.com/usermanual-cce/cce_10_0402.md): 通常情况下,Pod中的容器会使用Kubernetes网络插件提供的网络,这些插件确保了Pod之间的网络通信。然而,有时候您可能需要Pod直接使用主机(节点)的网络,直接使用主机的IP地址和端口,您可以通过在Pod的配置中设置hostNetwork: true来实现。直接使用主机网络可以减少网络转发的开销,提高网络性能,但同时也需要注意Po - [为Pod配置QoS](https://support.huaweicloud.com/usermanual-cce/cce_10_0382.md): 部署在同一节点上的不同业务容器之间存在带宽抢占,容易造成业务抖动。您可以通过对Pod配置带宽限制来解决这个问题。Pod带宽限制功能规格如下:功能规格容器隧道网络模型VPC网络模型云原生网络2.0模型VPC网络模型+DataPlane V2云原生网络2.0模型+DataPlane V2支持的集群版本所有集群版本均支持v1.19.10以上集群 - [配置网络策略(NetworkPolicy)限制Pod访问的对象](https://support.huaweicloud.com/usermanual-cce/cce_10_0059.md): 网络策略(NetworkPolicy)是Kubernetes设计用来限制Pod访问的对象,相当于从应用的层面构建了一道防火墙,进一步保证了网络安全。NetworkPolicy支持的能力取决于集群的网络插件的能力。默认情况下,如果命名空间中不存在任何策略,则所有进出该命名空间中的Pod的流量都被允许。NetworkPolicy的Ingres - [DataPlane V2网络加速说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0945.md): 创建VPC网络模型和云原生网络2.0模型的集群支持开启DataPlane V2网络加速模式,开启后,会启用eBPF流量转发路径,实现Service、NetworkPolicy、Bandwidth等能力。开启DataPlane V2功能后,会安装以下组件:您可以通过ConfigMap自定义配置DataPlane V2的网络组件,具体说明如下 - [优化DataPlane V2模式下conntrack配置](https://support.huaweicloud.com/usermanual-cce/cce_10_1163.md): conntrack是连接跟踪机制的一种实现,用于跟踪和记录网络连接的状态,例如TCP连接的状态(SYN、ESTABLISHED、CLOSED等)。开启DataPlane V2后,集群对应的conntrack信息不再存储在Linux conntrack表里,而是存储在eBPF map里。当前DataPlane V2默认启用cilium的配置 - [部署Hubble实现DataPlane V2网络可观测性](https://support.huaweicloud.com/usermanual-cce/cce_10_1063.md): 在开启了DataPlane V2的集群中,部署开源的可观测项目Hubble可以将容器网络流量进行可视化展示,实现容器网络可观测性。CCE Standard集群版本在v1.27.16-r50、v1.28.15-r40、v1.29.15-r0、v1.30.14-r0、v1.31.10-r0、v1.32.6-r0及以上,并开启DataPlane - [开启DataPlane V2网络的cilium-agent组件可观测性](https://support.huaweicloud.com/usermanual-cce/cce_10_1064.md): 开启了DataPlane V2的集群,会在每个节点上部署cilium-agent组件,通过本文的配置可实现cilium-agent组件的可观测。CCE Standard集群版本在v1.27.16-r50、v1.28.15-r40、v1.29.15-r0、v1.30.14-r0、v1.31.10-r0、v1.32.6-r0及以上,并开启Da - [通过Hubble监控集群TCP及UDP流量](https://support.huaweicloud.com/usermanual-cce/cce_10_1171.md): Hubble是基于Cilium和eBPF的Kubernetes网络可观测性平台。通过安装Hubble Relay和Hubble UI/CLI,您可以实时查看集群流量拓扑、排查网络延迟、拦截(Dropped)数据包并生成服务依赖图。在开启了DataPlane V2的集群中,部署开源的可观测项目Hubble,将容器网络流量进行可视化展示,结合 - [服务概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0249.md): 在Kubernetes中,服务(Service)用于将运行在一组Pod上的应用程序公开为网络服务。它不仅为这些Pod提供了一个统一的DNS名称,还实现了Pod之间的负载均衡。本文将为您介绍Kubernetes Service的基本概念以及不同类型Service的对比介绍。关于服务(Service),您需要了解以下基本概念。Pod创建完成后 - [集群内访问(ClusterIP)](https://support.huaweicloud.com/usermanual-cce/cce_10_0011.md): 集群内访问(ClusterIP)是Kubernetes默认的服务类型,它为集群内部提供了一种稳定的网络访问方式。Kubernetes会从服务网段中分配一个仅在集群内部可访问的虚拟IP(称为集群IP),同时CoreDNS会注册一个集群内部域名的DNS记录,允许通过集群内部域名进行解析和访问。集群内部域名格式为<服务名称>.<工作负载所在命名 - [节点访问(NodePort)](https://support.huaweicloud.com/usermanual-cce/cce_10_0142.md): 节点访问(NodePort)是Kubernetes中一种基础的服务类型,它在集群内访问服务的基础上增加了节点端口映射功能,即在每个节点的IP上开放一个静态端口,通过静态端口对外暴露服务。创建NodePort服务时,Kubernetes同样会自动创建一个集群内部IP地址(ClusterIP),集群外部的客户端通过访问 := v1.21.2-r0 时支持,且需要everest插件版本>=2.1.23。节点上的默认数据盘(供容器运行时和Kubelet组件使用)不支持导入为存储池。供容器运 - [通过动态存储卷使用本地持久卷](https://support.huaweicloud.com/usermanual-cce/cce_10_0634.md): 本文介绍如何在CCE中通过动态存储卷方式使用本地持久卷(Local PV)。本地持久卷可将节点本地磁盘、LVM逻辑卷等存储资源以PV/PVC形式提供给工作负载,并自带节点亲和性,实现Pod自动调度。您已经创建好一个集群,并且在该集群中安装CSI插件(everest)。如果您需要通过命令行创建,需要使用kubectl连接到集群,详情请参见通 - [在有状态负载中动态挂载本地持久卷](https://support.huaweicloud.com/usermanual-cce/cce_10_0635.md): 动态挂载仅可在创建有状态负载(StatefulSet)时使用,通过卷声明模板(volumeClaimTemplates字段)实现,并依赖于StorageClass的动态创建PV能力。在多实例的有状态负载中,动态挂载可以为每一个Pod关联一个独有的PVC及PV,当Pod被重新调度后,仍然能够根据该PVC名称挂载原有的数据。而在无状态工作负载 - [临时存储卷概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0637.md): 当有些应用程序需要额外的存储,但并不关心数据在重启后是否仍然可用。 例如,缓存服务经常受限于内存大小,而且可以将不常用的数据转移到比内存慢的存储中,对总体性能的影响并不大。另有些应用程序需要以文件形式注入的只读数据,比如配置数据或密钥。Kubernetes中的临时卷(Ephemeral Volume),就是为此类场景设计的。临时卷会遵从P - [在存储池中导入临时卷](https://support.huaweicloud.com/usermanual-cce/cce_10_0725.md): CCE支持使用LVM将节点上的数据卷组成存储池(VolumeGroup),然后划分LV给容器挂载使用。在创建本地临时卷前,需将节点数据盘导入存储池。本地临时卷仅在集群版本 >= v1.21.2-r0 时支持,且需要everest插件版本>=1.2.29。供容器运行时与K8s组件使用的数据盘不支持导入存储池。条带化模式的存储池不支持扩容,条 - [使用本地临时卷](https://support.huaweicloud.com/usermanual-cce/cce_10_0726.md): 本地临时卷(Local Ephemeral Volume)存储在临时卷存储池,相比原生EmptyDir默认的存储介质类型性能要更好,且支持扩容,适用于需临时存储但无需持久化的场景,如应用中间数据或高吞吐日志。您已经创建好一个集群,并且在该集群中安装CSI插件(everest)。如果您需要通过命令行创建,需要使用kubectl连接到集群,详 - [使用临时路径](https://support.huaweicloud.com/usermanual-cce/cce_10_0638.md): 临时路径是Kubernetes原生的EmptyDir类型,生命周期与容器实例相同,并支持指定内存作为存储介质。容器实例消亡时,EmptyDir会被删除,数据会永久丢失。在CCE中,用户可通过控制台或kubectl命令行方式使用临时路径,具体步骤如下:vi nginx-emptydir.yamlYAML文件内容如下:kubectl appl - [主机路径(HostPath)](https://support.huaweicloud.com/usermanual-cce/cce_10_0377.md): 主机路径(HostPath)可以将容器所在宿主机的文件目录挂载到容器指定的挂载点中,如容器需要访问/etc/hosts则可以使用HostPath映射/etc/hosts等场景。HostPath卷存在许多安全风险,最佳做法是尽可能避免使用HostPath,例如您可以使用local类型替代。当必须使用HostPath卷时,它的范围应仅限于所需 - [自定义存储类(StorageClass)](https://support.huaweicloud.com/usermanual-cce/cce_10_0380.md): StorageClass是Kubernetes中用于定义存储类别的资源对象,提供动态分配存储卷的能力。通过设置不同的参数,StorageClass能够根据业务需求自动供应和调整存储资源。在PVC中指定StorageClassName字段后,若在集群中未找到匹配的PV,Kubernetes将根据所引用的StorageClass调用对应的Pr - [存储管理最佳实践](https://support.huaweicloud.com/usermanual-cce/cce_10_0900.md): 本文主要为您介绍存储管理相关实践。 - [弹性伸缩概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0279.md): 随着Kubernetes已经成为云原生应用编排、管理的事实标准,越来越多的应用选择向Kubernetes迁移,用户也越来越关心在Kubernetes上应用如何快速扩容面对业务高峰,以及如何在业务低谷时快速缩容节约资源与成本。弹性伸缩在云容器引擎(CCE)上的应用非常广泛,典型的使用场景包括:在线业务弹性:在节假日、促销活动等高峰时段自动增 - [工作负载伸缩原理](https://support.huaweicloud.com/usermanual-cce/cce_10_0290.md): CCE支持多种工作负载伸缩方式,策略对比如下:弹性伸缩策略对比伸缩策略HPA策略CronHPA策略CustomedHPA策略VPA策略AHPA策略策略介绍Kubernetes中实现POD水平自动伸缩的功能,即Horizontal Pod Autoscaling。基于HPA策略的增强能力,主要面向应用资源使用率存在周期性变化的场景。CCE自 - [创建HPA策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0208.md): 随着应用访问请求量的波动,静态预设的服务实例数量往往难以满足高效、弹性的资源利用需求。比如,在高峰期,如果应用实例数量不足,可能会导致响应延迟增加、用户体验下降;而在低谷期,过多的实例又会造成资源浪费。Kubernetes提供了HPA策略(Horizontal Pod Autoscaling)对实例数量进行水平自动伸缩的。HPA策略通过监 - [创建使用自定义指标的HPA策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0944.md): Kubernetes默认的HPA策略只支持基于CPU和内存的自动伸缩,在复杂的业务场景中,仅使用CPU和内存使用率指标进行弹性伸缩往往无法满足日常运维需求。通过自定义指标配置工作负载HPA策略,可以根据业务自身特点,通过更多指标实现更灵活的弹性配置。本文介绍如何部署示例Nginx应用,并通过Prometheus标准方式暴露containe - [创建CronHPA定时策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0415.md): 在一些复杂的业务场景下,可能有固定时间段高峰业务,又有日常突发高峰业务。此种情况下,用户既期望能定时弹性伸缩应对固定时间段高峰业务,又期望能根据指标弹性伸缩应对日常突发高峰业务。CCE提供CronHPA的自定义资源,实现在固定时间段对集群进行扩缩容,并且可以和HPA策略共同作用,定时调整HPA伸缩范围,实现复杂场景下的工作负载伸缩。Cro - [创建CustomedHPA策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0292.md): 随着应用复杂度的增加和业务需求的多样化,企业和开发者在实际使用中发现,标准的HPA虽然能够根据CPU利用率和内存使用量自动调整Pod数量,但在某些特定场景下,这种单一的扩缩策略可能并不能完全满足需求。例如,某些应用的负载可能会在特定时间段内急剧变化,或者需要基于指标对扩缩容动作进行更精细的控制,如扩缩容步长等。CustomedHPA策略是 - [创建VPA策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0921.md): VPA策略即Vertical Pod Autoscaling,该功能可以在Kubernetes中实现Pod垂直弹性伸缩,可以根据容器资源历史使用情况自动调整Pod的CPU、Memory资源申请量。当业务负载急剧飙升时,VPA能够快速地在设定范围内扩大容器的资源申请值(Requests),以满足业务需求。而在业务负载变小时,VPA会根据实际 - [创建AHPA策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0934.md): Kubernetes原生HPA是根据当前指标值被动触发的,只有在检测到当前资源利用率超过预设阈值时才会启动扩缩容操作。这种机制在实际应用中通常会存在弹性滞后的问题,即在负载高峰期,系统反应不够迅速,导致响应延迟增加和用户体验下降;而在负载低谷期,可能会有短暂的资源浪费。为了解决Kubernetes原生HPA的弹性滞后问题,CCE支持使用A - [管理工作负载弹性伸缩策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0083.md): 工作负载弹性策略创建完成后,可对创建的策略进行更新、编辑YAML以及删除等操作。您可以查看工作负载弹性策略的规则、最新状态和事件,参照界面中的报错提示有针对性地解决异常事件。您还可以在工作负载详情页中查看已创建的弹性伸缩策略:登录CCE控制台,单击集群名称进入集群。在左侧导航栏中单击“工作负载”,单击工作负载名称查看详情。在该工作负载详情 - [节点伸缩原理](https://support.huaweicloud.com/usermanual-cce/cce_10_0296.md): HPA是针对Pod级别的,可以根据负载指标动态调整副本数量,但是如果集群的资源不足,新的副本无法运行的情况下,就只能对集群进行扩容。CCE集群弹性引擎是Kubernetes提供的集群节点弹性伸缩组件,根据Pod调度状态及资源使用情况对集群的节点进行自动扩容缩容,同时支持多可用区、多实例规格、指标触发和周期触发等多种伸缩模式,满足不同的节点 - [节点池弹性伸缩优先级说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0649.md): 如需使用节点规格优先级功能,CCE集群弹性引擎插件版本要求为1.19.35、1.21.28、1.23.30、1.25.20及以上。其中未调度实例扩容AZ均衡分布策略在1.23.122、1.25.117、1.27.85、1.28.52及以上支持。指标阈值扩容AZ均衡分布需1.30.193、1.31.150、1.32.126、1.33.120 - [创建节点弹性策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0209.md): 如果集群中存在大量的应用和服务,节点的计算资源一般固定的,而负载需求是动态变化,例如:业务高峰期:负载压力大,节点数量不足会导致扩容的工作负载实例无法运行,导致响应变慢、请求超时。业务低谷期:如果节点数量过多,会浪费大量的计算资源和成本。这些问题不仅影响了应用的性能和用户体验,还会增加运维的复杂性和成本。Kubernetes提供了节点弹性 - [管理节点弹性策略](https://support.huaweicloud.com/usermanual-cce/cce_10_0063.md): 节点弹性策略创建完成后,可对创建的策略进行删除、编辑、停用、启用、克隆等操作。您可以查看节点弹性策略的关联节点池、执行规则和伸缩历史,参照界面中的提示有针对性地解决异常问题。您还可以在“策略”页面中查看已创建的弹性伸缩策略:登录CCE控制台,单击集群名称进入集群。在左侧导航栏中单击“策略”,切换至“节点伸缩策略”页签。您可以查看弹性伸缩策 - [自定义节点池的节点缩容条件](https://support.huaweicloud.com/usermanual-cce/cce_10_0967.md): 在使用CCE集群弹性引擎插件自动调整节点数量时,由于一个集群中可能存在多个节点池,而不同节点池需要在不同情况下进行缩容,因此需要自定义各个节点池的缩容条件,以满足具体的使用场景需求。已创建一个v1.25及以上版本的集群。已为集群安装CCE集群弹性引擎插件,且插件版本为1.25.181、1.27.152、1.28.120、1.29.81、1 - [调整节点缩容并发配置](https://support.huaweicloud.com/usermanual-cce/cce_10_1088.md): 配置节点弹性伸缩策略后,节点缩容过程可能会出现节点缩容等待时间过长或缩容速度不满足需求的问题,尤其是在处理大规模集群时,这些问题会更加显著。为了解决该问题,CCE集群弹性引擎插件支持配置单节点最大GC等待时间和节点缩容并发数,允许您根据自身业务需求灵活调整这些参数。通过设置maxGracefulTerminationFlag,您可以指定最 - [CCE容器实例弹性伸缩到CCI服务](https://support.huaweicloud.com/usermanual-cce/cce_10_0295.md): CCE突发弹性引擎(对接 CCI)作为一种虚拟的kubelet用来连接Kubernetes集群和其他平台的API。Bursting的主要场景是将Kubernetes API扩展到无服务器的容器平台(如CCI)。基于该插件,支持用户在短时高负载场景下,将部署在云容器引擎CCE上的无状态负载(Deployment)、有状态负载(Statefu - [使用HPA+CA实现工作负载和节点联动弹性伸缩](https://support.huaweicloud.com/usermanual-cce/cce_10_0300.md): 企业应用的流量大小不是每时每刻都一样,有高峰,有低谷,如果每时每刻都要保持能够扛住高峰流量的机器数目,那么成本会很高。通常解决这个问题的办法就是根据流量大小或资源占用率自动调节机器的数量,也就是弹性伸缩。当使用Pod/容器部署应用时,通常会设置容器的申请/限制值来确定可使用的资源上限,以避免在流量高峰期无限制地占用节点资源。然而,这种方法 - [备份中心概述](https://support.huaweicloud.com/usermanual-cce/cce_10_1159.md): 备份中心以Velero工具作为基础,为Kubernetes集群提供应用与数据的高效备份、灵活恢复与平滑迁移的一站式方案,支持集群内的资源对象(如Deployment、Service、ConfigMap)及持久化卷数据(PV/PVC)的备份、恢复,为多集群场景下的应用提供了数据容灾和迁移能力。备份中心为您提供高效可靠的备份恢复能力,应用于多 - [集群内备份和恢复应用](https://support.huaweicloud.com/usermanual-cce/cce_10_1160.md): 备份中心可用于解决Kubernetes集群内的应用备份与恢复,实现集群的备份容灾能力。它能够对集群内的资源对象(如Deployment、Service、ConfigMap)及持久化卷数据(PV/PVC)进行一体化的保护,支持为整个命名空间或指定应用设置自动化备份和快速恢复,有效应对人为误操作、应用故障或数据损坏等风险。集群中已安装Vele - [备份中心常见问题](https://support.huaweicloud.com/usermanual-cce/cce_10_1164.md): 创建备份计划时,自定义CRON表达式如何填写?备份记录删除失败提示:backup storage location xxx is currently in read-only mode备份仓库状态不可用提示:Backup store contains invalid top-level directories: [xxx]恢复失败提示:e - [云原生观测体系概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0110.md): 云原生可观测性是指在云原生架构中,通过使用各种工具和技术来实现对应用程序和基础设施的监控告警、日志、故障排除等功能的一套完整的解决方案。本文介绍云容器引擎CCE可观测性架构分层和主要的可观测能力,以帮助您对CCE云原生可观测性生态有一个全面的认识。从架构分层的角度,CCE可观测性分为四个层次。自下而上分别为:算力底座、数据采集、监控与日志 - [云原生观测委托权限说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0953.md): 由于云原生观测相关的功能在运行中对监控、告警、通知服务等各类云服务资源都存在依赖关系,因此当您首次使用云原生观测相关的功能时,系统将自动请求获取当前区域下的云资源权限,从而更好地为您提供服务。为了最小化授权,CCE服务进行了一次权限细粒度化改造,将由系统策略为粒度的权限集,修改为Action(依赖调用的接口对应一个Action)粒度的权限 - [健康中心概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0740.md): 健康诊断用于诊断集群及工作负载的健康状态,该功能集合了容器运维专家的经验,为您提供了集群级别的健康诊断最佳实践。可对集群健康及工作负载运行状况进行全面检查,帮助您及时发现集群故障与潜在风险,并提供修复建议供您参考。健康诊断覆盖范围如下图所示:支持开箱即用,可以在不开通监控中心情况下,进行基础的集群健康诊断支持全量检查集群整体运行状况(开通 - [集群诊断](https://support.huaweicloud.com/usermanual-cce/cce_10_0717.md): 云容器引擎CCE服务提供一键集群诊断能力,包括集群诊断、节点诊断、工作负载诊断、核心插件诊断和外部依赖诊断,可以辅助您定位集群中出现的问题。本文介绍如何在集群中使用集群诊断功能。已获取资源权限。集群版本高于v1.17。集群处于“运行中”状态。您可以在不开通监控中心的情况下,进行基础的集群健康诊断。如果想体验更丰富的诊断能力,请参考开通监控 - [工作负载诊断](https://support.huaweicloud.com/usermanual-cce/cce_10_0951.md): 基于以往的运维经验,负载类型故障发生频率较高,且问题排查耗时较长,占用大量运维精力。为了提升运维效率,CCE引入了单Pod级别的资源诊断能力,帮助运维团队更高效地定位和解决问题。该诊断工具通过综合使用Kubernetes原生API、Kubernetes事件、日志以及监控指标,对问题进行全面的分析和判定,并提供具体的修复建议。这种综合诊断方 - [诊断项及修复方案](https://support.huaweicloud.com/usermanual-cce/cce_10_0823.md): 集群诊断项包含以下维度。 - [监控中心概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0413.md): 监控中心是华为云打造的新一代云原生容器运维平台,可实时监控应用及资源,采集各项指标及事件等数据以分析应用健康状态,提供全面、清晰、多维度数据可视化能力,兼容主流开源组件,并提供快捷故障定位的能力。多维度数据洞察:提供基于Kubernetes原生类型的容器监控能力,支持集群、节点、工作负载、Pod和事件的指标展示,全面监控集群的健康状态和负 - [开通监控中心](https://support.huaweicloud.com/usermanual-cce/cce_10_0820.md): 开通监控中心将在集群中安装云原生监控插件,该插件提供监控中心的指标采集功能。开通后,监控中心将采集集群中的指标并上报至AOM实例。本章节介绍如何为集群开通监控中心功能。开通监控中心后,集群中的指标将上报至AOM实例,AOM针对基础指标免费,自定义指标由AOM服务收费,具体请参考价格详情。云原生监控插件在集群中运行需要消耗集群资源,请确保集 - [管理监控采集任务](https://support.huaweicloud.com/usermanual-cce/cce_10_0803.md): 您可以简单、方便地可视化管理采集任务,所有的配置均可在升级云原生监控插件时得到保留。集群中已安装云原生监控插件3.11.0及以上版本。开启默认关闭的采集任务、添加基础免费指标之外的指标后,若您已对接AOM,AOM服务会按量收取费用。具体请参考价格详情。监控采集任务配置由以下配置项共同提供:系统预置采集配置、ServiceMonitor采集 - [集群监控](https://support.huaweicloud.com/usermanual-cce/cce_10_0712.md): 当您想观测整个集群的资源使用情况和健康度时,可以在“监控中心 > 集群”页面查看,该页面提供了单个集群的监控情况,包含集群健康度、健康概况、资源消耗Top统计和数据面监控多维度的信息概况。集群健康度评估包括多个维度,如健康评分、待处理风险项数、风险等级,以及诊断风险项在集群、核心插件、节点、工作负载和外部依赖五个方面的占比(异常数据使用红 - [节点监控](https://support.huaweicloud.com/usermanual-cce/cce_10_0713.md): 如果您需要监控节点的资源使用情况,可以前往“监控中心 > 节点”页面查看。该页面提供了指定集群下所有节点的综合信息,以及单个节点的详细监控数据,包括CPU/内存使用率、网络流入/流出速率、磁盘读/写IO等。节点列表页面呈现了所有节点的综合信息,如需深入了解单个节点的监控情况,可单击节点名称,进入该节点的“概览”页面,通过切换“Pod列表” - [工作负载监控](https://support.huaweicloud.com/usermanual-cce/cce_10_0714.md): 如果您需要监控工作负载的资源使用情况,可以前往“监控中心 > 工作负载”页面查看。该页面提供了指定集群下所有工作负载的综合信息,以及单个工作负载的详细监控数据,包括CPU/内存使用率、网络流入/流出速率等。工作负载列表页面呈现了所有工作负载的综合信息,如需深入了解单个工作负载的监控情况,可单击工作负载名称,进入该工作负载的“概览”页面,通 - [Pod监控](https://support.huaweicloud.com/usermanual-cce/cce_10_0715.md): 如果您需要监控Pod的资源使用情况,可以前往“监控中心 > Pod”页面查看。该页面提供了指定集群下所有Pod的综合信息,以及单个Pod的详细监控数据,包括CPU/内存使用率、网络流入/流出速率等。Pod列表页面呈现了所有Pod的综合信息,如需深入了解单个Pod的监控情况,可单击Pod名称,进入该Pod的“概览”页面,通过切换“容器列表” - [事件监控](https://support.huaweicloud.com/usermanual-cce/cce_10_0716.md): Kubernetes事件涵盖了集群的运行状态和各类资源的调度情况,对运维人员日常观察资源的变更以及定位问题均有帮助。为了实现这一目标,您需要为集群安装log-agent插件,该插件可以采集Kubernetes事件,并在“监控中心 > 事件”页面进行展示。事件页面分为两个页签:“概览”和“事件”。在“概览”页签中,您可以查看集群中事件的总数 - [使用仪表盘](https://support.huaweicloud.com/usermanual-cce/cce_10_0718.md): 仪表盘集合了不同视角、不同组件的高频监控指标。将不同的指标以图表的形式直观、综合性地汇集在同一个屏幕上,帮助您实时全面地掌握集群整体运行状况。仪表盘提供了丰富的视图监控指标呈现,包括集群视图、APIServer视图、Pod视图、主机视图、Node视图等等。集群版本高于v1.17。集群处于“运行中”状态。集群已开通“监控中心”。在页面右上角 - [集群视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0753.md): 基于集群的指标和PromQL语句,提供了集群节点、CPU、内存、网络、磁盘等关键资源相关图表,帮助您了解整体集群的资源运行状态。接下来主要从指标说明、指标清单两个部分来进行图表的说明,其中图表中对于数值过大的字节(bytes)会换算为MB、KB、GB等。集群视图暴露的指标包括基础资源指标、网络指标和磁盘指标,具体说明如下:集群视图使用的指 - [APIServer视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0754.md): 提供了Kubernetes核心组件APIServer主要监控视图,帮助您更好地监控APIServer的运行状态。主要包括APIServer组件的请求、资源、工作队列等相关指标。APIServer视图暴露的指标包括请求指标、工作队列指标和资源指标,具体说明如下:APIServer视图使用的指标清单如下: - [Pod视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0755.md): 从Pod视角呈现Pod维度集群资源、网络、磁盘等监控情况,帮助您详细了解Pod的运行状态。Pod视图暴露的指标包括Pod资源指标、Pod网络指标和Pod磁盘指标,具体说明如下:Pod视图使用的指标清单如下: - [主机视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0756.md): 从主机视角出发,监控主机的资源占用与健康状态,查看主机的磁盘、文件系统等常用系统设备指标,帮助您掌控节点运行状况。主机视图暴露的指标具体说明如下:主机视图使用的指标清单如下:指标说明指标名称类型说明node_cpu_seconds_totalCounter节点不同模式下花费的CPU秒node_load1Gauge1分钟内CPU平均负载,反 - [Node视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0757.md): 从节点视角出发,加入了节点资源、网络、磁盘等关键指标呈现,帮助您掌控节点运行状况。Node视图暴露的指标如下:节点视图使用的指标清单如下: - [节点池视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0758.md): 从节点池视角呈现节点池资源的占用和分配情况,帮助您详细了解节点池的负载状态。节点池视图暴露的指标如下:节点池视图使用的指标清单如下: - [GPU视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0759.md): GPU资源指标可以衡量GPU性能和使用情况,包括GPU的利用率、温度、显存等方面的监控数据,帮助您掌控GPU运行状况。GPU视图使用的指标清单如下:GPU指标说明指标名称类型说明cce_gpu_gpu_utilizationGaugeGPU卡算力使用率cce_gpu_memory_utilizationGaugeGPU卡显存使用率cce_ - [XGPU视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0760.md): XGPU是虚拟化的GPU设备,从XGPU视图可以在节点、GPU卡、容器等多个角度监控XGPU虚拟化设备的显存、算力分配率,帮助您掌控GPU运行状况。XGPU视图基于以下指标得到:XGPU指标说明指标名称类型说明xgpu_memory_totalGaugeXGPU显存总量xgpu_memory_usedGaugeXGPU显存使用量xgpu_ - [CoreDNS视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0761.md): 提供了负载域名解析的CoreDNS监控视图,包含请求、响应情况,以及缓存状况。CoreDNS视图暴露的指标如下:CoreDNS视图使用的指标清单如下: - [PVC视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0762.md): 提供了集群中的PVC监控视图,包含PV/PVC的状态、使用率情况。支持以下PVC类型监控:云硬盘类型的PVC(要求volumeMode参数值为Filesystem)支持使用量监控。本地持久卷类型的PVC(要求集群中安装的Everest版本大于等于2.4.41)支持使用量监控。极速文件存储类型的PVC支持使用量监控(包括子目录场景,但子目录 - [Kubelet视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0763.md): Kubelet是运行在集群中每个节点上的代理程序,它提供了一些指标可以更好地了解集群的运行状态。Kubelet视图暴露的指标如下:Kubelet视图使用的指标清单如下: - [Prometheus Server视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0764.md): Prometheus本地数据存储模式可以收集有关主机和应用程序的指标数据并存储在集群中,监控数据可以选择上报并存储到AOM或三方监控平台。Prometheus Server视图展示了Prometheus提供的一些内置指标,可用于监控和度量系统的性能和状态。Prometheus Server视图暴露的指标如下:Prometheus Serv - [Prometheus Agent视图](https://support.huaweicloud.com/usermanual-cce/cce_10_0765.md): Prometheus Agent是轻量化的容器监控模式,可以收集有关主机和应用程序的指标数据,并将数据上报并存储到AOM或三方监控平台。Prometheus Agent视图展示了Prometheus提供的一些内置指标,可用于监控和度量系统的性能和状态。Prometheus Agent视图暴露的指标如下:Prometheus Agent视图 - [日志中心概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0557.md): Kubernetes日志可以协助您排查和诊断问题。本文介绍CCE如何通过多种方式进行Kubernetes日志管理。 - [通过云原生日志采集插件采集容器日志](https://support.huaweicloud.com/usermanual-cce/cce_10_0555.md): 云原生日志采集插件基于开源fluent-bit和opentelemetry构建,支持采集云原生日志以及Kubernetes事件。CCE 云原生日志采集插件支持基于CRD的日志采集策略,可以根据您配置的策略规则,对集群中的容器标准输出日志、容器文件日志、节点日志及Kubernetes事件日志进行采集与转发。每个集群最多支持创建100条日志规 - [通过ICAgent采集容器日志](https://support.huaweicloud.com/usermanual-cce/cce_10_0018.md): CCE支持通过ICAgent组件收集工作负载的容器日志,在创建节点时会默认安装ICAgent组件(在集群kube-system命名空间下名为icagent的DaemonSet)。您可以使用ICAgent采集日志上报至不同的存储位置,具体如下表:ICAgent只采集*.log、*.trace和*.out类型的文本日志文件。AOM每月赠送每个 - [采集多行容器日志](https://support.huaweicloud.com/usermanual-cce/cce_10_0988.md): 在采集容器日志时,有些程序打印的日志存在一条完整日志数据跨占多行的情况(例如Java程序日志),而日志采集系统默认是按行采集,可能会出现采集到的日志每行显示不全的问题。您可以开启多行文本采集,根据正则表达式匹配日志,从而采集到完整的日志数据。本文介绍如何配置多行日志采集策略,以及不同日志类型、不同容器运行时下的注意事项。您可以选择以下两种 - [采集全路径日志](https://support.huaweicloud.com/usermanual-cce/cce_10_1028.md): 在采集容器内日志或节点日志时,如果被采集的日志文件的文件名相同但路径不同,会导致日志采集工具无法准确区分不同的日志文件,您可以选择开启采集日志全路径功能解决以上问题。该功能要求云原生日志采集插件版本为1.7.6及以上。暂不支持采集调度到CCI的Pod。该功能会有一定的性能损耗,若当前日志量已经接近或超过插件性能规格允许的上限,则不建议开启 - [采集Kubernetes事件](https://support.huaweicloud.com/usermanual-cce/cce_10_0793.md): CCE 云原生日志采集插件可采集Kubernetes事件上报到云日志服务(LTS)和应用运维管理(AOM),用于保存事件信息和事件告警。采集Kubernetes事件过程中,由于部分场景存在特殊性,请注意以下场景产生的事件将不会采集:插件otel-collector-event组件启动前产生的事件不会采集组件主备切换期间生成的事件不会采集配 - [采集控制面组件日志](https://support.huaweicloud.com/usermanual-cce/cce_10_0554.md): 集群支持对用户开放集群控制节点的日志信息。在日志中心页面可以选择需要上报日志的控制面组件,支持kube-controller-manager、kube-apiserver、kube-scheduler组件。如您需要查看集群控制面组件日志,集群必须为v1.21.7-r0及以上补丁版本、v1.23.5-r0及以上补丁版本或1.25版本。请确保 - [采集Kubernetes审计日志](https://support.huaweicloud.com/usermanual-cce/cce_10_0792.md): 集群支持对用户开放集群控制节点的日志信息。您可以在“日志中心”页面的Kubernetes审计日志页签选择是否上报Kubernetes审计日志到云日志服务(LTS)。如您需要查看集群Kubernetes审计日志,集群必须为v1.21.7-r0及以上补丁版本、v1.23.5-r0及以上补丁版本或1.25版本。请确保云日志服务LTS资源配额充足 - [采集NGINX Ingress访问日志](https://support.huaweicloud.com/usermanual-cce/cce_10_0933.md): CCE云原生日志采集插件支持收集NGINX Ingress控制器插件日志,可分析历史流量变化情况,得到业务流量特征,为业务决策提供数据支持。集群中需安装2.2.82及以上、2.6.32及以上、3.0.8及以上版本的NGINX Ingress控制器插件。集群中需安装1.6.0及以上版本的云原生日志采集插件。LTS创建日志组免费,并每月赠送每 - [告警中心概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0798.md): 云原生告警是可观测性体系里面比较重要的一环。在云原生告警中,除了传统的CPU、内存等资源使用量的告警以外,还有容器重启等事件告警、应用访问失败等自定义的监控指标告警。CCE的云原生告警能力是由AOM服务提供的,支持指标和事件的告警。同时,CCE集群详情中增加了告警中心能力,能支持快速配置资源等常用告警和告警查看。告警中心基于AOM服务的告 - [通过告警中心一键配置告警](https://support.huaweicloud.com/usermanual-cce/cce_10_0724.md): 告警中心基于AOM告警功能,提供集群内置告警一键开启能力,在集群发生故障时能够及时发现并预警,协助您维护业务稳定性。智能告警中心可有效节省您在AOM侧手动配置告警规则的工作量,并且内置的告警规则基于华为云容器团队大规模集群运维经验,能够满足您的日常运维所需,覆盖容器服务异常事件告警、集群相关基础资源的关键指标告警及集群中应用的指标告警。集 - [通过CCE配置自定义告警](https://support.huaweicloud.com/usermanual-cce/cce_10_0835.md): 当默认的告警规则无法满足您的诉求时,可以创建自定义告警规则。通过在CCE中创建告警规则,您可以及时了解集群中各种资源是否存在异常。基于Prometheus指标的阈值告警规则,指标告警规则依赖开通监控中心,请前往监控中心一键开通。详情请参见开通监控中心。部分指标模板依赖CCE节点故障检测插件(NPD)进行上报,指标详情请参见表1。如需要使用 - [通过AOM配置自定义告警](https://support.huaweicloud.com/usermanual-cce/cce_10_0394.md): CCE对接AOM并上报告警和事件,通过在AOM中设置告警规则,您可以及时了解集群中各种资源是否存在异常。在SMN创建主题。创建告警通知规则。添加告警规则。事件类告警:根据集群上报到AOM的事件配置告警。推荐配置的事件和配置方法请参见添加事件类告警。指标类告警:实时监控环境中主机、组件等资源使用情况,根据监控指标阈值告警。推荐配置阈值指标和 - [CCE事件列表](https://support.huaweicloud.com/usermanual-cce/cce_10_0902.md): 在集群运行过程中,CCE会上报一系列事件至AOM,您可以根据自身需求添加事件类告警,监控集群数据面和控制面组件的健康状态,及时发现和解决问题,保证集群的稳定性和可靠性。集群数据面事件:集群运行过程中与用户操作相关的事件,包括工作负载、网络、节点、存储、弹性伸缩等事件。工作负载相关事件网络相关事件节点相关事件存储相关事件弹性伸缩相关事件工作 - [云审计服务支持的CCE操作列表](https://support.huaweicloud.com/usermanual-cce/cce_10_0025.md): CCE通过云审计服务(Cloud Trace Service,简称CTS)为您提供云服务资源的操作记录,记录内容包括您从云管理控制台或者开放API发起的云服务资源操作请求以及每次请求的结果,供您查询、审计和回溯使用。采集以下列表中涉及的查询类事件(Get和List),您需要在CTS服务的配置中心开启CCE服务的只读事件上报功能。查询类操作 - [在CTS事件列表查看云审计事件](https://support.huaweicloud.com/usermanual-cce/cce_10_0026.md): 云审计服务能够为您提供云服务资源的操作记录,记录的信息包括发起操作的用户身份、IP地址、具体的操作内容的信息,以及操作返回的响应信息。根据这些操作记录,您可以很方便地实现安全审计、问题跟踪、资源定位,帮助您更好地规划和利用已有资源、甄别违规或高危操作。本节介绍如何在云审计服务控制台查看或导出最近7天的操作记录。事件即云审计服务追踪并保存的 - [计费相关FAQ](https://support.huaweicloud.com/usermanual-cce/cce_10_0800.md): 可观测性(监控中心、日志中心、告警中心)如何收费?为什么关闭日志中心后还有收费产生?免费场景监控中心自身免费使用,监控中心所使用的指标都上报并存储在AOM服务,其中在AOM范畴内的基础指标不收费,存储时长15天(暂不支持修改)。详情请参见基础指标。日志中心自身免费使用,集群内产生的日志都上报并存储在LTS服务,云日志服务的计费项由日志读写 - [监控中心FAQ](https://support.huaweicloud.com/usermanual-cce/cce_10_0923.md): 为什么监控中心没有数据了?如何关闭监控中心?监控中心为什么没有展示自定义指标?为什么云原生监控插件开启本地数据存储时,重启prometheus-server实例可能会导致节点列表的资源信息短时间(1-2分钟)无法正常显示?为什么云原生监控插件开启本地数据存储时,重启kube-state-metrics实例可能会导致页面部分数据翻倍?云原生 - [日志中心FAQ](https://support.huaweicloud.com/usermanual-cce/cce_10_0809.md): 如何关闭日志中心?插件中除log-operator外组件均未就绪log-operator标准输出报错节点容器运行时为docker时采集不到容器文件日志日志无法上报,otel组件标准输出报错:log's quota has full采集容器内日志,且采集目录配置了通配符,日志无法采集fluent-bit容器组一直重启节点OS为Ubuntu - [告警中心FAQ](https://support.huaweicloud.com/usermanual-cce/cce_10_0810.md): 在“告警中心 > 默认联系组”页面,对已确认订阅的终端执行删除操作即可。告警清除仅清除告警规则页面的统计,如该告警持续达到阈值或者异常事件持续发生,仍会产生告警。在告警中心的默认联系组页面无法创建钉钉、飞书等通知方式,需要在SMN消息通知服务进行开通,请参考SMN文档。集群中安装云原生日志插件后,默认为10分钟清除。集群中未安装云原生日志 - [云原生监控插件兼容自建Prometheus](https://support.huaweicloud.com/usermanual-cce/cce_10_0926.md): 若您已自建Prometheus,且您的Prometheus基于开源,未做深度定制、未与您的监控系统深度整合,建议您卸载自建Prometheus并直接使用云原生监控插件对您的集群进行监控,无需开启兼容模式。卸载您自建的Prometheus,需要确保删除您自建Prometheus所有的工作负载以及以monitoring.coreos.com结 - [使用云原生监控插件监控自定义指标](https://support.huaweicloud.com/usermanual-cce/cce_10_0373.md): CCE提供了云原生监控插件,支持使用Prometheus监控自定义指标。本文将通过一个Nginx应用的示例演示如何使用Prometheus监控自定义指标,步骤如下:安装并访问云原生监控插件CCE提供了集成Prometheus功能的插件,支持一键安装。CCE提供了集成Prometheus功能的插件,支持一键安装。准备应用您需要准备一个应用镜 - [使用AOM监控自定义指标](https://support.huaweicloud.com/usermanual-cce/cce_10_0201.md): CCE支持上传自定义指标到AOM,节点上的ICAgent会定期调用负载中配置的监控指标接口读取监控数据,然后上传到AOM上。负载的自定义指标接口可以在创建时配置。本文将通过一个Nginx应用的示例演示如何上报自定义监控指标到AOM,步骤如下:准备应用您需要准备一个应用镜像,该应用需要提供监控指标接口供ICAgent采集,且监控数据需要满足 - [使用PrometheusRule配置普罗监控与告警规则](https://support.huaweicloud.com/usermanual-cce/cce_10_0812.md): Prometheus具有PrometheusRule的能力,PrometheusRule提供了一种用于监控和警报的规则语言,能够方便用户更好地使用Prometheus查询监控指标,配置基于PromQL的告警规则。当前云原生监控插件仅在开启本地数据存储时,支持PrometheusRule配置。Prometheus提供了PrometheusR - [使用Prometheus监控控制节点组件指标](https://support.huaweicloud.com/usermanual-cce/cce_10_0559.md): 本文将介绍如何使用Prometheus对控制节点的kube-apiserver、kube-controller、kube-scheduler、etcd-server、kubelet-cadvisor-master组件进行监控。云原生监控中心已支持对控制节点的kube-apiserver组件进行监控,您在集群中开通云原生监控中心后(安装云原 - [监控NGINX Ingress控制器指标](https://support.huaweicloud.com/usermanual-cce/cce_10_0830.md): 通过Prometheus和Grafana,可以实现对NGINX Ingress控制器指标的观测。本文以实际示例介绍如何通过Prometheus查看集群的NGINX Ingress控制器指标,具体步骤如下:访问Prometheus(可选)为Prometheus绑定LoadBalancer类型的Service,支持从外部访问Prometheu - [监控CCE Turbo集群容器网络扩展指标](https://support.huaweicloud.com/usermanual-cce/cce_10_0834.md): CCE容器网络扩展指标插件是一款容器网络流量监控管理插件,可支持CCE Turbo集群非主机网络容器的流量统计,以及节点内容器连通性健康检查。监控信息已适配Prometheus格式,可以通过调用Prometheus接口查看监控数据。本文以实际示例介绍如何通过Prometheus查看CCE Turbo集群容器网络扩展指标,具体步骤如下:安装 - [Prometheus插件平滑迁移实践](https://support.huaweicloud.com/usermanual-cce/cce_10_0905.md): 由于Prometheus(停止维护)仅支持v1.21及之前的集群版本,若您需要将集群升级至v1.21以上,您需要将停止维护的Prometheus插件迁移至云原生监控插件,以获取后续的技术支持。本文将指导您将已经停止维护的Prometheus插件迁移至云原生监控插件。云原生监控插件与Prometheus插件的对比如下:Prometheus插 - [Grafana插件自定义配置迁移](https://support.huaweicloud.com/usermanual-cce/cce_10_0960.md): 在v1.3.1及以上插件版本中,提供v10和v7的Grafana开源版本选择,但Grafana开源版本由v7.x升级到v10.x存在视图不兼容的风险,需要您卸载Grafana插件并选择v10版本的Grafana插件重新安装。若存在自定义的视图,请参考如下方法操作进行迁移。 - [切换Grafana对接的AOM实例](https://support.huaweicloud.com/usermanual-cce/cce_10_1027.md): 当Grafana插件启用与AOM实例的对接后,会自动生成一个名为prometheus-aom的DataSource配置,并通过Grafana的Provisioning功能自动添加到Grafana的DataSource配置中。Provisioning是Grafana提供的自动化配置方式,允许通过文件定义数据源、仪表盘和告警规则等,无需手动通 - [大规模集群中的云原生监控插件配置最佳实践](https://support.huaweicloud.com/usermanual-cce/cce_10_0978.md): 在大规模集群中,云原生监控插件的采集配置将较大程度地影响采集性能。在数据采集阶段,合理的配置能够显著提升监控系统的效率和稳定性。本文档将指导您在大规模集群中高效配置和管理云原生监控插件,确保集群业务的稳定运行和高效运维。主要包括以下配置:采集周期调整Prometheus采集分片调整kube-state-metrics分片调整kube-st - [日志采集状态监控及告警最佳实践](https://support.huaweicloud.com/usermanual-cce/cce_10_0989.md): 在企业级应用中,通常会配置日志采集功能。然而日志采集过程中可能会出现采集中断、数据丢失等情况。为确保日志的完整性和可用性,建议您设置日志采集状态的监控与告警(例如错误日志的数量、日志的写入量等),一旦检测到异常可通过电子邮件或短信发出告警通知,以便能够迅速响应并处理相关问题。云原生日志采集插件使用fluent-bit组件采集日志,您可以针 - [云原生监控插件负载OOM处理](https://support.huaweicloud.com/usermanual-cce/cce_10_1013.md): 在集群运行过程中,很多情况下云原生监控插件都可能会发生OOM(Out of Memory)问题,本文为您介绍如何有效地解决该问题。云原生监控插件的组件出现OOM时,可参考以下解决方案:prometheus-lightweight负载出现OOMprometheus-server负载出现OOMthanos-query和thanos-sidec - [通过APM配置Java应用告警](https://support.huaweicloud.com/usermanual-cce/cce_10_1089.md): 应用性能管理APM是一种用于实时监控和管理云端应用性能与故障的云服务,能帮助运维人员快速发现应用的性能瓶颈,以及故障根源的快速定位,为用户体验保驾护航。对于部署在Standard/Turbo集群中的Java类工作负载,您只需安装APM探针,无需修改代码,即可实现应用的全方位监控,快速定位出错与慢接口,重现调用参数,识别系统瓶颈,大幅提升线 - [云原生成本治理概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0748.md): 云原生成本治理是基于FinOps理念的容器成本治理解决方案,提供部门维度、集群维度、命名空间维度的成本和资源画像,并通过工作负载资源推荐等优化手段协助企业IT成本管理人员实现容器集群的提效降本诉求。成本洞察基于真实账单和集群资源用量统计数据,通过自研的成本画像算法进行成本拆分,提供以部门、集群、命名空间、应用等维度的成本画像。成本洞察能够 - [云原生成本治理委托权限说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0952.md): 由于云原生成本治理在运行过程中对CCE、AOM、OBS、CBC等各类云服务有依赖关系。因此当您首次使用云原生成本治理功能时,需要具有Security Administrator权限的账户完成授权,将当前区域云资源权限授权给CCE,以此来支持成本治理功能运行需要。为了最小化授权,CCE服务进行了一次权限细粒度化改造,将由系统策略为粒度的权限 - [成本洞察概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0875.md): 成本洞察基于真实账单和集群资源用量统计数据,通过自研的成本画像算法进行成本拆分,提供以部门、集群、命名空间、应用等维度的成本画像。成本洞察能够帮助成本管理人员分析集群成本开销、资源使用状况,识别资源浪费,为下一步的成本优化提供输入。成本洞察从Region视角和集群资源视角展示用户的容器成本使用情况。其中:Region视角成本洞察:以企业管 - [成本计算模型](https://support.huaweicloud.com/usermanual-cce/cce_10_0876.md): 工作负载成本是由Pod成本聚合而成。Pod成本:使用监控指标和实际账单作为输入,通过CPU、内存使用量占整体节点资源比例计算出来的成本,结合Pod关联PVC存储的成本。计算过程中,Pod的使用量为当前采样时刻下申请量(Request)和实际使用量(Real Used)中的最大值。如下图:工作负载成本计算原理如:采样点1,Request C - [开通成本洞察](https://support.huaweicloud.com/usermanual-cce/cce_10_0877.md): 成本洞察基于真实账单和集群资源用量统计数据,通过自研的成本画像算法进行成本拆分,提供以部门、集群、命名空间、应用等维度的成本画像。成本洞察能够帮助成本管理人员分析集群成本开销、资源使用状况,识别资源浪费,为下一步的成本优化提供输入。本文主要介绍如何开通成本洞察功能。开通Region视角的成本洞察开通单集群视角成本洞察开通成本洞察需要安装云 - [Region视角的成本洞察](https://support.huaweicloud.com/usermanual-cce/cce_10_0878.md): 为站在企业管理人员角色的角度,呈现整体Region级别成本分析报表。从云原生角度出发,用户可以灵活去组织成本。可以自由按照集群、命名空间粒度去归结成本到部门,形成部门的成本分析报告。并支持成本报表导出功能。已开通成本洞察功能由于实际账单的获取存在两天时间延迟,开通成本洞察后,成本洞察成本数据会延迟2天显示。使用成本洞察期间,要保证云原生监 - [单部门视角的成本洞察](https://support.huaweicloud.com/usermanual-cce/cce_10_0903.md): 单部门视角成本洞察,提供单一部门的成本分析报告。在部门成本分析模块,进行整体部门成本状况查看,并可单击部门列表中的某一部门,进行单部门的详细成本分析。已开通成本洞察功能已完成部门配置由于实际账单的获取存在两天时间延迟,开通成本洞察后,成本洞察成本数据会延迟2天显示。使用成本洞察期间,要保证云原生监控插件运行正常,否则影响成本洞察中命名空间 - [单集群视角的成本洞察](https://support.huaweicloud.com/usermanual-cce/cce_10_0879.md): 单集群视角的成本洞察是为了帮助成本运维人员深入集群内部,从命名空间、应用、节点池等多个维度分析集群成本开销、资源使用状况,进而提供成本优化的依据。当前支持集群维度和命名空间维度两个视角的成本洞察。已开通成本洞察功能由于实际账单的获取存在两天时间延迟,开通成本洞察后,成本洞察成本数据会延迟2天显示。使用成本洞察期间,需要保证云原生监控插件运 - [应用资源规格推荐](https://support.huaweicloud.com/usermanual-cce/cce_10_0749.md): CCE为Kubernetes原生工作负载提供了应用资源规格推荐的功能。该功能通过对工作负载的历史CPU、内存资源使用数据进行分析,得出工作负载资源申请量(Request)的推荐值,可以帮助您合理进行资源规划,进而为应用粒度的成本优化提供助力。据Gartner统计,企业CPU平均使用率不足15%,造成了严重的资源浪费。这其中一个关键因素就是 - [AI容器概述](https://support.huaweicloud.com/usermanual-cce/cce_10_09731.md): AI容器是云容器引擎CCE提供的AI容器调度平台,支撑大规模AI开发、训练、推理业务。随着大模型参数规模持续增长,AI训练与推理作业对底层基础设施提出了异构算力调度复杂、分布式训练通信瓶颈、推理服务高并发治理等多方面挑战,传统容器调度能力难以满足。AI容器以CCE容器集群为底座,以高性能工作负载调度引擎Volcano为核心,针对上述挑战提 - [部署推理负载](https://support.huaweicloud.com/usermanual-cce/cce_10_11511.md): 推理负载(Inference Workload / ServingGroup)适用于在CCE集群中部署大语言模型(LLM)推理服务。该能力基于Kthena ModelServing构建,通过vLLM推理引擎,支持单节点或多角色(Entry + Worker)分布式推理,结合Gang调度与拓扑感知策略,实现算力灵活配比与服务稳定调度。在开始 - [Kthena ModelServing](https://support.huaweicloud.com/usermanual-cce/cce_10_1123.md): 随着大语言模型(LLM)参数规模的指数级增长,单一计算节点的显存与算力瓶颈日益凸显。为突破物理资源限制,业界正加速向PD分离(Prefill-Decode Disaggregation)与大/小模型混部等创新架构演进。这一变革促使推理任务的执行模式从单Pod独享转向多Pod协作的分布式形态。多Pod协作在推理任务中的核心定位:无论是传统的 - [部署AI应用模板](https://support.huaweicloud.com/usermanual-cce/cce_10_1154.md): AI应用模板是基于华为云CCE(云容器引擎)“AI推理框架插件”打造的便捷化模型部署工具。传统的AI大模型部署往往涉及复杂的容器配置、硬件资源(GPU/NPU)调度、网络网关设置以及存储挂载等繁琐步骤。为了大幅降低大模型部署的门槛,现为您提供了一键式的推理预置模板:预置配置:底层已内置针对主流AI模型(如DeepSeek-R1)的预定义配 - [Volcano Job](https://support.huaweicloud.com/usermanual-cce/cce_10_1092.md): 随着人工智能、大数据分析和高性能计算(HPC)等场景的快速发展,传统Kubernetes Job在复杂任务调度、资源保障、任务依赖等方面逐渐显现出局限性。为解决这些问题,CCE Standard/Turbo 集群基于Volcano提供了 Volcano Job(简称 vcjob) 功能。Volcano是一个面向批处理与高性能计算场景的Ku - [Volcano队列](https://support.huaweicloud.com/usermanual-cce/cce_10_11521.md): 在共享异构算力资源(GPU/NPU) 集群中,算法开发、模型调优和生产训练等业务通常由不同团队共同使用同一批计算资源。如果所有训练任务都提交到同一个默认队列,容易出现以下问题:某个团队一次提交大量任务长期占用GPU/NPU,其他团队的任务无法及时运行;开发调试任务与生产训练任务相互竞争,关键训练缺少稳定的资源保障;某个队列空闲时,已分配给 - [云原生AI套件](https://support.huaweicloud.com/usermanual-cce/cce_10_0973.md): 云原生AI套件以华为云CCE服务为基础,为您提供开箱即用的AI训练与推理全流程的解决方案,涵盖AI资源管理、AI负载调度、AI任务管理、AI数据加速及AI服务部署等服务,提供端到端的全栈支持与优化。CCE AI套件(NVIDIA GPU)和CCE AI套件(Ascend NPU)插件可以实现GPU、NPU、ROCE网卡等异构计算资源的标准 - [AI负载调度](https://support.huaweicloud.com/usermanual-cce/cce_10_0975.md): 本文主要介绍Volcano调度器在AI负载调度方面的关键功能,包括弹性调度、任务调度、异构资源调度和任务队列调度。Volcano调度器提供高性能任务调度引擎、高性能异构芯片管理、高性能任务运行管理等通用计算能力,旨在提升AI负载的调度效率和运行性能。Volcano为应用的扩缩容提供优先级调度能力。Volcano调度器为批量计算的任务提供了 - [CCE集群配置分析](https://support.huaweicloud.com/usermanual-cce/cce_10_1103.md): CCE支持针对集群当前的配置项进行智能分析,包括删除保护、HSS安全服务等配置项的开启情况。如果发现任何风险点,系统将提供相应的改进建议,帮助您更有效地使用集群。使用CCE集群智能诊断会通过云宝助手进行交互,您必须先完成登录、实名认证和服务声明签署。关于AI建议的高风险操作执行规范对于AI建议的删除资源(如强制重置节点配置)、强制更新(如 - [CCE节点/节点池配置分析](https://support.huaweicloud.com/usermanual-cce/cce_10_1104.md): CCE支持针对节点/节点池当前的配置项进行智能分析,包括是否开启等保加固、数据盘加密等配置项。如果发现任何风险点,系统将提供相应的改进建议,帮助您更有效地使用集群。使用CCE集群智能诊断会通过云宝助手进行交互,您必须先完成登录、实名认证和服务声明签署。关于AI建议的高风险操作执行规范对于AI建议的删除资源(如强制重置节点配置)、强制更新( - [CCE集群智能诊断](https://support.huaweicloud.com/usermanual-cce/cce_10_1093.md): CCE智能诊断是一款面向Kubernetes的智能化运维工具,旨在自动检测并诊断Kubernetes相关的问题,帮助运维人员快速发现并解决集群问题。当前版本已支持K8s事件、集群告警及工作负载日志的智能分析与诊断。使用CCE集群智能诊断会通过云宝助手进行交互,您必须先完成登录、实名认证和服务声明签署。关于AI建议的高风险操作执行规范对于A - [CCE节点智能诊断](https://support.huaweicloud.com/usermanual-cce/cce_10_1070.md): CCE智能诊断是一款面向Kubernetes的智能化运维工具,旨在自动检测并诊断Kubernetes相关的问题,帮助运维人员快速发现并解决集群问题。当前版本已支持节点的异常状态诊断。使用CCE节点智能诊断会通过云宝助手进行交互,您必须先完成登录、实名认证和服务声明签署。关于AI建议的高风险操作执行规范对于AI建议的删除资源(如强制重置节点 - [CCE工作负载智能诊断](https://support.huaweicloud.com/usermanual-cce/cce_10_1071.md): CCE智能诊断是一款面向Kubernetes的智能化运维工具,旨在自动检测并诊断Kubernetes相关的问题,帮助运维人员快速发现并解决集群问题。当前版本已支持工作负载的异常状态诊断。使用CCE工作负载智能诊断会通过云宝助手进行交互,您必须先完成登录、实名认证和服务声明签署。关于AI建议的高风险操作执行规范对于AI建议的删除资源(如de - [CCE服务/路由智能诊断](https://support.huaweicloud.com/usermanual-cce/cce_10_1106.md): CCE支持针对服务(Service)和路由(Ingress)自身资源信息以及触发的相关事件进行智能诊断,协助您定位异常根因,并提供相应的解决方案帮助您解决异常。使用CCE集群智能诊断会通过云宝助手进行交互,您必须先完成登录、实名认证和服务声明签署。关于AI建议的高风险操作执行规范对于AI建议的删除资源(如强制重置节点配置)、强制更新(如修 - [CCE存储智能诊断](https://support.huaweicloud.com/usermanual-cce/cce_10_1105.md): CCE支持针对存储卷声明(PVC)和存储卷(PV)自身资源信息以及触发的相关事件进行智能诊断,协助您定位异常根因,并提供相应的解决方案帮助您解决异常。使用CCE集群智能诊断会通过云宝助手进行交互,您必须先完成登录、实名认证和服务声明签署。关于AI建议的高风险操作执行规范对于AI建议的删除资源(如强制重置节点配置)、强制更新(如修改核心系统 - [创建命名空间](https://support.huaweicloud.com/usermanual-cce/cce_10_0278.md): 命名空间(Namespace)是对一组资源和对象的抽象整合。在同一个集群内可创建不同的命名空间,不同命名空间中的数据彼此隔离。使得它们既可以共享同一个集群的服务,也能够互不干扰。例如可以将开发环境、测试环境的业务分别放在不同的命名空间。至少已创建一个集群。每个命名空间下,创建的服务数量不能超过6000个。此处的服务对应kubernetes - [管理命名空间](https://support.huaweicloud.com/usermanual-cce/cce_10_0285.md): 创建工作负载时,您可以选择对应的命名空间,实现资源或租户的隔离。查询工作负载时,选择对应的命名空间,查看对应命名空间下的所有工作负载。按照不同环境划分命名空间一般情况下,工作负载发布会经历开发环境、联调环境、测试环境,最后到生产环境的过程。这个过程中不同环境部署的工作负载相同,只是在逻辑上进行了定义。分为两种做法:分别创建不同集群。不同集 - [设置资源配额及限制](https://support.huaweicloud.com/usermanual-cce/cce_10_0287.md): Kubernetes在一个物理集群上提供了多个虚拟集群,这些虚拟集群被称为命名空间。命名空间可用于多种工作用途,满足多用户、多环境、多应用的使用需求,通过为每个命名空间配置包括CPU、内存、Pod数量等资源的额度可以有效限制资源滥用,从而保证集群的可靠性,更多信息请参见资源配额。从1.21版本集群开始,如果在集群配置管理中开启了enabl - [创建配置项](https://support.huaweicloud.com/usermanual-cce/cce_10_0152.md): 配置项(ConfigMap)是Kubernetes中用于存储非敏感配置信息的资源类型,其内容可由用户灵活定义。配置项创建完成后,支持以文件挂载或环境变量注入两种方式,被容器工作负载直接调用。通过配置项,能够将配置文件与容器镜像解耦,大幅提升容器工作负载的可移植性,避免因配置差异导致镜像重复构建。配置项的核心价值体现在以下几个方面:配置文件 - [使用配置项](https://support.huaweicloud.com/usermanual-cce/cce_10_0015.md): 配置项创建后,可在工作负载环境变量、命令行参数和数据卷三个场景使用。通过配置项设置工作负载环境变量通过配置项设置命令行参数使用配置项挂载到工作负载数据卷本节以下面这个ConfigMap为例,具体介绍ConfigMap的用法。在工作负载里使用ConfigMap时,需要工作负载和ConfigMap处于同一集群和命名空间中。以数据卷挂载使用Co - [创建密钥](https://support.huaweicloud.com/usermanual-cce/cce_10_0153.md): 密钥(Secret)是Kubernetes中用于存储敏感信息等的资源类型,例如工作负载所需要认证信息、密钥等。Secret的内容由用户决定,创建完成后,支持以文件挂载或环境变量注入两种方式,被容器工作负载安全调用。借助Secret,能够将敏感信息与容器镜像解耦,避免敏感数据明文暴露在镜像或配置文件中,大幅降低数据泄露风险,同时提升工作负载 - [使用密钥](https://support.huaweicloud.com/usermanual-cce/cce_10_0016.md): 密钥创建后,可在工作负载环境变量和数据卷两个场景使用。请勿对以下CCE系统使用的密钥做任何操作,详情请参见集群系统密钥说明。请不要操作kube-system下的secrets。请不要操作任何命名空间下的default-secret、paas.elb。其中,default-secret用于SWR的私有镜像拉取,paas.elb用于该命名空间 - [集群系统密钥说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0388.md): CCE默认会在每个命名空间下创建如下密钥。default-secretpaas.elbdefault-token-xxxxx(xxxxx为随机数)下面将详细介绍这个几个密钥的用途。default-secret的类型为kubernetes.io/dockerconfigjson,其data内容是登录SWR镜像仓库的凭据,用于从SWR拉取镜像 - [插件概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0277.md): CCE提供了多种类型的插件,用于管理集群的扩展功能,支持用户根据特定需求进行选择性扩展,从而增强容器化应用环境的功能和灵活性。这些插件既包括CCE自研/增强的插件,也涵盖了广泛使用的开源插件。CCE自研/增强插件与CCE平台深度集成,针对特定的业务需求和场景进行了优化,能够更好地支持复杂的企业级应用,确保高性能和高可靠性。开源插件则利用广 - [Volcano调度器](https://support.huaweicloud.com/usermanual-cce/cce_10_0193.md): Volcano是一个基于Kubernetes的批处理平台,提供了机器学习、深度学习、生物信息学、基因组学及其他大数据应用所需要而Kubernetes当前缺失的一系列特性。Volcano提供了高性能任务调度引擎、高性能异构芯片管理、高性能任务运行管理等通用计算能力,通过接入AI、大数据、基因、渲染等诸多行业计算框架服务终端用户,最大支持10 - [CCE集群弹性引擎](https://support.huaweicloud.com/usermanual-cce/cce_10_0154.md): CCE集群弹性引擎插件基于社区Autoscaler组件,能够根据应用的资源需求自动调整集群节点数量,优化资源利用率和性能。作为Kubernetes中的核心控制器,Autoscaler具备根据资源需求情况自动扩展或缩减节点的能力。当集群中的Pod因为资源不足无法调度时,Autoscaler会扩容新的节点来提供更多的资源。同时,如果扩容的节点 - [CCE容器弹性引擎](https://support.huaweicloud.com/usermanual-cce/cce_10_0240.md): CCE容器弹性引擎(原名cce-hpa-controller)插件是一款CCE自研的插件,能够基于CPU利用率、内存利用率等指标,对无状态工作负载进行弹性扩缩容。安装本插件后,可创建CronHPA定时策略及CustomedHPA策略,具体请参见创建CronHPA定时策略或创建CustomedHPA策略。支持按照当前实例数的百分比进行扩缩容 - [CCE突发弹性引擎(对接CCI)](https://support.huaweicloud.com/usermanual-cce/cce_10_0135.md): CCE突发弹性引擎(对接 CCI)作为一种虚拟的kubelet用来连接Kubernetes集群和其他平台的API。Bursting的主要场景是将Kubernetes API扩展到无服务器的容器平台(如CCI)。基于该插件,支持用户在短时高负载场景下,将部署在云容器引擎CCE上的无状态负载(Deployment)、有状态负载(Statefu - [容器垂直弹性引擎](https://support.huaweicloud.com/usermanual-cce/cce_10_0920.md): CCE容器垂直弹性引擎是一款支持应用垂直弹性伸缩(VPA,Vertical Pod Autoscaling)的插件,可以根据容器资源历史使用情况自动调整Pod的CPU、Memory资源申请量。开源社区地址:https://github.com/kubernetes/autoscaler/tree/master/vertical-pod-a - [CCE增强集群弹性引擎](https://support.huaweicloud.com/usermanual-cce/cce_10_1142.md): CCE增强集群弹性引擎(AdvancedClusterAutoscaler,简称ACA)是一个基于社区cluster-autoscaler智能增强的集群预测弹性引擎插件,深度对接AASP服务(柔性资源容量预测服务)进行宏观建模,提前感知集群级别负载压力变化,实现更主动,更精准的容量调整。针对具有明显周期性变化的整体性负载具有更佳效果。AA - [云原生监控插件](https://support.huaweicloud.com/usermanual-cce/cce_10_0406.md): 云原生监控插件(原名kube-prometheus-stack)通过使用Prometheus-operator和Prometheus,提供简单易用的端到端Kubernetes集群监控能力。使用云原生监控插件可将监控数据与监控中心对接,在监控中心控制台查看监控数据,配置告警等。开源社区地址:https://github.com/promet - [云原生日志采集插件](https://support.huaweicloud.com/usermanual-cce/cce_10_0416.md): 云原生日志采集插件(原名log-agent)是基于开源fluent-bit和opentelemetry构建的云原生日志、K8s事件采集插件。log-agent支持基于CRD的日志采集策略,可以根据您配置的策略规则,对集群中的容器标准输出日志、容器文件日志、节点日志及K8s事件日志进行采集与转发。同时支持上报K8s事件到AOM,用于配置事件 - [CCE节点故障检测](https://support.huaweicloud.com/usermanual-cce/cce_10_0132.md): CCE节点故障检测插件(原名NPD)是一款监控集群节点异常事件的插件,以及对接第三方监控平台功能的组件。它是一个在每个节点上运行的守护程序,可从不同的守护进程中搜集节点问题并将其报告给apiserver。NPD可以作为DaemonSet运行, 也可以独立运行。CCE节点故障检测插件基于社区开源项目node-problem-detector - [CCE容器网络扩展指标](https://support.huaweicloud.com/usermanual-cce/cce_10_0371.md): CCE容器网络扩展指标插件是一款CCE Turbo集群容器网络可观测性增强插件,能提供CCE Turbo集群容器网络相关的各项监控数据,帮助您观测各种容器网络流量以及快速发现和定位容器网络问题。插件实例仅支持部署在X86/ARM架构的Huawei Cloud EulerOS 2.0节点或X86架构的EulerOS的节点上。当前支持Pod粒 - [Kubernetes Metrics Server](https://support.huaweicloud.com/usermanual-cce/cce_10_0205.md): 从Kubernetes 1.8开始,Kubernetes通过Metrics API提供资源使用指标,例如容器CPU和内存使用率。这些度量可以由用户直接访问(例如,通过使用kubectl top命令),或者由集群中的控制器(例如,Horizontal Pod Autoscaler)使用来进行决策,具体的组件为Metrics-Server,用 - [Grafana](https://support.huaweicloud.com/usermanual-cce/cce_10_0828.md): Grafana是一款开源的数据可视化和监控平台,可以为您提供丰富的图表和面板,用于实时监控、分析和可视化各种指标和数据源。待插件安装完成后,选择对应的集群,然后单击左侧导航栏的“插件中心”,可筛选“已安装插件”查看相应的插件。如需通过公网访问Grafana图表,您需要在Grafana设置中开启“公网访问”并绑定一个负载均衡器。开启“公网访 - [Prometheus(停止维护)](https://support.huaweicloud.com/usermanual-cce/cce_10_0221.md): Prometheus是一套开源的系统监控报警框架。它启发于Google的borgmon监控系统,由工作在SoundCloud的Google前员工在2012年创建,作为社区开源项目进行开发,并于2015年正式发布。2016年,Prometheus正式加入Cloud Native Computing Foundation,成为受欢迎度仅次于K - [CCE AI套件(NVIDIA GPU)](https://support.huaweicloud.com/usermanual-cce/cce_10_0141.md): CCE AI套件(NVIDIA GPU)插件是一款用于启用和管理GPU资源的设备管理插件,支持容器内访问GPU显卡资源,帮助用户在云原生环境中高效运行和运维基于GPU的计算密集型工作负载。通过该插件,Standard/Turbo集群可具备GPU调度、驱动自动化安装、运行时管理及性能指标监控等能力,为GPU工作负载提供完整的生命周期支持。集 - [CCE AI套件(Ascend NPU)](https://support.huaweicloud.com/usermanual-cce/cce_10_0239.md): CCE AI套件(Ascend NPU)是支持容器里使用huawei NPU设备的管理插件,提供驱动自动安装、设备注册与调度支持、性能监控和虚拟化资源管理等功能。通过该插件,用户可实现NPU资源的自动化部署、精细化调度、可视化监控和虚拟化使用,满足多样化的异构算力需求。常用应用场景包括:AI模型训练:支持多卡并行和精细化资源调度,提升大规 - [AI推理框架插件](https://support.huaweicloud.com/usermanual-cce/cce_10_0996.md): AI推理框架插件是一款面向AI模型全生命周期管理的云原生插件,支持用户通过声明式API自定义注册、部署及调度AI大模型,并高效执行推理任务。已创建v1.28及以上版本的CCE Standard/Turbo集群,且集群内已有Snt9B类型的NPU节点。已安装LeaderWorkerSet插件,具体操作请参见LeaderWorkerSet插件 - [AI推理网关插件](https://support.huaweicloud.com/usermanual-cce/cce_10_1003.md): 随着大规模语言模型(LLM)及人工智能(AI)推理服务的迅猛发展,云原生AI团队面临着愈加复杂的推理流量治理难题。在AI推理应用场景中,除了传统的基于HTTP路径和协议的流量路由外,还需根据“模型名称”、“推理优先级”以及“模型版本”等AI业务属性,灵活地进行流量分发与灰度发布,以满足日益多样化的业务需求。为此,CCE Standard/ - [AI数据加速引擎插件](https://support.huaweicloud.com/usermanual-cce/cce_10_0999.md): 在处理AI和大数据任务时,Kubernetes面临计算存储分离导致的高延迟和带宽浪费、数据管理不足、存储接口碎片化,以及缺乏智能数据感知与调度等核心挑战。为此,CCE Standard/Turbo集群基于Fluid提供AI数据加速引擎插件。该插件提供数据集抽象、数据编排和应用编排等能力,旨在通过透明的数据管理和优化调度,帮助AI和大数据应 - [LeaderWorkerSet插件](https://support.huaweicloud.com/usermanual-cce/cce_10_1004.md): 大规模语言模型(LLM)推理采用多节点、多GPU的分布式计算架构,通过Tensor Parallelism跨GPU切分模型参数,结合Pipeline Parallelism跨节点分配计算阶段,实现多设备协同推理。传统的Kubernetes的Deployment和StatefulSet可以用于部署LLM分布式推理,但存在一些局限性:Depl - [kagent插件](https://support.huaweicloud.com/usermanual-cce/cce_10_1001.md): Kagent是专为DevOps和平台工程师设计的开源编程框架,将强大的AI代理功能引入Kubernetes集群,自动化执行运维任务、排查故障并优化云原生环境中的工作流,帮助团队更高效地解决复杂的技术挑战。其主要提供以下功能:自动化运维:通过AI代理自动处理常见故障(如Pod崩溃、网络策略冲突),减少人工干预。知识沉淀:将团队经验转化为可复 - [AgentCube插件](https://support.huaweicloud.com/usermanual-cce/cce_10_1133.md): 随着生成式AI和大语言模型(LLM)应用的快速发展,AI Agent工作负载正在成为云原生环境中的重要负载类型。这些工作负载具有独特的特征:持续交互、状态保持、间歇性活跃的长会话特性。然而,现有的工作负载管理模式无法满足AI Agent的这些特殊需求:冷启动延迟高:Agent的交互通常要求毫秒级响应。然而,原生的K8s Pod启动流程(调 - [Notebook](https://support.huaweicloud.com/usermanual-cce/cce_10_1141.md): 在AI模型的研发全生命周期中,数据探索(Data Exploration)与算法实验(Prototyping)是最为耗时且迭代频繁的环节。传统本地开发模式正面临三大严峻挑战:算力瓶颈:本地笔记本或工作站难以承载大模型微调及海量数据预处理的高并发计算需求,导致迭代周期漫长。环境依赖困境:深度学习框架(PyTorch、MindSpore)、底 - [KubeRay](https://support.huaweicloud.com/usermanual-cce/cce_10_0958.md): KubeRay是一个Kubernetes原生插件,用于在Kubernetes集群(包括CCE Standard/Turbo集群)上管理和运行Ray分布式计算框架。Ray是一个高性能的分布式计算库,常用于机器学习、强化学习和数据处理等场景。KubeRay的目标是将Ray与Kubernetes深度集成,使得用户可以轻松地在Kubernetes - [Kubeflow插件](https://support.huaweicloud.com/usermanual-cce/cce_10_1000.md): 随着模型和数据量的增加,如何高效地构建、部署和管理复杂的机器学习工作流成为重要挑战,具体如下:缺乏管理复杂机器学习任务的统一平台。不同组件之间的依赖关系和数据流难以追踪和管理。重复执行相同任务导致计算资源浪费。不同的计算环境之间无法迁移工作流,缺乏灵活性。为解决上述问题,CCE Standard/Turbo集群基于Kubeflow提供了K - [CoreDNS域名解析](https://support.huaweicloud.com/usermanual-cce/cce_10_0129.md): CoreDNS域名解析插件是一款通过链式插件的方式为Kubernetes提供域名解析服务的DNS服务器。CoreDNS是由CNCF孵化的开源软件,用于Cloud-Native环境下的DNS服务器和服务发现解决方案。CoreDNS实现了插件链式架构,能够按需组合插件,运行效率高、配置灵活。在Kubernetes集群中使用CoreDNS能够自 - [NGINX Ingress控制器](https://support.huaweicloud.com/usermanual-cce/cce_10_0034.md): Kubernetes通过kube-proxy服务实现了Service的对外发布及负载均衡,它的各种方式都是基于传输层实现的。在实际的互联网应用场景中,不仅要实现单纯的转发,还有更加细致的策略需求,如果使用真正的负载均衡器更会增加操作的灵活性和转发性能。基于以上需求,Kubernetes引入了资源对象Ingress,Ingress为Serv - [节点本地域名解析加速](https://support.huaweicloud.com/usermanual-cce/cce_10_0404.md): 节点本地域名解析加速(原名node-local-dns)是基于社区NodeLocal DNSCache提供的插件,通过在集群节点上作为守护程序集运行DNS缓存代理,提高集群DNS性能。开源社区地址:https://github.com/kubernetes/dns启用NodeLocal DNSCache之后,DNS查询所遵循的路径如下图所 - [Envoy Gateway](https://support.huaweicloud.com/usermanual-cce/cce_10_1155.md): Envoy Gateway是基于Envoy构建的开源Kubernetes API网关,完全遵循Gateway API标准,提供标准化、高性能、可扩展的南北向流量接入与路由管理能力,可替代Ingress作为Kubernetes集群统一流量入口,支撑业务发布、流量治理、安全防护等核心场景。开源社区地址:https://github.com/e - [CCE容器存储(Everest)](https://support.huaweicloud.com/usermanual-cce/cce_10_0066.md): CSI(Container Storage Interface)是Kubernetes社区推荐的存储插件标准,用于实现容器编排平台与各类存储系统的统一对接。基于CSI标准,CCE提供自研的存储插件,即CCE容器存储(Everest)插件。该插件可无缝对接多种IaaS存储服务,包括云硬盘(块存储)、文件存储、对象存储和极速文件存储等,为容器 - [CCE容器存储(Flexvolume,已废弃)](https://support.huaweicloud.com/usermanual-cce/cce_10_0127.md): CCE容器存储(FlexVolume),即storage-driver,是一款云存储驱动插件,北向遵循标准容器平台存储驱动接口。实现Kubernetes Flex Volume标准接口,提供容器使用EVS块存储、SFS文件存储、OBS 对象存储、SFS Turbo 极速文件存储的能力。通过安装升级云存储插件可以实现云存储功能的快速安装和更 - [CCE密钥管理(对接 DEW)](https://support.huaweicloud.com/usermanual-cce/cce_10_0370.md): CCE密钥管理(原名dew-provider)插件用于对接密码安全中心(Data Encryption Workshop, DEW)。该插件允许用户将存储在集群外部(即专门存储敏感信息的数据加密服务)的凭据挂载至业务Pod内,从而将敏感信息与集群环境解耦,有效避免程序硬编码或明文配置等问题导致的敏感信息泄密。安装该插件后,您可以使用以下能 - [容器镜像签名验证](https://support.huaweicloud.com/usermanual-cce/cce_10_0743.md): 容器镜像签名验证插件(原名swr-cosign)提供镜像验签功能,可以对镜像文件进行数字签名验证,以确保镜像文件的完整性和真实性,有效地防止软件被篡改或植入恶意代码,保障用户的安全。使用镜像验签功能依赖容器镜像仓库企业版,请先创建一个企业版仓库。选择系统预置规格时,您可根据集群规模选择“小规格”或“大规格”,系统会根据不同的预置规格配置插 - [Kubernetes Dashboard](https://support.huaweicloud.com/usermanual-cce/cce_10_0128.md): Kubernetes Dashboard是一个旨在为Kubernetes世界带来通用监控和操作Web界面的项目,集合了命令行可以操作的所有命令。使用Kubernetes Dashboard,您可以:向Kubernetes集群部署容器化应用诊断容器化应用的问题管理集群的资源查看集群上所运行的应用程序创建、修改Kubernetes上的资源(例 - [OpenKruise](https://support.huaweicloud.com/usermanual-cce/cce_10_0915.md): OpenKruise是一个基于Kubernetes的扩展套件,使用CRD拓展来提供扩展工作负载和应用管理能力,实现云原生应用的自动化部署、发布、运维和可用性防护,使得应用的管理更加简单和高效。OpenKruise的核心能力如下:高级工作负载:OpenKruise包含一系列增强版本的工作负载,例如CloneSet、Advanced Stat - [Gatekeeper](https://support.huaweicloud.com/usermanual-cce/cce_10_0917.md): Gatekeeper是一个基于开放策略(OPA)的可定制的云原生策略控制器,有助于策略的执行和治理能力的加强,在集群中提供了更多符合Kubernetes应用场景的安全策略规则。开源社区地址:https://github.com/open-policy-agent/gatekeeper使用方式:https://open-policy-age - [Velero](https://support.huaweicloud.com/usermanual-cce/cce_10_1162.md): Velero是一款提供备份和恢复Kubernetes集群资源及持久卷的插件,它将用户应用数据和业务数据备份到OBS桶中,并提供数据的本地备份和远程备份的能力。您可以在以下场景中使用Velero插件:对您的集群进行备份,以便在数据丢失时进行恢复。将集群资源迁移到其他集群。将您的生产集群复制到开发和测试集群中。开源社区地址:https://g - [CCE集群备份恢复(停止维护)](https://support.huaweicloud.com/usermanual-cce/cce_10_0395.md): CCE集群备份恢复插件(原名e-backup)提供集群备份恢复能力。它将用户应用数据和业务数据备份到OBS桶中,并提供数据的本地备份和远程备份的能力。备份/恢复过程中,用户要保证集群处于稳态,不要触发增删改等变更行为,以免出现备份/恢复失败或不完整;若集群发生变更,建议等15分钟后,集群处于稳态,再做备份操作;使用 云盘快照备份 时,仅提 - [Kubernetes Web终端(停止维护)](https://support.huaweicloud.com/usermanual-cce/cce_10_0134.md): Kubernetes Web终端(原名web-terminal)是一款非常轻巧的终端服务器,支持在Web界面上使用Kubectl命令。它支持通过标准的Web浏览器和HTTP协议提供远程CLI,提供灵活的接口便于集成到独立系统中,可直接作为一个服务连接,通过cmdb获取信息并登录服务器。web-terminal可以在Node.js支持的所有 - [通用检查项](https://support.huaweicloud.com/usermanual-cce/cce_10_1031.md): 插件状态异常检查插件配置异常检查模板检查检查说明:检测到插件关联的Pod或Service未全部就绪,导致插件处于非“运行中”状态。检测范围:支持检查类型:插件运行中巡检插件编辑/升级前检查插件运行中巡检插件编辑/升级前检查支持集群范围:1.15及以上集群版本支持插件范围:所有插件风险说明:若在插件未完全就绪的情况下继续执行集群升级,可能导 - [NGINX Ingress控制器插件升级检查](https://support.huaweicloud.com/usermanual-cce/cce_10_1032.md): 对于NGINX Ingress控制器插件,在升级时除通用检查项中包括的插件状态异常检查、插件配置异常检查、模板检查外,还需对以下资源进行额外检查:证书密钥长度检查默认后端服务检查IngressClass缺失检查Snippet兼容性检查检查说明:检查NGINX Ingress控制器指定的默认服务器证书密钥长度是否安全。检测范围:支持检查类型 - [模板概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0191.md): CCE提供了管理Helm Chart(模板)的控制台,能够帮助您方便地使用模板部署应用,并在控制台上管理应用。CCE使用的Helm版本为v3.8.2,支持上传Helm v3语法的模板包,具体请参见通过模板部署应用。您也可以直接使用Helm客户端直接部署应用,使用Helm客户端部署应用不受版本控制,可以使用Helm v2或v3,具体请参见通 - [通过模板部署应用](https://support.huaweicloud.com/usermanual-cce/cce_10_0146.md): 在CCE控制台上,您可以上传Helm模板包,然后在控制台安装部署,并对部署的实例进行管理。CCE从2022年9月开始,各region将逐步切换至Helm v3。模板管理不再支持Helm v2版本的模板,若您在短期内不能切换至Helm v3,可通过Helm v2 客户端在后台管理v2版本的模板。单个用户可以上传模板的个数有限制,请以各个Re - [Helm v2与Helm v3的差异及适配方案](https://support.huaweicloud.com/usermanual-cce/cce_10_0421.md): 随着Helm v2 发布最终版本Helm 2.17.0,Helm v3 现在已是 Helm 开发者社区支持的唯一标准。为便于管理,建议用户尽快将模板切换至Helm v3格式。当前社区从Helm v2演进到Helm v3,主要有以下变化:移除tillerHelm v3 使用更加简单和灵活的架构,移除了 tiller,直接通过kubeconf - [通过Helm v2客户端部署应用](https://support.huaweicloud.com/usermanual-cce/cce_10_0420.md): CCE从2022年9月开始,各region将逐步切换至Helm v3。模板管理不再支持Helm v2版本的模板,若您在短期内不能切换至Helm v3,可通过Helm v2 客户端在后台管理v2版本的模板。在CCE中创建的Kubernetes集群已对接kubectl,具体请参见步骤一:下载kubectl。CCE当前会尝试转换v2模板实例到v - [通过Helm v3客户端部署应用](https://support.huaweicloud.com/usermanual-cce/cce_10_0144.md): 在CCE中创建的Kubernetes集群已对接kubectl,具体请参见步骤一:下载kubectl。部署Helm时如果需要拉取公网镜像,请提前为节点绑定弹性公网IP。本文以Helm v3.3.0为例进行演示。如需选择其他合适的版本,请访问https://github.com/helm/helm/releases。回显如下:version. - [Helm v2 Release转换成Helm v3 Release](https://support.huaweicloud.com/usermanual-cce/cce_10_0422.md): 当前CCE已全面支持Helm v3版本,用户可通过本指南将已创建的v2 release转换成v3 release,从而更好地使用v3的特性。因Helm v3底层相对于Helm v2来说,一些功能已被弃用或重构,因此转换会有一定风险,需转换前进行模拟转换。该指南参考社区文档:https://github.com/helm/helm-2to3 - [CCE权限概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0187.md): CCE权限管理是在统一身份认证服务(IAM)与Kubernetes的角色访问控制(RBAC)的能力基础上,打造的细粒度权限管理功能,支持基于IAM的细粒度权限控制和IAM Token认证,支持集群级别、命名空间级别的权限控制,帮助用户便捷灵活地对租户下的IAM用户、用户组设定不同的操作权限。如果您需要对CCE集群及相关资源进行精细的权限管 - [角色与策略授权(旧版IAM)](https://support.huaweicloud.com/usermanual-cce/cce_10_0732.md): 如果您需要对CCE进行角色与策略授权的权限管理,您可以使用统一身份认证服务(Identity and Access Management,简称IAM),通过IAM,您可以:根据企业的业务组织,在您的账号中,给企业中不同职能部门的员工创建IAM用户,让员工拥有唯一安全凭证,并使用CCE资源。根据企业用户的职能,设置不同的访问权限,以达到用户 - [身份策略授权(新版IAM)](https://support.huaweicloud.com/usermanual-cce/cce_10_0733.md): 身份策略授权是IAM新版控制台提供的能力,提供更精细化和更灵活的权限管控。关于新旧版IAM的差异详情,请参见IAM新旧控制台功能差异说明。如果您继续使用IAM旧版控制台,相关的操作及说明请参考角色与策略授权(旧版IAM)。如果您需要对CCE进行身份策略的权限管理,您可以使用统一身份认证服务(Identity and Access Mana - [CCE控制台的权限依赖](https://support.huaweicloud.com/usermanual-cce/cce_10_0190.md): CCE对其他云服务有诸多依赖关系,因此在您开启IAM授权后,在CCE Console控制台的各项功能需要配置相应的服务权限后才能正常查看或使用,详细说明如下:依赖服务的权限配置均基于您已设置了IAM授权的CCE FullAccess或CCE ReadOnlyAccess策略权限,详细设置方法请参见集群权限(IAM授权)。集群显示情况依赖于 - [配置命名空间权限(Kubernetes RBAC授权)](https://support.huaweicloud.com/usermanual-cce/cce_10_0189.md): 命名空间权限是基于Kubernetes RBAC能力的授权,通过权限设置可以让不同的用户或用户组拥有操作不同Kubernetes资源的权限。Kubernetes RBAC API定义了四种类型:Role、ClusterRole、RoleBinding与ClusterRoleBinding,这四种类型之间的关系和简要说明如下:Role:角色 - [使用访问策略(AccessPolicy)API管理命名空间权限(Kubernetes RBAC授权)](https://support.huaweicloud.com/usermanual-cce/cce_10_0957.md): 在多用户的场景下,不同的用户群体可能需要特定级别的集群资源访问权限,而IAM权限不支持根据集群的资源类型进行细粒度授权,您需要在IAM对用户进行授权后,继续前往集群授予命名空间权限(Kubernetes RBAC授权),这一操作过程需要在不同的权限体系中进行切换,存在比较大的维护工作量。CCE支持使用访问策略(AccessPolicy)A - [RBAC示例:某部门权限设计及配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0245.md): 随着容器技术的快速发展,原有的分布式任务调度模式正在被基于Kubernetes的技术架构所取代。云容器引擎(Cloud Container Engine,简称CCE)是高度可扩展的、高性能的企业级Kubernetes集群,支持社区原生应用和工具。借助云容器引擎,您可以在云上轻松部署、管理和扩展容器化应用程序,快速高效地将微服务部署在云端。 - [在CCE集群中使用容器组身份(Pod Identity)获取IAM凭证](https://support.huaweicloud.com/usermanual-cce/cce_10_1110.md): 容器组身份(Pod Identity)是云容器引擎(CCE)提供的一项强大功能,它允许Kubernetes中的Pod以安全、可控的方式访问华为云服务资源。与基于OIDC的工作负载身份认证相比,Pod Identity的配置方式更加简单,具备更强的隔离性。本文档介绍如何CCE集群中使用Pod Identity。Pod Identity为集群 - [在CCE集群中使用OIDC实现工作负载身份认证(旧版IAM)](https://support.huaweicloud.com/usermanual-cce/cce_10_2188.md): 工作负载身份认证(Workload Identity)允许集群中的工作负载模拟IAM用户来访问云服务,从而无需直接使用IAM账号的AK/SK等信息,降低安全风险。本文档介绍如何在CCE中使用工作负载Identity。本文方案仅适用于对接旧版IAM。支持1.19.16及以上版本集群。获取集群签发的公钥,将集群Token控制器注册为IAM身份 - [在CCE中使用Dex OIDC Provider进行身份验证](https://support.huaweicloud.com/usermanual-cce/cce_10_0997.md): Dex是一个开源的OpenID Connect(OIDC)身份提供商,在Kubernetes中使用Dex可以为集群提供灵活的身份认证和联邦身份管理能力。Dex充当中间层,将多种身份源(如LDAP、GitHub、SAML等)转换为标准的OIDC协议,供Kubernetes和其他应用使用。OIDC是一种基于OAuth 2.0协议的认证方式,在 - [系统委托说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0556.md): 由于CCE在运行中对计算、存储、网络以及监控等各类云服务资源都存在依赖关系,因此当您首次登录CCE控制台时,CCE将自动请求获取当前资源空间下的云资源权限,从而更好地为您提供服务。服务权限包括:计算类服务CCE集群创建节点时会关联创建云服务器,因此需要获取访问弹性云服务器、裸金属服务器的权限。存储类服务CCE支持为集群下节点和容器挂载存储 - [集群自定义委托说明](https://support.huaweicloud.com/usermanual-cce/cce_10_1069.md): CCE集群在运行时对计算、存储、网络以及监控等各类云服务资源存在依赖关系,需要您通过委托授权CCE集群对各类云服务资源进行操作。默认情况下,CCE使用系统委托生成集群内部使用的临时访问凭证,CCE集群通过此凭证对各类云服务资源进行访问。您也可以对CCE集群配置使用自定义委托,配置了自定义委托的CCE集群将使用自定义委托生成集群内部使用的临 - [插件自定义委托说明](https://support.huaweicloud.com/usermanual-cce/cce_10_1099.md): CCE部分插件在使用时对计算、存储、网络以及监控等各类云服务资源存在依赖关系,需要您通过委托授权插件对各类云服务资源进行操作。为了保障您的集群安全,CCE对插件使用的凭据来源进行了一次重要的安全加固升级:最小化权限:允许用户为每个插件配置单独的委托,仅授权插件所需的IAM权限,确保每个插件只能访问其工作所必需的资源和服务。废弃静态凭据:不 - [ServiceAccount Token安全性提升说明](https://support.huaweicloud.com/usermanual-cce/cce_10_0477.md): Kubernetes 1.21以前版本的集群中,Pod中获取Token的形式是通过挂载ServiceAccount的Secret来获取Token,这种方式获得的Token是永久的。该方式在1.21及以上的版本中不再推荐使用,并且根据社区版本迭代策略,在1.25及以上版本的集群中,ServiceAccount将不会自动创建对应的Secret - [禁用集群中静态存储的临时凭据说明](https://support.huaweicloud.com/usermanual-cce/cce_10_1111.md): 当前CCE对集群中使用的凭据来源进行了安全加固升级,不再依赖集群中通过Secret形式静态存储的临时凭据,您可以在集群中将其禁用以提升集群安全性。用于存储临时凭据的Secret如下:paas.elb、paas.aksk:默认插件凭证,该Secret的data内容是临时AK/SK数据,部分插件在未配置自定义委托时会使用它作为IAM凭证访问其 - [集群配置概览](https://support.huaweicloud.com/usermanual-cce/cce_10_0782.md): 集群配置中心为您提供集群基础配置的概况及对应的修改入口,包含集群信息、集群配置、集群控制节点可用区和已安装插件多维度的信息概况。集群信息包括多个维度:集群ID:集群资源唯一标识,创建成功后自动生成,可用于API接口调用等场景。集群名称:集群创建成功后可以单击进行修改集群名称。集群原名:修改集群名称后显示的集群原名,设置其他集群的名称时和该 - [集群访问配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0783.md): kubectl:您需要先下载kubectl以及kubeconfig配置文件,完成配置后,即可以使用kubectl访问Kubernetes集群。详情请参见通过kubectl连接集群。公网地址:为Kubernetes集群的API Server绑定弹性公网IP。配置完成后,集群API Server将具有公网访问能力。如果无可用IP,可单击“创建 - [网络配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0784.md): 网络配置支持为您的集群配置节点默认安全组,扩展容器网段等。容器网段:当创建集群时设置的容器网段太小,无法满足业务扩容需求时,您可以通过扩展集群容器网段的方法来解决,详情请参见扩展VPC网络集群的容器网段。仅支持v1.19.16-r0及以上版本的“VPC网络”模型集群。仅支持v1.19.16-r0及以上版本的“VPC网络”模型集群。VPC容 - [调度配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0785.md): 为您提供kube-scheduler基础配置信息,并提供Volcano作为容器调度器的高级调度能力配置,您可以在此开启装箱策略、基于优先级的调度与抢占、AI任务性能增强、异构资源管理等高级调度能力,提升集群资源利用率,为您节约成本。默认调度器 (default-scheduler)Kubernetes调度器可以发现集群中新创建且尚未被调度 - [集群弹性伸缩配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0786.md): CCE集群弹性引擎将综合判断整集群的资源情况,当微服务负载高(CPU/内存使用率过高)时水平扩容,增加Pod的数量以降低负载。节点扩容条件负载无法调度时自动扩容:集群中存在负载实例无法调度时,尝试自动扩容已开启弹性伸缩的节点池。若Pod已经设置亲和某个节点,则不会自动扩容节点。该功能可以和HPA策略配合使用,具体请参见使用HPA+CA实现 - [监控运维配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0836.md): CCE为您提供监控应用及资源的能力,支持采集各项指标及事件等数据以分析应用健康状态,您可以通过“配置中心 > 监控运维配置”统一调整监控运维参数。您需要开通监控中心,以使用监控运维配置的所有功能。采集配置系统预置采集:可视化管理云原生监控插件的监控采集任务。详情请参见管理监控采集任务。ServiceMonitor:定义针对Service的 - [Kubernetes原生配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0787.md): 为您提供典型的原生配置选项,您可以在此设置kube-apiserver、kube-controller等社区原生管理组件的配置,为您的集群在海量场景下提供最佳的云原生体验。容器故障迁移默认容忍周期容器故障迁移默认容忍周期配置默认对集群中所有的容器生效,您也可以为指定Pod进行差异化容忍配置,此时将以Pod配置的容忍时长为准,详情请参见默认 - [异构资源配置](https://support.huaweicloud.com/usermanual-cce/cce_10_0788.md): GPU虚拟化:CCE GPU虚拟化采用自研xGPU虚拟化技术,能够动态对GPU设备显存与算力进行划分,单个GPU卡最多虚拟化成20个GPU虚拟设备。相对于静态分配来说,虚拟化的方案更加灵活,最大程度保证业务稳定的前提下,可以完全由用户自己定义使用的GPU量,提高GPU利用率。详情请参见GPU虚拟化概述。集群默认驱动:集群中GPU节点默认使 - [存储Flexvolume概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0306.md): 容器存储是为容器工作负载提供存储的组件,支持多种类型的存储,同一个工作负载(Pod)可以使用任意数量的存储。云容器引擎CCE的容器存储功能基于Kubernetes存储系统,并深度融合云存储服务,完全兼容Kubernetes原生的存储服务,例如EmptyDir、HostPath、Secret、ConfigMap等存储。1.13及以下版本的C - [1.15集群如何从Flexvolume存储类型迁移到CSI Everest存储类型](https://support.huaweicloud.com/usermanual-cce/cce_10_0343.md): 在v1.15.11-r1之后版本的集群中,CSI Everest插件已接管fuxi Flexvolume(即storage-driver插件)容器存储的所有功能,建议将对fuxi Flexvolume的使用切换CSI Everest上。迁移的主要原理是通过创建静态PV的形式关联原有底层存储,并创建新的PVC关联该新建的静态PV,之后应用升 - [云硬盘存储卷概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0310.md): 为满足数据持久化的需求,CCE支持将云硬盘(EVS)创建的存储卷挂载到容器的某一路径下,当容器迁移时,挂载的云硬盘将一同迁移。通过云硬盘,可以将存储系统的远端文件目录挂载到容器中,数据卷中的数据将被永久保存,即使删除了容器,数据卷中的数据依然保存在存储系统中。使用便捷:您可以像使用传统服务器硬盘一样,对挂载到服务器上的块存储(硬盘)做格式 - [使用kubectl自动创建云硬盘](https://support.huaweicloud.com/usermanual-cce/cce_10_0312.md): 如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch pvc-evs-auto-example.yamlvi pvc-evs-auto-example.yaml1.9、1.11、1.13版本集群,yaml文件配置示例如下:apiVersion: v1 kind: PersistentVolumeClaim meta - [使用kubectl对接已有云硬盘](https://support.huaweicloud.com/usermanual-cce/cce_10_0313.md): 如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch pv-evs-example.yaml pvc-evs-example.yaml1.11.7 ≤ K8s version ≤ 1.13(1.11.7以上及1.13版本集群)PV yaml文件配置示例如下:apiVersion: v1 kind: Persist - [使用kubectl部署带云硬盘存储卷的工作负载](https://support.huaweicloud.com/usermanual-cce/cce_10_0314.md): 云硬盘创建或导入CCE后,可以在工作负载中挂载云硬盘。云硬盘不支持跨可用区挂载。在挂载前,您可以使用kubectl get pvc 命令查询当前集群所在分区下可用PVC。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch evs-deployment-example.yamlvi evs-deployment-e - [极速文件存储卷概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0330.md): CCE支持将极速文件存储(SFS Turbo)创建的存储卷挂载到容器的某一路径下,以满足数据持久化的需求,极速文件存储具有按需申请,快速供给,弹性扩展,方便灵活等特点,适用于DevOps、容器微服务、企业办公等应用场景。符合标准文件协议:用户可以将文件系统挂载给服务器,像使用本地文件目录一样。数据共享:多台服务器可挂载相同的文件系统,数据 - [使用kubectl对接已有极速文件存储卷](https://support.huaweicloud.com/usermanual-cce/cce_10_0332.md): CCE支持使用已有的极速文件存储来创建PersistentVolume,创建成功后,通过创建相应的PersistentVolumeClaim来绑定当前的PersistentVolume使用。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch pv-efs-example.yaml pvc-efs-example. - [使用kubectl部署带极速文件存储卷的无状态工作负载](https://support.huaweicloud.com/usermanual-cce/cce_10_0333.md): 极速文件存储创建或导入CCE后,可以在工作负载中挂载极速文件存储。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch efs-deployment-example.yamlvi efs-deployment-example.yaml在无状态工作负载中基于pvc共享式使用极速文件存储示例:“spec.templat - [使用kubectl部署带极速文件存储卷的有状态工作负载](https://support.huaweicloud.com/usermanual-cce/cce_10_0334.md): CCE支持使用已有的极速文件存储(SFS Turbo),创建有状态工作负载(StatefulSet)。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch efs-statefulset-example.yamlvi efs-statefulset-example.yamlyaml示例如下:spec.templat - [对象存储卷概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0323.md): 为满足数据持久化的需求,CCE支持将对象存储服务(OBS)创建的存储卷挂载到容器的某一路径下,对象存储适用于云工作负载、数据分析、内容分析和热点对象等场景。安全容器不支持使用对象存储卷。OBS限制单用户创建100个桶,但是CCE使用OBS桶为单个工作负载挂载一个桶,当工作负载数量较多时,容易导致桶数量超过限制,OBS桶无法创建。建议此种场 - [使用kubectl自动创建对象存储](https://support.huaweicloud.com/usermanual-cce/cce_10_0325.md): 动态使用OBS可以自动创建并挂载所期望的OBS对象存储,目前支持标准、低频两种类型的桶,分别对应obs-standard、obs-standard-ia。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch pvc-obs-auto-example.yamlvi pvc-obs-auto-example.yamly - [使用kubectl对接已有对象存储](https://support.huaweicloud.com/usermanual-cce/cce_10_0326.md): CCE支持使用已有的对象存储来创建PersistentVolume,并通过创建对应PersistentVolumeClaim绑定当前PersistentVolume使用。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch pv-obs-example.yaml pvc-obs-example.yaml1.11 ≤ - [使用kubectl部署带对象存储卷的无状态工作负载](https://support.huaweicloud.com/usermanual-cce/cce_10_0327.md): 对象存储卷创建或导入CCE后,可以在工作负载中挂载对象存储卷。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch obs-deployment-example.yamlvi obs-deployment-example.yaml在无状态工作负载中基于pvc共享式使用对象存储示例:apiVersion: apps/ - [使用kubectl部署带对象存储卷的有状态工作负载](https://support.huaweicloud.com/usermanual-cce/cce_10_0328.md): CCE支持使用已有的对象存储卷(PersistentVolumeClaim),创建有状态工作负载(StatefulSet)。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch obs-statefulset-example.yamlvi obs-statefulset-example.yamlyaml示例如下:k - [文件存储卷概述](https://support.huaweicloud.com/usermanual-cce/cce_10_0316.md): CCE支持将弹性文件存储(SFS)创建的存储卷挂载到容器的某一路径下,以满足数据持久化需求,SFS存储卷适用于多读多写的持久化存储,适用场景包括:媒体处理、内容管理、大数据分析和分析工作负载程序等。符合标准文件协议:用户可以将文件系统挂载给服务器,像使用本地文件目录一样。数据共享:多台服务器可挂载相同的文件系统,数据可以共享操作和访问。私 - [使用kubectl自动创建文件存储](https://support.huaweicloud.com/usermanual-cce/cce_10_0318.md): 当前SFS文件存储处于售罄状态,暂时无法使用存储类自动创建PVC。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch pvc-sfs-auto-example.yamlvi pvc-sfs-auto-example.yamlyaml文件配置示例如下:apiVersion: v1 kind: Persistent - [使用kubectl对接已有文件存储](https://support.huaweicloud.com/usermanual-cce/cce_10_0319.md): 如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch pv-sfs-example.yaml pvc-sfs-example.yaml1.11 ≤ K8s version ≤ 1.13(1.11以上及1.13版本集群)PV yaml文件配置示例:apiVersion: v1 kind: PersistentVol - [使用kubectl部署带文件存储卷的无状态工作负载](https://support.huaweicloud.com/usermanual-cce/cce_10_0320.md): 文件存储卷创建或导入CCE后,可以在工作负载中挂载文件存储卷。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch sfs-deployment-example.yamlvi sfs-deployment-example.yaml在无状态工作负载中基于pvc共享式使用文件存储示例:apiVersion: apps/ - [使用kubectl部署带文件存储卷的有状态工作负载](https://support.huaweicloud.com/usermanual-cce/cce_10_0321.md): CCE支持使用已有的文件存储(PersistentVolumeClaim),创建有状态工作负载(StatefulSet)。如下配置示例适用于Kubernetes 1.13及以下版本的集群。touch sfs-statefulset-example.yamlvi sfs-statefulset-example.yamlyaml示例如下:sp ## 最佳实践 - [CCE最佳实践汇总](https://support.huaweicloud.com/bestpractice-cce/cce_sac.md): 本文汇总了云容器引擎(CCE)服务的常见应用场景,并为每个场景提供详细的方案描述和操作指南,以帮助您在CCE集群中轻松搭建业务。以下所有第三方教程均来自于华为云社区。由于云容器引擎产品持续更新与迭代,开发者社区教程中的步骤可能存在时效性,不一定与产品最新操作步骤完全保持一致,相关内容仅供学习和参考。为帮助企业高效上云,华为云Solutio - [容器应用部署上云CheckList](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00006.md): 安全高效、稳定高可用是每一位涉云从业者的共同诉求。这一诉求实现的前提,离不开系统可用性、数据可靠性及运维稳定性三者的配合。本文将通过评估项目、影响说明及评估参考三个角度为您阐述容器应用部署上云的各个检查项,以便帮助您扫除上云障碍、顺利高效地完成业务迁移至云容器引擎(CCE),降低因为使用不当导致集群或应用异常的风险。 - [应用容器化改造方案概述](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0002.md): 本手册基于云容器引擎实践所编写,用于指导您已有应用的容器化改造。容器是操作系统内核自带能力,是基于Linux内核实现的轻量级高性能资源隔离机制。云容器引擎CCE是基于开源Kubernetes的企业级容器服务,提供高可靠高性能的企业级容器应用管理服务,支持Kubernetes社区原生应用和工具,简化云上自动化容器运行环境搭建。更高效的利用系 - [资源与成本规划](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0343.md): 本文提供的成本预估费用仅供参考,资源的实际费用与用户所在区域相关,请以华为云管理控制台显示为准。完成本实践所需的资源如下: - [整体应用容器化改造](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0003.md): 本教程以整体应用容器化改造为例,指导您将一个“部署在虚拟机上的ERP企业管理系统”进行容器化改造,部署到容器服务中。您不需要改动任何代码和架构,仅需将整体应用构建为容器镜像,部署到云容器引擎中。本例企业管理应用由某企业(简称A企业)开发,这款应用提供给不同的第三方企业客户,第三方客户仅需要使用应用,维护工作由A企业提供。在第三方企业需要使 - [改造流程](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0004.md): 整体应用容器化改造时,需要执行完整的改造流程。容器化改造流程包括:分析应用、准备应用运行环境、编写开机脚本、编写Dockerfile、制作并上传镜像、创建容器工作负载。改造流程每一部分的详情可参考改造流程。 - [分析应用](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0005.md): 应用在容器化改造前,您需要了解自身应用的运行环境、依赖包等,并且熟悉应用的部署形态。需要了解的内容如表1。 - [准备应用运行环境](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0006.md): 在应用分析后,您已经了解到应用所需的操作系统、运行环境等。您需要准备好这些环境。安装容器构建工具,您可在以下两项中选择一项安装:安装Docker:应用容器化时,需要将应用构建为容器镜像。您需要准备一台机器,并安装Docker。安装nerdctl:将应用构建为容器镜像。nerdctl工具适于containerd环境,您需要准备一台已经安装并 - [编写开机运行脚本](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0007.md): 应用容器化时,一般需要准备开机运行的脚本,写作脚本的方式和写一般shell脚本相同。该脚本的主要目的包括:启动应用所依赖的软件。将需要修改的配置设置为环境变量。开机运行脚本与应用实际需求直接相关,每个应用所写的开机脚本会有所区别。请根据实际业务需求来写该脚本。cd apptestvistart_tomcat_and_mongo.sh#!/ - [编写Dockerfile文件](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0008.md): 镜像是容器的基础,容器基于镜像定义的内容来运行。镜像是多层存储,每一层是前一层基础上进行的修改。定制镜像时,一般使用Dockerfile来完成。Dockerfile是一个文本文件,其内包含了一条条的指令,每一条指令构建镜像的其中一层,因此每一条指令的内容,就是描述该层应该如何构建。本章节指导您如何编写dockerfile文件。Docker - [制作并上传镜像](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0009.md): 本章指导用户将整体应用制作成Docker镜像。制作完镜像后,每次应用的部署和升级即可通过镜像操作,减少了人工配置,提升效率。制作镜像时,要求制作镜像的文件在同个目录下。容器镜像服务SWR:是一种支持容器镜像全生命周期管理的服务, 提供简单易用、安全可靠的镜像管理功能,帮助用户快速部署容器化服务。镜像:Docker镜像是一个特殊的文件系统, - [创建容器工作负载](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0010.md): 在本章节中,您将会把应用部署到CCE中。首次使用CCE时,您需要创建一个初始集群,并添加一个节点。应用镜像上传到容器镜像服务后,部署容器应用的方式都是基本类似的。不同点在于是否需要设置环境变量,是否需要使用云存储,这些也是和业务直接相关。云容器引擎CCE:提供高可靠高性能的企业级容器应用管理服务,支持Kubernetes社区原生应用和工具 - [容器镜像迁移方案概述](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0329.md): 随着容器化技术的发展,越来越多的企业使用容器代替了虚拟机完成应用的运行部署。目前许多企业选择自建Kubernetes集群,但是自建集群往往有着沉重的运维负担,需要运维人员自己配置管理系统和监控解决方案。企业自运维大批镜像资源,意味着要付出高昂的运维、人力、管理成本,且效率不高。容器镜像服务支持Linux、ARM等多架构容器镜像托管。企业可 - [使用docker命令将镜像迁移至SWR](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0330.md): 容器镜像服务提供了简便、易用的镜像托管和高效分发业务。当要迁移的镜像数量较少时,企业可以通过简单的docker pull、docker push命令行,将之前维护的镜像迁移到SWR上。使用docker pull命令下载镜像。示例:docker pull nginx:latest使用docker images命令查看是否下载成功。# doc - [使用image-migrator将镜像迁移至SWR](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0331.md): 为保证集群迁移后容器镜像可正常拉取,提升容器部署效率,建议您将自建镜像仓库迁移至华为云容器镜像服务(SWR)。image-migrator是一个镜像迁移工具,能够自动将基于Docker Registry v2搭建的Docker镜像仓库中的镜像迁移到SWR中。在开始迁移之前,请确保您已准备了一台安装了kubectl的服务器,用于连接源集群和 - [跨云Harbor同步镜像至华为云SWR](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0332.md): 部分客户存在多云场景,并且使用某一家云上的自建Harbor作为镜像仓库。跨云Harbor同步镜像至SWR存在两种场景:Harbor可以通过公网访问SWR,配置方法参见公网访问场景。通过专线打通Harbor到VPC间的网络,使用VPC终端节点访问SWR,配置方法参见专线打通场景。Harbor是VMware公司开源的企业级Docker Reg - [集群备份和迁移概述](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10070.md): Kubernetes集群备份和迁移是确保数据安全性和业务连续性的关键措施。在Kubernetes环境中,备份不仅仅涉及存储数据,还包括整个集群的状态、配置、应用和服务。而集群迁移其实就是将这些备份恢复到另一个集群中。CCE支持多种备份和迁移工具,选择合适的工具常取决于您的具体需求。以下是一些常用的工具: - [K8s集群迁移方案概述](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0307.md): 随着容器化技术的发展,越来越多的企业使用容器代替了虚拟机完成应用的运行部署,而Kubernetes的发展让容器化的部署变得简单并且高效。目前许多企业选择自建Kubernetes集群,但是自建集群往往有着沉重的运维负担,需要运维人员自己配置管理系统和监控解决方案,伴随而来的就是企业人力成本的上升和效率的降低。在性能方面,自建集群的规模固定, - [目标集群资源规划](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0014.md): CCE支持对集群资源进行自定义选择,以满足您的多种业务需求。表1中列举了集群的主要性能参数,并给出了本示例的规划值,您可根据业务的实际需求大小进行设置,建议与原集群性能配置保持相对一致。集群创建成功后,表1中带“*”号的资源参数将不可更改,请谨慎选择。 - [集群外资源迁移](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0059.md): 若您的集群不涉及表1中的集群外资源,或迁移后无需使用其他云服务进行资源替换,可忽略本章节内容。为保证集群迁移后容器镜像可正常拉取,提升容器部署效率,十分建议您将私有镜像迁移至容器镜像服务SWR。CCE配合SWR为您提供容器自动化交付流水线,采用并行传输的镜像拉取方式,能够大幅提升容器的交付效率。若您的自建镜像仓库为Harbor 1.10. - [迁移工具安装](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0310.md): Velero是开源的 Kubernetes 集群备份、迁移工具,集成了Restic工具对PV数据的备份能力,可以通过Velero工具将原集群中的K8s资源对象(如Deployment、Job、Service、ConfigMap等)和Pod挂载的持久卷数据保存备份上传至对象存储。在发生灾难或需要迁移时,目标集群可使用Velero从对象存储中 - [集群内资源迁移(Velero)](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0024.md): 本文使用Wordpress应用为例,将自建Kubernetes集群中应用整体迁移到CCE集群。Wordpress应用包含Wordpress和MySQL两个组件,均为容器化实例,分别绑定了两个Local类型的本地存储卷,并通过NodePort服务对外提供访问。迁移前通过浏览器访问Wordpress站点,创建站点名称为“Migrate to - [资源更新适配](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0312.md): 由于本例使用的Wordpress和MySQL镜像均可从SWR正常拉取,因此不会出现镜像拉取失败(ErrImagePull)问题。如迁移应用为私有镜像,请执行以下步骤完成镜像更新适配。镜像地址格式如下:'swr.{区域}.myhuaweicloud.com/{所属组织名称}/{镜像名称}:{版本名称}'集群迁移后,原有集群的访问服务可能无法 - [其余工作](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0313.md): 由于集群迁移是对应用数据的全量迁移,可能存在应用内适配问题。例如本示例中,集群迁移后,Wordpress中发布的文章跳转链接仍是原域名,单击文章标题将会重定向至原集群中的应用实例,因此需要通过搜索将Wordpress中原有的旧域名并替换为新域名,并修改数据库中的site_url和主url值,具体操作可参考更改站点URL。最后在浏览器上访问 - [异常排查及解决](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0314.md): HostPath与Local均为本地存储卷,但由于Velero集成的Restic工具无法对HostPath类型的PV进行备份,只支持Local类型,因此需要在原集群中将HostPath类型存储卷替换为Local类型。Local volume类型的存储建议在Kubernetes v1.10及以上的版本中使用,且只能静态创建,详情请参考loc - [使用k8clone工具进行集群备份恢复](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10057.md): CCE备份恢复为无状态和有状态应用的备份和恢复提供了一套可靠、安全、灵活且高效的解决方案。通过遵循CCE备份恢复的全流程指导,您可以顺利地完成应用的备份和恢复。建议在用户业务量小时执行备份和恢复操作。易用性:在应用备份和恢复阶段,已实现工具自动化。这些工具免安装,简单轻量且配置灵活。多版本:支持在维版本的应用备份和恢复。版本策略详情请参阅 - [在CCE中安装部署Jenkins方案概述](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0066.md): Jenkins是一个开源的、提供友好操作界面的持续集成(CI)工具,起源于Hudson,主要用于持续、自动的构建/测试软件项目、监控外部任务的运行。Jenkins用Java语言编写,可在Tomcat等流行的servlet容器中运行,也可独立运行。通常与版本管理工具(SCM)、构建工具结合使用。Jenkins可以很好地支持各种语言的项目构建 - [资源和成本规划](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0344.md): 本文提供的成本预估费用仅供参考,资源的实际费用与用户所在区域相关,请以华为云管理控制台显示为准。完成本实践所需的资源如下: - [Jenkins Master安装部署](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0067.md): Jenkins界面中的词条可能因版本不同而存在一些差异,例如中英文不同等,本文中的截图仅供您参考。在DockerHub上选择1个相对较新的稳定镜像,本次搭建测试用的Jenkins使用的镜像为jenkinsci/blueocean,该镜像捆绑了所有Blue Ocean插件和功能,不需要再单独安装Blue Ocean插件,详情请参见在Dock - [Jenkins Agent配置](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0068.md): 安装完Jenkins后,可能会出现以下提示,说明Jenkins使用Master进行本地构建,未配置Agent。如果您选择单Master安装Jenkins,执行完毕Jenkins Master安装部署中的操作后已完成,可直接进行流水线构建,请参见使用Jenkins构建流水线。如果您选择Master+Agent模式的Jenkins,请继续完成 - [使用Jenkins构建流水线](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0069.md): 在Jenkins安装部署过程中,已经完成了容器中执行docker命令的配置(参见9),故Jenkins对接SWR无需额外配置,可直接执行docker命令。仅需获取长期有效的SWR登录指令,具体步骤请参见获取长期有效docker login指令。例如本账号的命令为:本示例将使用Jenkins构建一条流水线,该流水线的作用是从代码仓中拉取代码 - [参考:Jenkins对接Kubernetes集群的RBAC](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0070.md): 集群需要开启RBAC。新建ServiceAccount和Role,然后定义一个RoleBinding,将ServiceAccount绑定到Role生成指定ServiceAccount的kubeconfig文件1.21以前版本的集群中,Pod中获取Token的形式是通过挂载ServiceAccount的Secret来获取Token,这种方式 - [Gitlab对接SWR和CCE执行CI/CD](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0324.md): GitLab是利用Ruby on Rails一个开源的版本管理系统,实现一个自托管的Git项目仓库,可通过Web界面进行访问公开的或者私人项目。与Github类似,GitLab能够浏览源代码,管理缺陷和注释。可以管理团队对仓库的访问,它非常易于浏览提交过的版本并提供一个文件历史库。团队成员可以利用内置的简单聊天程序(Wall)进行交流。G - [使用Argo CD实现持续交付](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10007.md): ArgoCD是用于Kubernetes的声明型GitOps持续交付(CD)工具。ArgoCD以Git为核心,支持声明式定义各类对象,通过ArgoCD可以实现应用快速发布到Kubernetes中,并且能够根据版本标识快速跟踪和多集群部署功能,实现多个集群之间同一应用部署问题。本文介绍在ArgoCD中对接CCE执行持续部署的过程,并通过一个具 - [方案概述](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10030.md): DevOps是一组过程、方法与系统的统称,通过一系列手段来促进开发(应用程序/软件工程)部门与技术运营和质量保障(QA)部门之间的密切沟通、高效协作与整合。通过自动化的软件交付和架构变更流程,让规划、开发、构建、测试、发布、部署、维护都能更快、更频繁、更可靠,保障开发结果的稳定可靠。随着微服务、中台架构的兴起,DevOps重要性日益显著。 - [资源规划](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10031.md): 本示例中需要创建虚拟私有云VPC、弹性云服务器ECS、CCE集群以及VPC对等连接,资源规划总体说明如表1所示。以下资源规划详情仅为示例,供您参考,您需要根据实际业务情况规划资源。 - [搭建Jenkins和Gitlab环境](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10033.md): 创建一个新的VPC,本示例中名为vpc-X,所使用网段为192.168.0.0/16。创建一台位于vpc-X(192.168.0.0/16网段)的ECS服务器,推荐规格为4vCPUs 16GiB,系统为Huawei Cloud EulerOS 2.0,并绑定一个弹性公网IP用于拉取公网镜像。在宿主机上通过vi打开文件/home/gitla - [配置集群环境](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10034.md): 创建2个新的VPC,且网段互不重叠。本示例中名为vpc-A,所使用网段为172.16.0.0/16,另一个名为vpc-B,所使用网段为172.17.0.0/16。集群类型:CCE Turbo集群集群版本:最新版本虚拟私有云:选择vpc-A,网段为172.16.0.0/16。节点规格:选择一个4核16GiB的规格。操作系统:Huawei C - [配置Gitlab项目](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10035.md): 输入用户名为root,以及对应的密码(如果未修改默认密码,请参见6获取默认密码)。 - [持续集成及持续部署](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10036.md): 在本方案中,需要在通过 code push 事件中触发 Jenkins 进行编译打包,通过邮件审批之后,将应用部署到 Kubernetes 集群中。除了前文安装 Jenkins 时默认安装的插件外,还需要安装 GitLab Plugin,Kubernetes CLI,Email Extension插件,详情可以参考官方文档。在Jenkin - [使用Pulumi自动化部署应用](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10084.md): Pulumi是一款基础设施即代码(IaC)自动化工具,依赖Terraform构建。支持使用主流编程语言Python、TypeScript、C#和Go来完成云基础设施的构建、部署与全生命周期管理。本文介绍使用Pulumi部署应用的流程,并通过一个具体的示例演示该过程。创建一个CCE集群,并确保节点已绑定弹性公网IP(EIP),用于下载镜像和 - [CCE集群高可用推荐配置](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10017.md): 为了保证应用可以稳定可靠地运行在Kubernetes里,本文介绍构建Kubernetes集群时的推荐配置。华为云支持多区域(Region),每个区域下又有不同的可用区(AZ,Availability Zone)。可用区是一个或多个物理数据中心的集合,有独立的风火水电。一个Region中的多个AZ间通过高速光纤相连,以满足用户跨AZ构建高可 - [在CCE中实现应用高可用部署](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00220.md): 在云原生环境中,容器化应用凭借弹性伸缩与敏捷迭代能力支撑业务高效交付,但底层基础设施、调度逻辑、存储依赖及应用生命周期管理中仍存在多重不确定性风险:单一节点或可用区故障、滚动更新策略不当、Pod调度冲突、云硬盘与节点可用区不匹配等问题,均可能引发服务中断或业务不可用。实现CCE全链路高可用,不能仅依靠多副本部署,需从基础设施层、应用调度层 - [插件高可用部署](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10027.md): CCE提供了多种插件扩展集群云原生能力,涵盖了容器调度与弹性、云原生可观测、容器网络、容器存储、容器安全等方向,插件通过Helm模板方式部署,将插件中的工作负载部署至集群的工作节点。随着插件使用的普及化,业务对插件的稳定性、可靠性保证已成为基本诉求。目前CCE服务默认的插件部署策略是工作节点之间配置了强反亲和,AZ之间配置了弱反亲和的调度 - [安全配置概述](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0316.md): 基于安全责任共担模式,CCE服务确保集群内控制节点和CCE自身组件的安全,并在集群、容器级别提供一系列的层次化的安全能力,而用户则负责集群Node节点的安全并遵循CCE服务提供的安全最佳实践,做好安全配置和运维。关于CCE服务的安全责任共担模型详情请参见责任共担。云容器引擎是基于业界主流的Docker和Kubernetes开源技术构建的容 - [CCE集群安全配置建议](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0317.md): 从安全的角度,建议您对集群做如下配置。Kubernetes社区一般4个月左右发布一个大版本,CCE的版本发布频率跟随社区版本发布节奏,在社区发布Kubernetes版本后3个月左右同步发布新的CCE版本,例如Kubernetes v1.19于2020年9月发布后,CCE于2021年3月左右发布CCE v1.19版本。最新版本的集群修复了已 - [CCE节点安全配置建议](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0318.md): 节点在新的镜像发布前请参考漏洞公告,完成节点漏洞修复。如非必需,节点不建议绑定EIP,以减少攻击面。在必须使用EIP的情况下,应通过合理配置防火墙或者安全组规则,限制非必须的端口和IP访问。在使用cce集群过程中,由于业务场景需要,在节点上配置了kubeconfig.json文件,kubectl使用该文件中的证书和私钥信息可以控制整个集群 - [CCE容器运行时的安全配置建议](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10046.md): 容器技术通过利用Linux的Namespace和Cgroup技术,实现了容器与宿主机之间的资源隔离与限制。Namespace提供了一种内核级别的环境隔离功能,它能够限制进程的视图,使其只能访问特定的资源集合,如文件系统、网络、进程和用户等。而Cgroup作为Linux内核的资源管理机制,能够限制进程对CPU、内存、磁盘和网络等资源的使用, - [在CCE集群中使用容器的安全配置建议](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0319.md): 通过nodeSelector或者nodeAffinity限定应用所能调度的节点范围,防止单个应用异常威胁到整个集群。参考节点亲和性。在逻辑多租等需强隔离场景,系统插件应该尽量运行在单独的节点或者节点池上,与业务Pod分离,降低集群中的提权攻击风险。因此您可以在系统插件安装页面,将节点亲和策略设置为“指定节点调度”或“指定节点池调度”。通过 - [在CCE集群中使用镜像服务的安全配置建议](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10047.md): 容器镜像是防御外部攻击的第一道防线,对保障应用程序、系统乃至整个供应链的安全至关重要。不安全的镜像容易成为攻击者的突破口,导致容器逃逸到宿主机。一旦容器逃逸发生,攻击者便能访问宿主机的敏感数据,甚至利用宿主机作为跳板,进一步控制整个集群或租户账户。以下是一些建议,以降低这种风险。为了加强容器镜像的安全性,首先应从镜像中移除所有不必要的二进 - [在CCE集群中使用密钥Secret的安全配置建议](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0320.md): 当前CCE已为secret资源配置了静态加密,用户创建的secret在CCE的集群的etcd里会被加密存储。当前secret主要有环境变量和文件挂载两种使用方式。不论使用哪种方式,CCE传递给用户的仍然是用户配置时的数据。因此建议:用户不应在日志中对相关敏感信息进行记录;通过文件挂载的方式secret时,默认在容器内映射的文件权限为064 - [在CCE集群中使用OIDC实现工作负载身份认证(旧版IAM)](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0333.md): 工作负载身份认证(Workload Identity)允许集群中的工作负载模拟IAM用户来访问云服务,从而无需直接使用IAM账号的AK/SK等信息,降低安全风险。本文档介绍如何在CCE中使用工作负载Identity。本文方案仅适用于对接旧版IAM。支持1.19.16及以上版本集群。获取集群签发的公钥,将集群Token控制器注册为IAM身份 - [使用HPA+CA实现工作负载和节点联动弹性伸缩](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00282.md): 企业应用的流量大小不是每时每刻都一样,有高峰,有低谷,如果每时每刻都要保持能够扛住高峰流量的机器数目,那么成本会很高。通常解决这个问题的办法就是根据流量大小或资源占用率自动调节机器的数量,也就是弹性伸缩。当使用Pod/容器部署应用时,通常会设置容器的申请/限制值来确定可使用的资源上限,以避免在流量高峰期无限制地占用节点资源。然而,这种方法 - [CCE容器实例弹性伸缩到CCI服务](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0133.md): CCE突发弹性引擎(对接 CCI)作为一种虚拟的kubelet用来连接Kubernetes集群和其他平台的API。Bursting的主要场景是将Kubernetes API扩展到无服务器的容器平台(如CCI)。基于该插件,支持用户在短时高负载场景下,将部署在云容器引擎CCE上的无状态负载(Deployment)、有状态负载(Statefu - [基于Prometheus指标的弹性伸缩实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10037.md): Kubernetes默认的HPA策略只支持基于CPU和内存的自动伸缩,在复杂的业务场景中,仅使用CPU和内存使用率指标进行弹性伸缩往往无法满足日常运维需求。为此,CCE提供云原生监控插件(kube-prometheus-stack),可全面对接开源Prometheus生态,支持类型丰富的组件监控,并提供了多种开箱即用的预置监控大盘。本文介 - [基于ELB监控指标的弹性伸缩实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00283.md): 在使用工作负载弹性伸缩时,Kubernetes默认提供基于CPU/内存等资源使用率指标进行伸缩。但是在流量突发的场景下,基于CPU/内存使用率资源使用率数据会滞后于ELB流量指标,无法及时反映应用实际需求。因此,对于某些需要快速弹性扩缩容的业务(例如抢购和社交媒体),仅依靠资源使用率进行扩缩容可能存在伸缩不及时的问题,无法及时满足业务的实 - [通过Nginx Ingress对多个应用进行弹性伸缩](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10038.md): 在实际的生产环境中,应用多实例部署可以提高应用的稳定性和可靠性,但也会增加资源的浪费和成本。因此,在进行多实例部署时,需要权衡资源利用率和应用性能之间的平衡,但手动调节实例数量存在伸缩不及时的问题,难以达到最佳的效果。如果该应用使用Nginx Ingress实现对外的流量路由转发,您可以使用nginx_ingress_controller - [使用Karpenter实现节点弹性伸缩](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10080.md): Karpenter是一个适用于Kubernetes平台的动态、高性能、开源的集群自动扩展解决方案,意在正确的时间使用正确的节点,简化Kubernetes基础设施管理。相较于Cluster AutoScaler,它将资源扩容时间由分钟级降为秒级,显著提高集群上工作负载的运行效率并降低成本。Karpenter的工作原理如下:监听:监控被标记为 - [使用KEDA实现事件驱动自动扩缩容](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10086.md): KEDA是一款基于Kubernetes的开源事件驱动自动扩缩容组件。它可与集群原生的水平Pod自动扩缩器(HPA)无缝协同,不会覆盖或重复原有扩缩能力,仅做功能增强。依托KEDA,您能够依据待处理事件量,对集群内任意业务容器实现事件驱动式自动扩缩容;同时支持单独指定需要事件弹性的应用,其余业务不受影响,轻量化部署、兼容性强,可安全共存于任 - [使用Prometheus监控多个集群](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10009.md): 通常情况下,用户的集群数量不止一个,例如生产集群、测试集群、开发集群等。如果在每个集群安装Prometheus监控集群里的业务各项指标的话,很大程度上提高了维护成本和资源成本,同时数据也不方便汇聚到一块查看,这时候可以通过部署一套Prometheus,对接监控多个集群的指标信息。将多个集群对接到同一个Prometheus监控系统,如下所示 - [使用dcgm-exporter监控GPU指标](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10011.md): 集群中包含GPU节点时,需要了解GPU应用使用节点GPU资源的情况,例如GPU利用率、显存使用量、GPU运行的温度、GPU的功率等。在获取GPU监控指标后,用户可根据应用的GPU指标配置弹性伸缩策略,或者根据GPU指标设置告警规则。本文基于开源Prometheus和DCGM Exporter实现丰富的GPU观测场景,关于DCGM Expo - [将Prometheus监控数据上报至第三方监控平台](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10021.md): CCE云原生监控插件可以将集群中收集到的Prometheus指标,上报到您指定的监控平台,例如AOM,或者您也可以指定支持Prometheus数据的第三方监控平台。本文以对接第三方Prometheus实例为例,使用CCE云原生监控插件作为采集数据源端,接收数据的第三方Prometheus实例作为目的端。Prometheus提供了Remot - [通过PromQL语句查询Prometheus数据](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10040.md): PromQL是Prometheus Query Language的缩写,是一种用于查询和聚合时间序列数据的查询语言。Prometheus是一个开源的监控系统,用于收集和存储时间序列数据,每个时间序列都由一个唯一的标识符和一组时间戳-值对组成。而PromQL是Prometheus的核心组件之一,使用标识符和标签组成的简单表达式对时间序列进行 - [GPU Pod监控指标采集及Grafana仪表盘搭建](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10061.md): 2.1.30、2.7.46及以上版本的CCE AI套件(NVIDIA GPU)插件中新增GPU Pod监控指标,包括gpu_pod_core_percentage_total、gpu_pod_core_percentage_used、gpu_pod_memory_total和gpu_pod_memory_used4个指标,能够全面监控整卡 - [Volcano调度指标采集及Grafana仪表盘搭建](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10071.md): Volcano插件中提供了各种监控指标采集,能够全面监控volcano调度工作负载情况,具体请参见Volcano默认监控指标说明。您可以基于Volcano监控指标构建不同维度的监控看板,以便及时了解集群相关信息。当前云原生监控插件暂不支持自动采集这些指标。若需在Grafana仪表盘中查看,需手动配置云原生监控插件采集相关数据,并构建相应的 - [CCE集群选型建议](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10016.md): 当您使用云容器引擎CCE创建Kubernetes集群时,常常会面对多种配置选项以及不同的名词,难以进行选择。本文将从不同的关键配置进行对比并给出选型建议,帮助您创建一个满足业务需求的集群。云容器引擎支持多种集群类型,以满足您各种业务需求,如下为各类集群区别:由于Kubernetes社区版本迭代较快,新版本中通常包含许多Bug修复和新功能, - [通过CCE搭建IPv4/IPv6双栈集群](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00222.md): 本教程将指引您搭建一个IPv6网段的VPC,并在VPC中创建一个带有IPv6地址的集群和节点,使节点可以访问Internet上的IPv6服务。IPv6的使用,可以有效弥补IPv4网络地址资源有限的问题。如果当前集群中的工作节点(如ECS)使用IPv4,那么启用IPv6后,工作节点可在双栈模式下运行,即工作节点可以拥有两个不同版本的IP地址 - [通过kubectl对接多个集群](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00254.md): kubectl命令行工具使用kubeconfig配置文件来查找选择集群所需的认证信息,并与集群的API服务器进行通信。默认情况下,kubectl会使用$HOME/.kube/config文件作为访问集群的凭证。在CCE集群的日常使用过程中,我们通常需要同时管理多个集群,因此在使用kubectl命令行工具连接集群时需要经常切换kubecon - [集群视角的成本可视化最佳实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10022.md): 当前使用CCE时,默认是以CCE整个云服务的粒度体现计费信息,没有划分不同集群使用的成本。通过给集群使用的资源打上CCE-Cluster-ID标签,在成本中心通过标签过滤汇聚整个集群所使用资源的成本,以集群为单位进行成本分析,降本增效。应用在资源上的标签,一般在创建并产生费用24小时后才会在“成本标签”页面展示。成本标签激活后,才能在分析 - [使用共享VPC创建CCE Turbo集群](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10023.md): 共享VPC是通过资源访问管理服务(RAM)将本账号的VPC资源共享给其他账号使用。例如,租户A可以将自己账号下创建的VPC和子网共享给租户B。在租户B接受共享以后,租户B账号下可以查看到该共享子网及其所属的共享VPC,并可以使用该共享子网和共享VPC创建资源,如CCE Turbo集群。详情请参见共享VPC概述。企业按企业的组织结构或业务形 - [集群过载保护最佳实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10024.md): 集群过载是指Kubernetes集群中的资源(如计算、存储、网络等)超出集群的处理能力,导致集群控制平面(如etcd、kube-apiserver)或工作节点资源耗尽的状态。当过载发生时,集群性能将显著下降,甚至无法正常运行。因此,需要提前对集群进行过载保护,通过过载控制、LIST请求处理优化等机制确保集群在负载激增时仍能维持核心服务的稳 - [集群成本管理最佳实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10053.md): 集群成本优化的核心在于如何最大化地利用集群资源,减少集群中不必要的成本开销。同时,成本优化并不局限在降低资源规模,而是需要在集群成本优化与可靠性之间进行平衡。本文汇总了集群成本优化的最佳实践,希望可以帮助您有效地进行集群成本优化,助力企业降本增效。在部署集群之前,您需要评估集群应用所需的资源需求,选择合适的集群类型、节点实例类型、集群付费 - [制作CCE节点自定义镜像](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00026.md): CCE自定义镜像制作基于开源工具HashiCorp Packer以及开源插件实现,并提供了cce-image-builder配置模板帮助您快速制作符合要求的自定义镜像。Packer是一款可以创建自定义镜像的开源工具。Packer包含构建器(Builder)、配置器(Provisioner)、后处理器(Post-Processor)三个组件 - [创建节点时执行安装前/后脚本](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10020.md): 在创建节点时,对于需要在节点上安装一些工具或者进行安全加固等操作时,可以使用安装前/后脚本实现。本文为您提供正确使用安装前/后脚本的指导,帮助您了解和使用安装前/后脚本。如果有进阶的安装脚本使用需求,可以将脚本存放在OBS中,避免脚本字符数超限等问题,详情请参见创建节点时使用OBS桶实现自定义脚本注入。请避免使用执行耗时过长的安装前/后脚 - [创建节点时使用OBS桶实现自定义脚本注入](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0304.md): 对于需要在节点上提前安装一些工具或者做用户自定义的安全加固等操作时,需要在创建节点的时候注入一些脚本。CCE创建节点提供了Kubernetes安装前和安装后两处注入脚本的功能。但是使用通常碰到如下限制:注入脚本的字符有限。各种需求、场景的多样性可能会经常修改注入的脚本内容,而对于CCE节点池的注入脚本是固定的,不适合经常修改。本文提供CC - [选择合适的节点数据盘大小](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10012.md): 节点在创建时会默认创建一块数据盘,供容器运行时和Kubelet组件使用,详情请参见数据盘空间分配说明。由于容器运行时和Kubelet组件使用的数据盘不可被卸载,且默认大小为100G,出于使用成本考虑,您可手动调整该数据盘容量,最小支持下调至20G,节点上挂载的普通数据盘支持下调至10G。调整容器运行时和Kubelet组件使用的数据盘大小存 - [节点池高可用最佳实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10054.md): 在使用节点池部署业务时,为提高可用性和容灾能力,您可以通过以下两个方面进行优化:在节点层面,利用节点池的云服务器组和可用区策略实现物理隔离;在Pod层面,通过亲和性调度和拓扑分布约束确保业务均匀分布在不同的节点上。物理机反亲和:使用云服务器组云服务器组是华为云ECS提供的功能,用于控制云服务器实例的部署位置。创建反亲和性云服务器组:在EC - [节点操作系统(OS)升级最佳实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10073.md): 节点操作系统中的CVE漏洞可能带来集群数据泄露、服务中断等问题,对集群的稳定性、安全性、合规性造成威胁。针对节点操作系统(OS)安全漏洞,CCE会负责及时提供相关公告,并发布对应的漏洞补丁及修复指导。在新版本OS发布时,CCE会修复已知的安全漏洞。在新版本未发布时,您可以开启集群安全服务,扫描节点上存在的安全漏洞,获得修复建议与方法,并在 - [集群网络地址段规划实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00004.md): 在CCE中创建集群时,您需要根据具体的业务需求规划VPC的数量、子网的数量、容器网段划分和服务网段连通方式。本文将介绍VPC环境下CCE集群里各种地址的作用,以及地址段该如何规划。VPC网段虚拟私有云(Virtual Private Cloud,简称VPC)可以为云服务器、云容器、云数据库等资源构建隔离的、用户自主配置和管理的虚拟网络环境 - [集群网络模型选择及各模型区别](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00162.md): 自研高性能商业版容器网络插件,支持容器隧道网络、VPC网络、云原生网络2.0网络模型:集群创建成功后,网络模型不可更改,请谨慎选择。容器隧道网络(Overlay):基于底层VPC网络构建了独立的VXLAN隧道化容器网络,适用于一般场景。VXLAN是将以太网报文封装成UDP报文进行隧道传输。容器网络是承载于VPC网络之上的Overlay网络 - [CCE集群实现访问跨VPC网络通信](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10044.md): 由于不同VPC之间网络不通,CCE集群无法跨VPC进行网络通信,您可以通过对等连接连通两个不同网段的VPC,实现本VPC下的集群访问另一个VPC下的集群或其他服务。为实现跨VPC访问,不同网络模型的集群需要打通的网段不同。容器隧道网络模型和云原生网络2.0模型(CCE Turbo集群):仅需打通两端VPC网段。VPC网络模型的集群:需要同 - [使用VPC和云专线实现容器与IDC之间的网络通信](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00234.md): 借助VPC和云专线,在VPC网络模型的集群中实现集群容器网段(172.56.0.0/16)与IDC网段(10.1.123.0/24)的相互通信。需要具备IDC并提前申请云专线服务。登录管理控制台,在管理控制台左上角单击,选择区域和项目。在控制台首页,单击左上角的,在展开的列表中单击网络 > 云专线 DC。在网络控制台的左侧栏目树中,单击云 - [自建IDC与CCE集群共享域名解析方案概述](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00276.md): 当前,越来越多的软件采用微服务架构,构建一个产品时会大量使用微服务,不同微服务之间访问时涉及到域名访问。拥有自建IDC的企业,在使用CCE时通常需要在CCE集群与自建IDC之间通信,而且当IDC有内部域名时,需要CCE集群内的节点和容器既能够解析IDC的域名,也能够解析云域名。例如,某企业APP微服务改造后,其管理后台部署在CCE集群上, - [通过DNS Endpoint做级联解析](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00279.md): CCE集群所在VPC与线下IDC已经使用专线或其他方式正确连接,IDC与VPC网段和CCE集群容器网段能够互访。专线的创建方法请参见云专线快速入门。登录VPCEP控制台。单击右上角购买终端节点。选择DNS服务和VPC,注意此处VPC需要选择CCE集群所在VPC。创建DNS Endpoint单击立即购买,完成创建。创建完成后,可在详情页中查 - [修改CoreDNS配置直接解析](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00280.md): CCE集群所在VPC与线下IDC已经使用专线或其他方式正确连接,IDC与VPC网段和CCE集群容器网段能够互访。专线的创建方法请参见云专线快速入门。CoreDNS的配置都存储在名为coredns的ConfigMap下,您可以在kube-system命名空间下找到该配置项。使用如下命令可以查看到默认配置的内容。kubectlget conf - [通过负载均衡配置实现会话保持](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00231.md): 会话保持可以确保用户在访问应用时的连续性和一致性。如果在客户端和服务器之间部署了负载均衡设备,很有可能这多个连接会被转发至不同的服务器进行处理。开启会话保持后,负载均衡会把来自同一客户端的访问请求持续分发到同一台后端云服务器上进行处理。例如在大多数需要用户身份认证的在线系统中,一个用户需要与服务器实现多次交互才能完成一次会话。由于多次交互 - [不同场景下容器内获取客户端源IP](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00035.md): 在容器化环境中,客户端与容器服务器间的通信可能涉及多种代理服务器。当外部请求经过代理服务器多层转发时,客户端源IP地址可能无法被成功传递至容器内的业务中。本文将针对CCE集群提供网络访问的不同方案,详细说明如何在容器内部有效地获取客户端源IP。根据不同的网络设置,容器内获取客户端源IP的方法可能会有所不同。以下是几种常见的网络访问配置及其 - [通过配置容器内核参数增大监听队列长度](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00225.md): net.core.somaxconn默认监听队列(backlog)长度为128,当服务繁忙时,如果连接请求超过了监听队列的长度,新的连接请求将会被拒绝。为了避免这种情况的发生,您可以通过配置内核参数net.core.somaxconn来增大监听队列的长度。方式一:修改节点池kubelet配置(默认节点池不支持)登录CCE控制台,进入集群。 - [为负载均衡类型的Service配置pass-through能力](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0301.md): 对于负载均衡类型的Service,负责集群内部流量转发的kube-proxy组件默认会将Service绑定的ELB IP地址配置到节点本地的转发规则中,从集群内部访问ELB的地址时,流量就会直接在集群内部转发,而不会经过ELB转发。如果Service设置了服务亲和为节点级别,即externalTrafficPolicy取值为Local,S - [从Pod访问公网](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10049.md): 从Pod中访问公网地址的实现方式会因集群网络模式的不同而不同,具体请参见表1。下面内容以CCE Turbo集群为例,讲解如何通过NAT网关访问公网。NAT网关能够为VPC内的容器实例提供源网络地址转换服务,即SNAT(Source Network Address Translation)。SNAT功能通过绑定弹性公网IP,实现私有IP向公 - [从Pod访问同一VPC网络的云服务](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10050.md): 集群的容器网络模型不同,集群内的从Pod访问同一VPC网络的云服务的方式也不同,请参见表1 从Pod访问云服务的方式(同一VPC)。与CCE进行通信的云服务有:ECS、ELB、RDS、DCS、Kafka、RabbitMQ、ModelArts、DDS等。进行通信时,除了关注相关的网络配置外,还需要关注所访问的云服务是否允许外部访问,如DCS - [从Pod访问不同VPC网络的云服务](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10051.md): 由于不同VPC之间网络不通,Pod无法跨VPC进行网络通信。您可以通过对等连接连通两个VPC,使在本VPC下的Pod中能够访问另一个VPC下的服务。集群的容器网络类型不同,实现跨VPC访问的步骤也不同,具体请参见表1。在本文中,集群所在VPC称为集群VPC,被访问的云服务所在VPC称为目标VPC,被访问的云服务所在子网称为目标子网。与CC - [自定义部署Nginx Ingress Controller](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0342.md): Nginx Ingress Controller是一款业界流行的开源Ingress控制器,有着广泛的应用。在大规模集群场景下,用户有在集群中部署多套Nginx Ingress Controller的诉求,不同流量使用不同的控制器,将流量区分开。例如,集群中部分服务需要通过公网Ingress方式对外提供访问,但是又有部分对内开放的服务不允许 - [Nginx Ingress Controller高级配置](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10015.md): 针对高并发业务场景,可通过参数配置进行优化:通过ConfigMap对Nginx Ingress Controller整体参数进行优化。通过InitContainers对Nginx Ingress Controller内核参数进行优化。优化后的value.yaml配置文件如下:Nginx Ingress Controller支持admiss - [CoreDNS配置优化概述](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0346.md): DNS是K8s中至关重要的基础服务之一,当容器DNS策略配置不合理,集群规模较大时,DNS容易出现解析超时、解析失败等现象,极端场景下甚至会引起集群内业务大面积解析失败。本文介绍Kubernetes集群中CoreDNS配置优化的最佳实践,帮助您避免此类问题。CoreDNS配置优化包含客户端优化及服务端优化。在客户端,您可以通过优化域名解析 - [优化域名解析请求](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0348.md): DNS解析是Kubernetes集群中最高频的网络行为之一,针对Kubernetes中的DNS解析的特点,您可以通过以下的方式优化域名解析请求。当一个容器应用需要频繁请求另一服务时,推荐使用连接池配置,连接池可以缓存上游服务的链接信息,避免每次访问都经过DNS解析和TCP重新建链的开销。由于resolve.conf文件中的ndots和se - [选择合适的镜像](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0349.md): Alpine容器镜像内置的musl libc库与标准的glibc存在以下差异:3.3版本及更早版本的Alpine不支持search参数,不支持搜索域,无法完成服务发现。并发请求/etc/resolve.conf中配置的多个DNS服务器,导致NodeLocal DNSCache的优化失效。并发使用同一Socket请求A和AAAA记录,在旧版 - [避免IPVS缺陷导致的DNS概率性解析超时](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0350.md): 当集群使用IPVS作为kube-proxy负载均衡模式时,您可能会在CoreDNS缩容或重启时遇到DNS概率性解析超时的问题。该问题由社区Linux内核缺陷导致,具体信息请参见https://github.com/torvalds/linux/commit/35dfb013149f74c2be1ff9c78f14e6a3cd1539d1。 - [使用节点DNS缓存NodeLocal DNSCache](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0351.md): 当集群中的DNS请求量增加时,CoreDNS将会承受更大的压力,可能会导致如下影响:延迟增加:CoreDNS需要处理更多的请求,可能会导致DNS查询变慢,从而影响业务性能。资源占用率增加:为保证DNS性能,CoreDNS往往需要更高规格的配置。NodeLocal DNSCache可以提升服务发现的稳定性和性能。关于NodeLocal DN - [及时升级集群中的CoreDNS版本](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0352.md): CoreDNS功能较为单一,对不同的Kubernetes版本也实现了较好的兼容性,CCE会定期同步社区bug,升级CoreDNS插件的版本,建议客户定期升级集群的CoreDNS版本。CCE的插件管理中心提供了CoreDNS的安装及升级功能。您可以定义关注集群中的CoreDNS版本,如果版本可以升级请尽快安排业务无缝升级集群中的CoreDN - [谨慎调整VPC和虚拟机的DNS配置](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0353.md): CoreDNS启动时会默认从部署的实例上获取resolve.conf中的DNS配置,作为上游的解析服务器地址,并且在CoreDNS重启之前不会再重新加载节点上的resolve.conf配置。建议:保持集群中各个节点的resolve.conf配置一致,这样CoreDNS可以调度到集群中的任意一个节点。修改集群中节点的resolve.conf - [监控CoreDNS运行状态](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0355.md): CoreDNS通过标准的Prometheus接口暴露出解析结果等健康指标,发现CoreDNS服务端甚至上游DNS服务器的异常。CoreDNS自身metrics数据接口,默认zone侦听{$POD_IP}:9153,请保持此默认值,否则普罗无法采集coredns metrics数据。若您是自建Prometheus监控Kubernetes集群 - [调整CoreDNS部署状态](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0356.md): CCE集群默认安装CoreDNS插件,CoreDNS应用默认情况下与您的业务容器运行在同样的集群节点上,部署时的注意事项如下:合理调整CoreDNS副本数合理分配CoreDNS所在位置使用自定义参数完成CoreDNS隔离部署基于HPA自动扩容CoreDNS建议您在任何情况下设置CoreDNS副本数应至少为2,且副本数维持在一个合适的水位以 - [合理配置CoreDNS](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0357.md): CoreDNS在插件界面仅支持按预设规格配置,通常情况下,这满足绝大多数使用场景。但在一些少数对CoreDNS资源用量有要求的场景下,不能根据需要灵活配置。CoreDNS官方文档:https://coredns.io/plugins/未开启“切换Corefile视图”:找到存根域设置,单击添加。填写存根域,格式为一个键值对,键为DNS后缀 - [CCE Turbo配置容器网卡动态预热](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10010.md): 在云原生网络2.0下,每个Pod都会分配(申请并绑定)一张弹性网卡或辅助弹性网卡(统一称为:容器网卡)。由于容器场景下Pod的极速弹性与慢速的容器网卡创建绑定的差异,严重影响了大规模批创场景下的容器启动速度。因此,云原生网络2.0提供了容器网卡动态预热的能力,在尽可能提高IP的资源利用率的前提下,尽可能加快Pod的启动速度。弹性网卡是EC - [集群通过企业路由器连接对端VPC](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10018.md): 企业路由器(Enterprise Router, ER)可以连接虚拟私有云(Virtual Private Cloud, VPC)或本地网络来构建中心辐射型组网,实现同区域的VPC互通,是云上大规格、高带宽、高性能的集中路由器。借助企业路由器的能力,可以实现不同VPC下CCE集群互通。通过ER连接对端VPC,可以解决不同VPC下的集群创建 - [在VPC网络集群中访问集群外地址时使用Pod IP作为客户端源IP](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10041.md): 在使用VPC网络的CCE集群中,Pod与集群外部通信时,系统默认会将源Pod的IP地址转换为节点的IP地址,使Pod以节点IP的形式与外部进行通信。这一过程被称为“Pod IP伪装”,技术上也称为源网络地址转换(Source Network Address Translation, SNAT)。CCE提供nonMasqueradeCIDR - [在华为云CCE中使用Kmesh](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10063.md): Kmesh是一个基于eBPF和可编程内核实现的高性能服务网格(Service Mesh)数据平面软件。通过将流量管理卸载到内核,Kmesh允许在网格内进行服务通信,而不需要经过代理软件,大大减少了流量转发路径,有效提升了服务访问的转发性能。Kmesh的双引擎模式使用eBPF来拦截内核空间的流量,并部署Waypoint Proxy来处理复杂 - [网关型应用配置最佳实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10068.md): NGINX、API Gateway等网关型应用通常作为系统的统一流量入口,承担着高并发请求的调度、转发、认证等核心功能。当系统面临短时间内大量外部请求(如促销活动、系统切换、定时任务触发等高峰时段)时,网关所在节点会迅速建立大量连接,此时节点的连接跟踪表会迅速增长。为了避免连接跟踪表打满后新建连接请求被内核丢弃,导致请求访问失败,需要采取 - [长连接业务配置ELB Ingress负载均衡最佳实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10072.md): 当长连接业务容器通过ELB Ingress对外提供访问时,可能会遇到压测业务不均衡的问题,导致部分服务器负载过高,影响业务性能。为了解决这一问题,您可以配置客户端连接空闲超时时间、等待客户端请求超时时间、等待后端服务器响应超时时间等参数进行优化,从而实现业务的均衡分布和高效运行。客户端连接空闲超时时间:该配置决定了在没有数据传输的情况下, - [存储扩容](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00198.md): CCE节点可进行扩容的存储类型如下:以“EulerOS 2.9”操作系统为例,系统盘“/dev/vda”原有容量50GB,只有一个分区“/dev/vda1”。将系统盘容量扩大至100GB,本示例将新增的50GB划分至已有的“/dev/vda1”分区内。在EVS控制台扩容成功后,仅扩大了云硬盘的存储容量,还需要执行后续步骤扩容分区和文件系统 - [跨账号挂载对象存储](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00199.md): 跨账号数据共享。例如,公司内部多团队需要共享数据,但不同团队使用不同的账号。跨账户数据迁移和备份。例如,账号A即将停用,所有的数据需要迁移至账户B。数据处理与分析。例如,账号B是外部数据处理商,需要访问账户A的原始数据进行大数据分析和机器学习等操作。通过跨账户挂载对象存储,您可以实现数据共享,降低存储和传输成本,同时确保数据的安全性和一致 - [通过StorageClass动态创建SFS Turbo子目录](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00253.md): 在创建SFS Turbo时有最低容量限制,并非按实际的使用量进行计费。而默认情况下,工作负载在挂载SFS Turbo时将根目录映射至容器,负载实际使用的容量远低于这一限值,易造成资源浪费。everest插件支持一种在SFS Turbo下动态创建子目录的方法,能够在SFS Turbo下动态创建子目录并挂载到容器,这种方法能够共享使用SFS - [1.15集群如何从Flexvolume存储类型迁移到CSI Everest存储类型](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0107.md): 在v1.15.11-r1之后版本的集群中,CSI Everest插件已接管fuxi Flexvolume(即storage-driver插件)容器存储的所有功能,建议将对fuxi Flexvolume的使用切换CSI Everest上。迁移的主要原理是通过创建静态PV的形式关联原有底层存储,并创建新的PVC关联该新建的静态PV,之后应用升 - [自定义StorageClass](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00281.md): CCE中使用存储时,最常见的方法是创建PVC时通过指定StorageClassName定义要创建存储的类型,如下所示,使用PVC申请一个SAS(高I/O)类型云硬盘/块存储。可以看到在CCE中如果需要指定云硬盘的类型,是通过everest.io/disk-volume-type: SAS字段指定,这里SAS是云硬盘的类型,代表高I/O,还 - [使用延迟绑定的云硬盘(csi-disk-topology)实现跨AZ调度](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00284.md): 云硬盘使用在使用时无法实现跨AZ挂载,即AZ1的云硬盘无法挂载到AZ2的节点上。有状态工作负载调度时,如果使用csi-disk存储类,会立即创建PVC和PV(创建PV会同时创建云硬盘),然后PVC绑定PV。但是当集群节点位于多AZ下时,PVC创建的云硬盘可能会与Pod调度到的节点不在同一个AZ,导致Pod无法调度成功。CCE提供了名为cs - [使用通用文件系统(原SFS 3.0 容量型)自动收集异常退出的JVM转储文件](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10026.md): 当您使用Java开发业务时,如果设置的JVM堆空间过小,程序可能会出现OOM(Out Of Memory)问题。为了解决这个问题,您可以使用通用文件系统(原SFS 3.0 容量型)作为记录日志的载体,并将其挂载到容器内的相应目录中。当JVM发生OOM时,通用文件系统(原SFS 3.0 容量型)可以将日志记录到相应的目录中。已创建CCE S - [存储多可用区部署的推荐配置](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10052.md): 在多可用区构成的集群下,业务可以指定可用区部署。多可用区部署可以减少可用区资源不足带来的故障问题。通过存储多可用区部署优化,可以帮您最大限度地减少应用发布中断,确保关键业务系统和应用在各种故障情况下能持续运行。您已创建一个安装CCE容器存储(Everest)的集群,并且集群版本≥1.21。若没有可用集群 ,请参照购买Standard/Tu - [在CCE Turbo分布式集群中挂载边缘可用区的对象桶](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10062.md): 本教程将指导您如何在CCE Turbo分布式集群中挂载边缘可用区的对象桶,以便于运行在边缘节点上的工作负载访问OBS存储资源。已创建一个CCE Turbo(分布式)集群,且该集群拥有位于边缘可用区的节点。详情请参见在CCE Turbo集群中使用分布式云资源。集群中已安装2.4.111及以上版本的Everest插件。登录API Explor - [工作负载推荐配置](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10059.md): 当您在CCE集群中部署工作负载时,需要结合实际的业务场景和环境,对您的工作负载进行适合的配置,以保证您的工作负载可以稳定、可靠地运行。本文为您提供部署工作负载时的一些推荐配置及建议。容器的Request及Limit需要根据实际的业务场景进行灵活的配置,Request的值会用于提供给调度器,调度器会检测每个节点可用于分配的资源(节点可分配资 - [合理分配容器计算资源](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00002.md): 只要节点有足够的内存资源,那容器就可以使用超过其申请的内存,但是不允许容器使用超过其限制的资源。如果容器分配了超过限制的内存,这个容器将会被优先结束。如果容器持续使用超过限制的内存,这个容器就会被终结。如果一个结束的容器允许重启,kubelet就会重启它,但是会出现其他类型的运行错误。节点的内存超过了节点内存预留的上限,导致触发OOMki - [升级实例过程中实现业务不中断](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00223.md): 在Kubernetes集群中,应用通常采用Deployment + LoadBalancer类型Service的方式对外提供访问。应用更新或升级时,Deployment会创建新的Pod并逐步替换旧的Pod,这个过程中可能会导致服务中断。避免服务中断可以从Deployment和Service两类资源入手:Deployment可以采用滚动升级 - [通过特权容器功能优化内核参数](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00227.md): 从客户端机器访问Kubernetes集群,需要使用Kubernetes命令行工具kubectl,请先连接kubectl。详情请参见通过kubectl连接集群。新建DaemonSet文件。vi daemonset.yamlYaml示例如下:spec.spec.containers.lifecycle字段是指容器启动后执行设置的命令。kind - [使用Init容器初始化应用](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00228.md): Init Containers,即初始化容器,顾名思义容器启动的时候,会先启动可一个或多个容器,如果有多个,那么这几个Init Container按照定义的顺序依次执行,只有所有的Init Container执行完后,主容器才会启动。由于一个Pod里的存储卷是共享的,所以Init Container里产生的数据可以被主容器使用到。Init - [设置容器的时区](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00229.md): 在使用容器的过程中,如果需要获取系统时间来进行日志记录、数据库存储等操作,容器内部时区不一致的问题可能会导致一系列的困扰。本文提供了多种解决容器内时区不一致问题的方案,请根据实际情况选择合适的方案进行操作。场景一:容器与节点时区同步场景二:制作容器镜像时指定时区场景三:Java容器日志与容器、节点时区同步命令行终端显示如下信息:使用kub - [容器网络带宽限制的配置建议](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00109.md): 同一个节点上的容器会共用主机网络带宽,对容器的网络带宽进行限制,可以有效避免容器之间相互干扰,提升容器间的网络稳定性。Pod带宽限制功能规格如下:功能规格容器隧道网络模型VPC网络模型云原生网络2.0模型VPC网络模型+DataPlane V2云原生网络2.0模型+DataPlane V2支持的集群版本所有集群版本均支持v1.19.10以 - [使用hostAliases参数配置Pod的/etc/hosts文件](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_00226.md): 在Kubernetes集群中,Pod内部的主机名解析默认依赖DNS配置(如CoreDNS)。但在某些情况下,Pod需要对特定域名进行本地化的解析控制,而不希望依赖集群DNS或外部DNS服务。然而,Pod的“/etc/hosts”文件由kubelet管理,默认内容由集群网络插件和系统配置决定。如果直接登录容器修改该文件,容器重启或重建后修改 - [CCE容器中域名解析的最佳实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_0089.md): 本文档重点介绍在CCE容器中如何配置域名解析。在创建工作负载(Deployment或ReplicaSet)之前,需要先创建与之相关联的服务。 因为Kubernetes在启动容器时,会为容器提供所有正在运行的服务作为环境变量。 例如,如果存在名为foo的服务,则所有容器将在其初始环境中获得以下变量。FOO_SERVICE_HOST= 集群弹性伸缩配置 > 节点扩容条件中开启负载无法调度时自动扩容的开关。如果GPU负载需求的GPU资源降低,节点处于空闲状态,为节省资源,您 - [根据推理业务GPU使用率创建HPA策略](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10078.md): 在CCE Standard/Turbo集群中,用户可以通过GPU监控指标为使用GPU资源的工作负载配置弹性伸缩(HPA),使应用在业务高峰期自动扩容、低负载时缩容,从而优化资源利用率并降低成本。目标集群已创建,且集群中包含GPU节点,并已运行GPU相关业务。在集群中安装CCE AI套件(NVIDIA GPU),且插件正常上报GPU的met - [构建基于vLLM/SGlang主流推理引擎的云原生大模型监控大盘](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10079.md): 随着大语言模型(LLM)在生产环境的规模化落地,构建高并发、低延迟的推理服务已成为核心诉求。vLLM和 SGLang等主流推理引擎凭借PageAttention等前沿技术,已成为企业部署大模型的首选底座。然而,大模型推理属于典型的“黑盒”高密度计算,企业在生产环境中往往面临以下运维挑战:吞吐量与队列感知滞后:无法实时感知引擎内部的请求队列 - [ModelServing结合Mooncake部署指南](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10082.md): 本文档在A3昇腾集群(单超节点)上,使用vLLM-ascend和Kthena推理平台部署DeepSeek-R1-Distill-Qwen-1.5B模型的1P1D(1 Prefill + 1 Decode) 分离架构的最佳实践。该架构通过物理隔离Prefill和Decode阶段,利用Mooncake Connector实现KV Cache传 - [CCE分布式推理场景下的EMS高性能KV Cache实践](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_10083.md): 本文介绍了如何在CCE集群 上,基于vLLM-ascend推理引擎和Kthena框架部署Kimi-25模型。该架构采用1P1D(1 Prefill + 1 Decode)分离架构,通过物理隔离Prefill与Decode阶段,并结合弹性内存存储(EMS) 实现KV Cache的高效传输,显著提升资源利用率和推理性能。Kthena是一个专为 - [Terraform概述](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_100719.md): Terraform是HashiCorp推出的基础设施即代码(IaC)工具(提供开源版及企业版),通过HCL(HashiCorp Configuration Language)声明式地描述基础设施目标状态,并为多云、网络、本地数据中心及SaaS环境提供统一的资源生命周期管理能力。Terraform的核心工作流程包含以下三个阶段。Terraf - [安装Terraform并配置华为云Provider](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_100712.md): Terraform是一个开源的基础设施即代码(IaC)工具,通过HCL(HashiCorp Configuration Language)声明式地描述云上资源的目标状态。执行后,Terraform会自动生成执行计划,确认后完成资源的创建与编排,实现标准化的自动化资源管理。本文档介绍如何安装Terraform并配置华为云Provider,为 - [创建IAM用户并配置CCE最小权限](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_100713.md): 华为云主账号具有账号的所有权限,使用主账号进行日常操作风险较高,误操作可能导致资源不可用或数据泄露。在团队协作场景下,不同成员需要不同的权限,直接共享主账号无法实现权限隔离。建议创建IAM用户并授予最小权限,仅开放业务所需的操作权限,降低安全风险。本文介绍如何通过Terraform创建IAM用户和用户组,并将CCE相关系统权限绑定到用户组 - [使用Terraform创建CCE集群](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_100714.md): 在容器化业务快速迭代的场景下,运维工程师需要频繁创建CCE集群以部署和管理容器化应用。手动通过控制台创建集群需要依次配置VPC、子网、集群参数等多个环节,操作繁琐且容易出错,尤其在多环境(开发、测试、生产)需要重复创建时效率较低。通过Terraform可以将集群创建过程定义为代码,实现一键自动化创建CCE集群及其依赖的网络资源,支持版本管 - [使用Terraform创建节点池并加入服务器组](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_100715.md): 云服务器组通过反亲和策略将同一组内的云服务器调度到不同的物理机上,避免单点故障导致多台服务器同时不可用,从而提高业务可用性。CCE集群中的节点实际就是云服务器,将同一节点池下的节点加入同一个云服务器组,可以实现节点级别的容灾,增强集群稳定性。本文介绍如何通过Terraform在CCE集群中创建节点池并开启云服务器组能力,使同一节点池下的节 - [使用Terraform开启节点池自动伸缩](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_100716.md): 在业务运行中,流量上涨可能导致集群计算资源紧张,手动扩容节点响应慢且容易遗漏。CCE具备集群节点自动扩缩容能力,结合节点池可以实现节点的自动扩缩容,在资源不足时自动扩容节点,在资源空闲时自动缩容节点,提高资源利用率并降低运维成本。本文介绍如何通过Terraform在CCE集群中创建节点池并开启自动扩缩容能力,同时配置扩展伸缩组以支持多规格 - [使用Terraform安装AutoScaler插件](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_100717.md): CCE集群弹性引擎插件(AutoScaler)是实现节点自动扩缩容的核心组件,配合节点池可以在业务流量上涨时自动扩容节点,在资源空闲时自动缩容节点。通过Terraform自动化部署插件,可以将插件安装纳入基础设施即代码的管理体系,实现多环境批量部署和版本统一管控。本文以安装AutoScaler插件为例,介绍如何使用Terraform在CC - [使用Terraform删除CCE集群](https://support.huaweicloud.com/bestpractice-cce/cce_bestpractice_100718.md): 通过Terraform删除CCE集群时,集群关联的存储资源(云硬盘、对象存储、文件存储、极速文件存储)和LTS日志不会自动删除,残留资源会持续产生费用。如需在删除集群时一并清理这些关联资源,可以通过修改Terraform配置中的删除策略参数来控制。本文介绍如何在已有CCE集群的Terraform配置中添加删除策略参数,使删除集群时自动清理 ## API参考 - [使用前必读](https://support.huaweicloud.com/api-cce/cce_02_0001.md): 欢迎使用云容器引擎(Cloud Container Engine,简称CCE)。云容器引擎提供高度可扩展的、高性能的企业级Kubernetes集群,支持运行Docker容器。借助云容器引擎,您可以在云上轻松部署、管理和扩展容器化应用程序。您可以使用本文档提供API对云容器引擎进行相关操作,如创建、删除、变更规格、添加网卡等。支持的全部操作 - [API概览](https://support.huaweicloud.com/api-cce/cce_02_0098.md): 云容器引擎所提供的接口分为CCE接口与Kubernetes原生接口。通过配合使用CCE接口和Kubernetes原生接口,您可以完整的使用云容器引擎的所有功能,包括创建集群和节点,使用Kubernetes接口创建容器工作负载,使用CCE接口监控工作负载的使用数据等。 - [构造请求](https://support.huaweicloud.com/api-cce/cce_02_0102.md): 本节介绍REST API请求的组成,并以调用IAM服务的获取用户Token说明如何调用API,该API获取用户的Token,Token可以用于调用其他API时鉴权。您还可以通过这个视频教程了解如何构造请求调用API:https://bbs.huaweicloud.com/videos/102987。请求URI由如下部分组成:{URI-sc - [认证鉴权](https://support.huaweicloud.com/api-cce/cce_02_0004.md): 调用接口有如下两种认证方式,您可以选择其中一种进行认证鉴权。Token认证:通过Token认证调用请求。AK/SK认证:通过AK(Access Key ID)/SK(Secret Access Key)加密调用请求。推荐使用AK/SK认证,其安全性比Token认证要高。Token认证:通过Token认证调用请求。AK/SK认证:通过AK( - [返回结果](https://support.huaweicloud.com/api-cce/cce_02_0334.md): 请求发送以后,您会收到响应,包含状态码、响应消息头和消息体。状态码是一组从1xx到5xx的数字代码,状态码表示了请求响应的状态,完整的状态码列表请参见状态码。对于获取用户Token接口,如果调用后返回状态码为“201”,则表示请求成功。对应请求消息头,响应同样也有消息头,如“Content-type”。对于获取用户Token接口,返回如图 - [创建集群 - CreateCluster](https://support.huaweicloud.com/api-cce/cce_02_0236.md): 该API用于创建一个空集群(即只有控制节点Master,没有工作节点Node)。请在调用本接口完成集群创建之后,通过创建节点添加节点。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即AP - [获取指定的集群 - ShowCluster](https://support.huaweicloud.com/api-cce/cce_02_0238.md): 该API用于获取指定集群的详细信息。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:cl - [获取指定项目下的集群 - ListClusters](https://support.huaweicloud.com/api-cce/cce_02_0239.md): 该API用于获取指定项目下所有集群的详细信息。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项c - [更新指定的集群 - UpdateCluster](https://support.huaweicloud.com/api-cce/cce_02_0240.md): 该API用于更新指定的集群。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:cluste - [删除集群 - DeleteCluster](https://support.huaweicloud.com/api-cce/cce_02_0241.md): 该API用于删除一个指定的集群。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:clus - [集群休眠 - HibernateCluster](https://support.huaweicloud.com/api-cce/cce_02_0374.md): 集群休眠用于将运行中的集群置于休眠状态,休眠后,将不再收取控制节点资源费用。1、集群休眠后,将无法在此集群上创建和管理工作负载等资源。2、按需付费集群休眠后,将暂停收取控制节点资源费用,集群所属的节点、绑定的弹性IP、带宽等资源按各自的计费方式(“包年/包月”或“按需付费”)进行收费。请参见如何调用API。账号具备所有API的调用权限,如 - [集群唤醒 - AwakeCluster](https://support.huaweicloud.com/api-cce/cce_02_0375.md): 集群唤醒用于唤醒已休眠的集群,唤醒后,将继续收取控制节点资源费用。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件 - [获取集群证书 - CreateKubernetesClusterCert](https://support.huaweicloud.com/api-cce/cce_02_0248.md): 该API用于获取指定集群的证书信息。该接口适用于1.13及以上集群版本。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须 - [吊销用户的集群证书 - RevokeKubernetesClusterCert](https://support.huaweicloud.com/api-cce/cce_02_0249.md): 该API用于吊销指定集群的用户证书吊销用户集群证书首先需要获取用户ID,如何获取 ID:方式一:如果您可以获取到此证书申请人下载的证书,证书的通用名称 (CN - Common Name) 即所需 ID。方式一:如果您可以获取到此证书申请人下载的证书,证书的通用名称 (CN - Common Name) 即所需 ID。方式二:如果您无法获 - [轮转用户的集群证书 - RotateClusterCredentials](https://support.huaweicloud.com/api-cce/RotateClusterCredentials.md): 该API用于轮转指定集群的证书操作完成后,用户集群组件的证书有效期会续期5年。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(* - [变更集群规格 - ResizeClusterFlavor](https://support.huaweicloud.com/api-cce/ResizeClusterFlavor.md): 该API用于变更一个指定集群的规格。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径。使用限制请参考变更集群规格。使用限制请参考变更集群规格。请参见如何调用API。账号具 - [获取任务信息 - ShowJob](https://support.huaweicloud.com/api-cce/cce_02_0247.md): 该API用于获取任务信息。通过某一任务请求下发后返回的jobID来查询指定任务的进度。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径该接口通常使用场景为:创建、删除集群时 - [绑定、解绑集群公网apiserver地址 - UpdateClusterEip](https://support.huaweicloud.com/api-cce/UpdateClusterEip.md): 该API用于通过集群ID绑定、解绑集群公网apiserver地址请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键 - [获取集群访问的地址 - ShowClusterEndpoints](https://support.huaweicloud.com/api-cce/ShowClusterEndpoints.md): 该API用于通过集群ID获取集群访问的地址,包括PrivateIP(HA集群返回VIP)与PublicIP请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限 - [查询集群日志配置信息 - ShowClusterConfig](https://support.huaweicloud.com/api-cce/ShowClusterConfig.md): 获取集群组件上报的LTS的配置信息请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3/projects/{project_i - [配置集群日志 - UpdateClusterLogConfig](https://support.huaweicloud.com/api-cce/UpdateClusterLogConfig.md): 用户可以选择集群管理节点上哪些组件的日志上报LTS请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。PUT /api/v3/projects/{p - [获取分区列表 - ListPartitions](https://support.huaweicloud.com/api-cce/ListPartitions.md): 获取分区列表请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:partition:list - [创建分区 - CreatePartition](https://support.huaweicloud.com/api-cce/CreatePartition.md): 创建分区请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:partition:create - [获取分区详情 - ShowPartition](https://support.huaweicloud.com/api-cce/ShowPartition.md): 获取分区详情请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:partition:getR - [更新分区 - UpdatePartition](https://support.huaweicloud.com/api-cce/UpdatePartition.md): 更新分区请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:partition:update - [获取集群LongAKSK配置 - GetClusterLongAKSKConfig](https://support.huaweicloud.com/api-cce/GetClusterLongAKSKConfig.md): 该API用于获取集群longaksk的配置。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cc - [更新集群LongAKSK配置 - UpdateClusterLongAKSKConfig](https://support.huaweicloud.com/api-cce/UpdateClusterLongAKSKConfig.md): 该API用于更新集群LongAKSK的配置。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cc - [获取项目LongAKSK配置 - GetLongAKSKConfig](https://support.huaweicloud.com/api-cce/GetLongAKSKConfig.md): 该API用于获取项目LongAKSK的配置。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cc - [更新项目LongAKSK配置 - UpdateLongAKSKConfig](https://support.huaweicloud.com/api-cce/UpdateLongAKSKConfig.md): 该API用于更新项目longaksk的配置。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cc - [查询集群可售卖规格 - GetClusterFlavorSpecs](https://support.huaweicloud.com/api-cce/GetClusterFlavorSpecs.md): 该API用于查询集群可售卖规格请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v2/flavor/specifications - [查询特性开关状态 - ShowFeatureGates](https://support.huaweicloud.com/api-cce/ShowFeatureGates.md): 该API用于查询特性开关状态请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3.1/feature-gates状态码:200 - [查询可用区列表 - GetAvailableZone](https://support.huaweicloud.com/api-cce/GetAvailableZone.md): 该API用于查询可用区列表请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v2/availabilityZones状态码:20 - [获取集群配额 - GetClusterQuota](https://support.huaweicloud.com/api-cce/GetClusterQuota.md): 该API用于获取集群配额请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /cce/v1/projects/{project_id}/qu - [创建节点 - CreateNode](https://support.huaweicloud.com/api-cce/cce_02_0242.md): 该API用于在指定集群下创建节点。若无集群,请先创建集群。若无集群,请先创建集群。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径。仅支持创建KVM虚拟化类型的节点,非K - [获取指定的节点 - ShowNode](https://support.huaweicloud.com/api-cce/cce_02_0243.md): 该API用于通过节点ID获取指定节点的详细信息。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项 - [获取集群下所有节点 - ListNodes](https://support.huaweicloud.com/api-cce/cce_02_0244.md): 该API用于通过集群ID获取指定集群下所有节点的详细信息。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依 - [更新指定的节点 - UpdateNode](https://support.huaweicloud.com/api-cce/cce_02_0245.md): 该API用于更新指定的节点。当前仅支持更新metadata下的name字段,即节点的名字。当前仅支持更新metadata下的name字段,即节点的名字。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径。集群管理的URL格式为:https://Endpoint/uri。其中uri为 - [删除节点 - DeleteNode](https://support.huaweicloud.com/api-cce/cce_02_0246.md): 该API用于删除指定的节点。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:node:d - [节点开启缩容保护 - LockNodeScaledown](https://support.huaweicloud.com/api-cce/LockNodeScaledown.md): 该API用于节点开启缩容保护,开启缩容保护的节点无法通过修改节点池个数的方式被缩容。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。POST / - [节点关闭缩容保护 - UnlLockNodeScaledown](https://support.huaweicloud.com/api-cce/UnlLockNodeScaledown.md): 该API用于节点关闭缩容保护,关闭缩容保护的节点可以通过修改节点池个数的方式被缩容,只允许按需节点关闭缩容保护。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无 - [同步节点 - SyncNode](https://support.huaweicloud.com/api-cce/SyncNode.md): 该API用于同步节点。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:node:sync - [批量同步节点 - BatchSyncNodes](https://support.huaweicloud.com/api-cce/BatchSyncNodes.md): 该API用于批量同步节点。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:node:up - [按需节点转包年/包月 - BatchChangeNodeToPeriod](https://support.huaweicloud.com/api-cce/BatchChangeNodeToPeriod.md): 该API用于将节点从按需计费模式转成包周期计费模式。按需节点池中的节点转成包年/包月时,需要将集群升级到v1.19.16-r40、v1.21.11-r0、v1.23.9-r0、v1.25.4-r0以及其他更高版本的集群。当按需节点池中的节点转成包年/包月后,该节点不支持弹性缩容。按需计费节点绑定的资源(弹性公网IP)可能不支持同步变更计费 - [纳管节点 - AddNode](https://support.huaweicloud.com/api-cce/AddNode.md): 该API用于在指定集群下纳管节点。纳管节点支持ECS(弹性云服务器)节点、BMS(裸金属服务器)节点以及DeH(专属主机)节点。纳管节点支持ECS(弹性云服务器)节点、BMS(裸金属服务器)节点以及DeH(专属主机)节点。待纳管节点必须状态为“运行中”,未被其他集群所使用,且不携带 CCE 专属节点标签CCE-Dynamic-Provis - [轮转节点证书 - RotateNodeCert](https://support.huaweicloud.com/api-cce/RotateNodeCert.md): 该API用于在指定集群下轮转节点证书。作为集群证书轮转操作的补偿机制:当通过配套的集群证书轮转接口执行轮转时,若部分节点证书轮转失败,可通过调用本接口进行重试。节点所在的集群,必须已经轮转过证书;节点所在的集群,必须已经轮转过证书;待执行证书轮转的节点必须状态为“运行中”。待执行证书轮转的节点必须状态为“运行中”。请参见如何调用API。账 - [自定义节点池纳管节点 - AddNodesToNodePool](https://support.huaweicloud.com/api-cce/AddNodesToNodePool.md): 该API用于在指定集群自定义节点池下纳管节点。竞价实例不支持纳管。纳管节点支持ECS(弹性云服务器)节点、BMS(裸金属服务器)节点、DeH(专属主机)节点。纳管节点支持ECS(弹性云服务器)节点、BMS(裸金属服务器)节点、DeH(专属主机)节点。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也 - [重置节点 - ResetNode](https://support.huaweicloud.com/api-cce/ResetNode.md): 该API用于在指定集群下重置节点。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:nod - [节点移除 - RemoveNode](https://support.huaweicloud.com/api-cce/RemoveNode.md): 该API用于在指定集群下移除节点。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:nod - [节点迁移 - MigrateNode](https://support.huaweicloud.com/api-cce/MigrateNode.md): 该API用于在指定集群下迁移节点到另一集群。仅支持在同一VPC、同一项目下的不同集群间进行迁移。仅支持在同一VPC、同一项目下的不同集群间进行迁移。CCE Turbo集群和CCE Standard集群间不支持互迁。CCE Turbo集群和CCE Standard集群间不支持互迁。DEC集群和非DEC集群间不支持互迁。DEC集群和非DEC集 - [节点迁移到自定义节点池 - MigrateToNodePool](https://support.huaweicloud.com/api-cce/MigrateToNodePool.md): 该API用于将节点迁移到自定义节点池,仅default节点池下节点支持迁移。迁移过程节点无重置无重启,原节点密码将保留。仅支持迁入与节点池相同VPC、子网、企业项目、云服务器组、规格、可用区、资源预留、容器引擎、操作系统的节点。仅支持迁入与节点池相同VPC、子网、企业项目、云服务器组、规格、可用区、资源预留、容器引擎、操作系统的节点。仅支 - [查询集群中超节点列表 - ListHyperNodes](https://support.huaweicloud.com/api-cce/ListHyperNodes.md): 该API用于获取指定集群下所有超节点的详细信息。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项 - [创建节点池 - CreateNodePool](https://support.huaweicloud.com/api-cce/cce_02_0354.md): 该API用于在指定集群下创建节点池。仅支持集群在处于可用、扩容、缩容状态时调用。1.21版本及以上的turbo网络类型的集群创建节点池时支持绑定安全组,每个节点池最多绑定五个安全组。更新节点池的安全组后,只针对新创的pod生效,建议驱逐节点上原有的pod。若无集群,请先创建集群。集群管理的URL格式为:https://Endpoint/u - [获取指定的节点池 - ShowNodePool](https://support.huaweicloud.com/api-cce/cce_02_0355.md): 该API用于获取指定节点池的详细信息。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果 - [获取集群下所有节点池 - ListNodePools](https://support.huaweicloud.com/api-cce/cce_02_0269.md): 该API用于获取集群下所有节点池。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径nodepool是集群中具有相同配置的节点实例的子集。nodepool是集群中具有相同配置 - [更新指定节点池 - UpdateNodePool](https://support.huaweicloud.com/api-cce/cce_02_0356.md): 该API用于更新指定的节点池。仅支持集群在处于可用、扩容、缩容状态时调用。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径若此次更新节点池未设置initialNodeCou - [删除节点池 - DeleteNodePool](https://support.huaweicloud.com/api-cce/cce_02_0357.md): 该API用于删除指定的节点池。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份 - [伸缩节点池 - ScaleNodePool](https://support.huaweicloud.com/api-cce/ScaleNodePool.md): 该API用于伸缩指定的节点池请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:nodepo - [同步节点池 - UpgradeNodePool](https://support.huaweicloud.com/api-cce/UpgradeNodePool.md): 该API用于同步节点池中已有节点的配置请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:n - [创建AddonInstance - CreateAddonInstance](https://support.huaweicloud.com/api-cce/cce_02_0322.md): 根据提供的插件模板,安装插件实例。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:add - [查询AddonTemplates列表 - ListAddonTemplates](https://support.huaweicloud.com/api-cce/cce_02_0321.md): 插件模板查询接口,查询插件信息。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:clus - [更新AddonInstance - UpdateAddonInstance](https://support.huaweicloud.com/api-cce/cce_02_0323.md): 更新插件实例的功能。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:addonInsta - [回滚AddonInstance - RollbackAddonInstance](https://support.huaweicloud.com/api-cce/RollbackAddonInstance.md): 将插件实例回滚到升级前的版本。只有在当前插件实例版本支持回滚到升级前的版本(status.isRollbackable为true),且插件实例状态为running(运行中)、available(可用)、abnormal(不可用)、upgradeFailed(升级失败)、rollbackFailed(回滚失败)时支持回滚。请参见如何调用AP - [删除AddonInstance - DeleteAddonInstance](https://support.huaweicloud.com/api-cce/cce_02_0324.md): 删除插件实例的功能。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:addonInsta - [获取AddonInstance详情 - ShowAddonInstance](https://support.huaweicloud.com/api-cce/cce_02_0325.md): 获取插件实例详情。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:addonInstan - [获取AddonInstance列表 - ListAddonInstances](https://support.huaweicloud.com/api-cce/cce_02_0326.md): 获取集群所有已安装插件实例请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:addonIn - [批量创建插件检查任务 - BatchCreateAddonPrecheck](https://support.huaweicloud.com/api-cce/BatchCreateAddonPrecheck.md): 该API用于在指定集群下批量创建插件检查任务。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。POST /api/v3/projects/{pr - [获取插件检查任务结果列表 - ListAddonPrecheckTasks](https://support.huaweicloud.com/api-cce/ListAddonPrecheckTasks.md): 获取集群下插件检查任务结果列表请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3/projects/{project_id} - [集群升级 - UpgradeCluster](https://support.huaweicloud.com/api-cce/UpgradeCluster.md): 集群升级。集群升级涉及多维度的组件升级操作,强烈建议统一通过CCE控制台执行交互式升级,降低集群升级过程的业务意外受损风险;集群升级涉及多维度的组件升级操作,强烈建议统一通过CCE控制台执行交互式升级,降低集群升级过程的业务意外受损风险;当前集群升级相关接口受限开放。当前集群升级相关接口受限开放。请参见如何调用API。账号具备所有API的 - [获取集群升级任务详情 - ShowUpgradeClusterTask](https://support.huaweicloud.com/api-cce/ShowUpgradeClusterTask.md): 获取集群升级任务详情,任务ID由调用集群升级API后从响应体中uid字段获取。集群升级涉及多维度的组件升级操作,强烈建议统一通过CCE控制台执行交互式升级,降低集群升级过程的业务意外受损风险;集群升级涉及多维度的组件升级操作,强烈建议统一通过CCE控制台执行交互式升级,降低集群升级过程的业务意外受损风险;当前集群升级相关接口受限开放。当前 - [重试集群升级任务 - RetryUpgradeClusterTask](https://support.huaweicloud.com/api-cce/RetryUpgradeClusterTask.md): 重新执行失败的集群升级任务。集群升级涉及多维度的组件升级操作,强烈建议统一通过CCE控制台执行交互式升级,降低集群升级过程的业务意外受损风险;集群升级涉及多维度的组件升级操作,强烈建议统一通过CCE控制台执行交互式升级,降低集群升级过程的业务意外受损风险;当前集群升级相关接口受限开放。当前集群升级相关接口受限开放。请参见如何调用API。账 - [获取集群升级任务详情列表 - ListUpgradeClusterTasks](https://support.huaweicloud.com/api-cce/ListUpgradeClusterTasks.md): 获取集群升级任务详情列表请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:cluster: - [集群升级前检查 - PreCheck](https://support.huaweicloud.com/api-cce/PreCheck.md): 集群升级前检查请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。POST /api/v3/projects/{project_id}/cluste - [获取集群升级前检查任务详情 - GetPreCheck](https://support.huaweicloud.com/api-cce/GetPreCheck.md): 获取集群升级前检查任务详情,任务ID由调用集群检查API后从响应体中uid字段获取。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /a - [获取集群升级前检查任务详情列表 - GetPreCheckList](https://support.huaweicloud.com/api-cce/GetPreCheckList.md): 获取集群升级前检查任务详情列表请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3/projects/{project_id} - [集群升级后确认 - PostCheck](https://support.huaweicloud.com/api-cce/PostCheck.md): 集群升级后确认,该接口建议配合Console使用,主要用于升级步骤完成后,客户确认集群状态和业务正常后做反馈。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需 - [集群备份 - ClusterMasterSnapshot](https://support.huaweicloud.com/api-cce/ClusterMasterSnapshot.md): 集群备份请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。POST /api/v3.1/projects/{project_id}/cluster - [获取集群备份任务详情列表 - ListClusterMasterSnapshotTasks](https://support.huaweicloud.com/api-cce/ListClusterMasterSnapshotTasks.md): 获取集群备份任务详情列表请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:cluster: - [获取集群升级相关信息 - GetClusterUpgradeInfo](https://support.huaweicloud.com/api-cce/GetClusterUpgradeInfo.md): 获取集群升级相关信息请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3/projects/{project_id}/clus - [获取集群升级路径 - GetClusterUpgradePaths](https://support.huaweicloud.com/api-cce/GetClusterUpgradePaths.md): 获取集群升级路径请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3/clusterupgradepaths状态码:200无状 - [获取集群升级特性开关配置 - GetClusterUpgradeFeatureGates](https://support.huaweicloud.com/api-cce/GetClusterUpgradeFeatureGates.md): 获取集群升级特性开关配置请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3/clusterupgradefeaturegat - [开启集群升级流程引导任务 - CreateUpgradeWorkFlow](https://support.huaweicloud.com/api-cce/CreateUpgradeWorkFlow.md): 该API用于创建一个集群升级流程引导任务。请在调用本接口完成引导任务创建之后,通过集群升级前检查开始检查任务。升级流程任务用于控制集群升级任务的执行流程,执行流程为 升级前检查 => 集群升级 => 升级后检查。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的 - [获取UpgradeWorkFlows列表 - ListUpgradeWorkFlows](https://support.huaweicloud.com/api-cce/ListUpgradeWorkFlows.md): 获取历史集群升级引导任务列表请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:cluste - [获取指定集群升级引导任务详情 - ShowUpgradeWorkFlow](https://support.huaweicloud.com/api-cce/ShowUpgradeWorkFlow.md): 该API用于通过升级引导任务ID获取任务的详细信息。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授 - [更新指定集群升级引导任务状态 - UpgradeWorkFlowUpdate](https://support.huaweicloud.com/api-cce/UpgradeWorkFlowUpdate.md): 该API用于更新指定集群升级引导任务状态,当前仅适用于取消升级流程调用该API时升级流程引导任务状态不能为进行中(running) 已完成(success) 已取消(cancel),升级子任务状态不能为running(进行中) init(已初始化) pause(任务被暂停) queue(队列中)请参见如何调用API。账号具备所有API的调 - [查询CCE服务下的资源配额 - ShowQuotas](https://support.huaweicloud.com/api-cce/ShowQuotas.md): 该API用于查询CCE服务下的资源配额。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce: - [查询API版本信息列表 - ShowVersion](https://support.huaweicloud.com/api-cce/ShowVersion.md): 该API用于查询CCE服务当前支持的API版本信息列表。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /无状态码:200无状态码:20 - [批量添加指定集群的资源标签 - BatchCreateClusterTags](https://support.huaweicloud.com/api-cce/BatchCreateClusterTags.md): 该API用于批量添加指定集群的资源标签。每个集群支持最多20个资源标签。每个集群支持最多20个资源标签。此接口为幂等接口:创建时,如果创建的标签已经存在(key/value均相同视为重复),默认处理成功;key相同,value不同时会覆盖原有标签。此接口为幂等接口:创建时,如果创建的标签已经存在(key/value均相同视为重复),默认处 - [批量删除指定集群的资源标签 - BatchDeleteClusterTags](https://support.huaweicloud.com/api-cce/BatchDeleteClusterTags.md): 该API用于批量删除指定集群的资源标签。此接口为幂等接口:删除时,如果删除的标签key不存在,默认处理成功。此接口为幂等接口:删除时,如果删除的标签key不存在,默认处理成功。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权 - [查询资源标签 - GetResourceTags](https://support.huaweicloud.com/api-cce/GetResourceTags.md): 该API用于查询资源标签请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /cce/v1/{project_id}/{resource_t - [查询自定义标签 - GetCustomizeTags](https://support.huaweicloud.com/api-cce/GetCustomizeTags.md): 该API用于查询自定义标签请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /cce/v1/{project_id}/{resource_ - [获取节点标签 - GetLabels](https://support.huaweicloud.com/api-cce/GetLabels.md): 该API用于获取集群所有节点的标签请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3/projects/{project_i - [查询指定节点池支持配置的参数列表 - ShowNodePoolConfigurationDetails](https://support.huaweicloud.com/api-cce/ShowNodePoolConfigurationDetails.md): 该API用于查询CCE服务下指定节点池支持配置的参数列表。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依 - [查询指定集群支持配置的参数列表 - ShowClusterConfigurationDetails](https://support.huaweicloud.com/api-cce/ShowClusterConfigurationDetails.md): 该API用于查询CCE服务下指定集群支持配置的参数列表。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3/projects - [获取集群支持的可配置参数列表 - GetClusterSupportConfiguration](https://support.huaweicloud.com/api-cce/GetClusterSupportConfiguration.md): 该API用于根据集群版本类型等查询集群支持的详细配置项,用于集群创建时指定。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v - [查询指定节点池支持配置的参数内容 - ShowNodePoolConfigurations](https://support.huaweicloud.com/api-cce/ShowNodePoolConfigurations.md): 该API用于查询指定节点池支持配置的参数内容。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3/projects/{pro - [修改指定节点池配置参数的值 - UpdateNodePoolConfiguration](https://support.huaweicloud.com/api-cce/UpdateNodePoolConfiguration.md): 该API用于修改CCE服务下指定节点池配置参数的值。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。PUT /api/v3/projects/{ - [上传模板 - UploadChart](https://support.huaweicloud.com/api-cce/UploadChart.md): 上传模板请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:chart:uploadWrit - [获取模板列表 - ListCharts](https://support.huaweicloud.com/api-cce/ListCharts.md): 获取模板列表请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:chart:listChar - [获取模板实例列表 - ListReleases](https://support.huaweicloud.com/api-cce/ListReleases.md): 获取模板实例列表请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:release:list - [更新模板 - UpdateChart](https://support.huaweicloud.com/api-cce/UpdateChart.md): 更新模板请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:chart:updateWrit - [创建模板实例 - CreateRelease](https://support.huaweicloud.com/api-cce/CreateRelease.md): 创建模板实例请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:release:create - [删除模板 - DeleteChart](https://support.huaweicloud.com/api-cce/DeleteChart.md): 删除模板请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:chart:deleteWrit - [更新指定模板实例 - UpdateRelease](https://support.huaweicloud.com/api-cce/UpdateRelease.md): 更新指定模板实例请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:release:upda - [获取模板 - ShowChart](https://support.huaweicloud.com/api-cce/ShowChart.md): 获取模板请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:chart:getChartRe - [删除指定模板实例 - DeleteRelease](https://support.huaweicloud.com/api-cce/DeleteRelease.md): 删除指定模板实例请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:release:dele - [下载模板 - DownloadChart](https://support.huaweicloud.com/api-cce/DownloadChart.md): 下载模板请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:chart:downloadRe - [获取指定模板实例 - ShowRelease](https://support.huaweicloud.com/api-cce/ShowRelease.md): 获取指定模板实例请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:release:getR - [获取模板Values - ShowChartValues](https://support.huaweicloud.com/api-cce/ShowChartValues.md): 获取模板Values请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /v2/charts/{chart_id}/values状态码:20 - [查询指定模板实例历史记录 - ShowReleaseHistory](https://support.huaweicloud.com/api-cce/ShowReleaseHistory.md): 查询指定模板实例历史记录请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /cce/cam/v3/clusters/{cluster_id - [获取用户模板配额 - ShowUserChartsQuotas](https://support.huaweicloud.com/api-cce/ShowUserChartsQuotas.md): 获取用户模板配额请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /v2/charts/{project_id}/quotas状态码:20 - [创建访问策略 - CreateAccessPolicy](https://support.huaweicloud.com/api-cce/CreateAccessPolicy.md): 该API用于创建访问策略。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:accessP - [获取访问策略列表 - ListAccessPolicy](https://support.huaweicloud.com/api-cce/ListAccessPolicy.md): 该API用于获取访问策略列表。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:acces - [获取访问策略详情 - GetAccessPolicy](https://support.huaweicloud.com/api-cce/GetAccessPolicy.md): 该API用于获取单个访问策略。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:acces - [更新访问策略 - UpdateAccessPolicy](https://support.huaweicloud.com/api-cce/UpdateAccessPolicy.md): 该API用于更新单个访问策略。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:acces - [删除访问策略 - DeleteAccessPolicy](https://support.huaweicloud.com/api-cce/DeleteAccessPolicy.md): 该API用于删除单个访问策略请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:access - [创建pod-identity关联 - CreatePodIdentityAssociation](https://support.huaweicloud.com/api-cce/CreatePodIdentityAssociation.md): 该API用于创建pod-identity关联,将容器集群serviceaccount与IAM委托绑定。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授 - [查询指定集群的pod-identity关联 - ListPodIdentityAssociations](https://support.huaweicloud.com/api-cce/ListPodIdentityAssociations.md): 该API用于获取集群下所有pod-identity关联。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖 - [查询指定pod-identity关联 - ShowPodIdentityAssociation](https://support.huaweicloud.com/api-cce/ShowPodIdentityAssociation.md): 该API用于查询指定pod-identity关联详情信息。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依 - [更新pod-identity关联 - UpdatePodIdentityAssociation](https://support.huaweicloud.com/api-cce/UpdatePodIdentityAssociation.md): 该API用于更新指定pod-identity关联所绑定的IAM委托信息。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须 - [删除pod-identity关联 - DeletePodIdentityAssociation](https://support.huaweicloud.com/api-cce/DeletePodIdentityAssociation.md): 该API用于删除指定的pod-identity关联。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授 - [获取pod-identity关联相关委托凭据 - AssumeAgencyForPodIdentity](https://support.huaweicloud.com/api-cce/AssumeAgencyForPodIdentity.md): 该API用于通过ServiceAccount token来assume获取ServiceAccount所关联的pod-identity关联中绑定的IAM委托凭据。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权 - [获取Job列表 - ListJobs](https://support.huaweicloud.com/api-cce/ListJobs.md): 该API用于获取指定项目下的所有jobs。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce - [获取Job详情 - GetOneJob](https://support.huaweicloud.com/api-cce/GetOneJob.md): 该API用于获取指定项目下的Job详情。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v2/projects/{projec - [删除Job - DeleteJob](https://support.huaweicloud.com/api-cce/DeleteJob.md): 该API用于删除指定项目下的Job。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:jo - [CoreDNS域名解析](https://support.huaweicloud.com/api-cce/cce_02_0407.md): CoreDNS是一款通过链式插件的方式给Kubernetes提供DNS解析服务的DNS服务器,为Kubernetes社区推荐的DNS服务器解决方案。 - [CCE容器存储插件(Everest)](https://support.huaweicloud.com/api-cce/cce_02_0408.md): CCE容器存储(Everest)插件基于CSI(即Container Storage Interface)为Kubernetes 集群对接云存储服务的能力。 - [CCE节点故障检测](https://support.huaweicloud.com/api-cce/cce_02_0409.md): CCE节点故障检测插件(node-problem-detector,简称NPD)是一款监控集群节点异常事件的插件,以及对接第三方监控平台功能的组件。它是一个在每个节点上运行的守护程序,可从不同的守护进程中搜集节点问题并将其报告给apiserver。node-problem-detector可以作为DaemonSet运行, 也可以独立运行。 - [Kubernetes Dashboard](https://support.huaweicloud.com/api-cce/cce_02_0410.md): Kubernetes Dashboard是一个旨在为Kubernetes世界带来通用监控和操作Web界面的项目,集合了命令行可以操作的所有命令。 - [CCE集群弹性引擎](https://support.huaweicloud.com/api-cce/cce_02_0411.md): CCE集群弹性引擎(autoscaler)提供节点池弹性伸缩能力。 - [NGINX Ingress控制器](https://support.huaweicloud.com/api-cce/cce_02_0412.md): NGINX Ingress控制器能根据Service中Pod的变化动态地调整配置,结合Nginx的高稳定性、高性能、高并发处理能力等特点,对容器化应用具有灵活的应用层管理能力。 - [Kubernetes Metrics Server](https://support.huaweicloud.com/api-cce/cce_02_0413.md): 从Kubernetes 1.8开始,Kubernetes通过Metrics API提供资源使用指标,例如容器CPU和内存使用率。这些度量可以由用户直接访问(例如,通过使用kubectl top命令),或者由集群中的控制器(例如,Horizontal Pod Autoscaler)使用来进行决策,具体的组件为Metrics-Server,用 - [CCE容器弹性引擎](https://support.huaweicloud.com/api-cce/cce_02_0414.md): CCE容器弹性引擎(cce-hpa-controller)插件是一款CCE自研的插件,能够基于CPU利用率、内存利用率等指标,对无状态工作负载进行弹性扩缩容。 - [CCE突发弹性引擎(对接CCI)](https://support.huaweicloud.com/api-cce/cce_02_0367.md): Virtual Kubelet是基于社区Virtual Kubelet开源项目开发的插件,该插件支持用户在短时高负载场景下,将部署在CCE上的无状态负载(Deployment)、有状态负载(StatefulSet)、普通任务(Job)三种资源类型的容器实例(Pod),弹性创建到华为云云容器实例CCI服务上,以减少集群扩容带来的消耗。详情请 - [CCE AI套件(NVIDIA GPU)](https://support.huaweicloud.com/api-cce/cce_02_0415.md): CCE AI套件(NVIDIA GPU)插件是支持在容器中使用GPU显卡的设备管理插件,集群中使用GPU节点时必须安装本插件。 - [CCE AI套件(Ascend NPU)](https://support.huaweicloud.com/api-cce/cce_02_0416.md): CCE AI套件(Ascend NPU)是支持容器里使用NPU设备的管理插件。安装本插件后,可创建“AI加速型”节点,实现快速高效地处理推理和图像识别等工作。 - [Volcano调度器](https://support.huaweicloud.com/api-cce/cce_02_0417.md): Volcano 是一个基于 Kubernetes 的批处理平台,提供了机器学习、深度学习、生物信息学、基因组学及其他大数据应用所需要的而 Kubernetes 当下缺失的一系列特性。 - [CCE密钥管理(对接 DEW)](https://support.huaweicloud.com/api-cce/cce_02_0418.md): CCE密钥管理(dew-provider)插件用于对接密码安全中心(Data Encryption Workshop, DEW)。该插件允许用户将存储在集群外部(即专门存储敏感信息的数据加密服务)的凭据挂载至业务Pod内,从而将敏感信息与集群环境解耦,有效避免程序硬编码或明文配置等问题导致的敏感信息泄密。 - [CCE容器网络扩展指标](https://support.huaweicloud.com/api-cce/cce_02_0419.md): CCE容器网络扩展指标插件(dolphin)是一款容器网络流量监控管理插件,支持CCE Turbo集群非主机网络容器的流量统计,以及节点内容器连通性健康检查。 - [节点本地域名解析加速](https://support.huaweicloud.com/api-cce/cce_02_0420.md): 节点本地域名解析加速(node-local-dns)是基于社区NodeLocal DNSCache提供的插件,通过在集群节点上作为守护程序集运行DNS缓存代理,提高集群DNS性能。 - [云原生监控](https://support.huaweicloud.com/api-cce/cce_02_0421.md): 云原生监控插件(kube-prometheus-stack)通过使用Prometheus-operator和Prometheus,提供简单易用的端到端Kubernetes集群监控能力。使用kube-prometheus-stack可将监控数据与监控中心对接,在监控中心控制台查看监控数据,配置告警等。 - [云原生日志采集](https://support.huaweicloud.com/api-cce/cce_02_0422.md): 云原生日志采集插件(log-agent)是基于开源fluent-bit和opentelemetry构建的云原生日志、K8s事件采集插件。log-agent支持基于CRD的日志采集策略,可以根据您配置的策略规则,对集群中的容器标准输出日志、容器文件日志、节点日志及K8s事件日志进行采集与转发。同时支持上报K8s事件到AOM,用于配置事件告警 - [使用Kubernetes API](https://support.huaweicloud.com/api-cce/kubernetesapi.md): Kubernetes API是通过HTTP提供的基于资源 (RESTful) 的编程接口。它支持通过标准HTTP请求方法(POST、PUT、PATCH、DELETE、GET)进行查询、创建、更新和删除各类集群资源。CCE支持通过多种方式使用原生Kubernetes API:通过集群API Server调用Kubernetes API:推荐 - [获取集群证书(已废弃) - CreateClusterCert](https://support.huaweicloud.com/api-cce/cce_02_0359.md): 该API用于获取指定集群的证书信息。该API已废弃,请使用获取集群证书。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须 - [变更集群规格(已废弃) - ResizeCluster](https://support.huaweicloud.com/api-cce/ResizeCluster.md): 该API用于变更一个指定集群的规格。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径。集群管理的URL格式为:https://Endpoint/uri。其中uri为资源路径,也即API访问的路径。使用限制请参考变更集群规格。请参见如何调用API。账号具备所有API的调用权限,如果 - [检查AK/SK状态(待废弃) - CheckAKSK](https://support.huaweicloud.com/api-cce/CheckAKSK.md): 该API用于检查AK/SK状态。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v2/projects/{project_id - [创建包周期集群规格变更单(待废弃) - ChangeCbcOrder](https://support.huaweicloud.com/api-cce/ChangeCbcOrder.md): 该API用于创建包周期集群规格变更单。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。PUT /api/v2/orders/{order_id} - [获取VPC下节点个数详情(待废弃) - GetVPCNodesNumber](https://support.huaweicloud.com/api-cce/GetVPCNodesNumber.md): 该API用于获取指定VPC下的节点个数详情。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v2/projects/{proj - [批量释放集群CBC锁(待废弃) - CheckClusterLock](https://support.huaweicloud.com/api-cce/CheckClusterLock.md): 该API用于批量释放集群CBC锁。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,需具备如下身份策略权限。授权项访问级别资源类型(*为必须)条件键别名依赖的授权项cce:clu - [获取节点列表 (待废弃) - GetNodeListForConsole](https://support.huaweicloud.com/api-cce/GetNodeListForConsole.md): 该API用于获取指定集群下的所有节点。该接口待废弃,推荐使用获取集群下所有节点接口替代。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET - [获取节点详情(待废弃) - GetNodeByConsole](https://support.huaweicloud.com/api-cce/GetNodeByConsole.md): 该API用于获取指定集群下的指定节点详情。该接口待废弃,推荐使用如下接口替代:获取指定的节点。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。G - [获取控制节点列表(待废弃) - GetMastersByUID](https://support.huaweicloud.com/api-cce/GetMastersByUID.md): 该API用于获取指定集群的控制节点列表。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v2/projects/{projec - [获取节点资源信息详情(待废弃) - GetNodeResourcesDetail](https://support.huaweicloud.com/api-cce/GetNodeResourcesDetail.md): 该API用于获取节点资源信息详情。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /cce/v1/projects/{project_i - [创建PV(已废弃) - CreateCloudPersistentVolumes](https://support.huaweicloud.com/api-cce/cce_02_0256.md): 该API用于通过指定云存储服务中的云存储(如EVS、SFS、OBS)去创建PV(PersistentVolume)。该API已废弃,请使用Kubernetes PV相关接口。存储管理的URL格式为:https://{clusterid}.Endpoint/uri。其中{clusterid}为集群ID,uri为资源路径,也即API访问的路径 - [删除PV(已废弃) - DeleteCloudPersistentVolumes](https://support.huaweicloud.com/api-cce/cce_02_0255.md): 该API用于删除指定Namespace下的PV(PersistentVolume)对象,并可以选择是否保留后端云存储。该API已废弃,请使用Kubernetes PV相关接口。存储管理的URL格式为:https://{clusterid}.Endpoint/uri。其中{clusterid}为集群ID,uri为资源路径,也即API访问的路 - [创建PVC(待废弃) - CreateCloudPersistentVolumeClaims](https://support.huaweicloud.com/api-cce/cce_02_0252.md): 该API用于在指定的Namespace下通过云存储服务中的云存储(EVS、SFS、OBS)去创建PVC(PersistentVolumeClaim)。该API待废弃,请使用Kubernetes PVC相关接口。存储管理的URL格式为:https://{clusterid}.Endpoint/uri。其中{clusterid}为集群ID,u - [删除PVC(待废弃) - DeleteCloudPersistentVolumeClaims](https://support.huaweicloud.com/api-cce/cce_02_0253.md): 该API用于删除指定Namespace下的PVC(PersistentVolumeClaim)对象,并可以选择保留后端的云存储。该API待废弃,请使用Kubernetes PVC相关接口。存储管理的URL格式为:https://{clusterid}.Endpoint/uri。其中{clusterid}为集群ID,uri为资源路径,也即A - [获取obs桶列表(待废弃) - ListBuckets](https://support.huaweicloud.com/api-cce/ListBuckets.md): 该API用于获取用户的obs桶列表。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3.1/storage/obs/buck - [获取obs桶详情(待废弃) - GetBucket](https://support.huaweicloud.com/api-cce/GetBucket.md): 该API用于获取用户的obs桶详情。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3.1/storage/obs/buck - [获取通用文件系统列表(待废弃) - ListSfs30Volumes](https://support.huaweicloud.com/api-cce/ListSfs30Volumes.md): 该API用于获取用户的通用文件系统列表。请参见如何调用API。账号具备所有API的调用权限,如果使用账号下的IAM用户调用当前API,该IAM用户需具备调用API所需的权限。如果使用角色与策略授权,具体权限要求请参见权限和授权项。如果使用身份策略授权,当前API调用无需身份策略权限。GET /api/v3.1/storage/sfs30/ - [暂停集群升级任务(已废弃) - PauseUpgradeClusterTask](https://support.huaweicloud.com/api-cce/PauseUpgradeClusterTask.md): 暂停集群升级任务。集群升级涉及多维度的组件升级操作,强烈建议统一通过CCE控制台执行交互式升级,降低集群升级过程的业务意外受损风险;集群升级涉及多维度的组件升级操作,强烈建议统一通过CCE控制台执行交互式升级,降低集群升级过程的业务意外受损风险;当前集群升级相关接口受限开放。当前集群升级相关接口受限开放。请参见如何调用API。账号具备所有 - [继续执行集群升级任务(已废弃) - ContinueUpgradeClusterTask](https://support.huaweicloud.com/api-cce/ContinueUpgradeClusterTask.md): 继续执行被暂停的集群升级任务。集群升级涉及多维度的组件升级操作,强烈建议统一通过CCE控制台执行交互式升级,降低集群升级过程的业务意外受损风险;集群升级涉及多维度的组件升级操作,强烈建议统一通过CCE控制台执行交互式升级,降低集群升级过程的业务意外受损风险;当前集群升级相关接口受限开放。当前集群升级相关接口受限开放。请参见如何调用API。 - [权限和授权项说明](https://support.huaweicloud.com/api-cce/cce_02_0395.md): 如果您需要对您所拥有的云容器引擎(CCE)进行精细的权限管理,您可以使用统一身份认证服务(Identity and Access Management,简称IAM),如果账号已经能满足您的要求,不需要创建独立的IAM用户,您可以跳过本章节,不影响您使用CCE服务的其它功能。通过IAM,您可以通过授权控制主体(IAM用户、用户组、IAM委托 - [角色与策略授权参考(旧版IAM)](https://support.huaweicloud.com/api-cce/cce_02_0327.md): 本章节介绍CCE角色与策略授权场景下支持的策略授权项。策略包含系统策略和自定义策略,如果系统策略不满足授权要求,管理员可以创建自定义策略,并通过给用户组授予自定义策略来进行精细的访问控制。策略支持的操作与API相对应,授权项列表说明如下:权限:允许或拒绝某项操作。对应API接口:自定义策略实际调用的API接口。授权项:自定义策略中支持的A - [身份策略授权参考(新版IAM)](https://support.huaweicloud.com/api-cce/Permission.md): 云服务在IAM预置了常用的权限,称为系统身份策略。如果IAM系统身份策略无法满足授权要求,管理员可以根据各服务支持的授权项,创建IAM自定义身份策略来进行精细的访问控制,IAM自定义身份策略是对系统身份策略的扩展和补充。除IAM服务外,Organizations服务中的服务控制策略(Service Control Policy,以下简称S - [状态码](https://support.huaweicloud.com/api-cce/cce_02_0084.md): 状态码如表1所示 - [错误码](https://support.huaweicloud.com/api-cce/ErrorCode.md): 调用接口出错后,将不会返回结果数据。调用方可根据每个接口对应的错误码来定位错误原因。 当调用出错时,HTTP 请求返回一个 4xx 或 5xx 的 HTTP 状态码。返回的消息体中是具体的错误代码及错误信息。在调用方找不到错误原因时,可以联系客服,并提供错误码,以便尽快帮您解决问题。当接口调用出错时,会返回错误码及错误信息说明,错误响应的 - [获取项目ID](https://support.huaweicloud.com/api-cce/cce_02_0341.md): 在调用接口的时候,部分URL中需要填入项目ID,所以需要获取到项目ID。有如下两种获取方式:调用API获取项目ID从控制台获取项目ID项目ID可以通过调用查询指定条件下的项目列表API获取。获取项目ID的接口为“GET https://{Endpoint}/v3/projects”,其中{Endpoint}为IAM的终端节点,可以参考请求 - [获取账号ID](https://support.huaweicloud.com/api-cce/cce_02_0342.md): 在调用接口的时候,部分URL中需要填入账号ID(domain-id),所以需要先在管理控制台上获取到账号ID。账号ID获取步骤如下:注册并登录管理控制台。单击用户名,在下拉列表中单击我的凭证。在API凭证页面的项目列表中查看账号ID。获取账号ID在API凭证页面的项目列表中查看账号ID。 - [创建集群时指定要安装的插件](https://support.huaweicloud.com/api-cce/cce_02_0365.md): 创建集群时,可在请求Body体中metadata字段的annotations中添加键值对,Key为cluster.install.addons/install,Value为AddonTemplate的json列表字符串。以下请求示例将创建一个VPC网络模式的集群,并指定安装了CoreDNS域名解析和CCE容器存储(Everest)插件。 - [如何获取接口URI中参数](https://support.huaweicloud.com/api-cce/cce_02_0271.md): project_id即项目ID,可以通过控制台或API接口获取,具体请参见获取项目ID。以Chrome浏览器为例,F12打开浏览器Console,单击“Network”。单击CCE控制台中的“操作记录”,查看集群操作记录详情。在浏览器Console的“Filter”栏里输入“jobs”,过滤出jobs列表,单击该名称并选择“Preview - [创建VPC和子网](https://support.huaweicloud.com/api-cce/cce_02_0100.md): 在创建集群之前,您需要创建虚拟私有云(VPC),为CCE服务提供一个安全、隔离的网络环境。如果用户已有VPC,可重复使用,不需多次创建。 - [创建密钥对](https://support.huaweicloud.com/api-cce/cce_02_0101.md): 在创建集群之前,您需要创建密钥对,用于登录工作节点时的身份验证。如果用户已有密钥对,可重复使用,不需多次创建。 - [节点规格(flavor)说明](https://support.huaweicloud.com/api-cce/cce_02_0368.md): 不同区域支持的节点规格(flavor)不同,且节点规格存在新增、售罄下线等情况,建议您在使用前登录CCE控制台,在创建节点界面查看您需要的节点规格是否支持。CCE集群不建议使用2U4G及以下的规格,因为系统组件会占用一定的资源,过小的规格可能无法调度大规格的Pod,剩余资源无法有效利用,导致整体资源利用率偏低。建议您通过控制台查询节点规格 - [创建节点时password字段加盐加密的方法](https://support.huaweicloud.com/api-cce/add-salt.md): 通过API创建节点时password字段需要加盐加密,具体方法如下:盐值需要根据密码的要求来设置,密码复杂度要求如下:长度为8-26位。密码至少必须包含大写字母、小写字母、数字和特殊字符(!@$%^-_=+[{}]:,./?)中的三种。密码不能包含用户名或用户名的逆序。Windows系统密码不能包含用户名或用户名的逆序,不能包含用户名中超 - [节点可创建的最大Pod数量说明](https://support.huaweicloud.com/api-cce/maxPods.md): 根据集群类型不同,节点可创建的最大Pod数量计算方式如下:在创建CCE集群时,如果网络模型选择VPC网络,根据VPC网络模型的Pod IP地址分配规则(详见Pod IP地址管理),您需要选择每个节点可供分配的Pod IP数量(即alpha.cce/fixPoolMask参数)。该参数会影响节点上可以创建最大Pod的数量,因为使用容器网络时 - [节点操作系统](https://support.huaweicloud.com/api-cce/node-os.md): 如下为当前已经发布的集群版本与操作系统版本的对应关系,请参考: - [默认数据盘空间分配说明](https://support.huaweicloud.com/api-cce/cce_01_0341.md): 本章节将详细介绍节点数据盘空间分配的情况,以便您根据业务实际情况配置数据盘大小。v1.23.18-r0、v1.25.13-r0、v1.27.10-r0、v1.28.8-r0、v1.29.4-r0以下版本的集群中,节点会添加一块默认数据盘供容器运行时和Kubelet组件使用,您可以根据需要自定义默认数据盘的空间分配。v1.23.18-r0、 - [节点磁盘挂载](https://support.huaweicloud.com/api-cce/node_storage_example.md): 在自规划磁盘、创建条带逻辑盘等使用场景下,如何在创建节点时,灵活的挂载和划分磁盘成为一个问题。节点创建中storage字段通过磁盘的大小、磁盘类型等参数的匹配来选择数据盘,避免了盘符匹配失败导致的节点创建、重置、迁移、纳管失败问题(例如当创建节点时NodeExtendParam字段中DockerLVMConfigOverride.disk - [通过控制台可视化生成API参数](https://support.huaweicloud.com/api-cce/cce_02_0432.md): 在使用API创建集群或节点时,如果请求中的API参数组合不正确,将会导致接口调用失败。您可以通过控制台可视化生成API参数,根据选项配置自动生成正确的参数组合。创建节点池:参考创建节点池,根据自身需求配置节点池参数。创建节点:参考创建节点,根据自身需求配置节点参数。 ## SDK参考 - [SDK概述](https://support.huaweicloud.com/sdkreference-cce/cce-sdk-001.md): 本文介绍了CCE服务提供的SDK语言版本,列举了最新版本SDK的获取地址。如果您需要了解SDK的隐私数据处理策略,请参见华为云SDK隐私声明。API Explorer能根据需要动态生成SDK代码功能,降低您使用SDK的难度,推荐使用。您可以在API Explorer中具体API页面的“代码示例”页签查看对应编程语言类型的SDK代码,如图1 - [SDK代码示例](https://support.huaweicloud.com/sdkreference-cce/cce-sdk-005.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 ## CLI参考 - [如何使用CLI](https://support.huaweicloud.com/clir-cce/cce_cli_0001.md): 华为云命令行工具服务(Koo Command Line Interface,KooCLI,原名HCloud CLI)是为发布在API Explorer上的云服务API提供的命令行管理工具。您可以通过此工具调用API Explorer中CCE开放的API,管理和使用您的CCE资源。关于KooCLI的详细信息,请参见什么是KooCLI。在使用 - [CLI命令参考](https://support.huaweicloud.com/clir-cce/cce_cli_0002.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 ## Skill参考 - [使用华为云云原生Skill](https://support.huaweicloud.com/skill-cce/cce_skill_0001.md): 本章节面向使用CCE(云容器引擎)及相关云服务的开发者、运维工程师和架构师,介绍华为云云原生Skill的能力定位、使用方式和详细参考。Skill是将专业知识、操作流程和最佳实践转化为可复用能力单元的开放能力。在AI Agent体系中,Skill用于扩展Agent的专业领域能力,使Agent能够按照预定义的流程和规则,自动执行特定领域的复杂 - [使用AI CLI对CCE工作负载进行故障诊断与恢复](https://support.huaweicloud.com/skill-cce/cce_skill_0003.md): 在CCE集群中,工作负载发布、扩缩容或配置变更后,可能出现Pod长时间未就绪、Deployment滚动升级卡住、容器频繁重启、镜像拉取失败、调度失败、服务端点异常等问题。传统排障通常需要运维人员在Deployment、ReplicaSet、Pod、Events、容器日志、探针配置和监控数据之间反复切换,定位链路长、人工判断成本高。通过AI - [使用OpenClaw进行CCE集群定期巡检](https://support.huaweicloud.com/skill-cce/cce_skill_0005.md): 生产环境中的CCE集群需要持续关注节点健康、Pod状态、核心插件、资源利用率、Kubernetes事件、AOM告警和业务入口状态。通过OpenClaw Agent对接集群巡检能力,可以用自然语言配置周期性巡检任务,让Agent自动完成集群健康检查、告警聚合、异常分析、风险分级、报告生成和通知推送。本实践推荐采用“先快检、异常再深检”的方式 - [使用AI CLI配置、查询和治理CCE AOM告警](https://support.huaweicloud.com/skill-cce/cce_skill_0006.md): CCE集群上线后,运维团队通常需要尽快完成告警规则初始化,并在日常排障中持续关注当前活跃告警、历史告警、恢复记录和通知规则。通过AI CLI Agent对接alarm-correlation-engine Skill,您可以用自然语言完成CCE AOM告警规则配置、告警查询、告警聚合分析和严重告警根因追查。相比只查看单条告警列表,本实践推 - [基于AI CLI和Skill实现CCE弹性至CCI 2.0](https://support.huaweicloud.com/skill-cce/cce_skill_0007.md): CCE突发弹性引擎(对接CCI)是一种虚拟kubelet,将Kubernetes API扩展到无服务器容器平台CCI,支持在短时高负载场景下将CCE工作负载弹性创建到CCI 2.0服务上。本文介绍如何通过AI CLI工具加载cce-cci-bursting-deployer,以一条提示词完成从集群预检到弹性验证的全流程配置。仅支持VPC网 - [基于Hermes与飞书构建CCE生产环境智能运维Agent](https://support.huaweicloud.com/skill-cce/cce_skill_0008.md): 本文以Hermes接入飞书为例,构建一个CCE生产环境ChatOps值班Agent。该Agent可以定时扫描现网告警,自动归并和分析告警,生成恢复方案,并在用户通过飞书手机端确认后执行恢复动作。文中的CPU高告警只是一个用于验证闭环的小案例,您可以基于同样的思路扩展出Pod重启诊断、节点异常处理、调度失败恢复、容量巡检、发布变更关联、日报 ## 常见问题 - [高频常见问题](https://support.huaweicloud.com/cce_faq/cce_faq_00006.md): CCE集群创建失败的原因与解决方法?集群的管理规模和控制节点的数量有关系吗?当集群状态为“不可用”时,如何排查解决?集群可用但节点状态为“不可用”如何解决?如何收集CCE集群中节点的日志?thinpool磁盘空间耗尽导致容器或节点异常时,如何解决?纳管节点时失败,报错“安装节点失败”如何解决?工作负载状态异常定位方法工作负载异常:实例调度 - [云容器引擎CCE如何定价/收费?](https://support.huaweicloud.com/cce_faq/cce_faq_00101.md): 云容器引擎提供包年/包月、按需计费两种计费模式,以满足不同场景下的用户需求。关于计费模式的详细介绍请参见计费模式概述。包年/包月是一种预付费模式,即先付费再使用,按照订单的购买周期进行结算,因此在购买之前,您必须确保账户余额充足。按需计费是一种后付费模式,即先使用再付费,按照实际使用时长计费。在购买集群或集群内资源后,如果发现当前计费模式 - [CCE集群的计费方式如何由按需改为包年包月?](https://support.huaweicloud.com/cce_faq/cce_faq_00009.md): 当前在CCE中购买集群时支持按需计费和包年/包月(按周期)两种计费方式。按需计费的购买的集群可以转成按周期计费的集群。如果您在购买按需计费的集群后,想更换为包年/包月计费,可按如下步骤进行操作: - [CCE创建的节点是否支持按需转包周期?](https://support.huaweicloud.com/cce_faq/cce_faq_00128.md): 当前在CCE中购买节点时支持按需计费和包年/包月(按周期)计费。按需节点池中的节点转为包年/包月时,需要将集群升级到v1.19.16-r40、v1.21.11-r0、v1.23.9-r0、v1.25.4-r0及以上版本。当按需节点池中的节点转为包年/包月后,该节点不支持弹性缩容。按需计费节点绑定的资源(云硬盘、弹性公网IP)可能不支持同步 - [华为云支持哪几种开具发票模式?](https://support.huaweicloud.com/cce_faq/cce_faq_00000.md): 华为云支持“按账期索取发票”和“按订单索取发票”模式。您可在费用中心的发票管理开具发票。 - [CCE是否支持余额不足提醒?](https://support.huaweicloud.com/cce_faq/cce_faq_00183.md): 用户可在费用中心总览页面“可用额度”区域单击“设置”,设置“可用额度预警”后的开关,即可开通或关闭可用额度预警功能。单击“修改”,可以对预警阈值进行修改。开通后,当可用额度(含现金余额、信用余额、通用代金券、现金券)的总金额低于预警阈值时, 会每天给联系人发送短信和邮件提醒,最多连续提醒3天。您可到消息中心“消息接收设置 > 财务信息 > - [CCE是否支持账户余额变动提醒?](https://support.huaweicloud.com/cce_faq/cce_faq_00105.md): 系统会以邮件、短信形式给客户发送账户余额变动通知,包括账户余额调整、充值到账、客户在线充值等。 - [包周期的CCE集群到期可以直接删除吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00216.md): CCE集群包周期到期后,您可以在备份好所有数据的情况下直接删除该集群。如果到期后您仍没有续费或删除,系统会根据资源到期时间删除该集群,请及时续费并做好数据备份工作。 - [如何退订我的云容器引擎?](https://support.huaweicloud.com/cce_faq/cce_faq_00042.md): 客户购买包周期资源后,支持客户退订包周期实例。退订资源实例包括资源续费部分和当前正在使用的部分,退订后资源将无法使用。退订资源实例需收取手续费。退订该实例是指退订续费部分和当前正在使用的部分,资源退订后将无法使用。解决方案组合产品只支持整体退订。订单中存在主从关系的资源,需分别退订。资源退订,相关注意事项请参见退订规则说明。在执行退订操作 - [集群冻结/解冻/释放常见问题](https://support.huaweicloud.com/cce_faq/cce_faq_00419.md): 资源冻结的类型包括欠费冻结、违规冻结、公安冻结。单击了解资源冻结的类型、冻结后对续费、退订的影响。欠费冻结:用户可通过续费或充值来解冻资源,恢复集群正常使用。欠费冻结的集群允许续费、释放或删除;已经到期的包年/包月集群不能发起退订,未到期的包年/包月集群可以退订。违规冻结:违规冻结的集群允许续费、释放或删除;已经到期的包年/包月集群不能发 - [云容器引擎CCE如何定价/收费?](https://support.huaweicloud.com/cce_faq/cce_faq_00101.md): 云容器引擎提供包年/包月、按需计费两种计费模式,以满足不同场景下的用户需求。关于计费模式的详细介绍请参见计费模式概述。包年/包月是一种预付费模式,即先付费再使用,按照订单的购买周期进行结算,因此在购买之前,您必须确保账户余额充足。按需计费是一种后付费模式,即先使用再付费,按照实际使用时长计费。在购买集群或集群内资源后,如果发现当前计费模式 - [CCE集群的计费方式如何由按需改为包年包月?](https://support.huaweicloud.com/cce_faq/cce_faq_00009.md): 当前在CCE中购买集群时支持按需计费和包年/包月(按周期)两种计费方式。按需计费的购买的集群可以转成按周期计费的集群。如果您在购买按需计费的集群后,想更换为包年/包月计费,可按如下步骤进行操作: - [CCE创建的节点是否支持按需转包周期?](https://support.huaweicloud.com/cce_faq/cce_faq_00128.md): 当前在CCE中购买节点时支持按需计费和包年/包月(按周期)计费。按需节点池中的节点转为包年/包月时,需要将集群升级到v1.19.16-r40、v1.21.11-r0、v1.23.9-r0、v1.25.4-r0及以上版本。当按需节点池中的节点转为包年/包月后,该节点不支持弹性缩容。按需计费节点绑定的资源(云硬盘、弹性公网IP)可能不支持同步 - [华为云支持哪几种开具发票模式?](https://support.huaweicloud.com/cce_faq/cce_faq_00000.md): 华为云支持“按账期索取发票”和“按订单索取发票”模式。您可在费用中心的发票管理开具发票。 - [CCE是否支持余额不足提醒?](https://support.huaweicloud.com/cce_faq/cce_faq_00183.md): 用户可在费用中心总览页面“可用额度”区域单击“设置”,设置“可用额度预警”后的开关,即可开通或关闭可用额度预警功能。单击“修改”,可以对预警阈值进行修改。开通后,当可用额度(含现金余额、信用余额、通用代金券、现金券)的总金额低于预警阈值时, 会每天给联系人发送短信和邮件提醒,最多连续提醒3天。您可到消息中心“消息接收设置 > 财务信息 > - [CCE是否支持账户余额变动提醒?](https://support.huaweicloud.com/cce_faq/cce_faq_00105.md): 系统会以邮件、短信形式给客户发送账户余额变动通知,包括账户余额调整、充值到账、客户在线充值等。 - [包周期的CCE集群到期可以直接删除吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00216.md): CCE集群包周期到期后,您可以在备份好所有数据的情况下直接删除该集群。如果到期后您仍没有续费或删除,系统会根据资源到期时间删除该集群,请及时续费并做好数据备份工作。 - [如何退订我的云容器引擎?](https://support.huaweicloud.com/cce_faq/cce_faq_00042.md): 客户购买包周期资源后,支持客户退订包周期实例。退订资源实例包括资源续费部分和当前正在使用的部分,退订后资源将无法使用。退订资源实例需收取手续费。退订该实例是指退订续费部分和当前正在使用的部分,资源退订后将无法使用。解决方案组合产品只支持整体退订。订单中存在主从关系的资源,需分别退订。资源退订,相关注意事项请参见退订规则说明。在执行退订操作 - [集群冻结/解冻/释放常见问题](https://support.huaweicloud.com/cce_faq/cce_faq_00419.md): 资源冻结的类型包括欠费冻结、违规冻结、公安冻结。单击了解资源冻结的类型、冻结后对续费、退订的影响。欠费冻结:用户可通过续费或充值来解冻资源,恢复集群正常使用。欠费冻结的集群允许续费、释放或删除;已经到期的包年/包月集群不能发起退订,未到期的包年/包月集群可以退订。违规冻结:违规冻结的集群允许续费、释放或删除;已经到期的包年/包月集群不能发 - [集群创建](https://support.huaweicloud.com/cce_faq/cce_faq_00278.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [CCE集群创建失败的原因与解决方法?](https://support.huaweicloud.com/cce_faq/cce_faq_00111.md): 本文主要介绍在CCE集群创建失败时,如何查找失败的原因,并解决问题。集群创建失败的原因包括:ntpd没安装或者安装失败、k8s组件预校验不过、磁盘分区错误等,目前只能尝试重新创建,定位方法请参见定位失败原因。当前集群规模所需的底层资源不足,请选择其他规模的集群类型后重新创建集群。确认账号是否欠费:账号必须是未欠费状态才可以购买资源,包括使 - [集群的管理规模和控制节点的数量有关系吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00090.md): 在CCE集群中,集群的管理规模和控制节点数量没有明显的关联,它们是属于不同的维度的集群参数,具体说明如下:集群管理规模:指集群支持管理的最大节点数。若选择50节点,表示当前集群最多可管理50个节点(集群实际可创建的节点受限于VPC网络的子网IP数量,且控制节点也占用一个IP地址)。针对不同的集群规模,控制节点的规格不同,但控制节点的数量不 - [CCE集群创建时的根证书如何更新?](https://support.huaweicloud.com/cce_faq/cce_faq_00123.md): CCE集群根证书是Kubernetes认证的基础证书,华为云上的Kubernetes集群管理面托管在CCE管理平台上,证书也在CCE的管理平台上,不对用户开放,这个证书在平台上会定期维护,不会出现过期的情况。X509证书在Kubernetes集群上也是默认开启的,更新平台自动会维护更新。通过CCE控制台获取集群证书,使用该证书可以访问Ku - [使用CCE需要关注哪些配额限制?](https://support.huaweicloud.com/cce_faq/cce_faq_00154.md): 云容器引擎CCE配额只限制了集群个数,但是用户使用CCE时也会使用其他云服务,包括:弹性云服务器、云硬盘、虚拟私有云、弹性负载均衡、容器镜像服务等。为防止资源滥用,平台限定了各服务资源的配额,对用户的资源数量和容量做了限制。如您最多可以创建多少台弹性云服务器、多少块云硬盘。如果当前资源配额限制无法满足使用需要,您可以申请扩大配额。登录管理 - [集群运行](https://support.huaweicloud.com/cce_faq/cce_faq_00279.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [当集群状态为“不可用”时,如何排查解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00039.md): 当集群状态显示为不可用时,请参照如下方式来排查解决。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。排查项一:安全组是否被修改排查项二:集群是否过载排查项三:集群Secret落盘加密使用的KMS密钥是否有效排查项四:集群证 - [CCE集群如何重置或重装?](https://support.huaweicloud.com/cce_faq/cce_faq_00257.md): CCE中的集群不能重置或重装,如确定集群无法使用,请提交工单或删除后重新购买集群。CCE集群中的节点重置功能已上线,详情请参见重置节点。 - [如何确认已创建的集群是否为多控制节点模式?](https://support.huaweicloud.com/cce_faq/cce_faq_00155.md): 登录CCE控制台,进入集群,在集群详情页面右侧查看控制节点数量:3个节点即为多控制节点模式。1个节点即为单控制节点模式。集群一旦创建,便无法更改控制节点数,需要重新创建集群才能调整。 - [是否可以直接连接CCE集群的控制节点?](https://support.huaweicloud.com/cce_faq/cce_faq_00131.md): CCE支持使用Kubectl工具连接集群,具体请参见通过Kubectl连接集群。CCE不支持登录控制节点执行相关操作。 - [CCE集群删除之后相关数据能否再次找回?](https://support.huaweicloud.com/cce_faq/cce_faq_00040.md): 问题描述:CCE集群删除之后相关数据能否再次找回?问题解答:集群删除之后,部署在集群上的工作负载也会同步删除,无法恢复,请慎重删除集群。 - [为什么CCE集群界面的节点磁盘监控看起来不准确?](https://support.huaweicloud.com/cce_faq/cce_faq_00249.md): 问题描述:CCE集群界面的某个节点磁盘监控高达80%以上,而进入云监控界面看到的磁盘使用率在40%不到。后面在该节点上排查,发现有一个pvc磁盘使用达到了92%,将这个盘清理后,集群界面的磁盘使用率和云监控使用率一致了。请问集群界面的节点监控是怎么样的原理,是否只报最大磁盘使用率的数据呢?问题解答:CCE集群监控信息中,磁盘使用率为当前节 - [如何修改CCE集群名称?](https://support.huaweicloud.com/cce_faq/cce_faq_00420.md): 集群创建完成后,支持修改集群名称。输入完成后,单击保存。保存后,集群名称将自动更新为修改后的名称。集群名称不能与其他集群的名称或原名相同修改名称后,CTS/RMS/EPS服务的记录会按照修改后的名称命名集群名称不能与其他集群的名称或原名相同修改名称后,CTS/RMS/EPS服务的记录会按照修改后的名称命名 - [控制台访问异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00467.md): 若您在查看容器组日志时遇到该问题,而集群其他资源均可正常访问,您可以按以下步骤排查。登录CCE控制台,单击集群名称进入集群。选择左侧导航栏的工作负载,查看工作负载容器组运行状态是否为“运行中”,若不是,请根据工作负载状态异常定位方法进行排查。在集群“概览”页面,在“网络信息”选择“节点默认安全组”,单击跳转到安全组页面,查看安全组入方向规 - [集群删除](https://support.huaweicloud.com/cce_faq/cce_faq_00309.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [集群删除失败:安全组中存在残留资源](https://support.huaweicloud.com/cce_faq/cce_faq_00394.md): CCE在删除集群时,会连接集群的kube-apiserver查询集群对接的周边资源信息,如Turbo集群对接的弹性网卡/弹性辅助网卡等,当CCE集群的状态为不可用,冻结,休眠等状态时,删除集群有可能会出现查询资源失败而导致集群删除失败的情况。删除集群失败,报错信息如下:该场景引起的原因是集群关联的安全组中存在未删除的资源,该安全组无法删除 - [集群删除失败:ELB删除失败](https://support.huaweicloud.com/cce_faq/cce_faq_00395.md): 删除集群失败,报错信息如下:该场景引起的原因是集群中的ELB存在正在使用的监听器未删除,导致集群删除失败。前往ELB控制台,手动删除对应ELB的监听器,然后重试删除集群。 - [集群删除失败:共享VPC被取消](https://support.huaweicloud.com/cce_faq/cce_faq_00514.md): 集群删除失败,信息如下:由于该集群创建时使用其他账号共享的VPC和子网,在共享者取消共享后,该账号权限无法查看之前共享的VPC和子网,从而导致删除集群失败。关于使用共享VPC创建集群的说明请参考使用共享VPC创建CCE Turbo集群。您可以让取消共享的账号重新共享该VPC和子网,子网ID见删除集群报错信息里的“Network *** c - [冻结或不可用的集群删除后如何清除残留资源](https://support.huaweicloud.com/cce_faq/cce_faq_00413.md): 处于非运行状态(例如冻结、不可用状态)中的集群,由于无法获取集群中的PVC、Service、Ingress等资源,因此删除集群之后可能会残留网络及存储等资源,您需要前往资源所属服务手动删除。通过PVC动态创建方式创建的云硬盘名称格式为“pvc-{uid}”,且接口中的MetaData字段包含集群ID信息,您可以通过集群ID筛选出该集群中自 - [集群升级](https://support.huaweicloud.com/cce_faq/cce_faq_00401.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [CCE集群升级时,升级集群插件失败如何排查解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00402.md): 在CCE在升级集群时,出现插件升级失败。 - [CCE集群升级时,ELB Ingress与ELB配置不一致如何处理?](https://support.huaweicloud.com/cce_faq/cce_faq_00493.md): 在CCE集群中,使用ELB Ingress可以将外部流量路由到集群内的服务。Ingress中定义的一系列参数实际上是作用于弹性负载均衡器(ELB)的配置,以便更好地控制流量管理和分发。表1将详细介绍这些ELB配置与Ingress参数的对应关系。集群升级前检查中,可能扫描出多个Ingress与ELB配置不一致项,并显示每个不一致项期望的配置 - [CCE集群创建失败的原因与解决方法?](https://support.huaweicloud.com/cce_faq/cce_faq_00111.md): 本文主要介绍在CCE集群创建失败时,如何查找失败的原因,并解决问题。集群创建失败的原因包括:ntpd没安装或者安装失败、k8s组件预校验不过、磁盘分区错误等,目前只能尝试重新创建,定位方法请参见定位失败原因。当前集群规模所需的底层资源不足,请选择其他规模的集群类型后重新创建集群。确认账号是否欠费:账号必须是未欠费状态才可以购买资源,包括使 - [集群的管理规模和控制节点的数量有关系吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00090.md): 在CCE集群中,集群的管理规模和控制节点数量没有明显的关联,它们是属于不同的维度的集群参数,具体说明如下:集群管理规模:指集群支持管理的最大节点数。若选择50节点,表示当前集群最多可管理50个节点(集群实际可创建的节点受限于VPC网络的子网IP数量,且控制节点也占用一个IP地址)。针对不同的集群规模,控制节点的规格不同,但控制节点的数量不 - [CCE集群创建时的根证书如何更新?](https://support.huaweicloud.com/cce_faq/cce_faq_00123.md): CCE集群根证书是Kubernetes认证的基础证书,华为云上的Kubernetes集群管理面托管在CCE管理平台上,证书也在CCE的管理平台上,不对用户开放,这个证书在平台上会定期维护,不会出现过期的情况。X509证书在Kubernetes集群上也是默认开启的,更新平台自动会维护更新。通过CCE控制台获取集群证书,使用该证书可以访问Ku - [使用CCE需要关注哪些配额限制?](https://support.huaweicloud.com/cce_faq/cce_faq_00154.md): 云容器引擎CCE配额只限制了集群个数,但是用户使用CCE时也会使用其他云服务,包括:弹性云服务器、云硬盘、虚拟私有云、弹性负载均衡、容器镜像服务等。为防止资源滥用,平台限定了各服务资源的配额,对用户的资源数量和容量做了限制。如您最多可以创建多少台弹性云服务器、多少块云硬盘。如果当前资源配额限制无法满足使用需要,您可以申请扩大配额。登录管理 - [CCE集群创建失败的原因与解决方法?](https://support.huaweicloud.com/cce_faq/cce_faq_00111.md): 本文主要介绍在CCE集群创建失败时,如何查找失败的原因,并解决问题。集群创建失败的原因包括:ntpd没安装或者安装失败、k8s组件预校验不过、磁盘分区错误等,目前只能尝试重新创建,定位方法请参见定位失败原因。当前集群规模所需的底层资源不足,请选择其他规模的集群类型后重新创建集群。确认账号是否欠费:账号必须是未欠费状态才可以购买资源,包括使 - [集群的管理规模和控制节点的数量有关系吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00090.md): 在CCE集群中,集群的管理规模和控制节点数量没有明显的关联,它们是属于不同的维度的集群参数,具体说明如下:集群管理规模:指集群支持管理的最大节点数。若选择50节点,表示当前集群最多可管理50个节点(集群实际可创建的节点受限于VPC网络的子网IP数量,且控制节点也占用一个IP地址)。针对不同的集群规模,控制节点的规格不同,但控制节点的数量不 - [CCE集群创建时的根证书如何更新?](https://support.huaweicloud.com/cce_faq/cce_faq_00123.md): CCE集群根证书是Kubernetes认证的基础证书,华为云上的Kubernetes集群管理面托管在CCE管理平台上,证书也在CCE的管理平台上,不对用户开放,这个证书在平台上会定期维护,不会出现过期的情况。X509证书在Kubernetes集群上也是默认开启的,更新平台自动会维护更新。通过CCE控制台获取集群证书,使用该证书可以访问Ku - [使用CCE需要关注哪些配额限制?](https://support.huaweicloud.com/cce_faq/cce_faq_00154.md): 云容器引擎CCE配额只限制了集群个数,但是用户使用CCE时也会使用其他云服务,包括:弹性云服务器、云硬盘、虚拟私有云、弹性负载均衡、容器镜像服务等。为防止资源滥用,平台限定了各服务资源的配额,对用户的资源数量和容量做了限制。如您最多可以创建多少台弹性云服务器、多少块云硬盘。如果当前资源配额限制无法满足使用需要,您可以申请扩大配额。登录管理 - [当集群状态为“不可用”时,如何排查解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00039.md): 当集群状态显示为不可用时,请参照如下方式来排查解决。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。排查项一:安全组是否被修改排查项二:集群是否过载排查项三:集群Secret落盘加密使用的KMS密钥是否有效排查项四:集群证 - [CCE集群如何重置或重装?](https://support.huaweicloud.com/cce_faq/cce_faq_00257.md): CCE中的集群不能重置或重装,如确定集群无法使用,请提交工单或删除后重新购买集群。CCE集群中的节点重置功能已上线,详情请参见重置节点。 - [如何确认已创建的集群是否为多控制节点模式?](https://support.huaweicloud.com/cce_faq/cce_faq_00155.md): 登录CCE控制台,进入集群,在集群详情页面右侧查看控制节点数量:3个节点即为多控制节点模式。1个节点即为单控制节点模式。集群一旦创建,便无法更改控制节点数,需要重新创建集群才能调整。 - [是否可以直接连接CCE集群的控制节点?](https://support.huaweicloud.com/cce_faq/cce_faq_00131.md): CCE支持使用Kubectl工具连接集群,具体请参见通过Kubectl连接集群。CCE不支持登录控制节点执行相关操作。 - [CCE集群删除之后相关数据能否再次找回?](https://support.huaweicloud.com/cce_faq/cce_faq_00040.md): 问题描述:CCE集群删除之后相关数据能否再次找回?问题解答:集群删除之后,部署在集群上的工作负载也会同步删除,无法恢复,请慎重删除集群。 - [为什么CCE集群界面的节点磁盘监控看起来不准确?](https://support.huaweicloud.com/cce_faq/cce_faq_00249.md): 问题描述:CCE集群界面的某个节点磁盘监控高达80%以上,而进入云监控界面看到的磁盘使用率在40%不到。后面在该节点上排查,发现有一个pvc磁盘使用达到了92%,将这个盘清理后,集群界面的磁盘使用率和云监控使用率一致了。请问集群界面的节点监控是怎么样的原理,是否只报最大磁盘使用率的数据呢?问题解答:CCE集群监控信息中,磁盘使用率为当前节 - [如何修改CCE集群名称?](https://support.huaweicloud.com/cce_faq/cce_faq_00420.md): 集群创建完成后,支持修改集群名称。输入完成后,单击保存。保存后,集群名称将自动更新为修改后的名称。集群名称不能与其他集群的名称或原名相同修改名称后,CTS/RMS/EPS服务的记录会按照修改后的名称命名集群名称不能与其他集群的名称或原名相同修改名称后,CTS/RMS/EPS服务的记录会按照修改后的名称命名 - [控制台访问异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00467.md): 若您在查看容器组日志时遇到该问题,而集群其他资源均可正常访问,您可以按以下步骤排查。登录CCE控制台,单击集群名称进入集群。选择左侧导航栏的工作负载,查看工作负载容器组运行状态是否为“运行中”,若不是,请根据工作负载状态异常定位方法进行排查。在集群“概览”页面,在“网络信息”选择“节点默认安全组”,单击跳转到安全组页面,查看安全组入方向规 - [当集群状态为“不可用”时,如何排查解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00039.md): 当集群状态显示为不可用时,请参照如下方式来排查解决。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。排查项一:安全组是否被修改排查项二:集群是否过载排查项三:集群Secret落盘加密使用的KMS密钥是否有效排查项四:集群证 - [CCE集群如何重置或重装?](https://support.huaweicloud.com/cce_faq/cce_faq_00257.md): CCE中的集群不能重置或重装,如确定集群无法使用,请提交工单或删除后重新购买集群。CCE集群中的节点重置功能已上线,详情请参见重置节点。 - [如何确认已创建的集群是否为多控制节点模式?](https://support.huaweicloud.com/cce_faq/cce_faq_00155.md): 登录CCE控制台,进入集群,在集群详情页面右侧查看控制节点数量:3个节点即为多控制节点模式。1个节点即为单控制节点模式。集群一旦创建,便无法更改控制节点数,需要重新创建集群才能调整。 - [是否可以直接连接CCE集群的控制节点?](https://support.huaweicloud.com/cce_faq/cce_faq_00131.md): CCE支持使用Kubectl工具连接集群,具体请参见通过Kubectl连接集群。CCE不支持登录控制节点执行相关操作。 - [CCE集群删除之后相关数据能否再次找回?](https://support.huaweicloud.com/cce_faq/cce_faq_00040.md): 问题描述:CCE集群删除之后相关数据能否再次找回?问题解答:集群删除之后,部署在集群上的工作负载也会同步删除,无法恢复,请慎重删除集群。 - [为什么CCE集群界面的节点磁盘监控看起来不准确?](https://support.huaweicloud.com/cce_faq/cce_faq_00249.md): 问题描述:CCE集群界面的某个节点磁盘监控高达80%以上,而进入云监控界面看到的磁盘使用率在40%不到。后面在该节点上排查,发现有一个pvc磁盘使用达到了92%,将这个盘清理后,集群界面的磁盘使用率和云监控使用率一致了。请问集群界面的节点监控是怎么样的原理,是否只报最大磁盘使用率的数据呢?问题解答:CCE集群监控信息中,磁盘使用率为当前节 - [如何修改CCE集群名称?](https://support.huaweicloud.com/cce_faq/cce_faq_00420.md): 集群创建完成后,支持修改集群名称。输入完成后,单击保存。保存后,集群名称将自动更新为修改后的名称。集群名称不能与其他集群的名称或原名相同修改名称后,CTS/RMS/EPS服务的记录会按照修改后的名称命名集群名称不能与其他集群的名称或原名相同修改名称后,CTS/RMS/EPS服务的记录会按照修改后的名称命名 - [控制台访问异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00467.md): 若您在查看容器组日志时遇到该问题,而集群其他资源均可正常访问,您可以按以下步骤排查。登录CCE控制台,单击集群名称进入集群。选择左侧导航栏的工作负载,查看工作负载容器组运行状态是否为“运行中”,若不是,请根据工作负载状态异常定位方法进行排查。在集群“概览”页面,在“网络信息”选择“节点默认安全组”,单击跳转到安全组页面,查看安全组入方向规 - [集群删除失败:安全组中存在残留资源](https://support.huaweicloud.com/cce_faq/cce_faq_00394.md): CCE在删除集群时,会连接集群的kube-apiserver查询集群对接的周边资源信息,如Turbo集群对接的弹性网卡/弹性辅助网卡等,当CCE集群的状态为不可用,冻结,休眠等状态时,删除集群有可能会出现查询资源失败而导致集群删除失败的情况。删除集群失败,报错信息如下:该场景引起的原因是集群关联的安全组中存在未删除的资源,该安全组无法删除 - [集群删除失败:ELB删除失败](https://support.huaweicloud.com/cce_faq/cce_faq_00395.md): 删除集群失败,报错信息如下:该场景引起的原因是集群中的ELB存在正在使用的监听器未删除,导致集群删除失败。前往ELB控制台,手动删除对应ELB的监听器,然后重试删除集群。 - [集群删除失败:共享VPC被取消](https://support.huaweicloud.com/cce_faq/cce_faq_00514.md): 集群删除失败,信息如下:由于该集群创建时使用其他账号共享的VPC和子网,在共享者取消共享后,该账号权限无法查看之前共享的VPC和子网,从而导致删除集群失败。关于使用共享VPC创建集群的说明请参考使用共享VPC创建CCE Turbo集群。您可以让取消共享的账号重新共享该VPC和子网,子网ID见删除集群报错信息里的“Network *** c - [冻结或不可用的集群删除后如何清除残留资源](https://support.huaweicloud.com/cce_faq/cce_faq_00413.md): 处于非运行状态(例如冻结、不可用状态)中的集群,由于无法获取集群中的PVC、Service、Ingress等资源,因此删除集群之后可能会残留网络及存储等资源,您需要前往资源所属服务手动删除。通过PVC动态创建方式创建的云硬盘名称格式为“pvc-{uid}”,且接口中的MetaData字段包含集群ID信息,您可以通过集群ID筛选出该集群中自 - [集群删除失败:安全组中存在残留资源](https://support.huaweicloud.com/cce_faq/cce_faq_00394.md): CCE在删除集群时,会连接集群的kube-apiserver查询集群对接的周边资源信息,如Turbo集群对接的弹性网卡/弹性辅助网卡等,当CCE集群的状态为不可用,冻结,休眠等状态时,删除集群有可能会出现查询资源失败而导致集群删除失败的情况。删除集群失败,报错信息如下:该场景引起的原因是集群关联的安全组中存在未删除的资源,该安全组无法删除 - [集群删除失败:ELB删除失败](https://support.huaweicloud.com/cce_faq/cce_faq_00395.md): 删除集群失败,报错信息如下:该场景引起的原因是集群中的ELB存在正在使用的监听器未删除,导致集群删除失败。前往ELB控制台,手动删除对应ELB的监听器,然后重试删除集群。 - [集群删除失败:共享VPC被取消](https://support.huaweicloud.com/cce_faq/cce_faq_00514.md): 集群删除失败,信息如下:由于该集群创建时使用其他账号共享的VPC和子网,在共享者取消共享后,该账号权限无法查看之前共享的VPC和子网,从而导致删除集群失败。关于使用共享VPC创建集群的说明请参考使用共享VPC创建CCE Turbo集群。您可以让取消共享的账号重新共享该VPC和子网,子网ID见删除集群报错信息里的“Network *** c - [冻结或不可用的集群删除后如何清除残留资源](https://support.huaweicloud.com/cce_faq/cce_faq_00413.md): 处于非运行状态(例如冻结、不可用状态)中的集群,由于无法获取集群中的PVC、Service、Ingress等资源,因此删除集群之后可能会残留网络及存储等资源,您需要前往资源所属服务手动删除。通过PVC动态创建方式创建的云硬盘名称格式为“pvc-{uid}”,且接口中的MetaData字段包含集群ID信息,您可以通过集群ID筛选出该集群中自 - [CCE集群升级时,升级集群插件失败如何排查解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00402.md): 在CCE在升级集群时,出现插件升级失败。 - [CCE集群升级时,ELB Ingress与ELB配置不一致如何处理?](https://support.huaweicloud.com/cce_faq/cce_faq_00493.md): 在CCE集群中,使用ELB Ingress可以将外部流量路由到集群内的服务。Ingress中定义的一系列参数实际上是作用于弹性负载均衡器(ELB)的配置,以便更好地控制流量管理和分发。表1将详细介绍这些ELB配置与Ingress参数的对应关系。集群升级前检查中,可能扫描出多个Ingress与ELB配置不一致项,并显示每个不一致项期望的配置 - [CCE集群升级时,升级集群插件失败如何排查解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00402.md): 在CCE在升级集群时,出现插件升级失败。 - [CCE集群升级时,ELB Ingress与ELB配置不一致如何处理?](https://support.huaweicloud.com/cce_faq/cce_faq_00493.md): 在CCE集群中,使用ELB Ingress可以将外部流量路由到集群内的服务。Ingress中定义的一系列参数实际上是作用于弹性负载均衡器(ELB)的配置,以便更好地控制流量管理和分发。表1将详细介绍这些ELB配置与Ingress参数的对应关系。集群升级前检查中,可能扫描出多个Ingress与ELB配置不一致项,并显示每个不一致项期望的配置 - [节点异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00468.md): CCE支持通过NPD插件排查节点异常问题,您也可以参考自主排查流程进行排查。若通过NPD插件排查和自主排查流程都无法解决问题,请提交工单排查。CCE提供节点故障检测NPD插件,NPD插件从1.16.0版本开始增加了大量检查项,能对节点上各种资源和组件的状态检测,帮助发现节点故障。强烈建议您安装该插件,如已安装请查看插件版本并升级到1.16 - [节点创建](https://support.huaweicloud.com/cce_faq/cce_faq_00280.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [CCE集群新增节点时的问题与排查方法](https://support.huaweicloud.com/cce_faq/cce_faq_00027.md): 新建节点时,数据盘如需分配用户空间,分配目录注意不要设置关键目录,例如:如需放到home下,建议设置为/home/test,不要直接写到/home/下。请注意挂载路径不能设置为根目录“/”,否则将导致挂载失败。挂载路径一般设置为:/opt/xxxx(但不能为/opt/cloud)/mnt/xxxx(但不能为/mnt/paas)/tmp/x - [CCE集群纳管节点时的常见问题及排查方法?](https://support.huaweicloud.com/cce_faq/cce_faq_00097.md): 本文主要介绍纳管/添加已有的ECS实例到CCE集群的常见问题。纳管时,会将所选弹性云服务器的操作系统重置为CCE提供的标准镜像,以确保节点的稳定性,请选择操作系统及重置后的登录方式。所选弹性云服务器挂载的系统盘、数据盘都会在纳管时被格式化,请确保信息已备份。纳管过程中,请勿在弹性云服务器控制台对所选虚拟机做任何操作。纳管节点支持ECS(弹 - [纳管节点时失败,报错“安装节点失败”如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00286.md): 节点纳管失败报错安装节点失败。登录节点,查看/var/paas/sys/log/baseagent/baseagent.log安装日志,发现如下报错:查看节点LVM设置,发现/dev/vdb没有创建LVM逻辑卷。手工创建逻辑卷:然后在界面重置节点后节点状态正常。 - [CCE支持等保三级认证吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00437.md): 云容器引擎CCE服务已通过等保三级认证,您可以在创建节点时进行安全加固,详情请参见如何进行安全加固。但在您使用集群前,还需要充分理解云容器引擎的安全责任边界,华为云无法限制您在服务托管范围外的行为,您需要为这部分的行为承担安全责任。详情请参见责任共担。以下为开启安全加固关键参数设置,其余参数请根据需求设置。在“操作系统”中选择“Huawe - [节点运行](https://support.huaweicloud.com/cce_faq/cce_faq_00281.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [集群可用但节点状态为“不可用”如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00120.md): 当集群状态为“可用”,而集群中部分节点状态为“不可用”时,请参照本文提供的排查思路解决。Kubernetes 节点发送的心跳确定每个节点的可用性,并在检测到故障时采取行动。检测的机制和间隔时间详细说明请参见心跳。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因 - [CCE集群中的节点无法远程登录,如何排查解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00118.md): CCE创建节点成功后,无法ssh远程登录。ssh回显提示“所选的用户密钥未在远程主机上注册”,即root用户不能直接登录到节点。出现上述问题的原因是CCE创建的节点安装了cloudinit,有默认的linux用户,并且该密钥也是用于linux。使用linux用户登录,使用sudo su命令切换到root用户。 - [如何重置CCE集群中节点的密码?](https://support.huaweicloud.com/cce_faq/cce_faq_00102.md): 在CCE中创建节点时,您选择了使用密钥对或者密码作为登录方式,当密钥对或密码丢失时,您可以登录ECS控制台对节点进行密码重置操作,重置密码后即可使用密码登录CCE服务中的节点。 - [如何收集CCE集群中节点的日志?](https://support.huaweicloud.com/cce_faq/cce_faq_00201.md): CCE节点日志文件如下表所示。您可以方便地使用CCE云原生日志采集插件采集节点日志并上报LTS,从而更好地利用LTS日志服务提供给您的各种日志统计分析等功能。具体操作,请参见通过云原生日志采集插件采集容器日志。 - [如何解决yum update升级操作系统导致的容器隧道网络不可用问题?](https://support.huaweicloud.com/cce_faq/cce_faq_00182.md): CCE控制台不提供针对节点的操作系统升级,也不建议您通过yum方式进行升级。建议您优先通过重置节点的方式升级操作系统。如果您在容器隧道网络集群节点上通过yum update升级了操作系统且重启了节点,会导致容器隧道网络依赖的openvswitch组件不可用。您可以通过如下方式手动恢复:集群节点高危操作 - [Node节点vdb盘受损,通过重置节点仍无法恢复节点?](https://support.huaweicloud.com/cce_faq/cce_faq_00263.md): 客户node节点vdb盘受损,通过重置节点,无法恢复节点。问题过程:在一个正常的node节点上,删除lv,删除vg,节点不可用。重置异常节点,重置过程中,报语法错误,而且节点不可用。如下图:如下图:node节点中vg被删除或者损坏无法识别,为了避免重置的时候误格式化用户的数据盘,需要先手动恢复vg,这样重置的时候就不会去格式化其余的数据盘 - [CCE集群节点中安装kubelet的端口主要有哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00290.md): CCE集群节点中安装kubelet的端口主要有如下几个:10250 –port:kubelet服务与API Server通信的端口。10248 –healthz-port:健康检查服务的端口。10255 –read-only-port:只读端口,用于对外提供监控指标。 - [如何配置Pod使用GPU节点的加速能力?](https://support.huaweicloud.com/cce_faq/cce_faq_00196.md): 我已经购买了GPU节点,但运行速度还是很慢,请问如何配置Pod使用GPU节点的加速能力。方案1:建议您将集群中GPU节点的不可调度的污点去掉,以便GPU插件驱动能够正常安装,同时您需要安装高版本的GPU驱动。如果您的集群中有非GPU的容器,可以通过亲和、反亲和策略将这个容器不调度到GPU节点上。方案2:建议您安装高版本的GPU驱动,通过k - [容器使用SCSI类型云硬盘偶现IO卡住如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00296.md): 容器使用SCSI类型的云硬盘存储,在CentOS节点上创建和删除容器触发磁盘频繁挂载卸载的场景,有概率会出现系统盘读写瞬时冲高,然后系统卡住的问题,影响节点正常工作。出现该问题时,可在dmesg日志中观察到:如下图红框所示:BUS 0上热插PCI设备后,Linux内核会多次遍历挂载在BUS 0上的所有PCI-Bridge,且PCI-Bri - [docker审计日志量过大影响磁盘IO如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00297.md): 部分集群版本的存量节点docker审计日志量较大,由于操作系统内核缺陷,会低概率出现IO卡住。该问题可通过优化审计日志规则,降低问题出现的概率。受影响的集群版本:v1.15.11-r1v.1.17.9-r0只需对已有节点进行修复,新建节点默认无此问题。升级过程需要重启auditd组件。只需对已有节点进行修复,新建节点默认无此问题。升级过程 - [thinpool磁盘空间耗尽导致容器或节点异常时,如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00307.md): 当节点上的thinpool磁盘空间接近写满时,概率性出现以下异常:在容器内创建文件或目录失败、容器内文件系统只读、节点被标记disk-pressure污点及节点不可用状态等。用户可手动在节点上执行docker info查看当前thinpool空间使用及剩余量信息,从而定位该问题。如下图:docker devicemapper模式下,尽管可 - [CCE节点上监听的端口列表](https://support.huaweicloud.com/cce_faq/cce_faq_00323.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [GPU节点使用nvidia驱动启动容器排查思路](https://support.huaweicloud.com/cce_faq/cce_faq_00020.md): 问题现象:节点运行正常且有GPU资源,但报如下失败信息:0/9 nodes are available: 9 insufficient nvidia.com/gpu排查思路:确认节点标签是否已经打上nvidia资源。查看nvidia驱动运行是否正常。到插件运行所在的节点上,查看驱动的安装日志,路径为/opt/cloud/cce/nvidi - [CCE节点NTP时间不同步如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00411.md): 节点上的ntpd在长时间无法连接ntpserver等特殊场景下,可能导致偏移量过大,无法自动恢复。CCE节点故障检测插件(npd)中已包含节点时间同步检查项,您可以在集群中安装该插件进行检测。详情请参见CCE节点故障检测。EulerOS和CentOS类型的节点存在由NTP引起的已知问题,其他类型的节点不涉及该问题。上述问题在v1.19.1 - [Containerd节点业务容器标准输出日志写入过快导致节点数据盘使用率过高](https://support.huaweicloud.com/cce_faq/cce_faq_00421.md): Containerd节点上业务容器标准输出不断写入大量日志,导致/var/lib/containerd目录占用空间不断增长,同时节点上容器创删速度变慢,进一步出现磁盘使用率过高、Pod驱逐、节点异常等现象。对于使用Containerd运行时的节点上业务容器,若日志输出方式采用容器标准输出,其日志转储由节点上kubelet组件完成,除负责业 - [为什么kubectl top命令查看节点内存使用超过100%?](https://support.huaweicloud.com/cce_faq/cce_faq_00426.md): 从界面上看节点内存使用率并不是很高,但使用kubelet top node查看节点内存使用率已超过100%。出现该问题的原因是kubectl top node是调用kubelet的metrics API来获取数据的,因此看到的是节点上已使用的资源总和除以可分配的所有资源。社区issue链接:https://github.com/kuber - [CCE节点事件中一直出现“镜像回收失败”告警如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00439.md): 节点事件中,重复出现“镜像回收失败”告警,告警示例如下:例如上述告警中提到的容器ID(966fce58d9b8)已经停止运行了,但没有完全被删除。kubelet根据imageGCHighThresholdPercent和imageGCLowThresholdPercent两个配置参数定期回收未在使用中的镜像。如果在节点上使用docker或 - [节点磁盘利用率高的问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00499.md): 节点磁盘利用率高,执行df -h命令,输出中存在使用率超过90%的场景:以下原因均可能导致节点磁盘利用率偏高:场景一:磁盘上存在大文件。场景二:由于容器挂载hostPath或者emptyDir的,大量容器数据写入主机导致。场景三:容器自身log日志打印,日志未设置保存天数,导致日志过大。场景一:排查是否存在大文件使用find命令来查找大文 - [节点指标异常,显示磁盘只读或磁盘资源不足,应该如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00506.md): 该问题可能出现以下现象(一种或多种):节点显示指标异常(显示磁盘只读或磁盘资源不足),并被kubelet打上污点导致节点受限调度。在节点磁盘目录中,创建文件或目录失败。挂载节点磁盘子目录的负载运行失败。节点内已有的Pod被驱逐,且状态变为ContainerStatusUnknown。在 Linux 系统中,磁盘资源主要受两个维度限制:物理 - [GPU节点显示GPU卡不可用时,如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00501.md): GPU节点显示GPU卡不可用,且可能原因如下:GPU插件未就绪或状态异常节点驱动未就绪GPU卡异常针对上述问题,建议首先检查驱动程序是否存在问题,随后排查CCE AI套件(NVIDIA GPU)插件的device-plugin组件问题,最后再排查GPU设备问题。具体步骤如下:登录CCE控制台,单击对应集群名称进入集群概览页。在左侧导航栏中 - [CCE AI套件(NVIDIA GPU)插件升级后,GPU节点事件中出现告警如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00502.md): CCE AI套件(NVIDIA GPU)插件升级后,查看GPU节点事件时,存在以下告警信息:告警一:事件名称:XGPUKmodNeedUpgradeK8S事件:GPU serverid: xxx, info: XGPU kmod on node xx.xx.xx.xx needs upgrade事件名称:XGPUKmodNeedUpgra - [节点rpm命令异常处理](https://support.huaweicloud.com/cce_faq/cce_faq_00508.md): 在节点上运行rpm包管理器命令执行失败。某些场景下,rpm数据库的锁文件没有正常清理,系统认为还有一个rpm进程在占用数据库,导致后续所有rpm命令操作都报错。请登录节点检查下列命令的可用性。如果上述命令不可用,您可通过以下命令恢复:如果上述操作无法解决,您可以尝试重置节点解决,详情请参见重置节点。 - [规格配置变更](https://support.huaweicloud.com/cce_faq/cce_faq_00282.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [如何变更CCE集群中的节点规格?](https://support.huaweicloud.com/cce_faq/cce_faq_00030.md): 变更节点规格并非CCE推荐的最佳实践,且存在一些约束与限制,可能会影响您的后续使用,请您仔细阅读。建议您使用新增节点再将原节点缩容的方式,对不满足使用诉求的节点规格进行滚动升级。变更规格后,节点最大实例数(即kubelet的配置参数maxPods)不会自动修改,请确认节点可运行的最大Pod数量满足使用诉求。详情请参见节点可创建的最大Pod - [CCE节点池内的节点变更规格后会有哪些影响?](https://support.huaweicloud.com/cce_faq/cce_faq_00445.md): 在ECS侧变更CCE节点池内节点的规格,前往CCE控制台同步云服务器状态,导致节点规格与节点池中设置的规格不一致。节点变更规格后,由于CPU、内存、网卡配额(可用IP地址)等节点参数发生变化,可能会导致该节点所在的节点池弹性伸缩行为与预期不符。例如,节点进行规格变更后,增加CPU和内存(从2U4G变更4U8G)。节点池扩容时,将根据节点池 - [CCE节点变更规格后,为什么无法重新拉起或创建工作负载?](https://support.huaweicloud.com/cce_faq/cce_faq_00189.md): kubelet启动参数中默认将CPU Manager的策略设置为static,允许为节点上具有某些资源特征的pod赋予增强的CPU亲和性和独占性。用户如果直接在ECS控制台对CCE节点变更规格,会由于变更前后CPU信息不匹配,导致节点上的负载无法重新拉起,也无法创建新负载。更多信息请参见Kubernetes控制节点上的CPU管理策略。开启 - [CCE集群的节点可以更改IP吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00244.md): 不支持修改私网IP:当前CCE的集群中把节点私网IP作为kubernetes node名称,kubernetes node名称不支持修改,修改后会导致节点不可用及容器网络异常等故障,所以不支持更换节点私网IP。支持修改公网IP:节点上的公网IP可以在ECS控制台更换。节点私网IP修改后,会导致节点不可用。这时您需要将节点的私网IP修改回原 - [操作系统问题说明](https://support.huaweicloud.com/cce_faq/cce_faq_00407.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [低版本内核的CentOS节点反复创删应用时偶现cgroup kmem泄露问题](https://support.huaweicloud.com/cce_faq/cce_faq_00408.md): CentOS 7.6节点内核低于3.10.0-1062.12.1.el7.x86_64的场景下(主要为1.17.9版本集群),反复创建应用时出现cgroup kmem泄露,导致节点内存有空余,但是无法创建新的Pod,并提示报错Cannot allocate memory。在反复创建应用时会创建的临时memory cgroup,但在应用删除 - [CCE集群IPVS转发模式下conn_reuse_mode问题说明](https://support.huaweicloud.com/cce_faq/cce_faq_00409.md): 对于节点内核版本小于5.9的场景,CCE集群在IPVS模式下,通过Service方式访问集群内部服务,偶现1秒延时或者后端业务升级后访问Service失败的情况,引起该问题的主要原因为社区IPVS连接复用Bug。IPVS对端口的复用策略主要由内核参数net.ipv4.vs.conn_reuse_mode决定。当net.ipv4.vs.co - [cgroup统计资源异常导致kubelet驱逐Pod](https://support.huaweicloud.com/cce_faq/cce_faq_00318.md): ARM架构节点上,cgroup统计资源异常导致kubelet驱逐Pod,节点无法正常使用。kubelet一直在驱逐pod,把容器全终止之后还是认为内存不足。此时实际资源使用正常。查看/sys/fs/cgroup/memory目录下cgroup的usage_in_bytes统计值有问题,与实际不符。ARM架构节点的EulerOS 2.8和E - [低版本内核的CentOS节点出现容器OOM时,偶现ext4文件系统卡死问题](https://support.huaweicloud.com/cce_faq/cce_faq_00410.md): CentOS 7.6节点内核低于3.10.0-1160.66.1.el7.x86_64的场景下,节点上容器出现OOM后,可能遇到节点上所有容器无法访问,docker、jdb等相关进程处于D状态,节点重启后恢复。业务容器内存使用超过容器的内存限制量时,触发cgroup OOM,被系统内核终止。容器cgroup OOM在CentOS 7会偶现 - [IPVS缺陷导致节点上升级CoreDNS后出现概率性解析超时](https://support.huaweicloud.com/cce_faq/cce_faq_00427.md): 在集群使用IPVS转发的场景下,节点上升级CoreDNS后,可能出现概率性丢包,导致域名解析失败。该问题由IPVS缺陷导致,社区已在IPVS v5.9-rc1版本中修复该问题,详情请参见ipvs: queue delayed work to expire no destination connections if expire_nodes - [节点ARP表项超过限制](https://support.huaweicloud.com/cce_faq/cce_faq_00428.md): ARP缓存超限,容器网络的访问出现异常,例如coredns域名解析概率失败。出现该问题的原因是节点上容器缓存的ARP表项超过限制。在节点操作系统内核为4.3及以上时,dmesg日志中会有显性的打印neighbor table overflow字样。详情请参见社区链接:link。# dmesg -T [Tue May 30 18:35:55 - [EulerOS 2.9内核缺陷导致虚拟机卡住](https://support.huaweicloud.com/cce_faq/cce_faq_00444.md): EulerOS 2.9节点上,由于内核存在调度相关的社区问题,有低概率会触发死锁,表现为虚拟机卡住。x86内核版本:4.18.0-147.5.1.6.h1152.eulerosv2r9.x86_64arm内核版本:4.19.90-vhulk2103.1.0.h1144.eulerosv2r9.aarch64EulerOS 4.18版本内核 - [特定规格的节点使用Ubuntu 22.04镜像可能出现性能下降问题的说明](https://support.huaweicloud.com/cce_faq/cce_faq_00461.md): 部分规格的节点使用Ubuntu 22.04操作系统时,整体性能或特定应用性能可能出现可感知的下降。当前主要涉及如下类型实例规格:通用计算增强型:aC系列规格内存优化型:aM系列规格该类型性能变化的根本原因在于Linux内核社区为修复特定的CPU安全漏洞(Speculative Return Stack Overflow - SRSO,即C - [节点异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00468.md): CCE支持通过NPD插件排查节点异常问题,您也可以参考自主排查流程进行排查。若通过NPD插件排查和自主排查流程都无法解决问题,请提交工单排查。CCE提供节点故障检测NPD插件,NPD插件从1.16.0版本开始增加了大量检查项,能对节点上各种资源和组件的状态检测,帮助发现节点故障。强烈建议您安装该插件,如已安装请查看插件版本并升级到1.16 - [CCE集群新增节点时的问题与排查方法](https://support.huaweicloud.com/cce_faq/cce_faq_00027.md): 新建节点时,数据盘如需分配用户空间,分配目录注意不要设置关键目录,例如:如需放到home下,建议设置为/home/test,不要直接写到/home/下。请注意挂载路径不能设置为根目录“/”,否则将导致挂载失败。挂载路径一般设置为:/opt/xxxx(但不能为/opt/cloud)/mnt/xxxx(但不能为/mnt/paas)/tmp/x - [CCE集群纳管节点时的常见问题及排查方法?](https://support.huaweicloud.com/cce_faq/cce_faq_00097.md): 本文主要介绍纳管/添加已有的ECS实例到CCE集群的常见问题。纳管时,会将所选弹性云服务器的操作系统重置为CCE提供的标准镜像,以确保节点的稳定性,请选择操作系统及重置后的登录方式。所选弹性云服务器挂载的系统盘、数据盘都会在纳管时被格式化,请确保信息已备份。纳管过程中,请勿在弹性云服务器控制台对所选虚拟机做任何操作。纳管节点支持ECS(弹 - [纳管节点时失败,报错“安装节点失败”如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00286.md): 节点纳管失败报错安装节点失败。登录节点,查看/var/paas/sys/log/baseagent/baseagent.log安装日志,发现如下报错:查看节点LVM设置,发现/dev/vdb没有创建LVM逻辑卷。手工创建逻辑卷:然后在界面重置节点后节点状态正常。 - [CCE支持等保三级认证吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00437.md): 云容器引擎CCE服务已通过等保三级认证,您可以在创建节点时进行安全加固,详情请参见如何进行安全加固。但在您使用集群前,还需要充分理解云容器引擎的安全责任边界,华为云无法限制您在服务托管范围外的行为,您需要为这部分的行为承担安全责任。详情请参见责任共担。以下为开启安全加固关键参数设置,其余参数请根据需求设置。在“操作系统”中选择“Huawe - [CCE集群新增节点时的问题与排查方法](https://support.huaweicloud.com/cce_faq/cce_faq_00027.md): 新建节点时,数据盘如需分配用户空间,分配目录注意不要设置关键目录,例如:如需放到home下,建议设置为/home/test,不要直接写到/home/下。请注意挂载路径不能设置为根目录“/”,否则将导致挂载失败。挂载路径一般设置为:/opt/xxxx(但不能为/opt/cloud)/mnt/xxxx(但不能为/mnt/paas)/tmp/x - [CCE集群纳管节点时的常见问题及排查方法?](https://support.huaweicloud.com/cce_faq/cce_faq_00097.md): 本文主要介绍纳管/添加已有的ECS实例到CCE集群的常见问题。纳管时,会将所选弹性云服务器的操作系统重置为CCE提供的标准镜像,以确保节点的稳定性,请选择操作系统及重置后的登录方式。所选弹性云服务器挂载的系统盘、数据盘都会在纳管时被格式化,请确保信息已备份。纳管过程中,请勿在弹性云服务器控制台对所选虚拟机做任何操作。纳管节点支持ECS(弹 - [纳管节点时失败,报错“安装节点失败”如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00286.md): 节点纳管失败报错安装节点失败。登录节点,查看/var/paas/sys/log/baseagent/baseagent.log安装日志,发现如下报错:查看节点LVM设置,发现/dev/vdb没有创建LVM逻辑卷。手工创建逻辑卷:然后在界面重置节点后节点状态正常。 - [CCE支持等保三级认证吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00437.md): 云容器引擎CCE服务已通过等保三级认证,您可以在创建节点时进行安全加固,详情请参见如何进行安全加固。但在您使用集群前,还需要充分理解云容器引擎的安全责任边界,华为云无法限制您在服务托管范围外的行为,您需要为这部分的行为承担安全责任。详情请参见责任共担。以下为开启安全加固关键参数设置,其余参数请根据需求设置。在“操作系统”中选择“Huawe - [集群可用但节点状态为“不可用”如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00120.md): 当集群状态为“可用”,而集群中部分节点状态为“不可用”时,请参照本文提供的排查思路解决。Kubernetes 节点发送的心跳确定每个节点的可用性,并在检测到故障时采取行动。检测的机制和间隔时间详细说明请参见心跳。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因 - [CCE集群中的节点无法远程登录,如何排查解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00118.md): CCE创建节点成功后,无法ssh远程登录。ssh回显提示“所选的用户密钥未在远程主机上注册”,即root用户不能直接登录到节点。出现上述问题的原因是CCE创建的节点安装了cloudinit,有默认的linux用户,并且该密钥也是用于linux。使用linux用户登录,使用sudo su命令切换到root用户。 - [如何重置CCE集群中节点的密码?](https://support.huaweicloud.com/cce_faq/cce_faq_00102.md): 在CCE中创建节点时,您选择了使用密钥对或者密码作为登录方式,当密钥对或密码丢失时,您可以登录ECS控制台对节点进行密码重置操作,重置密码后即可使用密码登录CCE服务中的节点。 - [如何收集CCE集群中节点的日志?](https://support.huaweicloud.com/cce_faq/cce_faq_00201.md): CCE节点日志文件如下表所示。您可以方便地使用CCE云原生日志采集插件采集节点日志并上报LTS,从而更好地利用LTS日志服务提供给您的各种日志统计分析等功能。具体操作,请参见通过云原生日志采集插件采集容器日志。 - [如何解决yum update升级操作系统导致的容器隧道网络不可用问题?](https://support.huaweicloud.com/cce_faq/cce_faq_00182.md): CCE控制台不提供针对节点的操作系统升级,也不建议您通过yum方式进行升级。建议您优先通过重置节点的方式升级操作系统。如果您在容器隧道网络集群节点上通过yum update升级了操作系统且重启了节点,会导致容器隧道网络依赖的openvswitch组件不可用。您可以通过如下方式手动恢复:集群节点高危操作 - [Node节点vdb盘受损,通过重置节点仍无法恢复节点?](https://support.huaweicloud.com/cce_faq/cce_faq_00263.md): 客户node节点vdb盘受损,通过重置节点,无法恢复节点。问题过程:在一个正常的node节点上,删除lv,删除vg,节点不可用。重置异常节点,重置过程中,报语法错误,而且节点不可用。如下图:如下图:node节点中vg被删除或者损坏无法识别,为了避免重置的时候误格式化用户的数据盘,需要先手动恢复vg,这样重置的时候就不会去格式化其余的数据盘 - [CCE集群节点中安装kubelet的端口主要有哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00290.md): CCE集群节点中安装kubelet的端口主要有如下几个:10250 –port:kubelet服务与API Server通信的端口。10248 –healthz-port:健康检查服务的端口。10255 –read-only-port:只读端口,用于对外提供监控指标。 - [如何配置Pod使用GPU节点的加速能力?](https://support.huaweicloud.com/cce_faq/cce_faq_00196.md): 我已经购买了GPU节点,但运行速度还是很慢,请问如何配置Pod使用GPU节点的加速能力。方案1:建议您将集群中GPU节点的不可调度的污点去掉,以便GPU插件驱动能够正常安装,同时您需要安装高版本的GPU驱动。如果您的集群中有非GPU的容器,可以通过亲和、反亲和策略将这个容器不调度到GPU节点上。方案2:建议您安装高版本的GPU驱动,通过k - [容器使用SCSI类型云硬盘偶现IO卡住如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00296.md): 容器使用SCSI类型的云硬盘存储,在CentOS节点上创建和删除容器触发磁盘频繁挂载卸载的场景,有概率会出现系统盘读写瞬时冲高,然后系统卡住的问题,影响节点正常工作。出现该问题时,可在dmesg日志中观察到:如下图红框所示:BUS 0上热插PCI设备后,Linux内核会多次遍历挂载在BUS 0上的所有PCI-Bridge,且PCI-Bri - [docker审计日志量过大影响磁盘IO如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00297.md): 部分集群版本的存量节点docker审计日志量较大,由于操作系统内核缺陷,会低概率出现IO卡住。该问题可通过优化审计日志规则,降低问题出现的概率。受影响的集群版本:v1.15.11-r1v.1.17.9-r0只需对已有节点进行修复,新建节点默认无此问题。升级过程需要重启auditd组件。只需对已有节点进行修复,新建节点默认无此问题。升级过程 - [thinpool磁盘空间耗尽导致容器或节点异常时,如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00307.md): 当节点上的thinpool磁盘空间接近写满时,概率性出现以下异常:在容器内创建文件或目录失败、容器内文件系统只读、节点被标记disk-pressure污点及节点不可用状态等。用户可手动在节点上执行docker info查看当前thinpool空间使用及剩余量信息,从而定位该问题。如下图:docker devicemapper模式下,尽管可 - [CCE节点上监听的端口列表](https://support.huaweicloud.com/cce_faq/cce_faq_00323.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [GPU节点使用nvidia驱动启动容器排查思路](https://support.huaweicloud.com/cce_faq/cce_faq_00020.md): 问题现象:节点运行正常且有GPU资源,但报如下失败信息:0/9 nodes are available: 9 insufficient nvidia.com/gpu排查思路:确认节点标签是否已经打上nvidia资源。查看nvidia驱动运行是否正常。到插件运行所在的节点上,查看驱动的安装日志,路径为/opt/cloud/cce/nvidi - [CCE节点NTP时间不同步如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00411.md): 节点上的ntpd在长时间无法连接ntpserver等特殊场景下,可能导致偏移量过大,无法自动恢复。CCE节点故障检测插件(npd)中已包含节点时间同步检查项,您可以在集群中安装该插件进行检测。详情请参见CCE节点故障检测。EulerOS和CentOS类型的节点存在由NTP引起的已知问题,其他类型的节点不涉及该问题。上述问题在v1.19.1 - [Containerd节点业务容器标准输出日志写入过快导致节点数据盘使用率过高](https://support.huaweicloud.com/cce_faq/cce_faq_00421.md): Containerd节点上业务容器标准输出不断写入大量日志,导致/var/lib/containerd目录占用空间不断增长,同时节点上容器创删速度变慢,进一步出现磁盘使用率过高、Pod驱逐、节点异常等现象。对于使用Containerd运行时的节点上业务容器,若日志输出方式采用容器标准输出,其日志转储由节点上kubelet组件完成,除负责业 - [为什么kubectl top命令查看节点内存使用超过100%?](https://support.huaweicloud.com/cce_faq/cce_faq_00426.md): 从界面上看节点内存使用率并不是很高,但使用kubelet top node查看节点内存使用率已超过100%。出现该问题的原因是kubectl top node是调用kubelet的metrics API来获取数据的,因此看到的是节点上已使用的资源总和除以可分配的所有资源。社区issue链接:https://github.com/kuber - [CCE节点事件中一直出现“镜像回收失败”告警如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00439.md): 节点事件中,重复出现“镜像回收失败”告警,告警示例如下:例如上述告警中提到的容器ID(966fce58d9b8)已经停止运行了,但没有完全被删除。kubelet根据imageGCHighThresholdPercent和imageGCLowThresholdPercent两个配置参数定期回收未在使用中的镜像。如果在节点上使用docker或 - [节点磁盘利用率高的问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00499.md): 节点磁盘利用率高,执行df -h命令,输出中存在使用率超过90%的场景:以下原因均可能导致节点磁盘利用率偏高:场景一:磁盘上存在大文件。场景二:由于容器挂载hostPath或者emptyDir的,大量容器数据写入主机导致。场景三:容器自身log日志打印,日志未设置保存天数,导致日志过大。场景一:排查是否存在大文件使用find命令来查找大文 - [节点指标异常,显示磁盘只读或磁盘资源不足,应该如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00506.md): 该问题可能出现以下现象(一种或多种):节点显示指标异常(显示磁盘只读或磁盘资源不足),并被kubelet打上污点导致节点受限调度。在节点磁盘目录中,创建文件或目录失败。挂载节点磁盘子目录的负载运行失败。节点内已有的Pod被驱逐,且状态变为ContainerStatusUnknown。在 Linux 系统中,磁盘资源主要受两个维度限制:物理 - [GPU节点显示GPU卡不可用时,如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00501.md): GPU节点显示GPU卡不可用,且可能原因如下:GPU插件未就绪或状态异常节点驱动未就绪GPU卡异常针对上述问题,建议首先检查驱动程序是否存在问题,随后排查CCE AI套件(NVIDIA GPU)插件的device-plugin组件问题,最后再排查GPU设备问题。具体步骤如下:登录CCE控制台,单击对应集群名称进入集群概览页。在左侧导航栏中 - [CCE AI套件(NVIDIA GPU)插件升级后,GPU节点事件中出现告警如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00502.md): CCE AI套件(NVIDIA GPU)插件升级后,查看GPU节点事件时,存在以下告警信息:告警一:事件名称:XGPUKmodNeedUpgradeK8S事件:GPU serverid: xxx, info: XGPU kmod on node xx.xx.xx.xx needs upgrade事件名称:XGPUKmodNeedUpgra - [节点rpm命令异常处理](https://support.huaweicloud.com/cce_faq/cce_faq_00508.md): 在节点上运行rpm包管理器命令执行失败。某些场景下,rpm数据库的锁文件没有正常清理,系统认为还有一个rpm进程在占用数据库,导致后续所有rpm命令操作都报错。请登录节点检查下列命令的可用性。如果上述命令不可用,您可通过以下命令恢复:如果上述操作无法解决,您可以尝试重置节点解决,详情请参见重置节点。 - [集群可用但节点状态为“不可用”如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00120.md): 当集群状态为“可用”,而集群中部分节点状态为“不可用”时,请参照本文提供的排查思路解决。Kubernetes 节点发送的心跳确定每个节点的可用性,并在检测到故障时采取行动。检测的机制和间隔时间详细说明请参见心跳。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因 - [CCE集群中的节点无法远程登录,如何排查解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00118.md): CCE创建节点成功后,无法ssh远程登录。ssh回显提示“所选的用户密钥未在远程主机上注册”,即root用户不能直接登录到节点。出现上述问题的原因是CCE创建的节点安装了cloudinit,有默认的linux用户,并且该密钥也是用于linux。使用linux用户登录,使用sudo su命令切换到root用户。 - [如何重置CCE集群中节点的密码?](https://support.huaweicloud.com/cce_faq/cce_faq_00102.md): 在CCE中创建节点时,您选择了使用密钥对或者密码作为登录方式,当密钥对或密码丢失时,您可以登录ECS控制台对节点进行密码重置操作,重置密码后即可使用密码登录CCE服务中的节点。 - [如何收集CCE集群中节点的日志?](https://support.huaweicloud.com/cce_faq/cce_faq_00201.md): CCE节点日志文件如下表所示。您可以方便地使用CCE云原生日志采集插件采集节点日志并上报LTS,从而更好地利用LTS日志服务提供给您的各种日志统计分析等功能。具体操作,请参见通过云原生日志采集插件采集容器日志。 - [如何解决yum update升级操作系统导致的容器隧道网络不可用问题?](https://support.huaweicloud.com/cce_faq/cce_faq_00182.md): CCE控制台不提供针对节点的操作系统升级,也不建议您通过yum方式进行升级。建议您优先通过重置节点的方式升级操作系统。如果您在容器隧道网络集群节点上通过yum update升级了操作系统且重启了节点,会导致容器隧道网络依赖的openvswitch组件不可用。您可以通过如下方式手动恢复:集群节点高危操作 - [Node节点vdb盘受损,通过重置节点仍无法恢复节点?](https://support.huaweicloud.com/cce_faq/cce_faq_00263.md): 客户node节点vdb盘受损,通过重置节点,无法恢复节点。问题过程:在一个正常的node节点上,删除lv,删除vg,节点不可用。重置异常节点,重置过程中,报语法错误,而且节点不可用。如下图:如下图:node节点中vg被删除或者损坏无法识别,为了避免重置的时候误格式化用户的数据盘,需要先手动恢复vg,这样重置的时候就不会去格式化其余的数据盘 - [CCE集群节点中安装kubelet的端口主要有哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00290.md): CCE集群节点中安装kubelet的端口主要有如下几个:10250 –port:kubelet服务与API Server通信的端口。10248 –healthz-port:健康检查服务的端口。10255 –read-only-port:只读端口,用于对外提供监控指标。 - [如何配置Pod使用GPU节点的加速能力?](https://support.huaweicloud.com/cce_faq/cce_faq_00196.md): 我已经购买了GPU节点,但运行速度还是很慢,请问如何配置Pod使用GPU节点的加速能力。方案1:建议您将集群中GPU节点的不可调度的污点去掉,以便GPU插件驱动能够正常安装,同时您需要安装高版本的GPU驱动。如果您的集群中有非GPU的容器,可以通过亲和、反亲和策略将这个容器不调度到GPU节点上。方案2:建议您安装高版本的GPU驱动,通过k - [容器使用SCSI类型云硬盘偶现IO卡住如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00296.md): 容器使用SCSI类型的云硬盘存储,在CentOS节点上创建和删除容器触发磁盘频繁挂载卸载的场景,有概率会出现系统盘读写瞬时冲高,然后系统卡住的问题,影响节点正常工作。出现该问题时,可在dmesg日志中观察到:如下图红框所示:BUS 0上热插PCI设备后,Linux内核会多次遍历挂载在BUS 0上的所有PCI-Bridge,且PCI-Bri - [docker审计日志量过大影响磁盘IO如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00297.md): 部分集群版本的存量节点docker审计日志量较大,由于操作系统内核缺陷,会低概率出现IO卡住。该问题可通过优化审计日志规则,降低问题出现的概率。受影响的集群版本:v1.15.11-r1v.1.17.9-r0只需对已有节点进行修复,新建节点默认无此问题。升级过程需要重启auditd组件。只需对已有节点进行修复,新建节点默认无此问题。升级过程 - [thinpool磁盘空间耗尽导致容器或节点异常时,如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00307.md): 当节点上的thinpool磁盘空间接近写满时,概率性出现以下异常:在容器内创建文件或目录失败、容器内文件系统只读、节点被标记disk-pressure污点及节点不可用状态等。用户可手动在节点上执行docker info查看当前thinpool空间使用及剩余量信息,从而定位该问题。如下图:docker devicemapper模式下,尽管可 - [CCE节点上监听的端口列表](https://support.huaweicloud.com/cce_faq/cce_faq_00323.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [GPU节点使用nvidia驱动启动容器排查思路](https://support.huaweicloud.com/cce_faq/cce_faq_00020.md): 问题现象:节点运行正常且有GPU资源,但报如下失败信息:0/9 nodes are available: 9 insufficient nvidia.com/gpu排查思路:确认节点标签是否已经打上nvidia资源。查看nvidia驱动运行是否正常。到插件运行所在的节点上,查看驱动的安装日志,路径为/opt/cloud/cce/nvidi - [CCE节点NTP时间不同步如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00411.md): 节点上的ntpd在长时间无法连接ntpserver等特殊场景下,可能导致偏移量过大,无法自动恢复。CCE节点故障检测插件(npd)中已包含节点时间同步检查项,您可以在集群中安装该插件进行检测。详情请参见CCE节点故障检测。EulerOS和CentOS类型的节点存在由NTP引起的已知问题,其他类型的节点不涉及该问题。上述问题在v1.19.1 - [Containerd节点业务容器标准输出日志写入过快导致节点数据盘使用率过高](https://support.huaweicloud.com/cce_faq/cce_faq_00421.md): Containerd节点上业务容器标准输出不断写入大量日志,导致/var/lib/containerd目录占用空间不断增长,同时节点上容器创删速度变慢,进一步出现磁盘使用率过高、Pod驱逐、节点异常等现象。对于使用Containerd运行时的节点上业务容器,若日志输出方式采用容器标准输出,其日志转储由节点上kubelet组件完成,除负责业 - [为什么kubectl top命令查看节点内存使用超过100%?](https://support.huaweicloud.com/cce_faq/cce_faq_00426.md): 从界面上看节点内存使用率并不是很高,但使用kubelet top node查看节点内存使用率已超过100%。出现该问题的原因是kubectl top node是调用kubelet的metrics API来获取数据的,因此看到的是节点上已使用的资源总和除以可分配的所有资源。社区issue链接:https://github.com/kuber - [CCE节点事件中一直出现“镜像回收失败”告警如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00439.md): 节点事件中,重复出现“镜像回收失败”告警,告警示例如下:例如上述告警中提到的容器ID(966fce58d9b8)已经停止运行了,但没有完全被删除。kubelet根据imageGCHighThresholdPercent和imageGCLowThresholdPercent两个配置参数定期回收未在使用中的镜像。如果在节点上使用docker或 - [节点磁盘利用率高的问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00499.md): 节点磁盘利用率高,执行df -h命令,输出中存在使用率超过90%的场景:以下原因均可能导致节点磁盘利用率偏高:场景一:磁盘上存在大文件。场景二:由于容器挂载hostPath或者emptyDir的,大量容器数据写入主机导致。场景三:容器自身log日志打印,日志未设置保存天数,导致日志过大。场景一:排查是否存在大文件使用find命令来查找大文 - [节点指标异常,显示磁盘只读或磁盘资源不足,应该如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00506.md): 该问题可能出现以下现象(一种或多种):节点显示指标异常(显示磁盘只读或磁盘资源不足),并被kubelet打上污点导致节点受限调度。在节点磁盘目录中,创建文件或目录失败。挂载节点磁盘子目录的负载运行失败。节点内已有的Pod被驱逐,且状态变为ContainerStatusUnknown。在 Linux 系统中,磁盘资源主要受两个维度限制:物理 - [GPU节点显示GPU卡不可用时,如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00501.md): GPU节点显示GPU卡不可用,且可能原因如下:GPU插件未就绪或状态异常节点驱动未就绪GPU卡异常针对上述问题,建议首先检查驱动程序是否存在问题,随后排查CCE AI套件(NVIDIA GPU)插件的device-plugin组件问题,最后再排查GPU设备问题。具体步骤如下:登录CCE控制台,单击对应集群名称进入集群概览页。在左侧导航栏中 - [CCE AI套件(NVIDIA GPU)插件升级后,GPU节点事件中出现告警如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00502.md): CCE AI套件(NVIDIA GPU)插件升级后,查看GPU节点事件时,存在以下告警信息:告警一:事件名称:XGPUKmodNeedUpgradeK8S事件:GPU serverid: xxx, info: XGPU kmod on node xx.xx.xx.xx needs upgrade事件名称:XGPUKmodNeedUpgra - [节点rpm命令异常处理](https://support.huaweicloud.com/cce_faq/cce_faq_00508.md): 在节点上运行rpm包管理器命令执行失败。某些场景下,rpm数据库的锁文件没有正常清理,系统认为还有一个rpm进程在占用数据库,导致后续所有rpm命令操作都报错。请登录节点检查下列命令的可用性。如果上述命令不可用,您可通过以下命令恢复:如果上述操作无法解决,您可以尝试重置节点解决,详情请参见重置节点。 - [如何变更CCE集群中的节点规格?](https://support.huaweicloud.com/cce_faq/cce_faq_00030.md): 变更节点规格并非CCE推荐的最佳实践,且存在一些约束与限制,可能会影响您的后续使用,请您仔细阅读。建议您使用新增节点再将原节点缩容的方式,对不满足使用诉求的节点规格进行滚动升级。变更规格后,节点最大实例数(即kubelet的配置参数maxPods)不会自动修改,请确认节点可运行的最大Pod数量满足使用诉求。详情请参见节点可创建的最大Pod - [CCE节点池内的节点变更规格后会有哪些影响?](https://support.huaweicloud.com/cce_faq/cce_faq_00445.md): 在ECS侧变更CCE节点池内节点的规格,前往CCE控制台同步云服务器状态,导致节点规格与节点池中设置的规格不一致。节点变更规格后,由于CPU、内存、网卡配额(可用IP地址)等节点参数发生变化,可能会导致该节点所在的节点池弹性伸缩行为与预期不符。例如,节点进行规格变更后,增加CPU和内存(从2U4G变更4U8G)。节点池扩容时,将根据节点池 - [CCE节点变更规格后,为什么无法重新拉起或创建工作负载?](https://support.huaweicloud.com/cce_faq/cce_faq_00189.md): kubelet启动参数中默认将CPU Manager的策略设置为static,允许为节点上具有某些资源特征的pod赋予增强的CPU亲和性和独占性。用户如果直接在ECS控制台对CCE节点变更规格,会由于变更前后CPU信息不匹配,导致节点上的负载无法重新拉起,也无法创建新负载。更多信息请参见Kubernetes控制节点上的CPU管理策略。开启 - [CCE集群的节点可以更改IP吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00244.md): 不支持修改私网IP:当前CCE的集群中把节点私网IP作为kubernetes node名称,kubernetes node名称不支持修改,修改后会导致节点不可用及容器网络异常等故障,所以不支持更换节点私网IP。支持修改公网IP:节点上的公网IP可以在ECS控制台更换。节点私网IP修改后,会导致节点不可用。这时您需要将节点的私网IP修改回原 - [如何变更CCE集群中的节点规格?](https://support.huaweicloud.com/cce_faq/cce_faq_00030.md): 变更节点规格并非CCE推荐的最佳实践,且存在一些约束与限制,可能会影响您的后续使用,请您仔细阅读。建议您使用新增节点再将原节点缩容的方式,对不满足使用诉求的节点规格进行滚动升级。变更规格后,节点最大实例数(即kubelet的配置参数maxPods)不会自动修改,请确认节点可运行的最大Pod数量满足使用诉求。详情请参见节点可创建的最大Pod - [CCE节点池内的节点变更规格后会有哪些影响?](https://support.huaweicloud.com/cce_faq/cce_faq_00445.md): 在ECS侧变更CCE节点池内节点的规格,前往CCE控制台同步云服务器状态,导致节点规格与节点池中设置的规格不一致。节点变更规格后,由于CPU、内存、网卡配额(可用IP地址)等节点参数发生变化,可能会导致该节点所在的节点池弹性伸缩行为与预期不符。例如,节点进行规格变更后,增加CPU和内存(从2U4G变更4U8G)。节点池扩容时,将根据节点池 - [CCE节点变更规格后,为什么无法重新拉起或创建工作负载?](https://support.huaweicloud.com/cce_faq/cce_faq_00189.md): kubelet启动参数中默认将CPU Manager的策略设置为static,允许为节点上具有某些资源特征的pod赋予增强的CPU亲和性和独占性。用户如果直接在ECS控制台对CCE节点变更规格,会由于变更前后CPU信息不匹配,导致节点上的负载无法重新拉起,也无法创建新负载。更多信息请参见Kubernetes控制节点上的CPU管理策略。开启 - [CCE集群的节点可以更改IP吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00244.md): 不支持修改私网IP:当前CCE的集群中把节点私网IP作为kubernetes node名称,kubernetes node名称不支持修改,修改后会导致节点不可用及容器网络异常等故障,所以不支持更换节点私网IP。支持修改公网IP:节点上的公网IP可以在ECS控制台更换。节点私网IP修改后,会导致节点不可用。这时您需要将节点的私网IP修改回原 - [低版本内核的CentOS节点反复创删应用时偶现cgroup kmem泄露问题](https://support.huaweicloud.com/cce_faq/cce_faq_00408.md): CentOS 7.6节点内核低于3.10.0-1062.12.1.el7.x86_64的场景下(主要为1.17.9版本集群),反复创建应用时出现cgroup kmem泄露,导致节点内存有空余,但是无法创建新的Pod,并提示报错Cannot allocate memory。在反复创建应用时会创建的临时memory cgroup,但在应用删除 - [CCE集群IPVS转发模式下conn_reuse_mode问题说明](https://support.huaweicloud.com/cce_faq/cce_faq_00409.md): 对于节点内核版本小于5.9的场景,CCE集群在IPVS模式下,通过Service方式访问集群内部服务,偶现1秒延时或者后端业务升级后访问Service失败的情况,引起该问题的主要原因为社区IPVS连接复用Bug。IPVS对端口的复用策略主要由内核参数net.ipv4.vs.conn_reuse_mode决定。当net.ipv4.vs.co - [cgroup统计资源异常导致kubelet驱逐Pod](https://support.huaweicloud.com/cce_faq/cce_faq_00318.md): ARM架构节点上,cgroup统计资源异常导致kubelet驱逐Pod,节点无法正常使用。kubelet一直在驱逐pod,把容器全终止之后还是认为内存不足。此时实际资源使用正常。查看/sys/fs/cgroup/memory目录下cgroup的usage_in_bytes统计值有问题,与实际不符。ARM架构节点的EulerOS 2.8和E - [低版本内核的CentOS节点出现容器OOM时,偶现ext4文件系统卡死问题](https://support.huaweicloud.com/cce_faq/cce_faq_00410.md): CentOS 7.6节点内核低于3.10.0-1160.66.1.el7.x86_64的场景下,节点上容器出现OOM后,可能遇到节点上所有容器无法访问,docker、jdb等相关进程处于D状态,节点重启后恢复。业务容器内存使用超过容器的内存限制量时,触发cgroup OOM,被系统内核终止。容器cgroup OOM在CentOS 7会偶现 - [IPVS缺陷导致节点上升级CoreDNS后出现概率性解析超时](https://support.huaweicloud.com/cce_faq/cce_faq_00427.md): 在集群使用IPVS转发的场景下,节点上升级CoreDNS后,可能出现概率性丢包,导致域名解析失败。该问题由IPVS缺陷导致,社区已在IPVS v5.9-rc1版本中修复该问题,详情请参见ipvs: queue delayed work to expire no destination connections if expire_nodes - [节点ARP表项超过限制](https://support.huaweicloud.com/cce_faq/cce_faq_00428.md): ARP缓存超限,容器网络的访问出现异常,例如coredns域名解析概率失败。出现该问题的原因是节点上容器缓存的ARP表项超过限制。在节点操作系统内核为4.3及以上时,dmesg日志中会有显性的打印neighbor table overflow字样。详情请参见社区链接:link。# dmesg -T [Tue May 30 18:35:55 - [EulerOS 2.9内核缺陷导致虚拟机卡住](https://support.huaweicloud.com/cce_faq/cce_faq_00444.md): EulerOS 2.9节点上,由于内核存在调度相关的社区问题,有低概率会触发死锁,表现为虚拟机卡住。x86内核版本:4.18.0-147.5.1.6.h1152.eulerosv2r9.x86_64arm内核版本:4.19.90-vhulk2103.1.0.h1144.eulerosv2r9.aarch64EulerOS 4.18版本内核 - [特定规格的节点使用Ubuntu 22.04镜像可能出现性能下降问题的说明](https://support.huaweicloud.com/cce_faq/cce_faq_00461.md): 部分规格的节点使用Ubuntu 22.04操作系统时,整体性能或特定应用性能可能出现可感知的下降。当前主要涉及如下类型实例规格:通用计算增强型:aC系列规格内存优化型:aM系列规格该类型性能变化的根本原因在于Linux内核社区为修复特定的CPU安全漏洞(Speculative Return Stack Overflow - SRSO,即C - [低版本内核的CentOS节点反复创删应用时偶现cgroup kmem泄露问题](https://support.huaweicloud.com/cce_faq/cce_faq_00408.md): CentOS 7.6节点内核低于3.10.0-1062.12.1.el7.x86_64的场景下(主要为1.17.9版本集群),反复创建应用时出现cgroup kmem泄露,导致节点内存有空余,但是无法创建新的Pod,并提示报错Cannot allocate memory。在反复创建应用时会创建的临时memory cgroup,但在应用删除 - [CCE集群IPVS转发模式下conn_reuse_mode问题说明](https://support.huaweicloud.com/cce_faq/cce_faq_00409.md): 对于节点内核版本小于5.9的场景,CCE集群在IPVS模式下,通过Service方式访问集群内部服务,偶现1秒延时或者后端业务升级后访问Service失败的情况,引起该问题的主要原因为社区IPVS连接复用Bug。IPVS对端口的复用策略主要由内核参数net.ipv4.vs.conn_reuse_mode决定。当net.ipv4.vs.co - [cgroup统计资源异常导致kubelet驱逐Pod](https://support.huaweicloud.com/cce_faq/cce_faq_00318.md): ARM架构节点上,cgroup统计资源异常导致kubelet驱逐Pod,节点无法正常使用。kubelet一直在驱逐pod,把容器全终止之后还是认为内存不足。此时实际资源使用正常。查看/sys/fs/cgroup/memory目录下cgroup的usage_in_bytes统计值有问题,与实际不符。ARM架构节点的EulerOS 2.8和E - [低版本内核的CentOS节点出现容器OOM时,偶现ext4文件系统卡死问题](https://support.huaweicloud.com/cce_faq/cce_faq_00410.md): CentOS 7.6节点内核低于3.10.0-1160.66.1.el7.x86_64的场景下,节点上容器出现OOM后,可能遇到节点上所有容器无法访问,docker、jdb等相关进程处于D状态,节点重启后恢复。业务容器内存使用超过容器的内存限制量时,触发cgroup OOM,被系统内核终止。容器cgroup OOM在CentOS 7会偶现 - [IPVS缺陷导致节点上升级CoreDNS后出现概率性解析超时](https://support.huaweicloud.com/cce_faq/cce_faq_00427.md): 在集群使用IPVS转发的场景下,节点上升级CoreDNS后,可能出现概率性丢包,导致域名解析失败。该问题由IPVS缺陷导致,社区已在IPVS v5.9-rc1版本中修复该问题,详情请参见ipvs: queue delayed work to expire no destination connections if expire_nodes - [节点ARP表项超过限制](https://support.huaweicloud.com/cce_faq/cce_faq_00428.md): ARP缓存超限,容器网络的访问出现异常,例如coredns域名解析概率失败。出现该问题的原因是节点上容器缓存的ARP表项超过限制。在节点操作系统内核为4.3及以上时,dmesg日志中会有显性的打印neighbor table overflow字样。详情请参见社区链接:link。# dmesg -T [Tue May 30 18:35:55 - [EulerOS 2.9内核缺陷导致虚拟机卡住](https://support.huaweicloud.com/cce_faq/cce_faq_00444.md): EulerOS 2.9节点上,由于内核存在调度相关的社区问题,有低概率会触发死锁,表现为虚拟机卡住。x86内核版本:4.18.0-147.5.1.6.h1152.eulerosv2r9.x86_64arm内核版本:4.19.90-vhulk2103.1.0.h1144.eulerosv2r9.aarch64EulerOS 4.18版本内核 - [特定规格的节点使用Ubuntu 22.04镜像可能出现性能下降问题的说明](https://support.huaweicloud.com/cce_faq/cce_faq_00461.md): 部分规格的节点使用Ubuntu 22.04操作系统时,整体性能或特定应用性能可能出现可感知的下降。当前主要涉及如下类型实例规格:通用计算增强型:aC系列规格内存优化型:aM系列规格该类型性能变化的根本原因在于Linux内核社区为修复特定的CPU安全漏洞(Speculative Return Stack Overflow - SRSO,即C - [节点池异常状态排查](https://support.huaweicloud.com/cce_faq/cce_faq_00440.md): 请根据具体节点池异常状态确定具体问题原因,如表1所示。 - [节点池一直在扩容中但“操作记录”里为何没有创建节点的记录?](https://support.huaweicloud.com/cce_faq/cce_faq_00127.md): 节点池的状态一直处于“扩容中”,但是“操作记录”里面没有看到有对应创建节点的记录。检查如下问题并修复:租户是否欠费。查看节点池配置的规格是否资源不足。租户的ECS或内存配额是否不足。如果一次创建节点太多,可能会出现租户的ECS容量校验不过的情况发生。若租户已经欠费,请尽快续费。若ECS节点资源不足,使用其他规格节点替代。若ECS或内存配额 - [节点池扩容失败](https://support.huaweicloud.com/cce_faq/cce_faq_00432.md): 请根据节点池扩容失败的具体事件信息确定问题原因,如表1所示。报错信息中包含以下信息:表示当前选择的节点规格不可用,导致节点无法创建。解决方案:报错信息中包含以下信息:表示当前选择的EVS云硬盘规格不可用,导致节点无法创建。解决方案:当扩容节点池失败时,事件中包含Ecs.0314错误,表明无法查询到节点池使用的密钥对,导致创建云服务器失败。 - [节点池批量扩缩容节点时,Kubernetes Event事件存在部分缺失](https://support.huaweicloud.com/cce_faq/cce_faq_00434.md): 节点池批量扩缩容节点时,Kubernetes Event事件存在部分缺失。例如,集群中批量缩容10个节点,CCE打印了10次“删除节点”事件,但是Kubernetes仅打印了4次“缩容空闲节点启动”的Event事件。出现该问题的原因是Kubernetes在处理Event事件时,为了后端服务etcd的可用性,会对事件进行限流、聚合、计数的预 - [云服务器无法纳管至节点池时如何修改云服务器配置](https://support.huaweicloud.com/cce_faq/cce_faq_00443.md): 云服务器纳管至节点池时,由于以下原因导致无法纳管,您可通过修改配置进行纳管。待纳管云服务器规格需修改成节点池中包含的规格。更多操作指导请参见ECS变更规格通用操作。待纳管的云服务器所在VPC和子网需修改成节点池相同的VPC和子网。更多操作指导请参见ECS切换虚拟私有云。虚拟私有云:选择需要切换的VPC。子网:选择需要切换的子网。私有IP地 - [节点池自动扩缩容失效问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00505.md): 集群存在多个不可用节点,CCE集群弹性引擎插件自动扩缩容失效,影响新容器调度。在集群K8s事件中,cluster-autoscaler-status的ConfigMap将会出现ClusterUnhealthy事件。当不可用节点数量超过ok-total-unready-count(默认值:3),并且占比超过max-total-unready - [节点池在自动扩容过程中再次触发扩容](https://support.huaweicloud.com/cce_faq/cce_faq_00515.md): 如果集群中同时存在多种不同规格的未调度Pod,Autoscaler扩容时可能因资源碎片原因导致过度扩容,具体表现为Autoscaler会先触发一次节点扩容,但在节点创建的过程中再次触发扩容。这是由于Autoscaler扩容计算时的算法与调度器的实际行为存在差异:首次扩容:在首次扩容时,Autoscaler采用贪心的策略,计算出的节点数是理 - [节点池异常状态排查](https://support.huaweicloud.com/cce_faq/cce_faq_00440.md): 请根据具体节点池异常状态确定具体问题原因,如表1所示。 - [节点池一直在扩容中但“操作记录”里为何没有创建节点的记录?](https://support.huaweicloud.com/cce_faq/cce_faq_00127.md): 节点池的状态一直处于“扩容中”,但是“操作记录”里面没有看到有对应创建节点的记录。检查如下问题并修复:租户是否欠费。查看节点池配置的规格是否资源不足。租户的ECS或内存配额是否不足。如果一次创建节点太多,可能会出现租户的ECS容量校验不过的情况发生。若租户已经欠费,请尽快续费。若ECS节点资源不足,使用其他规格节点替代。若ECS或内存配额 - [节点池扩容失败](https://support.huaweicloud.com/cce_faq/cce_faq_00432.md): 请根据节点池扩容失败的具体事件信息确定问题原因,如表1所示。报错信息中包含以下信息:表示当前选择的节点规格不可用,导致节点无法创建。解决方案:报错信息中包含以下信息:表示当前选择的EVS云硬盘规格不可用,导致节点无法创建。解决方案:当扩容节点池失败时,事件中包含Ecs.0314错误,表明无法查询到节点池使用的密钥对,导致创建云服务器失败。 - [节点池批量扩缩容节点时,Kubernetes Event事件存在部分缺失](https://support.huaweicloud.com/cce_faq/cce_faq_00434.md): 节点池批量扩缩容节点时,Kubernetes Event事件存在部分缺失。例如,集群中批量缩容10个节点,CCE打印了10次“删除节点”事件,但是Kubernetes仅打印了4次“缩容空闲节点启动”的Event事件。出现该问题的原因是Kubernetes在处理Event事件时,为了后端服务etcd的可用性,会对事件进行限流、聚合、计数的预 - [云服务器无法纳管至节点池时如何修改云服务器配置](https://support.huaweicloud.com/cce_faq/cce_faq_00443.md): 云服务器纳管至节点池时,由于以下原因导致无法纳管,您可通过修改配置进行纳管。待纳管云服务器规格需修改成节点池中包含的规格。更多操作指导请参见ECS变更规格通用操作。待纳管的云服务器所在VPC和子网需修改成节点池相同的VPC和子网。更多操作指导请参见ECS切换虚拟私有云。虚拟私有云:选择需要切换的VPC。子网:选择需要切换的子网。私有IP地 - [节点池自动扩缩容失效问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00505.md): 集群存在多个不可用节点,CCE集群弹性引擎插件自动扩缩容失效,影响新容器调度。在集群K8s事件中,cluster-autoscaler-status的ConfigMap将会出现ClusterUnhealthy事件。当不可用节点数量超过ok-total-unready-count(默认值:3),并且占比超过max-total-unready - [节点池在自动扩容过程中再次触发扩容](https://support.huaweicloud.com/cce_faq/cce_faq_00515.md): 如果集群中同时存在多种不同规格的未调度Pod,Autoscaler扩容时可能因资源碎片原因导致过度扩容,具体表现为Autoscaler会先触发一次节点扩容,但在节点创建的过程中再次触发扩容。这是由于Autoscaler扩容计算时的算法与调度器的实际行为存在差异:首次扩容:在首次扩容时,Autoscaler采用贪心的策略,计算出的节点数是理 - [工作负载异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00029.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [工作负载状态异常定位方法](https://support.huaweicloud.com/cce_faq/cce_faq_00134.md): 工作负载状态异常时,建议先查看Pod的事件以便于确定导致异常的初步原因,再针对性解决问题。如果工作负载状态为“未就绪”,重点排查Pod异常,参见第二步:排查Pod异常(定位负载异常的核心根源)。如果工作负载状态为“处理中”,一般为过程中的状态,请耐心等待。若长时间未恢复,可按“未就绪”排查。如果工作负载状态为“运行中”,一般无需处理。如果 - [工作负载异常:实例调度失败](https://support.huaweicloud.com/cce_faq/cce_faq_00098.md): 当Pod状态为Pending,事件中出现实例调度失败的信息时,可根据具体事件信息确定具体问题原因。事件查看方法请参见工作负载状态异常定位方法。根据具体事件信息确定具体问题原因,如表1所示。登录CCE控制台,检查节点状态是否为可用。或使用如下命令查看节点状态是否为Ready。如果状态都为不可用(Not Ready),则说明集群中无可用节点。 - [工作负载异常:实例拉取镜像失败](https://support.huaweicloud.com/cce_faq/cce_faq_00015.md): 当工作负载状态显示实例未就绪:Back-off pulling image "xxxxx",该状态下工作负载实例K8s事件名称为实例拉取镜像失败或重新拉取镜像失败。查看K8s事件的方法请参见查看Pod事件。根据具体事件信息确定具体问题原因,如表1所示。当工作负载状态异常并显示“实例拉取镜像失败”的K8s事件时,请排查yaml文件中是否存在 - [工作负载异常:启动容器失败](https://support.huaweicloud.com/cce_faq/cce_faq_00018.md): 工作负载详情中,若事件中提示启动容器失败,请按照如下方式来初步排查原因:如果节点为docker,请执行docker命令:如果节点为containerd,请执行containerd命令:crictl ps -a | grep$podName如果节点为docker,请执行docker命令:如果节点为containerd,请执行containe - [工作负载异常:实例驱逐异常(Evicted)](https://support.huaweicloud.com/cce_faq/cce_faq_00209.md): 当节点出现异常时,为了保证工作负载的可用性,Kubernetes会通过驱逐机制(Eviction)将该节点上的Pod调离异常节点。目前Kubernetes中存在两种Eviction机制,分别由kube-controller-manager和kubelet实现。kube-controller-manager实现的驱逐kube-control - [工作负载异常:存储卷无法挂载或挂载超时](https://support.huaweicloud.com/cce_faq/cce_faq_00200.md): EVS存储卷挂载异常SFS Turbo存储卷挂载异常SFS存储卷挂载异常存储卷挂载超时如果您挂载的存储中内容太多,同时又配置了以下几条配置,最终会由于逐个修改文件权限,而导致挂载时间过长。问题定位:Securitycontext字段中是否包含runAsuser/fsGroup。securityContext是kubernetes中的字段, - [工作负载异常:一直处于创建中](https://support.huaweicloud.com/cce_faq/cce_faq_00140.md): 节点上的工作负载一直处于创建中。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。排查项一:cce-pause镜像是否被误删除排查项二:集群开启CPU管理策略后变更节点规格问题现象创建工作负载时报如下错误,显示无法创建san - [工作负载异常:Pod一直处于Terminating状态](https://support.huaweicloud.com/cce_faq/cce_faq_00210.md): 查询某个命名空间下的工作负载时,偶现部分Pod(实例)一直处于Terminating 状态。例如,查询aos命名空间下的Pod:通过kubectl delete pods -n 命令始终无法将其删除:Pod出现Terminating 状态的原因可能有多种,以下是一些常见的情况:节点异常:在节点处于 - [工作负载异常:已停止](https://support.huaweicloud.com/cce_faq/cce_faq_00012.md): 工作负载的状态为已停止。工作负载的yaml的中metadata.enable字段为false,导致工作负载被停止,Pod被删除导致工作负载处于已停止状态,如下图所示:将enable字段删除或者将false修改为true。 - [工作负载异常:GPU节点部署服务时报错](https://support.huaweicloud.com/cce_faq/cce_faq_00109.md): 在CCE集群的GPU节点上部署服务出现如下问题:容器无法查看显存。部署了7个GPU服务,有2个是能正常访问的,其他启动时都有报错。2个是能正常访问的CUDA版本分别是10.1和10.0其他服务CUDA版本也在这2个范围内2个是能正常访问的CUDA版本分别是10.1和10.0其他服务CUDA版本也在这2个范围内在GPU服务容器中发现一些新增 - [工作负载异常:添加存储失败](https://support.huaweicloud.com/cce_faq/cce_faq_00433.md): 实例一直处于创建中,事件中存在“添加存储失败”的告警,事件信息如下所示:该告警事件说明节点上绑定的云硬盘已达上限,挂载云硬盘的工作负载实例调度到该节点后,无法继续挂载云硬盘,导致工作负载无法正常运行。例如,假设节点可挂载的云硬盘上限为20,除去节点上已挂载的1块系统盘和1块数据盘后,节点剩余可挂载的云硬盘数量为18块。若该节点通过ECS控 - [工作负载异常:实例无法写入数据](https://support.huaweicloud.com/cce_faq/cce_faq_00302.md): Pod所在的节点文件系统损坏,新建的Pod无法成功在/var/lib/kubelet/device-plugins/.xxxxx写入数据,Pod通常会出现以下类似事件:此类异常Pod仅为异常记录,并不实际占用系统资源。导致文件系统异常的原因有很多,例如物理控制节点的异常开关机。此类异常Pod并不影响正常业务,当系统文件未能恢复,出现大量异 - [工作负载异常:Init容器启动失败](https://support.huaweicloud.com/cce_faq/cce_faq_00469.md): Pod的状态为Init:N/M。Pod的状态为Init:Error。Pod的状态为Init:CrashLoopBackOff。Pod运行状态为Init:N/M,说明该Pod包含M个Init容器,其中N个已经启动完成,但仍有M-N个Init容器未启动成功。Pod运行状态为Init:Error,说明Pod中的Init容器启动失败。Pod运行状 - [工作负载异常:OOM问题](https://support.huaweicloud.com/cce_faq/cce_faq_00470.md): 若因OOM被终止的进程为容器的阻塞进程,可能会导致容器异常重启。容器不允许使用超过其限制的内存,超过后容器可能会被终止,触发OOM(Out Of Memory)事件,导致容器异常退出。关于OOM事件,可以参考为容器和Pod分配内存资源。登录CCE控制台。单击集群名称进入集群,在左侧选择“工作负载”。单击工作负载操作列的“监控”,即可查看P - [工作负载状态正常但未正常工作](https://support.huaweicloud.com/cce_faq/cce_faq_00471.md): Pod已经处于Running状态(查看Pod状态)但未正常工作,或者访问结果不符合预期。可能是您的部署描述YAML文件(例如 Pod、Deployment、StatefulSet等)存在错误。例如:镜像版本未更新。您可能未使用正确的镜像版本,或者是旧版镜像和新版镜像重名均为latest版本,而节点上已存在旧版镜像,但工作负载的imageP - [挂载文件存储的节点,Pod创建删除卡死](https://support.huaweicloud.com/cce_faq/cce_faq_00312.md): 在挂载文件存储(SFS或SFS Turbo)的节点上,删除Pod卡在“结束中”,创建Pod卡在“创建中”。后端文件存储被删除,导致无法访问挂载点。节点与文件存储间网络异常,导致无法访问挂载点。findmnt挂载点路径示例:/mnt/paas/kubernetes/kubelet/pods/7b88feaf-71d6-4e6f-8965-f - [容器异常退出状态码](https://support.huaweicloud.com/cce_faq/cce_faq_00404.md): 当容器启动失败或终止时,K8s事件中将会打印容器异常退出状态码(Exit Code)来报告容器异常的原因。本文将介绍如何通过事件中打印的Exit Code进一步定位容器异常的根本原因。您可使用kubectl连接集群,并通过以下命令查询Pod详细状态:在返回结果中的Exit Code字段即为程序上次退出时的状态码,该值不为0即表示程序异常退 - [Java容器内存虚高以及OOM问题定位](https://support.huaweicloud.com/cce_faq/cce_faq_00480.md): Java堆内存(Heap Memory)是Java虚拟机(JVM)管理的主要内存区域,但将Java堆内存限制参数Xmx并不能当作进程内存限制参数使用,将容器内存限制设置为和Xmx一样大,可能会导致OOM。除了堆内存,JVM还管理其他类型的内存,Java进程的内存占用情况可以简略总结为下图:Java应用程序的内存使用情况包括JVM内存和非J - [集群中大量Pod处于UnexpectedAdmissionError状态怎么办](https://support.huaweicloud.com/cce_faq/cce_faq_00496.md): 查询集群中的Pod时,发现大量Pod实例处于UnexpectedAdmissionError状态。例如,执行kubectl get pod -A时,回显结果如下:NAME READY STATUS RESTARTS A - [Pod实例异常,显示无法找到设备文件](https://support.huaweicloud.com/cce_faq/cce_faq_00500.md): Pod实例创建失败,报错信息如下:同时,执行以下命令,查看PCIE总线的数量。当回显结果小于预期数目时,可以判断发生了PCIE断链。昇腾Snt9设备发生PCIE断链后,设备驱动未能上报准确的掉卡信息,导致任务仍被调度至断链的卡。您可以执行以下命令,进一步验证PCIE是否断链:回显结果如下:由NPU ID可知,昇腾Snt9设备中的第4张丢失 - [容器设置](https://support.huaweicloud.com/cce_faq/cce_faq_00095.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [在什么场景下设置工作负载生命周期中的“停止前处理”?](https://support.huaweicloud.com/cce_faq/cce_faq_00159.md): 问题描述:在什么场景下设置工作负载生命周期中的“停止前处理”?问题解答:服务的业务处理时间较长,在升级时,需要先等Pod中的业务处理完,才能kill该Pod,以保证业务不中断的场景。 - [在什么场景下,容器会被重建?](https://support.huaweicloud.com/cce_faq/cce_faq_00472.md): 在什么场景下,容器会被重建?容器重建是指容器被销毁并重新创建一个新实例。容器重建可能由多种原因触发,以下是一些常见的场景:使用数据存储(如挂载云硬盘、文件系统等)可以有效解决容器重建导致的数据丢失问题,确保重要数据实现持久化存储并能够在容器重建后继续使用。 - [在同一个命名空间内访问指定容器的FQDN是什么?](https://support.huaweicloud.com/cce_faq/cce_faq_00261.md): 客户询问在创建负载时指定部署的容器名称、pod名称、namespace名称,在同一个命名空间内访问该容器的FQDN是什么?全限定域名:FQDN,即Fully Qualified Domain Name,同时带有主机名和域名的名称。(通过符号“.”)例如:主机名是bigserver,域名是mycompany.com,那么FQDN就是:big - [健康检查探针(Liveness、Readiness)偶现检查失败?](https://support.huaweicloud.com/cce_faq/cce_faq_00255.md): 健康检查探针偶现检测失败,是由于容器内的业务故障所导致,您需要优先定位自身业务问题。常见情况有:业务处理时间长,导致返回超时。tomcat建链和等待耗费时间太长(连接数、线程数等),导致返回超时。容器所在节点,磁盘IO等性能达到瓶颈,导致业务处理超时。 - [如何设置容器umask值?](https://support.huaweicloud.com/cce_faq/cce_faq_00230.md): tailf /dev/null的方式启动容器,然后手动执行启动脚本的方式得到的目录的权限是700,而不加tailf由Kubernetes自行启动的方式得到的目录权限却是751。这个问题是因为两种方式设置的umask值不一样,所以创建出来的目录权限不相同。umask值用于为用户新创建的文件和目录设置缺省权限。如果umask的值设置过小,会使 - [CCE启动实例失败时的重试机制是怎样的?](https://support.huaweicloud.com/cce_faq/cce_faq_00004.md): CCE是基于原生Kubernetes的云容器引擎服务,完全兼容Kubernetes社区原生版本,与社区最新版本保持紧密同步,完全兼容Kubernetes API和Kubectl。在Kubernetes中,Pod的spec中包含一个restartPolicy字段,其取值包括:Always、OnFailure和Never,默认值为:Alway - [监控日志](https://support.huaweicloud.com/cce_faq/cce_faq_00283.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [工作负载的“事件”保存多长时间?](https://support.huaweicloud.com/cce_faq/cce_faq_00212.md): 在1.7.3-r12、1.9.2-r3及以上版本的集群中,工作负载的“事件”信息保存时间为1个小时,1小时后自动清除数据。在1.7.3-r12之前更老的集群版本中,保存时间为24小时。 - [容器监控的内存使用率与实际弹性伸缩现象不一致](https://support.huaweicloud.com/cce_faq/cce_faq_00454.md): 容器监控的内存使用率与实际弹性伸缩现象不一致,例如容器内存使用率在界面上显示为40%左右,而HPA设置缩容阈值为70%,但界面上显示的内存使用率低于HPA阈值后并没有发生缩容。界面上显示的容器内存使用率与HPA弹性伸缩的内存使用率在计算方式上存在差异:界面上显示的容器内存使用率计算方式为:container_memory_rss/内存Li - [调度策略](https://support.huaweicloud.com/cce_faq/cce_faq_00284.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [如何让多个Pod均匀部署到各个节点上?](https://support.huaweicloud.com/cce_faq/cce_faq_00260.md): 在Kubernetes中,如果需要让多个Pod均匀部署到各个节点,可以通过配置调度策略控制kube-scheduler的决策,结合Pod亲和性、Pod拓扑分布约束等机制实现。方案一:使用Pod反亲和性分散Pod:该方案适用于粗略分散,本质是将Pod分散至不同的拓扑域,但无法精确控制每个域有多少个Pod,不能严格意义上实现均分。例如,在节点 - [如何避免节点上的某个容器被驱逐?](https://support.huaweicloud.com/cce_faq/cce_faq_00262.md): 在工作负载调度时可能会发生一个节点上的两个容器之间互相争资源的情况,最终导致kubelet将其全部驱逐。那么能不能设定策略让其中一个服务一直保留?如何设定?Kubelet会按照下面的标准对Pod的驱逐行为进行评判:根据服务质量:即BestEffort、Burstable、Guaranteed。根据Pod调度请求的被耗尽资源的消耗量。接下来 - [为什么Pod在节点不是均匀分布?](https://support.huaweicloud.com/cce_faq/cce_faq_00314.md): Kubernetes中kube-scheduler组件负责Pod的调度,对每一个新创建的 Pod 或者是未被调度的 Pod,kube-scheduler 会选择一个最优的节点去运行这个 Pod。kube-scheduler 给一个 Pod 做调度选择包含过滤和打分两个步骤。过滤阶段会将所有满足 Pod 调度需求的节点选出来,在打分阶段 k - [如何驱逐节点上的所有Pod?](https://support.huaweicloud.com/cce_faq/cce_faq_00326.md): 您可使用kubectl drain命令从节点安全地逐出所有Pod。默认情况下,kubectl drain命令会保留某些系统级Pod不被驱逐,例如everest-csi-driver。驱逐前该节点上的Pod如下:如果节点上存在绑定了本地存储的Pod或是一些守护进程集管理的Pod,将提示“error: unable to drain node - [如何查看Pod是否使用CPU绑核?](https://support.huaweicloud.com/cce_faq/cce_faq_00414.md): 以4U8G节点为例,并提前在集群中部署一个CPU request为1,limit为2的工作负载。回显如下:policyName字段值为static代表策略设置成功。{pod uid}为Pod UID,可在已通过kubectl连接集群的机器上使用以下命令获取:kubectl get po {pod name} -n {namespace} - [节点关机后Pod不重新调度](https://support.huaweicloud.com/cce_faq/cce_faq_00415.md): 节点关机后,节点上的Pod仍然显示running状态。通过kubectl describe pod 命令查询Pod最新事件为:节点关机后,系统会自动给节点添加污点,比如:node.kubernetes.io/unreachable:NoExecutenode.cloudprovider.kubernetes.io/sh - [如何避免非GPU/NPU负载调度到GPU/NPU节点?](https://support.huaweicloud.com/cce_faq/cce_faq_00422.md): 当集群中存在GPU/NPU节点和普通节点混合使用的场景时,普通工作负载也可以调度到GPU/NPU节点上,可能出现GPU/NPU资源未充分利用的情况。由于GPU/NPU节点同样提供CPU、内存资源,在一般情况下,即使工作负载未声明使用GPU/NPU资源,调度器也会根据打分机制将工作负载调度到GPU/NPU节点运行,于是可能会出现GPU/NP - [为什么Pod调度不到某个节点上?](https://support.huaweicloud.com/cce_faq/cce_faq_00293.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [修改kubelet参数导致已驱逐的Pod被重新调度](https://support.huaweicloud.com/cce_faq/cce_faq_00481.md): 如果节点存在Memory/Disk/PID Pressure的情况,节点会被添加系统污点。此时修改节点池kubelet组件配置参数或者重启节点kubelet后,该污点会被临时删除,可能会导致由于节点资源压力而触发驱逐的节点重新加入调度器计算流程中,Pod重新调度到该节点上,如果节点资源压力未缓解,之后节点会再次进入驱逐流程。当前kubel - [根据GPU/NPU卡信息定位使用该卡的Pod](https://support.huaweicloud.com/cce_faq/cce_faq_00482.md): 在CCE中使用GPU/NPU卡时,无法直接获取到使用该卡的Pod。您可以根据GPU/NPU卡的信息,通过kubectl命令行操作筛选Pod,以便在GPU/NPU卡故障时能够及时将Pod驱逐。已创建CCE集群,且配置了kubectl命令行工具。详细操作可参考通过kubectl连接集群。集群上安装了CCE AI套件(GPU/NPU),可参考C - [节点标签更新导致的Pod容器退出问题](https://support.huaweicloud.com/cce_faq/cce_faq_00487.md): 工作负载通过节点标签调度到节点运行后,如果更新节点标签,然后修改节点的kubelet配置参数导致kubelet组件重启。kubelet组件重启后约30s,查看工作负载状态,会出现异常事件Predicate NodeAffinity failed,原Pod状态变成Completed,并且新Pod将会重新调度。如果不存在其他符合指定标签的节点 - [创建使用GPU虚拟化多卡均分调度功能的工作负载之后,大量Pod执行失败](https://support.huaweicloud.com/cce_faq/cce_faq_00497.md): 创建使用GPU虚拟化多卡均分调度功能的工作负载之后,大量的GPU Pod执行失败。具体示例如下:回显结果如下:使用GPU虚拟化多卡均分调度功能,集群版本与CCE AI套件(NVIDIA GPU)插件版本需要适配,具体如下:插件版本在2.1.41及以上时:集群版本在1.27.16-r20、1.28.15-r10、1.29.10-r10、1. - [其他](https://support.huaweicloud.com/cce_faq/cce_faq_00186.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [定时任务停止一段时间后,为何无法重新启动?](https://support.huaweicloud.com/cce_faq/cce_faq_00213.md): 定时任务在运行过程中,如果被暂停,再次被开启时,控制器会检查上一次调度的时间点到现在所错过了调度次数。如果错过的调度次数超过100次, 那么它就不会启动这个任务并记录这个错误,详情请参考CronJob限制。例如,假设一个CronJob被设置为从08:30:00开始每隔1分钟创建一个新的Job,且startingDeadlineSecond - [创建有状态负载时,实例间发现服务是指什么?](https://support.huaweicloud.com/cce_faq/cce_faq_00289.md): 云容器引擎的实例间发现服务,在原生Kubernetes中称之为Headless Service。Headless Service也是一种Service,但是会在YAML中定义spec.clusterIP: None,也就是不需要Cluster IP的Service。普通Service:一个Service可能对应多个EndPoint(Pod - [CCE容器拉取私有镜像时报错“Auth is empty”](https://support.huaweicloud.com/cce_faq/cce_faq_00106.md): 在CCE的控制台界面中为已经创建的工作负载更换镜像,选择我上传的镜像,容器在拉取镜像时报错“Auth is empty, only accept X-Auth-Token or Authorization”。您可以通过CCE控制台界面选择私有镜像创建应用,此时CCE会自动带上该secret,升级时不会出现该问题。您通过API创建应用时,在 - [CCE集群中工作负载镜像的拉取策略有哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00199.md): 容器在启动运行前,需要镜像。镜像的存储位置可能会在本地,也可能会在远程镜像仓库中。Kubernetes配置文件中的imagePullPolicy属性是用于描述镜像的拉取策略的,如下:Always:总是拉取镜像。imagePullPolicy: AlwaysIfNotPresent:本地有则使用本地镜像,不拉取。imagePullPolic - [鲲鹏集群Docker容器挂载点被卸载](https://support.huaweicloud.com/cce_faq/cce_faq_00317.md): 鲲鹏集群Docker容器挂载点被卸载。鲲鹏集群节点为EulerOS 2.8系统时,如果在Docker服务文件中配置了MountFlags=shared字段,会因为systemd特性的原因导致容器挂载点被卸载。修改Docker服务文件,删除MountFlags=shared字段,重启Docker。vi /usr/lib/systemd/sy - [下载镜像缺少层如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00319.md): 在使用containerd容器运行时场景下,拉取镜像到节点时,概率性缺少镜像层,导致工作负载容器创建失败。docker v1.10 之前支持mediaType 为 application/octet-stream 的layer,而containerd不支持application/octet-stream,导致没有拉取。有如下两种方式可解决 - [容器内的文件权限和用户都是问号](https://support.huaweicloud.com/cce_faq/cce_faq_0393.md): 节点操作系统为CentOS 7.6或EulerOS 2.5时,如果使用“Debian GNU/Linux 11 (bullseye)”内核为基础镜像的容器,会出现容器内的文件权限和用户异常。容器内文件权限及用户异常。CCE提供以下两种解决方案,您可根据实际情况选取:建议业务容器的基础镜像使用Debian 9或者Debian 10。建议节点 - [如何导出容器中的文件?](https://support.huaweicloud.com/cce_faq/cce_faq_00495.md): 在开发和生产环境中,可能存在很多场景需要将容器中的文件导出到宿主机,例如导出日志文件进行分析、导出配置文件进行备份、导出构建产物等等。本文将为您介绍如何将容器中的文件导出。您可以使用kubectl cp命令导出容器中的文件。假设您的Pod名为pod_name,位于default命名空间中,要从Pod的/path/to/file路径复制文件 - [工作负载状态异常定位方法](https://support.huaweicloud.com/cce_faq/cce_faq_00134.md): 工作负载状态异常时,建议先查看Pod的事件以便于确定导致异常的初步原因,再针对性解决问题。如果工作负载状态为“未就绪”,重点排查Pod异常,参见第二步:排查Pod异常(定位负载异常的核心根源)。如果工作负载状态为“处理中”,一般为过程中的状态,请耐心等待。若长时间未恢复,可按“未就绪”排查。如果工作负载状态为“运行中”,一般无需处理。如果 - [工作负载异常:实例调度失败](https://support.huaweicloud.com/cce_faq/cce_faq_00098.md): 当Pod状态为Pending,事件中出现实例调度失败的信息时,可根据具体事件信息确定具体问题原因。事件查看方法请参见工作负载状态异常定位方法。根据具体事件信息确定具体问题原因,如表1所示。登录CCE控制台,检查节点状态是否为可用。或使用如下命令查看节点状态是否为Ready。如果状态都为不可用(Not Ready),则说明集群中无可用节点。 - [工作负载异常:实例拉取镜像失败](https://support.huaweicloud.com/cce_faq/cce_faq_00015.md): 当工作负载状态显示实例未就绪:Back-off pulling image "xxxxx",该状态下工作负载实例K8s事件名称为实例拉取镜像失败或重新拉取镜像失败。查看K8s事件的方法请参见查看Pod事件。根据具体事件信息确定具体问题原因,如表1所示。当工作负载状态异常并显示“实例拉取镜像失败”的K8s事件时,请排查yaml文件中是否存在 - [工作负载异常:启动容器失败](https://support.huaweicloud.com/cce_faq/cce_faq_00018.md): 工作负载详情中,若事件中提示启动容器失败,请按照如下方式来初步排查原因:如果节点为docker,请执行docker命令:如果节点为containerd,请执行containerd命令:crictl ps -a | grep$podName如果节点为docker,请执行docker命令:如果节点为containerd,请执行containe - [工作负载异常:实例驱逐异常(Evicted)](https://support.huaweicloud.com/cce_faq/cce_faq_00209.md): 当节点出现异常时,为了保证工作负载的可用性,Kubernetes会通过驱逐机制(Eviction)将该节点上的Pod调离异常节点。目前Kubernetes中存在两种Eviction机制,分别由kube-controller-manager和kubelet实现。kube-controller-manager实现的驱逐kube-control - [工作负载异常:存储卷无法挂载或挂载超时](https://support.huaweicloud.com/cce_faq/cce_faq_00200.md): EVS存储卷挂载异常SFS Turbo存储卷挂载异常SFS存储卷挂载异常存储卷挂载超时如果您挂载的存储中内容太多,同时又配置了以下几条配置,最终会由于逐个修改文件权限,而导致挂载时间过长。问题定位:Securitycontext字段中是否包含runAsuser/fsGroup。securityContext是kubernetes中的字段, - [工作负载异常:一直处于创建中](https://support.huaweicloud.com/cce_faq/cce_faq_00140.md): 节点上的工作负载一直处于创建中。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。排查项一:cce-pause镜像是否被误删除排查项二:集群开启CPU管理策略后变更节点规格问题现象创建工作负载时报如下错误,显示无法创建san - [工作负载异常:Pod一直处于Terminating状态](https://support.huaweicloud.com/cce_faq/cce_faq_00210.md): 查询某个命名空间下的工作负载时,偶现部分Pod(实例)一直处于Terminating 状态。例如,查询aos命名空间下的Pod:通过kubectl delete pods -n 命令始终无法将其删除:Pod出现Terminating 状态的原因可能有多种,以下是一些常见的情况:节点异常:在节点处于 - [工作负载异常:已停止](https://support.huaweicloud.com/cce_faq/cce_faq_00012.md): 工作负载的状态为已停止。工作负载的yaml的中metadata.enable字段为false,导致工作负载被停止,Pod被删除导致工作负载处于已停止状态,如下图所示:将enable字段删除或者将false修改为true。 - [工作负载异常:GPU节点部署服务时报错](https://support.huaweicloud.com/cce_faq/cce_faq_00109.md): 在CCE集群的GPU节点上部署服务出现如下问题:容器无法查看显存。部署了7个GPU服务,有2个是能正常访问的,其他启动时都有报错。2个是能正常访问的CUDA版本分别是10.1和10.0其他服务CUDA版本也在这2个范围内2个是能正常访问的CUDA版本分别是10.1和10.0其他服务CUDA版本也在这2个范围内在GPU服务容器中发现一些新增 - [工作负载异常:添加存储失败](https://support.huaweicloud.com/cce_faq/cce_faq_00433.md): 实例一直处于创建中,事件中存在“添加存储失败”的告警,事件信息如下所示:该告警事件说明节点上绑定的云硬盘已达上限,挂载云硬盘的工作负载实例调度到该节点后,无法继续挂载云硬盘,导致工作负载无法正常运行。例如,假设节点可挂载的云硬盘上限为20,除去节点上已挂载的1块系统盘和1块数据盘后,节点剩余可挂载的云硬盘数量为18块。若该节点通过ECS控 - [工作负载异常:实例无法写入数据](https://support.huaweicloud.com/cce_faq/cce_faq_00302.md): Pod所在的节点文件系统损坏,新建的Pod无法成功在/var/lib/kubelet/device-plugins/.xxxxx写入数据,Pod通常会出现以下类似事件:此类异常Pod仅为异常记录,并不实际占用系统资源。导致文件系统异常的原因有很多,例如物理控制节点的异常开关机。此类异常Pod并不影响正常业务,当系统文件未能恢复,出现大量异 - [工作负载异常:Init容器启动失败](https://support.huaweicloud.com/cce_faq/cce_faq_00469.md): Pod的状态为Init:N/M。Pod的状态为Init:Error。Pod的状态为Init:CrashLoopBackOff。Pod运行状态为Init:N/M,说明该Pod包含M个Init容器,其中N个已经启动完成,但仍有M-N个Init容器未启动成功。Pod运行状态为Init:Error,说明Pod中的Init容器启动失败。Pod运行状 - [工作负载异常:OOM问题](https://support.huaweicloud.com/cce_faq/cce_faq_00470.md): 若因OOM被终止的进程为容器的阻塞进程,可能会导致容器异常重启。容器不允许使用超过其限制的内存,超过后容器可能会被终止,触发OOM(Out Of Memory)事件,导致容器异常退出。关于OOM事件,可以参考为容器和Pod分配内存资源。登录CCE控制台。单击集群名称进入集群,在左侧选择“工作负载”。单击工作负载操作列的“监控”,即可查看P - [工作负载状态正常但未正常工作](https://support.huaweicloud.com/cce_faq/cce_faq_00471.md): Pod已经处于Running状态(查看Pod状态)但未正常工作,或者访问结果不符合预期。可能是您的部署描述YAML文件(例如 Pod、Deployment、StatefulSet等)存在错误。例如:镜像版本未更新。您可能未使用正确的镜像版本,或者是旧版镜像和新版镜像重名均为latest版本,而节点上已存在旧版镜像,但工作负载的imageP - [挂载文件存储的节点,Pod创建删除卡死](https://support.huaweicloud.com/cce_faq/cce_faq_00312.md): 在挂载文件存储(SFS或SFS Turbo)的节点上,删除Pod卡在“结束中”,创建Pod卡在“创建中”。后端文件存储被删除,导致无法访问挂载点。节点与文件存储间网络异常,导致无法访问挂载点。findmnt挂载点路径示例:/mnt/paas/kubernetes/kubelet/pods/7b88feaf-71d6-4e6f-8965-f - [容器异常退出状态码](https://support.huaweicloud.com/cce_faq/cce_faq_00404.md): 当容器启动失败或终止时,K8s事件中将会打印容器异常退出状态码(Exit Code)来报告容器异常的原因。本文将介绍如何通过事件中打印的Exit Code进一步定位容器异常的根本原因。您可使用kubectl连接集群,并通过以下命令查询Pod详细状态:在返回结果中的Exit Code字段即为程序上次退出时的状态码,该值不为0即表示程序异常退 - [Java容器内存虚高以及OOM问题定位](https://support.huaweicloud.com/cce_faq/cce_faq_00480.md): Java堆内存(Heap Memory)是Java虚拟机(JVM)管理的主要内存区域,但将Java堆内存限制参数Xmx并不能当作进程内存限制参数使用,将容器内存限制设置为和Xmx一样大,可能会导致OOM。除了堆内存,JVM还管理其他类型的内存,Java进程的内存占用情况可以简略总结为下图:Java应用程序的内存使用情况包括JVM内存和非J - [集群中大量Pod处于UnexpectedAdmissionError状态怎么办](https://support.huaweicloud.com/cce_faq/cce_faq_00496.md): 查询集群中的Pod时,发现大量Pod实例处于UnexpectedAdmissionError状态。例如,执行kubectl get pod -A时,回显结果如下:NAME READY STATUS RESTARTS A - [Pod实例异常,显示无法找到设备文件](https://support.huaweicloud.com/cce_faq/cce_faq_00500.md): Pod实例创建失败,报错信息如下:同时,执行以下命令,查看PCIE总线的数量。当回显结果小于预期数目时,可以判断发生了PCIE断链。昇腾Snt9设备发生PCIE断链后,设备驱动未能上报准确的掉卡信息,导致任务仍被调度至断链的卡。您可以执行以下命令,进一步验证PCIE是否断链:回显结果如下:由NPU ID可知,昇腾Snt9设备中的第4张丢失 - [工作负载状态异常定位方法](https://support.huaweicloud.com/cce_faq/cce_faq_00134.md): 工作负载状态异常时,建议先查看Pod的事件以便于确定导致异常的初步原因,再针对性解决问题。如果工作负载状态为“未就绪”,重点排查Pod异常,参见第二步:排查Pod异常(定位负载异常的核心根源)。如果工作负载状态为“处理中”,一般为过程中的状态,请耐心等待。若长时间未恢复,可按“未就绪”排查。如果工作负载状态为“运行中”,一般无需处理。如果 - [工作负载异常:实例调度失败](https://support.huaweicloud.com/cce_faq/cce_faq_00098.md): 当Pod状态为Pending,事件中出现实例调度失败的信息时,可根据具体事件信息确定具体问题原因。事件查看方法请参见工作负载状态异常定位方法。根据具体事件信息确定具体问题原因,如表1所示。登录CCE控制台,检查节点状态是否为可用。或使用如下命令查看节点状态是否为Ready。如果状态都为不可用(Not Ready),则说明集群中无可用节点。 - [工作负载异常:实例拉取镜像失败](https://support.huaweicloud.com/cce_faq/cce_faq_00015.md): 当工作负载状态显示实例未就绪:Back-off pulling image "xxxxx",该状态下工作负载实例K8s事件名称为实例拉取镜像失败或重新拉取镜像失败。查看K8s事件的方法请参见查看Pod事件。根据具体事件信息确定具体问题原因,如表1所示。当工作负载状态异常并显示“实例拉取镜像失败”的K8s事件时,请排查yaml文件中是否存在 - [工作负载异常:启动容器失败](https://support.huaweicloud.com/cce_faq/cce_faq_00018.md): 工作负载详情中,若事件中提示启动容器失败,请按照如下方式来初步排查原因:如果节点为docker,请执行docker命令:如果节点为containerd,请执行containerd命令:crictl ps -a | grep$podName如果节点为docker,请执行docker命令:如果节点为containerd,请执行containe - [工作负载异常:实例驱逐异常(Evicted)](https://support.huaweicloud.com/cce_faq/cce_faq_00209.md): 当节点出现异常时,为了保证工作负载的可用性,Kubernetes会通过驱逐机制(Eviction)将该节点上的Pod调离异常节点。目前Kubernetes中存在两种Eviction机制,分别由kube-controller-manager和kubelet实现。kube-controller-manager实现的驱逐kube-control - [工作负载异常:存储卷无法挂载或挂载超时](https://support.huaweicloud.com/cce_faq/cce_faq_00200.md): EVS存储卷挂载异常SFS Turbo存储卷挂载异常SFS存储卷挂载异常存储卷挂载超时如果您挂载的存储中内容太多,同时又配置了以下几条配置,最终会由于逐个修改文件权限,而导致挂载时间过长。问题定位:Securitycontext字段中是否包含runAsuser/fsGroup。securityContext是kubernetes中的字段, - [工作负载异常:一直处于创建中](https://support.huaweicloud.com/cce_faq/cce_faq_00140.md): 节点上的工作负载一直处于创建中。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。排查项一:cce-pause镜像是否被误删除排查项二:集群开启CPU管理策略后变更节点规格问题现象创建工作负载时报如下错误,显示无法创建san - [工作负载异常:Pod一直处于Terminating状态](https://support.huaweicloud.com/cce_faq/cce_faq_00210.md): 查询某个命名空间下的工作负载时,偶现部分Pod(实例)一直处于Terminating 状态。例如,查询aos命名空间下的Pod:通过kubectl delete pods -n 命令始终无法将其删除:Pod出现Terminating 状态的原因可能有多种,以下是一些常见的情况:节点异常:在节点处于 - [工作负载异常:已停止](https://support.huaweicloud.com/cce_faq/cce_faq_00012.md): 工作负载的状态为已停止。工作负载的yaml的中metadata.enable字段为false,导致工作负载被停止,Pod被删除导致工作负载处于已停止状态,如下图所示:将enable字段删除或者将false修改为true。 - [工作负载异常:GPU节点部署服务时报错](https://support.huaweicloud.com/cce_faq/cce_faq_00109.md): 在CCE集群的GPU节点上部署服务出现如下问题:容器无法查看显存。部署了7个GPU服务,有2个是能正常访问的,其他启动时都有报错。2个是能正常访问的CUDA版本分别是10.1和10.0其他服务CUDA版本也在这2个范围内2个是能正常访问的CUDA版本分别是10.1和10.0其他服务CUDA版本也在这2个范围内在GPU服务容器中发现一些新增 - [工作负载异常:添加存储失败](https://support.huaweicloud.com/cce_faq/cce_faq_00433.md): 实例一直处于创建中,事件中存在“添加存储失败”的告警,事件信息如下所示:该告警事件说明节点上绑定的云硬盘已达上限,挂载云硬盘的工作负载实例调度到该节点后,无法继续挂载云硬盘,导致工作负载无法正常运行。例如,假设节点可挂载的云硬盘上限为20,除去节点上已挂载的1块系统盘和1块数据盘后,节点剩余可挂载的云硬盘数量为18块。若该节点通过ECS控 - [工作负载异常:实例无法写入数据](https://support.huaweicloud.com/cce_faq/cce_faq_00302.md): Pod所在的节点文件系统损坏,新建的Pod无法成功在/var/lib/kubelet/device-plugins/.xxxxx写入数据,Pod通常会出现以下类似事件:此类异常Pod仅为异常记录,并不实际占用系统资源。导致文件系统异常的原因有很多,例如物理控制节点的异常开关机。此类异常Pod并不影响正常业务,当系统文件未能恢复,出现大量异 - [工作负载异常:Init容器启动失败](https://support.huaweicloud.com/cce_faq/cce_faq_00469.md): Pod的状态为Init:N/M。Pod的状态为Init:Error。Pod的状态为Init:CrashLoopBackOff。Pod运行状态为Init:N/M,说明该Pod包含M个Init容器,其中N个已经启动完成,但仍有M-N个Init容器未启动成功。Pod运行状态为Init:Error,说明Pod中的Init容器启动失败。Pod运行状 - [工作负载异常:OOM问题](https://support.huaweicloud.com/cce_faq/cce_faq_00470.md): 若因OOM被终止的进程为容器的阻塞进程,可能会导致容器异常重启。容器不允许使用超过其限制的内存,超过后容器可能会被终止,触发OOM(Out Of Memory)事件,导致容器异常退出。关于OOM事件,可以参考为容器和Pod分配内存资源。登录CCE控制台。单击集群名称进入集群,在左侧选择“工作负载”。单击工作负载操作列的“监控”,即可查看P - [工作负载状态正常但未正常工作](https://support.huaweicloud.com/cce_faq/cce_faq_00471.md): Pod已经处于Running状态(查看Pod状态)但未正常工作,或者访问结果不符合预期。可能是您的部署描述YAML文件(例如 Pod、Deployment、StatefulSet等)存在错误。例如:镜像版本未更新。您可能未使用正确的镜像版本,或者是旧版镜像和新版镜像重名均为latest版本,而节点上已存在旧版镜像,但工作负载的imageP - [挂载文件存储的节点,Pod创建删除卡死](https://support.huaweicloud.com/cce_faq/cce_faq_00312.md): 在挂载文件存储(SFS或SFS Turbo)的节点上,删除Pod卡在“结束中”,创建Pod卡在“创建中”。后端文件存储被删除,导致无法访问挂载点。节点与文件存储间网络异常,导致无法访问挂载点。findmnt挂载点路径示例:/mnt/paas/kubernetes/kubelet/pods/7b88feaf-71d6-4e6f-8965-f - [容器异常退出状态码](https://support.huaweicloud.com/cce_faq/cce_faq_00404.md): 当容器启动失败或终止时,K8s事件中将会打印容器异常退出状态码(Exit Code)来报告容器异常的原因。本文将介绍如何通过事件中打印的Exit Code进一步定位容器异常的根本原因。您可使用kubectl连接集群,并通过以下命令查询Pod详细状态:在返回结果中的Exit Code字段即为程序上次退出时的状态码,该值不为0即表示程序异常退 - [Java容器内存虚高以及OOM问题定位](https://support.huaweicloud.com/cce_faq/cce_faq_00480.md): Java堆内存(Heap Memory)是Java虚拟机(JVM)管理的主要内存区域,但将Java堆内存限制参数Xmx并不能当作进程内存限制参数使用,将容器内存限制设置为和Xmx一样大,可能会导致OOM。除了堆内存,JVM还管理其他类型的内存,Java进程的内存占用情况可以简略总结为下图:Java应用程序的内存使用情况包括JVM内存和非J - [集群中大量Pod处于UnexpectedAdmissionError状态怎么办](https://support.huaweicloud.com/cce_faq/cce_faq_00496.md): 查询集群中的Pod时,发现大量Pod实例处于UnexpectedAdmissionError状态。例如,执行kubectl get pod -A时,回显结果如下:NAME READY STATUS RESTARTS A - [Pod实例异常,显示无法找到设备文件](https://support.huaweicloud.com/cce_faq/cce_faq_00500.md): Pod实例创建失败,报错信息如下:同时,执行以下命令,查看PCIE总线的数量。当回显结果小于预期数目时,可以判断发生了PCIE断链。昇腾Snt9设备发生PCIE断链后,设备驱动未能上报准确的掉卡信息,导致任务仍被调度至断链的卡。您可以执行以下命令,进一步验证PCIE是否断链:回显结果如下:由NPU ID可知,昇腾Snt9设备中的第4张丢失 - [在什么场景下设置工作负载生命周期中的“停止前处理”?](https://support.huaweicloud.com/cce_faq/cce_faq_00159.md): 问题描述:在什么场景下设置工作负载生命周期中的“停止前处理”?问题解答:服务的业务处理时间较长,在升级时,需要先等Pod中的业务处理完,才能kill该Pod,以保证业务不中断的场景。 - [在什么场景下,容器会被重建?](https://support.huaweicloud.com/cce_faq/cce_faq_00472.md): 在什么场景下,容器会被重建?容器重建是指容器被销毁并重新创建一个新实例。容器重建可能由多种原因触发,以下是一些常见的场景:使用数据存储(如挂载云硬盘、文件系统等)可以有效解决容器重建导致的数据丢失问题,确保重要数据实现持久化存储并能够在容器重建后继续使用。 - [在同一个命名空间内访问指定容器的FQDN是什么?](https://support.huaweicloud.com/cce_faq/cce_faq_00261.md): 客户询问在创建负载时指定部署的容器名称、pod名称、namespace名称,在同一个命名空间内访问该容器的FQDN是什么?全限定域名:FQDN,即Fully Qualified Domain Name,同时带有主机名和域名的名称。(通过符号“.”)例如:主机名是bigserver,域名是mycompany.com,那么FQDN就是:big - [健康检查探针(Liveness、Readiness)偶现检查失败?](https://support.huaweicloud.com/cce_faq/cce_faq_00255.md): 健康检查探针偶现检测失败,是由于容器内的业务故障所导致,您需要优先定位自身业务问题。常见情况有:业务处理时间长,导致返回超时。tomcat建链和等待耗费时间太长(连接数、线程数等),导致返回超时。容器所在节点,磁盘IO等性能达到瓶颈,导致业务处理超时。 - [如何设置容器umask值?](https://support.huaweicloud.com/cce_faq/cce_faq_00230.md): tailf /dev/null的方式启动容器,然后手动执行启动脚本的方式得到的目录的权限是700,而不加tailf由Kubernetes自行启动的方式得到的目录权限却是751。这个问题是因为两种方式设置的umask值不一样,所以创建出来的目录权限不相同。umask值用于为用户新创建的文件和目录设置缺省权限。如果umask的值设置过小,会使 - [CCE启动实例失败时的重试机制是怎样的?](https://support.huaweicloud.com/cce_faq/cce_faq_00004.md): CCE是基于原生Kubernetes的云容器引擎服务,完全兼容Kubernetes社区原生版本,与社区最新版本保持紧密同步,完全兼容Kubernetes API和Kubectl。在Kubernetes中,Pod的spec中包含一个restartPolicy字段,其取值包括:Always、OnFailure和Never,默认值为:Alway - [在什么场景下设置工作负载生命周期中的“停止前处理”?](https://support.huaweicloud.com/cce_faq/cce_faq_00159.md): 问题描述:在什么场景下设置工作负载生命周期中的“停止前处理”?问题解答:服务的业务处理时间较长,在升级时,需要先等Pod中的业务处理完,才能kill该Pod,以保证业务不中断的场景。 - [在什么场景下,容器会被重建?](https://support.huaweicloud.com/cce_faq/cce_faq_00472.md): 在什么场景下,容器会被重建?容器重建是指容器被销毁并重新创建一个新实例。容器重建可能由多种原因触发,以下是一些常见的场景:使用数据存储(如挂载云硬盘、文件系统等)可以有效解决容器重建导致的数据丢失问题,确保重要数据实现持久化存储并能够在容器重建后继续使用。 - [在同一个命名空间内访问指定容器的FQDN是什么?](https://support.huaweicloud.com/cce_faq/cce_faq_00261.md): 客户询问在创建负载时指定部署的容器名称、pod名称、namespace名称,在同一个命名空间内访问该容器的FQDN是什么?全限定域名:FQDN,即Fully Qualified Domain Name,同时带有主机名和域名的名称。(通过符号“.”)例如:主机名是bigserver,域名是mycompany.com,那么FQDN就是:big - [健康检查探针(Liveness、Readiness)偶现检查失败?](https://support.huaweicloud.com/cce_faq/cce_faq_00255.md): 健康检查探针偶现检测失败,是由于容器内的业务故障所导致,您需要优先定位自身业务问题。常见情况有:业务处理时间长,导致返回超时。tomcat建链和等待耗费时间太长(连接数、线程数等),导致返回超时。容器所在节点,磁盘IO等性能达到瓶颈,导致业务处理超时。 - [如何设置容器umask值?](https://support.huaweicloud.com/cce_faq/cce_faq_00230.md): tailf /dev/null的方式启动容器,然后手动执行启动脚本的方式得到的目录的权限是700,而不加tailf由Kubernetes自行启动的方式得到的目录权限却是751。这个问题是因为两种方式设置的umask值不一样,所以创建出来的目录权限不相同。umask值用于为用户新创建的文件和目录设置缺省权限。如果umask的值设置过小,会使 - [CCE启动实例失败时的重试机制是怎样的?](https://support.huaweicloud.com/cce_faq/cce_faq_00004.md): CCE是基于原生Kubernetes的云容器引擎服务,完全兼容Kubernetes社区原生版本,与社区最新版本保持紧密同步,完全兼容Kubernetes API和Kubectl。在Kubernetes中,Pod的spec中包含一个restartPolicy字段,其取值包括:Always、OnFailure和Never,默认值为:Alway - [工作负载的“事件”保存多长时间?](https://support.huaweicloud.com/cce_faq/cce_faq_00212.md): 在1.7.3-r12、1.9.2-r3及以上版本的集群中,工作负载的“事件”信息保存时间为1个小时,1小时后自动清除数据。在1.7.3-r12之前更老的集群版本中,保存时间为24小时。 - [容器监控的内存使用率与实际弹性伸缩现象不一致](https://support.huaweicloud.com/cce_faq/cce_faq_00454.md): 容器监控的内存使用率与实际弹性伸缩现象不一致,例如容器内存使用率在界面上显示为40%左右,而HPA设置缩容阈值为70%,但界面上显示的内存使用率低于HPA阈值后并没有发生缩容。界面上显示的容器内存使用率与HPA弹性伸缩的内存使用率在计算方式上存在差异:界面上显示的容器内存使用率计算方式为:container_memory_rss/内存Li - [工作负载的“事件”保存多长时间?](https://support.huaweicloud.com/cce_faq/cce_faq_00212.md): 在1.7.3-r12、1.9.2-r3及以上版本的集群中,工作负载的“事件”信息保存时间为1个小时,1小时后自动清除数据。在1.7.3-r12之前更老的集群版本中,保存时间为24小时。 - [容器监控的内存使用率与实际弹性伸缩现象不一致](https://support.huaweicloud.com/cce_faq/cce_faq_00454.md): 容器监控的内存使用率与实际弹性伸缩现象不一致,例如容器内存使用率在界面上显示为40%左右,而HPA设置缩容阈值为70%,但界面上显示的内存使用率低于HPA阈值后并没有发生缩容。界面上显示的容器内存使用率与HPA弹性伸缩的内存使用率在计算方式上存在差异:界面上显示的容器内存使用率计算方式为:container_memory_rss/内存Li - [如何让多个Pod均匀部署到各个节点上?](https://support.huaweicloud.com/cce_faq/cce_faq_00260.md): 在Kubernetes中,如果需要让多个Pod均匀部署到各个节点,可以通过配置调度策略控制kube-scheduler的决策,结合Pod亲和性、Pod拓扑分布约束等机制实现。方案一:使用Pod反亲和性分散Pod:该方案适用于粗略分散,本质是将Pod分散至不同的拓扑域,但无法精确控制每个域有多少个Pod,不能严格意义上实现均分。例如,在节点 - [如何避免节点上的某个容器被驱逐?](https://support.huaweicloud.com/cce_faq/cce_faq_00262.md): 在工作负载调度时可能会发生一个节点上的两个容器之间互相争资源的情况,最终导致kubelet将其全部驱逐。那么能不能设定策略让其中一个服务一直保留?如何设定?Kubelet会按照下面的标准对Pod的驱逐行为进行评判:根据服务质量:即BestEffort、Burstable、Guaranteed。根据Pod调度请求的被耗尽资源的消耗量。接下来 - [为什么Pod在节点不是均匀分布?](https://support.huaweicloud.com/cce_faq/cce_faq_00314.md): Kubernetes中kube-scheduler组件负责Pod的调度,对每一个新创建的 Pod 或者是未被调度的 Pod,kube-scheduler 会选择一个最优的节点去运行这个 Pod。kube-scheduler 给一个 Pod 做调度选择包含过滤和打分两个步骤。过滤阶段会将所有满足 Pod 调度需求的节点选出来,在打分阶段 k - [如何驱逐节点上的所有Pod?](https://support.huaweicloud.com/cce_faq/cce_faq_00326.md): 您可使用kubectl drain命令从节点安全地逐出所有Pod。默认情况下,kubectl drain命令会保留某些系统级Pod不被驱逐,例如everest-csi-driver。驱逐前该节点上的Pod如下:如果节点上存在绑定了本地存储的Pod或是一些守护进程集管理的Pod,将提示“error: unable to drain node - [如何查看Pod是否使用CPU绑核?](https://support.huaweicloud.com/cce_faq/cce_faq_00414.md): 以4U8G节点为例,并提前在集群中部署一个CPU request为1,limit为2的工作负载。回显如下:policyName字段值为static代表策略设置成功。{pod uid}为Pod UID,可在已通过kubectl连接集群的机器上使用以下命令获取:kubectl get po {pod name} -n {namespace} - [节点关机后Pod不重新调度](https://support.huaweicloud.com/cce_faq/cce_faq_00415.md): 节点关机后,节点上的Pod仍然显示running状态。通过kubectl describe pod 命令查询Pod最新事件为:节点关机后,系统会自动给节点添加污点,比如:node.kubernetes.io/unreachable:NoExecutenode.cloudprovider.kubernetes.io/sh - [如何避免非GPU/NPU负载调度到GPU/NPU节点?](https://support.huaweicloud.com/cce_faq/cce_faq_00422.md): 当集群中存在GPU/NPU节点和普通节点混合使用的场景时,普通工作负载也可以调度到GPU/NPU节点上,可能出现GPU/NPU资源未充分利用的情况。由于GPU/NPU节点同样提供CPU、内存资源,在一般情况下,即使工作负载未声明使用GPU/NPU资源,调度器也会根据打分机制将工作负载调度到GPU/NPU节点运行,于是可能会出现GPU/NP - [为什么Pod调度不到某个节点上?](https://support.huaweicloud.com/cce_faq/cce_faq_00293.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [修改kubelet参数导致已驱逐的Pod被重新调度](https://support.huaweicloud.com/cce_faq/cce_faq_00481.md): 如果节点存在Memory/Disk/PID Pressure的情况,节点会被添加系统污点。此时修改节点池kubelet组件配置参数或者重启节点kubelet后,该污点会被临时删除,可能会导致由于节点资源压力而触发驱逐的节点重新加入调度器计算流程中,Pod重新调度到该节点上,如果节点资源压力未缓解,之后节点会再次进入驱逐流程。当前kubel - [根据GPU/NPU卡信息定位使用该卡的Pod](https://support.huaweicloud.com/cce_faq/cce_faq_00482.md): 在CCE中使用GPU/NPU卡时,无法直接获取到使用该卡的Pod。您可以根据GPU/NPU卡的信息,通过kubectl命令行操作筛选Pod,以便在GPU/NPU卡故障时能够及时将Pod驱逐。已创建CCE集群,且配置了kubectl命令行工具。详细操作可参考通过kubectl连接集群。集群上安装了CCE AI套件(GPU/NPU),可参考C - [节点标签更新导致的Pod容器退出问题](https://support.huaweicloud.com/cce_faq/cce_faq_00487.md): 工作负载通过节点标签调度到节点运行后,如果更新节点标签,然后修改节点的kubelet配置参数导致kubelet组件重启。kubelet组件重启后约30s,查看工作负载状态,会出现异常事件Predicate NodeAffinity failed,原Pod状态变成Completed,并且新Pod将会重新调度。如果不存在其他符合指定标签的节点 - [创建使用GPU虚拟化多卡均分调度功能的工作负载之后,大量Pod执行失败](https://support.huaweicloud.com/cce_faq/cce_faq_00497.md): 创建使用GPU虚拟化多卡均分调度功能的工作负载之后,大量的GPU Pod执行失败。具体示例如下:回显结果如下:使用GPU虚拟化多卡均分调度功能,集群版本与CCE AI套件(NVIDIA GPU)插件版本需要适配,具体如下:插件版本在2.1.41及以上时:集群版本在1.27.16-r20、1.28.15-r10、1.29.10-r10、1. - [如何让多个Pod均匀部署到各个节点上?](https://support.huaweicloud.com/cce_faq/cce_faq_00260.md): 在Kubernetes中,如果需要让多个Pod均匀部署到各个节点,可以通过配置调度策略控制kube-scheduler的决策,结合Pod亲和性、Pod拓扑分布约束等机制实现。方案一:使用Pod反亲和性分散Pod:该方案适用于粗略分散,本质是将Pod分散至不同的拓扑域,但无法精确控制每个域有多少个Pod,不能严格意义上实现均分。例如,在节点 - [如何避免节点上的某个容器被驱逐?](https://support.huaweicloud.com/cce_faq/cce_faq_00262.md): 在工作负载调度时可能会发生一个节点上的两个容器之间互相争资源的情况,最终导致kubelet将其全部驱逐。那么能不能设定策略让其中一个服务一直保留?如何设定?Kubelet会按照下面的标准对Pod的驱逐行为进行评判:根据服务质量:即BestEffort、Burstable、Guaranteed。根据Pod调度请求的被耗尽资源的消耗量。接下来 - [为什么Pod在节点不是均匀分布?](https://support.huaweicloud.com/cce_faq/cce_faq_00314.md): Kubernetes中kube-scheduler组件负责Pod的调度,对每一个新创建的 Pod 或者是未被调度的 Pod,kube-scheduler 会选择一个最优的节点去运行这个 Pod。kube-scheduler 给一个 Pod 做调度选择包含过滤和打分两个步骤。过滤阶段会将所有满足 Pod 调度需求的节点选出来,在打分阶段 k - [如何驱逐节点上的所有Pod?](https://support.huaweicloud.com/cce_faq/cce_faq_00326.md): 您可使用kubectl drain命令从节点安全地逐出所有Pod。默认情况下,kubectl drain命令会保留某些系统级Pod不被驱逐,例如everest-csi-driver。驱逐前该节点上的Pod如下:如果节点上存在绑定了本地存储的Pod或是一些守护进程集管理的Pod,将提示“error: unable to drain node - [如何查看Pod是否使用CPU绑核?](https://support.huaweicloud.com/cce_faq/cce_faq_00414.md): 以4U8G节点为例,并提前在集群中部署一个CPU request为1,limit为2的工作负载。回显如下:policyName字段值为static代表策略设置成功。{pod uid}为Pod UID,可在已通过kubectl连接集群的机器上使用以下命令获取:kubectl get po {pod name} -n {namespace} - [节点关机后Pod不重新调度](https://support.huaweicloud.com/cce_faq/cce_faq_00415.md): 节点关机后,节点上的Pod仍然显示running状态。通过kubectl describe pod 命令查询Pod最新事件为:节点关机后,系统会自动给节点添加污点,比如:node.kubernetes.io/unreachable:NoExecutenode.cloudprovider.kubernetes.io/sh - [如何避免非GPU/NPU负载调度到GPU/NPU节点?](https://support.huaweicloud.com/cce_faq/cce_faq_00422.md): 当集群中存在GPU/NPU节点和普通节点混合使用的场景时,普通工作负载也可以调度到GPU/NPU节点上,可能出现GPU/NPU资源未充分利用的情况。由于GPU/NPU节点同样提供CPU、内存资源,在一般情况下,即使工作负载未声明使用GPU/NPU资源,调度器也会根据打分机制将工作负载调度到GPU/NPU节点运行,于是可能会出现GPU/NP - [为什么Pod调度不到某个节点上?](https://support.huaweicloud.com/cce_faq/cce_faq_00293.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [修改kubelet参数导致已驱逐的Pod被重新调度](https://support.huaweicloud.com/cce_faq/cce_faq_00481.md): 如果节点存在Memory/Disk/PID Pressure的情况,节点会被添加系统污点。此时修改节点池kubelet组件配置参数或者重启节点kubelet后,该污点会被临时删除,可能会导致由于节点资源压力而触发驱逐的节点重新加入调度器计算流程中,Pod重新调度到该节点上,如果节点资源压力未缓解,之后节点会再次进入驱逐流程。当前kubel - [根据GPU/NPU卡信息定位使用该卡的Pod](https://support.huaweicloud.com/cce_faq/cce_faq_00482.md): 在CCE中使用GPU/NPU卡时,无法直接获取到使用该卡的Pod。您可以根据GPU/NPU卡的信息,通过kubectl命令行操作筛选Pod,以便在GPU/NPU卡故障时能够及时将Pod驱逐。已创建CCE集群,且配置了kubectl命令行工具。详细操作可参考通过kubectl连接集群。集群上安装了CCE AI套件(GPU/NPU),可参考C - [节点标签更新导致的Pod容器退出问题](https://support.huaweicloud.com/cce_faq/cce_faq_00487.md): 工作负载通过节点标签调度到节点运行后,如果更新节点标签,然后修改节点的kubelet配置参数导致kubelet组件重启。kubelet组件重启后约30s,查看工作负载状态,会出现异常事件Predicate NodeAffinity failed,原Pod状态变成Completed,并且新Pod将会重新调度。如果不存在其他符合指定标签的节点 - [创建使用GPU虚拟化多卡均分调度功能的工作负载之后,大量Pod执行失败](https://support.huaweicloud.com/cce_faq/cce_faq_00497.md): 创建使用GPU虚拟化多卡均分调度功能的工作负载之后,大量的GPU Pod执行失败。具体示例如下:回显结果如下:使用GPU虚拟化多卡均分调度功能,集群版本与CCE AI套件(NVIDIA GPU)插件版本需要适配,具体如下:插件版本在2.1.41及以上时:集群版本在1.27.16-r20、1.28.15-r10、1.29.10-r10、1. - [定时任务停止一段时间后,为何无法重新启动?](https://support.huaweicloud.com/cce_faq/cce_faq_00213.md): 定时任务在运行过程中,如果被暂停,再次被开启时,控制器会检查上一次调度的时间点到现在所错过了调度次数。如果错过的调度次数超过100次, 那么它就不会启动这个任务并记录这个错误,详情请参考CronJob限制。例如,假设一个CronJob被设置为从08:30:00开始每隔1分钟创建一个新的Job,且startingDeadlineSecond - [创建有状态负载时,实例间发现服务是指什么?](https://support.huaweicloud.com/cce_faq/cce_faq_00289.md): 云容器引擎的实例间发现服务,在原生Kubernetes中称之为Headless Service。Headless Service也是一种Service,但是会在YAML中定义spec.clusterIP: None,也就是不需要Cluster IP的Service。普通Service:一个Service可能对应多个EndPoint(Pod - [CCE容器拉取私有镜像时报错“Auth is empty”](https://support.huaweicloud.com/cce_faq/cce_faq_00106.md): 在CCE的控制台界面中为已经创建的工作负载更换镜像,选择我上传的镜像,容器在拉取镜像时报错“Auth is empty, only accept X-Auth-Token or Authorization”。您可以通过CCE控制台界面选择私有镜像创建应用,此时CCE会自动带上该secret,升级时不会出现该问题。您通过API创建应用时,在 - [CCE集群中工作负载镜像的拉取策略有哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00199.md): 容器在启动运行前,需要镜像。镜像的存储位置可能会在本地,也可能会在远程镜像仓库中。Kubernetes配置文件中的imagePullPolicy属性是用于描述镜像的拉取策略的,如下:Always:总是拉取镜像。imagePullPolicy: AlwaysIfNotPresent:本地有则使用本地镜像,不拉取。imagePullPolic - [鲲鹏集群Docker容器挂载点被卸载](https://support.huaweicloud.com/cce_faq/cce_faq_00317.md): 鲲鹏集群Docker容器挂载点被卸载。鲲鹏集群节点为EulerOS 2.8系统时,如果在Docker服务文件中配置了MountFlags=shared字段,会因为systemd特性的原因导致容器挂载点被卸载。修改Docker服务文件,删除MountFlags=shared字段,重启Docker。vi /usr/lib/systemd/sy - [下载镜像缺少层如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00319.md): 在使用containerd容器运行时场景下,拉取镜像到节点时,概率性缺少镜像层,导致工作负载容器创建失败。docker v1.10 之前支持mediaType 为 application/octet-stream 的layer,而containerd不支持application/octet-stream,导致没有拉取。有如下两种方式可解决 - [容器内的文件权限和用户都是问号](https://support.huaweicloud.com/cce_faq/cce_faq_0393.md): 节点操作系统为CentOS 7.6或EulerOS 2.5时,如果使用“Debian GNU/Linux 11 (bullseye)”内核为基础镜像的容器,会出现容器内的文件权限和用户异常。容器内文件权限及用户异常。CCE提供以下两种解决方案,您可根据实际情况选取:建议业务容器的基础镜像使用Debian 9或者Debian 10。建议节点 - [如何导出容器中的文件?](https://support.huaweicloud.com/cce_faq/cce_faq_00495.md): 在开发和生产环境中,可能存在很多场景需要将容器中的文件导出到宿主机,例如导出日志文件进行分析、导出配置文件进行备份、导出构建产物等等。本文将为您介绍如何将容器中的文件导出。您可以使用kubectl cp命令导出容器中的文件。假设您的Pod名为pod_name,位于default命名空间中,要从Pod的/path/to/file路径复制文件 - [定时任务停止一段时间后,为何无法重新启动?](https://support.huaweicloud.com/cce_faq/cce_faq_00213.md): 定时任务在运行过程中,如果被暂停,再次被开启时,控制器会检查上一次调度的时间点到现在所错过了调度次数。如果错过的调度次数超过100次, 那么它就不会启动这个任务并记录这个错误,详情请参考CronJob限制。例如,假设一个CronJob被设置为从08:30:00开始每隔1分钟创建一个新的Job,且startingDeadlineSecond - [创建有状态负载时,实例间发现服务是指什么?](https://support.huaweicloud.com/cce_faq/cce_faq_00289.md): 云容器引擎的实例间发现服务,在原生Kubernetes中称之为Headless Service。Headless Service也是一种Service,但是会在YAML中定义spec.clusterIP: None,也就是不需要Cluster IP的Service。普通Service:一个Service可能对应多个EndPoint(Pod - [CCE容器拉取私有镜像时报错“Auth is empty”](https://support.huaweicloud.com/cce_faq/cce_faq_00106.md): 在CCE的控制台界面中为已经创建的工作负载更换镜像,选择我上传的镜像,容器在拉取镜像时报错“Auth is empty, only accept X-Auth-Token or Authorization”。您可以通过CCE控制台界面选择私有镜像创建应用,此时CCE会自动带上该secret,升级时不会出现该问题。您通过API创建应用时,在 - [CCE集群中工作负载镜像的拉取策略有哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00199.md): 容器在启动运行前,需要镜像。镜像的存储位置可能会在本地,也可能会在远程镜像仓库中。Kubernetes配置文件中的imagePullPolicy属性是用于描述镜像的拉取策略的,如下:Always:总是拉取镜像。imagePullPolicy: AlwaysIfNotPresent:本地有则使用本地镜像,不拉取。imagePullPolic - [鲲鹏集群Docker容器挂载点被卸载](https://support.huaweicloud.com/cce_faq/cce_faq_00317.md): 鲲鹏集群Docker容器挂载点被卸载。鲲鹏集群节点为EulerOS 2.8系统时,如果在Docker服务文件中配置了MountFlags=shared字段,会因为systemd特性的原因导致容器挂载点被卸载。修改Docker服务文件,删除MountFlags=shared字段,重启Docker。vi /usr/lib/systemd/sy - [下载镜像缺少层如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00319.md): 在使用containerd容器运行时场景下,拉取镜像到节点时,概率性缺少镜像层,导致工作负载容器创建失败。docker v1.10 之前支持mediaType 为 application/octet-stream 的layer,而containerd不支持application/octet-stream,导致没有拉取。有如下两种方式可解决 - [容器内的文件权限和用户都是问号](https://support.huaweicloud.com/cce_faq/cce_faq_0393.md): 节点操作系统为CentOS 7.6或EulerOS 2.5时,如果使用“Debian GNU/Linux 11 (bullseye)”内核为基础镜像的容器,会出现容器内的文件权限和用户异常。容器内文件权限及用户异常。CCE提供以下两种解决方案,您可根据实际情况选取:建议业务容器的基础镜像使用Debian 9或者Debian 10。建议节点 - [如何导出容器中的文件?](https://support.huaweicloud.com/cce_faq/cce_faq_00495.md): 在开发和生产环境中,可能存在很多场景需要将容器中的文件导出到宿主机,例如导出日志文件进行分析、导出配置文件进行备份、导出构建产物等等。本文将为您介绍如何将容器中的文件导出。您可以使用kubectl cp命令导出容器中的文件。假设您的Pod名为pod_name,位于default命名空间中,要从Pod的/path/to/file路径复制文件 - [网络异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00205.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [工作负载网络异常时,如何定位排查?](https://support.huaweicloud.com/cce_faq/cce_faq_00202.md): 以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。排查项一:容器+容器端口排查项二:节点IP+节点端口排查项三:负载均衡IP+服务端口(Port)排查项四:NAT网关+端口排查项五:检查容器所在节点安全组是否放通在CCE控制 - [负载均衡类型Service异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00473.md): 负载均衡类型Service通过ELB负载均衡对外提供服务,创建负载均衡类型Service时,支持选择已有的ELB实例或自动创建ELB实例。若选择已有的ELB实例,CCE集群会为Service配置ELB监听器、后端服务器组等资源;若选择自动创建ELB实例,CCE除了会为Service配置ELB监听器、后端服务器组等资源,还会负责ELB实例的 - [集群内部无法使用ELB地址访问负载](https://support.huaweicloud.com/cce_faq/cce_faq_00390.md): 在集群内部(节点上或容器中),使用ELB地址无法访问。当Service设置了服务亲和为节点级别,即externalTrafficPolicy取值为Local时,在使用中可能会碰到从集群内部(节点上或容器中)访问不通的情况,回显类似如下内容:upstream connect error or disconnect/reset before - [集群外部访问Ingress不通](https://support.huaweicloud.com/cce_faq/cce_faq_00313.md): Ingress基于七层的HTTP和HTTPS协议进行转发,是集群流量的入口,可以通过域名和路径对访问做到更细粒度的划分。集群在添加Ingress后,可能会出现无法正常访问的情况,本文提供添加Ingress失败或无法正常访问的通用排查思路,帮助您找到问题所在。在进行Ingress问题排查前,请您阅读以下几点须知,并进行自检。如创建Ingre - [CCE集群中域名解析失败](https://support.huaweicloud.com/cce_faq/cce_faq_00416.md): CCE集群中域名解析失败。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。当遇到域名解析失败的问题时,首先需要判断是集群内域名还是集群外域名解析失败。集群内域名:确认coredns插件是否安装,coredns服务是否正常运 - [为什么访问部署的应用时浏览器返回404错误码?](https://support.huaweicloud.com/cce_faq/cce_faq_00203.md): CCE服务本身在浏览器中访问应用时不会返回任何的错误码,请优先排查自身业务。如果404的返回如下图所示,说明这个返回码是ELB返回的,说明ELB找不到相关的转发策略。请排查相关的转发规则等。如果404的返回如下图所示,说明这个返回码是由nginx(客户业务)返回,请排查客户自身业务问题。 - [为什么容器无法连接互联网?](https://support.huaweicloud.com/cce_faq/cce_faq_00204.md): 当容器无法连接互联网时,首先需要排查容器所在节点能否连接互联网。其次,需要查看容器的网络配置是否正确,例如DNS配置是否可以正常解析域名。如图1,若弹性IP一栏有IP地址,表示已绑定弹性IP;若没有,请为弹性云服务器绑定弹性IP。节点是否已绑定弹性IP在容器中执行cat /etc/resolv.conf命令,查看DNS配置。示例如下:如果 - [VPC的子网无法删除,怎么办?](https://support.huaweicloud.com/cce_faq/cce_faq_00126.md): VPC的子网无法删除可能是因为您在CCE的集群中使用了该VPC的子网,因此需要在CCE界面删除相应的集群后,再删除VPC的子网。删除集群会将集群内的节点以及运行的工作负载和服务都销毁,请谨慎操作。不建议在ECS界面删除CCE集群中的节点。 - [CCE Turbo集群如何修复出现故障的容器网卡?](https://support.huaweicloud.com/cce_faq/cce_faq_00121.md): CCE Turbo集群采用的是云原生网络2.0网络模型,每个Pod创建时都会分配一张网卡,您可以根据Pod上的Event事件进行对应的处理恢复:Pod创建报错exit status -1Pod创建报错timed out waiting for the condition [arping timeout]Pod创建报错timed out w - [节点无法连接互联网(公网),如何排查定位?](https://support.huaweicloud.com/cce_faq/cce_faq_00022.md): 当节点无法连接互联网时,请参照如下方法排查。登录ECS控制台,查看节点对应的弹性云服务器是否已绑定弹性IP。若弹性IP一栏有IP地址,表示已绑定弹性IP。若没有,请为弹性云服务器绑定弹性IP。登录VPC控制台,单击左侧导航栏的访问控制 > 网络ACL。排查节点所在集群的子网是否配置了网络ACL,并限制了外部访问。 - [如何解决VPC网段与容器网络冲突的问题?](https://support.huaweicloud.com/cce_faq/cce_faq_00149.md): 在集群创建页面,若“容器网段”配置与“VPC网段”冲突,界面会提示“该网段与VPC网段有冲突,请重新选择”,重新调整“容器网段”即可。 - [ELB四层健康检查导致java报错:Connection reset by peer](https://support.huaweicloud.com/cce_faq/cce_faq_00092.md): 使用Java NIO建立Socket服务端,当客户端意外关闭的情况,不是发送指定指令通知服务器退出,就会产生此错误。ELB节点根据健康检查配置,向后端服务器(IP+健康检查端口)发送TCP SYN报文。后端服务器收到请求报文后,如果相应的端口已经被正常监听,则会返回SYN+ACK报文。如果在超时时间内没有收到后端服务器的SYN+ACK报文 - [Service事件:Have no node to bind,如何排查?](https://support.huaweicloud.com/cce_faq/cce_faq_00252.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [为什么登录虚拟机VNC界面会间歇性出现Dead loop on virtual device gw_11cbf51a, fix it urgently?](https://support.huaweicloud.com/cce_faq/cce_faq_00237.md): VPC网络模式的集群,登录虚拟机出现 Dead loop on virtual device gw_11cbf51a, fix it urgently,如图:VPC网络模式的集群采用了linux开源社区的ipvlan模块实现容器网络通信,这一日志打印与ipvlan的设计实现有关,ipvlan L2E模式它优先进行二层转发,再进行三层转发。 - [集群节点使用networkpolicy概率性出现panic问题](https://support.huaweicloud.com/cce_faq/cce_faq_00303.md): 集群版本:v1.15.6-r1版本集群类型:CCE集群网络模式:容器隧道网络模式节点操作系统:CentOS 7.6上述集群的用户配置使用networkpolicy后,由于节点上canal-agent网络组件与CentOS 7.6内核存在不兼容,概率性导致CentOS 7.6的节点panic。以下三条为必要条件,若有一条不满足,则您不会受到 - [节点远程登录界面(VNC)打印较多source ip_type日志问题](https://support.huaweicloud.com/cce_faq/cce_faq_00304.md): 集群版本:v1.15.6-r1版本集群类型:CCE集群网络模式:VPC网络节点操作系统:CentOS 7.6上述节点的容器进行容器间通信时,由于容器网络组件在VNC界面打印较多source ip_type或者not ipvlan but in own host日志,导致影响节点VNC界面使用体验及高负载场景下的容器网络性能。现象如下:1、 - [使用IE浏览器访问nginx-ingress出现重定向308无法访问](https://support.huaweicloud.com/cce_faq/cce_faq_00423.md): NGINX Ingress控制器从较老的版本升级后,使用IE浏览器无法访问已有的服务,状态码显示为308。NGINX Ingress控制器在升级后默认的永久重定向状态码从301变成了308,而部分老版本的IE浏览器不支持308重定向,因此出现无法访问的问题。NGINX Ingress控制器社区issue:https://github.co - [NGINX Ingress控制器插件升级导致集群内Nginx类型的Ingress路由访问异常](https://support.huaweicloud.com/cce_faq/cce_faq_00430.md): 集群中存在未指定Ingress类型(annotations中未添加kubernetes.io/ingress.class: nginx)的Nginx Ingress路由,NGINX Ingress控制器插件从1.x版本升级至2.x版本后,服务中断。针对Nginx类型的Ingress资源,查看对应Ingress的YAML,如Ingress的 - [负载均衡型Service更新出现错误:Quota exceeded for resources: members_per_pool](https://support.huaweicloud.com/cce_faq/cce_faq_00435.md): 负载均衡型Service更新时出现错误,信息如下:ELB单后端服务器组可添加的后端服务器数量默认配额上限值为500。在CCE Turbo集群中使用独享型ELB创建Service时,Service关联的每个Pod实例都会在ELB侧创建一个后端服务器,当后端服务器数量超过配额上限时,会出现以上错误。解决方法:根据业务需求对负载均衡器的后端服务 - [ELB Ingress出现告警:Invalid input for rules](https://support.huaweicloud.com/cce_faq/cce_faq_00483.md): 创建或更新ELB Ingress时出现告警,信息如下:该告警中的错误码ELB.8902表示请求参数输入有误,详情请参见弹性负载均衡错误码。您需要根据问题原因修改正确的参数配置。 - [为ELB Ingress配置了HTTPS证书后访问异常的原因有哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00455.md): 为ELB Ingress配置了HTTPS证书后,如果证书配置出现以下问题,可能导致访问异常,您可以参考表格中的原因进行排查。您可以通过以下命令查看证书的过期时间、域名等信息,其中ca.crt为证书路径。使用TLS类型的密钥证书:需要将证书导入至Secret中,CCE会将该证书自动配置到ELB侧(证书名以k8s_plb_default开头) - [Nginx Ingress中默认开启HSTS会导致HTTP请求重定向到HTTPS](https://support.huaweicloud.com/cce_faq/cce_faq_00489.md): Nginx Ingress中没有配置HTTP重定向至HTTPS,nginx.ingress.kubernetes.io/ssl-redirect设置为false,但是访问HTTPS之后再访问HTTP会被重定向成HTTPS。NGINX Ingress控制器默认开启HTTP Strict Transport Security(HSTS)配置, - [ELB Ingress配置HTTPS证书后请求访问失败](https://support.huaweicloud.com/cce_faq/cce_faq_00503.md): ELB Ingress在转发策略中指定域名,同时配置HTTPS服务器证书后,访问域名出现TLS握手失败。ELB Ingress转发策略中配置的域名与服务器证书所带的域名不匹配。如果ELB Ingress的转发策略中需要根据域名进行匹配,建议为Ingress配置SNI证书,详情请参见为ELB Ingress配置服务器名称指示(SNI)。尤其 - [ELB Ingress转发规则匹配不符合预期怎么解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00511.md): 在Ingress中配置了多条转发规则时,当请求同时匹配多条规则,实际流量可能被转发至非预期的后端路径。该现象通常由于ELB(弹性负载均衡)侧的转发规则优先级排序不符合预期所致。ELB默认根据域名和URL的匹配逻辑对转发规则进行排序;若启用了高级转发策略,则按规则创建顺序决定优先级。若未显式控制优先级,可能导致匹配结果与预期不一致。具体转发 - [网络规划](https://support.huaweicloud.com/cce_faq/cce_faq_00146.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [集群与虚拟私有云、子网的关系是怎样的?](https://support.huaweicloud.com/cce_faq/cce_faq_00266.md): 虚拟私有云类似家庭生活中路由器管理192.168.0.0/16的私有局域网,是为用户在云上构建的一个私有网络,是弹性云服务器、负载均衡、中间件等工作的基本网络环境。根据实际业务需要可以设置不同规模的网络,一般可为10.0.0.0/8~24,172.16.0.0/12~24,192.168.0.0/16~24。子网是虚拟私有云中的一个子集, - [如何查看虚拟私有云VPC的网段?](https://support.huaweicloud.com/cce_faq/cce_faq_00148.md): 在虚拟私有云页面,可查看虚拟私有云的名称/ID和VPC网段。用户可以调整已创建的VPC或通过重新创建VPC调整网段。 - [如何设置CCE集群中的VPC网段和子网网段?](https://support.huaweicloud.com/cce_faq/cce_faq_00144.md): VPC中的子网网段一旦创建,便无法更改。创建虚拟私有云时,请预留一定的VPC网段和子网网段资源,避免后续无法扩容。子网网段可在创建虚拟私有云页面的子网配置 > 子网网段中进行设置。在设置选项下可查看到可用IP数。容器网段掩码如果设置不合适,会导致集群实际可用的节点较少。例如:节点规模为1000,子网可以选择192.168.0.0/20,支 - [如何设置CCE集群中的容器网段?](https://support.huaweicloud.com/cce_faq/cce_faq_00142.md): 进入CCE控制台,在创建集群时进行容器网段设置。当前可供选择的容器网段为10.0.0.0/8~18,172.16.0.0/16~18,192.168.0.0/16~18。集群创建完成后,如需添加容器网段,可前往集群信息页面,单击“添加容器网段”进行添加。使用“容器隧道网络”模型的集群暂不支持添加容器网段。容器网段添加后无法删除,请谨慎操作 - [什么是云原生网络2.0网络模式,适用于什么场景?](https://support.huaweicloud.com/cce_faq/cce_faq_00246.md): 云原生网络2.0是新一代容器网络模型,深度整合了虚拟私有云VPC的原生弹性网卡(Elastic Network Interface,简称ENI)能力,采用VPC网段分配容器地址,支持ELB直通容器,享有高性能。仅CCE Turbo集群支持使用云原生网络2.0。由于云原生网络2.0直接使用的VPC网络,性能与VPC网络的性能几乎一致,所以适 - [什么是弹性网卡?](https://support.huaweicloud.com/cce_faq/cce_faq_00294.md): 弹性网卡即虚拟网卡,您可以通过创建并配置弹性网卡,并将其附加到您的云服务器实例(包括弹性云服务器和裸金属服务器)上,实现灵活、高可用的网络方案配置。主弹性网卡:在创建云服务器实例时,随实例默认创建的弹性网卡称作主弹性网卡。主弹性网卡无法与实例进行解绑。扩展弹性网卡:您可以创建扩展弹性网卡,将其附加到云服务器实例上,您也可以将其从实例上进行 - [如何修改集群安全组规则配置](https://support.huaweicloud.com/cce_faq/cce_faq_00265.md): CCE作为通用的容器平台,安全组规则的设置适用于通用场景。集群在创建时将会自动为Master节点和Node节点分别创建一个安全组,其中Master节点的安全组名称是:{集群名}-cce-control-{随机ID};Node节点的安全组名称是:{集群名}-cce-node-{随机ID}。使用CCE Turbo集群时会额外创建一个ENI的安 - [创建CCE Turbo集群时如何设置IPv6服务网段](https://support.huaweicloud.com/cce_faq/cce_faq_00406.md): 当您需要创建一个IPv4/IPv6双栈的CCE Turbo集群时,需要设置IPv6服务网段,该网段默认值为fc00::/112,包含了65536个IPv6服务地址。如果您需要自定义服务网段,您可参考本文进行设置。IPv6地址IPv6地址采用128位二进制表示,是IPv4地址长度的4倍。因此IPv4地址的十进制格式不再适用,IPv6采用了十 - [CCE集群的节点是否支持绑定多网卡?](https://support.huaweicloud.com/cce_faq/cce_faq_00245.md): CCE集群的节点不支持绑定多网卡,请勿手动绑定多网卡,否则会对集群的网络访问造成影响。 - [安全加固](https://support.huaweicloud.com/cce_faq/cce_faq_00264.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [集群节点如何不暴露到公网?](https://support.huaweicloud.com/cce_faq/cce_faq_00267.md): 问题描述:集群节点如何不暴露到公网?问题解决:如果不需要访问集群节点的22端口,可在安全组规则中禁用22端口的访问。如非必须,集群节点不建议绑定EIP。如有远程登录集群节点的需求,推荐使用华为云堡垒机服务作为中转连接集群节点。 - [如何配置集群的访问策略](https://support.huaweicloud.com/cce_faq/cce_faq_00417.md): 为集群绑定公网API Server地址后,建议修改控制节点5443端口的安全组规则,加固集群的访问控制策略。除客户端IP外,端口还需保留对VPC网段、容器网段和托管网格控制面网段放通,以保证集群内部可访问API Server。如果您需要使用CloudShell功能,请保留5443端口对198.19.0.0/16网段放通,否则将无法访问集群 - [如何获取TLS密钥证书?](https://support.huaweicloud.com/cce_faq/cce_faq_00185.md): 当您的Ingress需要使用HTTPS协议时,创建Ingress时必须配置IngressTLS或kubernetes.io/tls类型的密钥。以创建IngressTLS密钥证书为例。如图1:创建密钥时密钥数据中上传的证书文件和私钥文件必须是配套的,不然会出现无效的情况。一般情况下,您需要从证书提供商处获取有效的合法证书。如果您需要在测试环 - [如何批量修改集群node节点安全组?](https://support.huaweicloud.com/cce_faq/cce_faq_00392.md): 一个安全组关联的实例数量建议不超过1000个,否则可能引起安全组性能下降。更多关于安全组的限制请参考安全组限制。通过修改左下角的单页最大显示条数,您可至多一次性添加20台服务器至安全组中。加入新的安全组后,节点仍保留原安全组。如需移除,请单击原安全组的管理实例按钮,并勾选其中的节点服务器进行移除。加入新的安全组后,节点仍保留原安全组。如需 - [网络指导](https://support.huaweicloud.com/cce_faq/cce_faq_00275.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [CCE如何与其他服务进行内网通信?](https://support.huaweicloud.com/cce_faq/cce_faq_00103.md): 与CCE进行内网通信的华为云常见服务有:RDS、DMS、Kafka、RabbitMQ、VPN、ModelArts等,有如下两种场景:在同一个VPC网络下,CCE节点可以与此VPC下的所有服务进行互通。CCE的容器与其他服务通信时,需要关注对端是否开启了容器网段的入方向的安全组规则(此限制只针对于CCE的集群为VPC网络模式)。如果不在同一 - [使用CCE设置工作负载访问方式时,端口如何填写?](https://support.huaweicloud.com/cce_faq/cce_faq_00108.md): CCE支持工作负载的内部互访和被互联网访问两种方式。内部访问:包括集群内访问(通过集群虚拟IP)和节点访问(通过节点私有IP)两种方式。内部访问类型说明内部访问类型说明端口如何填写集群内访问(通过集群虚拟IP)用于工作负载之间的互访,例如某个后端工作负载需要和前端工作负载互访,就需要选择该类型来实现内部互访。集群虚拟IP,即Cluster - [Ingress中的property字段如何实现与社区client-go兼容?](https://support.huaweicloud.com/cce_faq/cce_faq_00234.md): 社区Ingress结构体中没有property属性,导致用户使用client-go调用创建ingress的api接口时,创建的Ingress中没有property属性。为了与社区的client-go兼容,CCE提供了如下解决方案。在使用client-go创建Ingress实例时,在annotation中做如下声明:匹配规则:用户调用CCE - [服务加入Istio后,如何获取客户端真实源IP?](https://support.huaweicloud.com/cce_faq/cce_faq_00299.md): 服务启用Istio后,访问日志中无法获取到客户端源IP。本文以绑定ELB类型Service的nginx应用为例,详细步骤如下:独享型ELB默认开启源地址透传功能,无需手动开启。在管理控制台左上角单击图标,选择区域和项目。选择“服务列表 > 网络 > 弹性负载均衡 ELB”。在“弹性负载均衡器”界面,单击需要操作的负载均衡名称。切换到“监听 - [为什么更换命名空间后无法创建Ingress?](https://support.huaweicloud.com/cce_faq/cce_faq_00298.md): 在default命名空间下可以正常创建ingress,但在其他命名空间(如:ns)下创建时不能创建成功。创建弹性负载均衡ELB后,使用default命名空间创建80端口的http监听,在CCE中只允许在本命名空间下创建同一端口的其它ingress(实际转发策略可根据域名、service来区分);所以出现客户侧在其它命名空间无法创建相同端口 - [服务发布到ELB,ELB的后端为何会被自动删除?](https://support.huaweicloud.com/cce_faq/cce_faq_00248.md): 问题描述:服务发布到ELB,工作负载已正常,但服务的pod端口未及时发布出来,ELB里的后端会被自动删除。问题解答:创建ELB时候,如果ELB健康检查失败,后端服务器组会删除,而且后续服务正常以后也不会添加。如果是更新已有的SVC时则不会删除。添加删除节点的时候,由于集群状态的改变,可能会引起集群内的Node访问方式的改变,为保证服务正常 - [如何使容器重启后所在容器IP仍保持不变?](https://support.huaweicloud.com/cce_faq/cce_faq_00192.md): 如果集群下仅有1个节点时,要使容器重启后所在容器IP保持不变,需在工作负载中配置主机网络,在工作负载的yaml中的spec.spec.下加入hostNetwork: true字段。如果集群下有多个节点时,除进行以上操作外,还需要设置节点的亲和策略,但工作负载创建后实例运行数不得超过亲和的节点数。进行如上设置并在工作负载运行后,工作负载实例 - [如何确认网卡不被集群占用?](https://support.huaweicloud.com/cce_faq/cce_faq_00446.md): 在CCE Turbo集群中,v1.23.17-r0、v1.25.12-r0、v1.27.9-r0、v1.28.7-r0、v1.29.3-r0及以上版本的集群支持删除容器子网。删除集群容器子网属于高危操作,您需要确保当前集群正在使用的网卡中没有网卡属于该子网,包含Pod正在使用和集群预热的网卡。如果需要清理集群内使用的子网网卡,需要提交工单 - [删除子网后如何删除安全组规则?](https://support.huaweicloud.com/cce_faq/cce_faq_00447.md): 在CCE Turbo集群中,v1.23.17-r0、v1.25.12-r0、v1.27.9-r0、v1.28.7-r0、v1.29.3-r0及以上版本的集群支持删除容器子网。删除子网后,CCE默认生成的节点级的安全组不会自动清理待删除子网的安全组规则,需要手动清理。 - [不同命名空间下的Ingress共用监听器时如何同步生效的证书?](https://support.huaweicloud.com/cce_faq/cce_faq_00459.md): 在同一个集群中,多个Ingress可以使用同一个监听器(即使用同一个负载均衡器的同一个端口)。如果两个Ingress均配置了HTTPS证书,则生效的服务器证书将以最早创建的Ingress配置为准。但是不同命名空间下的Ingress对接同一个监听器且使用TLS密钥类型证书时,由于命名空间隔离,后创建的Ingress可能出现无法正常显示TLS - [如何确认监听器配置生效的Ingress](https://support.huaweicloud.com/cce_faq/cce_faq_00460.md): CCE支持将多个Ingress对接到同一个ELB的监听器,并创建不同的转发策略。由于监听器配置参数通过annotation方式承载,因此可能存在同一个监听器配置在多个Ingress上有不同配置参数的场景。本文为您介绍如何确认监听器配置生效Ingress。由于对接同监听器的路由(Ingress)均可配置监听器参数,因此CCE采取首个创建的I - [如何扩展单个CCE Turbo集群能支持的最大网卡数?](https://support.huaweicloud.com/cce_faq/cce_faq_00507.md): CCE Turbo采用的是云原生网络2.0网络模式,Pod直接使用的是从VPC分配出来的网卡,每个网卡默认关联该集群的ENI安全组。由于单个安全组关联的网卡数存在上限,默认值为5万。如果不做任何配置,假设没有预热的容器网卡,单个CCE Turbo集群最多只能运行5万个使用容器网络的Pod。您可以使用以下方法扩展单集群能支持的最大网卡数: - [工作负载网络异常时,如何定位排查?](https://support.huaweicloud.com/cce_faq/cce_faq_00202.md): 以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。排查项一:容器+容器端口排查项二:节点IP+节点端口排查项三:负载均衡IP+服务端口(Port)排查项四:NAT网关+端口排查项五:检查容器所在节点安全组是否放通在CCE控制 - [负载均衡类型Service异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00473.md): 负载均衡类型Service通过ELB负载均衡对外提供服务,创建负载均衡类型Service时,支持选择已有的ELB实例或自动创建ELB实例。若选择已有的ELB实例,CCE集群会为Service配置ELB监听器、后端服务器组等资源;若选择自动创建ELB实例,CCE除了会为Service配置ELB监听器、后端服务器组等资源,还会负责ELB实例的 - [集群内部无法使用ELB地址访问负载](https://support.huaweicloud.com/cce_faq/cce_faq_00390.md): 在集群内部(节点上或容器中),使用ELB地址无法访问。当Service设置了服务亲和为节点级别,即externalTrafficPolicy取值为Local时,在使用中可能会碰到从集群内部(节点上或容器中)访问不通的情况,回显类似如下内容:upstream connect error or disconnect/reset before - [集群外部访问Ingress不通](https://support.huaweicloud.com/cce_faq/cce_faq_00313.md): Ingress基于七层的HTTP和HTTPS协议进行转发,是集群流量的入口,可以通过域名和路径对访问做到更细粒度的划分。集群在添加Ingress后,可能会出现无法正常访问的情况,本文提供添加Ingress失败或无法正常访问的通用排查思路,帮助您找到问题所在。在进行Ingress问题排查前,请您阅读以下几点须知,并进行自检。如创建Ingre - [CCE集群中域名解析失败](https://support.huaweicloud.com/cce_faq/cce_faq_00416.md): CCE集群中域名解析失败。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。当遇到域名解析失败的问题时,首先需要判断是集群内域名还是集群外域名解析失败。集群内域名:确认coredns插件是否安装,coredns服务是否正常运 - [为什么访问部署的应用时浏览器返回404错误码?](https://support.huaweicloud.com/cce_faq/cce_faq_00203.md): CCE服务本身在浏览器中访问应用时不会返回任何的错误码,请优先排查自身业务。如果404的返回如下图所示,说明这个返回码是ELB返回的,说明ELB找不到相关的转发策略。请排查相关的转发规则等。如果404的返回如下图所示,说明这个返回码是由nginx(客户业务)返回,请排查客户自身业务问题。 - [为什么容器无法连接互联网?](https://support.huaweicloud.com/cce_faq/cce_faq_00204.md): 当容器无法连接互联网时,首先需要排查容器所在节点能否连接互联网。其次,需要查看容器的网络配置是否正确,例如DNS配置是否可以正常解析域名。如图1,若弹性IP一栏有IP地址,表示已绑定弹性IP;若没有,请为弹性云服务器绑定弹性IP。节点是否已绑定弹性IP在容器中执行cat /etc/resolv.conf命令,查看DNS配置。示例如下:如果 - [VPC的子网无法删除,怎么办?](https://support.huaweicloud.com/cce_faq/cce_faq_00126.md): VPC的子网无法删除可能是因为您在CCE的集群中使用了该VPC的子网,因此需要在CCE界面删除相应的集群后,再删除VPC的子网。删除集群会将集群内的节点以及运行的工作负载和服务都销毁,请谨慎操作。不建议在ECS界面删除CCE集群中的节点。 - [CCE Turbo集群如何修复出现故障的容器网卡?](https://support.huaweicloud.com/cce_faq/cce_faq_00121.md): CCE Turbo集群采用的是云原生网络2.0网络模型,每个Pod创建时都会分配一张网卡,您可以根据Pod上的Event事件进行对应的处理恢复:Pod创建报错exit status -1Pod创建报错timed out waiting for the condition [arping timeout]Pod创建报错timed out w - [节点无法连接互联网(公网),如何排查定位?](https://support.huaweicloud.com/cce_faq/cce_faq_00022.md): 当节点无法连接互联网时,请参照如下方法排查。登录ECS控制台,查看节点对应的弹性云服务器是否已绑定弹性IP。若弹性IP一栏有IP地址,表示已绑定弹性IP。若没有,请为弹性云服务器绑定弹性IP。登录VPC控制台,单击左侧导航栏的访问控制 > 网络ACL。排查节点所在集群的子网是否配置了网络ACL,并限制了外部访问。 - [如何解决VPC网段与容器网络冲突的问题?](https://support.huaweicloud.com/cce_faq/cce_faq_00149.md): 在集群创建页面,若“容器网段”配置与“VPC网段”冲突,界面会提示“该网段与VPC网段有冲突,请重新选择”,重新调整“容器网段”即可。 - [ELB四层健康检查导致java报错:Connection reset by peer](https://support.huaweicloud.com/cce_faq/cce_faq_00092.md): 使用Java NIO建立Socket服务端,当客户端意外关闭的情况,不是发送指定指令通知服务器退出,就会产生此错误。ELB节点根据健康检查配置,向后端服务器(IP+健康检查端口)发送TCP SYN报文。后端服务器收到请求报文后,如果相应的端口已经被正常监听,则会返回SYN+ACK报文。如果在超时时间内没有收到后端服务器的SYN+ACK报文 - [Service事件:Have no node to bind,如何排查?](https://support.huaweicloud.com/cce_faq/cce_faq_00252.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [为什么登录虚拟机VNC界面会间歇性出现Dead loop on virtual device gw_11cbf51a, fix it urgently?](https://support.huaweicloud.com/cce_faq/cce_faq_00237.md): VPC网络模式的集群,登录虚拟机出现 Dead loop on virtual device gw_11cbf51a, fix it urgently,如图:VPC网络模式的集群采用了linux开源社区的ipvlan模块实现容器网络通信,这一日志打印与ipvlan的设计实现有关,ipvlan L2E模式它优先进行二层转发,再进行三层转发。 - [集群节点使用networkpolicy概率性出现panic问题](https://support.huaweicloud.com/cce_faq/cce_faq_00303.md): 集群版本:v1.15.6-r1版本集群类型:CCE集群网络模式:容器隧道网络模式节点操作系统:CentOS 7.6上述集群的用户配置使用networkpolicy后,由于节点上canal-agent网络组件与CentOS 7.6内核存在不兼容,概率性导致CentOS 7.6的节点panic。以下三条为必要条件,若有一条不满足,则您不会受到 - [节点远程登录界面(VNC)打印较多source ip_type日志问题](https://support.huaweicloud.com/cce_faq/cce_faq_00304.md): 集群版本:v1.15.6-r1版本集群类型:CCE集群网络模式:VPC网络节点操作系统:CentOS 7.6上述节点的容器进行容器间通信时,由于容器网络组件在VNC界面打印较多source ip_type或者not ipvlan but in own host日志,导致影响节点VNC界面使用体验及高负载场景下的容器网络性能。现象如下:1、 - [使用IE浏览器访问nginx-ingress出现重定向308无法访问](https://support.huaweicloud.com/cce_faq/cce_faq_00423.md): NGINX Ingress控制器从较老的版本升级后,使用IE浏览器无法访问已有的服务,状态码显示为308。NGINX Ingress控制器在升级后默认的永久重定向状态码从301变成了308,而部分老版本的IE浏览器不支持308重定向,因此出现无法访问的问题。NGINX Ingress控制器社区issue:https://github.co - [NGINX Ingress控制器插件升级导致集群内Nginx类型的Ingress路由访问异常](https://support.huaweicloud.com/cce_faq/cce_faq_00430.md): 集群中存在未指定Ingress类型(annotations中未添加kubernetes.io/ingress.class: nginx)的Nginx Ingress路由,NGINX Ingress控制器插件从1.x版本升级至2.x版本后,服务中断。针对Nginx类型的Ingress资源,查看对应Ingress的YAML,如Ingress的 - [负载均衡型Service更新出现错误:Quota exceeded for resources: members_per_pool](https://support.huaweicloud.com/cce_faq/cce_faq_00435.md): 负载均衡型Service更新时出现错误,信息如下:ELB单后端服务器组可添加的后端服务器数量默认配额上限值为500。在CCE Turbo集群中使用独享型ELB创建Service时,Service关联的每个Pod实例都会在ELB侧创建一个后端服务器,当后端服务器数量超过配额上限时,会出现以上错误。解决方法:根据业务需求对负载均衡器的后端服务 - [ELB Ingress出现告警:Invalid input for rules](https://support.huaweicloud.com/cce_faq/cce_faq_00483.md): 创建或更新ELB Ingress时出现告警,信息如下:该告警中的错误码ELB.8902表示请求参数输入有误,详情请参见弹性负载均衡错误码。您需要根据问题原因修改正确的参数配置。 - [为ELB Ingress配置了HTTPS证书后访问异常的原因有哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00455.md): 为ELB Ingress配置了HTTPS证书后,如果证书配置出现以下问题,可能导致访问异常,您可以参考表格中的原因进行排查。您可以通过以下命令查看证书的过期时间、域名等信息,其中ca.crt为证书路径。使用TLS类型的密钥证书:需要将证书导入至Secret中,CCE会将该证书自动配置到ELB侧(证书名以k8s_plb_default开头) - [Nginx Ingress中默认开启HSTS会导致HTTP请求重定向到HTTPS](https://support.huaweicloud.com/cce_faq/cce_faq_00489.md): Nginx Ingress中没有配置HTTP重定向至HTTPS,nginx.ingress.kubernetes.io/ssl-redirect设置为false,但是访问HTTPS之后再访问HTTP会被重定向成HTTPS。NGINX Ingress控制器默认开启HTTP Strict Transport Security(HSTS)配置, - [ELB Ingress配置HTTPS证书后请求访问失败](https://support.huaweicloud.com/cce_faq/cce_faq_00503.md): ELB Ingress在转发策略中指定域名,同时配置HTTPS服务器证书后,访问域名出现TLS握手失败。ELB Ingress转发策略中配置的域名与服务器证书所带的域名不匹配。如果ELB Ingress的转发策略中需要根据域名进行匹配,建议为Ingress配置SNI证书,详情请参见为ELB Ingress配置服务器名称指示(SNI)。尤其 - [ELB Ingress转发规则匹配不符合预期怎么解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00511.md): 在Ingress中配置了多条转发规则时,当请求同时匹配多条规则,实际流量可能被转发至非预期的后端路径。该现象通常由于ELB(弹性负载均衡)侧的转发规则优先级排序不符合预期所致。ELB默认根据域名和URL的匹配逻辑对转发规则进行排序;若启用了高级转发策略,则按规则创建顺序决定优先级。若未显式控制优先级,可能导致匹配结果与预期不一致。具体转发 - [工作负载网络异常时,如何定位排查?](https://support.huaweicloud.com/cce_faq/cce_faq_00202.md): 以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。排查项一:容器+容器端口排查项二:节点IP+节点端口排查项三:负载均衡IP+服务端口(Port)排查项四:NAT网关+端口排查项五:检查容器所在节点安全组是否放通在CCE控制 - [负载均衡类型Service异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00473.md): 负载均衡类型Service通过ELB负载均衡对外提供服务,创建负载均衡类型Service时,支持选择已有的ELB实例或自动创建ELB实例。若选择已有的ELB实例,CCE集群会为Service配置ELB监听器、后端服务器组等资源;若选择自动创建ELB实例,CCE除了会为Service配置ELB监听器、后端服务器组等资源,还会负责ELB实例的 - [集群内部无法使用ELB地址访问负载](https://support.huaweicloud.com/cce_faq/cce_faq_00390.md): 在集群内部(节点上或容器中),使用ELB地址无法访问。当Service设置了服务亲和为节点级别,即externalTrafficPolicy取值为Local时,在使用中可能会碰到从集群内部(节点上或容器中)访问不通的情况,回显类似如下内容:upstream connect error or disconnect/reset before - [集群外部访问Ingress不通](https://support.huaweicloud.com/cce_faq/cce_faq_00313.md): Ingress基于七层的HTTP和HTTPS协议进行转发,是集群流量的入口,可以通过域名和路径对访问做到更细粒度的划分。集群在添加Ingress后,可能会出现无法正常访问的情况,本文提供添加Ingress失败或无法正常访问的通用排查思路,帮助您找到问题所在。在进行Ingress问题排查前,请您阅读以下几点须知,并进行自检。如创建Ingre - [CCE集群中域名解析失败](https://support.huaweicloud.com/cce_faq/cce_faq_00416.md): CCE集群中域名解析失败。以下排查思路根据原因的出现概率进行排序,建议您从高频率原因往低频率原因排查,从而帮助您快速找到问题的原因。如果解决完某个可能原因仍未解决问题,请继续排查其他可能原因。当遇到域名解析失败的问题时,首先需要判断是集群内域名还是集群外域名解析失败。集群内域名:确认coredns插件是否安装,coredns服务是否正常运 - [为什么访问部署的应用时浏览器返回404错误码?](https://support.huaweicloud.com/cce_faq/cce_faq_00203.md): CCE服务本身在浏览器中访问应用时不会返回任何的错误码,请优先排查自身业务。如果404的返回如下图所示,说明这个返回码是ELB返回的,说明ELB找不到相关的转发策略。请排查相关的转发规则等。如果404的返回如下图所示,说明这个返回码是由nginx(客户业务)返回,请排查客户自身业务问题。 - [为什么容器无法连接互联网?](https://support.huaweicloud.com/cce_faq/cce_faq_00204.md): 当容器无法连接互联网时,首先需要排查容器所在节点能否连接互联网。其次,需要查看容器的网络配置是否正确,例如DNS配置是否可以正常解析域名。如图1,若弹性IP一栏有IP地址,表示已绑定弹性IP;若没有,请为弹性云服务器绑定弹性IP。节点是否已绑定弹性IP在容器中执行cat /etc/resolv.conf命令,查看DNS配置。示例如下:如果 - [VPC的子网无法删除,怎么办?](https://support.huaweicloud.com/cce_faq/cce_faq_00126.md): VPC的子网无法删除可能是因为您在CCE的集群中使用了该VPC的子网,因此需要在CCE界面删除相应的集群后,再删除VPC的子网。删除集群会将集群内的节点以及运行的工作负载和服务都销毁,请谨慎操作。不建议在ECS界面删除CCE集群中的节点。 - [CCE Turbo集群如何修复出现故障的容器网卡?](https://support.huaweicloud.com/cce_faq/cce_faq_00121.md): CCE Turbo集群采用的是云原生网络2.0网络模型,每个Pod创建时都会分配一张网卡,您可以根据Pod上的Event事件进行对应的处理恢复:Pod创建报错exit status -1Pod创建报错timed out waiting for the condition [arping timeout]Pod创建报错timed out w - [节点无法连接互联网(公网),如何排查定位?](https://support.huaweicloud.com/cce_faq/cce_faq_00022.md): 当节点无法连接互联网时,请参照如下方法排查。登录ECS控制台,查看节点对应的弹性云服务器是否已绑定弹性IP。若弹性IP一栏有IP地址,表示已绑定弹性IP。若没有,请为弹性云服务器绑定弹性IP。登录VPC控制台,单击左侧导航栏的访问控制 > 网络ACL。排查节点所在集群的子网是否配置了网络ACL,并限制了外部访问。 - [如何解决VPC网段与容器网络冲突的问题?](https://support.huaweicloud.com/cce_faq/cce_faq_00149.md): 在集群创建页面,若“容器网段”配置与“VPC网段”冲突,界面会提示“该网段与VPC网段有冲突,请重新选择”,重新调整“容器网段”即可。 - [ELB四层健康检查导致java报错:Connection reset by peer](https://support.huaweicloud.com/cce_faq/cce_faq_00092.md): 使用Java NIO建立Socket服务端,当客户端意外关闭的情况,不是发送指定指令通知服务器退出,就会产生此错误。ELB节点根据健康检查配置,向后端服务器(IP+健康检查端口)发送TCP SYN报文。后端服务器收到请求报文后,如果相应的端口已经被正常监听,则会返回SYN+ACK报文。如果在超时时间内没有收到后端服务器的SYN+ACK报文 - [Service事件:Have no node to bind,如何排查?](https://support.huaweicloud.com/cce_faq/cce_faq_00252.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [为什么登录虚拟机VNC界面会间歇性出现Dead loop on virtual device gw_11cbf51a, fix it urgently?](https://support.huaweicloud.com/cce_faq/cce_faq_00237.md): VPC网络模式的集群,登录虚拟机出现 Dead loop on virtual device gw_11cbf51a, fix it urgently,如图:VPC网络模式的集群采用了linux开源社区的ipvlan模块实现容器网络通信,这一日志打印与ipvlan的设计实现有关,ipvlan L2E模式它优先进行二层转发,再进行三层转发。 - [集群节点使用networkpolicy概率性出现panic问题](https://support.huaweicloud.com/cce_faq/cce_faq_00303.md): 集群版本:v1.15.6-r1版本集群类型:CCE集群网络模式:容器隧道网络模式节点操作系统:CentOS 7.6上述集群的用户配置使用networkpolicy后,由于节点上canal-agent网络组件与CentOS 7.6内核存在不兼容,概率性导致CentOS 7.6的节点panic。以下三条为必要条件,若有一条不满足,则您不会受到 - [节点远程登录界面(VNC)打印较多source ip_type日志问题](https://support.huaweicloud.com/cce_faq/cce_faq_00304.md): 集群版本:v1.15.6-r1版本集群类型:CCE集群网络模式:VPC网络节点操作系统:CentOS 7.6上述节点的容器进行容器间通信时,由于容器网络组件在VNC界面打印较多source ip_type或者not ipvlan but in own host日志,导致影响节点VNC界面使用体验及高负载场景下的容器网络性能。现象如下:1、 - [使用IE浏览器访问nginx-ingress出现重定向308无法访问](https://support.huaweicloud.com/cce_faq/cce_faq_00423.md): NGINX Ingress控制器从较老的版本升级后,使用IE浏览器无法访问已有的服务,状态码显示为308。NGINX Ingress控制器在升级后默认的永久重定向状态码从301变成了308,而部分老版本的IE浏览器不支持308重定向,因此出现无法访问的问题。NGINX Ingress控制器社区issue:https://github.co - [NGINX Ingress控制器插件升级导致集群内Nginx类型的Ingress路由访问异常](https://support.huaweicloud.com/cce_faq/cce_faq_00430.md): 集群中存在未指定Ingress类型(annotations中未添加kubernetes.io/ingress.class: nginx)的Nginx Ingress路由,NGINX Ingress控制器插件从1.x版本升级至2.x版本后,服务中断。针对Nginx类型的Ingress资源,查看对应Ingress的YAML,如Ingress的 - [负载均衡型Service更新出现错误:Quota exceeded for resources: members_per_pool](https://support.huaweicloud.com/cce_faq/cce_faq_00435.md): 负载均衡型Service更新时出现错误,信息如下:ELB单后端服务器组可添加的后端服务器数量默认配额上限值为500。在CCE Turbo集群中使用独享型ELB创建Service时,Service关联的每个Pod实例都会在ELB侧创建一个后端服务器,当后端服务器数量超过配额上限时,会出现以上错误。解决方法:根据业务需求对负载均衡器的后端服务 - [ELB Ingress出现告警:Invalid input for rules](https://support.huaweicloud.com/cce_faq/cce_faq_00483.md): 创建或更新ELB Ingress时出现告警,信息如下:该告警中的错误码ELB.8902表示请求参数输入有误,详情请参见弹性负载均衡错误码。您需要根据问题原因修改正确的参数配置。 - [为ELB Ingress配置了HTTPS证书后访问异常的原因有哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00455.md): 为ELB Ingress配置了HTTPS证书后,如果证书配置出现以下问题,可能导致访问异常,您可以参考表格中的原因进行排查。您可以通过以下命令查看证书的过期时间、域名等信息,其中ca.crt为证书路径。使用TLS类型的密钥证书:需要将证书导入至Secret中,CCE会将该证书自动配置到ELB侧(证书名以k8s_plb_default开头) - [Nginx Ingress中默认开启HSTS会导致HTTP请求重定向到HTTPS](https://support.huaweicloud.com/cce_faq/cce_faq_00489.md): Nginx Ingress中没有配置HTTP重定向至HTTPS,nginx.ingress.kubernetes.io/ssl-redirect设置为false,但是访问HTTPS之后再访问HTTP会被重定向成HTTPS。NGINX Ingress控制器默认开启HTTP Strict Transport Security(HSTS)配置, - [ELB Ingress配置HTTPS证书后请求访问失败](https://support.huaweicloud.com/cce_faq/cce_faq_00503.md): ELB Ingress在转发策略中指定域名,同时配置HTTPS服务器证书后,访问域名出现TLS握手失败。ELB Ingress转发策略中配置的域名与服务器证书所带的域名不匹配。如果ELB Ingress的转发策略中需要根据域名进行匹配,建议为Ingress配置SNI证书,详情请参见为ELB Ingress配置服务器名称指示(SNI)。尤其 - [ELB Ingress转发规则匹配不符合预期怎么解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00511.md): 在Ingress中配置了多条转发规则时,当请求同时匹配多条规则,实际流量可能被转发至非预期的后端路径。该现象通常由于ELB(弹性负载均衡)侧的转发规则优先级排序不符合预期所致。ELB默认根据域名和URL的匹配逻辑对转发规则进行排序;若启用了高级转发策略,则按规则创建顺序决定优先级。若未显式控制优先级,可能导致匹配结果与预期不一致。具体转发 - [集群与虚拟私有云、子网的关系是怎样的?](https://support.huaweicloud.com/cce_faq/cce_faq_00266.md): 虚拟私有云类似家庭生活中路由器管理192.168.0.0/16的私有局域网,是为用户在云上构建的一个私有网络,是弹性云服务器、负载均衡、中间件等工作的基本网络环境。根据实际业务需要可以设置不同规模的网络,一般可为10.0.0.0/8~24,172.16.0.0/12~24,192.168.0.0/16~24。子网是虚拟私有云中的一个子集, - [如何查看虚拟私有云VPC的网段?](https://support.huaweicloud.com/cce_faq/cce_faq_00148.md): 在虚拟私有云页面,可查看虚拟私有云的名称/ID和VPC网段。用户可以调整已创建的VPC或通过重新创建VPC调整网段。 - [如何设置CCE集群中的VPC网段和子网网段?](https://support.huaweicloud.com/cce_faq/cce_faq_00144.md): VPC中的子网网段一旦创建,便无法更改。创建虚拟私有云时,请预留一定的VPC网段和子网网段资源,避免后续无法扩容。子网网段可在创建虚拟私有云页面的子网配置 > 子网网段中进行设置。在设置选项下可查看到可用IP数。容器网段掩码如果设置不合适,会导致集群实际可用的节点较少。例如:节点规模为1000,子网可以选择192.168.0.0/20,支 - [如何设置CCE集群中的容器网段?](https://support.huaweicloud.com/cce_faq/cce_faq_00142.md): 进入CCE控制台,在创建集群时进行容器网段设置。当前可供选择的容器网段为10.0.0.0/8~18,172.16.0.0/16~18,192.168.0.0/16~18。集群创建完成后,如需添加容器网段,可前往集群信息页面,单击“添加容器网段”进行添加。使用“容器隧道网络”模型的集群暂不支持添加容器网段。容器网段添加后无法删除,请谨慎操作 - [什么是云原生网络2.0网络模式,适用于什么场景?](https://support.huaweicloud.com/cce_faq/cce_faq_00246.md): 云原生网络2.0是新一代容器网络模型,深度整合了虚拟私有云VPC的原生弹性网卡(Elastic Network Interface,简称ENI)能力,采用VPC网段分配容器地址,支持ELB直通容器,享有高性能。仅CCE Turbo集群支持使用云原生网络2.0。由于云原生网络2.0直接使用的VPC网络,性能与VPC网络的性能几乎一致,所以适 - [什么是弹性网卡?](https://support.huaweicloud.com/cce_faq/cce_faq_00294.md): 弹性网卡即虚拟网卡,您可以通过创建并配置弹性网卡,并将其附加到您的云服务器实例(包括弹性云服务器和裸金属服务器)上,实现灵活、高可用的网络方案配置。主弹性网卡:在创建云服务器实例时,随实例默认创建的弹性网卡称作主弹性网卡。主弹性网卡无法与实例进行解绑。扩展弹性网卡:您可以创建扩展弹性网卡,将其附加到云服务器实例上,您也可以将其从实例上进行 - [如何修改集群安全组规则配置](https://support.huaweicloud.com/cce_faq/cce_faq_00265.md): CCE作为通用的容器平台,安全组规则的设置适用于通用场景。集群在创建时将会自动为Master节点和Node节点分别创建一个安全组,其中Master节点的安全组名称是:{集群名}-cce-control-{随机ID};Node节点的安全组名称是:{集群名}-cce-node-{随机ID}。使用CCE Turbo集群时会额外创建一个ENI的安 - [创建CCE Turbo集群时如何设置IPv6服务网段](https://support.huaweicloud.com/cce_faq/cce_faq_00406.md): 当您需要创建一个IPv4/IPv6双栈的CCE Turbo集群时,需要设置IPv6服务网段,该网段默认值为fc00::/112,包含了65536个IPv6服务地址。如果您需要自定义服务网段,您可参考本文进行设置。IPv6地址IPv6地址采用128位二进制表示,是IPv4地址长度的4倍。因此IPv4地址的十进制格式不再适用,IPv6采用了十 - [CCE集群的节点是否支持绑定多网卡?](https://support.huaweicloud.com/cce_faq/cce_faq_00245.md): CCE集群的节点不支持绑定多网卡,请勿手动绑定多网卡,否则会对集群的网络访问造成影响。 - [集群与虚拟私有云、子网的关系是怎样的?](https://support.huaweicloud.com/cce_faq/cce_faq_00266.md): 虚拟私有云类似家庭生活中路由器管理192.168.0.0/16的私有局域网,是为用户在云上构建的一个私有网络,是弹性云服务器、负载均衡、中间件等工作的基本网络环境。根据实际业务需要可以设置不同规模的网络,一般可为10.0.0.0/8~24,172.16.0.0/12~24,192.168.0.0/16~24。子网是虚拟私有云中的一个子集, - [如何查看虚拟私有云VPC的网段?](https://support.huaweicloud.com/cce_faq/cce_faq_00148.md): 在虚拟私有云页面,可查看虚拟私有云的名称/ID和VPC网段。用户可以调整已创建的VPC或通过重新创建VPC调整网段。 - [如何设置CCE集群中的VPC网段和子网网段?](https://support.huaweicloud.com/cce_faq/cce_faq_00144.md): VPC中的子网网段一旦创建,便无法更改。创建虚拟私有云时,请预留一定的VPC网段和子网网段资源,避免后续无法扩容。子网网段可在创建虚拟私有云页面的子网配置 > 子网网段中进行设置。在设置选项下可查看到可用IP数。容器网段掩码如果设置不合适,会导致集群实际可用的节点较少。例如:节点规模为1000,子网可以选择192.168.0.0/20,支 - [如何设置CCE集群中的容器网段?](https://support.huaweicloud.com/cce_faq/cce_faq_00142.md): 进入CCE控制台,在创建集群时进行容器网段设置。当前可供选择的容器网段为10.0.0.0/8~18,172.16.0.0/16~18,192.168.0.0/16~18。集群创建完成后,如需添加容器网段,可前往集群信息页面,单击“添加容器网段”进行添加。使用“容器隧道网络”模型的集群暂不支持添加容器网段。容器网段添加后无法删除,请谨慎操作 - [什么是云原生网络2.0网络模式,适用于什么场景?](https://support.huaweicloud.com/cce_faq/cce_faq_00246.md): 云原生网络2.0是新一代容器网络模型,深度整合了虚拟私有云VPC的原生弹性网卡(Elastic Network Interface,简称ENI)能力,采用VPC网段分配容器地址,支持ELB直通容器,享有高性能。仅CCE Turbo集群支持使用云原生网络2.0。由于云原生网络2.0直接使用的VPC网络,性能与VPC网络的性能几乎一致,所以适 - [什么是弹性网卡?](https://support.huaweicloud.com/cce_faq/cce_faq_00294.md): 弹性网卡即虚拟网卡,您可以通过创建并配置弹性网卡,并将其附加到您的云服务器实例(包括弹性云服务器和裸金属服务器)上,实现灵活、高可用的网络方案配置。主弹性网卡:在创建云服务器实例时,随实例默认创建的弹性网卡称作主弹性网卡。主弹性网卡无法与实例进行解绑。扩展弹性网卡:您可以创建扩展弹性网卡,将其附加到云服务器实例上,您也可以将其从实例上进行 - [如何修改集群安全组规则配置](https://support.huaweicloud.com/cce_faq/cce_faq_00265.md): CCE作为通用的容器平台,安全组规则的设置适用于通用场景。集群在创建时将会自动为Master节点和Node节点分别创建一个安全组,其中Master节点的安全组名称是:{集群名}-cce-control-{随机ID};Node节点的安全组名称是:{集群名}-cce-node-{随机ID}。使用CCE Turbo集群时会额外创建一个ENI的安 - [创建CCE Turbo集群时如何设置IPv6服务网段](https://support.huaweicloud.com/cce_faq/cce_faq_00406.md): 当您需要创建一个IPv4/IPv6双栈的CCE Turbo集群时,需要设置IPv6服务网段,该网段默认值为fc00::/112,包含了65536个IPv6服务地址。如果您需要自定义服务网段,您可参考本文进行设置。IPv6地址IPv6地址采用128位二进制表示,是IPv4地址长度的4倍。因此IPv4地址的十进制格式不再适用,IPv6采用了十 - [CCE集群的节点是否支持绑定多网卡?](https://support.huaweicloud.com/cce_faq/cce_faq_00245.md): CCE集群的节点不支持绑定多网卡,请勿手动绑定多网卡,否则会对集群的网络访问造成影响。 - [集群节点如何不暴露到公网?](https://support.huaweicloud.com/cce_faq/cce_faq_00267.md): 问题描述:集群节点如何不暴露到公网?问题解决:如果不需要访问集群节点的22端口,可在安全组规则中禁用22端口的访问。如非必须,集群节点不建议绑定EIP。如有远程登录集群节点的需求,推荐使用华为云堡垒机服务作为中转连接集群节点。 - [如何配置集群的访问策略](https://support.huaweicloud.com/cce_faq/cce_faq_00417.md): 为集群绑定公网API Server地址后,建议修改控制节点5443端口的安全组规则,加固集群的访问控制策略。除客户端IP外,端口还需保留对VPC网段、容器网段和托管网格控制面网段放通,以保证集群内部可访问API Server。如果您需要使用CloudShell功能,请保留5443端口对198.19.0.0/16网段放通,否则将无法访问集群 - [如何获取TLS密钥证书?](https://support.huaweicloud.com/cce_faq/cce_faq_00185.md): 当您的Ingress需要使用HTTPS协议时,创建Ingress时必须配置IngressTLS或kubernetes.io/tls类型的密钥。以创建IngressTLS密钥证书为例。如图1:创建密钥时密钥数据中上传的证书文件和私钥文件必须是配套的,不然会出现无效的情况。一般情况下,您需要从证书提供商处获取有效的合法证书。如果您需要在测试环 - [如何批量修改集群node节点安全组?](https://support.huaweicloud.com/cce_faq/cce_faq_00392.md): 一个安全组关联的实例数量建议不超过1000个,否则可能引起安全组性能下降。更多关于安全组的限制请参考安全组限制。通过修改左下角的单页最大显示条数,您可至多一次性添加20台服务器至安全组中。加入新的安全组后,节点仍保留原安全组。如需移除,请单击原安全组的管理实例按钮,并勾选其中的节点服务器进行移除。加入新的安全组后,节点仍保留原安全组。如需 - [集群节点如何不暴露到公网?](https://support.huaweicloud.com/cce_faq/cce_faq_00267.md): 问题描述:集群节点如何不暴露到公网?问题解决:如果不需要访问集群节点的22端口,可在安全组规则中禁用22端口的访问。如非必须,集群节点不建议绑定EIP。如有远程登录集群节点的需求,推荐使用华为云堡垒机服务作为中转连接集群节点。 - [如何配置集群的访问策略](https://support.huaweicloud.com/cce_faq/cce_faq_00417.md): 为集群绑定公网API Server地址后,建议修改控制节点5443端口的安全组规则,加固集群的访问控制策略。除客户端IP外,端口还需保留对VPC网段、容器网段和托管网格控制面网段放通,以保证集群内部可访问API Server。如果您需要使用CloudShell功能,请保留5443端口对198.19.0.0/16网段放通,否则将无法访问集群 - [如何获取TLS密钥证书?](https://support.huaweicloud.com/cce_faq/cce_faq_00185.md): 当您的Ingress需要使用HTTPS协议时,创建Ingress时必须配置IngressTLS或kubernetes.io/tls类型的密钥。以创建IngressTLS密钥证书为例。如图1:创建密钥时密钥数据中上传的证书文件和私钥文件必须是配套的,不然会出现无效的情况。一般情况下,您需要从证书提供商处获取有效的合法证书。如果您需要在测试环 - [如何批量修改集群node节点安全组?](https://support.huaweicloud.com/cce_faq/cce_faq_00392.md): 一个安全组关联的实例数量建议不超过1000个,否则可能引起安全组性能下降。更多关于安全组的限制请参考安全组限制。通过修改左下角的单页最大显示条数,您可至多一次性添加20台服务器至安全组中。加入新的安全组后,节点仍保留原安全组。如需移除,请单击原安全组的管理实例按钮,并勾选其中的节点服务器进行移除。加入新的安全组后,节点仍保留原安全组。如需 - [CCE如何与其他服务进行内网通信?](https://support.huaweicloud.com/cce_faq/cce_faq_00103.md): 与CCE进行内网通信的华为云常见服务有:RDS、DMS、Kafka、RabbitMQ、VPN、ModelArts等,有如下两种场景:在同一个VPC网络下,CCE节点可以与此VPC下的所有服务进行互通。CCE的容器与其他服务通信时,需要关注对端是否开启了容器网段的入方向的安全组规则(此限制只针对于CCE的集群为VPC网络模式)。如果不在同一 - [使用CCE设置工作负载访问方式时,端口如何填写?](https://support.huaweicloud.com/cce_faq/cce_faq_00108.md): CCE支持工作负载的内部互访和被互联网访问两种方式。内部访问:包括集群内访问(通过集群虚拟IP)和节点访问(通过节点私有IP)两种方式。内部访问类型说明内部访问类型说明端口如何填写集群内访问(通过集群虚拟IP)用于工作负载之间的互访,例如某个后端工作负载需要和前端工作负载互访,就需要选择该类型来实现内部互访。集群虚拟IP,即Cluster - [Ingress中的property字段如何实现与社区client-go兼容?](https://support.huaweicloud.com/cce_faq/cce_faq_00234.md): 社区Ingress结构体中没有property属性,导致用户使用client-go调用创建ingress的api接口时,创建的Ingress中没有property属性。为了与社区的client-go兼容,CCE提供了如下解决方案。在使用client-go创建Ingress实例时,在annotation中做如下声明:匹配规则:用户调用CCE - [服务加入Istio后,如何获取客户端真实源IP?](https://support.huaweicloud.com/cce_faq/cce_faq_00299.md): 服务启用Istio后,访问日志中无法获取到客户端源IP。本文以绑定ELB类型Service的nginx应用为例,详细步骤如下:独享型ELB默认开启源地址透传功能,无需手动开启。在管理控制台左上角单击图标,选择区域和项目。选择“服务列表 > 网络 > 弹性负载均衡 ELB”。在“弹性负载均衡器”界面,单击需要操作的负载均衡名称。切换到“监听 - [为什么更换命名空间后无法创建Ingress?](https://support.huaweicloud.com/cce_faq/cce_faq_00298.md): 在default命名空间下可以正常创建ingress,但在其他命名空间(如:ns)下创建时不能创建成功。创建弹性负载均衡ELB后,使用default命名空间创建80端口的http监听,在CCE中只允许在本命名空间下创建同一端口的其它ingress(实际转发策略可根据域名、service来区分);所以出现客户侧在其它命名空间无法创建相同端口 - [服务发布到ELB,ELB的后端为何会被自动删除?](https://support.huaweicloud.com/cce_faq/cce_faq_00248.md): 问题描述:服务发布到ELB,工作负载已正常,但服务的pod端口未及时发布出来,ELB里的后端会被自动删除。问题解答:创建ELB时候,如果ELB健康检查失败,后端服务器组会删除,而且后续服务正常以后也不会添加。如果是更新已有的SVC时则不会删除。添加删除节点的时候,由于集群状态的改变,可能会引起集群内的Node访问方式的改变,为保证服务正常 - [如何使容器重启后所在容器IP仍保持不变?](https://support.huaweicloud.com/cce_faq/cce_faq_00192.md): 如果集群下仅有1个节点时,要使容器重启后所在容器IP保持不变,需在工作负载中配置主机网络,在工作负载的yaml中的spec.spec.下加入hostNetwork: true字段。如果集群下有多个节点时,除进行以上操作外,还需要设置节点的亲和策略,但工作负载创建后实例运行数不得超过亲和的节点数。进行如上设置并在工作负载运行后,工作负载实例 - [如何确认网卡不被集群占用?](https://support.huaweicloud.com/cce_faq/cce_faq_00446.md): 在CCE Turbo集群中,v1.23.17-r0、v1.25.12-r0、v1.27.9-r0、v1.28.7-r0、v1.29.3-r0及以上版本的集群支持删除容器子网。删除集群容器子网属于高危操作,您需要确保当前集群正在使用的网卡中没有网卡属于该子网,包含Pod正在使用和集群预热的网卡。如果需要清理集群内使用的子网网卡,需要提交工单 - [删除子网后如何删除安全组规则?](https://support.huaweicloud.com/cce_faq/cce_faq_00447.md): 在CCE Turbo集群中,v1.23.17-r0、v1.25.12-r0、v1.27.9-r0、v1.28.7-r0、v1.29.3-r0及以上版本的集群支持删除容器子网。删除子网后,CCE默认生成的节点级的安全组不会自动清理待删除子网的安全组规则,需要手动清理。 - [不同命名空间下的Ingress共用监听器时如何同步生效的证书?](https://support.huaweicloud.com/cce_faq/cce_faq_00459.md): 在同一个集群中,多个Ingress可以使用同一个监听器(即使用同一个负载均衡器的同一个端口)。如果两个Ingress均配置了HTTPS证书,则生效的服务器证书将以最早创建的Ingress配置为准。但是不同命名空间下的Ingress对接同一个监听器且使用TLS密钥类型证书时,由于命名空间隔离,后创建的Ingress可能出现无法正常显示TLS - [如何确认监听器配置生效的Ingress](https://support.huaweicloud.com/cce_faq/cce_faq_00460.md): CCE支持将多个Ingress对接到同一个ELB的监听器,并创建不同的转发策略。由于监听器配置参数通过annotation方式承载,因此可能存在同一个监听器配置在多个Ingress上有不同配置参数的场景。本文为您介绍如何确认监听器配置生效Ingress。由于对接同监听器的路由(Ingress)均可配置监听器参数,因此CCE采取首个创建的I - [如何扩展单个CCE Turbo集群能支持的最大网卡数?](https://support.huaweicloud.com/cce_faq/cce_faq_00507.md): CCE Turbo采用的是云原生网络2.0网络模式,Pod直接使用的是从VPC分配出来的网卡,每个网卡默认关联该集群的ENI安全组。由于单个安全组关联的网卡数存在上限,默认值为5万。如果不做任何配置,假设没有预热的容器网卡,单个CCE Turbo集群最多只能运行5万个使用容器网络的Pod。您可以使用以下方法扩展单集群能支持的最大网卡数: - [CCE如何与其他服务进行内网通信?](https://support.huaweicloud.com/cce_faq/cce_faq_00103.md): 与CCE进行内网通信的华为云常见服务有:RDS、DMS、Kafka、RabbitMQ、VPN、ModelArts等,有如下两种场景:在同一个VPC网络下,CCE节点可以与此VPC下的所有服务进行互通。CCE的容器与其他服务通信时,需要关注对端是否开启了容器网段的入方向的安全组规则(此限制只针对于CCE的集群为VPC网络模式)。如果不在同一 - [使用CCE设置工作负载访问方式时,端口如何填写?](https://support.huaweicloud.com/cce_faq/cce_faq_00108.md): CCE支持工作负载的内部互访和被互联网访问两种方式。内部访问:包括集群内访问(通过集群虚拟IP)和节点访问(通过节点私有IP)两种方式。内部访问类型说明内部访问类型说明端口如何填写集群内访问(通过集群虚拟IP)用于工作负载之间的互访,例如某个后端工作负载需要和前端工作负载互访,就需要选择该类型来实现内部互访。集群虚拟IP,即Cluster - [Ingress中的property字段如何实现与社区client-go兼容?](https://support.huaweicloud.com/cce_faq/cce_faq_00234.md): 社区Ingress结构体中没有property属性,导致用户使用client-go调用创建ingress的api接口时,创建的Ingress中没有property属性。为了与社区的client-go兼容,CCE提供了如下解决方案。在使用client-go创建Ingress实例时,在annotation中做如下声明:匹配规则:用户调用CCE - [服务加入Istio后,如何获取客户端真实源IP?](https://support.huaweicloud.com/cce_faq/cce_faq_00299.md): 服务启用Istio后,访问日志中无法获取到客户端源IP。本文以绑定ELB类型Service的nginx应用为例,详细步骤如下:独享型ELB默认开启源地址透传功能,无需手动开启。在管理控制台左上角单击图标,选择区域和项目。选择“服务列表 > 网络 > 弹性负载均衡 ELB”。在“弹性负载均衡器”界面,单击需要操作的负载均衡名称。切换到“监听 - [为什么更换命名空间后无法创建Ingress?](https://support.huaweicloud.com/cce_faq/cce_faq_00298.md): 在default命名空间下可以正常创建ingress,但在其他命名空间(如:ns)下创建时不能创建成功。创建弹性负载均衡ELB后,使用default命名空间创建80端口的http监听,在CCE中只允许在本命名空间下创建同一端口的其它ingress(实际转发策略可根据域名、service来区分);所以出现客户侧在其它命名空间无法创建相同端口 - [服务发布到ELB,ELB的后端为何会被自动删除?](https://support.huaweicloud.com/cce_faq/cce_faq_00248.md): 问题描述:服务发布到ELB,工作负载已正常,但服务的pod端口未及时发布出来,ELB里的后端会被自动删除。问题解答:创建ELB时候,如果ELB健康检查失败,后端服务器组会删除,而且后续服务正常以后也不会添加。如果是更新已有的SVC时则不会删除。添加删除节点的时候,由于集群状态的改变,可能会引起集群内的Node访问方式的改变,为保证服务正常 - [如何使容器重启后所在容器IP仍保持不变?](https://support.huaweicloud.com/cce_faq/cce_faq_00192.md): 如果集群下仅有1个节点时,要使容器重启后所在容器IP保持不变,需在工作负载中配置主机网络,在工作负载的yaml中的spec.spec.下加入hostNetwork: true字段。如果集群下有多个节点时,除进行以上操作外,还需要设置节点的亲和策略,但工作负载创建后实例运行数不得超过亲和的节点数。进行如上设置并在工作负载运行后,工作负载实例 - [如何确认网卡不被集群占用?](https://support.huaweicloud.com/cce_faq/cce_faq_00446.md): 在CCE Turbo集群中,v1.23.17-r0、v1.25.12-r0、v1.27.9-r0、v1.28.7-r0、v1.29.3-r0及以上版本的集群支持删除容器子网。删除集群容器子网属于高危操作,您需要确保当前集群正在使用的网卡中没有网卡属于该子网,包含Pod正在使用和集群预热的网卡。如果需要清理集群内使用的子网网卡,需要提交工单 - [删除子网后如何删除安全组规则?](https://support.huaweicloud.com/cce_faq/cce_faq_00447.md): 在CCE Turbo集群中,v1.23.17-r0、v1.25.12-r0、v1.27.9-r0、v1.28.7-r0、v1.29.3-r0及以上版本的集群支持删除容器子网。删除子网后,CCE默认生成的节点级的安全组不会自动清理待删除子网的安全组规则,需要手动清理。 - [不同命名空间下的Ingress共用监听器时如何同步生效的证书?](https://support.huaweicloud.com/cce_faq/cce_faq_00459.md): 在同一个集群中,多个Ingress可以使用同一个监听器(即使用同一个负载均衡器的同一个端口)。如果两个Ingress均配置了HTTPS证书,则生效的服务器证书将以最早创建的Ingress配置为准。但是不同命名空间下的Ingress对接同一个监听器且使用TLS密钥类型证书时,由于命名空间隔离,后创建的Ingress可能出现无法正常显示TLS - [如何确认监听器配置生效的Ingress](https://support.huaweicloud.com/cce_faq/cce_faq_00460.md): CCE支持将多个Ingress对接到同一个ELB的监听器,并创建不同的转发策略。由于监听器配置参数通过annotation方式承载,因此可能存在同一个监听器配置在多个Ingress上有不同配置参数的场景。本文为您介绍如何确认监听器配置生效Ingress。由于对接同监听器的路由(Ingress)均可配置监听器参数,因此CCE采取首个创建的I - [如何扩展单个CCE Turbo集群能支持的最大网卡数?](https://support.huaweicloud.com/cce_faq/cce_faq_00507.md): CCE Turbo采用的是云原生网络2.0网络模式,Pod直接使用的是从VPC分配出来的网卡,每个网卡默认关联该集群的ENI安全组。由于单个安全组关联的网卡数存在上限,默认值为5万。如果不做任何配置,假设没有预热的容器网卡,单个CCE Turbo集群最多只能运行5万个使用容器网络的Pod。您可以使用以下方法扩展单集群能支持的最大网卡数: - [如何扩容容器的存储空间?](https://support.huaweicloud.com/cce_faq/cce_faq_00224.md): 容器默认大小为10G,当容器中产生数据较多时,容易导致容器存储空间不足,可以通过此方法来扩容。重置节点操作可能导致与节点有绑定关系的资源(本地存储,指定调度节点的负载等)无法正常使用。请谨慎操作,避免对运行中的业务造成影响。如需对容器存储空间进行调整,请重点关注以下配置。存储配置:单击数据盘后方的“展开高级配置”可进行如下设置:Pod容器 - [CCE支持的存储在持久化和多节点挂载方面有什么区别?](https://support.huaweicloud.com/cce_faq/cce_faq_00038.md): 容器存储是为容器工作负载提供存储的组件,支持多种类型的存储,同一个工作负载(pod)可以使用任意数量的存储。当前云容器引擎CCE支持本地磁盘存储、云硬盘存储卷、文件存储卷、对象存储卷和极速文件存储卷。各类存储的区别和对比如下:创建工作负载时,可以使用以下类型的存储。建议将工作负载pod数据存储在云存储上。若存储在本地磁盘上,节点异常无法恢 - [创建CCE节点时可以不添加数据盘吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00089.md): 如果“系统组件存储”选择“系统盘”,可以不添加数据盘。如果“系统组件存储”选择“数据盘”,数据盘是必须要的。新建节点会给节点绑定一个供kubelet及容器运行时使用的专用数据盘,详情请参见数据盘空间分配说明。CCE数据盘默认使用LVM(Logical Volume Manager)进行磁盘管理,开启后您可以通过空间分配调整数据盘中不同资源 - [EVS存储卷的底层存储被删除或者过期后,数据是否可以恢复?](https://support.huaweicloud.com/cce_faq/cce_faq_00019.md): 当底层云硬盘被删除时,可能存在以下场景:若您已为原PVC创建快照,则可直接通过快照恢复数据,具体请参见使用快照创建PVC。若您已开启云硬盘回收站功能,则可以通过回收站找回,具体请参见恢复回收站中的云硬盘。若不满足以上场景,则原数据无法找回。若您已为原PVC创建快照,则可直接通过快照恢复数据,具体请参见使用快照创建PVC。若您已开启云硬盘回 - [公网访问CCE部署的服务并上传OBS,为何报错找不到host?](https://support.huaweicloud.com/cce_faq/cce_faq_00218.md): 线下机器访问CCE部署的服务并上传OBS,报错找不到host,报错截图如下:服务收到http请求之后,向OBS传输文件,这些报文都会经过Proxy。传输文件总量很大的话,会消耗很多资源,目前proxy分配内存128M,在压测场景下,损耗非常大,最终导致请求失败。目前压测所有流量都经过Proxy,业务量大就要加大分配资源。传文件涉及大量报文 - [Pod接口ExtendPathMode: PodUID如何与社区client-go兼容?](https://support.huaweicloud.com/cce_faq/cce_faq_00235.md): 社区Pod结构体中没有ExtendPathMode,用户使用client-go调用创建pod或deployment的API接口时,创建的pod中没有ExtendPathMode。为了与社区的client-go兼容,CCE提供了如下解决方案。创建pod时,在pod的annotation中需增加kubernetes.io/extend-pat - [创建存储卷失败如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00315.md): 创建PV或PVC失败,在事件中看到如下信息。事件信息表示账号被停用或没有权限,请检查账号状态是否正常。如账号正常请查看该用户的命名空间权限,您需要拥有该命名空间的开发权限、运维权限或管理员权限之一,或者包含PVC/PV读写操作的自定义权限。详情请参见配置命名空间权限(控制台)。 - [CCE容器云存储PVC能否感知底层存储故障?](https://support.huaweicloud.com/cce_faq/cce_faq_00316.md): CCE PVC按照社区逻辑实现,PVC本身的定义是存储声明,与底层存储解耦,不负责感知底层存储细节,因此没有感知底层存储故障的能力。云监控服务CES 具备查看云服务监控指标的能力:云监控服务基于云服务自身的服务属性,已经内置了详细全面的监控指标。当用户在云平台上开通云服务后,系统会根据服务类型自动关联该服务的监控指标,帮助用户实时掌握云服 - [通用文件系统(原SFS 3.0 容量型)在OS中的挂载点修改属组及权限报错](https://support.huaweicloud.com/cce_faq/cce_faq_00412.md): 将通用文件系统(原SFS 3.0 容量型)挂载到OS中某个目录后,该目录成为通用文件系统(原SFS 3.0 容量型)的挂载点,使用chown和chmod命令尝试修改挂载点的属组或权限,会遇到以下报错:或通用文件系统(原SFS 3.0 容量型)在OS中的挂载点的属组及权限不支持修改,请勿执行此类操作。 - [无法使用kubectl命令删除PV或PVC](https://support.huaweicloud.com/cce_faq/cce_faq_00418.md): 无法使用kubectl delete命令直接删除已有的PV或PVC,删除后会一直处于Terminating状态。Kubernetes为了防止误删除PV和PVC导致数据丢失,存在数据保护机制,无法使用delete命令直接删除。执行以下命令,先解除保护机制,再删除PV或PVC。如果已经使用kubectl delete命令删除PV或PVC,会一 - [删除挂载了云存储的Pod时提示target is busy](https://support.huaweicloud.com/cce_faq/cce_faq_00436.md): 在删除Pod时一直处于Terminating状态,通过节点上的/var/log/cce/kubernetes/kubelet.log路径查询kubelet日志,出现以下错误提示:出现以上问题的原因是宿主机上有其他进程正在使用该设备。您需要登录到Pod所在宿主机上查找正在使用该设备的进程,并终止对应的进程。回显示例如下:进程终止后,云存储会 - [无法自动创建包周期的云硬盘存储卷](https://support.huaweicloud.com/cce_faq/cce_faq_00441.md): 创建包周期的云硬盘存储卷时,无法为cce_cluster_agency委托添加支付权限。当集群版本为v1.23.14-r0、v1.25.9-r0、v1.27.6-r0、v1.28.4-r0及以上时支持动态创建包周期的云硬盘存储卷,且集群中需安装2.4.16及以上版本的Everest插件。cce_cluster_agency委托是CCE的系 - [误卸载存储池的磁盘后如何恢复](https://support.huaweicloud.com/cce_faq/cce_faq_00456.md): 存储池是Everest创建的一种Custom Resource,资源为nodelocalvolumes,该资源在正常情况下不建议手动操作。Everest每分钟会扫描空闲磁盘,并检查已添加进存储池的磁盘是否正常。Everest使用LVM进行存储池管理,本地持久卷和本地临时卷均为LVM中的一个卷组(Volume Group,VG):本地持久卷 - [删除动态创建的PVC之后,底层存储依旧残留](https://support.huaweicloud.com/cce_faq/cce_faq_00457.md): 删除集群中动态创建的PVC,PVC使用的StorageClass中reclaimPolicy为Delete模式,但删除PVC时底层存储却没有被同步删除。同时删除PVC和与其绑定的PV,会出现底层存储没有被同步删除的情况。在删除PVC前,尝试直接删除PV,但由于PV被PVC绑定而受到保护无法直接删除。然后再删除PVC,就会出现底层存储没有被 - [已释放的云硬盘重新绑定PV后,在Pod中挂载失败](https://support.huaweicloud.com/cce_faq/cce_faq_00498.md): 在Pod中挂载云硬盘存储卷时,报错信息中出现“wrong fs type, bad option, bad superblock on /dev/sda, missing codepage or helper program, or other error”,具体示例如下:云硬盘的文件系统类型与首次绑定的PV文件系统类型(fstype)一 - [如何扩容容器的存储空间?](https://support.huaweicloud.com/cce_faq/cce_faq_00224.md): 容器默认大小为10G,当容器中产生数据较多时,容易导致容器存储空间不足,可以通过此方法来扩容。重置节点操作可能导致与节点有绑定关系的资源(本地存储,指定调度节点的负载等)无法正常使用。请谨慎操作,避免对运行中的业务造成影响。如需对容器存储空间进行调整,请重点关注以下配置。存储配置:单击数据盘后方的“展开高级配置”可进行如下设置:Pod容器 - [CCE支持的存储在持久化和多节点挂载方面有什么区别?](https://support.huaweicloud.com/cce_faq/cce_faq_00038.md): 容器存储是为容器工作负载提供存储的组件,支持多种类型的存储,同一个工作负载(pod)可以使用任意数量的存储。当前云容器引擎CCE支持本地磁盘存储、云硬盘存储卷、文件存储卷、对象存储卷和极速文件存储卷。各类存储的区别和对比如下:创建工作负载时,可以使用以下类型的存储。建议将工作负载pod数据存储在云存储上。若存储在本地磁盘上,节点异常无法恢 - [创建CCE节点时可以不添加数据盘吗?](https://support.huaweicloud.com/cce_faq/cce_faq_00089.md): 如果“系统组件存储”选择“系统盘”,可以不添加数据盘。如果“系统组件存储”选择“数据盘”,数据盘是必须要的。新建节点会给节点绑定一个供kubelet及容器运行时使用的专用数据盘,详情请参见数据盘空间分配说明。CCE数据盘默认使用LVM(Logical Volume Manager)进行磁盘管理,开启后您可以通过空间分配调整数据盘中不同资源 - [EVS存储卷的底层存储被删除或者过期后,数据是否可以恢复?](https://support.huaweicloud.com/cce_faq/cce_faq_00019.md): 当底层云硬盘被删除时,可能存在以下场景:若您已为原PVC创建快照,则可直接通过快照恢复数据,具体请参见使用快照创建PVC。若您已开启云硬盘回收站功能,则可以通过回收站找回,具体请参见恢复回收站中的云硬盘。若不满足以上场景,则原数据无法找回。若您已为原PVC创建快照,则可直接通过快照恢复数据,具体请参见使用快照创建PVC。若您已开启云硬盘回 - [公网访问CCE部署的服务并上传OBS,为何报错找不到host?](https://support.huaweicloud.com/cce_faq/cce_faq_00218.md): 线下机器访问CCE部署的服务并上传OBS,报错找不到host,报错截图如下:服务收到http请求之后,向OBS传输文件,这些报文都会经过Proxy。传输文件总量很大的话,会消耗很多资源,目前proxy分配内存128M,在压测场景下,损耗非常大,最终导致请求失败。目前压测所有流量都经过Proxy,业务量大就要加大分配资源。传文件涉及大量报文 - [Pod接口ExtendPathMode: PodUID如何与社区client-go兼容?](https://support.huaweicloud.com/cce_faq/cce_faq_00235.md): 社区Pod结构体中没有ExtendPathMode,用户使用client-go调用创建pod或deployment的API接口时,创建的pod中没有ExtendPathMode。为了与社区的client-go兼容,CCE提供了如下解决方案。创建pod时,在pod的annotation中需增加kubernetes.io/extend-pat - [创建存储卷失败如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00315.md): 创建PV或PVC失败,在事件中看到如下信息。事件信息表示账号被停用或没有权限,请检查账号状态是否正常。如账号正常请查看该用户的命名空间权限,您需要拥有该命名空间的开发权限、运维权限或管理员权限之一,或者包含PVC/PV读写操作的自定义权限。详情请参见配置命名空间权限(控制台)。 - [CCE容器云存储PVC能否感知底层存储故障?](https://support.huaweicloud.com/cce_faq/cce_faq_00316.md): CCE PVC按照社区逻辑实现,PVC本身的定义是存储声明,与底层存储解耦,不负责感知底层存储细节,因此没有感知底层存储故障的能力。云监控服务CES 具备查看云服务监控指标的能力:云监控服务基于云服务自身的服务属性,已经内置了详细全面的监控指标。当用户在云平台上开通云服务后,系统会根据服务类型自动关联该服务的监控指标,帮助用户实时掌握云服 - [通用文件系统(原SFS 3.0 容量型)在OS中的挂载点修改属组及权限报错](https://support.huaweicloud.com/cce_faq/cce_faq_00412.md): 将通用文件系统(原SFS 3.0 容量型)挂载到OS中某个目录后,该目录成为通用文件系统(原SFS 3.0 容量型)的挂载点,使用chown和chmod命令尝试修改挂载点的属组或权限,会遇到以下报错:或通用文件系统(原SFS 3.0 容量型)在OS中的挂载点的属组及权限不支持修改,请勿执行此类操作。 - [无法使用kubectl命令删除PV或PVC](https://support.huaweicloud.com/cce_faq/cce_faq_00418.md): 无法使用kubectl delete命令直接删除已有的PV或PVC,删除后会一直处于Terminating状态。Kubernetes为了防止误删除PV和PVC导致数据丢失,存在数据保护机制,无法使用delete命令直接删除。执行以下命令,先解除保护机制,再删除PV或PVC。如果已经使用kubectl delete命令删除PV或PVC,会一 - [删除挂载了云存储的Pod时提示target is busy](https://support.huaweicloud.com/cce_faq/cce_faq_00436.md): 在删除Pod时一直处于Terminating状态,通过节点上的/var/log/cce/kubernetes/kubelet.log路径查询kubelet日志,出现以下错误提示:出现以上问题的原因是宿主机上有其他进程正在使用该设备。您需要登录到Pod所在宿主机上查找正在使用该设备的进程,并终止对应的进程。回显示例如下:进程终止后,云存储会 - [无法自动创建包周期的云硬盘存储卷](https://support.huaweicloud.com/cce_faq/cce_faq_00441.md): 创建包周期的云硬盘存储卷时,无法为cce_cluster_agency委托添加支付权限。当集群版本为v1.23.14-r0、v1.25.9-r0、v1.27.6-r0、v1.28.4-r0及以上时支持动态创建包周期的云硬盘存储卷,且集群中需安装2.4.16及以上版本的Everest插件。cce_cluster_agency委托是CCE的系 - [误卸载存储池的磁盘后如何恢复](https://support.huaweicloud.com/cce_faq/cce_faq_00456.md): 存储池是Everest创建的一种Custom Resource,资源为nodelocalvolumes,该资源在正常情况下不建议手动操作。Everest每分钟会扫描空闲磁盘,并检查已添加进存储池的磁盘是否正常。Everest使用LVM进行存储池管理,本地持久卷和本地临时卷均为LVM中的一个卷组(Volume Group,VG):本地持久卷 - [删除动态创建的PVC之后,底层存储依旧残留](https://support.huaweicloud.com/cce_faq/cce_faq_00457.md): 删除集群中动态创建的PVC,PVC使用的StorageClass中reclaimPolicy为Delete模式,但删除PVC时底层存储却没有被同步删除。同时删除PVC和与其绑定的PV,会出现底层存储没有被同步删除的情况。在删除PVC前,尝试直接删除PV,但由于PV被PVC绑定而受到保护无法直接删除。然后再删除PVC,就会出现底层存储没有被 - [已释放的云硬盘重新绑定PV后,在Pod中挂载失败](https://support.huaweicloud.com/cce_faq/cce_faq_00498.md): 在Pod中挂载云硬盘存储卷时,报错信息中出现“wrong fs type, bad option, bad superblock on /dev/sda, missing codepage or helper program, or other error”,具体示例如下:云硬盘的文件系统类型与首次绑定的PV文件系统类型(fstype)一 - [一个集群最多能创建多少个命名空间?](https://support.huaweicloud.com/cce_faq/cce_faq_00485.md): 在Kubernetes集群中并没有明确的硬性限制来规定一个集群中可以创建的命名空间数量,但在实际使用过程中,可创建命名空间的数量会受到一些其他因素的限制。资源限制对于CCE集群来说,集群的规模越大,集群控制平面节点的资源也会相对变大,能够支持的命名空间数量相对也会更多。但每个命名空间都会消耗一定的控制平面资源用于存储元数据,因此大量的命名 - [命名空间因APIService对象访问失败无法删除](https://support.huaweicloud.com/cce_faq/cce_faq_00325.md): 删除命名空间时,命名空间一直处“删除中”状态,无法删除。查看命名空间yaml配置,status中有报错“DiscoveryFailed”,示例如下:上图中报错信息为:Discovery failed for some groups, 1 failing: unable to retrieve the complete list of se - [如何删除Terminating状态的命名空间?](https://support.huaweicloud.com/cce_faq/cce_faq_00277.md): Kubernetes中namespace有两种常见的状态,即Active和Terminating状态。当对应的命名空间下还存在运行的资源,但该命名空间被删除时才会出现Terminating状态,这种情况下只要等待Kubernetes本身将命名空间下的资源回收后,该命名空间将会被系统自动删除。但是在某些情况下,即使命名空间下没有运行的资源, - [一个集群最多能创建多少个命名空间?](https://support.huaweicloud.com/cce_faq/cce_faq_00485.md): 在Kubernetes集群中并没有明确的硬性限制来规定一个集群中可以创建的命名空间数量,但在实际使用过程中,可创建命名空间的数量会受到一些其他因素的限制。资源限制对于CCE集群来说,集群的规模越大,集群控制平面节点的资源也会相对变大,能够支持的命名空间数量相对也会更多。但每个命名空间都会消耗一定的控制平面资源用于存储元数据,因此大量的命名 - [命名空间因APIService对象访问失败无法删除](https://support.huaweicloud.com/cce_faq/cce_faq_00325.md): 删除命名空间时,命名空间一直处“删除中”状态,无法删除。查看命名空间yaml配置,status中有报错“DiscoveryFailed”,示例如下:上图中报错信息为:Discovery failed for some groups, 1 failing: unable to retrieve the complete list of se - [如何删除Terminating状态的命名空间?](https://support.huaweicloud.com/cce_faq/cce_faq_00277.md): Kubernetes中namespace有两种常见的状态,即Active和Terminating状态。当对应的命名空间下还存在运行的资源,但该命名空间被删除时才会出现Terminating状态,这种情况下只要等待Kubernetes本身将命名空间下的资源回收后,该命名空间将会被系统自动删除。但是在某些情况下,即使命名空间下没有运行的资源, - [插件异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00474.md): 在插件安装、升级、更改配置等过程中出现异常问题时,控制台通常会提示相应的错误码。您可以根据错误码查找对应的问题,查看问题原因和解决方案。本文介绍常见错误码及其问题原因和解决方案。问题现象安装插件时,出现“内部错误”,错误码为CCE.03500001。问题原因出现“内部错误”时,错误信息内会提示具体的错误原因,如 ClusterRole \ - [集群安装nginx-ingress插件失败,一直处于创建中?](https://support.huaweicloud.com/cce_faq/cce_faq_00240.md): 客户已经购买并搭建了CCE集群,希望在公网上可以访问到CCE上部署的应用服务,目前最高效的方式是在ingress资源上注册该应用的Service路径,从而满足要求。但客户安装ingress插件后,插件状态一直显示创建中,nginx-ingress-controller的pod一直处于pending状态。nginx限制的内存资源不足导致无法 - [NPD插件版本过低导致进程资源残留问题](https://support.huaweicloud.com/cce_faq/cce_faq_00130.md): 在节点负载压力比较大的场景下,可能存在NPD进程资源残留的问题。登录到CCE集群的ECS节点,查询存在大量npd进程。升级CCE节点故障检测(简称NPD)插件至最新版本。如果CCE节点故障检测插件版本已经为1.13.6及以上版本,则不需要进行升级操作。 - [模板格式不正确,无法删除模板实例?](https://support.huaweicloud.com/cce_faq/cce_faq_00217.md): 若上传的模板中包含不正确或者不兼容的资源,会导致安装模板失败,类似下图:此时模板实例无法正常工作。如果您尝试在界面上删除,可能会出现deletion failed的报错,模板实例仍在列表中:您可以使用kubectl命令删除残留的模板实例。删除残留的模板实例无法从根本上解决该问题。为避免该问题再次发生,建议您及时更新模板中资源的apiVer - [CCE是否支持nginx-ingress?](https://support.huaweicloud.com/cce_faq/cce_faq_00013.md): nginx-ingress是比较热门的ingress-controller,作为反向代理将外部流量导入到集群内部,将Kubernetes内部的Service暴露给外部,在Ingress对象中通过域名匹配Service,这样就可以直接通过域名访问到集群内部的服务。nginx-ingress由ingress-controller和nginx组 - [插件安装失败,提示The release name is already exist如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00322.md): 当安装插件失败,返回 The release name is already exist 错误。当安装插件返回The release name is already exist错误时,表示kubernetes集群中有残留该插件release记录,一般由于集群etcd做过备份恢复或者该插件之前安装删除异常导致。通过kubectl对接集群,手 - [创建或升级模板失败,提示rendered manifests contain a resource that already exists](https://support.huaweicloud.com/cce_faq/cce_faq_00327.md): 创建或升级模板失败,提示“Create release by helm failed: rendered manifests contain a resource that already exists. Unable to continue with install: ...”的错误。由于CCE插件通过模板进行安装,因此安装或升级插件时 - [kube-prometheus-stack插件实例调度失败如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00424.md): 安装kube-prometheus-stack插件时, 插件状态一直处于“部分就绪”,查看插件的prometheus实例事件中提示“0/x nodes are available: x node(s) had volume node affinity conflict.”。如果选择安装grafana组件,也可能出现同样的问题。当出现以上报 - [上传模板失败如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00425.md): 上传模板时出现“请求失败,请稍后重试”的错误,错误码为SVCSTG.CCECAM.4000121,错误信息提示“Package name and version must be valid and same with chart name and version!”。当出现以上报错内容时,说明模板Chart.yaml文件中的name和ve - [如何根据集群规格调整插件配额?](https://support.huaweicloud.com/cce_faq/cce_faq_00429.md): 当您的集群规格调整后,可能需要根据集群规格相应地调整插件资源配额,以确保插件实例能够正常运行。例如,如果您将集群规格从50节点调整为200节点或以上,则需要增加插件CPU、内存配额,防止插件实例因需要调度过多的节点而出现OOM等异常。因此,在调整集群规格后,请您同时考虑调整插件资源配额。CoreDNS所能提供的域名解析QPS与CPU消耗成 - [NGINX Ingress控制器插件处于Unknown状态时卸载残留](https://support.huaweicloud.com/cce_faq/cce_faq_00438.md): NGINX Ingress控制器插件处于Unknown状态时,卸载插件会出现组件残留。NGINX Ingress控制器插件涉及的K8s资源:命名空间级别资源:secret、configmap、deployment、service、role、rolebinding、lease、serviceAccount、job集群级别资源:cluster - [NGINX Ingress控制器插件升级后无法使用TLS v1.0和v1.1](https://support.huaweicloud.com/cce_faq/cce_faq_00442.md): NGINX Ingress控制器插件升级至2.3.3及以上版本后,如果客户端TLS版本低于v1.2,会导致客户端与NGINX Ingress协商时报错。2.3.3及以上版本的NGINX Ingress默认仅支持TLS v1.2及v1.3版本,如果需要支持更多TLS版本,您可以在NGINX Ingress控制器插件配置的ssl-cipher - [NPU驱动升级失败如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00494.md): 在NPU驱动升级过程中,可能因版本兼容性或环境配置等问题导致命令报错。本文整理了NPU驱动升级过程中的典型报错场景及其解决方案,您可根据实际报错代码或错误描述快速解决问题。执行代码:npu-smi info报错信息:dcmi module initialize failed. ret is -8001解决方案:提前在文档中心下载对应的驱动 - [NPU插件从1.x.x升级到2.x.x后Pod无法启动如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00486.md): NPU插件从1.x.x版本升级到2.x.x版本之后,按照原先的配置部署业务,业务的Pod一直处于Pending状态无法启动。通过kubectl describe pod命令查询,发现该Pod存在以下报错导致创建容器失败。由于1.x.x版本的插件不具备给业务容器自动挂载驱动和npu-smi工具的能力,用户需要业务手动挂载主机上的驱动和npu - [CCE AI套件(NVIDIA GPU)插件版本升级或回滚后,如何对GPU节点进行排水?](https://support.huaweicloud.com/cce_faq/cce_faq_00488.md): 在GPU节点上存在GPU虚拟化负载时,对CCE AI套件(NVIDIA GPU)插件进行版本升级或回滚,可能导致部分组件(GPU虚拟化和运行时组件)出现升级或回滚失败的情况。此时,为了保证插件的正常使用,需要对GPU节点进行排水操作,以排空节点中的GPU虚拟化负载。建议采取滚动排水策略,即每次仅对一个或少量GPU节点进行排水,避免大规模排 - [CCE AI套件(Ascend NPU)插件版本升级,如何对NPU节点进行排水?](https://support.huaweicloud.com/cce_faq/cce_faq_00517.md): 在NPU节点上存在NPU虚拟化负载时,对CCE AI套件(Ascend NPU)插件进行版本升级,可能导致部分组件(flexnpu-server)出现升级失败的情况。此时,为了保证插件的正常使用,需要对NPU节点进行排水操作,以排空节点中的NPU虚拟化负载。建议采取滚动排水策略,即每次仅对一个或少量NPU节点进行排水,避免大规模排水对业务 - [通过CCE AI套件(NVIDIA GPU)插件安装的驱动,执行编解码任务时失败](https://support.huaweicloud.com/cce_faq/cce_faq_00504.md): 在使用以下版本的CCE AI套件(NVIDIA GPU)插件安装驱动后,执行编解码任务时可能失败,并报错 “Cuda Encode error: ......”。集群版本为v1.27及以下时,插件版本在2.2.1以下。集群版本为v1.28及以上时,插件版本在2.8.1以下。上述问题可能是当前Pod所在的GPU节点中缺少10_nvidia. - [EulerOS 2.9系统安装NVIDIA驱动失败](https://support.huaweicloud.com/cce_faq/cce_faq_00491.md): 在EulerOS 2.9系统中,手动安装GPU驱动时,即未通过CCE AI套件(NVIDIA GPU)插件安装驱动,出现错误,且错误提示如下:当安装GPU驱动出错时,可以通过以下命令查询驱动日志,从而确定报错原因。若回显中存在以下内容,则说明未安装GPU驱动的相关依赖项。您可以采取两种方式解决上述问题:通过CCE AI套件(NVIDIA - [Volcano调度器插件升级后,Volcano Job(vcjob)资源无法正常运行](https://support.huaweicloud.com/cce_faq/cce_faq_00492.md): Volcano调度器插件由1.4.7及以下版本升级到1.4.7以后版本时,出现新建的vcjob资源无法正常运行的现象。同时,API Server日志报错信息和volcano-admission组件报错信息分别如下。API Server的日志报错信息:... W0318 14:57:51.376736 13 dispatcher. - [插件异常问题排查](https://support.huaweicloud.com/cce_faq/cce_faq_00474.md): 在插件安装、升级、更改配置等过程中出现异常问题时,控制台通常会提示相应的错误码。您可以根据错误码查找对应的问题,查看问题原因和解决方案。本文介绍常见错误码及其问题原因和解决方案。问题现象安装插件时,出现“内部错误”,错误码为CCE.03500001。问题原因出现“内部错误”时,错误信息内会提示具体的错误原因,如 ClusterRole \ - [集群安装nginx-ingress插件失败,一直处于创建中?](https://support.huaweicloud.com/cce_faq/cce_faq_00240.md): 客户已经购买并搭建了CCE集群,希望在公网上可以访问到CCE上部署的应用服务,目前最高效的方式是在ingress资源上注册该应用的Service路径,从而满足要求。但客户安装ingress插件后,插件状态一直显示创建中,nginx-ingress-controller的pod一直处于pending状态。nginx限制的内存资源不足导致无法 - [NPD插件版本过低导致进程资源残留问题](https://support.huaweicloud.com/cce_faq/cce_faq_00130.md): 在节点负载压力比较大的场景下,可能存在NPD进程资源残留的问题。登录到CCE集群的ECS节点,查询存在大量npd进程。升级CCE节点故障检测(简称NPD)插件至最新版本。如果CCE节点故障检测插件版本已经为1.13.6及以上版本,则不需要进行升级操作。 - [模板格式不正确,无法删除模板实例?](https://support.huaweicloud.com/cce_faq/cce_faq_00217.md): 若上传的模板中包含不正确或者不兼容的资源,会导致安装模板失败,类似下图:此时模板实例无法正常工作。如果您尝试在界面上删除,可能会出现deletion failed的报错,模板实例仍在列表中:您可以使用kubectl命令删除残留的模板实例。删除残留的模板实例无法从根本上解决该问题。为避免该问题再次发生,建议您及时更新模板中资源的apiVer - [CCE是否支持nginx-ingress?](https://support.huaweicloud.com/cce_faq/cce_faq_00013.md): nginx-ingress是比较热门的ingress-controller,作为反向代理将外部流量导入到集群内部,将Kubernetes内部的Service暴露给外部,在Ingress对象中通过域名匹配Service,这样就可以直接通过域名访问到集群内部的服务。nginx-ingress由ingress-controller和nginx组 - [插件安装失败,提示The release name is already exist如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00322.md): 当安装插件失败,返回 The release name is already exist 错误。当安装插件返回The release name is already exist错误时,表示kubernetes集群中有残留该插件release记录,一般由于集群etcd做过备份恢复或者该插件之前安装删除异常导致。通过kubectl对接集群,手 - [创建或升级模板失败,提示rendered manifests contain a resource that already exists](https://support.huaweicloud.com/cce_faq/cce_faq_00327.md): 创建或升级模板失败,提示“Create release by helm failed: rendered manifests contain a resource that already exists. Unable to continue with install: ...”的错误。由于CCE插件通过模板进行安装,因此安装或升级插件时 - [kube-prometheus-stack插件实例调度失败如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00424.md): 安装kube-prometheus-stack插件时, 插件状态一直处于“部分就绪”,查看插件的prometheus实例事件中提示“0/x nodes are available: x node(s) had volume node affinity conflict.”。如果选择安装grafana组件,也可能出现同样的问题。当出现以上报 - [上传模板失败如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00425.md): 上传模板时出现“请求失败,请稍后重试”的错误,错误码为SVCSTG.CCECAM.4000121,错误信息提示“Package name and version must be valid and same with chart name and version!”。当出现以上报错内容时,说明模板Chart.yaml文件中的name和ve - [如何根据集群规格调整插件配额?](https://support.huaweicloud.com/cce_faq/cce_faq_00429.md): 当您的集群规格调整后,可能需要根据集群规格相应地调整插件资源配额,以确保插件实例能够正常运行。例如,如果您将集群规格从50节点调整为200节点或以上,则需要增加插件CPU、内存配额,防止插件实例因需要调度过多的节点而出现OOM等异常。因此,在调整集群规格后,请您同时考虑调整插件资源配额。CoreDNS所能提供的域名解析QPS与CPU消耗成 - [NGINX Ingress控制器插件处于Unknown状态时卸载残留](https://support.huaweicloud.com/cce_faq/cce_faq_00438.md): NGINX Ingress控制器插件处于Unknown状态时,卸载插件会出现组件残留。NGINX Ingress控制器插件涉及的K8s资源:命名空间级别资源:secret、configmap、deployment、service、role、rolebinding、lease、serviceAccount、job集群级别资源:cluster - [NGINX Ingress控制器插件升级后无法使用TLS v1.0和v1.1](https://support.huaweicloud.com/cce_faq/cce_faq_00442.md): NGINX Ingress控制器插件升级至2.3.3及以上版本后,如果客户端TLS版本低于v1.2,会导致客户端与NGINX Ingress协商时报错。2.3.3及以上版本的NGINX Ingress默认仅支持TLS v1.2及v1.3版本,如果需要支持更多TLS版本,您可以在NGINX Ingress控制器插件配置的ssl-cipher - [NPU驱动升级失败如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00494.md): 在NPU驱动升级过程中,可能因版本兼容性或环境配置等问题导致命令报错。本文整理了NPU驱动升级过程中的典型报错场景及其解决方案,您可根据实际报错代码或错误描述快速解决问题。执行代码:npu-smi info报错信息:dcmi module initialize failed. ret is -8001解决方案:提前在文档中心下载对应的驱动 - [NPU插件从1.x.x升级到2.x.x后Pod无法启动如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00486.md): NPU插件从1.x.x版本升级到2.x.x版本之后,按照原先的配置部署业务,业务的Pod一直处于Pending状态无法启动。通过kubectl describe pod命令查询,发现该Pod存在以下报错导致创建容器失败。由于1.x.x版本的插件不具备给业务容器自动挂载驱动和npu-smi工具的能力,用户需要业务手动挂载主机上的驱动和npu - [CCE AI套件(NVIDIA GPU)插件版本升级或回滚后,如何对GPU节点进行排水?](https://support.huaweicloud.com/cce_faq/cce_faq_00488.md): 在GPU节点上存在GPU虚拟化负载时,对CCE AI套件(NVIDIA GPU)插件进行版本升级或回滚,可能导致部分组件(GPU虚拟化和运行时组件)出现升级或回滚失败的情况。此时,为了保证插件的正常使用,需要对GPU节点进行排水操作,以排空节点中的GPU虚拟化负载。建议采取滚动排水策略,即每次仅对一个或少量GPU节点进行排水,避免大规模排 - [CCE AI套件(Ascend NPU)插件版本升级,如何对NPU节点进行排水?](https://support.huaweicloud.com/cce_faq/cce_faq_00517.md): 在NPU节点上存在NPU虚拟化负载时,对CCE AI套件(Ascend NPU)插件进行版本升级,可能导致部分组件(flexnpu-server)出现升级失败的情况。此时,为了保证插件的正常使用,需要对NPU节点进行排水操作,以排空节点中的NPU虚拟化负载。建议采取滚动排水策略,即每次仅对一个或少量NPU节点进行排水,避免大规模排水对业务 - [通过CCE AI套件(NVIDIA GPU)插件安装的驱动,执行编解码任务时失败](https://support.huaweicloud.com/cce_faq/cce_faq_00504.md): 在使用以下版本的CCE AI套件(NVIDIA GPU)插件安装驱动后,执行编解码任务时可能失败,并报错 “Cuda Encode error: ......”。集群版本为v1.27及以下时,插件版本在2.2.1以下。集群版本为v1.28及以上时,插件版本在2.8.1以下。上述问题可能是当前Pod所在的GPU节点中缺少10_nvidia. - [EulerOS 2.9系统安装NVIDIA驱动失败](https://support.huaweicloud.com/cce_faq/cce_faq_00491.md): 在EulerOS 2.9系统中,手动安装GPU驱动时,即未通过CCE AI套件(NVIDIA GPU)插件安装驱动,出现错误,且错误提示如下:当安装GPU驱动出错时,可以通过以下命令查询驱动日志,从而确定报错原因。若回显中存在以下内容,则说明未安装GPU驱动的相关依赖项。您可以采取两种方式解决上述问题:通过CCE AI套件(NVIDIA - [Volcano调度器插件升级后,Volcano Job(vcjob)资源无法正常运行](https://support.huaweicloud.com/cce_faq/cce_faq_00492.md): Volcano调度器插件由1.4.7及以下版本升级到1.4.7以后版本时,出现新建的vcjob资源无法正常运行的现象。同时,API Server日志报错信息和volcano-admission组件报错信息分别如下。API Server的日志报错信息:... W0318 14:57:51.376736 13 dispatcher. - [用户访问集群API Server的方式哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00025.md): 当前CCE提供两种访问集群API Server的方式:集群API方式:(推荐)集群API需要使用证书认证访问。直接连接集群API Server,适合大规模调用。API网关方式:API网关采用token方式认证,需要使用账号信息获取token。适合小规模调用场景,大规模调用时可能会触发API网关流控。详情请参见使用Kubernetes AP - [通过API或kubectl操作CCE集群,创建的资源是否能在控制台展示?](https://support.huaweicloud.com/cce_faq/cce_faq_00208.md): 在CCE控制台,暂时不支持显示的kubernetes资源有:DaemonSet、 ReplicationController、ReplicaSets、Endpoints等。若需要查询这些资源,请通过kubectl命令进行查询。此外,Deployment、Statefulset、Service和Pod资源需满足以下条件,才能在控制台显示:D - [通过kubectl连接集群时,其配置文件config如何下载?](https://support.huaweicloud.com/cce_faq/cce_faq_00041.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [kubectl top node命令为何报错](https://support.huaweicloud.com/cce_faq/cce_faq_00321.md): 执行kubectl top node命令报错Error from server (ServiceUnavailable): the server is currently unable to handle the request (get nodes.metrics.k8s.io)执行kubectl时出现Error from server - [kubectl使用报错:Error from server (Forbidden)](https://support.huaweicloud.com/cce_faq/cce_faq_00311.md): 使用kubectl在创建或查询Kubernetes资源时,显示如下内容。# kubectl get deploy Error from server (Forbidden): deployments.apps is forbidden: User "0c97ac3cb280f4d91fa7c0096739e1f8" cannot list - [用户访问集群API Server的方式哪些?](https://support.huaweicloud.com/cce_faq/cce_faq_00025.md): 当前CCE提供两种访问集群API Server的方式:集群API方式:(推荐)集群API需要使用证书认证访问。直接连接集群API Server,适合大规模调用。API网关方式:API网关采用token方式认证,需要使用账号信息获取token。适合小规模调用场景,大规模调用时可能会触发API网关流控。详情请参见使用Kubernetes AP - [通过API或kubectl操作CCE集群,创建的资源是否能在控制台展示?](https://support.huaweicloud.com/cce_faq/cce_faq_00208.md): 在CCE控制台,暂时不支持显示的kubernetes资源有:DaemonSet、 ReplicationController、ReplicaSets、Endpoints等。若需要查询这些资源,请通过kubectl命令进行查询。此外,Deployment、Statefulset、Service和Pod资源需满足以下条件,才能在控制台显示:D - [通过kubectl连接集群时,其配置文件config如何下载?](https://support.huaweicloud.com/cce_faq/cce_faq_00041.md): 华为云帮助中心,为用户提供产品简介、价格说明、购买指南、用户指南、API参考、最佳实践、常见问题、视频帮助等技术文档,帮助您快速上手使用华为云服务。 - [kubectl top node命令为何报错](https://support.huaweicloud.com/cce_faq/cce_faq_00321.md): 执行kubectl top node命令报错Error from server (ServiceUnavailable): the server is currently unable to handle the request (get nodes.metrics.k8s.io)执行kubectl时出现Error from server - [kubectl使用报错:Error from server (Forbidden)](https://support.huaweicloud.com/cce_faq/cce_faq_00311.md): 使用kubectl在创建或查询Kubernetes资源时,显示如下内容。# kubectl get deploy Error from server (Forbidden): deployments.apps is forbidden: User "0c97ac3cb280f4d91fa7c0096739e1f8" cannot list - [CCE集群内域名解析失败,如何快速规避保障业务运行?](https://support.huaweicloud.com/cce_faq/cce_faq_00509.md): 恢复方案:在异常Pod内配置hosts文件方式1:直接编辑Pod内的/etc/hosts文件Pod重启后添加的hosts配置会丢失。操作步骤:执行kubectl exec -it命令,进入Pod。kubectl exec -it -- /bin/sh通过vi /etc/hosts命令添加解析异常域名的hosts配置。 - [CCE集群内域名解析失败,如何定位处理?](https://support.huaweicloud.com/cce_faq/cce_faq_00197.md): CoreDNS所能提供的域名解析QPS与CPU消耗呈正相关,如遇QPS较高的场景,需要根据QPS的量级调整CoreDNS实例规格。集群超过100节点时,推荐使用NodeLocal DNSCache提升DNS性能,详情请参见使用NodeLocal DNSCache提升DNS性能。如实例已达性能瓶颈,则需调整CoreDNS插件规格。单击Cor - [为什么CCE集群的容器无法通过DNS解析?](https://support.huaweicloud.com/cce_faq/cce_faq_00107.md): 某客户在DNS服务中做内网解析,将自有的域名绑定到DNS服务中的内网域名中,并绑定到特定的VPC中,发现本VPC内的节点(ECS)可以正常解析内网域名的记录,而VPC内的容器则无法解析。VPC内的容器无法进行正常DNS解析的情况。由于本案例涉及的是内网域名解析,按照内网域名解析的规则,需要确保VPC内的子网DNS设置成的云上DNS,具体以 - [为什么修改子网DNS配置后,无法解析租户区域名?](https://support.huaweicloud.com/cce_faq/cce_faq_00295.md): 用户集群子网DNS配置,增加了DNS服务器配置,如114.114.114.114,该域名无法解析租户区域名。CCE会将用户的子网DNS信息配置到node节点上,coredns插件中也是使用该配置信息,因此会导致用户在节点容器内解析域名会偶发失败的状况。建议您通过修改coredns插件的存根域更新用户集群子网DNS配置,修改方法请参见为Co - [解析外部域名很慢或超时,如何优化配置?](https://support.huaweicloud.com/cce_faq/cce_faq_00195.md): 工作负载的容器内的resolv.conf文件,示例如下:其中:nameserver:DNS服务器的IP地址,此处为coredns的ClusterIP。search:域名的搜索列表,此处为Kubernetes的常用后缀。ndots:“.”的个数小于它的域名,会优先使用search进行解析。timeout:超时时间。single-reques - [如何设置容器内的DNS策略?](https://support.huaweicloud.com/cce_faq/cce_faq_00194.md): CCE支持通过dnsPolicy标记每个Pod配置不同的DNS策略:None:表示空的DNS设置,这种方式一般用于想要自定义DNS配置的场景,而且,往往需要和dnsConfig配合一起使用达到自定义DNS的目的。Default:从运行所在的节点继承名称解析配置。即容器的域名解析文件使用kubelet的“--resolv-conf”参数指向 - [如何解决CoreDNS使用废弃API问题?](https://support.huaweicloud.com/cce_faq/cce_faq_00490.md): 在CCE集群中,如果CoreDNS在1.19集群版本中启动,集群升级到1.25版本或1.27版本时,CoreDNS可能仍在监听v1beta1版本的EndpointSlice资源。由于v1beta1版本的EndpointSlice资源在CCE 1.25集群版本中被废弃,导致CoreDNS无法获取到最新的Service/Endpoint变更事 - [CCE集群内域名解析失败,如何快速规避保障业务运行?](https://support.huaweicloud.com/cce_faq/cce_faq_00509.md): 恢复方案:在异常Pod内配置hosts文件方式1:直接编辑Pod内的/etc/hosts文件Pod重启后添加的hosts配置会丢失。操作步骤:执行kubectl exec -it命令,进入Pod。kubectl exec -it -- /bin/sh通过vi /etc/hosts命令添加解析异常域名的hosts配置。 - [CCE集群内域名解析失败,如何定位处理?](https://support.huaweicloud.com/cce_faq/cce_faq_00197.md): CoreDNS所能提供的域名解析QPS与CPU消耗呈正相关,如遇QPS较高的场景,需要根据QPS的量级调整CoreDNS实例规格。集群超过100节点时,推荐使用NodeLocal DNSCache提升DNS性能,详情请参见使用NodeLocal DNSCache提升DNS性能。如实例已达性能瓶颈,则需调整CoreDNS插件规格。单击Cor - [为什么CCE集群的容器无法通过DNS解析?](https://support.huaweicloud.com/cce_faq/cce_faq_00107.md): 某客户在DNS服务中做内网解析,将自有的域名绑定到DNS服务中的内网域名中,并绑定到特定的VPC中,发现本VPC内的节点(ECS)可以正常解析内网域名的记录,而VPC内的容器则无法解析。VPC内的容器无法进行正常DNS解析的情况。由于本案例涉及的是内网域名解析,按照内网域名解析的规则,需要确保VPC内的子网DNS设置成的云上DNS,具体以 - [为什么修改子网DNS配置后,无法解析租户区域名?](https://support.huaweicloud.com/cce_faq/cce_faq_00295.md): 用户集群子网DNS配置,增加了DNS服务器配置,如114.114.114.114,该域名无法解析租户区域名。CCE会将用户的子网DNS信息配置到node节点上,coredns插件中也是使用该配置信息,因此会导致用户在节点容器内解析域名会偶发失败的状况。建议您通过修改coredns插件的存根域更新用户集群子网DNS配置,修改方法请参见为Co - [解析外部域名很慢或超时,如何优化配置?](https://support.huaweicloud.com/cce_faq/cce_faq_00195.md): 工作负载的容器内的resolv.conf文件,示例如下:其中:nameserver:DNS服务器的IP地址,此处为coredns的ClusterIP。search:域名的搜索列表,此处为Kubernetes的常用后缀。ndots:“.”的个数小于它的域名,会优先使用search进行解析。timeout:超时时间。single-reques - [如何设置容器内的DNS策略?](https://support.huaweicloud.com/cce_faq/cce_faq_00194.md): CCE支持通过dnsPolicy标记每个Pod配置不同的DNS策略:None:表示空的DNS设置,这种方式一般用于想要自定义DNS配置的场景,而且,往往需要和dnsConfig配合一起使用达到自定义DNS的目的。Default:从运行所在的节点继承名称解析配置。即容器的域名解析文件使用kubelet的“--resolv-conf”参数指向 - [如何解决CoreDNS使用废弃API问题?](https://support.huaweicloud.com/cce_faq/cce_faq_00490.md): 在CCE集群中,如果CoreDNS在1.19集群版本中启动,集群升级到1.25版本或1.27版本时,CoreDNS可能仍在监听v1beta1版本的EndpointSlice资源。由于v1beta1版本的EndpointSlice资源在CCE 1.25集群版本中被废弃,导致CoreDNS无法获取到最新的Service/Endpoint变更事 - [如何制作Docker镜像?如何解决拉取镜像慢的问题?](https://support.huaweicloud.com/cce_faq/cce_faq_00031.md): 关于如何通过Dockerfile定制一个简单的Web应用程序的Docker镜像,请参见Docker基础知识或如何制作Docker镜像?由于运营商网络问题可能导致公共镜像仓库中的镜像拉取速度缓慢,您可将常用的镜像上传至容器镜像服务SWR,提高镜像拉取速度。容器镜像服务(Software Repository for Container,SW - [如何上传我的镜像到CCE中使用?](https://support.huaweicloud.com/cce_faq/cce_faq_00032.md): 镜像的管理是由容器镜像服务(SoftWare Repository)提供的,当前容器镜像服务提供如下上传镜像的方法:客户端上传镜像页面上传镜像如您需要将Harbor镜像仓库平滑地迁移到容器镜像服务,请参考跨云Harbor同步镜像至华为云SWR。 - [如何制作Docker镜像?如何解决拉取镜像慢的问题?](https://support.huaweicloud.com/cce_faq/cce_faq_00031.md): 关于如何通过Dockerfile定制一个简单的Web应用程序的Docker镜像,请参见Docker基础知识或如何制作Docker镜像?由于运营商网络问题可能导致公共镜像仓库中的镜像拉取速度缓慢,您可将常用的镜像上传至容器镜像服务SWR,提高镜像拉取速度。容器镜像服务(Software Repository for Container,SW - [如何上传我的镜像到CCE中使用?](https://support.huaweicloud.com/cce_faq/cce_faq_00032.md): 镜像的管理是由容器镜像服务(SoftWare Repository)提供的,当前容器镜像服务提供如下上传镜像的方法:客户端上传镜像页面上传镜像如您需要将Harbor镜像仓库平滑地迁移到容器镜像服务,请参考跨云Harbor同步镜像至华为云SWR。 - [能否只配置命名空间权限,不配置集群管理权限?](https://support.huaweicloud.com/cce_faq/cce_faq_00398.md): 命名空间权限和集群管理权限是相互独立又相互补充的两个权限体系:命名空间权限:作用于集群内部,用于管理集群资源操作(如创建工作负载等)。集群管理(IAM)权限:云服务层面的权限,用于管理CCE集群与周边资源(如VPC、ELB、ECS等)的操作。对于IAM Admin用户组的管理员用户来说,可以为IAM子用户授予集群管理权限(如CCE Adm - [如果不配置集群管理权限的情况下,是否可以使用API呢?](https://support.huaweicloud.com/cce_faq/cce_faq_00399.md): CCE提供的API可以分为云服务接口和集群接口:云服务接口:支持操作云服务层面的基础设施(如创建节点),也可以调用集群层面的资源(如创建工作负载)。使用云服务接口时,必须配置集群管理(IAM)权限。使用云服务接口时,必须配置集群管理(IAM)权限。集群接口:直接通过Kubernetes原生API Server来调用集群层面的资源(如创建工 - [如果不配置集群管理权限,是否可以使用kubectl命令呢?](https://support.huaweicloud.com/cce_faq/cce_faq_00400.md): 使用kubectl命令无需经过IAM认证,因此理论上不配置集群管理(IAM)权限是可以使用kubectl命令的。但前提是需要获取具有命名空间权限的kubectl配置文件(kubeconfig),以下场景认证文件传递过程中均存在安全泄露风险,应在实际使用中注意。场景一如果某IAM子用户先配置了集群管理权限和命名空间权限,然后在界面下载kub - [IAM用户无法使用调用API](https://support.huaweicloud.com/cce_faq/cce_faq_00458.md): 使用IAM用户调用API时,出现以下报错:该错误表示IAM用户没有编程访问权限。 - [什么是OBS全局访问密钥?如何排查集群中是否使用全局访问密钥?](https://support.huaweicloud.com/cce_faq/cce_faq_00484.md): 在CCE集群中创建OBS类型的PVC时,需要选择一个访问密钥(AK/SK)。OBS的访问密钥可分为以下两种:自定义访问密钥(推荐使用):使用自定义访问密钥时,PVC的yaml中带有csi.storage.k8s.io/node-publish-secret-namespace和csi.storage.k8s.io/node-publish - [委托校验/创建失败](https://support.huaweicloud.com/cce_faq/cce_faq_00512.md): 问题原因委托配额达到上限。解决方案请联系统一身份认证服务(IAM)扩充委托配额。问题原因用户不具备委托的创建/授权权限。解决方案您需要为用户配置统一身份认证服务(IAM)的以下操作权限:iam:agencies:createAgency:创建委托iam:permissions:revokeRoleFromAgencyOnProject:移 - [误删集群使用的委托如何恢复](https://support.huaweicloud.com/cce_faq/cce_faq_00513.md): 在开始恢复操作前,请务必了解以下重要信息:由于系统存在凭证缓存机制,任何委托重新创建后,都不会立即生效。请根据下文各场景的说明,预留足够的等待时间,或在操作后主动重启相关组件以加速生效。CCEServiceAgency是集群正常运行所必需的委托。若被误删,请按以下步骤恢复:集群委托的恢复方式取决于其创建类型(系统默认或自定义)。请先确认您 - [能否只配置命名空间权限,不配置集群管理权限?](https://support.huaweicloud.com/cce_faq/cce_faq_00398.md): 命名空间权限和集群管理权限是相互独立又相互补充的两个权限体系:命名空间权限:作用于集群内部,用于管理集群资源操作(如创建工作负载等)。集群管理(IAM)权限:云服务层面的权限,用于管理CCE集群与周边资源(如VPC、ELB、ECS等)的操作。对于IAM Admin用户组的管理员用户来说,可以为IAM子用户授予集群管理权限(如CCE Adm - [如果不配置集群管理权限的情况下,是否可以使用API呢?](https://support.huaweicloud.com/cce_faq/cce_faq_00399.md): CCE提供的API可以分为云服务接口和集群接口:云服务接口:支持操作云服务层面的基础设施(如创建节点),也可以调用集群层面的资源(如创建工作负载)。使用云服务接口时,必须配置集群管理(IAM)权限。使用云服务接口时,必须配置集群管理(IAM)权限。集群接口:直接通过Kubernetes原生API Server来调用集群层面的资源(如创建工 - [如果不配置集群管理权限,是否可以使用kubectl命令呢?](https://support.huaweicloud.com/cce_faq/cce_faq_00400.md): 使用kubectl命令无需经过IAM认证,因此理论上不配置集群管理(IAM)权限是可以使用kubectl命令的。但前提是需要获取具有命名空间权限的kubectl配置文件(kubeconfig),以下场景认证文件传递过程中均存在安全泄露风险,应在实际使用中注意。场景一如果某IAM子用户先配置了集群管理权限和命名空间权限,然后在界面下载kub - [IAM用户无法使用调用API](https://support.huaweicloud.com/cce_faq/cce_faq_00458.md): 使用IAM用户调用API时,出现以下报错:该错误表示IAM用户没有编程访问权限。 - [什么是OBS全局访问密钥?如何排查集群中是否使用全局访问密钥?](https://support.huaweicloud.com/cce_faq/cce_faq_00484.md): 在CCE集群中创建OBS类型的PVC时,需要选择一个访问密钥(AK/SK)。OBS的访问密钥可分为以下两种:自定义访问密钥(推荐使用):使用自定义访问密钥时,PVC的yaml中带有csi.storage.k8s.io/node-publish-secret-namespace和csi.storage.k8s.io/node-publish - [委托校验/创建失败](https://support.huaweicloud.com/cce_faq/cce_faq_00512.md): 问题原因委托配额达到上限。解决方案请联系统一身份认证服务(IAM)扩充委托配额。问题原因用户不具备委托的创建/授权权限。解决方案您需要为用户配置统一身份认证服务(IAM)的以下操作权限:iam:agencies:createAgency:创建委托iam:permissions:revokeRoleFromAgencyOnProject:移 - [误删集群使用的委托如何恢复](https://support.huaweicloud.com/cce_faq/cce_faq_00513.md): 在开始恢复操作前,请务必了解以下重要信息:由于系统存在凭证缓存机制,任何委托重新创建后,都不会立即生效。请根据下文各场景的说明,预留足够的等待时间,或在操作后主动重启相关组件以加速生效。CCEServiceAgency是集群正常运行所必需的委托。若被误删,请按以下步骤恢复:集群委托的恢复方式取决于其创建类型(系统默认或自定义)。请先确认您 - [云容器引擎(CCE)与云容器实例(CCI)的区别是什么?](https://support.huaweicloud.com/cce_faq/cce_faq_00258.md): 通过安装CCE突发弹性引擎(对接CCI)插件,可以在短时高负载场景时,将部署在CCE上的无状态工作负载(Deployment)、有状态工作负载(StatefulSet)、普通任务(Job)三种资源类型的容器实例(Pod),弹性创建到华为云云容器实例CCI服务上,以减少集群扩容带来的消耗。具体功能如下:支持容器实例实现秒级弹性伸缩:在集群资 - [云容器引擎(CCE)和应用管理与运维平台(ServiceStage)的区别是什么?](https://support.huaweicloud.com/cce_faq/cce_faq_00250.md): 对于使用者而言,云容器引擎关注的重点是Pod的部署,应用管理与运维平台关注的是服务的使用。对于技术实现来看,应用管理与运维平台是对云容器引擎的再一次封装。云容器引擎(CCE)云容器引擎(Cloud Container Engine,简称CCE)提供高度可扩展的、高性能的企业级Kubernetes集群,支持运行Docker容器,提供了Kub - [开启主机安全防护失败如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00510.md): 问题现象集群配置中心页面开启主机安全防护时出现弹窗报错,信息如下:问题根因开启主机安全防护需要用户具有相关权限,否则将会出现权限不足的错误。解决方案请联系账号管理员为IAM用户授予权限,关于授权的详细操作请参见创建用户组并授权。您需要使用IAM旧版控制台授予“HSS AgencyOperatePolicy”系统策略和“HSS Admini - [云容器引擎(CCE)与云容器实例(CCI)的区别是什么?](https://support.huaweicloud.com/cce_faq/cce_faq_00258.md): 通过安装CCE突发弹性引擎(对接CCI)插件,可以在短时高负载场景时,将部署在CCE上的无状态工作负载(Deployment)、有状态工作负载(StatefulSet)、普通任务(Job)三种资源类型的容器实例(Pod),弹性创建到华为云云容器实例CCI服务上,以减少集群扩容带来的消耗。具体功能如下:支持容器实例实现秒级弹性伸缩:在集群资 - [云容器引擎(CCE)和应用管理与运维平台(ServiceStage)的区别是什么?](https://support.huaweicloud.com/cce_faq/cce_faq_00250.md): 对于使用者而言,云容器引擎关注的重点是Pod的部署,应用管理与运维平台关注的是服务的使用。对于技术实现来看,应用管理与运维平台是对云容器引擎的再一次封装。云容器引擎(CCE)云容器引擎(Cloud Container Engine,简称CCE)提供高度可扩展的、高性能的企业级Kubernetes集群,支持运行Docker容器,提供了Kub - [开启主机安全防护失败如何解决?](https://support.huaweicloud.com/cce_faq/cce_faq_00510.md): 问题现象集群配置中心页面开启主机安全防护时出现弹窗报错,信息如下:问题根因开启主机安全防护需要用户具有相关权限,否则将会出现权限不足的错误。解决方案请联系账号管理员为IAM用户授予权限,关于授权的详细操作请参见创建用户组并授权。您需要使用IAM旧版控制台授予“HSS AgencyOperatePolicy”系统策略和“HSS Admini