实例运维常见问题

更新时间:
复制 MD 格式

本文汇总了Lindorm实例在扩缩容、升降配、实例重启、版本升级等实例运维场景中的常见问题,包括但不限于操作耗时、业务影响及费用说明,帮助您快速了解运维操作中的相关细节和注意事项。

问题导览

扩容、升配、服务开通

缩容、降配

小版本升级、实例重启

存储空间

内存使用率

实例扩容节点需要多久?

节点扩容是并行进行的,一个节点平均耗时约10~15分钟,扩容的节点数越多扩容整体耗时越长。

实例扩容节点期间对业务有什么影响?

实例节点扩容期间业务读写请求仍然可正常执行,服务不会中断。然而,部分读写请求的平均延迟会发生抖动,请确保客户端配置了正确的重试机制。对读写请求延迟比较敏感的业务,建议在业务低峰期进行扩容。

实例扩容存储空间需要多久,扩容期间对业务有什么影响?

当前仅存储类型为标准型云存储、性能型云存储和容量型云存储的实例支持扩容。扩容操作耗时为分钟级别,对服务无影响。存储类型为本地SSD盘或本地HDD盘的实例不支持直接扩容存储,需要通过扩容节点的方式来扩容存储。

开通冷存储需要多久,开通期间对业务有什么影响?

开通冷存储需要滚动重启实例。实例重启时,一个节点平均耗时约10~15分钟,重启操作为串行操作。例如需要操作的实例有4个节点,则开通冷存储需要60分钟左右。

预估耗时与节点中的Region数量相关,Region越多,执行时间越长。

在重启期间业务读写仍然请求可正常执行,服务不中断。然而,部分读写请求可能会出现延迟抖动或链接中断现象,请确保客户端配置了正确的重试机制。对读写延迟敏感的业务,建议在业务低峰期进行升配操作。

扩容冷存储需要多久,扩容期间对业务有什么影响?

冷存储扩容操作分钟级完成,对业务没有影响。

实例升配需要多久,升配期间对业务有什么影响?

实例升配的耗时与实例中的节点数量有关,预计一个节点平均耗时约10~15分钟,操作是串行进行的。例如,如果需要升配的实例有4个节点,那么升配操作大约需要60分钟完成。

预估耗时与节点上的Region数量相关,Region越多,升配时间越长。

在升配期间,业务的读写请求仍然可以正常执行,服务不会中断。然而,部分读写请求可能会出现延迟抖动或链接中断现象,请确保客户端配置了正确的重试机制。对读写延迟敏感的业务,建议在业务低峰期进行升配操作。

实例缩容节点需要多久?

缩容节点需要的迁移时间估算方式:需要迁移的数据量/(总节点数*30MB/s) 。假设当前业务已使用存储空间为10 TB,共有10个节点,需要缩容2个节点。因为数据通常是均匀分布的,所以需要迁移2 TB的数据量,则预估的迁移时间为:2 TB/(10 * 30 MB/s) = 6990.5秒 ≈ 2小时+0.5小时(静默时间)=2.5小时。

重要
  • 该时间仅为预估时间,实际缩容耗时受业务负载和存储介质差异的影响。

  • 如果实例缩容后任一存储介质的使用水位高于85%,将无法提交缩容变更任务。有关缩容后费用变动的详细说明,请参见退订规则

实例缩容节点期间对业务有什么影响?

实例缩容期间业务的读写请求仍能正常执行,服务不会中断。

实例降配需要多久,降配期间对业务有什么影响?

实例降配的耗时与实例中的节点数量有关,预计一个节点平均耗时约10~15分钟,操作是串行进行的。例如,如果需要降配的实例有4个节点,那么降配操作大约需要60分钟完成。

预计耗时与节点上的Region数量相关,节点上的Region数量越多,耗时越长。

在降配过程中,集群会滚动重启,但业务的读写请求仍然可以正常执行,服务不会中断。然而,部分读写请求可能会出现延迟抖动或链接中断现象,请确保客户端已配置正确的重试机制。对读写延迟比较敏感的业务,建议在业务低峰期执行降配操作。

关于降配后费用变动的详细说明,请参见退订规则

实例小版本升级需要多久?

  • 文件引擎或底层存储小版本升级(LDFS) :一个节点平均耗时约10~15分钟,串行操作。例如,需要升级的实例有4个存储节点,那么升级预计60分钟左右完成。

  • 宽表引擎小版本升级:一个节点平均耗时约10~15分钟,串行操作。例如,需要升级的实例有4个节点,则预计需要约60分钟左右完成。

小版本升级可以选择升级的版本吗?

不支持选择升级的版本。小版本升级操作默认升级至当前的稳定版本,该版本默认向上兼容。

小版本升级期间对业务有什么影响?

  • 文件引擎或底层存储小版本升级(LDFS) :升级期间基本对业务没有影响。

  • 宽表引擎小版本升级:升级期间读写请求仍然可以正常执行,服务不会中断。然而,部分读写请求可能会出现延迟抖动或链接中断现象,请确保客户端已配置正确的重试机制。对读写延迟比较敏感的业务,建议在业务低峰期执行降配操作。

实例重启需要多久,重启期间对业务有什么影响?

实例重启为滚动重启,一个节点平均耗时约10~15分钟左右,重启为串行操作。例如,如果需要重启的实例有4个节点,则重启整个实例需要60分钟左右完成。

预计耗时与节点上的Region数量有关,节点上的Region数量越多,耗时越长。

在重启期间,业务的读写请求仍然可以正常执行,服务不会中断。然而,部分读写请求可能会出现延迟抖动或链接中断现象,请确保客户端已配置正确的重试机制。对读写延迟比较敏感的业务,建议在业务低峰期执行降配操作。

如何理解存储占用空间?

  • 针对云存储(性能型云存储、标准型云存储、容量型云存储),一般包括两部分:数据引擎已使用空间、非引擎侧已使用空间。

    假设实例仅开通了宽表引擎,在控制台存储明细中:

    存储空间占用类型

    说明

    宽表引擎

    不考虑副本数,表示单副本的使用空间。

    其他使用

    指非引擎侧已使用的空间,一般包含回收站数据、块的元数据信息、正在写入块的预占用、系统文件占用以及分布式系统的保留空间,一般占比极小。

  • 针对非云存储:需要考虑副本数,假设副本数为3,则写入100 MB数据会显示已占用300 MB的存储空间。

    本地 HDD 盘存储面板显示已使用容量 827.0KiB / 125.9TiB(0.0%),其中宽表引擎占用 57.68KiB,其他使用占用 769.35KiB,剩余空间 125.92TiB。

集群中服务器内存偏高与集群稳定性之间有关系吗

Lindorm 集群中 Linux 系统内存使用率偏高与集群稳定性之间并无必然关联。这是因为操作系统会将内存预分配给 JVM 进程,即使系统层面显示内存占用较高,也不代表存在内存瓶颈。如需准确评估内存资源的健康状况,建议关注 JVM Full GC 相关指标(如 GC 频率、STW 时间)或 Lindorm JVM 堆内存使用率,这些指标更能真实反映集群的内存压力和稳定性风险。

内存水位阈值现已不建议用户手动配置;如确需调整,请将阈值设置为 90% 及以上。