SStorpath

分布式存储运维工程师成长路径

从看懂一条 iostat 开始,成为能扛线上存储的工程师

五个阶段,一条主线:先把 Linux 系统基础打扎实,再吃透 Ceph 这一套统一存储的块、文件、对象三种形态,接着学会把业务需求翻译成机器配置,最后走向 GPFS ECE、K8s CSI 与商业存储的进阶战场。每节课都配检查点、实验或命令行闯关。

5 个
学习阶段
36 节
课程
16 个
实验与闯关
23 小时
预计学时

学习路径

L0
系统基础Linux 性能与观测

存储工程师的地基。看得懂 iostat 的每一列,能用 USE 方法在十分钟内把问题定位到 CPU、内存、磁盘还是网络。

0/6
已完成
  1. 0.1性能分析的第一课:USE 方法面对"系统慢"这种模糊报障,用一套固定套路把范围收敛到具体资源。
  2. 0.2CPU 与内存:存储节点的隐形瓶颈OSD 进程吃满 CPU、NUMA 跨节点访问、page cache 被挤掉,都会表现成"磁盘慢"。
  3. 0.3磁盘 I/O:IOPS、吞吐与延迟的三角关系为什么队列深度一加大 IOPS 就上去、延迟也跟着上去?这节课把 iostat 每一列讲透。
  4. 0.4文件系统:从 VFS 到 XFS 挂载参数存储服务底下压着的还是本地文件系统,它的行为直接决定上层表现。
  5. 0.5网络:存储集群的第二块硬盘分布式存储把网络放进了 I/O 路径,网络抖动会直接变成写延迟。
  6. 0.6观测与压测工具箱把 iostat/vmstat/perf/bpftrace 和 elbencho 串成一套可复用的手法。
L1
存储原理块 / 文件 / 对象与冗余机制

建立分布式存储的通用心智模型:数据怎么切、怎么冗余、故障时怎么恢复,换任何一款产品都通用。

0/5
已完成
  1. 1.1块、文件、对象:三种存储语义不是三种产品,是三种访问语义。选错语义,后面怎么调优都别扭。
  2. 1.2副本还是纠删码:冗余机制的取舍三副本浪费 67% 空间,EC 省空间但重建时能把集群拖垮。这节课算清这笔账。
  3. 1.3一致性、故障域与可用性CAP 不是屠龙术,它每天都在决定你的集群在断电时丢不丢数据。
  4. 1.4硬件基础:从 NAND 到整机选型写放大、寿命、掉电保护,这些盘的特性会一路传导到集群指标上。
  5. 1.5存储协议与接入方式iSCSI、NFS、S3、NVMe-oF 各自的开销与坑,接入前先知道。
L2
Ceph 主战场一套集群,三种存储

这是分布式存储运维的核心战场。从架构原理到部署、日常运维、故障排查,形成完整闭环。

0/13
已完成
  1. 2.1Ceph 架构总览:RADOS 与四类守护进程MON、OSD、MGR、MDS 各管什么,一次写入在集群里走过哪些环节。
  2. 2.2CRUSH 与 PG:数据到底落在哪块盘上没有中心元数据服务,客户端却能算出数据在哪 —— CRUSH 是 Ceph 最漂亮的设计。
  3. 2.3实验:用 cephadm 从零部署一套集群三节点起步,走完 bootstrap、加主机、加 OSD、看健康状态的全流程。
  4. 2.4实验:Rook 在 K8s 里跑 Ceph存储与计算同集群的另一条路线,Operator 帮你做了什么、藏了什么。
  5. 2.5RBD 块存储:从 pool 到挂载创建 pool、开 image、映射到主机,再把它接到 K8s 里。
  6. 2.6CephFS 文件存储:MDS 与元数据共享文件系统的甜与苦,元数据缓存是它的命门。
  7. 2.7RGW 对象存储:S3 网关把 RADOS 包装成 S3,用户、bucket、配额与多站点。
  8. 2.8Day-2 运维:扩容、换盘、升级集群跑起来只是开始,接下来两年都是这些活。
  9. 2.9闯关:HEALTH_WARN 从哪儿看起在模拟终端里接手一套告警集群,一步步定位到根因。
  10. 2.10闯关:集群完全不可用,MON 出了什么事ceph 命令直接卡住不返回。这一关练的是「管理面挂了怎么办」。
  11. 2.11闯关:CephFS 突然卡住,客户端全在等带宽正常、OSD 全绿,但 ls 一个目录要等半分钟。问题在元数据层。
  12. 2.12闯关:对象存储 5xx 激增监控报 RGW 错误率飙升,但 Ceph 集群显示 HEALTH_OK。
  13. 2.13Ceph 性能调优与压测先量再调。没有基线的调优都是玄学。
L3
容量与性能规划从需求到方案

把业务需求翻译成机器数量、盘型号和网络配置 —— 这是运维工程师开始有话语权的地方。

0/4
已完成
  1. 3.1需求拆解:容量、带宽、IOPS 三条线客户说"要 1PB 高性能存储",这句话里缺了至少五个关键参数。
  2. 3.2算一遍:Ceph 集群容量规划给定裸盘配置,算出真正能用的容量 —— 交互计算器边调边看。
  3. 3.3性能估算与瓶颈定位在采购之前就算出这套配置能跑多快,以及第一个瓶颈会出现在哪。
  4. 3.4方案对比:什么时候不该用 Ceph开源不等于便宜。把授权费、运维成本、技术支持一起算进去。
L4
进阶方向GPFS ECE、K8s 与商业存储

走出 Ceph 的舒适区。企业级高性能场景里,GPFS、Weka、VastData 和 K8s CSI 才是常态。

0/8
已完成
  1. 4.1GPFS / Storage Scale 概念与 ECE 架构NSD、文件系统、集群角色 —— 换一套术语体系,但底层问题还是那些。
  2. 4.2实验:GPFS ECE 部署与调优从网络规划到 recovery group,把一套 ECE 集群跑起来。
  3. 4.3GPFS Day-2:多租户、快照与扩容fileset、配额、CES 导出、集群扩容,企业环境的日常。
  4. 4.4K8s 存储模型:PV、PVC、SC 与 CSI容器时代的存储接口层,运维和开发在这里分工。
  5. 4.5实验:ceph-csi 与 gpfs-csi 接入把后端存储真正接进 K8s,并跑通快照。
  6. 4.6商业方案巡礼:Weka / VastData / XSKY知道市面上有什么、各自强在哪,选型时才不会只会推 Ceph。
  7. 4.7可观测性:指标、告警与容量水位值班靠的不是手快,是提前两周就看到容量要满了。
  8. 4.8值班手册:SOP 与故障复盘把前面所有知识固化成可交接的流程,这才是工程师的产出物。