从源码理解 KubeRay 与 Volcano:系列目录 Ray 集群管理与批调度。从背景导引到 KubeRay 协调、恢复,再到 Volcano Gang、队列、两端接入与系列总结的十一篇文章。 2026-09-16 源码阅读 #Ray #Kubernetes #KubeRay #Volcano
第 0 篇|背景导引:Ray、Kubernetes、KubeRay 与 Volcano 从计算与部署需求出发,解释 Ray、Kubernetes、KubeRay 与 Volcano 的职责和采用条件,给出面向使用者的架构与设计阅读路线。 2026-09-15 源码阅读 #Ray #分布式计算 #源码阅读 #Kubernetes #KubeRay #Volcano
第 1 篇|KubeRay 架构:组件分工与协作 以一次 RayJob 提交说明各类资源的用途,解释 KubeRay、Kubernetes 与 Ray 如何分工完成集群准备、程序执行和收尾。 2026-09-15 源码阅读 #Ray #分布式计算 #源码阅读 #Kubernetes #KubeRay
第 2 篇|KubeRay 协调:从 Pod 变化到 Reconcile 从 worker Pod 的状态变化进入监听、缓存和工作队列,跟踪一次 Reconcile,以及事件、延时和错误怎样触发下一轮协调。 2026-09-15 源码阅读 #Ray #分布式计算 #源码阅读 #Kubernetes #KubeRay
第 3 篇|KubeRay 并发:一个 Operator 如何管理 100 个 RayCluster 以 100 个 RayCluster 为推演场景,分析协调协程、队列键锁、缓存滞后与 expectations,区分管理并发和 Ray 计算并发。 2026-09-15 源码阅读 #Ray #分布式计算 #源码阅读 #Kubernetes #KubeRay
第 4 篇|KubeRay 恢复:Operator 重启后如何继续工作 把中断放在资源创建与状态写回之间,沿持久化身份、对象查询和重试分支,分析 Operator 重启后的恢复依据与防重边界。 2026-09-15 源码阅读 #Ray #分布式计算 #源码阅读 #Kubernetes #KubeRay
第 5 篇|KubeRay 高可用:从主备切换到 Ray 服务恢复 从 Operator 的 Lease 选主与接管,追到 Kubernetes 控制面、Ray head、GCS 和 RayService,分别核对管理恢复、计算恢复与请求可用性。 2026-09-15 源码阅读 #Ray #分布式计算 #源码阅读 #Kubernetes #KubeRay
第 6 篇|Volcano 架构:从 Pod 到作业 从几个 Pod 争用资源的问题进入 Volcano,区分 Job、PodGroup、Queue,以及 Scheduler、Controller Manager 和 Admission 的协作。 2026-09-15 源码阅读 #Ray #分布式计算 #源码阅读 #Kubernetes #KubeRay #Volcano
第 7 篇|Volcano Gang 调度:成组分配与绑定 沿一个三成员 PodGroup 走过准入、试分配、Gang 检查、提交与异步绑定,说明资源不足和部分绑定失败时会发生什么。 2026-09-15 源码阅读 #Ray #分布式计算 #源码阅读 #Kubernetes #KubeRay #Volcano
第 8 篇|Volcano 资源竞争:队列份额与作业调度 用两个 Queue 说明 Volcano 怎样计算资源份额、选择下一项工作,以及资源占满后怎样在 Queue 内抢占或跨 Queue 回收。 2026-09-15 源码阅读 #Ray #分布式计算 #源码阅读 #Kubernetes #KubeRay #Volcano