第 0 篇|背景导引:Ray、Kubernetes、KubeRay 与 Volcano 从计算与部署需求出发,解释 Ray、Kubernetes、KubeRay 与 Volcano 的职责和采用条件,给出面向使用者的架构与设计阅读路线。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay #Volcano
第 1 篇|KubeRay 架构:组件分工与协作 以一次 RayJob 提交说明各类资源的用途,解释 KubeRay、Kubernetes 与 Ray 如何分工完成集群准备、程序执行和收尾。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay
第 2 篇|KubeRay 协调:从 Pod 变化到 Reconcile 从 worker Pod 的状态变化进入监听、缓存和工作队列,跟踪一次 Reconcile,以及事件、延时和错误怎样触发下一轮协调。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay
第 3 篇|KubeRay 并发:一个 Operator 如何管理 100 个 RayCluster 以 100 个 RayCluster 为推演场景,分析协调协程、队列键锁、缓存滞后与 expectations,区分管理并发和 Ray 计算并发。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay
第 4 篇|KubeRay 恢复:Operator 重启后如何继续工作 把中断放在资源创建与状态写回之间,沿持久化身份、对象查询和重试分支,分析 Operator 重启后的恢复依据与防重边界。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay
第 5 篇|KubeRay 高可用:从主备切换到 Ray 服务恢复 从 Operator 的 Lease 选主与接管,追到 Kubernetes 控制面、Ray head、GCS 和 RayService,分别核对管理恢复、计算恢复与请求可用性。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay
第 6 篇|Volcano 架构:从 Pod 到作业 从几个 Pod 争用资源的问题进入 Volcano,区分 Job、PodGroup、Queue,以及 Scheduler、Controller Manager 和 Admission 的协作。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay #Volcano
第 7 篇|Volcano Gang 调度:成组分配与绑定 跟踪一个 PodGroup 在 Session 中的准入、试分配、Gang 检查、提交与绑定,解释分配撤销和部分绑定失败的处理边界。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay #Volcano
第 8 篇|Volcano 资源竞争:队列份额与作业调度 用有明确前提的数字例子分析 Queue 份额、DRF、优先级和资源回收,区分策略计算、节点放置与实际 Pod 占用。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay #Volcano
第 9 篇|KubeRay 与 Volcano:接入与生命周期协作 说明 KubeRay 如何把 Ray 集群的调度需求交给 Volcano,以及提交、完成、暂停和重试时两端如何协作。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay #Volcano