源码阅读导引:Ray、Kubernetes、KubeRay 与 Volcano 从计算与部署需求出发,解释 Ray、Kubernetes、KubeRay 与 Volcano 的职责和采用条件,给出面向使用者的架构与设计阅读路线。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay #Volcano
KubeRay 源码阅读:从 RayJob 看组件分工与协作 以一次 RayJob 提交说明各类资源的用途,解释 KubeRay、Kubernetes 与 Ray 如何分工完成集群准备、程序执行和收尾。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay
KubeRay 源码阅读:一次 Pod 变化怎样触发 Reconcile 从 worker Pod 的状态变化进入监听、缓存和工作队列,跟踪一次 Reconcile,以及事件、延时和错误怎样触发下一轮协调。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay
KubeRay 源码阅读:一个 Operator 如何管理 100 个 RayCluster 以 100 个 RayCluster 为推演场景,分析协调协程、队列键锁、缓存滞后与 expectations,区分管理并发和 Ray 计算并发。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay
KubeRay 源码阅读:Operator 重启后如何继续工作 把中断放在资源创建与状态写回之间,沿持久化身份、对象查询和重试分支,分析 Operator 重启后的恢复依据与防重边界。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay
KubeRay 源码阅读:从 Operator 主备切换到 Ray 服务恢复 从 Operator 的 Lease 选主与接管,追到 Kubernetes 控制面、Ray head、GCS 和 RayService,分别核对管理恢复、计算恢复与请求可用性。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay
Volcano 源码阅读:从 Pod 到作业 从几个 Pod 争用资源的问题进入 Volcano,区分 Job、PodGroup、Queue,以及 Scheduler、Controller Manager 和 Admission 的协作。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay #Volcano
Volcano 源码阅读:一次调度怎样满足 Gang 约束 跟踪一个 PodGroup 在 Session 中的准入、试分配、Gang 检查、提交与绑定,解释分配撤销和部分绑定失败的处理边界。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay #Volcano
Volcano 源码阅读:多个作业怎样共享与竞争资源 用有明确前提的数字例子分析 Queue 份额、DRF、优先级和资源回收,区分策略计算、节点放置与实际 Pod 占用。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay #Volcano
KubeRay 与 Volcano:从 RayJob 到 PodGroup 说明 KubeRay 如何把 Ray 集群的调度需求交给 Volcano,以及提交、完成、暂停和重试时两端如何协作。 2026-09-15 源码阅读 #Ray #源码阅读 #分布式计算 #Kubernetes #KubeRay #Volcano