本文整理自 QCon 北京 2026 宋顾杨、李冲分享《大模型时代AI Workload 调度的通用范式》通过AI音视频总结工具Ai好记进行转录整理以下为视频转文字整理后的会议笔记内容。大模型任务要跑得起来背后调度是命脉。Ray 和 K8s 两个系统经常被拿来比是不是重复造轮子这场分享讲清楚了它们怎么协同、怎么互补Ray 管进程级的 AI 任务调度K8s 管集群资源组合起来就是当下 AI 基础设施的主流技术栈。这篇文章把 AI Workload 的调度需求、Ray 的编程模型和底层架构一次讲透。主流 AI 基础设施技术栈从整个大模型生命周期看要经历数据处理、预训练、后训练、服务推理、智能体等阶段业界普遍用一套技术栈支撑K8s 加 Ray 加 PyTorch 加 VLLM。以典型的 RL 训推一体架构为例训练部分靠 PyTorch 生态的 Accelerate 和 DeepSpeed推理部分用 VLLM做后端整个框架的编排、训练、推理和通信由 Ray 调度K8s 负责集群资源从开源活跃度看VLLM 2025 年有 8000 多个 commits 非常活跃Kubernetes 一直平稳高位Ray 近几年活跃度明显高于 Spark 和 Flink 两个传统大数据引擎。Ray 的爆发和 ChatGPT 有关OpenAI 底层用 Ray 做训练带来一波流量但真正铺开是靠近两年的两个主力场景RayData 做数据处理和 RL 强化学习。国内各大厂几乎全覆盖DeepSeek、月之暗面等也在用 Ray蚂蚁从 17、18 年就开始用还用在图计算、隐私计算等非 AI 场景。AI 任务的两类典型调度需求多模态数据处理pipeline 有多个 stage包含 CPU 预处理和 GPU 模型推理。调度特点有三个异构资源调度有抽帧、格式转换这种 CPU 算子也有 ASR、LLM 推理这种 GPU 算子动态资源分配每个 stage按负载动态扩缩容高容错局部故障不下探到整个 pipeline粒度至少到 stage大语言模型强化学习以 PPO training step 为例提示词经过 Actor 推理结果并发传给 Reward 和 Critic 打分评估再经 Aggregator 计算回传给 Actor 和 Critic 训练。特点是多角色Actor、Critic、Reward、Reference 至少四个每个角色运行时完全不同还涉及训推分离而且任务以复杂多播形式传递不是简单线性。所以 RL 更像「多个异构角色的协同调度问题」。两种计算范式SPMD 与 Single-Controller主流的预训练框架大量用SPMD范式每个计算单元跑同构进程、同步 Barrier、集合通信。弊端明显难表达异构角色、单点故障易引发通信组崩溃、缺乏全局编排。所以主流 RL 框架基本都换成了Single Controller, Multiple Program, Multiple Data范式中心 Controller 以全局视角统一编排跨角色任务流每个角色内部仍可保持 SPMD 提升局部性能异构角色松耦合容错能在角色粒度独立完成。由此总结出 AI 任务的四大调度需求异构角色资源需求、动态资源分配、高容错、对 Single-Controller 的原生支持。Ray 的编程模型Ray 的编程 API 很简洁。在主函数里调用 Ray 声明中心 driver用ray.remote装饰器定义异构角色并声明实例级异构资源需求通过remote接口创建进程级计算单元然后在中心 driver 里用远程方法调用编排复杂任务流。四大调度需求的实现Single-Controller 靠ray.remote声明中心 driver 加远程方法调用编排异构资源在装饰器里声明不同角色和资源需求高容错在装饰器里声明角色是否自动重启并在初始化函数自定义状态恢复动态资源分配通过给角色建 Workgroup运行中按负载动态创建远程实例加进去。Ray 的底层架构Ray 集群有一个 Head Node 和多个 Worker Node。Head 上有 Global ControlStorage 管集群元数据每个 Worker Node 跑一个 Raylet 进程负责分布式调度和本地进程管理。Driver 想动态创建远程实例时先把调度请求发给本地 RayletRaylet 决策选择合适的节点转发目标节点 Raylet 本地创建计算单元然后 Driver 通过 RPC 或共享内存和 Worker 交互。所以 Ray 本质上是对进程级计算单元做调度在这个粒度上可以落地丰富策略RoundRobin、资源水位调度、节点亲和性、标签亲和性、Gang Scheduling有重数据依赖还能用 Locality 优化调度效率。总结K8s 和 Ray 不是二选一K8s 管集群资源调度Ray 在之上管 AI 任务的进程级调度组合成 K8s 加 Ray 加 PyTorch 加 VLLM 的标准技术栈支撑了当下 90% 以上的主流大模型框架。理解了这个分层再去看 RL、数据处理这些 AI 任务怎么落地就清晰很多。常见问题 FAQ问Ray 和 K8s 到底是什么关系答两者是互补分层。K8s 负责集群资源的绝对标准调度Ray 在 K8s 之上负责 AI 任务内部的进程级调度和跨角色编排组合成主流 AI 技术栈。问Ray 为什么适合强化学习答RL 本质是多角色异构协同调度问题Ray 的 Single-Controller 范式能统一编排 Actor、Critic、Reward、Reference 等角色角色内部保持 SPMD容错还能在角色粒度独立完成。问Ray 的高容错是怎么实现的答可在ray.remote装饰器声明角色是否自动重启重启时在初始化函数自定义状态恢复实现进程级自动重调度。以上内容由 Ai好记 转录整理。Ai好记是一款音视频转图文笔记的AI音视频转录总结工具支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件转录后自动视频转文字生成精华速览、思维导图和结构化笔记等内容形式帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。