跳转至

GeoOrchestra: Orchestrating Heterogeneous Geo-Distributed Training with Network-Aware Scheduling

Warning

感觉是个水文...

TODO: 不过, 未来做 D2CLab 的时候可以借鉴!!!

(1) 论文背景与面临的挑战

  • 研究背景:

    • 大型语言模型(LLMs)参数规模呈指数级增长,单一数据中心在电力、散热和高端GPU集群规模上面临物理限制
    • 因此: 聚合跨区域闲置资源的跨数据中心(地理分布式)训练成为一种关键范式
  • 三大核心挑战:

    • 资源不对称(硬件异构性):
      • 不同数据中心的节点在内存容量和计算吞吐量上存在极大差异
      • 传统的均匀划分策略,在面对这种异构性时,会导致严重的资源利用率不足
  • 策略搜索爆炸(组合复杂性):

    • 在异构环境中存在负扩展性(添加资源反而导致性能下降)
    • 这使得探索有效的分布式并行策略,面临巨大的搜索空间和极高的计算成本,难以通过传统的一体化优化方案解决
  • 静态策略与动态网络的冲突(网络环境随机性):

    • 广域网(WAN)通常是多租户共享的,网络带宽不可预测
    • 而: 现有的训练调度器多依赖"离线生成"的静态执行计划,在遇到网络波动时会导致管道停滞和性能大幅下降

(2) GeoOrchestra 系统架构设计

为了解决上述复杂性,论文提出了一种名为 GeoOrchestra 的分治(divide-and-conquer)策略搜索与网络感知调度框架

alt text

该系统主要由三个核心组件构成:

  • 分析器 (Analyzer):
    • 采用异构感知的性能模型对候选资源组合进行轻量级预过滤(剪枝),消除具有负扩展性的硬件组合
    • 通过计算“跨数据中心强度 (Cross-DC Intensity, CDI)”指标以及估算单次迭代预算约束,提前剔除那些受制于网络带宽瓶颈或流水线气泡成本过高的资源组合
  • 编排器 (Orchestrator):
    • 负责资源驱动的细粒度并行策略搜索
    • 处理计算瓶颈:
      • 如果性能受限于慢速计算节点(straggler),系统采用贪心负载均衡:
      • 将模型层从 "慢速节点" 转移到 "相邻较快的节点" 以最小化阶段执行时间的方差
    • 处理通信瓶颈(核心创新):
      • 如果遇到广域网通信瓶颈,采用“内存换带宽 (Memory-for-Bandwidth Swap)”机制
      • 系统会利用高端节点(如 H20)的富余内存来增加微批次(micro-batch)的缓冲深度,让高端节点在等待跨数据中心数据时能预取并继续执行前向计算,从而解耦计算与通信依赖,有效掩盖长延迟
  • 运行时 (Runtime):
    • 全局资源调度器: 支持实时故障转移(Failover)
      • 如果主资源在执行期间不可用,调度器会自动热切换到候选集中的下一个可行计划,确保训练连续性
  • 网络流量调度器:
    • 利用动态时间片切分(Dynamic time-slot slicing)提供严格的最低带宽保证,实现多租户间的性能隔离
    • 同时: 通过多租户交错传输(Interleaved Transmission)机制利用空闲时隙临时重新分配带宽,提升聚合吞吐量

alt text

(3) 系统实现与 RDMA 网关

alt text

  • GeoOrchestra 的多租户训练引擎基于 Megatron-LM 进行扩展,支持策略搜索和不对称感知缓冲机制
  • 为了屏蔽广域网的高延迟和丢包不稳定性,系统部署了专门的 广域网 RDMA 加速网关
    • 将 "广域网通信" 结构化为 "主机-网关-主机" 的三段式传输
    • 发送方主机将数据发给本地网关后即可收到伪 ACK 以释放本地 RDMA 队列资源,再由网关在长距离广域网中通过超时重传和确认机制完成可靠传输