Timeline:

  • 看了前 4 个 commit 的改动 ✅ 2026-07-23

0. Review

reviewcommit
加了一个 bool 的环境变量(enable_ep_overlap),然后按照这个决定后续的 CUDA_DEVICE_MAX_CONNECTIONS 的值e6e9982: add enable_ep_overlap config and config validation
1. 原来的_token_dispatch 内的算 splits + alltoall + permute 拆成三个独立函数
2. 原来的_token_combine 内的 (etp 的 ar + 反向 permute)和 alltoall 变成俩独立的函数
6e8321d: finish task 1.1
第一次 a2a 拉过来的 prob 多次 D2H 变成一次,所以只需要一次 D2H了现在1473c48: finish task 1.3
加了一个 EPDispatchState 类( 每个 mb 一个),用来存之前挂在 nn.module 的变量,解决 2mb 的 overlap时两者的 split 互相读错,故:token_dispatch和token_combine 现在需要多考虑输出一个 state 输入一个 state12c63bc: finish task 1.2
把 MoE.forward 切成 preprocess(路由+排序)→ 专家计算 → postprocess(合并+还原) 三段b4be0c9: finish task 3.1
1c6200c: commit for task 2.1

问题: 1.

2 验证