Timeline:
- 看了前 4 个 commit 的改动 ✅ 2026-07-23
0. Review
| review | commit |
|---|---|
| 加了一个 bool 的环境变量(enable_ep_overlap),然后按照这个决定后续的 CUDA_DEVICE_MAX_CONNECTIONS 的值 | e6e9982: add enable_ep_overlap config and config validation |
| 1. 原来的_token_dispatch 内的算 splits + alltoall + permute 拆成三个独立函数 2. 原来的_token_combine 内的 (etp 的 ar + 反向 permute)和 alltoall 变成俩独立的函数 | 6e8321d: finish task 1.1 |
| 第一次 a2a 拉过来的 prob 多次 D2H 变成一次,所以只需要一次 D2H了现在 | 1473c48: finish task 1.3 |
| 加了一个 EPDispatchState 类( 每个 mb 一个),用来存之前挂在 nn.module 的变量,解决 2mb 的 overlap时两者的 split 互相读错,故:token_dispatch和token_combine 现在需要多考虑输出一个 state 输入一个 state | 12c63bc: finish task 1.2 |
| 把 MoE.forward 切成 preprocess(路由+排序)→ 专家计算 → postprocess(合并+还原) 三段 | b4be0c9: finish task 3.1 |
| 1c6200c: commit for task 2.1 |
问题: 1.