01
RL 后训练与推理系统论文
arXiv / 南京大学、阶跃星辰
·
MISA-T 面向 RLVR、RLHF 与 Agentic Rollout 共用异步推理池的场景,在路由层加入自适应会话准入、按工作负载划分的 KV 容量和驻留时间加权记账,同时保持 Trainer 指定的任务混合比例。作者在 Step3.7 与 Qwen3.6-35B-A3B 的 Rollout-only 实验中,相对经过静态并发 Sweep 的 vLLM Router 报告吞吐分别提升 53.3% 和 43.6%;Step3.7 的 50 轮端到端实验中,Rollout 吞吐提升 35.6%,平均迭代时间降低 22.8%。
为什么值得读:RL 推理流量的 KV 占用不仅由 Token 数决定:工具等待期间仍要保留会话状态,不同任务还会形成不同 Decode 尾部和完成依赖。MISA-T 将“准入一次意味着承诺一段 KV 驻留时间”显式化,为 RL 控制面提供了比 Prefix Locality 更完整的资源模型。结果基于 196B-A11B Step3.7 的 H200 集群与 Qwen3.6-35B-A3B 的 16×H100 配置,且策略依赖服务层暴露会话 Cache Snapshot;跨模型、引擎与任务混合仍需复验。
02
机架级模型加载系统论文
arXiv / Scitix.AI
·
FlashBoot 在 SGLang 上引入 FabricArena,将数万块离散 Weight Tensor 预打包为连续、可导出且跨节点可寻址的 Device Memory;FlashLoad 以批量零拷贝路径从 Host 加载,FlashClone 则通过 IMEX/NVLink 远程映射已有副本,避免先建立 NCCL Communicator。作者在 GB300 NVL72、DeepSeek-V4-Pro 1.6T 与 DeepSeek-V4-Flash 284B、TP=4 的边界内报告,远端映射约 10 ms、每个 Clone 不低于 700 GB/s;单节点加载从 20.1 秒降至 0.4 秒,最多 50 倍,8 个并发 Clone 的机架级加载从 87 秒降至 0.32 秒,超过 270 倍。
为什么值得读:大模型弹性扩容和故障恢复的关键路径不再只是从存储读多少字节,而是权重对象布局、跨节点访问授权和启动时集体通信是否串行。连续 Arena 让“已有 GPU 副本”成为机架内可复制制品。不过论文仅实测单一 NVL72/IMEX Fabric,RDMA Backend 尚属未来工作,代码也仅承诺后续公开;这些倍数不能外推到普通 PCIe 或以太网集群。
03
官方工程博客与可复现实作
AWS Machine Learning Blog
·
AWS 在 SageMaker HyperPod 上把 vLLM/LMCache 的 L0 GPU、L1 Host DRAM 延伸到 Curvine 共享 NVMe L2,并配合 Prefix/KV-aware Router 让不同 Replica 复用同一份 KV。厂商测试使用两节点、Qwen2-7B-Instruct FP16、TP=1、LMCache 256-Token Chunk,并绕过 Router 定向让 Pod A 写、Pod B 跨节点读;500—3000 Token Sweep 中,2500 Token 的 TTFT 从 774 ms 降至 287 ms(2.7 倍),约 1925 Token 的跨节点读取约 56 ms;四轮对话回放总延迟从 4.21 秒降至 3.25 秒。
为什么值得读:共享 L2 解决了水平扩展后每个 Replica Cache 孤岛的问题,也把 KV 复用变成存储拓扑和路由共同决定的系统能力。边界同样关键:500 Token 时只有 0.99 倍,短 Prompt 的跨节点往返可能不如重算;上述数据是 AWS 在 A10G/L40S/L4、串行单请求和字节完全相同 Prompt 下自报,并且当前需 Patch LMCACHE_REMOTE_URL 才能让 Operator 使用 Curvine FUSE,生产并发收益取决于命中率与网络。
04
官方工程博客与可复现训练实验
AMD ROCm Blog
·
AMD 将 ICLR 2026 的 On-Demand Communication 移植到 ROCm 7.2 与 Primus:节点内使用 XGMI/HIP IPC,跨节点使用 rocSHMEM/MORI,以单边 Gather 与 Scatter-Accumulate 取代 FSDP2 每层 All-Gather/Reduce-Scatter,并允许各 Rank 运行真实可变长度 Microbatch。相对带 Packing/Padding 的 RCCL 强基线,AMD 自报 8×MI300X、1.5B 模型在全局 Batch 16 时最高 1.201 倍;16×MI300X、14B 模型在 Batch 128 时 1.154 倍,但跨节点 Batch 16 只有 0.796 倍。
为什么值得读:它验证了 FSDP 同步语义可从“每层所有 Rank 锁步”放宽为“按需取参、异步推梯度、Minibatch 末统一 Settle”,并给出完整复现路径。厂商结果也清楚暴露反例:小 Batch 的固定开销会输给 RCCL,ROCm GDA 缺少 GPU 发起 RDMA Write,需要额外同步;当前 Settle 与 Backward 的重叠仅约 5%,所以这不是无条件替换 Collective 的结论。
05
开源 GPU Kernel 发布
FlashInfer
·
0.6.17 将 flashinfer.moe_ep 的 MegaMoE 路径推进到 Serving Engine:支持 CUDA Graph Capture/Replay、融合量化与 Staging、预量化 Weight Pack、跨层复用的对称 Buffer Workspace,以及无需在线 Autotune 的持久化 Knob Cache。NCCL-EP 与 NIXL-EP 还增加可选 Fault-Tolerance Rank Mask,在 Dispatch/Combine 的 Peer 超时时跳过故障 Rank;同时修复 SM120/121 NVFP4 W4A4 的两个量化准确性问题,并加入 Kimi K3 MLA、MiniMax-M3 稀疏 Attention 与 Ulysses P2P All-to-All 路径。
为什么值得读:MoE Kernel 库正在承担通信、图捕获、调优状态与局部容错,而不只是 GEMM。对生产团队而言,FP4 准确性修复和 Rank Mask 都要求端到端数值、路由语义与降级行为测试;Rank Mask 让进程存活不代表丢失 Expert 后的模型质量仍满足 SLO,且该 Release 仍回退了 SM90 CUTLASS MoE Backend。
06
开源分布式系统发布
Ray
·
Ray Data 默认启用 DataSourceV2,并引入任务式 Hash Shuffle V2:Map/Reduce Operator 通过 Object Store 传递 Shard,替代预估容量后常驻 Actor Heap、不可 Spill 的 Aggregator Pool,且支持 Join。Ray Serve 将 HAProxy 作为独立 PyPI 包与默认 Ingress,增加 gRPC Streaming、指标和请求 ID;Serve LLM 还加入实验性 KV-aware Router,通过 Event Plane 跟踪 Replica KV 状态,并在路由前 Tokenize、结合 Prefill/Decode Token Load 选择 Replica。Ray Core 同时加入嵌入式 RocksDB GCS 后端,故障恢复不再强制依赖外部 Redis。
为什么值得读:该版本的共同主线是把隐形状态纳入平台资源模型:Shuffle 中间态回到可 Spill、可计量的 Object Store,Serving Cache 进入路由决策,控制面元数据也获得内置持久化。KV-aware 路由在 2.57 仍明确为实验性且完整支持计划到 2.58,升级者应分别回归 Direct Ingress、GCS 恢复与 Data Shuffle 内存压力。
07
训练可靠性论文与开源实现
arXiv
·
SCOUT 针对同步训练会把单 Rank Stall、Slowdown 或数值错误扩散成全局症状的问题,以等价 Replica 的严格多数共识识别异常 Rank。其 Consensus Collective Communication 对 Progress、Timing、数值 Signature 与 Collective Fingerprint 做紧凑比对;独立 CPU Observer 在 Trainer Block 或终止后仍可响应,In-situ Replay 则在原模型状态、Kernel、Memory Pressure 和通信路径下复现 Straggler 与 Silent Data Corruption,并用干净 Replay 覆盖验证 Checkpoint 数值完整性。
为什么值得读:传统 In-process Watchdog 往往在真正 Hang 时与训练进程一起失语,而离线硬件测试又丢失触发故障的 Workload 条件。SCOUT 将故障定位、原位复现和恢复点认证连接起来,并声称可接入 PyTorch、TorchTitan、Megatron-Core 与 DeepSpeed 而无需改训练循环;不过 v1 摘要未给出统一端到端开销数字,部署前仍需检查多数假设、旁路网络和 Replay 对生产负载的扰动。
08
集群 Benchmark 与回归测试论文
arXiv / NHR@FAU
·
ClusterBench 让一次 Scheduler Submission 把相同测试派发到集群每个节点,并持续采集 CPU、GPU、Memory、Interconnect 与 I/O 指标;内置集合包括 HPL、DGEMM/SGEMM、TheBandwidthBenchmark、OSU Micro-Benchmarks 与 fio。作者在 NHR@FAU 的 Helma、Alex、Fritz 集群上报告,同一部件随时间的变动通常低于 1%,但规格相同的不同个体间可达 5%;性能与功耗、频率、温度的相关性还会随风冷/液冷及按时间或空间观察而变化。
为什么值得读:大规模训练由最慢 Rank 决定 Step Time,单节点 Burn-in 或一次性验收无法发现软件升级回退和个体慢节点。ClusterBench 将 Benchmark 变成集群生命周期内的连续时间序列,更适合做 Kernel、驱动、固件和网络变更 Gate;论文结果来自三套 HPC 集群,5% 是所测部件和测试的上限观察,不是所有 AI 集群的固定离散度。
09
开源预发布
NVIDIA TensorRT-LLM
·
该候选版加入 C++ KVCacheManagerV2、Paged Vanilla Attention、FlashInfer Block Reuse 与 KV 压缩物理 Compaction;分离式 Serving 的内部 Metadata 改为共享密钥签名,并增加 HTTP Keep-alive、每请求优先级和多项 Breaking API 迁移。模型侧扩充 Kimi K3、Qwen3.x、MiniMax M3 和多模态 Encoder Cache;同时修复 UCX/NIXL 传输取消、KV Pool Sizing、MoE Hang 与 CUDA Graph Warmup OOM 等问题。
为什么值得读:这是一次同时改动缓存管理、请求接口、分离式数据路径和 Kernel Backend 的大范围 RC,适合作为提前兼容目标,不宜直接当稳定版。Release 明列多 GPU 低精度 MoE 严重精度损失、torch.compile + CUDA Graph 非法访存、Python NIXL + UCX 1.21 高并发崩溃、共享 FlashInfer JIT 并发编译启动失败等风险;采用者必须按模型、量化、拓扑和 Graph 模式设上线 Gate。