01
推理系统论文与上游实现
arXiv / Stanford、Meta、Alibaba、NVIDIA Research 等
·
HiSparse 面向 Top-k 稀疏 Attention,把每个请求的完整 KV 历史放在 Pinned Host Memory,只在 GPU 保留固定大小工作集;融合 CUDA Kernel 在 Decode CUDA Graph 内完成命中检测、LRU 替换与 Host-to-Device Fetch,共享跨层选择的模型还可精确预取。实现已合入上游 SGLang;作者在 DSA、NSA、Quest 三类路径,以及 2×B200、8×H200 和 GH200 上报告,长上下文峰值生成吞吐最高提升 4.7 倍,同时输出不变、重叠负载区间的 TPOT 相近。
为什么值得读:稀疏 Attention 若仍要求完整 KV 常驻 HBM,算力节省不会解除容量墙;HiSparse 把“逻辑可选”与“物理驻留”分开,使并发和可服务上下文主要受主机层容量与链路约束。4.7 倍来自特定模型、Top-k=2048、上下文和平台;论文也指出剩余成本几乎就是主机—设备 I/O,且最大的跨层预取收益依赖模型共享索引选择。
02
开源发布
vLLM
·
0.27.0 汇入 561 个 Commit,升级到 PyTorch 2.13.0、Triton 3.7.1,加入 Kimi K3 与 Qwen3.5 等模型支持。系统侧扩充通用 P2P KV 二级层、按请求过滤与可插拔淘汰策略、并行度无关的页面映射;为混合 MLA+SSM 模型加入 NIXL Prefill/Decode、异构 Block Size 和 MoRIIO TP↔DP 路由,并增加简化版 DP+EP 外部负载均衡容错及弹性 EP 异步准备。项目还自报 DeepSeek-V4 多项局部优化,包括两个分别降低端到端 TTFT 3.4% 和 3.9% 的改动。
为什么值得读:这是一次涉及依赖、缓存身份、分离式推理和故障域的“大面升级”,说明 Serving Engine 已从单机 Scheduler 走向跨层状态与集群生命周期管理。升级者应把 PyTorch/Triton 版本变化视为破坏性环境变更,并分别回归 KV Offload、P/D 抢占、弹性扩缩与模型数值;Release 中的性能百分比是项目在对应 PR 边界内自报,不是跨工作负载保证。
03
开源通信库发布
NVIDIA NCCL
·
该版本新增 ncclCollConfig_t 与全套 nccl*Config API,可按单次 Collective 选择算法、CTA/CGA 尺寸和策略,并给 Profiler 加 userTag。Blackwell + CUDA 13.3 起可使用 Compute Fabric Transport 的 Host/Device API 执行 Put、Get 与 NVLS;GIN 增加 AWS EFA GDA Backend、设备侧 Timeout 与多 Backend DevComm。诊断侧加入 GPU、驱动、ECC、NVLink、环境变量一致性与主动 P2P 连通检查,并修复 PXN 初始化竞态 Hang、共享 Backing Allocation 上多对称窗口的数据损坏等问题。
为什么值得读:通信栈开始把算法选择、设备侧 RMA、故障诊断和 Profiling 暴露成细粒度控制面,而不是只靠全局环境变量和离线 nccl-tests。生产采用要先看边界:CFT 仅支持 Blackwell/CUDA 13.3+;PAT+NVLS 在 H100 有已知性能回退,B40 对称 TMA Kernel 可能非法访存,Release 给出了禁用开关。
04
分布式训练系统论文
arXiv / 清华、字节跳动等
·
StateFlow 将长序列切成调度 Chunk,在 Chunk 间传播线性递归的边界状态与反向梯度,使局部 Backward 后即可释放 Activation;对混合 Softmax Attention/递归模型,再用离线 Profile 搜索非均匀切分,并把低并行度 State Transition Kernel 与周边 Dense 计算重叠。作者在 A100 80GB、8/16/32 GPU 上评测 3B/15B/32B Gated DeltaNet 与 Mamba-3、最长 256K 上下文,报告相对同配置原生 Pipeline 最高 2.22 倍吞吐与约 2.45 倍峰值显存缩减。
为什么值得读:线性 Attention/SSM 降低了算子复杂度,却没有自动解决长序列 Activation 生命周期和 Pipeline Bubble;StateFlow 利用固定大小递归状态重画了并行边界。结果基于 Megatron Core r0.12.0、ms-swift 3.6.4、PyTorch 2.6 和 A100,且代码尚表述为“将发布”,跨互连、现代 GPU 与其他递归算子仍需复验。
05
正式会议硬件—系统论文
arXiv / MICRO 2026
·
这项已被 MICRO 2026 接收的工作指出,同一 Tensor 在 Prefill/Decode 或 MoE Expert 强度变化时,最佳执行设备可能在 NPU 与 PIM 间切换,而静态、偏单一设备的数据布局会浪费带宽。PFM 用单一联合优化物理布局,为 NPU 与 PIM 暴露不同逻辑地址视图,并以 Accessor-Aware Remapping 和 Runtime Scheduler 选择访问方式,无需复制或即时 Relayout。基于增强 Ramulator 2.0 的 HBM-PIM 模拟和 A100/开源模拟器校验,作者报告相对最佳既有统一内存设计端到端吞吐最高提升 2.32 倍。
为什么值得读:统一地址空间不等于统一高效访问;当执行位置随阶段和路由改变,布局本身也需要成为动态调度的一部分。2.32 倍来自架构模型与 Trace 驱动模拟,模拟校验平均误差为 -5.14%、范围 -15.57% 至 0%,不是现成 NPU-PIM 芯片实测;采购或部署结论仍需真实硬件验证。
06
开源补丁发布
DeepSpeed
·
0.19.5 修复 ZeRO++ 在小参数上的 Secondary Shard Copy、AutoEP 的 ZeRO-1/2 Universal Checkpoint 转换,并调整 ZeRO-3 异步 Gradient Offload,使 Pinned Offload Buffer 成为默认路径。版本还避免单个 Op Builder 的兼容性探测破坏 DeepSpeed Import,修复 Torch 2.12+ 编译问题,并把原生 Host Pinning 拆为独立 pin_memory Op,同时为 Unmanaged Gradient Accumulation 加入 ZeRO Offload 支持。
为什么值得读:这些改动都位于训练恢复、Host—Device 数据路径和导入/编译兼容的基础层,失败时可能表现为错误 Checkpoint、构建中断或吞吐抖动。由于它紧随 0.19.4 发布,使用 ZeRO++、AutoEP、异步 Offload 或 Torch 2.12+ 的团队应做定向升级回归,而不是只验证训练能启动。
07
官方工程博客与制品发布
PyTorch Blog / ExecuTorch
·
ExecuTorch 为 30B 开放权重 Muse Glimmer 提供 NVIDIA CUDA 与 Apple Silicon PTE 制品,支持文本/图像输入、直接 GGUF 导出、原生 K-Quant、128K+ 上下文和 DFlash 并行 Diffusion Speculative Decoding。CUDA 路径用 CUDA Graph 合并 Decode Launch,以 Packed K-Quant Kernel 优化低 Batch,并为单 Token Decode 与小型 DFlash Verification Block 使用长度感知 Split-K FlashDecoding++;长上下文中仅 13/52 层使用全局 Attention,其余 39 层为 Sliding Window。
为什么值得读:它展示了复杂新架构不必为每个端侧 Backend 重写完整模型,而可从 PyTorch 图经 AOT Lowering 到 Triton、MLX 与 Metal。当前边界同样重要:首发不支持视频,也没有跨会话 Prefix Sharing、Checkpointing 或 Continuous Batching,因此它更接近单机多会话端侧 Runtime,而非完整生产 Serving Engine。