01
论文预印本
arXiv
·
TileSight 把 tile 同时作为程序和分析原语:卡内建模计算—内存流水重叠与基于复用距离的缓存命中,跨卡则把远端 tensor 访问映射到 placement、route 与 alpha-beta stage cost。作者在 A100、H200、B200、B6000 上报告单卡 kernel 延迟预测的 pooled MAPE 为 12.35%;扩展到最多 32 张 GPU 后,融合分布式 kernel 的 wMAPE 为 16.18%,端到端 vLLM serving 为 13.52%。
为什么值得读:融合 kernel 与分布式推理让传统 roofline 太粗、黑盒回归又难解释。TileSight 尝试用同一层级化模型连接 tile 参数、cache、通信与服务延迟,可用于低成本设计空间搜索;当前仍是预印本,且代码仅承诺在发表时开放,结果需要独立复现。
02
Kernel 优化指南
AMD ROCm Blog
·
AMD 以 MQA/GQA decode 为例,展示如何利用 MI450 的 TDM 异步 global-to-LDS 搬运、更大的 VGPR/LDS,以及 workgroup cluster:先调整 WMMA operand/output layout,重塑 K/V 以获得更宽的 TDM 请求,再把 TDM、LDS load、QK/PV 与 softmax 做细粒度流水,并用 split-k 拉满长上下文并行度。项目方在 batch 64、64 个 Q heads、1/2 个 KV heads、4K—64K KV 长度与 FP8 QKV 下,自报 GQA 达到 17.10 TB/s、即同机 20 TB/s 读带宽的 85%;文章提供完整命令与开源 kernel。
为什么值得读:这是一份把新硬件原语落实到 attention hot loop 的可复现案例,尤其说明 decode 优化不能只看矩阵指令,还要共同设计 TDM 请求形状、LDS 双缓冲、依赖调度与跨 workgroup reduction。数字来自 AMD 的早期 MI450 系统,且尚未覆盖 paged KV cache、MLA/DSA 或端到端 serving。
03
开源发布
NVIDIA Dynamo
·
Dynamo 1.3.0 将 KV 选择拆成可独立扩展的 slot/selection service,并加入 branch-sharded KV indexer、拓扑约束与按 worker、DP rank 的会话亲和;Release 自报 compressed radix tree 的 store/remove 事件处理约快 28 倍,AgentX bs64/c384 多前端基准吞吐提高 13.7%。Planner 改用 AIC latency prediction,并给 Mocker / offline replay 加入 Mooncake trace、KVBM offload、逐请求 TTFT/ITL 与 cache-hit 指标;同时引入面向 RL rollout 的 token-in/token-out 和原地权重更新路径。
为什么值得读:分布式推理的瓶颈正从单个 engine 转向“缓存在哪、请求去哪、扩多少卡、升级前如何回放流量”的控制面。这个版本把这些能力收进同一平台,但 Release 也列出 EFA 分离式 SGLang 空响应、部分 KVBM/LMCache handshake 等已知问题,生产升级必须按后端和网络逐项回归。
04
论文预印本
arXiv
·
论文对 19 个 AI tools 做 CPU/GPU profiling,发现 11 个偏好 GPU、4 个取决于条件、1 个因 PCIe 搬运更适合 CPU、3 个基本设备中性。系统让 LLM agent 在立即上 GPU、排队等待 GPU、CPU offload 三种动作中选择,并由算法 runtime monitor 提供运行平均、对称重测、swap 重测与探索提示;作者报告在串行、并发竞争和 VRAM 受限的 13 个场景中均找到 brute-force 最优映射,且无需离线训练。
为什么值得读:Agent 工作流会把 embedding、视觉、OCR、代码执行等异构工具串在一起,GPU-first 容易把 PCIe、排队和 VRAM 竞争变成端到端长尾。该工作提示调度器应基于在线 contention 更新 placement,而不是把离线 profile 当常量;但场景规模与工具集合仍有限。
05
正式论文预印本
arXiv / PVLDB 2026
·
SPDP 将离线非结构化 weight pruning 与输入相关的动态 pruning 放进同一个 Tiled-Column-wise Bitmap Compressed 格式,并为两个阶段分别设计 kernel:decode 使用 CUDA-core spMspV 与共享内存 bitmap decode 做 activation skipping,prefill 使用 Tensor-Core SpMM 保持计算密度。作者在 inference GPU 上报告,相比 SpInfer 等稀疏框架平均加速 1.24—1.37 倍、最高 2.51 倍,同时在匹配 perplexity 时可使用最高多 25% 的稀疏度;论文已被 PVLDB 2026 接收并开放代码。
为什么值得读:许多稀疏方案只优化 prefill 或 decode,格式转换和不规则访问会吃掉理论收益。SPDP 的关键是让统一压缩布局服务两个算力特征完全不同的阶段,适合评估“模型稀疏度—kernel 规则性—服务吞吐”的联合 Pareto 边界。
06
开源系统发布
NVIDIA / Hugging Face Blog
·
Cosmos-H-Dreams 将手术视频 world model 蒸馏为 causal few-step student:先用缓存的 teacher denoising trajectories 做 causal warmup,再以 self-forcing 让学生在自己的历史输出上接受分布匹配监督,最少每个 latent frame 使用两步去噪。FlashDreams runtime 叠加 streaming KV cache、CUDA Graph 与模型编译;NVIDIA 自报在单张 RTX PRO 6000 上从标准 Cosmos-H-Surgical-Simulator 约 10 FPS 提升至约 160 FPS,并开放模型、训练 recipe 与 runtime 代码。
为什么值得读:这是推理基础设施从文本 token 扩展到闭环生成环境的实例:低延迟不仅依靠蒸馏,还需要 causal state、KV 生命周期和稳定的流式执行。160 FPS 属厂商在特定模型、GPU 和场景上的自报,视觉速度不等于物理正确性;文章也明确后续仍需 action fidelity、长期漂移与 sim-to-real benchmark。
07
论文预印本
arXiv
·
Controlled Periodic Data Parallelism 是一条兼容 PyTorch DDP 的路径:worker 先进行 K 次本地更新,再用 gradient AllReduce 与 SlowMo 参数平均做 reconciliation,试图比纯 LocalSGD 更好地控制轨迹分歧。作者在 Grid'5000 的站内集群及 Nancy—Sophia、16.6 ms RTT 跨站部署上报告,ResNet-50/CIFAR-100、固定学习率 0.1 时,K=4 相比 DDP 的 peak accuracy 高 2.44 个百分点,平均 wall-clock 低 13.8%,暴露的同步时间约为 DDP 一半。
为什么值得读:当训练跨越地域或波动网络时,“每步同步”会把 WAN latency 直接暴露在关键路径,而只做参数平均又可能损伤收敛。CPDP 展示了把同步周期与 reconciliation 机制共同调优的折中;目前工作仍在同行评审中,结果主要覆盖视觉模型与单组 WAN 条件。