01
会议论文预印本
arXiv / ICPP 2026
·
这项将发表于 ICPP 2026 的工作把 MoE 专家输出的 GEMM 视为 producer,把返回源 rank 的第二次 all-to-all 视为 consumer:每个 rank 用持久化计算 kernel 覆盖本地全部专家并优先执行远端关键 tiles,再由占用少量独立 SM 的持久化通信 kernel 在 tiles 就绪后按 segment 发起传输。作者强调方案不要求把计算与通信侵入式融合成一个 kernel;在 4 张 A100、三类 MoE 模型和四个现有系统的实验中,自报最高 2.64 倍端到端加速、2.74 倍 MoE 层加速。
为什么值得读:MoE 的第二次 all-to-all 常直接暴露在关键路径上,而粗粒度 chunk 很难与 GEMM tile 边界对齐。该设计给出一个可移植的中间点:设备端信号、rank-wide 调度和 SM 资源隔离协同工作,同时也揭示 segment 大小与 producer/consumer SM 配额必须按拓扑和 shape 调优。
02
论文预印本
arXiv
·
InstantInfer 把冷启动中的进程、tensor 等组件表示为单调状态转换,并用跨组件状态依赖描述可安全并行的执行关系;其框架在尽量保留原顺序程序结构的同时,由 runtime 阻塞、唤醒并调度独立转换。作者将该抽象用于 vLLM 的进程树创建、tensor 加载和运行时模型切换,通过并发执行与合并细粒度 I/O 自报最高 7.2 倍冷启动加速、32.3 倍模型加载加速,以及 11.8 倍更短的模型切换服务停顿。
为什么值得读:弹性扩容、长尾模型与故障恢复都让 cold start 成为 TTFT 的隐藏上界。论文的价值不只是某条加载快路径,而是用显式依赖和正确性论证把跨组件并发从一次性手工重写变成可复用的程序抽象;当前仍是预印本,生产采用前需评估框架侵入性与不同存储栈的收益。
03
工程发布
Hugging Face Blog
·
Diffusers 现可原生加载 Nunchaku Lite checkpoint:runtime 在标准模型中替换目标 Linear,使用 SVDQuant 的 W4A4 路径处理 attention/MLP,并以 AWQ W4A16 处理精度敏感的调制层;kernel 通过 Hugging Face kernels 包分发,无需用户本地编译或维护独立 pipeline。项目方在 RTX PRO 6000 Blackwell、ERNIE-Image-Turbo、1024×1024 的测试中报告,NVFP4 将峰值显存从 31.1GB 降至 20.6GB、端到端从 3.00 秒降至 2.27 秒;叠加 torch.compile 后为 1.68 秒。
为什么值得读:它把高性能 diffusion 量化从架构专用 engine 拉回通用 Diffusers 加载与工具链,降低 checkpoint 发布和新模型适配成本。通用路径仍缺少原版 Nunchaku 的部分模型专用融合,且 NVFP4 只支持 Blackwell、INT4 支持范围也有硬件边界,性能数据应按模型和 GPU 复测。
04
开源系统发布
AMD ROCm Blog
·
AMD 发布开源 Hyperloom,把推理优化组织为 Profile → Analyze → Plan → Optimize → Validate 闭环:TraceLens-Agent 分析 trace,Magpie 和 IntelliKit 负责 benchmark、profiling 与验证,GEAK 搜索 HIP、Triton、FlyDSL 等 kernel 实现,Arbor 进行长周期树搜索,orchestrator 再按预期收益和成本管理候选。首版面向 MI300X、MI325X、MI355X、ROCm 7.2,以及 SGLang 0.5.12+ 和 vLLM 0.21.0+;AMD 称可把部分端到端调优周期从数周缩短到数小时。
为什么值得读:Agent 写 kernel 的真正难点不是生成一段代码,而是自动建立可重复基线、保持数值正确、定位跨仓库瓶颈并拒绝回退。Hyperloom 把这些环节组合成可运行系统,但“数周到数小时”属于厂商定性自报,是否有效高度依赖 benchmark 代表性、搜索预算和环境可复现性。
05
论文预印本
arXiv / Base Compute
·
BaseRT 为 Metal 4 tensor API 编写 dense/MoE GEMM 与 Flash-Attention prefill kernels,把计算受限的矩阵乘路径送入 M5 每核 Neural Accelerator,同时保留既有专用 kernels 处理内存带宽受限的逐 token decode。作者在单台 48GB Apple M5 Pro、15 个从 sub-1B 到 35B 的 Qwen、Llama 与 Gemma 配置上,自报 prefill 吞吐最高为 llama.cpp 的 6.4 倍、MLX 的 3.9 倍,decode 最高分别为 1.75 倍和 1.33 倍。
为什么值得读:工作清楚地区分了 tensor core 能显著受益的 batched prefill 与受统一内存带宽约束的 decode,适合作为端侧 runtime 做 workload-aware dispatch 的案例。结果来自项目作者且只覆盖单设备、单用户、M5 Pro,不包含 continuous batching、并发服务或更高 M5 SKU。
06
开源补丁发布
NIXL
·
NIXL 1.3.2 定向修复 1.3.1 引入的跨节点 EFA 传输挂死:开启 progress thread 时,CQ progress 可能在一批带 FI_MORE 的 WRITE descriptor 尚未闭合前取得同一 endpoint lock,使 batch 永久不 flush,decode worker 会卡在 KVPoll.WaitingForInput 并返回空响应。最终方案先识别每条 rail 的最后 descriptor,只在该位置或达到 batch 上限时清除 FI_MORE,从而关闭每条 rail 的批次,同时保留其他 provider 的 batching 吞吐。
为什么值得读:这是典型的“性能优化改变锁与完成队列时序,随后演化为生产 hang”问题。使用 EFA/efa-direct、progress thread 和 NIXL 1.3.1 的分离式推理部署应优先审阅升级;补丁范围很小,但直接影响 KV 传输可用性和空响应故障。
07
开源发布
LMCache
·
LMCache 0.5.2 明确成为 vLLM 0.26.0+ 的必需兼容版本,并将 NIXL 拆为可选 extra。功能侧加入 MiniMax M3、支持 vLLM Hybrid KV Cache Manager 的 CacheBlend 与 sliding-window dual-RoPE、L1 全局 P2P token matching,以及 Azure Blob、Valkey、Cloud Bigtable、SageMaker HyperPod 等 L2 adapter;同时修复 V2 ref-count 泄漏导致的内存耗尽与 CUDA IPC KV 内存回收问题。
为什么值得读:KV cache 层正在从单机 offload 组件变成连接 serving engine、远端存储和跨实例共享的兼容性中枢。这个版本既含接口依赖变化,也含可能导致长期服务内存耗尽的修复,vLLM 0.26 升级计划应把 LMCache、NIXL extra 和实际 connector 一起做回归。
08
Benchmark 基础设施
MLCommons
·
MLCommons 与 Google Cloud 演示 MedPerf 在 Confidential Space TEE 中执行脑肿瘤分割 benchmark:数据与模型先用 Cloud KMS 加密,workload identity 只允许具有指定容器和输入测量值的 confidential VM 取得访问权;运行时通过 attestation 换取 token,解密模型与数据完成推理,再以数据所有者公钥加密结果。该流程延续“模型移动到数据而非数据外流”的联邦评测,同时增加模型 IP 与 benchmark 完整性保护。
为什么值得读:高价值 benchmark 不只是在固定硬件上计时,还要解决私有数据、私有权重和可信执行三方互不完全信任的问题。MedPerf 的流程提供了可审计的云端参考架构;当前发布侧重集成与演示,并未给出 TEE 开销或跨云可移植性的系统 benchmark。