Machine Learning Systems · Daily Briefing Research / Engineering / Infrastructure

MLSys Daily


中文精选版

Daily Edition · 2026-08-22

从长上下文容量墙到
推测解码与 Day-One 适配

本期聚焦推理系统的三条主线:跨节点 MoE 服务如何守住正确性与容量边界,推测解码怎样进入主流 serving 栈,以及新模型、新硬件与 benchmark 如何更快获得可信支持。

今日精选

6 STORIES

SGLang v0.5.18

SGLang v0.5.18 汇集 212 名贡献者的 710 个 PR,新增多种自回归与扩散模型,并扩展 DSpark、DFlash 等推测解码路径。系统侧重点包括启动时让 checkpoint staging 与 CUDA graph capture 重叠、以 all-to-all 替代 pure-DP attention 下 TP LMHead 的 allgather + scatter,以及让非融合 allreduce 复用 FlashInfer MNNVL workspace;项目报告 Qwen3-32B/H100 的指定启动配置较普通默认路径从 84.8 秒降至 35.6 秒,其他性能数字同样只适用于 Release 所列模型和硬件。

为什么值得读:这次发布把启动、通信、推测解码、统一 kernel cache 与依赖升级放在同一版本中,反映 serving 性能已不再由单一 attention kernel 决定。升级者尤其应留意统一缓存目录导致的首次重编译,以及 PyTorch 2.13、Triton 3.7.1 等环境变化。

DI Series: Scaling GLM-5.1-FP8 to 64 MI300X GPUs

AMD 展示 GLM-5.1-FP8 在最多 64 张 MI300X 上采用 prefill/decode 解耦、WideEP 与 MoRI 通信栈的部署,并解释两个阻断生产的正确性问题:长上下文下 sparse-MLA 元数据键冲突,以及 DSA 的第二套 indexer KV cache 未被传至 decode。修复后,团队在 EP8—EP32、2k—35k 上下文范围执行检索正确性验证,并以 72 组测试分析吞吐与容量;AMD 自报在 28k 输入、并发 256 时,单 decode 实例因 KV working set 超出池容量跌至 1,405 tokens/s,而多 decode 拓扑维持约 15.3k—16.5k tokens/s。

为什么值得读:文章最有价值之处不是峰值数字,而是把性能断崖还原为可计算的 KV 容量墙,并展示新 attention 架构如何引入隐蔽的第二份状态。对长上下文 MoE 服务,正确性测试、KV 传输完整性和容量模型必须与吞吐 benchmark 同等重要。

Up to 3.2x Faster Inference with LFM2.5-DSpark

Liquid AI 为 LFM2.5-1.2B-Instruct、2.6B 与 8B-A1B 发布约 296M—328M 参数的 DSpark draft checkpoints,并提供 SGLang 与 llama.cpp 接入路径。DSpark 组合并行 draft backbone、轻量顺序 Markov head 与按置信度裁剪验证窗口;发布方在 batch size 1、temperature 0 下,用单张 H100 80GB/BF16 和 M4 Max/FP16 GGUF 测得不同模型及数据集约 1.04—3.18 倍加速,且强调 greedy decoding 由目标模型逐 token 验证,输出与基线相同。

为什么值得读:推测解码的工程价值取决于接受率、验证窗口、draft 额外显存和后端实现,而不只是算法名称。该发布同时覆盖数据中心 GPU 与端侧 Metal 路径,也暴露 MoE 在 llama.cpp 后端中因额外专家权重流量而收益较小的现实边界。

Harnessing AI for Day-One Model Enablement

IBM Spyre 团队提出用薄层 runtime adapters 桥接 Hugging Face Transformers 与仍在演进的 torch-spyre 编译运行栈:当模型表达触发尚未成熟的 lowering 路径时,adapter 在运行时替换为数学等价、后端能够处理的形式,而非等待底层栈完整支持。团队让 coding agent 跨模型与编译器代码库定位缺口、起草适配,再由人类负责数值误差定位和端到端验证;其自报阶段性结果是 13 个 adapter 覆盖最常下载的 10,000 个 embedding 模型中的 7,960 个,其中 6,804 个通过 Spyre 端到端测试。

为什么值得读:新硬件的 Day-One 支持往往卡在长尾算子、形状与数值约束,而不是主干 GEMM。以可移除 adapter 充当“脚手架”能缩短 bring-up 周期,但文章也明确说明 agent 给出的局部诊断可能自信却错误,硬件数值漂移与 compiler fusion 仍需要严格的人在回路验证。

MLPerf Client v2.0 Expands AI PC Benchmarking with Image Generation and Agentic AI

MLPerf Client v2.0 把 AI PC 测试从既有 LLM 任务扩展到图像生成与 Agentic AI:实验性图像生成负载采用 Flux.2 klein 4B,Agent 类别包含 SWE Agent 与 Data Analyst Agent,并分别报告端到端、LLM 推理及工具执行时间。LLM 测试将必测模型更新为 Phi-4 Mini Instruct,加入约 4K token 的中等长度摘要任务,并以 Qwen3 8B 作为实验项;实现与 Windows、macOS、Linux 发布包均开放。

为什么值得读:客户端 AI benchmark 若只测孤立 tokens/s,会遗漏工具调用、完整任务链和生成式视觉负载。把模型推理与工具执行拆开计时,有助于区分 NPU/GPU 性能、runtime 开销和 agent orchestration 瓶颈,也为跨 PC 平台复现提供共同协议。

Measuring benchmark optimization in speech recognition

Hume AI 针对 ASR 的 benchmark optimization 设计三类探针:检查模型是否复现错误参考文本、在音频数字被静音后是否仍恢复基准答案,以及是否随数据集切换到参考文本偏好的拼写形式。作者测试 11 个开放 ASR 模型,并用新采集、晚于训练截止时间的同域音频作对照;文中报告若干高分模型会在音频与参考冲突时复现公开 benchmark 的错误,而这种行为在新数据上明显减弱。

为什么值得读:可复现 benchmark 不等于可信 benchmark:公开测试集既可能有标签错误,也可能被模型通过音频域线索识别。对模型平台与硬件评测团队,这套干预式方法提醒我们除汇总 WER 外,还应保留 held-out 数据、反事实样本和 reference-error 审计。

这个主题下今天没有条目。