<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>MLSys Daily</title><link>https://mlsys.caseylia.com/</link><description>面向训练、推理、编译器与硬件的每日中文精选。</description><language>zh-CN</language><atom:link href="https://mlsys.caseylia.com/feed.xml" rel="self" type="application/rss+xml"/><item><title>从百万级沙箱到 “近乎免费”的归一化</title><link>https://mlsys.caseylia.com/archive/2026-07-22/</link><guid isPermaLink="true">https://mlsys.caseylia.com/archive/2026-07-22/</guid><pubDate>Wed, 22 Jul 2026 08:00:00 +0800</pubDate><description><![CDATA[<ul><li><a href="https://pytorch.org/blog/triton-plugin-extensions-enabling-tlx-and-custom-compiler-passes-out-of-the-box/">Triton Plugin Extensions：不再为自定义编译器 Pass 长期维护 Fork</a> — PyTorch-Triton 3.7 引入运行时插件扩展机制，可以动态加载自定义 compiler pass、MLIR dialect 和 DSL 操作，而不必修改或重新编译上游 Triton。首个主要使用者是 Meta 的 TLX；文章展示了插件如何插入、替换甚至覆盖从 TTIR、TTGIR 到 LLVM IR 的编译阶段，并覆盖 NVIDIA 与 AMD 后端。</li><li><a href="https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/">把 LayerNorm / RMSNorm 融进 GEMM 与 Attention：最多隐藏 90% 归一化延迟</a> — 文章提出 Lazy Pre-Norm、Multi-CTA Norm Fusion 与 FlashNormAttention 等融合策略，针对归一化算子内存受限、难以利用 Tensor Core 的问题，把 norm 与 GEMM 或 attention 的计算和数据移动重叠。作者在 750W 功耗上限的 NVIDIA B200 上报告：可隐藏最多 90% 的归一化 kernel 延迟，FlashNormAttention 的 kernel 加速最高达到 35%。</li><li><a href="https://modal.com/blog/scaling-to-1-million-concurrent-sandboxes-in-seconds">Modal 如何在一分钟内启动并运行 100 万个并发沙箱</a> — Modal 为 RL rollout 和 agent workload 重构沙箱控制面，目标是消除所有随节点数或沙箱数线性增长的中心瓶颈。新架构弱化全局强一致协调，让负载均衡层直接在 worker fleet 上创建容器，并把传统依赖 Postgres、工作流和集中式调度的路径拆散；演示中 100 万个沙箱在一分钟内全部创建完成。</li><li><a href="https://engineering.fb.com/2026/07/13/ml-applications/modernizing-the-meta-ads-service-with-an-open-source-kernel-scheduler/">Meta 用 sched_ext 为广告服务定制 Linux 调度策略</a> — Meta 在 Linux 升级引发广告检索延迟回退后，使用进入上游 Linux 的 BPF 调度框架 sched_ext，把延迟关键线程与后台工作软分区到不同 CPU 池，并动态调整池大小以改善 L3 locality。Meta 报告首轮部署令广告检索路径 p99 延迟下降 28%、全 fleet 节省 3.28MW，并增加 1.1% 的广告排序量；后续策略更新继续降低延迟与超时。</li><li><a href="https://rocm.blogs.amd.com/software-tools-optimization/minimax-m3-mi355/README.html">MiniMax-M3 在 AMD MI355X 上的端到端推理协同优化</a> — AMD 围绕 MiniMax-M3 的 MoE、稀疏 attention、长上下文 KV cache 与量化路径，联合 ATOM、AITER 和 ATOMesh 做系统级优化：加载时在线转换 attention 权重格式、采用 FP8 KV cache 与 page-16 SHUFFLE 布局、加入 EAGLE3 speculative decoding，并通过 prefill/decode 分离与缓存传输扩展分布式服务。</li><li><a href="https://www.together.ai/blog/99-9-uptime-for-inference">99.9% 推理可用性究竟意味着要扛住什么故障</a> — 文章把 99%、99.9% 和 99.99% 映射到不同故障域：分别要求抵御节点、整个数据中心和区域级故障，并讨论 GPU ECC、驱动、NVLink、交换机、存储和发布系统之间的级联问题。作者强调双数据中心必须持续承载真实流量、保留足够吸收全量负载的容量，而不是只准备未经演练的冷备。</li><li><a href="https://github.com/vllm-project/vllm/releases/tag/v0.25.1">vLLM 0.25.1：针对 0.25.0 的两项定向故障修复</a> — vLLM 0.25.1 是一个小型 patch release，在 0.25.0 之上集中处理两项回归/故障问题。对于生产推理集群，这类补丁版本通常比大型功能版本更值得快速审阅：变更面小，但可能直接影响模型加载、请求执行或升级稳定性。</li><li><a href="https://github.com/flashinfer-ai/flashinfer/releases/tag/v0.6.15.post1">FlashInfer 0.6.15.post1 发布，推理 Kernel 进入新的补丁周期</a> — FlashInfer 在 0.6.15 后发布 post1 补丁，并继续提供每日 nightly。该项目位于 attention、sampling、MoE 等 LLM inference kernels 的关键路径，版本更新可能通过 vLLM、SGLang 或自定义 serving stack 间接影响吞吐、兼容性和新硬件支持。</li></ul>]]></description></item></channel></rss>