Machine Learning Systems · Daily Briefing Research / Engineering / Infrastructure

MLSys Daily


中文精选版

Daily Edition · 2026-08-08

Agent Serving 穿过 CPU—GPU 边界,
Tensor 状态与推理控制面开始独立成层

本期从 Agent 工作流的主机侧尖峰出发,追踪 Tensor 生命周期、千级 LoRA 池化内存、会话感知缓存、跨区域碳路由与多节点训练运维:系统优化的对象正从单个 Kernel 扩展到状态、角色与控制面。

今日精选

9 STORIES

Agentic AI 的 CPU 已在关键路径:Agora 按角色池化核心并超售 GPU Memory

论文结合 Microsoft Azure 生产研究与开源框架实验,将 Agent 请求刻画为 LLM 推理、工具调用和编排决策交替组成的碎片化工作流。作者观察到主机侧工具与编排让 CPU 进入关键路径,负载长期偏低但会突然尖峰;原型 Agora 因而回收空闲核心承载吞吐任务、用角色池与亲和性调度恢复局部性,并通过预取在 GPU Memory 中放置更多 Agent 状态。

为什么值得读:传统推理服务器常按稳定的 GPU 饱和负载配置,但 Agent 工作流把瓶颈拉回 CPU、内存交换和尾延迟保护。该论文为 Agent Serving 的异构资源规划给出了一套比“只扩 GPU”更接近实际执行结构的框架。

TensorCast:把权重、KV Cache 与 Checkpoint 的生命周期抽成 Tensor-as-a-Service

TensorCast 将权重加载、权重同步、KV Cache 和 Checkpoint 这些分散在 Engine、网络与存储后端里的状态管理,统一成可编程的 Tensor 生命周期层。系统提供一等 Tensor 抽象与生命周期原语,并已接入 vLLM 和 SGLang;作者报告,一项跨组件策略在高并发多轮 Agent 负载中将中位 TTFT 最多降低 93.2%。

为什么值得读:推理栈正同时演化权重分发、KV 分层和请求路由,若每个优化都深嵌 Engine,组合成本会快速失控。独立的 Tensor 管理层可能成为连接 Serving Engine、网络与存储控制面的共同接口。

PLoRA:让千级 LoRA 与 KV Cache 驻留池化内存,链路只返回归约结果

PLoRA 面向单个基座模型挂载 1000 余个 Adapter 的 Multi-LoRA Serving,把 LoRA 与 KV Cache 放进可由 GPU 直接寻址的池化内存,并在数据旁执行部分计算,只把归约结果送回 GPU。其管理器按 Adapter 在四种 LoRA 与两种 Attention 路径间选择,并缓存最关键的字节;作者在单张 H100、1000 个 Adapter 的测试中报告,Decode 延迟平均比实机 S-LoRA 低 6.6 倍,额外设备面积低于 3.4%。

为什么值得读:Multi-LoRA 的容量需求远高于单卡显存,而 CPU DRAM 经 PCIe 搬运会引入停顿和主机控制开销。PLoRA 展示了 CXL/NVLink 类内存语义互连加近数据处理,如何把 Adapter Serving 从“频繁搬运”改写为“远端可计算状态池”。

SGLang 0.5.17:Rust 前端、会话感知 Radix Cache 与 MoE Prefill 新并行路径同批落地

0.5.17 汇入 582 个 PR,新增 Rust 前端初始实现,将从网络入口到 GPU Scheduler 前的前半段从 Python 迁向多线程 Rust;Unified Radix Cache 可按稳定 session_id 追踪仍被活跃会话引用的 Prefix。Release 还加入 DCP 通信后端与 DWDP MoE Prefill:后者预取远端专家权重并在本地计算,避免 Expert Parallel 的 Token All-to-All。项目自报在 4×B200、gpt-oss-120b 的特定 Prefill 测试中最高达 DEP4 的 1.92 倍,但明确将 DWDP 标为早期开发。

为什么值得读:该版本同时触及入口并发、会话状态和 MoE 通信,说明 Serving Engine 的热点已从单一 GPU Kernel 扩展到前端运行时与生命周期感知缓存。采用新路径前仍需按自身模型、并发和网络拓扑复测。

多节点 B300 微调实录:GPU Utilization 100% 也可能是 NCCL Hang

这份经验报告在两节点 16×NVIDIA B300 上用 FSDP / ZeRO-3 全量微调 Qwen3-32B,重点不是新算法,而是故障分诊与反例。作者指出 NCCL Hang 时 Utilization 仍可能显示 100%,板卡功耗更能区分计算、通信、数据饥饿和死锁;其一次 Epoch 末死锁源于各 Rank Token Packing 不平衡,并用 2.7 秒启动前不变量检查和外部 Watcher 将多小时静默失败提前拦截。报告还发现,在语料进入 Page Cache 且训练受计算限制的边界下,逐步 NFS 读取与本地预分词缓存都约为 53k tok/s。

为什么值得读:它提醒训练平台不要把单一 Utilization 当健康信号,也不要把存储介质先验当根因。功耗、Rank 间数据不变量和启动前 Gate 是可直接移植到大规模训练 Runbook 的运维措施。

SparseDitto:按矩阵、算子和目标 GPU 让 Agent 定制稀疏 Kernel

SparseDitto 面向 SpMV、SpMM 和 SpGEMM,先用轻量模型依据矩阵结构排序既有策略,再让架构感知 Planner、编码 Agent 与验证 Agent 在目标 GPU 上实测迭代。作者报告,相对 cuSPARSE,几何平均加速在 RTX PRO 6000 上为 2.68 倍、H200 上为 2.79 倍;生成的 SpMM Kernel 还使全批 GCN 训练最多加速 3.39 倍。这些数字来自论文选定矩阵、算子与硬件。

为什么值得读:稀疏 Kernel 的最佳数据格式和映射高度依赖输入形态,静态库很难一招通吃。该工作把 Agent 置于有测量反馈和验证约束的搜索闭环中,比直接让模型生成 CUDA 更接近可落地的自动调优器。

实时碳感知 LLM 路由:用实际生产 Router 作基线,而不是拿 Round-Robin 充数

论文用边际运行排放率(MOER)信号在多区域 GPU Testbed 上实时引导请求,同时保留生产压力路由器作为可逆 Overlay 的基线。每请求能耗来自 NVIDIA DCGM 遥测和实测并发曲线,并用历史 MOER 结算;一年回放中,作者在其主要建模配置下报告,相对 Round-Robin 的 GPU 归因运行排放降低 50.9%,但明确说明使用历史真实 MOER 而非预测值,因此这是该配置下的上界,而非普适节省比例。

为什么值得读:跨区域调度不仅要看延迟、容量和成本,也可以把实时电网信号作为软约束。更重要的是,该研究展示了较严谨的评估边界:生产路由基线、遥测归因、预测与事后结算必须分开。

Meta 把长用户序列拆成离线大模型与在线轻排序,Serving 成本不再随容量同比增长

Meta 将序列模型分为异步离线用户模型与低延迟在线排序模型:前者处理数千长度的用户历史并缓存与候选广告无关的 Embedding,后者结合实时信号和候选信息完成打分。系统还采用 Dense Tokenization 与 Target-Aware Multi-Head Attention;Meta 自报,与更广泛模型创新合计带来 Instagram 转化率 6%、Facebook 转化率 3% 和 Facebook 广告点击 3.5% 的累计提升,数字属于其线上业务边界。

为什么值得读:这是典型的“把重计算移出请求关键路径,再把状态送回在线模型”架构。它与推理系统中的 Prefill/Decode 分离、Prefix Cache 和特征物化共享同一设计逻辑:容量扩展不必等比例拖高在线延迟成本。

Cloudflare 合并 Workers AI 与 AI Gateway:模型托管和第三方路由共用一个控制面

Cloudflare 宣布让 Workers AI 与 AI Gateway 共用 AI Binding 和统一 REST 入口,既可调用其托管 GPU 模型,也可连接其他模型提供商。若使用 default Gateway,首次认证请求会自动创建控制面,并提供请求日志、延迟、Token、错误率和成本归因;后续仍可切换到命名 Gateway 以配置缓存或按应用拆分流量。

为什么值得读:模型托管与 Provider Proxy 的产品边界正在消失,平台差异转向路由、观测、安全与计费策略。对多模型 Serving 团队而言,统一入口能降低接入摩擦,但完整 Prompt/Response Logging 也意味着需要同步审视数据留存和敏感信息策略。

这个主题下今天没有条目。