Machine Learning Systems · Daily Briefing Research / Engineering / Infrastructure

MLSys Daily


中文精选版

Daily Edition · 2026-07-29

从 Agent 沙箱预热到
百万 Token 训练池:系统瓶颈继续外溢

本期把运行时、集群控制面与基准放在同一张图上:Agent 服务开始预测工具沙箱,长上下文训练重新划分 attention 负载,模型副本复用 GPU 权重与编译缓存,GPU Operator 则把硬件故障闭环推进 Kubernetes。

今日精选

8 STORIES

SpecBox:在 LLM 还在生成时预测并预热下一座工具沙箱

SpecBox 面向通过 MCP 调用隔离执行环境的多轮 Agent 服务,在 token 流式生成期间用关键词和语义嵌入识别潜在工具意图,并提前启动对应沙箱;跨步骤则基于依赖图做随机预取。系统还加入语义结果缓存与带外共享内存传输。作者在高并发多轮 trace 上自报,相比按需创建,P99 端到端延迟最多降低 2.9 倍;相比永久保留沙箱,峰值内存最多减少 45.9%。

为什么值得读:Agent 服务的关键路径已经从模型 decode 延伸到工具环境冷启动、状态复用和制品传输。SpecBox 把 speculative execution 用到基础设施侧,但收益依赖意图预测准确率、沙箱启动分布和 workload 重复度,仍需在真实多租户平台验证。

Libra:用有界 Sequence Pool 驯服百万 Token 训练的 Attention 倾斜

论文指出,固定 token 数的 sequence packing 只能平衡内存和线性算子,attention 成本取决于各原始序列长度平方和,因此长尾语料仍会制造 data-parallel straggler 与 pipeline bubble。Libra 把 packed sequences 和 CP groups 放入固定大小的 sequence pools,用方差降低 placement 配对互补 workload,再在池内调度 sequence-head tiles 并重叠交换与计算。作者在 Qwen3-Turbo、256K 与 1M-token 生产 workload 上自报,相比 Ulysses 端到端吞吐最高提升 2.54 倍。

为什么值得读:它把“扩大 DP 就扩大 attention 通信域”的惯性设计改成增加固定边界的池,试图让负载平滑与网络规模解耦。论文称该方案已运行数十万 GPU 小时,但仍应关注池大小、长尾分布、CP 拓扑及 sampler 对训练可重复性的影响。

ModelExpress:优先从现有 GPU 副本搬权重,并复用 JIT Kernel 缓存

ModelExpress 在新副本启动前发现兼容权重来源,优先通过 NIXL 做 GPU-to-GPU P2P RDMA;没有 peer 时再选择对象存储流式加载、GPUDirect Storage 或普通 host-staged loader。它还可搬运 Triton、DeepGEMM、TileLang、CuTe DSL 与 FlashInfer 的编译/调优缓存,并用 VMM arena 把大量 tensor 的内存注册压缩为单一注册区。NVIDIA 在 8×B200、ConnectX-7、vLLM 0.23.0、TP=8 的 DeepSeek-V4-Pro 测试中自报,权重与 JIT cache 从现有副本传入少于 10 秒,总启动时间由 8 分钟降至 1 分 44 秒。

为什么值得读:弹性扩容不只受 checkpoint 下载限制,权重布局转换、RDMA 注册、kernel autotune 和 CUDA Graph capture 都会进入 readiness 关键路径。该项目已开放代码并原生集成 vLLM/SGLang,但数字来自 NVIDIA 的单一 B200 集群,跨存储、网络和引擎版本仍需复测。

AMD GPU Operator 1.5:DRA、节点故障检测与自动修复进入同一控制面

AMD GPU Operator 1.5.0 新增 Kubernetes Dynamic Resource Allocation,可通过 DeviceClass、ResourceSlice 和 CEL 选择设备,并允许同一 Pod 内多个容器协调共享 GPU。可靠性侧把 Device Metrics Exporter、Node Problem Detector 与 Argo Workflows 接入自动节点修复:硬件异常可转成 node condition,随后 drain、reboot 并恢复调度;版本还加入每进程 CU 占用、deferred ECC、可调健康轮询,并将托管栈更新到 ROCm 7.2.1。

为什么值得读:GPU 平台的成熟度不只看能否把设备挂进 Pod,而要看分配语义、遥测基数、故障判定和恢复动作能否形成闭环。DRA 与自动修复扩大了 operator 的控制权限,生产启用前应验证 Kubernetes/OpenShift 版本、Argo 依赖、drain 策略及误判保护。

MLPerf Endpoints v0.7:把推理比较从单点峰值改成负载曲线

MLCommons 发布 MLPerf Endpoints v0.7 foundation release,初始结果来自 CoreWeave、Google、Intel、KRAI 和 NVIDIA,覆盖 3 个 benchmark。每套系统不再只给一个峰值,而是随并发负载展示 system TPS、每用户 interactivity、P95 TTFT 与 concurrency 的 operating curve;基础设施已支持自动提交、持续审查和动态可视化。v1.0 计划加入更面向采购者的规则、归一化、更多 benchmark 与 agentic workloads,并开放滚动提交。

为什么值得读:在线推理采购真正需要回答的是在目标并发和延迟 SLO 下能承载多少吞吐,以及成本/功耗如何,而不是离线峰值。v0.7 仍是奠基版本、覆盖面有限;在更多供应商、模型和审计规则进入后,才更适合做跨服务采购判断。

OlmoEarth:把行星尺度推理拆成 CPU I/O、GPU Forward 与 CPU 拼图三段

OlmoEarth Platform 将卫星推理拆为 CPU 高 I/O 的检索与重投影、GPU forward、以及 CPU 后处理与地图拼接,并把地域切成可独立运行且带重叠边界的 partitions/windows。Ai2 在北美野火风险地图任务中自报,峰值并行使用约 19,600 个 CPU 与 994 张 GPU、网络吞吐超过 168 GB/s,把估算的 4,737 小时串行计算压到 30.5 小时。每个任务设计为可重入和幂等,配合自动重试、数据源回退与 stalled-runner 监测。

为什么值得读:这是一个提醒:真实 AI 推理常被数据发现、坐标对齐、网络与失败恢复主导,GPU 只是流水线的一段。数字来自 Ai2 的特定地理任务和云配额,不能外推到通用模型服务,但其 stage 分工与幂等执行模式具有广泛参考价值。

X-Stage:把 GPU 远端写入后的排空过程变成可调度流水阶段

X-Stage 关注 device-initiated remote store 发出后、数据对端可见前的 sender-side progress:短 burst 可在计算恢复时排空,持续注入则会耗尽有限 outstanding capacity 并产生 backpressure。作者用 Burst-Gap 模型描述 issue time、drain rate 与容量,并据此重排 DeepGEMM MegaMoE 两段计算和远端写 burst,同时把 Ulysses post-attention all-to-all 以 tile 粒度融合进 FlashAttention。作者自报,MegaMoE 84 个配置几何平均加速 1.18 倍、最高 1.62 倍;FA3/FA4 sender-visible 最高约 1.43/1.42 倍。

为什么值得读:GPU 发出通信并不等于通信成本已经消失;注入节奏与有限队列会反过来阻塞计算。该工作为 compute-communication fusion 增加了一个可测的调度维度,但结果依赖特定 NVIDIA 节点、remote-store 实现与 kernel shape。

LFM2.5 Encoders:把 8K 长文本分类与路由放回 CPU

Liquid AI 发布 230M 与 350M 参数的 LFM2.5 bidirectional encoders,支持 8,192-token context,面向分类、路由、PII 检测和策略检查等持续运行的理解任务。项目方报告在 8,192 tokens 时,230M 模型一次 forward 约 28 秒,而 ModernBERT-base 超过 90 秒,约快 3.7 倍;评测框架、原始结果和微调示例已开放。文章同时显示 GPU 短序列并非始终占优。

为什么值得读:Agent 基础设施中的 router、guardrail 和抽取任务未必值得占用生成式 LLM 或 GPU,较小 encoder 可成为同机 CPU sidecar。不过文章未清楚标注 CPU 型号与线程配置,28 秒数据只能视为项目方边界不完整的自报,部署前应使用开放评测脚本在目标 x86/ARM 环境复测。

这个主题下今天没有条目。