01
论文预印本
arXiv
·
SpecBox 面向通过 MCP 调用隔离执行环境的多轮 Agent 服务,在 token 流式生成期间用关键词和语义嵌入识别潜在工具意图,并提前启动对应沙箱;跨步骤则基于依赖图做随机预取。系统还加入语义结果缓存与带外共享内存传输。作者在高并发多轮 trace 上自报,相比按需创建,P99 端到端延迟最多降低 2.9 倍;相比永久保留沙箱,峰值内存最多减少 45.9%。
为什么值得读:Agent 服务的关键路径已经从模型 decode 延伸到工具环境冷启动、状态复用和制品传输。SpecBox 把 speculative execution 用到基础设施侧,但收益依赖意图预测准确率、沙箱启动分布和 workload 重复度,仍需在真实多租户平台验证。
02
论文预印本
arXiv
·
论文指出,固定 token 数的 sequence packing 只能平衡内存和线性算子,attention 成本取决于各原始序列长度平方和,因此长尾语料仍会制造 data-parallel straggler 与 pipeline bubble。Libra 把 packed sequences 和 CP groups 放入固定大小的 sequence pools,用方差降低 placement 配对互补 workload,再在池内调度 sequence-head tiles 并重叠交换与计算。作者在 Qwen3-Turbo、256K 与 1M-token 生产 workload 上自报,相比 Ulysses 端到端吞吐最高提升 2.54 倍。
为什么值得读:它把“扩大 DP 就扩大 attention 通信域”的惯性设计改成增加固定边界的池,试图让负载平滑与网络规模解耦。论文称该方案已运行数十万 GPU 小时,但仍应关注池大小、长尾分布、CP 拓扑及 sampler 对训练可重复性的影响。
03
开源系统发布
NVIDIA Technical Blog
·
ModelExpress 在新副本启动前发现兼容权重来源,优先通过 NIXL 做 GPU-to-GPU P2P RDMA;没有 peer 时再选择对象存储流式加载、GPUDirect Storage 或普通 host-staged loader。它还可搬运 Triton、DeepGEMM、TileLang、CuTe DSL 与 FlashInfer 的编译/调优缓存,并用 VMM arena 把大量 tensor 的内存注册压缩为单一注册区。NVIDIA 在 8×B200、ConnectX-7、vLLM 0.23.0、TP=8 的 DeepSeek-V4-Pro 测试中自报,权重与 JIT cache 从现有副本传入少于 10 秒,总启动时间由 8 分钟降至 1 分 44 秒。
为什么值得读:弹性扩容不只受 checkpoint 下载限制,权重布局转换、RDMA 注册、kernel autotune 和 CUDA Graph capture 都会进入 readiness 关键路径。该项目已开放代码并原生集成 vLLM/SGLang,但数字来自 NVIDIA 的单一 B200 集群,跨存储、网络和引擎版本仍需复测。
04
开源基础设施发布
AMD ROCm Blog
·
AMD GPU Operator 1.5.0 新增 Kubernetes Dynamic Resource Allocation,可通过 DeviceClass、ResourceSlice 和 CEL 选择设备,并允许同一 Pod 内多个容器协调共享 GPU。可靠性侧把 Device Metrics Exporter、Node Problem Detector 与 Argo Workflows 接入自动节点修复:硬件异常可转成 node condition,随后 drain、reboot 并恢复调度;版本还加入每进程 CU 占用、deferred ECC、可调健康轮询,并将托管栈更新到 ROCm 7.2.1。
为什么值得读:GPU 平台的成熟度不只看能否把设备挂进 Pod,而要看分配语义、遥测基数、故障判定和恢复动作能否形成闭环。DRA 与自动修复扩大了 operator 的控制权限,生产启用前应验证 Kubernetes/OpenShift 版本、Argo 依赖、drain 策略及误判保护。
05
Benchmark 发布
MLCommons
·
MLCommons 发布 MLPerf Endpoints v0.7 foundation release,初始结果来自 CoreWeave、Google、Intel、KRAI 和 NVIDIA,覆盖 3 个 benchmark。每套系统不再只给一个峰值,而是随并发负载展示 system TPS、每用户 interactivity、P95 TTFT 与 concurrency 的 operating curve;基础设施已支持自动提交、持续审查和动态可视化。v1.0 计划加入更面向采购者的规则、归一化、更多 benchmark 与 agentic workloads,并开放滚动提交。
为什么值得读:在线推理采购真正需要回答的是在目标并发和延迟 SLO 下能承载多少吞吐,以及成本/功耗如何,而不是离线峰值。v0.7 仍是奠基版本、覆盖面有限;在更多供应商、模型和审计规则进入后,才更适合做跨服务采购判断。
06
系统设计
Ai2 / Hugging Face Blog
·
OlmoEarth Platform 将卫星推理拆为 CPU 高 I/O 的检索与重投影、GPU forward、以及 CPU 后处理与地图拼接,并把地域切成可独立运行且带重叠边界的 partitions/windows。Ai2 在北美野火风险地图任务中自报,峰值并行使用约 19,600 个 CPU 与 994 张 GPU、网络吞吐超过 168 GB/s,把估算的 4,737 小时串行计算压到 30.5 小时。每个任务设计为可重入和幂等,配合自动重试、数据源回退与 stalled-runner 监测。
为什么值得读:这是一个提醒:真实 AI 推理常被数据发现、坐标对齐、网络与失败恢复主导,GPU 只是流水线的一段。数字来自 Ai2 的特定地理任务和云配额,不能外推到通用模型服务,但其 stage 分工与幂等执行模式具有广泛参考价值。
07
论文预印本
arXiv
·
X-Stage 关注 device-initiated remote store 发出后、数据对端可见前的 sender-side progress:短 burst 可在计算恢复时排空,持续注入则会耗尽有限 outstanding capacity 并产生 backpressure。作者用 Burst-Gap 模型描述 issue time、drain rate 与容量,并据此重排 DeepGEMM MegaMoE 两段计算和远端写 burst,同时把 Ulysses post-attention all-to-all 以 tile 粒度融合进 FlashAttention。作者自报,MegaMoE 84 个配置几何平均加速 1.18 倍、最高 1.62 倍;FA3/FA4 sender-visible 最高约 1.43/1.42 倍。
为什么值得读:GPU 发出通信并不等于通信成本已经消失;注入节奏与有限队列会反过来阻塞计算。该工作为 compute-communication fusion 增加了一个可测的调度维度,但结果依赖特定 NVIDIA 节点、remote-store 实现与 kernel shape。
08
模型与工程发布
Liquid AI / Hugging Face Blog
·
Liquid AI 发布 230M 与 350M 参数的 LFM2.5 bidirectional encoders,支持 8,192-token context,面向分类、路由、PII 检测和策略检查等持续运行的理解任务。项目方报告在 8,192 tokens 时,230M 模型一次 forward 约 28 秒,而 ModernBERT-base 超过 90 秒,约快 3.7 倍;评测框架、原始结果和微调示例已开放。文章同时显示 GPU 短序列并非始终占优。
为什么值得读:Agent 基础设施中的 router、guardrail 和抽取任务未必值得占用生成式 LLM 或 GPU,较小 encoder 可成为同机 CPU sidecar。不过文章未清楚标注 CPU 型号与线程配置,28 秒数据只能视为项目方边界不完整的自报,部署前应使用开放评测脚本在目标 x86/ARM 环境复测。