Machine Learning Systems · Daily Briefing Research / Engineering / Infrastructure

MLSys Daily


中文精选版

Daily Edition · 2026-08-14

把路由回放变成控制面,
再把中间态留在片上

本期从 Agentic RL 与 MoE RL 的就绪度、序列和专家联合调度出发,延伸到 FP8/MXFP4 与 Wavelet Kernel 的 I/O 感知融合,以及 RAG Cache 和大规模论文复现:高效系统越来越依赖可提前观测的状态与可审计的执行边界。

今日精选

7 STORIES

RoutePack:用 Rollout 路由回放联合安排 MoE 专家位置与训练序列

RoutePack 利用 MoE RL 在 Rollout 阶段已经记录的逐样本序列长度和逐层专家需求,先按优化器窗口做状态一致的逐层专家重排,再在固定行数与 Token 容量约束下联合打包 DP Microbatch;目标同时建模线性/二次 Attention 工作量和每层最忙物理 EP Rank。作者在 GSM8K、64×8 GRPO、8192 Token Microbatch 上评测 Ling-3.0-Tiny 7.9B/1.3B active 与 Ling-3.0-Flash 124B/5.1B active:专家重排分别提升 3.80% 和 10.50% 吞吐,路由感知打包再增加 4.86% 和 3.98%,相对基线合计提升 8.85% 和 14.89%。

为什么值得读:它把路由回放从“保持训练语义”的记录升级为模型状态与数据布局的共同控制信号,并明确区分优化器窗口级专家偏斜与执行行内尾部偏斜。结果只覆盖两款 Ling 模型、GSM8K 和单一 64×8 GRPO 配置;规划还要求训练前封闭一个窗口并保持 Forward/Backward 期间专家所有权不变,跨数据集、多节点和动态副本策略仍需验证。

TideRL:用就绪度统一 KV 驻留、Ref-Actor 执行模式与 Rollout/Trainer GPU 配额

TideRL 面向会反复等待工具、恢复长上下文且尾部差异巨大的多轮 Agentic RL,把“已就绪 Microbatch 数量与到达间隔”作为统一控制信号。Continuous Task Batching 以任务语义决定准入、暂停和恢复;RA²P 在分离式 Ref/Actor 流水与共置聚合间切换;ERS 则在自然权重同步边界移动 Rollout 与 Trainer Rank。作者在 4 节点、32×H100、vLLM Rollout 与 Megatron Trainer 上报告:文本任务相对同步 VeRL 最高 5.6 倍、相对 AReaL 1.8 倍训练 Goodput;多模态任务相对异步基线超过 1.33 倍,KV 命中率提升 1.58 倍,总等待时间最高降低 77.6%。

为什么值得读:Agentic RL 的资源瓶颈会在相邻训练步之间切换,固定 Rollout/Trainer 切分和请求级 KV 淘汰很容易把 GPU 占用变成无效工作。TideRL 展示了从任务状态、模型切换到集群配额的闭环设计;但倍数依赖 WebShop/AlfWorld/OSWorld/ScienceBoard、Qwen 系列、32×H100 与特定同步/异步基线,且异步训练允许有限策略陈旧度,不能直接等同于严格同步算法语义。

PyTorch 把 AMD FP8 训练优化上游化:先修 FNUZ 正确性,再融合 MoE 量化数据路径

AMD 与 Meta 将此前 Primus-Turbo 中的 FP8 支持合入 TorchAO/TorchTitan 主线:自动选择 AMD e4m3fnuz 的 240 最大值以避免静默裁剪梯度,为 ROCm 打通 MoE Grouped GEMM,并用 Triton 融合 Absmax、Scale、Clamp 与 Cast,去掉反向转置拷贝和多次 HBM 中间态。团队自报 8×MI300X 上 Llama3-8B Rowwise FP8 相对 BF16 吞吐提升 13.4%;8×MI325X、DeepSeek-V3 671B 的前向融合把 5996 提至 7027 tok/s、恢复 89% 的 FP8 量化开销,单层 Colwise Scale Kernel 从 7290 降至 1170 微秒。

为什么值得读:这篇文章把低精度训练的两类风险放在一起:格式选择错误会悄然破坏收敛,而正确但碎片化的量化流水又会被 Launch 与 HBM 往返吞掉收益。上述数字是 AMD/Meta 在特定 MI300X/MI325X、模型形状、Batch、Sequence、FSDP2 和 Torch Compile 配置下自报;不同 GPU、网络、精度配方与模型需要独立回归,但相关改动已进入标准上游栈而非私有补丁。

AMD 融合 MXFP4 在线旋转:Dense 模型精度修复的 TPOT 税降到 0.3%—0.8%

AMD 为 MI355X 上的 Qwen3 MXFP4 推理把在线 Hadamard 旋转、FP4 量化及 MoE Expert Sort 融为单个 Gluon/Triton Kernel,让旋转结果留在寄存器并直接进入 v_cvt_scalef32_pk_fp4_f32。厂商测试显示,Dense 路径 Kernel 约 2 倍、MoE 路径约 3.9—4.9 倍快于分离实现;在单张 MI355X、vLLM、ISL=1024/OSL=256、200 Prompt×3 次配置下,RS=64 将 Qwen3 8B/14B/32B 在线旋转相对 RTN 的 TPOT 开销压到 0.3%—0.8%,而 30B-A3B MoE 在 RS=128 下由约 10.2% 降至 5.6%。

为什么值得读:低比特量化要成为默认生产路径,不能只证明精度可恢复,还要把每层每 Token 的修复成本压回服务预算。这里的关键不是减少旋转数学,而是消除 Kernel 边界和 BF16 全局内存往返。所有数字均为 AMD 在 MI355X、指定 Qwen3 Checkpoint、Quark 训练与实验性 vLLM Branch 上自报;MoE 的 RS=64 收益仍是估计,正式上游状态和跨硬件表现需另行确认。

Fast WTConv:重算廉价 Haar 变换,换掉 2.55 倍 HBM 流量

该工作指出 WTConv 的参考实现会把多级 Wavelet 系数与重建中间态反复物化到 HBM,FP32 算术强度仅约 1.63 FLOP/Byte。作者将 Haar Analysis 融入 Depthwise Convolution、把多级 Synthesis 递归折叠为由输出坐标 Bit 索引的单 Pass,并把逐通道 Scale 折入权重;模型化 HBM 流量约减少 2.55 倍。在 RTX A6000 为主、并补充第二款不同架构 GPU 的测试中,完整训练步相对参考 FP32 快 3.71—4.35 倍、FP16 快 2.68—3.09 倍,峰值显存约减半。

为什么值得读:它再次说明“FLOP 相近”并不代表算子成本相近:对深度内存受限算子,代数重写、廉价重算和片上驻留可能比常规调参更重要。作者验证的是 WTConvNeXt、特定 Tensor Shape、分解层数与两张 GPU,且自定义融合依赖 Haar 结构,不能自动推广到任意 Wavelet 或普通编译器;不过 CUDA、Triton 与 Metal 实现已放入官方仓库,便于复现。

QV-PIC:把长文档渲染成双分辨率视觉缓存,在查询时只给相关页面加细节

QV-PIC 针对把文本 Chunk 渲染为图像后进行 Position-Independent Cache 复用的质量损失:离线以模型原生 Chat Template 前缀编译并丢弃前缀 KV,在线保留 72 DPI 全局上下文,只把累计相关度达到阈值的最多 4 张图升级到 120 DPI。作者在 8×A800 80GB、Glyph 9B 与六项 LongBench QA 上报告,相对原始 Rendered-image PIC 平均 F1 提升 21.6 点;相对优化 Text PIC 高 2.58 F1 且 TTFT 低 17.2%,相对 Full Prefill 的在线 Prefill 时间降低 83.8%,并在 GLM-4.1V 与 LLaVA-OneVision-2 上做了迁移测试。

为什么值得读:它把 Cache 编译上下文与表示分辨率同时纳入 Serving 决策:不是为全部文档支付高分辨率 KV,而是把视觉 Token 预算投向当前 Query。数字来自单请求、统一 Hugging Face/PyTorch 框架和固定 LongBench 子集;TTFT 已包含 KV 从 CPU 到 GPU、组合、位置重锚和查询编码,但尚不能代表多租户 Batch Serving、缓存存储成本或真实检索分布。

ICML 2026 开放复现:6816 份可审计 Logbook 暴露了“验证、反例与复现错误”三重风险

Hugging Face 报告其 19 天 ICML 2026 Open Reproductions 挑战:1221 名参与者用自带 Coding Agent 发布 6816 份 Trackio Logbook,覆盖 2226 篇论文和 35908 项 Claim;每份制品包含文字、代码、产物,部分还公开完整 Agent Trace,再由 GLM-5.2 自动 Judge 逐 Claim 标注 Verified、Falsified、Toy 或 Inconclusive。官方汇总称,51% 的被检查论文至少有一项独立验证,23% 至少有一项被反驳或争议;团队还人工复核全部 35 个正式 Falsification 申诉,并发现过单位归一化错误导致的“错误反驳”。

为什么值得读:Agent 可以把实验执行扩展到会议规模,但同样会早停、误读尺度效应或建立在单位错误上;真正可用的基础设施必须保留代码、数据、Trace、Judge 版本和人工复核路径。上述比例不是对整个 ICML 的随机审计结论:只覆盖自选的 34% 论文,计算预算和制品可用性不均,Judge 也是模型;它更适合作为开放、可追溯复现流水线的实证,而非简单的会议质量排行榜。

这个主题下今天没有条目。