01
推理系统论文
arXiv / NVIDIA
·
论文面向同一模型家族内的大小模型级联与会话中切换,将源模型 KV 经过逐 Head Ridge Mapping 转成目标模型格式:先选最有预测力的源层、去除 Key 中的 RoPE,再用 500 条、每条 1024 Token 的 FineWeb-Edu 校准序列闭式拟合。六组 matched-KV 模型对中,四组保留目标模型独立 Prefill 准确率的 73%—98%,两组明显退化;在 8×H100 NVLink、BF16 的合成输入延迟实验里,映射相对重新 Prefill 快 2.7—25.1 倍。
为什么值得读:模型路由若每次切换都重算完整上下文,长 Agent 会话的成本会随路由次数累积;这项工作把 KV 变成可迁移状态,而不只是在单模型内做 Prefix Cache。边界也很明确:目前只评测同族、Dense Full-Attention、matched-KV 模型,端到端跨进程传输未计入,且两组模型对失败,不能把线性可迁移性当作普遍性质。
02
分布式训练系统论文
arXiv / UCL、Politecnico di Milano、Broadcom
·
这份 8 页论文提出以 time-to-target-loss 统一网络和 ML 控制面,而不是分别优化“字节怎么传”和“多久同步一次”。初步两旋钮原型在共享网络中联合选择 BF16/MXFP4 梯度通信精度与 GA4/GA16,前台任务为 GPT-2 Large,后台竞争流来自 GPT-1B 作业;作者报告,联合选择相对其比较策略到达目标 Loss 最多快 42%,并展示独立最优组合成 GA16+MXFP4 后反而可能劣于 GA4+MXFP4。
为什么值得读:通信压缩、Batch/GA 和拥塞控制会共同改变统计效率与每步时间,平台若按子系统 KPI 各自调优,可能得到更慢的端到端训练。该结果仍是小规模初步 Case Study,尚非完整在线控制器,也只观察一个前台作业对固定背景竞争流;42% 不能外推到其他模型、网络和收敛目标。
03
KV Cache 系统论文
arXiv
·
QEvict 将历史窗口分为全精度、可恢复低比特和永久删除三层,并依据累计 Attention Score 动态降级或重新提升窗口;核心假设是 Token 重要性会随生成 Query 漂移,二元保留/删除不可逆。作者在 LongBench、RULER 与 GSM8K 上报告优于代表性 Eviction/Quantization 基线;Llama-3.1-8B、256 Token Prefill、1024 Token 生成、Batch 32 的端到端测试中,Eager/SDPA 吞吐提升 9.8%,而 FlashAttention-2 下峰值显存从 29.54 GB 降至 20.78 GB,但吞吐由 535.11 降至 218.05 tok/s。
为什么值得读:这项工作把 KV 管理从一次性淘汰改成可逆状态机,更贴近多轮推理中注意力热点重新激活的现实。它也诚实暴露了系统代价:当前实现需物化 Attention Score、反量化并重组 Cache,只有 Eager Backend 获得速度收益;在融合低比特 Attention 与路由 Kernel 之前,显存收益不等于生产吞吐收益。
04
正式会议论文与硬件协同设计
arXiv / ICCAD 2026
·
Celty 针对权重与运行时 Activation 同时稀疏、Batch 1 Decode 形成的 SpMspV,引入可向量化加载的 RLC-CSC 格式和基于 Shared Memory 的 Scatter Accumulation;进一步提出带流水 RLC Decoder、复用本地 Register File 累加的 Sparse SIMT Core。软件 Kernel 在单张 A5000、CUDA 12.6 的指定层形状上最高相对 cuBLAS 快 2.8 倍、相对 Flash-LLM 快 2.4 倍;硬件估计在 70% 双稀疏时最高 5.3 倍。LLaMA-2-13B 端到端单 Token Decode 在 40% 双稀疏时报告 1.97 倍加速,但 WikiText-2 PPL 从 Dense FP16 的 4.9 增至 5.6。
为什么值得读:Batch 1 的不规则稀疏很难喂饱 Tensor Core,格式、索引重建和冲突累加可能吞掉理论 FLOP 节省;Celty 展示了从压缩格式一路协同到微架构的路径。需要区分实测与估计:软件 Kernel/模型实验在 A5000 上完成,而 Sparse SIMT Core 性能通过修改 Kernel 估计,Decoder 以 32nm 综合后缩放到 7nm,并非现成芯片实测。
05
Serving Benchmark 方法论文
arXiv / 中南大学、阿里巴巴等
·
Bottleneck-Preserving Witnessing 先用不看 Response 的 Workload 特征和源侧测量提名候选,再把 Scheduler、Prefill、Decode、KV Cache 的多组件候选组织成可复用 Hyperedge,最后只凭目标系统直接测量验证标签,并要求每个组件至少有两个直接 Witness。作者在 BurstGPT、ServeGen 与 Mooncake Trace 上、以 Qwen2-1.5B、vLLM 0.6.6.post1 和 V100S 32 GB 重放,比较 16 种策略;BPW 在三个 Trace 的 Mean Prefix Macro-F1 与 WBRC-AUC 均为最高,并报告相对提升 2.3% 与 16.3%。
为什么值得读:生产 Trace 缩减若只追求长度、并发或分布代表性,罕见但关键的瓶颈请求很容易被删掉,导致配置回归测试“看起来覆盖”却无法诊断组件。BPW 强调预测只能选样,不能同时充当真值;不过实验模型、GPU、vLLM 版本和每 Cell 24 个确定性请求都较受限,迁移到现代多 GPU Serving 前仍需复验。
06
推理能耗与电网论文
arXiv
·
论文用真实 GPU 功率 Trace 研究 vLLM Chunked Prefill:切分长 Prompt 并未明显降低峰值功率,却会降低平均 Ramp Rate,而且收益随系统饱和度上升。作者在单张 RTX 4090、Qwen2.5-Coder-7B-Instruct、ShareGPT 混合负载上报告,并发从轻到重时平均 Ramp 降幅由 7.0% 增至 34.6%,高比例/大尺寸长 Prompt 条件下达到 42.6%;再以实测 Trace Bootstrap 建模,估计代表性运行点的快速调节备用容量可降低 20.3%—22.7%。
为什么值得读:推理调度不仅决定 TTFT/TPOT,也会塑造机房对电网呈现的短时功率变化;已有生产功能可能成为无需新增硬件的 Demand-Shaping 手段。论文明确使用消费级 4090 和单 GPU,长 Prompt 混合也刻意放大,机架级同步效应、A100/H100 功率曲线与真实电网采购结果仍需独立验证。
07
Pre-publication 系统论文
arXiv / DeepSig
·
这项 pre-publication 工作为 OCUDU 5G PHY 与 O-RAN Fronthaul 加入 CUDA Backend,通过 CUDA-visible Grid、Device Softbit Buffer、Stream Event、Pinned Staging 与 Managed Memory,让 PDSCH/PUSCH/PRACH、Split-8 Lower-PHY 及 IQ 压缩尽量常驻 GPU。作者在 DGX Spark 的 GB10 GPU 与 ARM Host 上,以固定到高性能核心的生产 CPU 路径为基线,报告最高 10.3 倍 PUSCH、19.7 倍批处理 Lower-PHY RX、91.4 倍 BFP12 解压和 28.8 倍 PRACH Detector 加速;测试 PUSCH 中 CPU/GPU 的 10% BLER 阈值差在 0.064 dB 内。
为什么值得读:它把 AI Infra 常见的经验带到无线栈:只有统一 Buffer Contract、减少 Host 往返并让多个阶段共享 Device Residency,Kernel 加速才会转化成流水线收益。数字来自特定 GB10、批形状、零拷贝模式与 Microbenchmark;作者明确表示这些表征 Benchmark Binary 延迟而非完整 OTA 吞吐,且 PUCCH、NIC—GPU 包路径等仍未完全常驻设备。