01
论文与推理前端系统
arXiv / Zhenyu Zhang、Zhichao Cao
·
TokTier 面向 coding agent 的两类输入:长会话末尾的小追加,以及没有可复用前缀的完整文本。前者只重分词追加边界附近的小窗口,并在找到稳定 pre-tokenization 边界后拼接,否则扩大窗口或回退;后者把 GPT 系 tokenizer 的 regex pre-tokenization 拆为可在 GPU 运行的规则,再执行精确 BPE,并用抽样 shadow verifier 校验。作者报告在 17 类生产 tokenizer、1.5×10^10 次边界检查、12.4 TB 文本和 9.3 万余条 agent step 上未见 token divergence;与 vLLM 集成后,中位 TTFT 降低 16—34%、P99 降低 23%。
为什么值得读:服务端做了 KV/prompt cache 后,CPU 前端不再只是固定小开销,而可能成为延迟与吞吐上限。TokTier 的关键不是近似加速,而是为增量路径定义逐请求正确性检查和安全回退;但 437×、491× 与 1,821 req/s 等数字来自作者的 tokenizer、硬件和 50 ms P99 目标,落地前必须用自身模板、Unicode 边界和请求分布复测。
02
分布式训练系统论文
arXiv / 香港科技大学(广州)等
·
混合图像—视频 DiT batch 的序列长度差异很大,固定 DP、CP 或分组组合会在组间负载不均和组内通信冗余之间取舍。Zellige 用硬件 profiler 估计候选 placement 的执行时间与峰值显存,两阶段 planner 先布置计算重的 anchor sequence,再把较轻序列填进剩余容量;coalesced attention engine 则在同一执行中容纳完整序列和 distributed-attention shard。作者报告 profiler 对 21 套计划的 step makespan 与峰值显存 MAPE 分别为 3.4% 和 1.5%,planner 每批耗时 33—119 ms;端到端相对 KnapFormer 在 16×A800 上提升 1.12—1.48×,在 32×A6000 上提升 1.27—1.54×。
为什么值得读:训练调度的资源单位正从“一个 batch 统一并行策略”下沉为“每条序列可塑形 placement”。这对混合模态、可变分辨率和长视频尤其重要,但收益依赖长度分布、通信拓扑、显存余量和 planner 开销,论文数字不能直接替代目标集群上的 step-time profiling。
03
Agent 推理论文
arXiv / AWS AI Labs 等
·
这项实证研究把 agent 的在线 KV compaction 区分为 token eviction 与 attention matching,并比较 boundary、repeat-prefill、延迟获取的未来生成查询等低成本 proxy。BrowseComp-Plus 和 WideSearch 实验显示,在尚不知道后续任务时立即压缩往往损害表现;等待 agent 产生未来查询后再压缩,可恢复相当一部分差距,而且 proxy 不完美时 token eviction 通常比 attention matching 更稳。作者报告跨不同规模模型,token eviction 在 KV 缩减 80% 时仍保留大部分准确率,并可能相对不压缩基线提升吞吐。
为什么值得读:对长轨迹 agent 而言,压什么比怎么压更依赖未来行为;把 compaction 放在错误的生命周期节点,会用不可逆的信息损失换来显存。该工作提示 serving engine 需要暴露 turn/trajectory 语义和延迟决策点,而不能只把 KV 压缩当作静态 cache policy。
04
正式会议论文与可观测性系统
arXiv / ASE 2026
·
TELLER 不修改模型二进制,采集 NVTX/CUPTI trace 与服务日志,再重建逐请求 call-chain tree,把日志行对齐到对应执行步骤。它以保留父子、时序和通信关系的 causal-context slice 表示异常上下文,并用 Trace Pair Encoding 将 parent、depth、duration 等结构压成 token 序列;其上结合数值候选定位和多模态 root-cause 模型,输出异常步骤、可疑算子与自然语言解释。作者在多节点 GPU 推理实验中报告,中等大小 TPE 词表可把每步 trace 长度压缩 80% 以上且取得最佳综合诊断表现,过度压缩则明显伤害质量。
为什么值得读:LLM serving 的一次请求横跨 Python/C++、CUDA、kernel 和 collective,单层 profiler 很难回答“哪一步导致哪个请求变慢”。TELLER 提供了把原始 timeline 转成可检索因果证据的路径;不过诊断模型与 fault prior 仍需在真实故障库上校准,自动解释不能替代底层 trace 证据。
05
无服务器基础设施实践
Modal Engineering
·
Modal 过去允许选择 container region,但输入输出仍统一绕行 us-east I/O plane,跨洲小模型调用可能让约 200 ms 网络往返压过不足 50 ms 的推理本身。新 I/O plane 分布到至少四个区域,并新增 routing_region;团队已把 us-east Functions 迁移完成,厂商自报端到端 Function Call 的 p50 约下降 80 ms。实现层面把 autoscaling 统计和事件发布移出热路径、减少共享存储交互,以客户端 metadata cache 与 JWT 重做鉴权,并把高并发 gRPC server 从 Python 改写为 Go;输入队列继续使用 Redis Streams,并因负载测试中的 CPU spike 暂留 Redis 7.1。
为什么值得读:对 embedding、reranker 和工具函数这类短任务,网络、鉴权、排队和序列化可能比模型计算更贵。文章给出了一套从路由地域到 control-plane telemetry 的完整延迟分解;80 ms 是 Modal 迁移后的整体自报值,实际收益取决于调用方、容器区域、payload 是否超过 2 MiB 以及 batch 策略。
06
节能推理系统论文
arXiv / 华中科技大学等
·
AFlex 基于 Attention 与 FFN 的能量最优频率会随 prefill/decode、负载和配置变化这一观察,把两类算子分离部署。全局 scheduler 联合决定资源配置,节点内控制器执行算子级 DVFS;系统再用交错 A/F pipeline、动态 microbatch depth 和自适应 batch 减少流水线气泡。作者在 SGLang 上实现原型,以 NVIDIA A800、Qwen3-32B、Mixtral-8×7B 及生产 Conversation/Coding trace 评测,自报在满足 TTFT 与 TPOT SLO 时,每 token 能耗相对先进分离式 serving 最多降低 49%,相对频率调节系统最多降低 48%。
为什么值得读:GPU 频率不必以整请求或整个推理阶段为最小控制粒度;算子的 memory/compute sensitivity 不同,给调度器留下新的节能空间。代价是额外资源池、通信和控制复杂度,收益也高度依赖 A800 的频率曲线、模型结构、batch 与 SLO,需在目标硬件上重新寻优。
07
厂商机架级硬件架构
AMD ROCm Blog
·
AMD 介绍基于 CDNA 5 与 MI455X 的 Helios rackscale:单机架包含 72 GPU、31 TB HBM4、18 颗最多 256 核的 EPYC Venice、最多 36 TB DDR5,并以 UALink over Ethernet 提供厂商标称 260 TB/s scale-up、开放以太网提供最高 43 TB/s scale-out。CDNA 5 增加 E5M3 scale 与 4-bit Tensor LUT,用于在矩阵乘前执行低精度解压和预处理;软件侧由 ROCm、Fabric Manager、Redfish 管理和 Slurm/Kubernetes 集成覆盖设备到集群。架构还以多路径自动重路由、vPod 故障域、热插拔 tray、冗余电源和液冷处理机架级故障;AMD 自报单链路、单交换机和单 switch tray 故障的带宽影响约为 3%、8% 和 17%。
为什么值得读:AI 集群的采购和调度边界正在从 8-GPU server 移到整机架,collective 拓扑、故障域、功耗、冷却和维护必须一起建模。所有吞吐、带宽、故障影响和“最高 4× AI compute”均为 AMD 规格或实验室计算,且产品信息可能变化;容量规划应等待独立工作负载 benchmark 与可供货配置。
08
GPU Kernel 与厂商 Benchmark
AMD ROCm Blog / CK Tile
·
VSA 先以 3D space-filling curve 保持视频 token 的时空邻近,再把 token 聚成 cube 做 coarse Top-K,fine stage 只对选中的 K/V cube 计算 token-level attention。CK Tile 实现使用 compact LUT 和 valid block count 直接跳到活跃块,并以三阶段双缓冲流水重叠 QK、softmax 和 KV GEMM。AMD 在单张 MI308X 上,以 Wan2.1-T2V-1.3B、832×480、81 帧、50 steps、BF16、Q/K/V=[1,12,32768,128] 测试,自报 70% 稀疏度时 attention kernel 相对 dense FlashAttention 快 3.31×;按实测 step 稀疏分布聚合后,生成时间约从 4 分 47 秒降到 3 分钟,即降低约 37%。
为什么值得读:只有把稀疏模式对齐 GPU tile 和索引表示,FLOP reduction 才可能变成 wall-clock 收益。该结果包含清晰硬件、模型和 tensor 边界,但目前质量核验仅为单样例视觉 sanity check,未提供 VBench 等量化指标;coarse selection 与 LUT 构建开销也应在生产集成中单独计量。