01
开源发布
NVIDIA Dynamo
·
Dynamo v1.4.0 把路由能力扩展到实验性的跨数据中心前缀路由,引入有序 KV relay、预约决策重放和按端点组织的事件传输,并以 cache salt 隔离不同租户的 KV 复用。前端新增实验性的 vLLM 兼容 token-in/token-out 接口及默认开启的 tokenizer 前缀缓存;vLLM-Omni 流水线加入基于 NIXL RDMA 的多节点自回归到扩散阶段解耦。发布还把 Spica 离散事件模拟框架纳入仓库,用于在无 GPU 条件下做容量规划和流量回放。
为什么值得读:这是一次覆盖路由、传输、前端协议、仿真和多模态流水线的推理平台更新。对运营多集群或多地域推理服务的团队,跨域 KV 索引、租户隔离和基于生产 trace 的容量模拟,比单个 kernel 的峰值更接近真实系统瓶颈。发布说明中的 640 个合并 PR、127 位贡献者及性能提升均为项目方自报。
02
工程文章
Cloudflare Blog
·
Cloudflare 说明如何在托管网络路径上识别 MCP 流量,并将控制点拆分为客户端 hook、设备网络边界和 MCP 服务端三层。文章指出仅靠主机名或 /mcp、/sse 路径无法可靠识别协议,因此 Gateway 使用协议头与 JSON-RPC 信号分类请求,再结合 MCP Server Portal 判断客户端是否绕过批准路径。服务端侧则可在工具执行前做按工具授权、参数检查、限流与审计。
为什么值得读:Agent 能以机器速度重复调用高权限工具,传统面向人类操作频率设计的访问控制并不充分。文章提供了一个可迁移的治理框架:客户端拥有最早的决策上下文,网络层覆盖面最广,服务端最接近实际执行;三者需要组合,而不能把 MCP 安全简化成 URL 黑白名单。文中能力与效果属于 Cloudflare 官方产品说明。
03
论文
arXiv
·
论文提出 Reduced Matrix Multiplication(RMM),在不修改模型权重、无需训练的条件下,根据输入从矩阵乘法收缩维中选择信息量较高的切片,以保留比例控制精度与计算量的折中。作者在 1B 至 70B 参数语言模型、生成与判别任务、长上下文及视觉语言推理上评估该方法,并观察到注意力侧计算通常比 MLP 更容易削减。使用定制 kernel 的 NVIDIA A100 墙钟测试显示,计算削减在较长序列上能够转化为实际运行时间收益。
为什么值得读:它把推理近似从固定量化或固定稀疏模式推进到输入自适应的矩阵乘法裁剪,并明确展示不同模型家族、组件和任务的容忍度并不一致。对 kernel 与运行时设计者,关键问题是如何低开销地产生选择、保持规则内存访问,并让理论 FLOP 减少稳定兑现为端到端延迟收益。
04
技术报告
arXiv
·
该报告研究如何把 High-Bandwidth Flash(HBF)作为 HBM 推理系统的容量扩展层,而不是直接替代计算路径上的高带宽内存。作者将新增容量用于驻留只读为主的模型状态,并通过模拟分析两类场景:MoE 服务可容纳更多 expert 副本,多模型服务可减少模型装载并复制热门模型。报告的核心边界是执行热路径仍需保持在 HBM,HBF 的价值主要来自扩大模型权重的常驻集合。
为什么值得读:当推理集群同时面对模型权重、KV cache 和多模型版本增长时,容量层级会直接影响路由自由度、冷启动和副本策略。这篇报告值得作为存储级内存与 GPU 内存协同设计的早期系统模型阅读,但结论来自作者模拟,并非真实 HBF 硬件上的生产 benchmark。
05
工程教程
AWS Machine Learning Blog
·
AWS 展示如何让运行在本地、GCP、Azure 或非 AgentCore Runtime 环境中的 Agent,把遥测发送到 AgentCore Observability。方案使用进程内 ADOT 自动插桩,采集符合生成式 AI 语义约定的 reasoning、工具调用、模型调用、token 使用等 span,再通过 SigV4 认证将 OTLP traces、metrics 与 logs 发往 CloudWatch 端点。文章给出了 Strands Agent 的配置流程,并说明可用 IAM Roles Anywhere 取代生产环境中的长期访问密钥。
为什么值得读:Agent 基础设施的可运维性不能局限于单一托管运行时;统一 trace 语义和跨环境采集是定位工具失败、成本异常与行为偏移的前提。该方案提供了可复现的 OpenTelemetry 接线方式,但控制面和存储仍落在 AWS 服务中,团队需要同时评估凭据管理、遥测数据边界和供应商绑定。