01
工程文章
AMD ROCm Blog
·
AMD 以 verl 解释同步、one-step-off 与 fully async 强化学习训练的区别,并给出两条 MI355X 复现路径:Megatron + Qwen2.5-VL-7B 的 GRPO,以及 FSDP2 + Qwen2.5-Math-7B 的 DAPO。Fully Async Policy 把 rollout 与 trainer 放在独立 GPU 池并行运行,通过 RCCL 同步权重、staleness_threshold 控制样本新鲜度,还可暂停并恢复参数更新期间的在途 rollout;文末另以不同工作负载比较 MI355X 与 B300 的同步吞吐。所有利用率与吞吐数字均为 AMD 在文中指定软件栈、模型和硬件下的自报测量。
为什么值得读:推理主导的 RL 工作负载常被长尾生成和阶段屏障拖慢,简单增加 GPU 不会自动消除空转。文章把资源解耦、权重传播、样本陈旧度与 partial rollout 串成一套可操作的系统设计,也明确区分“异步流水线演示”和“同步硬件比较”两个实验边界。
02
研究文章
IBM Research / Hugging Face Blog
·
IBM Research 用 ALTK-Evolve 从 Agent 既往轨迹提炼行为指南,并在推理时选择注入完整指南集或“固定核心 + 按任务检索”的子集,无需更新模型权重。作者在 AppWorld 的 585 个多步任务和 8 个模型上观察到不同剂量模式:有能力余量的模型更受益于完整集合,较弱模型容易被大上下文淹没,而接近饱和的模型没有可测收益;例如 gpt-oss-120b 在作者协议下用检索式配置提高 16.1 个百分点 TGC,同时平均 token 开销增加 5%。这些效果依赖特定任务集、指南生成方式与模型版本。
为什么值得读:Agent memory 不只是“存多少”的产品功能,而是上下文预算、检索策略和 prompt cache 共同决定的运行时资源配置。文章还把 token 膨胀与 ReAct 步数分开测量,为平台团队判断应扩上下文、做检索还是利用前缀缓存提供了更清楚的成本模型。
03
开源发布
Hugging Face Blog
·
Sentence Transformers v6.0 新增 MultiVectorEncoder,把 ColBERT/PyLate 式 late interaction、ColPali 视觉文档检索以及相关训练与评测流程纳入统一 API。与每个文档压成单向量不同,多向量模型保留 token 级表示并以 MaxSim 评分,换取更强的精细匹配能力和更大的索引;官方示例中 4,874 个 Natural Questions 段落生成 608,414 个 128 维 token 向量,float32 占 311.5 MB,fast-plaid 压缩后为 92 MB。数字只描述文中该模型与语料配置。
为什么值得读:late interaction 的质量收益过去常伴随独立工具链和复杂索引工程。统一进 Sentence Transformers 后,团队可以更直接地比较 dense、sparse、reranker 与 multi-vector 路线,但也必须把 token pooling、量化索引和两阶段 retrieve-rerank 纳入容量设计。
04
系统设计
AWS Machine Learning Blog
·
AWS 与 Jumio 介绍一个部署在三个 Region 的 streaming-first 实时特征平台:事件经 Kinesis 进入 Flink,在线特征写入 SageMaker Feature Store,并以 Valkey 支撑热点数据;并行离线路径经 Firehose、S3 与 EMR Serverless 生成 Iceberg 表,用于训练、回填和分析。系统分别监控 Kinesis→Flink→Feature Store 各段延迟、checkpoint、backpressure 与 GET/PUT 健康度;文章报告该工作负载的 P95 响应时间为 16.9 ms、读取 P50 为 8.44 ms、写入 P50 为 18.6 ms,属于 Jumio/AWS 在其架构和 SLA 下的案例数据。
为什么值得读:线上与离线特征一致性、迟到事件和回填通常比数据库选型更难。这个案例把热冷分层、流批双路径、Iceberg 离线表和分段可观测性放在一张架构图中,也坦陈 Flink 学习曲线、多服务集成与成本治理的代价。
05
工程文章
Together AI Blog
·
Together AI 介绍在模型 endpoint 层执行固定 cohort A/B 实验的机制:一个 control 可配最多 20 个 variants,各成员百分比合计 100%,且 variant 在基础 traffic split 中必须保持零权重,避免容量权重与实验曝光重复计数。配置支持从 95/5 逐步提升到 80/20、50/50,更新由 etag 防止并发覆盖;平台按 deployment 提供延迟、错误和吞吐指标,而产品质量信号需由用户用 deployment ID 联结。
为什么值得读:模型升级不能只靠离线 benchmark 或 shadow traffic,因为后者无法测量真实用户行为。把实验路由从应用代码下沉到 serving control plane,可减少 cohort 漂移和遗留分支,但也要求平台明确实验分流、自动扩缩容、蓝绿发布和故障回退的组合顺序。