Ai2 如何用 GPU 时间预算与分层公平分配改造集群调度
Ai2 用 GPU 时间预算、分层公平分配和时间切片合约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维操作变成透明的行政预算流程。
Ai2 用 GPU 时间预算、分层公平分配和时间切片合约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维操作变成透明的行政预算流程。
Postman 在 Amazon Bedrock 上构建 Agent Mode,以 AI 原生方式覆盖 API 测试、文档、发现与实现,服务 4000 万开发者。
Amazon Bedrock 上线 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 GPT-6 Astra 支持最高 100 万 input tokens,Ultrafast 版本 API 推理速度最高提升 6 倍、达 300 tokens/秒。
NVIDIA 开发者正用前沿 AI 模型配合 Omniverse 库,通过自然语言指令构建仿真应用。文中展示了 GPT-6 Astra 参与的多个项目,包括仓库人形机器人仿真器、自动驾驶测试工作流、数字孪生传感器校验,以及用 Unitree G1 人形机器人做体育动作测试的 Robo Olympics,其中机器人 100 次仿真中 64 次越过单个栏架。
Amazon Bedrock AgentCore payments 正式可用,为 AI 智能体提供按需付费的托管能力,支持 x402 兼容端点,由基础设施层而非模型执行消费限额。
AWS 发布基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群。
Oracle 在招聘、工程和运营环节借助 ChatGPT Work 与 Codex,把专家知识转化为快速、可复用的工作流,将原本需要数天的工作缩短到几分钟。
《Gears of War: E-Day》本周正式上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能云端游玩,并支持 NVIDIA DLSS 和 NVIDIA Reflex。
LegalOn 将每日 Codex 预估成本削减 65%,同时保持开发速度。该公司按任务类型分配 Astra、Sol 和 Luna 模型,并对预算进行策略性管理。
作者在 HuggingChat 中开启 ML-intern 模式,用提示词驱动它完成数据构建、训练、评测和发布,两天内做出六个模型,总计算成本约 103 美元。
推荐理由:作者用 ML Intern 在两天内从零训出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。
推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的能力定位、成本变化与调用方式,便于判断它在多智能体分层中的位置。
在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。
推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断 Windows 端侧智能体的落地路径。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核实权限,避免依赖可能过期或映射错误的 ACL 数据。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重写智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计取舍与实测增益,可据此判断自建智能体训练链路的成本。
AWS 提出 Agentic Value Model 框架,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量和变更韧性四个维度衡量 agentic automation 的价值。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,为全球超 4 万家客户提供带来源引用的企业级问答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超 10 万条洞察。
AWS 展示了一套自动化修复工作流,用 Amazon EventBridge 接收 AWS DevOps Agent 的调查完成事件,再由 AWS Lambda Durable Functions 调用 Amazon Bedrock 从预审工具白名单中选取修复动作。
AWS 设计了一个为期六周、每周约四小时的结构化项目,让非工程背景的业务人员用 Amazon Bedrock AgentCore、Strands Agents SDK 等工具构建可运行的 AI 原型。
Cornerstone OnDemand 基于 Amazon Bedrock 和 Strands Agents 构建多智能体系统 Orion AI,将数据库诊断时间从 45 分钟降至 10 分钟,降幅 78%。该系统还把手动生命周期步骤从 10 步以上压缩为 1 次交互(减少 70%),并将冗余告警中位数削减 65%。三人团队用六个月完成交付。
Google Research 展示 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为公共卫生概念验证:它把匿名搜索趋势、人口流动、建成环境密度和环境决定因素压缩为按月更新的位置嵌入向量,无需任务特定微调即可直接接入现有流行病学模型。
NVIDIA 最新《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型与软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并开放端到端微调配方。
NVIDIA Inception 计划中的三家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
Google 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算转移到服务端,训练瓶颈从设备可用性转为 TEE 资源,训练时间不再受设备昼夜波动影响,此前这类模型训练通常需要 1-2 个月。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已落地的训练提速与隐私保证细节。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的硬件门槛。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完备性。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:原文给出 Astra Ultrafast 在 Blackwell 上的加速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测与 AE、Dst 指数预测,结合各变电站纬度、地质电导率等数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真与工程 AI、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能在本地执行代码、调用第三方 API。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。它把文档高度拆成确定性的代码几何与动态块几何两部分,评论高度按需懒测量并锚定到文件、行和侧,避免滚动跳变。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的卸载工具链,读者可据此判断物理 AI 的部署取舍。
Google Private AI Compute 团队公布 Private AI Compute 架构更新,将为其平台带来持久、跨设备的服务端 AI 记忆,同时保持端侧隐私标准。
推荐理由:Google 给出私有 AI 计算加入持久服务端记忆的架构思路,读者可了解云端记忆如何与端侧隐私标准结合。
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还可在受控环境中用专有数据训练自有模型,保留数据与模型所有权。Cloudera 平台承载 30 exabytes 客户管理数据,双方称此举面向对主权 AI 日益增长的需求。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用 Skill.md 引导智能体导出状态快照并在 C++ 侧校验,再用 Vibe CLI 启动上百个智能体解析调用树、结合 Mistral OCR 整理散落的 PDF 文档并逐节点提交 PR。
推荐理由:Mistral 公开了用智能体迁移 4 万行 Fortran 的完整流程,其中先建数值对齐测试再迁移的做法可迁移到其他遗留系统改造。
Mistral 发布 Agentic Search,作为检索层让模型在多步循环中查找、检查和验证信息,通过 Mistral Search Toolkit 提供,并内置到 Studio 和 Vibe 的 Libraries 中。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统 RAG 的替代路径。
Berkeley Sky Lab 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX,通过结构化的 CUDA-to-MLX 翻译层,让已有 CUDA 内核成为知识库并适配为 Apple Silicon 内核。
推荐理由:读者可以看到 CUDA 内核经验如何被结构化迁移到 Apple Silicon,以及翻译层对性能差距的具体贡献。
伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统面临三大新挑战:为智能体服务、运行智能体集群、由智能体合成。作者指出智能体的"agentic speculation"会让单次用户请求产生上千条 SQL 查询,其中 80-90% 子查询是重复工作,需重新设计查询接口与优化策略。
伯克利 AI 研究团队系统梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild!