Ai2 如何用 GPU 时间预算与分层公平分配改造集群调度
Ai2 用 GPU 时间预算、分层公平分配和时间切片合约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维操作变成透明的行政预算流程。
Ai2 用 GPU 时间预算、分层公平分配和时间切片合约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维操作变成透明的行政预算流程。
Anthropic 的 Claude Science 首次绘制出完整的全天紫外图。该项目由 Claude Science 协调多个 AI 智能体,从多个太空任务下载数据、校准并合并,再用 inpainting 补全缺失区域,测试中预测与实测平均偏差约 10%。约翰斯·霍普金斯大学天体物理学家 Brice Ménard 在 Anthropic 官网介绍了这一流程,并称该图将用作教学材料。
Simon Willison 发布 ttok 1.0,将默认 tokenizer 从 GPT-4 切换为 GPT-5/GPT-6。
Anthropic 为 Claude 推出两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源。
Ben Affleck 因在多段采访中讲解机器学习、神经网络、Transformer、张量和 GPU 等概念而走红网络,他称自己会写 Python 脚本。他透露曾走访 OpenAI,并于 2022 年创办 InterPositive,通过解冻权重微调开源视频模型、只训练最后的电影质感层,该技术已用于其电影《Animals》的后期制作。
一批数学家发表声明,呼吁抵制 OpenAI,起因是 OpenAI 一次性放出 700 多个文件,声称其内部模型解决了 100 多个未解数学问题。菲尔兹奖得主 Terence Tao 在博客转发该声明并提出 Math 2.0 时代,Scott Aaronson 则称之为 Mathocalypse。
推荐理由:数学界对 OpenAI 批量放出 AI 证明的反弹,呈现了 AI 冲击基础研究时学术共同体与实验室之间的张力。
Periodic Labs 联合创始人 Liam Fedus 与 Ekin Dogus Cubuk 在 Latent Space 播客中提出"合成超级智能"(synthesis superintelligence)愿景:以物理实验为环境的强化学习、AI 材料表征、DFT 模拟与高通量实验室,让模型学习做科学的全过程而非只看已发表结果。
AWS 发布基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群。
作者在 HuggingChat 中开启 ML-intern 模式,用提示词驱动它完成数据构建、训练、评测和发布,两天内做出六个模型,总计算成本约 103 美元。
推荐理由:作者用 ML Intern 在两天内从零训出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
Google Research 与 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机分配给 11 家知识产权律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重写智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计取舍与实测增益,可据此判断自建智能体训练链路的成本。
英伟达团队从 Nemotron 3 出发,用 SFT、RL 和生成-验证-改进推理流程打造竞赛专用模型,在 IOI 2026 与 IMO 2026 均达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型的训练与推理流程。
Google Research 展示 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)作为公共卫生概念验证:它把匿名搜索趋势、人口流动、建成环境密度和环境决定因素压缩为按月更新的位置嵌入向量,无需任务特定微调即可直接接入现有流行病学模型。
Reflection 发布 Beam,一个面向编码、智能体和科研的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月发布。
MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。
NVIDIA Inception 计划中的三家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已作为 Asta 的 Fast 模式上线并开放权重与训练数据。
推荐理由:原文给出了训练数据构造与过滤细节,以及 Fast 模式与 Thinking 模式的实测耗时对比,可据此判断小模型做科研报告生成的可行边界。
Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,介绍公司从 Meta 引入前沿模型能力后转向规模化部署的 AI 转型路径。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完备性。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测与 AE、Dst 指数预测,结合各变电站纬度、地质电导率等数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:DeepMind 把水印从数字内容延伸到合成生物,读者可了解其原理、湿实验验证结果与开源范围。
Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,通过轻量级"转向阻尼器"网络在不改动基座模型权重的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持灰盒与黑盒访问。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名的化合物在湿实验中产生了最大的经典到基底细胞状态转变,整个从缩小化合物搜索空间到选出候选验证的过程仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自进化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc,通过学习式重排序整合两者互补预测。在十项高难度靶分子的专家盲测中,RetroChimera 成功完成九项,优于 de novo 模型的五项、编辑模型的四项和基线 NeuralSym 的两项。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中程物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。中程物流承担区域乃至洲际配送中心之间的大批量货物运输,成本占比高却因企业数据敏感长期缺乏公开高质量数据,该工具将中程网络建模为时空图上的多商品流问题,以捕捉货物换车、按目的地分拣与时间窗衔接等约束。
Google Research 发布一项研究实验,让教师借助生成式 UI(GenUI)按自己的课程目标和教学大纲动态生成互动式学习模拟,并已开放 30 多个面向初高中 STEM 的英文学习互动样例库,覆盖物理、化学、生物和数学,全部由 AI 生成并经教师审核。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,即所有可能的单字母改变,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过免费网站门户面向学术研究开放。
推荐理由:原文给出 9 亿单核苷酸变异预测的开放入口与 AVI 评分,读者可据此判断基因组变异解读的门槛变化。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,用蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身则未见可测量的加速。多校团队推出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
Import AI 第 469 期介绍了新基准 DiG-bench,用 70 款规则与目标均隐藏的游戏测试 AI 的探索与发现能力,21 款已公开,Opus 5 和 Fable 5 搭配 Claude Code 表现最佳,仅二者能在 Tier 7 通关 0.2 的任务,而人类可达 100%。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。
伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统面临三大新挑战:为智能体服务、运行智能体集群、由智能体合成。作者指出智能体的"agentic speculation"会让单次用户请求产生上千条 SQL 查询,其中 80-90% 子查询是重复工作,需重新设计查询接口与优化策略。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使基于梯度的规划更稳健。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。