跳到正文
今天10月10日周六1 条
10月9日周五
  1. The Decoder60

    Anthropic 的 Claude Science 首次绘制全天紫外图

    Anthropic 的 Claude Science 首次绘制出完整的全天紫外图。该项目由 Claude Science 协调多个 AI 智能体,从多个太空任务下载数据、校准并合并,再用 inpainting 补全缺失区域,测试中预测与实测平均偏差约 10%。约翰斯·霍普金斯大学天体物理学家 Brice Ménard 在 Anthropic 官网介绍了这一流程,并称该图将用作教学材料。

  2. TechCrunch · AI22

    Ben Affleck 谈 AI:从卷积神经网络到微调开源视频模型,好莱坞明星的技术素养走红网络

    Ben Affleck 因在多段采访中讲解机器学习、神经网络、Transformer、张量和 GPU 等概念而走红网络,他称自己会写 Python 脚本。他透露曾走访 OpenAI,并于 2022 年创办 InterPositive,通过解冻权重微调开源视频模型、只训练最后的电影质感层,该技术已用于其电影《Animals》的后期制作。

  3. The Decoder80

    数学家呼吁抵制 OpenAI,AI 生成证明涌入数学领域

    一批数学家发表声明,呼吁抵制 OpenAI,起因是 OpenAI 一次性放出 700 多个文件,声称其内部模型解决了 100 多个未解数学问题。菲尔兹奖得主 Terence Tao 在博客转发该声明并提出 Math 2.0 时代,Scott Aaronson 则称之为 Mathocalypse。

    推荐理由:数学界对 OpenAI 批量放出 AI 证明的反弹,呈现了 AI 冲击基础研究时学术共同体与实验室之间的张力。

10月8日周四
  1. Google Research67

    Google Research 研究:AI 辅助提升专利撰写产出,但未必加速初级律师专业判断成长

    Google Research 与 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机分配给 11 家知识产权律所的 133 名律师。

    推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。

  2. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一 agent harness 直接参与训练,无需在训练框架内重写智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计取舍与实测增益,可据此判断自建智能体训练链路的成本。

10月7日周三
10月6日周二
10月5日周一
  1. NVIDIA Blog22

    NVIDIA Inception 初创公司如何用 AI 补齐乳腺癌诊疗缺口

    NVIDIA Inception 计划中的三家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,公司称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。

10月2日周五
  1. Hugging Face Blog62

    Ai2 开源 AstaBrief 8B 科研报告生成模型

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已作为 Asta 的 Fast 模式上线并开放权重与训练数据。

    推荐理由:原文给出了训练数据构造与过滤细节,以及 Fast 模式与 Thinking 模式的实测耗时对比,可据此判断小模型做科研报告生成的可行边界。

  2. Hugging Face Blog38

    ServiceNow CoreAI 推出 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程在 EnterpriseOps Gym 数据集上进行了演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完备性。

10月1日周四
9月30日周三
  1. Google DeepMind66

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:DeepMind 把水印从数字内容延伸到合成生物,读者可了解其原理、湿实验验证结果与开源范围。

  2. Google Research40

    Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,通过轻量级"转向阻尼器"网络在不改动基座模型权重的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持灰盒与黑盒访问。

9月29日周二
  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物世界模型和连接模型、科学工具、文献与实验人员的交互式 harness 组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物,最高排名的化合物在湿实验中产生了最大的经典到基底细胞状态转变,整个从缩小化合物搜索空间到选出候选验证的过程仅用一个周末。

    推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

  2. Microsoft Research18

    微软亚洲研究院新加坡分院成立一周年:推进研究、合作与人才培养

    微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来聚焦下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践及生态与人才培养四大方向。该实验室与新加坡医疗生态伙伴合作推进多模态医疗 AI 和自进化诊断智能体,并联合 EDB 于 2026 年 2 月举办物流与运输 AI 高管圆桌会。

9月21日周一
  1. Microsoft Research50

    微软开源逆合成模型 RetroChimera,成果登上 Nature

    微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc,通过学习式重排序整合两者互补预测。在十项高难度靶分子的专家盲测中,RetroChimera 成功完成九项,优于 de novo 模型的五项、编辑模型的四项和基线 NeuralSym 的两项。

9月19日周六
  1. Google Research22

    Google Research 推出 MilleMiglia:面向中程物流的真实实例生成器

    Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中程物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。中程物流承担区域乃至洲际配送中心之间的大批量货物运输,成本占比高却因企业数据敏感长期缺乏公开高质量数据,该工具将中程网络建模为时空图上的多商品流问题,以捕捉货物换车、按目的地分拣与时间窗衔接等约束。

9月18日周五
9月8日周二
  1. Google DeepMind76

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单字母变异预测

    Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,即所有可能的单字母改变,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过免费网站门户面向学术研究开放。

    推荐理由:原文给出 9 亿单核苷酸变异预测的开放入口与 AVI 评分,读者可据此判断基因组变异解读的门槛变化。

9月1日周二
8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;用 SPADE 自动生成训练环境;用 Hawkeye 构建更好的 GPU kernel

    METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身则未见可测量的加速。多校团队推出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。

8月17日周一
7月26日周日
  1. Berkeley AI Research32

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互摘要

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也低于全上下文设置。

7月7日周二
  1. Berkeley AI Research34

    智能免费之后怎么办?面向智能体、由智能体运行、由智能体构建的数据系统

    伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统面临三大新挑战:为智能体服务、运行智能体集群、由智能体合成。作者指出智能体的"agentic speculation"会让单次用户请求产生上千条 SQL 查询,其中 80-90% 子查询是重复工作,需重新设计查询接口与优化策略。

4月20日周一
  1. Berkeley AI Research37

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使基于梯度的规划更稳健。

3月13日周五