GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布特征构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 pull request。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布特征构建,包含来自 187 个开源仓库、覆盖 19 种语言的 219 个 pull request。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再依据终端后端状态和副作用而非生成文本判定成败,每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判定成败,并给出 20 次重复下的稳定性与成本数据。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测与 AE、Dst 指数预测,结合各变电站纬度、地质电导率等数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的卸载工具链,读者可据此判断物理 AI 的部署取舍。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与基于 GNN 的 NeuralLoc,通过学习式重排序整合两者互补预测。在十项高难度靶分子的专家盲测中,RetroChimera 成功完成九项,优于 de novo 模型的五项、编辑模型的四项和基线 NeuralSym 的两项。