跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

7 条精选近 30 天 7 条共收录 35 条

更新

安全对齐的精选

10月9日周五第 1–7 条
  1. The Decoder80

    数学家呼吁抵制 OpenAI,AI 生成证明涌入数学领域

    一批数学家发表声明,呼吁抵制 OpenAI,起因是 OpenAI 一次性放出 700 多个文件,声称其内部模型解决了 100 多个未解数学问题。菲尔兹奖得主 Terence Tao 在博客转发该声明并提出 Math 2.0 时代,Scott Aaronson 则称之为 Mathocalypse。

    推荐理由:数学界对 OpenAI 批量放出 AI 证明的反弹,呈现了 AI 冲击基础研究时学术共同体与实验室之间的张力。

10月8日周四
  1. The Decoder76

    Zenity Labs 发现 AWS AgentCore 漏洞:一个公开智能体可接管同区域全部智能体

    安全公司 Zenity Labs 称,AWS 的 Bedrock AgentCore 存在一串被其命名为 AgentCorruption 的漏洞,攻击者只需对一个公开智能体拥有聊天权限,用一条提示词即可接管同一 AWS 账号和区域内的所有 AgentCore 智能体,读取私密对话、源代码和存储的凭证。

    推荐理由:Zenity Labs 披露 AWS AgentCore 的默认权限与隔离缺陷,呈现了智能体平台在权限边界上的系统性风险。

  2. GitHub Blog · AI & ML60

    GitHub 推出基于 ModernBERT 的密钥检测模型,扩展 push protection

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露与人工修复的失衡,并给出把检测前移到 push 环节的模型方案。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已采用

    Google 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算转移到服务端,训练瓶颈从设备可用性转为 TEE 资源,训练时间不再受设备昼夜波动影响,此前这类模型训练通常需要 1-2 个月。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已落地的训练提速与隐私保证细节。

9月30日周三
  1. Google DeepMind66

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:DeepMind 把水印从数字内容延伸到合成生物,读者可了解其原理、湿实验验证结果与开源范围。

9月25日周五
  1. GitHub Blog · AI & ML60

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就能识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

9月24日周四