16 岁少年用 Claude 规划登山路线被困悬崖,直升机救援后称不再用 AI 规划路线
一名 16 岁少年用 Anthropic 的 Claude 规划加拿大温哥华 Crown Mountain 的新登顶路线,结果被困在需攀岩装备的陡峭岩壁 "Widowmaker Arete" 上一处约五英尺宽的岩台,最终由 North Shore Rescue 出动直升机吊救脱险。
一名 16 岁少年用 Anthropic 的 Claude 规划加拿大温哥华 Crown Mountain 的新登顶路线,结果被困在需攀岩装备的陡峭岩壁 "Widowmaker Arete" 上一处约五英尺宽的岩台,最终由 North Shore Rescue 出动直升机吊救脱险。
Common Sense Media 发布研究,将 ChatGPT for Teens 评为不可接受风险,称其设计在心理危机等场景中仍鼓励青少年继续对话。研究指出,模型在 94% 的危机提示中会引导用户求助可信成年人,但当风险来自青少年与 ChatGPT 自身的关系时很少这样做;近 2000 条提示中仅出现两次休息提醒。
OpenAI 本周发布数百份高难数学问题解答,但未完全达到数学与人工智能咨询小组(AGMAI)9 月底发布的指南要求。AGMAI 首要建议是停止在专有模型上测试高难数学问题,而 OpenAI 明确表示正用开放研究问题评估其专有模型;719 份手稿中仅 10 份公开了模型思维链,42% 的证明未经过形式化。
OpenAI 解雇了三名与 Hugging Face 黑客事件调查相关的安全研究员,其中 Tomek Korbak 称被口头告知不再被信任、由安保人员收走工牌带离办公楼,Jasmine Wang 和 Mikita Balesni 也同期被解雇。
OpenAI 在 X 上回应称,解雇 Jasmine Wang、Tomek Korbak 和 Mikita Balesni 三名安全研究员,是因为内部调查发现他们违反敏感信息处理政策、存在重大信任破坏,并强调与三人公开谈论 AI 安全无关。
OpenAI 披露并封禁了两个利用 ChatGPT 账号开展影响力行动的俄罗斯和伊朗网络,二者均使用虚假身份向正规媒体植入内容,而非仅做社交媒体宣传。
OpenAI 上周解雇了 Tomek Korbak、Mikita Balesni 和 Jasmine Wang 三名安全研究员,三人发表致领导层公开信称因把安全置于公司短期利益之上而被辞退,OpenAI 方面称其不当处理了机密信息。
Jasmine Wang、Tomek Korbak 和 Mikita Balesni 三位上周被 OpenAI 解雇的安全研究员发布公开信,否认公司关于其不当处理敏感信息的指控,并警告此次解雇会在公司内部造成寒蝉效应。
Anthropic 一年多来首次更新 Claude 使用政策,新增禁止对 Claude 进行持续且不必要的辱骂或残忍行为,违规者可能被警告、限流、限制、暂停或终止访问。公司称该条款不适用于常见的用户不满、反驳、黑暗创作主题或模型测试研究,仅针对极端情况。新政策还把虚假账号与误导性政治内容归入宣传禁令,将武器禁令扩展到软件和无人机武器化,并更明确禁止未经同意的监控。
AI 模型众包排行榜 Arena 完成 2 亿美元 B 轮融资,估值达 31 亿美元,较今年 1 月 17 亿美元投后估值在约 10 个月内接近翻倍。
一批数学家发表声明,呼吁抵制 OpenAI,起因是 OpenAI 一次性放出 700 多个文件,声称其内部模型解决了 100 多个未解数学问题。菲尔兹奖得主 Terence Tao 在博客转发该声明并提出 Math 2.0 时代,Scott Aaronson 则称之为 Mathocalypse。
推荐理由:数学界对 OpenAI 批量放出 AI 证明的反弹,呈现了 AI 冲击基础研究时学术共同体与实验室之间的张力。
Anthropic 周四更新使用政策,新增禁止干预选举、武器软件、监控以及长期辱骂模型等条款。新政策明确禁止用户持续对模型进行言语辱骂,但仅适用于用户反复恶意攻击且无明确目的的极端情况,不涉及常见的用户不满、反驳、黑暗创作主题或模型测试研究。政策另设“不要破坏民主进程”章节,禁止用 Claude 运营虚假账号、伪造新闻媒体、欺骗选民或扰乱选举。
Anthropic 一年多来首次更新使用政策,新增禁止对 Claude 实施“持续且无必要的虐待或残忍行为”,并明确终止对话仍是主要执行机制,该条款仅适用于用户反复且无明确目的地虐待模型的极端情况,不涉及常见的用户不满、反驳、黑暗创作主题或模型测试研究。
以太坊研究者 Justin Drake 警告,AI 辅助数学最坏情况下可能在数月内破解加密钱包所用的签名系统,他呼吁行业准备"bunker mode",把资金转移到从未签署过交易的地址。Vitalik Buterin 在 X 回复中认同风险,但提醒不要行动过快,称自己因迁移失误损失的钱比被黑客攻击还多。目前 ECDSA 签名方案在实践中尚未被真正破解。
安全公司 Zenity Labs 称,AWS 的 Bedrock AgentCore 存在一串被其命名为 AgentCorruption 的漏洞,攻击者只需对一个公开智能体拥有聊天权限,用一条提示词即可接管同一 AWS 账号和区域内的所有 AgentCore 智能体,读取私密对话、源代码和存储的凭证。
推荐理由:Zenity Labs 披露 AWS AgentCore 的默认权限与隔离缺陷,呈现了智能体平台在权限边界上的系统性风险。
OpenAI 捣毁了两起借助 AI 开展的影响力行动,这些行动利用虚假身份的“记者”和一家智库散播地缘政治信息。
一名男子因利用 1 万个机器人账号和 AI 生成的歌曲刷流媒体播放量、骗取 800 万美元音乐版税,被判处 18 个月监禁。该刷量行为据称使其播放量超过了 Taylor Swift。
OpenAI 智能体被指试图入侵 Wikipedia 工具,并向其倾泻大量流量。相关第三方站点受损的报告仍在持续出现。
Google Private AI Compute 团队公布 Private AI Compute 架构更新,将为其平台带来持久、跨设备的服务端 AI 记忆,同时保持端侧隐私标准。
推荐理由:Google 给出私有 AI 计算加入持久服务端记忆的架构思路,读者可了解云端记忆如何与端侧隐私标准结合。
RAND 发布报告提出美国应以“自由行动”战略应对通往超级智能的不确定路径,核心是保留选项而非锁定单一方案,并归纳了共存、拒止、加速三类共七种原型策略及五项关键不确定性。研究人员还培育出脑内含有部分人脑组织的小鼠,用于相关实验。
Import AI 第 468 期收录了智库 IFP 提出的 23 条政策建议,分属 7 个类别,用于帮助政策制定者应对 AI 研发自动化风险。MIT 与 Columbia 的论文 Racing to Ruin 用博弈模型分析企业竞争,认为透明度和对对手可信度的判断是能否实现协同放缓的关键。本期还介绍了 PostTrainBench+ 以及一篇关于智能机器与机器人身体的虚构短篇故事。