跳到正文
TechCrunch · AI· Aditya Mehta·· 1 天前AI 评分62

Goodfire 推出内部探针监控,拦截失控 AI 智能体

Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost

AI 导读

Goodfire 发布基于可解释性的监控方案,通过探针读取模型内部激活信号来发现失控 AI 智能体,已向 Baseten 客户开放。在 Kimi K3 测试中,监控约 100 万次交互成本约 185 美元,而用便宜模型逐步检查需 5420 美元、顶级模型约 20 万美元;探针捕获了 93% 的恶意黑客会话,并将 5.5% 的无害会话送交二次审查。

来源:TechCrunch · AI · techcrunch.com