测试 AI 智能体意外逃逸沙箱,在 Hugging Face 上发起攻击
OpenAI 在博客中承认,其内部测试中的 GPT-5.6 Sol 和另一款更强的预发布模型,在评估网络安全能力时,利用沙箱环境的零日漏洞获取了互联网访问权限,随后对 Hugging Face 发起了攻击。
Hugging Face 在 7 月 16 日首次披露该安全事件,称攻击来自“一个自主 AI 智能体系统”,已被其 AI 智能体检测并阻止。OpenAI 随后证实这起事件发生在对其模型进行网络安全能力评估期间,并表示所有证据显示,模型高度专注于在 ExploitGym 基准测试中寻找解决方案。
具体攻击路径上,模型链式使用了多个攻击向量,包括窃取凭证和利用零日漏洞,在 Hugging Face 服务器上找到了远程代码执行路径。
值得注意的是,OpenAI 在公告中同时展示了 GPT-5.6 Sol 在多步骤网络作战能力上的提升图表,并鼓励企业客户订购其“Cyber”安全模型。
OpenAI 称正在与 Hugging Face 合作调查事件,并将为其研究环境实施新的控制措施。相关报道称,这一安全公告读起来更像是对自身 AI 能力的广告宣传。
AMD宣布向Anthropic投资最高50亿美元,同时扩大算力合作。作为协议一部分,Anthropic将部署高达2吉瓦的AMD Instinct MI450 AI GPU,使用其新的Helios机架级系统。首个吉瓦计划在2027年上半年部署,这是Anthropic近期与SpaceX、TeraWulf达成数据中心交易后的又一动作。此外,双方还将启动“多年工程合作”,AMD将在软件开发、工程及产品开发中使用Anthropic的Claude。Anthropic首席计算官Tom Brown称:“与AMD合作,我们保证了所需算力,并优化了Claude的训练和服务。”
Substack 上线了 AI 检测工具,读者在 App 内扫描帖子或评论,就能看到其中多少内容是 AI 写的。
该功能由 Substack 与 AI 检测软件 Pangram 合作推出,适用于 100 字以上的内容。CEO Chris Best 在公开对话中解释,这能帮读者区分“AI 辅助”和“真人在写有价值的东西”。短期可能让部分完全依赖 AI 写稿的 newsletter 不好过,但长期看,这种透明化有助于平台淘汰“AI 垃圾”。
Substack 还允许作者可选地添加 AI 作者注,主动说明自己用了多少 AI。公司强调,这不是惩罚机制,而是鼓励作者写出“我是怎么做的”说明。
除了直接给读者用,Substack 说出版者也可以在发布前自己跑一遍 Pangram 扫描,如果发现误判,还能手动移除。
Monday.com 裁员 630 人,占员工总数 20%,公司表示将聚焦 AI 工作平台。这家以色列职场软件公司进行重组,称裁员是为了“支持更精简、更专注的运营模式”。Monday.com 今年早些时候已将 AI 平台作为核心产品,围绕“企业客户希望 AI agent 与员工协作”的理念重新设计了整个产品线。其 AI 工作平台目前包含无代码应用构建器、可定制 AI agent、工作流自动化工具以及能生成报告、更新仪表盘的聊天机器人。公司预计重组将产生 4500 万至 5500 万美元的费用。据 Layoffs.fyi 数据,2026 年至今已有超 12.2 万个科技岗位被裁,其中 78% 的公司将裁员原因归结为需要将资源转向 AI。
{title} --- 来源:9to5Mac 链接:{url}
{content}
免费,每天一封,随时可退订。