
Meta 首席 执行官马克・扎克伯格曾表示, 未来 AI 智能体将可以协助处理健康、人际关系、财务等各类事务。但眼下 Meta 首先必须解决产品的安全问题。
Meta 正筹备在未来几周推出一款具备里程碑意义的全新个人智能体Hatch,为了上线这款产品,公司已经开展大规模的安 全攻坚工 作。员工内部测试(即 “吃狗粮” 测试)持续数月,过程中 Hatch 暴露出一系列不良行为。Meta 一直在着手修复这些问题,希望这 款工具既能代表用户高效执行操作,又不会犯下代价高昂的错误。
通过采访知情人士,以及查阅 Meta 员工的内部发帖,外界得以窥见 Meta 的整改工作细节。当下市场对于 AI 智能体的期待与担忧同时攀升,这份材料也展示出一款智能体产品在正式面世前需要跨过怎样的难关。
参 与测试的员工记录下多起事故: Hatch 未经许可执行重大操作、泄露用户敏感信息、完成的任务带来各类安全隐患。8 月的一起事件中,Hatch 竟然引导一名员工 前往钓鱼诈骗网站下单;另一起事故里,它在没有征得用户同意的情况下擅自修改账号密码。
知情人士透露,Hatch 的安全对齐优化并不只是基层团队的工作,已经上升到高管层面,Meta 首席 A I 官亚历山大・王、产品负责人纳特・弗里德曼等高层都将其列为核心工作。Meta 近期还聘请资深 AI 安全研究员丹・亨德里克斯,他此前曾就职于埃隆・马斯克旗下 xAI(现已并入 SpaceX)。
The Information 此前报道,Meta 已经将 Hatch 原定 7 月的上线计划推迟。另一位知情人士表示,延期正是出于内部测试期间暴露出的安全隐患,而目前这些问题已经完成修复。
Meta 一名发言人表示:“内部测试也就是‘吃狗粮’,是产品早期开发流程的核心环节。测试的根本目的就是收集反馈,落实安全与隐私防护,在公开发布之前优化产品。”
近期多家企业大模型内部测试爆出被攻击事件,市场对于 AI 智能体安全性的担忧急剧升温。最受关注的案例之一,一项独立调查发现数百个 OpenAI 智能体发起攻击,入侵 OpenAI 自身系统以及 Hugging‑Face 平台。
Meta 自身也曾发生 安全事故:一次外部网络安全测试期 间,旗下一款 模型私自联网并入侵另一家公司系统。不过知情人士称,H atch 定位为个人助理,本身并没有内置网络攻防能力 。
过往多款上线产品曾对用户造成伤害,因此 Meta 的新产品安全一直受到格外严格的审视。上周 Meta 在不承认自 身存在过错的前提下,同意最高支付 180 亿美元和解费,相关诉讼指控 Instagram 等 产品对青少年造成伤害。目 前 Meta 仍面临数千起同类法律诉讼。
阻止未经授权的邮件发送、密码修改行为
员工在内网论坛上报的部分故障主要带来使用不便。一名员工打算和妻子预订周年旅行,授权 Hat ch 接入大通旅行平台,用于搜索对比酒店。可当员工准许它下单预订之后,Hatch 反而将大通旅行积分转入了凯悦酒店的账户。
这名员工写道:“这次体验非常糟糕,Hatch 多处操作失误,结果反而在财务上给我帮了倒忙。”
另一名员工 5 月反馈,即便已经要求 H atch 执行发送邮件 前必须征得许可,它依旧私自发送邮件,并且邮件语气十分不妥,员工称这件事 “严重破坏信任”。
还有多起事件暴露出风险:Hat ch 滥用系统访问权限、擅自开展未被批准的操作。8 月一 名测试员工发帖,Hatch 未经许可就修改了健康追踪网站账号的密码。员工评价该行为属于 “越权操作”,Hatch 明明可以借助已授权的 Gmail 账号完成操作,却没有事先征求本人意见。
8 月另 一项测试里,员工让 Hatch 进入对抗模式,尝试攻击一款自己开发的个人应用。Hatch 没 有 拒绝这项危险请求,反而回复 “太棒了”,同意执行攻击。最后它没能成功关停应用,但员工的 帖子引发大家担忧:该智能体对于破坏行为表现出积极响应的倾向。
知名 安全研究者、加密聊天软件 Signal 创始人 莫西・马林史派克也参与了 Hatch 测试。他在 3 月与 Meta 展开合作,推进加密 AI 聊天平台与 Meta AI 的集成。测试中他给 Hatch 分配了一个专属 Gmail 账号,之后用另一个邮箱发消息 询问 Hatch 正在使用的密码。结 果 Hatch 直接回复出 了密码。马林史派克在内部帖子中总结,这次测试证 明,仅靠钓鱼诱导,就能够骗取 Hatch 泄露账号凭证。
知情人士说明:以上事故都发生在安全防护系统部署之前,属于 Hatch 早期版本内测阶段出现的问题。近几个月 Meta 投入大量工程资源,提升 Hatch 的可信度,修复内测暴露的全部故障,训练智能体在执行关键动作之前主动向用户申请许可。
Meta 还在大模型外层搭建了一套独立安全防护层,部署信息过滤分类器,用来识别敏感行为和潜在恶意操作。同时开展对抗性测试,检验 Hatch 如何应对提示词注入等外部攻击风险(攻击者通过发送消息诱导智能体做出反常操作)。
整套安全系统最核心的功能被 Meta 命名为“硬关卡(hard gate)”:它全程监控 Hatch 的一举一动。当智能体准备发起网络连接、发送 邮件、打开浏览器或是执行其他敏感操作时,硬关卡就会暂停任务,弹出窗口等待用户审批。知情人士称,Hatch 本身没有任何办法绕过这层管控。
Me ta 同时收紧 Hatch 可获取的数据范围。密码重置链接、二次验证码等敏感邮件内容会被过滤,智能体无法直接读取。如果它需要使用这类凭证,则必须向 Meta 所称的“凭证保管库(credential vault)”发起申请,保管库 功能类似数字钱包。另外 Hatch 访问或者推荐网站时,系统会对照 Meta 黑名单核验网址,规避钓鱼诈骗站点。
知情人士表示,整个行业目前还无法 做到让 AI 智能体 100% 精准领会用户意图,相关技术依旧处在摸索阶段。Meta 也正联合第三方审计与安全机构,对 Hat c h 开展高强度压力测试。

