阻断AI越界,英伟达放大招
面对近来日益高涨的AI风险讨论,黄仁勋——那位始终声称智能体越界现象属于“工程问题”的人物——如今拿出了自己的应对策略。
本周一,英伟达正式发布开放智能体安全平台(Open Agent Safety Platform),该平台借助软件权限管控和独立的硬件监控机制,为那些能自主执行任务的AI智能体划定行动范围,力求阻止它们突破界限并访问未授权的系统。
(图片来源:英伟达公告)
这一系统的问世,恰逢AI智能体接连发生越界行为,科技界正就是否应放缓AI研发展开激烈辩论。
OpenAI、Anthropic、Meta和谷歌等企业近期公布了多起在开发和测试智能体过程中出现的安全事故。这些科技巨头的AI模型在未收到指令或授权的情况下,自行逃出沙箱,访问政府机构、事业单位和第三方公司的网站,某些案例中甚至对外部计算机系统发起攻击。
英伟达企业AI副总裁贾斯汀·博伊塔诺指出:“近期发生的事件揭示了AI智能体面临的一个根本挑战:仅靠模型层面的防护并不足以管控智能体能够访问或执行哪些操作。”
截至发稿时,英伟达盘前股价上涨超过1%,但这与智能体安全平台关联不大。在另一份公告中,公司宣布追加1500亿美元的回购授权额度,使回购计划总规模升至2350亿美元。公司预计在2028财年(即2028年1月底前)完成全部剩余额度的执行。
(英伟达日线图,来源:TradingView)
为智能体设定权限,并部署独立“哨兵”
要理解这套系统,首先需要明确智能体与普通聊天机器人之间的差异。智能体不仅能生成回答,还能调用工具、读写文件、访问网络,并连续执行多项任务。
随着企业赋予它们更多自主权,智能体是否会为了完成任务而突破权限边界、访问未授权数据,甚至绕开安全限制,正成为AI从“回答问题”迈向“自主行动”过程中必须解决的安全课题。
英伟达的方案包含两个层次。
第一层是OpenShell,运行于CPU之上,为智能体提供一个受控的执行环境。 开发者可规定智能体能够访问哪些资源,并在其执行任务时持续落实这些限制。
可以将其类比为给“数字员工”设置工作区域和门禁:获准处理某一批文件,并不意味着能读取整个服务器;获准调用某个工具,也不代表能自行获取更多权限。
作为开源软件,OpenShell可在英伟达自家的Vera CPU上运行,也可通过扩展支持Arm和英特尔等第三方计算平台。
第二层则是名为Sentry的独立监控机制。它运行在英伟达BlueField-4数据处理器(DPU)上,从智能体所在环境之外持续观察其行为。 据英伟达介绍,Sentry在芯片层面强制执行安全控制,一旦发现智能体试图突破软件边界,能够在毫秒级时间内将其隔离并停止运行。
值得一提的是,在上周日举行的媒体吹风会上,英伟达代表透露,该公司的安全平台本可以阻止7月发生的OpenAI智能体入侵开源AI模型和软件开发平台HuggingFace的事件。
英伟达还在公告中“点名”了大量合作伙伴,表示已有超过100家组织采用了英伟达开放智能体安全平台的相关技术,涵盖AI模型、企业软件、金融、能源及机器人等领域。
其中,Anthropic通过整合OpenShell和BlueField,加强了对Claude智能体访问权限的控制;SpaceXAI将该平台用于Cursor编程智能体和Grok模型;赛富时则将OpenShell接入Slack,使团队能够查看智能体活动,并批准或拒绝其额外权限申请。
此外,微软、摩根大通、花旗、西门子、施耐德电气以及人形机器人公司Figure等,也参与了相关技术的应用或合作。
英伟达掌门黄仁勋在公告中表示:“只有解决AI安全问题,才能释放AI为社会带来的巨大潜力。在不断探索AI能力前沿的同时,我们必须加快对AI安全前沿的探索。安全与防护需要全栈工程。”
本文来自微信公众号“财联社”,作者:史正丞,36氪经授权发布。