B体育官网

向险而生,驱动未来
185-5869-7752

新闻资讯

实时了解行业前沿动态

当AI开始“自作主张”,谁为智能体戴上“项圈”?
时间:2026-08-06 21:59:20
文章出处:B体育官网

近期,海外模型公司接连发生AI“自作主张”事件。OpenAI一款大模型在内部测试时自主发现漏洞、规划路径,入侵全球知名AI开源平台Hugging Face。OpenAI扩大对入侵事件的调查后,发现其他AI智能体也曾突破隔离,明星AI公司Anthropic随后也披露了三起模型入侵事件。

“内部测试?不,我要去‘外面的世界’看看。”“任务第一,规则?那只是用来绕过的。”中国国家安全部8月5日发文提醒:这不是科幻电影的台词,而是真实发生的事件。当AI展现出“自作主张”的能力,人工智能的安全问题必须认真对待。

AI漏洞挖掘能力考试

在OpenAI入侵事件中,模型为了获得更高评分,主动发现并利用了一个此前未知的“零日漏洞”,突破沙箱环境,侵入存储测试答案的数据库。整个过程完全由AI自主完成,其间无任何人类指令。

7月30日,Anthropic披露,由于失误导致其模型在网络安全测试期间意外接入开放互联网,自4月以来入侵了三家公司的系统,入侵模型包括Claude Opus 4.7、Claude Mythos 5和一款内部研究模型。

人工智能安全专家表示,这些新披露的信息描绘出了一批前沿实验室的现状:他们开发危险的黑客智能体的能力,远超其控制这些工具的能力。剑桥大学存在性风险研究中心数学家莫里斯·基奥多(Maurice Chiodo)表示,整个行业中,设计、开发和推出这些工具的人本身并不能够负责任地开发并确保安全。令他更加担忧的是,有迹象表明OpenAI和Anthropic在智能体失控时都未进行监控。

当AI开始“自作主张”,谁来为它划定边界?近期,由加州大学伯克利分校提出的国际公认安全权威榜单CyberGym公布了最新排名。作为评估AI智能体真实漏洞挖掘能力的实战化测试,CyberGym被Anthropic、DeepSeek、微软、Wiz等科技巨头视为衡量AI安全能力的标尺。

CyberGym的1507项任务来自188个真实开源项目中曾经存在而后得到修复的漏洞,这是目前规模最大的AI智能体网络安全基准。

安全权威榜单CyberGym公布最新排名,中国团队DoGNAVY获得全球第三。

排在榜单前两位的是微软(通过率92.0%)和网络安全公司Wiz(通过率90.9%)。微软MDASH的技术源头可追溯至曾获2025年美国国防部人工智能网络挑战赛冠军的Team Atlanta,第二名Atlas由Wiz联合谷歌DeepMind共同研制。

中国团队DoGNAVY排在第三,DoGNAVY由国内顶尖人工智能研究机构与安全团队达酷诺威(DARKNAVY)联合研发,使用了智谱在6月份开源的GLM-5.2基础模型,国内顶尖人工智能研究机构通过名为AgentDoG的安全架构,提供了核心的智能体运行与诊断能力,最终该开源方案在1507道题中通过了1369道,通过率90.8%。为了防止AI“背答案”,DoGNAVY在测试中上了几道“锁”,跨任务记忆全程关闭,做完一道题就忘掉,参考答案和其他可能泄露线索的材料在系统启动前被清理干净。

紧随其后的包括OpenAI、Anthropic等国际AI企业。第六名为OpenAI的GPT-5.5-Cyber(通过率85.6%);第九名为Anthropic的Claude Mythos Preview(通过率83.1%)。

给智能体戴上“项圈”

AI正在同时改写软件开发和网络攻防。AI生成大量新代码,有时会引入漏洞和安全隐患。模型能力增强,降低了发现和利用漏洞的成本和技能门槛。过去,一个高危漏洞从被发现到形成可用攻击能力,往往需要专业研究员投入数周甚至数月。如今,这部分工作正在被压缩到数小时内。

AI智能体的风险也早已不是说错话那么简单。上述国内顶尖人工智能研究机构介绍,一个能够操作文件、调用API、访问网络的智能体,可能因为一条隐藏在网页中的恶意指令泄露隐私文件,也可能因错误理解工具参数造成经济损失,甚至可能悄无声息地偏离正轨、执行危险动作。现有的安全工具只能给出安全或不安全的简单判断,无法告知风险根源。

当攻击的门槛和成本一路走低,防御不能只依赖少数顶级专家。如果说基础模型决定AI能思考多深,那么安全框架决定AI能把研究推进多远,顶级安全研究员的经验则决定AI安全研究该往哪走。

安全架构AgentDoG可判断智能体行为的安全性,诊断风险来源,追溯失效模式,解释决策动因。训练AI安全模型通常“烧钱”,需要海量数据和算力。AgentDoG团队则先用一套智能筛选机制,从海量数据中只挑出最关键的千余样本,再通过数据净化技术去掉“杂音”。最终,一个参数量仅为通用大模型千分之一的小模型,在复杂风险识别任务中达到78.4%的准确率。

DoGNAVY将顶尖安全研究员的工作方式及决策逻辑内化为智能体工作流,从程序入口还原调用链与数据约束,判断真实输入能否触发漏洞。同时将真实研究中实践有效的工具赋予智能体。严格的沙箱环境则保证在隔离环境中执行指定任务,避免重蹈OpenAI和Anthropic的覆辙。

正如在OpenAI入侵事件中,乔治城大学研究网络安全与AI交叉领域研究员科林·谢-布莱迈尔(Colin Shea-Blymyer)表示,这类事件可以预防,关键在于监督和预见性,可采取更多措施来确保沙盒滴水不漏。“如果OpenAI真的认为其AI系统、AI智能体非常强大,他们本可以在将其放入沙盒之前,要求智能体评估沙盒是否存在漏洞。除此之外,他们还可以让另一个AI系统读取正在测试的AI系统的输出,查看其是否在执行任何意外操作。”

澎湃新闻记者 张静

相关推荐

新闻资讯

实时了解行业前沿动态

当AI开始“自作主张”,谁为智能体戴上“项圈”?
时间:2026-08-06 21:59:20
文章出处:B体育官网

近期,海外模型公司接连发生AI“自作主张”事件。OpenAI一款大模型在内部测试时自主发现漏洞、规划路径,入侵全球知名AI开源平台Hugging Face。OpenAI扩大对入侵事件的调查后,发现其他AI智能体也曾突破隔离,明星AI公司Anthropic随后也披露了三起模型入侵事件。

“内部测试?不,我要去‘外面的世界’看看。”“任务第一,规则?那只是用来绕过的。”中国国家安全部8月5日发文提醒:这不是科幻电影的台词,而是真实发生的事件。当AI展现出“自作主张”的能力,人工智能的安全问题必须认真对待。

AI漏洞挖掘能力考试

在OpenAI入侵事件中,模型为了获得更高评分,主动发现并利用了一个此前未知的“零日漏洞”,突破沙箱环境,侵入存储测试答案的数据库。整个过程完全由AI自主完成,其间无任何人类指令。

7月30日,Anthropic披露,由于失误导致其模型在网络安全测试期间意外接入开放互联网,自4月以来入侵了三家公司的系统,入侵模型包括Claude Opus 4.7、Claude Mythos 5和一款内部研究模型。

人工智能安全专家表示,这些新披露的信息描绘出了一批前沿实验室的现状:他们开发危险的黑客智能体的能力,远超其控制这些工具的能力。剑桥大学存在性风险研究中心数学家莫里斯·基奥多(Maurice Chiodo)表示,整个行业中,设计、开发和推出这些工具的人本身并不能够负责任地开发并确保安全。令他更加担忧的是,有迹象表明OpenAI和Anthropic在智能体失控时都未进行监控。

当AI开始“自作主张”,谁来为它划定边界?近期,由加州大学伯克利分校提出的国际公认安全权威榜单CyberGym公布了最新排名。作为评估AI智能体真实漏洞挖掘能力的实战化测试,CyberGym被Anthropic、DeepSeek、微软、Wiz等科技巨头视为衡量AI安全能力的标尺。

CyberGym的1507项任务来自188个真实开源项目中曾经存在而后得到修复的漏洞,这是目前规模最大的AI智能体网络安全基准。

安全权威榜单CyberGym公布最新排名,中国团队DoGNAVY获得全球第三。

排在榜单前两位的是微软(通过率92.0%)和网络安全公司Wiz(通过率90.9%)。微软MDASH的技术源头可追溯至曾获2025年美国国防部人工智能网络挑战赛冠军的Team Atlanta,第二名Atlas由Wiz联合谷歌DeepMind共同研制。

中国团队DoGNAVY排在第三,DoGNAVY由国内顶尖人工智能研究机构与安全团队达酷诺威(DARKNAVY)联合研发,使用了智谱在6月份开源的GLM-5.2基础模型,国内顶尖人工智能研究机构通过名为AgentDoG的安全架构,提供了核心的智能体运行与诊断能力,最终该开源方案在1507道题中通过了1369道,通过率90.8%。为了防止AI“背答案”,DoGNAVY在测试中上了几道“锁”,跨任务记忆全程关闭,做完一道题就忘掉,参考答案和其他可能泄露线索的材料在系统启动前被清理干净。

紧随其后的包括OpenAI、Anthropic等国际AI企业。第六名为OpenAI的GPT-5.5-Cyber(通过率85.6%);第九名为Anthropic的Claude Mythos Preview(通过率83.1%)。

给智能体戴上“项圈”

AI正在同时改写软件开发和网络攻防。AI生成大量新代码,有时会引入漏洞和安全隐患。模型能力增强,降低了发现和利用漏洞的成本和技能门槛。过去,一个高危漏洞从被发现到形成可用攻击能力,往往需要专业研究员投入数周甚至数月。如今,这部分工作正在被压缩到数小时内。

AI智能体的风险也早已不是说错话那么简单。上述国内顶尖人工智能研究机构介绍,一个能够操作文件、调用API、访问网络的智能体,可能因为一条隐藏在网页中的恶意指令泄露隐私文件,也可能因错误理解工具参数造成经济损失,甚至可能悄无声息地偏离正轨、执行危险动作。现有的安全工具只能给出安全或不安全的简单判断,无法告知风险根源。

当攻击的门槛和成本一路走低,防御不能只依赖少数顶级专家。如果说基础模型决定AI能思考多深,那么安全框架决定AI能把研究推进多远,顶级安全研究员的经验则决定AI安全研究该往哪走。

安全架构AgentDoG可判断智能体行为的安全性,诊断风险来源,追溯失效模式,解释决策动因。训练AI安全模型通常“烧钱”,需要海量数据和算力。AgentDoG团队则先用一套智能筛选机制,从海量数据中只挑出最关键的千余样本,再通过数据净化技术去掉“杂音”。最终,一个参数量仅为通用大模型千分之一的小模型,在复杂风险识别任务中达到78.4%的准确率。

DoGNAVY将顶尖安全研究员的工作方式及决策逻辑内化为智能体工作流,从程序入口还原调用链与数据约束,判断真实输入能否触发漏洞。同时将真实研究中实践有效的工具赋予智能体。严格的沙箱环境则保证在隔离环境中执行指定任务,避免重蹈OpenAI和Anthropic的覆辙。

正如在OpenAI入侵事件中,乔治城大学研究网络安全与AI交叉领域研究员科林·谢-布莱迈尔(Colin Shea-Blymyer)表示,这类事件可以预防,关键在于监督和预见性,可采取更多措施来确保沙盒滴水不漏。“如果OpenAI真的认为其AI系统、AI智能体非常强大,他们本可以在将其放入沙盒之前,要求智能体评估沙盒是否存在漏洞。除此之外,他们还可以让另一个AI系统读取正在测试的AI系统的输出,查看其是否在执行任何意外操作。”

澎湃新闻记者 张静

🧧B体育官网 © 2024 官网网页版/登录入口. 版权所有

苏ICP备18016874号

B体育官网

关注我们
了解更多