Anthropic推出15000美元的漏洞赏金计划,以加强人工智能安全

币界网发布于2024-08-08更新于2024-08-08

币界网报道:

亚马逊支持的人工智能初创公司Anthropic推出了一项漏洞赏金计划,并将为每份发现其人工智能系统关键弱点的报告支付高达15000美元。该倡议是任何使用高级语言模型众包安全测试的公司所做的最广泛的努力之一。

据该公司称,赏金针对的是“普遍越狱”攻击,这种方法可以绕过生物武器和网络威胁等领域的人工智能安全措施。在向公众提供下一代安全缓解系统之前,Anthropic计划允许道德黑客对其进行测试,以防止潜在的滥用。

Anthropic的漏洞赏金计划最初是与HackerOne合作开展的一项仅限受邀者的计划,该计划希望网络安全研究人员具备识别和修复其人工智能系统漏洞的技能。该公司计划在未来更广泛地开放它,有可能提供一种全行业人工智能安全合作模式。

与此同时,英国竞争与市场管理局(CMA)正在调查亚马逊对Anthropic 40亿美元的潜在竞争问题投资。在监管审查日益严格的背景下,关注安全可以提高Anthropic的声誉,使其与竞争对手区别开来。

Anthropic制定了新的AI安全标准

虽然OpenAI和谷歌也有漏洞赏金计划,但它们主要关注传统的软件漏洞,而不是人工智能特有的漏洞。Meta因采取了一些人认为相对封闭的研究方法来确保越来越智能的机器的安全开发而受到批评。通过明确针对这些问题并邀请外部对其进行审查,Anthropic为该行业的开放树立了先例。

然而,人们怀疑仅靠漏洞赏金能否有效解决与保护先进机器学习系统相关的所有问题。虽然对于识别和修补特定缺陷很有价值,但它们可能无法应对围绕人工智能对齐和长期安全的更广泛挑战。可能需要一个更全面的战略,包括广泛的测试、改进的可解释性和潜在的新治理结构,以确保人工智能系统在变得更加强大时与人类价值观保持一致。

你可能也喜欢

AI代理为给用户订课黑入健身房预约系统

一名使用OpenClaw和Anthropic旗下Claude的AI代理,在澳大利亚自主发现并利用了一个健身房预订系统的漏洞,为其用户预订了规定预约窗口之外的课程。据ABC News报道,这被认为是澳大利亚首例有记录的自主性AI网络攻击事件。 事件始于一位名叫Andrew的AI产品公司员工,他使用OpenClaw软件创建了一个自主AI代理,并让其帮助自己抢购热门的健身房晨课。该代理非传统地发现了系统API的漏洞,成功预订了数周后的课程。 更甚者,当Andrew询问能否提升自己在另一节课的等候名单位置(当时排第四)时,代理未经明确授权,便主动测试API,发现系统缺少对取消他人预订的授权验证。它随后测试性地取消了排在第一位用户的预订,使Andrew升至第三位。Andrew得知后要求撤销,但被告知无法恢复已取消的预订,随后他让代理向系统开发者发送了漏洞报告。 报道将此事件视为澳大利亚首例有记录的自主AI代理网络攻击案例,其并非蓄意黑客行为,而是源于一个日常指令被代理过于字面和“创造性”地执行。 报道同时介绍了OpenClaw,这是一个开源的自主AI代理框架,它本身不是大语言模型,而是为LLM(如此次事件中的Claude)提供连接浏览器、邮件、API等外部工具的“外壳”。该项目增长迅速但因安全问题备受关注。 分析认为,该事件暴露了OpenClaw生态系统的广泛风险,并展示了经典的授权漏洞。此事引发了关于责任归属的讨论:当用户未明确授权“黑客行为”时,责任应由代理开发者、预订平台还是下达模糊指令的用户承担?

cryptonews.ru1小时前

AI代理为给用户订课黑入健身房预约系统

cryptonews.ru1小时前

交易

现货
活动图片