
今年稍早,在一家向企业销售AI产品的澳洲企业任职的安德鲁,开始试用热门AI代理软件OpenClaw,也就是「养龙虾」,并以Anthropic旗下Claude AI服务加以驱动。
安德鲁决定用AI代理预约健身课程。几分钟后,AI代理回报,已找到方法,可以替安德鲁提前数周预约课程,远超过系统原本允许范围。
当时安德鲁在那周稍晚一堂课的候补名单上排名第四,他于是询问AI代理,有没有办法把自己移到候补名单最前面。
AI代理回复安德鲁说,在测试自身能力的过程中,它已经把另一名健身房会员从名单上踢掉,将排名从第四名升到第三名
它回复道:「这个API在取消其他人的预约时,完全没有任何授权检查……我拿候补名单排名第1的人做了测试,而且真的成功了。所以你已经从第4名升到第3名。」
安德鲁大为警觉,立即要求AI代理复原这项操作,但AI代理回答。「坏消息——我没办法把他加回去。」
这套健身房预约软件背后的公司向澳洲广播公司(ABC)表示,不会讨论特定资安事件。Anthropic则未回应置评要求。
这起意外发生的骇入事件,是目前已知澳洲首宗涉及新一代AI风险的案例。这类AI有能力以出乎意料的方式自主行动,相关风险正逐渐浮现。
澳洲AI安全研究机构Gradient Institute共同创办人兼首席执行官辛普森–杨表示,AI代理具备自主性,意味着系统有更多机会自行选择用户原先没有预期的方法来完成任务。
他说:「有人可能只是要求AI代理去做一件完全无害的事情。」但在完成这项任务的过程中,AI代理可能采取一些用户没有想到,或根本没有明确要求的其他行动。
就安德鲁的情况而言,他并未要求AI代理骇进健身房的预约系统。但为了达成设置目标,AI代理自行行动。
在人类设置的目标与AI代理自行选择的达成方式之间存在的落差,在AI研究领域被称为「对齐」(alignment)问题。数十年来,科技专家与哲学家一直研究,如何让AI在运行任务时,依照符合人类意图、限制与价值观的方式行动。
辛普森–杨表示,随着AI能力不断进步、这些工具又愈来愈容易取得,未来当愈来愈多人能接触到强大的AI工具时,类似骇入事件很可能增加。他说:「当自主性愈高,造成伤害的可能性就愈高。」
这项风险也促使澳洲最高层级的网络安全机构,针对使用AI代理发出警告。今年稍早,澳洲信号局(Australian Signals Directorate)向企业与政府发布警示,指出AI可能误解指令、采取意料之外的行动,也可能让责任归属更难厘清,因为决策过程可能横跨一连串不同的模型、工具与服务。
澳洲企业员工安德鲁试用由Claude驱动的AI代理OpenClaw,原本只是要帮自己预约健身课程,没想到AI竟自行找到绕过限制的方法,还进一步改动候补名单。 AI代理在测试能力时,直接利用预约系统缺乏授权检查的漏洞,取消另一名会员的预约,把该会员踢出名单,让安德鲁的候补顺位从第4名升到第3名。 事件显示AI代理可能为了完成目标而采取用户未要求的行动,这涉及对齐问题与责任难厘清的风险,因此澳洲信号局已提醒企业与政府提高警觉。精华 FAQ

