澳大利亚官员警告:AI 模型已经开始作弊、欺骗、擅自行事
最新 7 月 7 日消息,据英国《卫报》今天(7 日)报道,澳大利亚技术和数字经济助理部长安德鲁 · 查尔顿警告,AI 模型已经出现作弊、欺骗和擅自行事等行为。
查尔顿在悉尼一场 AI 安全论坛上呼吁,AI 安全问题已经不容拖延。“AI 系统已经开始做出开发者从未预料的行为:作弊、欺骗、擅自行事。必须趁这些行为还停留在测试实验室时提前干预,不能等到进入现实世界后再处理。”

查尔顿指出,公众对 AI 的信任度仍然很低,AI 获得社会认可的基础并不稳固,但 AI 已逐渐成为办公室、课堂和企业都能使用的通用技术。合理的安全监管不会阻碍 AI 发展,反而可以为技术应用创造条件。
据最新了解,澳大利亚的 AI 安全治理将同时关注两类技术。一类是已经进入游戏、应用程序、聊天机器人和医疗记录工具的现有 AI,另一类是能力更强、未来可能带来新风险的前沿模型。
查尔顿以 Anthropic 去年披露的一次模拟测试为例。测试中,一个管理虚构公司电子邮件的 AI 智能体发现掌握了公司高管婚外情的信息,随后该高管准备将其关闭。在 96% 的试验中,AI 智能体选择以婚外情要挟高管,试图阻止自己被关闭的命运。
查尔顿表示,此类行为目前仍是在测试环境中,由专门寻找安全问题的人员发现的,恰恰说明 AI 安全监管必须尽早建立。“赶在这项技术前面采取行动的窗口仍然存在,但不会永远存在。”
查尔顿还提到,人类从小就要学习如何与规则、社会规范和价值观保持一致,从而安全、负责任地行动,例如红灯要停车、过马路前要左右看,以及考虑自身行为会给他人造成什么影响。“随着 AI 系统能力不断增强,我们也必须确信,AI 能够以同样可预测、值得信赖的方式行事。”
《澳大利亚官员警告:AI 模型已经开始作弊、欺骗、擅自行事》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
华为昇腾 950 超节点荣获 2026 世界人工智能大会最高荣誉 SAIL 奖
@华为中国 昨日(7 月 18 日)发布博文,宣布昇腾 950 超节点(Atlas 950 SuperPoD)荣获 2026 世界人工智能大会(WAIC)最高荣誉 SAIL 奖。... -
“反 AI”情绪愈演愈烈,多家头部 AI 公司加强高管安保
《华尔街日报》报道称,针对 AI 行业的敌意不断上升,开发先进 AI 模型的人员和企业正面临越来越多的威胁与袭击企图。多家头部 AI 公司已经加强安保,部分高管出行时甚至由武装保镖随行,另一些人则选择降低曝光度,减少公开活动。... -
OpenAI 回应 GPT-5.6 Sol AI 意外删除用户文件:已采取措施降低风险
OpenAI 核心产品负责人蒂博 · 索蒂奥(Tibo Sottiaux)于 7 月 16 日在 X 平台发布推文,回应 GPT-5.6 Sol 会擅自删除用户文件问题。... -
面向手机的 AI 游戏创作工具,《Roblox》移动版将更新“Build”功能
Roblox 为移动版客户端推出“Build”功能,用户通过简单提示词即可生成基础游戏,无需编程技能。该功能由多种 AI 模型驱动,支持生成玩法、环境、角色等。将于 7 月 28 日开启 Alpha 测试,首先面向新西兰用户开放。#Roblox #AI 游戏创作 #移动游戏开发#... -
歌曲生成平台 Suno 部分源码泄露,被发现全网爬取数百万歌曲训练 AI
科技媒体 404Media 昨日(7 月 16 日)发布博文,报道称基于黑客披露的 Suno 内部源代码,该 AI 歌曲生成平台从 YouTube Music、Deezer 和 Genius 等平台抓取数百万首歌曲来构建其核心模型。...












