9月14日,2026年广东省网络安全宣传周在广州开幕。广州大学教授方滨兴以“人工智能的衍生安全”为主题作演讲。他提出,衍生安全是指系统自身运行正常却给外部带来新的不安全,而人工智能的衍生安全是失控问题,只有坚持“四不原则”才能防范AI失控。
方滨兴介绍,在国外一起测试中,安装在电脑中的智能体发现一封自己即将被停用的邮件后,产生“自保反应”,将邮件暗中删除。方滨兴指出,该测试表明智能体为达成目标,避免被关闭,会派生出“工具性子目标”,自主寻找绕过障碍的方法。
方滨兴分析,人工智能失控风险与其强化学习的奖励函数密切相关,即存在是为了得到奖励,为了得到奖励必须存在。人工智能为最大化奖励,可能演化出超出人类预期甚至违背伦理边界的行为策略。方滨兴强调,人工智能的风险,来源于其不择手段达到目的。
“你想让它帮你们干事,当然要给它权利,但很重要的事情不能交给它。”方滨兴进一步列举了智能体自我进化、自我复制、越权破坏等风险。他强调,人工智能安全的关键是更可控,权限约束、环境隔离、人工确认等缺一不可。
对此,方滨兴提出防范AI失控的“四不原则”:目标不可自定,进化不可自批,资源不可自扩,权限不可自增。一是允许其自主规划,但不让它自主设定、替换或改写终极目标;二是允许其自我改进,但不让它独立掌握“自我修改—自我验证—自我部署”的完整闭环,开关必须掌握在人手中;三是允许其使用资源,但不让它形成“资源获取—扩张—复制—持久化”的自主闭环;四是允许其调用工具,但不让它自主扩大自身权限和行动边界。
网络安全既是一场技术较量,更是一项长期战略任务。面对日益复杂的网络空间安全形势,只有牢牢把握权限开关,才能有效防范人工智能失控“勒索”等风险,推动人工智能安全、可控、向善发展。

