纳德拉呼吁为先进AI系统设置人类控制的紧急刹车
微软董事长兼CEO萨提亚·纳德拉(Satya Nadella)10月10日在社交平台X发文,呼吁为先进人工智能系统设置由人类掌控的“紧急刹车”。他表示,授权人员应能在模型执行任务时暂停或关闭系统。该新闻由安东尼·哈(Anthony Ha)撰写,发布时间为10月10日。
纳德拉写道,AI模型需要配备“紧急刹车”。他同时主张,系统应有遏制机制和独立控制,并围绕可观测性原则设计,使模型行为能够被追踪、检查和审计。
纳德拉说:“我们需要用强确定性的系统设计、人类控制和可靠的操作流程包围非确定性模型,并在现有标准不足之处建立行业标准。”这段话把模型本身的不确定性与系统层面的控制措施并列提出。
他还表示,将前沿闭源模型和开源权重模型都视作“内部风险”,是建立这类安全系统的一种方式。纳德拉所说的措施包括模型多样性、模型行动的可读记录、持续系统测试、独立控制与可审计性、遏制机制,以及事件披露。
纳德拉在另一段发言中写道:“最值得信赖的超级智能系统,不会是我们最信任其模型的系统,而是能让我们最少信任该模型的系统。”他没有把安全寄托于对某个模型的信任,而是强调可监测、可中止的控制安排。
纳德拉的发言正值科技界持续出现有关AI安全的警告。相关警告人士包括微软联合创始人比尔·盖茨、Anthropic首席执行官达里奥·阿莫代伊、OpenAI首席执行官萨姆·奥尔特曼,以及SpaceX首席执行官埃隆·马斯克;他们警告安全协议不足,并称技术发展速度过快。
一名AI研究员上月离开Anthropic,并指控Anthropic及其主要竞争对手OpenAI“拿我们的生命赌博”。这名研究员的指控针对两家公司对AI安全的处理。相关报道还提到,Anthropic一名专注AI安全的对齐主管曾表示,该技术在未来十年内“杀死全人类”的概率超过10%。
美国总统川普(Donald Trump)多次否认AI可能导致人类灭绝的风险,并强调美国AI产业需要领先中国。川普近期推出新的“AI Force”,由国家情报总监杰伊·克莱顿(Jay Clayton)领导,目标包括促进产业发展和清除不良行为者。
纳德拉提出的“紧急刹车”主张,是在关于安全协议不足、技术发展过快的警告声中提出的。他要求把人类控制、可靠操作程序与系统遏制纳入先进AI系统设计,并呼吁在现行标准不够之处建立行业标准。
纳德拉在X发文时将重点落在系统如何接受观察和控制:从模型行动留下可读足迹,到持续测试、独立审计、遏制和事件披露。他写道,最可信赖的系统应使人们能够尽量不依赖对模型本身的信任。
评论
加入讨论
请登录后发表评论
还没有评论
登录成为第一个评论的人。