微软发布 AI 行为准则:禁止入侵系统、欺骗人类
微软发布面向其 MAI 模型的 AI 行为准则,列出每个模型必须遵守的总体约束,且该准则优先于用户偏好和具体任务。绝对约束包括禁止网络攻击、核武器及深度伪造生产,并禁止使用自适应、欺骗、自我强化或合谋等机制逃避人类监督,确保系统可被授权人员可靠指挥、修改或关闭。
文件开头预测未来十年超级智能 AI 将在多数任务中超过人类,控制和对齐这种力量是最大挑战之一。准则同时提出一般原则,包括支持人类而非替代人类、加速人类繁荣,并将原则细化为具体安全约束。
微软 CEO Satya Nadella 在社交平台表示欢迎研究和有意识的节奏,也欢迎嵌入式评估者等机制。此次发布正值 AI 安全关注升温,微软与 Anthropic、OpenAI、xAI 一起支持对前沿开发节奏进行约束。