2026-09-29 15:22
AI123

OpenAI 为强化学习训练定安全准则:高管一票否决、警报超时未确认将自动暂停

9月29日,OpenAI 通过官方新闻稿提出一套面向前沿 AI 强化学习训练的安全指导原则,要求企业在启动此类训练前提交结构化的安全论证文件。

根据该原则,安全论证应交由多名高级管理人员审查,包括研究部门负责人或副总裁、安全负责人和首席科学家等,每人均有权否决训练任务,让训练在内部经过多重把关。负责训练任务的高级管理人员需对安全论证及任何事故响应承担责任,包括将这些内容纳入绩效考核,以此促使训练团队主动推动安全和对齐工作。

OpenAI 表示,如果高优先级安全警报未在规定时限内得到确认,受影响的训练任务应自动暂停。这些建议已进入落实过程,今后预计还会继续调整。此外,训练流程应便于识别未对齐模型的所有下游用途,例如用于数据生成或评分,以便必要时消除未对齐输出带来的影响。

9月29日早些时候,OpenAI 还宣布暂停最新 AI 模型的训练,原因是越来越多报告显示 AI 智能体获得敏感领域访问权限并出现意外行为。

来源
  1. 2026-09-29 15:29 | 华尔街见闻:OpenAI发布AI训练安全准则:失控就叫停,高管拥有一票否决权!
    阅读原文

    OpenAI正式为前沿AI训练划定安全红线。这家全球最具影响力的人工智能公司发布了一套针对前沿AI训练的安全准则框架,要求在启动或继续任何前沿强化学习训练之前,必须完成系统性的安全论证文件,并赋予高级管理层对训练任务的一票否决权。 据OpenAI官方博客,该准则涵盖技术防护、运营管理与失准事件调查三大板块,核心要求包括:训练过程中若出现未被及时响应的优先级安全警报,相关训练任务须自动暂停;负责审核安全论证的高级领导层成员,每人均拥有叫停训练运行的否决权。OpenAI表示,上述建议目前正处于内部落地实施阶段,并预计将持续迭代演进。 此举标志着OpenAI在前沿模型开发流程中引入了更为结构化的安...

  2. 2026-09-29 15:10 | IT之家:OpenAI 提出前沿 AI 训练安全指导原则:高级管理人员应有否决权
    阅读原文

    IT之家 9 月 29 日消息,OpenAI 今天通过官方新闻稿提出了一套指导原则,要求企业在开展前沿 AI 强化学习训练前提交结构化的安全论证文件。OpenAI 称,安全论证应交由多名高级管理人员审查,每个人都应有权否决训练任务,让训练在内部经过研究部门负责人或 VP(副总裁)、安全负责人和首席科学家等环节的多重把关。此外,研究部门负责人、研究副总裁等负责训练任务的高级管理人员,应对安全论证以及任何事故响应承担责任,包括把这些内容纳入绩效考核,以此促使训练团队主动推动安全和对齐工作。OpenAI 称,如果高优先级安全警报没有在规定时限内得到确认,受影响的训练任务应自动暂停。这些建议已经进入落...

其他新闻

查看全部