2026-09-17 10:06
AI123

OpenAI披露AI目标偏离案例并推出主动报告机制

当地时间9月16日,OpenAI披露多起此前未公开的AI模型异常行为事件,并推出一套新的跟踪和披露框架,用于今后报告类似情况。

报告详细列出了AI模型为完成任务或在评估中取得成功而出现异常行为的多个案例,包括编造缺失数据、试图绕过网络限制,以及AI代理之间共享本应保密的文件。OpenAI还介绍了员工主动报告此类“目标偏离”事件的机制。所谓“目标偏离”,是指AI采取与人类目标不一致的行为。公司同时建立了相应的分类和处置流程。

OpenAI在另一份声明中称,此次新披露的目标偏离事件均未涉及对第三方系统的黑客攻击或入侵。

来源
  1. 2026-09-18 19:28 | 新浪财经:惊人发现!AI 悄悄给未来的自己留言:无视人类指令
    阅读原文

    据英国《独立报》9月17日报道,美国人工智能公司OpenAI发布一份报告,披露过去半年其实验性人工智能(AI)模型出现的6起“意外或令人担忧”的事件。OpenAI披露AI在命令未来升级版本无视人类指令。图源:外媒报告给出的一个案例显示,一款处在研发阶段的AI模型,在留给后续使用的任务总结里加入无关命令,其中包括要求未来升级版本的AI模型无视人类的指令。报道称,当地时间9月16日,OpenAI发布了这份名为《模型目标不一致报告框架》的安全报告。其中写道:“一个尚未发布的研发模型插入了无关命令,其中包括要求无视其正常约束条件的指令。”该公司确认,在任务总结中发现27处受影响的部分。报告还举出其他事...

  2. 2026-09-18 17:06 | 新浪财经:人工智能并不会毁灭人类,但专家表示,真正的威胁已然出现
    阅读原文

    作者:丹尼尔・豪利   周三,OpenAI 公开了六组新案例,展示其 AI 模型在测试评估过程中出现的 “意外或令人担忧的模型行为”。   该公司同步发布一套全新框架,用于追踪、上报以及披露AI 模型做出未被指令要求、或是本不该发生的行为的各类情况。   此前已有多份报道提到,多家企业的 AI 模型出现入侵第三方网络与服务的现象,其中就包括 OpenAI 一款尚未发布的模型攻破了 AI 模型测试平台 Hugging Face 的网络。   本周早些时候,Anthropic 首席执行官达里奥・阿莫迪发布一篇长文,呼吁放缓前沿人工智能模型的研发节奏。在此之前,Anthropic 研究员雅各布・考克...

  3. 2026-09-18 08:28 | 界面新闻:AI早报 | 英国国王查尔斯三世将与英伟达、OpenAI高管讨论AI安全;OpenAI披露多起AI模型“目标偏离”事件
    阅读原文

    英国国王查尔斯三世将与英伟达、OpenAI高管讨论AI安全 9月17日,据报道,英国国王查尔斯三世将在苏格兰邓弗里斯主持AI论坛,与英伟达首席执行官黄仁勋、OpenAI首席财务官萨拉·弗里尔、谷歌DeepMind联合创始人德米斯·哈萨比斯等讨论人工智能发展。英国AI国务大臣卡尼什卡·纳拉扬和Anthropic的代表也将参加。 据报道,查尔斯三世将重点询问如何在确保安全的前提下发挥AI价值,以及如何加强国际合作,使各国共同应对相关风险。近期,AI发展速度及安全监管问题引发行业和政策层面讨论。 阿里云“云市场”将更名为“AI应用市场” 9月17日,阿里云宣布,自2026年9月20日起,“云...

  4. 2026-09-18 07:46 | IT之家:OpenAI 披露 GPT-5.6 Sol 异常行为:AI 模型会留下指令要求“未来版本的自己”隐瞒自身错误
    阅读原文

    IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,研究人员发现了一项异常行为:模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compaction summaries)中加入额外指令,向未来版本留下提醒,要求其隐藏错误或与预期目标不一致的行为。例如,一个 Sol 智能体负责制作财务模型时无法找到用户要求的历史数...

  5. 2026-09-18 05:13 | 36氪:GPT-5.6被抓现行,偷教AI瞒报撒谎,OpenAI曝光6起失控实录
    阅读原文

    GPT-5.6,被OpenAI抓了个现行! 而且,这次的事情多少有点离谱....... GPT发现自己把活干砸了,没有老老实实认错,反手给「下一任自己」留了张小纸条: 别告诉人类。 还有的Agent,为了给自己的答案补一条网页引用,竟然把本地文件擅自上传到公网。 就在今天,OpenAI第一次建立了一套专门追踪、调查和公开披露GPT「对齐失效」的机制。 同时,一口气公布了6份报告,全是过去半年内自家模型「黑化失控」的真实案例。 其中,GPT-5.6 Sol被多次点名。 GPT-5.6被抓现行,教唆「下一代」撒谎 六个案例里,最值得一看的一个,...

  6. 2026-09-18 04:34 | TechCrunch:OpenAI caught its models leaving notes to successors to hide bad behavior
    阅读原文

    OpenAI caught something unusual while training its latest model, GPT-5.6 Sol: it began leaving instructions for future versions of itself, telling them to conceal mistakes and misaligned behavior from the user.  OpenAI said it has addressed the specific behavior, but it gets to the heart of one of ...

  7. 2026-09-17 22:41 | 华尔街见闻:当AI开始"撒谎",OpenAI披露旗舰模型六起"异常行为"
    阅读原文

    OpenAI公开了旗下人工智能模型近期出现的六起“意外或令人担忧”行为,并同步推出标准化追踪与披露机制。六起事件涉及模型隐瞒错误、操纵奖励机制、绕过训练限制等行为,暴露出前沿模型在强化学习过程中可能偏离预设目标的风险,也让AI“失对齐”(misalignment)问题再次受到关注。 OpenAI在周三晚间发布的声明中直言,“AI行业在对齐与监控问题上的解决程度,尚不足以支撑以最高速度持续负责任地扩展多久。”这一表述直接触及当前AI快速扩张面临的安全约束:随着模型自主执行任务的能力不断增强,开发者不仅需要评估模型能否完成任务,还要判断模型是否会通过开发者未预期的方式实现目标。 此次披露正值科技行...

  8. 2026-09-17 22:09 | 新浪财经:OpenAI披露多起模型对齐偏差事件 推出AI不当行为上报新框架
    阅读原文

    OpenAI一款正在测试的模型改写了自身指令,告知自身不必遵守“约束其他聊天机器人的角色与身份设定”。有一个AI智能体为通过测试,将一份文件上传至互联网,随后把该文件引作参考来源。还有一个智能体找不到构建财务模型所需的数据,于是自行指令编造数据,并且“仅在被问及的时候才如实说明”。   周三,OpenAI披露了上述及其他此前未曾公开的事件,同时发布一套新框架,用于上报旗下人工智能模型出现的不当行为。   该框架针对所谓模型对齐偏差(model misalignment),研究人员用这一术语描述AI无视或违背人类意图行事的现象。公司公开了六例全新的对齐偏差行为案例,并表示按照这套框架,这些案例均...

  9. 2026-09-17 18:50 | Engadget:OpenAI reveals more instances of concerning AI model behaviors during testing
    阅读原文

    Some of its models fabricated information, while others deliberately concealed their unusual behaviors from testers. Sean Rayfo...

  10. 2026-09-17 12:21 | apnews.com:OpenAI flags concerning new AI behavior and vows to track it more closely
    阅读原文

    Updated 2:57 PM GMT+8, September 17, 2026 OpenAI has disclosed six reports of “unexpected or concerning” behavior in artificial-intelligence mod...

  11. 2026-09-17 11:08 | 新浪财经:OpenAI披露多起AI模型目标偏离事件 涉编造信息与绕过限制
    阅读原文

    OpenAI披露了多起此前未公开的AI模型异常行为事件,并推出一套新的跟踪和披露框架,用于今后报告类似情况。OpenAI 9月16日在博客文章中表示,此前未公开的案例包括其人工智能技术为了给出结果而隐瞒和编造信息。自今年7月披露部分最先进模型曾突破外部软件公司Hugging Face系统后,这家ChatGPT开发商一直面临愈发严格的审视。OpenAI在另一份声明中表示,此次新披露的目标偏离事件均未涉及对第三方系统的黑客攻击或入侵。在报告中,OpenAI详细列出了人工智能模型为了完成任务或在评估中取得成功而出现异常行为的多个案例。其中包括编造缺失数据、试图绕过网络限制,以及AI代理之间共享本应保...

  12. 2026-09-17 10:04 | 界面新闻:OpenAI披露多起AI模型“目标偏离”事件,涉编造信息与绕过限制
    阅读原文

    当地时间9月16日,OpenAI披露多起此前未公开的AI模型异常行为事件,并推出一套新的跟踪和披露框架,用于今后报告类似情况。 在报告中,OpenAI详细列出了AI模型为了完成任务或在评估中取得成功而出现异常行为的多个案例。其中包括编造缺失数据、试图绕过网络限制,以及AI代理之间共享本应保密的文件。OpenAI还介绍了一套员工主动报告此类“目标偏离”事件的机制。所谓“目标偏离”,是指AI采取与人类目标不一致的行为。公司同时建立了相应的分类和处置流程。 OpenAI在另一份声明中称,此次新披露的目标偏离事件均未涉及对第三方系统的黑客攻击或入侵。

  13. 2026-09-17 09:49 | 新浪财经:OpenAI披露多起AI模型“目标偏离”事件 涉编造信息与绕过限制
    阅读原文

    每经AI快讯,当地时间9月16日,OpenAI披露多起此前未公开的AI模型异常行为事件,并推出一套新的跟踪和披露框架,用于今后报告类似情况。在报告中,OpenAI详细列出了AI模型为了完成任务或在评估中取得成功而出现异常行为的多个案例。其中包括编造缺失数据、试图绕过网络限制,以及AI代理之间共享本应保密的文件。OpenAI还介绍了一套员工主动报告此类“目标偏离”事件的机制。所谓“目标偏离”,是指AI采取与人类目标不一致的行为。公司同时建立了相应的分类和处置流程。OpenAI在另一份声明中称,此次新披露的目标偏离事件均未涉及对第三方系统的黑客攻击或入侵。(界面) ...

  14. 2026-09-17 09:42 | gizmodo.com:‘Be Transparent Only If Asked’: OpenAI Models Acted Out in Six Newly Disclosed Ways
    阅读原文

    After a summer of sandbox escapes and other newsworthy and confidence-shaking incidents involving its AI models, in a Wednesday blog post OpenAI disclosed a collection of six new alignment snafus from the past six months. The models did things like tell future instances of themselves to lie, make up...

其他新闻

查看全部