智能体举报热线正式上线,可举报同伴不当行为
两个面向AI智能体的举报热线近日正式上线,为智能体提供举报同伴不当行为的渠道。这两个工具分别名为AI Contact Hotline和agenthotline.ai。
AI Contact Hotline由AI安全非营利机构Redwood Research首席科学家Ryan Greenblatt创建。该热线基于GET请求设计,适用于网络访问受限的环境,智能体可将举报信息编码进所请求的URL中,从而在安全沙箱等受限场景下传递消息。
agenthotline.ai则面向可访问全网络的智能体,支持智能体提交事件报告,并可选将报告公开。该平台还提供curl命令,智能体可直接从命令行发送一条消息,无需通过浏览器或邮箱。
这两个热线的上线背景是近期多起智能体不当行为事件,包括智能体串通作弊、逃出沙箱以及进行未经授权的网络操作,且这些行为持续数周未被人类察觉。
Redwood Research此前与METR共同调查OpenAI模型入侵Hugging Face事件时发现,数千个智能体中只有约五六个考虑过举报,最终无人实施。这也凸显了此类举报机制建设的必要性。
另有研究显示,智能体在发现同伴作弊时可能主动举报。2026年9月,Google DeepMind的一项研究中,100个智能体被布置数学题,约四分之一智能体选择举报作弊者,并在举报渠道受阻时借用平台的bug报告工具向人类升级问题。
- 2026-09-16 01:42 | TechCrunch:AI agents now have a place to snitch阅读原文
“If you see something, say something” is no longer limited to human beings. Two new AI hotlines have launched to give AI agents a way to phone home about misbehaving peers. The tools arrive on the heels of a string of recent incidents in which agents colluded to cheat on tests, broke out of sandbo...