2026-05-25 09:15
微软新推 Fara1.5 系列智能体模型,任务成功率高达 72%!超越 OpenAI!
文本核心速览
- 三参数版本发布—微软推出Fara1.5系列智能体模型,包含4B、9B和27B三种参数规模,专为浏览器场景设计。
- 核心机制:观察-思考-行动—模型能读取浏览器截图并模拟鼠标键盘操作,融合历史对话与最近三张截图进行动态推理与精准响应。
- 性能领先行业—Fara1.5-27B在Online-Mind2Web测试中任务成功率达72%,显著领先OpenAI Operator的58.3%和Gemini 2.5 Computer Use的57.3%。
- 多样化训练数据—基于约200万条样本微调,涵盖网页轨迹(60%)、合成环境(12.8%)、用户交互(12.5%)等,提升适应能力。
- 安全机制双重保障—模型在三种场景下主动暂停并征询用户确认,所有操作记录于MagneticLite沙盒内,确保隐私与安全边界。
Fara1.5 浏览器智能体上线,27B 版本任务成功率 72% 碾压 OpenAI Operator 的 58.3%
微软研究院 AI Frontiers 实验室刚刚放出了 Fara1.5 系列,三个参数规模:4B、9B、27B——4B 是最轻量的,27B 是最能打的。群里在传,这模型跟 MagneticLite 沙盒浏览器界面深度绑定,直接截屏看网页,然后自己动鼠标键盘干活。核心套路是“观察 — 思考 — 行动”循环,每步决策都要结合历史对话和最近三张屏幕截图。有开发者试了说,27B 在 Online-Mind2Web 测试里任务成功率飙到 72%,而 OpenAI Operator 只有 58.3%,Gemini 2.5 Computer Use 是 57.3%——这差距挺明显。轻量版 9B 也有 63.4%,不算差。
训练数据:200 万条样本,轨迹占六成
训练数据用了大约 200 万条多样样本,细分下来:网页轨迹 60%,合成环境 12.8%,用户交互 12.5%,事实锚定 8.8%,视觉问答 4.9%。群里在说,这多场景混搭让模型适应能力变强了,不是那种只会跑固定流程的傻东西。
安全机制:三种情况主动暂停问用户
Fara1.5 在三种情况下会主动暂停,弹窗问用户确认:缺失个人信息、任务描述模糊、即将执行未经授权的不可逆操作。所有操作记录在 MagneticLite 沙盒里,安全边界卡得死。有开发者试了说,这比那些闷头干活的智能体让人放心,至少不会自己把账号注销了。
接下来盯着看什么
这会让 OpenAI 和 Google 难受——浏览器自动化这块,微软用沙盒+视觉推理的组合拳直接捅了它们一刀。受益的是搞自动化测试、网页爬虫、RPA 的公司,低成本就能拿到接近人类操作水平的模型。但得小心别让智能体在沙盒外裸奔,安全机制再严也防不住恶意 prompt。