三校团队发布视觉智能体框架OmniHarness,创意任务解决率达95%
北京航空航天大学、香港中文大学和新加坡国立大学研究团队近日发布视觉智能体框架OmniHarness,其核心机制是让智能体通过自主练习、结果检查与符号策略学习,将验证成功的流程抽象为可复用的策略,使后续任务能够调用经过验证的方法。
在ComfyBench创意任务中,OmniHarness达到95%的解决率,超过最佳对照SymbOmni 27.5个百分点;采用Codex GPT-4o配置时,总体解决率为92.5%。当推理骨干同为GPT-4o时,OmniHarness总体解决率为89.5%,创意任务则为95%。
OmniHarness采用符号策略学习,将验证成功的流程整理为可用于一类任务的策略,保存的内容包含工作流模板、适用条件和资源依赖,并抽离当前图片、具体描述等实例输入。策略库还可适配到其他智能体,宿主保留原有控制流程,模型无需微调。实验显示,ComfyAgent总体解决率由32.5%升至57.0%,ComfyMind从83.0%提高到88.0%,SymbOmni由86.0%达到89.0%。
该框架还将只练过图像任务的冻结策略库迁移到视频工作流,视频总体解决率为85.9%,高出最佳对照5.1个百分点;其中视频到视频任务达到80.0%,高出13.3个百分点。团队表示,自主练习、多轮验证和修复会增加计算开销,检索效率与推理预算仍有优化空间。
- 2026-09-17 19:30 | 36氪:创意任务解决率95%,让视觉AI自己练习,还能把经验带到视频阅读原文
AI完成任务之后,还能留下什么? 北京航空航天大学、香港中文大学和新加坡国立大学的研究团队最近发布了OmniHarness,给出的路径是:让视觉智能体主动练习、检查结果,再将有效流程留下。 面对下一个需求,AI手里能多一份经过验证的方法。 论文全文:https://arxiv.org/abs/2609.16057 项目主页:https://omniharness.github.io/ 代码与运行说明:https://github.com/OmniHarness/OmniHarness 创意任务解决率95% ComfyBench创意任务中...