Ferret 是一款由苹果团队研发的端到端多模态大语言模型(MLLM),能够接受任意形式的空间指代(如点、框、草图)并精准定位图像中任意粒度的物体,同时生成丰富的语义描述。该模型创新性地提出了混合区域表示与空间感知视觉采样器,首次实现了开放词汇的指代与定位能力。
Ferret 基于 LLaVA 框架构建,融合了 Vicuna 语言模型与 CLIP 视觉编码器,并通过大规模层次化指令微调数据集 GRIT(约110万样本)进行训练。模型支持 7B 和 13B 两个参数量版本,可在 8 张 A100 GPU 上完成训练,并提供了公开的权重差分文件,便于研究社区复现和使用。
项目还配套发布了 Ferret-Bench 多模态评估基准,专门测试模型在指代、定位、语义理解、知识推理等联合任务上的表现。Ferret 的研究成果已被 ICLR 2024 接收为 Spotlight 论文,后续衍生版本 Ferret-v2 和 Ferret-UI 进一步拓展了在 UI 理解等垂直场景的应用。