Neon联手Castform训练4B文档搜索模型,超越GPT-5.6 Sol
- 合作训练4B模型—Neon与Castform利用强化学习后训练出4B参数开源模型,文档搜索准确率超过GPT-5.6 Sol,单次推理成本仅为其约1/100。
- 智能体式搜索兴起—文档搜索正从嵌入式向量匹配转向智能体式搜索,模型自主拆解问题、迭代查询直至收集足够信息,能处理复杂任务但成本高昂。
- 强化学习训练流程—Castform负责训练模型判断搜索策略,通过尝试任务并依据结果评分反馈迭代,评估维度涵盖答案正确性、文档命中与段落引用。
- 评估刷新最高纪录—后训练模型平均评估分达1.447,超过GPT-5.6 Sol的1.369和GPT-5.4的1.377,刷新该验证集最高纪录。
- 成本优势改写格局—4B模型单次推理成本0.000929美元,仅为GPT-5.6 Sol的0.087338美元的约1/94,为多轮检索的智能体应用大幅降低单位成本。
小模型的大突破
Neon 和 Castform 两家公司联手完成了一项令人重新审视“小模型”潜力的工作——通过强化学习后训练,产出了一个 4B 参数的开源模型。在文档搜索任务上,该模型的准确率不仅不低于 GPT-5.6 Sol,甚至更高,而单次推理成本仅为后者的约 1/100。
搜索范式的转变
目前,文档检索的主流做法是嵌入式搜索:将文档转换为数值向量,再通过相似度匹配来查找相关内容。然而,随着 AI 智能体的普及,搜索流程正在向智能体式搜索演进:模型把复杂问题拆解为多个子问题,自主决定搜索查询、检查结果、再发起下一轮搜索,如此循环往复,直至收集到足够信息。
这种方式能够处理更复杂的问题,但代价是每次搜索都需要调用高性能模型,耗时和成本都居高不下。以 Neon 给出的典型请求口径为例,GPT-5.6 Sol 处理一次搜索请求耗时超过 10 秒,成本约为 0.03 美元。
明确分工与强化学习
Neon 和 Castform 在合作中各司其职:
- Neon 提供文档存储位置和搜索能力;
- Castform 负责训练模型判断“该搜什么”。
训练采用强化学习:模型先尝试完成任务,系统对结果打分,评分直接反馈进下一轮试验。评估维度不仅看最终答案是否正确,还会检查是否找到了正确的文档、是否引用了合适的段落。最终,Castform 后训练的模型在 Neon 的验证中取得了 1.447 的平均评估分,超过了 GPT-5.6 Sol 的 1.369 和作为对照的 GPT-5.4 的 1.377,刷新了该验证的最高纪录。
成本优势是杀手锏
成本差异才是真正的杀手锏:这个 4B 小模型的单次推理成本为 0.000929 美元,而 GPT-5.6 Sol 则是 0.087338 美元,相差约 94 倍。用 4B 参数达到 GPT-5.6 Sol 级别的搜索精度,同时将推理开销压至几乎可忽略不计,对于高度依赖反复调用模型进行多轮检索的智能体应用来说,这意味单位成本结构被彻底改写。
这一成果表明,在特定任务上,经过精心训练的“小模型”完全有潜力以极低成本匹敌甚至超越通用大模型,为实际应用提供了更具性价比的选项。
未来,随着智能体搜索场景的普及,这种“小而美”的模型或将开辟出一条全新的技术路径,值得业界持续关注。