返回新闻列表
2026-08-08 10:02

Neon联手Castform训练4B文档搜索模型,超越GPT-5.6 Sol

文本核心速览
  1. 合作训练4B模型Neon与Castform利用强化学习后训练出4B参数开源模型,文档搜索准确率超过GPT-5.6 Sol,单次推理成本仅为其约1/100。
  2. 智能体式搜索兴起文档搜索正从嵌入式向量匹配转向智能体式搜索,模型自主拆解问题、迭代查询直至收集足够信息,能处理复杂任务但成本高昂。
  3. 强化学习训练流程Castform负责训练模型判断搜索策略,通过尝试任务并依据结果评分反馈迭代,评估维度涵盖答案正确性、文档命中与段落引用。
  4. 评估刷新最高纪录后训练模型平均评估分达1.447,超过GPT-5.6 Sol的1.369和GPT-5.4的1.377,刷新该验证集最高纪录。
  5. 成本优势改写格局4B模型单次推理成本0.000929美元,仅为GPT-5.6 Sol的0.087338美元的约1/94,为多轮检索的智能体应用大幅降低单位成本。

小模型的大突破

Neon 和 Castform 两家公司联手完成了一项令人重新审视“小模型”潜力的工作——通过强化学习后训练,产出了一个 4B 参数的开源模型。在文档搜索任务上,该模型的准确率不仅不低于 GPT-5.6 Sol,甚至更高,而单次推理成本仅为后者的约 1/100

搜索范式的转变

目前,文档检索的主流做法是嵌入式搜索:将文档转换为数值向量,再通过相似度匹配来查找相关内容。然而,随着 AI 智能体的普及,搜索流程正在向智能体式搜索演进:模型把复杂问题拆解为多个子问题,自主决定搜索查询、检查结果、再发起下一轮搜索,如此循环往复,直至收集到足够信息。

这种方式能够处理更复杂的问题,但代价是每次搜索都需要调用高性能模型,耗时和成本都居高不下。以 Neon 给出的典型请求口径为例,GPT-5.6 Sol 处理一次搜索请求耗时超过 10 秒,成本约为 0.03 美元

明确分工与强化学习

Neon 和 Castform 在合作中各司其职:

  • Neon 提供文档存储位置和搜索能力;
  • Castform 负责训练模型判断“该搜什么”。

训练采用强化学习:模型先尝试完成任务,系统对结果打分,评分直接反馈进下一轮试验。评估维度不仅看最终答案是否正确,还会检查是否找到了正确的文档、是否引用了合适的段落。最终,Castform 后训练的模型在 Neon 的验证中取得了 1.447 的平均评估分,超过了 GPT-5.6 Sol 的 1.369 和作为对照的 GPT-5.4 的 1.377,刷新了该验证的最高纪录。

成本优势是杀手锏

成本差异才是真正的杀手锏:这个 4B 小模型的单次推理成本为 0.000929 美元,而 GPT-5.6 Sol 则是 0.087338 美元,相差约 94 倍。用 4B 参数达到 GPT-5.6 Sol 级别的搜索精度,同时将推理开销压至几乎可忽略不计,对于高度依赖反复调用模型进行多轮检索的智能体应用来说,这意味单位成本结构被彻底改写。

这一成果表明,在特定任务上,经过精心训练的“小模型”完全有潜力以极低成本匹敌甚至超越通用大模型,为实际应用提供了更具性价比的选项。

未来,随着智能体搜索场景的普及,这种“小而美”的模型或将开辟出一条全新的技术路径,值得业界持续关注。

来源: aibase阅读原文

其他新闻

查看全部