返回新闻列表
2026-04-08 14:03

​微软 Bing 团队开源 “Harrier” 多语言嵌入模型

文章提及的 AI 工具Bing Image Creator
文本核心速览
  1. 多语言嵌入模型Harrier开源微软Bing团队开源词嵌入模型Harrier,在MTEB v2基准测试中表现优异,支持超过100种语言,显著提升多语言处理能力。
  2. 海量训练数据与长上下文窗口Harrier训练数据包含超20亿个示例及GPT-5合成数据,采用32000词元上下文窗口,确保多语言任务的高准确性和灵活性。
  3. 三个参数版本供选择模型提供27亿、2.7亿和0.6亿参数三个版本,适配不同硬件需求,均以MIT许可证在Hugging Face平台发布。
  4. 集成计划推动AI应用微软计划将Harrier集成到Bing搜索引擎及新一代AI代理服务中,以提升搜索性能,满足高效信息处理需求。

Harrier模型开源:100种语言、GPT-5数据、27亿参数,低配硬件也能跑

微软Bing团队开源了词嵌入模型Harrier,它直接在多语言MTEB v2基准测试中拿下高分,支持超过100种语言。

模型大小与参数

Harrier有三个版本:一个完整的27亿参数版本,外加两个小号——0.6亿参数2.7亿参数。27亿参数那个大概有3.3GB大,属于中等规模;0.6亿版本则只有几百MB,能在几年前的笔记本CPU上跑起来。上下文窗口是32,000个词元,相当于一次能读3万字左右的文档,比一般模型(通常512或1024词元)长得多。

训练数据

Harrier的训练数据包括超过20亿个示例以及来自GPT-5的合成数据。有开发者试了说,这种混合训练方式让模型在处理低资源语言时准确率明显提升。GPT-5的合成数据可能用来补齐某些小语种的训练样本缺口。

开源与许可证

三款模型都已经在Hugging Face上以MIT许可证发布,可以直接下载、修改、商用,不需要交钱。MIT许可证意味着连专利声明都省了,企业用起来最省事。

应用场景

嵌入模型在AI系统中负责把文本变成长数字向量,用于搜索、检索、分类。Harrier在MTEB v2基准上的表现说明,它能在超过100种语言上保持一致性,这对跨国搜索引擎或聊天机器人价值很大。群里在传,Harrier的多语言能力可能会让一些依赖单一语言嵌入模型的AI代理重新训练。

未来计划

微软接下来打算把Harrier技术集成到Bing搜索引擎中,以及用于新一代AI代理的基础服务。这意味着Bing的搜索结果排名可能更准,AI代理也能独立处理多步骤任务(比如退票再订票这种跨语言操作)。

接下来盯着看Harrier能不能让Bing的搜索质量超过Google,以及低配电脑用户能不能真正用上多语言AI应用——这会让Ollama上那些本地小模型用户受益,但可能会让OpenAI的闭源嵌入服务(比如text-embedding-3-large)感到价格压力。

来源: aibase阅读原文

其他新闻

查看全部