2026-04-03 15:50
美团发布LongCat-Next:视觉语音底层统一的多模态模型
美团LongCat-Next用离散Token统一图像、语音和文本,实测性能碾压专用模型
4月3日,美团技术团队开源了原生多模态大模型LongCat-Next,它通过把图像、语音和文本都变成同一种离散Token,让AI像处理文字一样原生地看和听。有开发者拆解后发现,这套架构彻底扔掉了“语言基座+插件”的拼凑方案。
技术核心:DiNA架构搞“模态内化”
为了不让不同模态的数据各说各话,美团搞了个DiNA(离散原生自回归)架构,有开发者试了说,这玩意把多模态建模几乎焊成了一块:
- 全模态统一:文字、图像、音频全用同一套参数、同一个注意力机制和同一个损失函数,不再给每个模态单独开小灶。
- 理解与生成对称:预测文字Token就是“理解”,预测图像Token就是“生成”,两者在训练里互相帮衬,群里在传协同效果比预期还强。
- 极致压缩:视觉分词器叫dNaViT,不管输入多少分辨率都能处理,靠8层残差向量量化把像素空间压缩了28倍(相当于一张4K图压到约143×143像素还能看清OCR和财报里的小字),关键细节一点没丢。
实测成绩:离散建模没撞上“天花板”
长期有人说“离散化必然损失信息”,LongCat-Next在几个基准上直接把这种说法怼了回去:
- 细粒度感知:在OmniDocBench密集文本场景测试中,跑分不仅压过了Qwen3-Omni,还比专用视觉模型Qwen3-VL强——有开发者试了说,财报表格里的数字识别率飙得离谱。
- 视觉推理:在MathVista上拿下83.1,群里在传这是工业级逻辑能力的体现,算几何题、图表推理都能打。
- 跨模态协同:语言能力保持领先(C-Eval 86.80),同时支持低延迟并行文本语音生成和可定制的语音克隆——实测说一句话就能克隆你的声线。
行业影响:给物理世界AI铺了块基石
长期以来大模型都是语言中心的动物,LongCat-Next这波操作让有从业者改口了:物理信息也能被离散化,像语言一样建模。当AI终于有了统一的“母语”,调用工具、写代码、看复杂图表时脑子会更灵光。目前美团已经把LongCat-Next模型和dNaViT分词器全量开源,是个小尺寸但潜力大的原生离散架构。
接下来盯着看这货能不能在手机端跑起来,那帮还在做“视觉插件+语言底座”的厂商怕是要难受了。
来源: aibase阅读原文