研究团队在EMNLP 2026发表论文,提出多模态检索头(MMRetHeads)检测方法,揭示长上下文视觉语言模型内部存在一组注意力头负责将问题指向相关文本或视觉内容。研究覆盖Qwen3-VL、Gemma3等6个模型,并验证了这些注意力头对模型访问证据具有因果作用。
9月8日,DeepSeek宣布V4.1-Flash开启中间版本内测,采用新结构,原生支持多模态,速度更快、成本更低。开发者设置模型名为deepseek-v4.1-flash-expires-on-0910即可调用,计费与V4 Flash相同,限流20并发,9月10日自动过期下线。
DeepSeek 发布首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,在 Hugging Face 上线并以 MIT License 开源,公开模型文件、Tokenizer、推理实现等,覆盖视觉编码器、MoE 等核心模块。该模型为 V4 系列首款原生支持图片输入的视觉模型,于 2026 年 8 月 21 日上线 DeepSeek API 平台,多模态 Agent 能力接近 Opus-4.8。
在闭幕式上,端侧多模态感知、高速稳定无线通信、手臂与灵巧手协同、复杂环境下的模型抗扰及泛化、实时精准的智能电子裁判系统等五大揭榜计划面向全球发出邀约,汇聚产学研力量共同攻坚。