DeepSeek发布开源视觉模型V4-Flash-Vision-Exp
2026年8月31日,DeepSeek将旗下首个多模态模型DeepSeek-V4-Flash-Vision-Exp在Hugging Face平台上线,并采用MIT License开源。
此次公开的内容包括模型文件、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块。
DeepSeek-V4-Flash-Vision-Exp是DeepSeek V4系列首款原生支持图片输入的视觉模型,官方明确标注为“Exp”实验版本。该模型已于2026年8月21日上线DeepSeek API平台,支持JPEG、PNG、GIF、WebP等图片格式,能够描述图片内容、识别截图中的文字、分析图表等。
据DeepSeek官方介绍,V4-Flash-Vision-Exp在各类Agent框架中表现出较好的多模态适配能力,在Agent、推理、世界知识等纯文本任务上与V4-Flash正式版持平,在需要视觉理解的Agent基准测试中较V4-Flash大幅提升,其多模态Agent能力已接近Opus-4.8。
- 2026-08-31 19:35 | IT之家:DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8阅读原文
IT之家 8 月 31 日消息,刚刚,DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT License 开源。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。据IT之家了解,DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列首款原生支持图片输入的视...