DeepSeek-V4.1-Flash 适配度评测发布:93.7% 综合成功率反超前代旗舰
2026 年 9 月 10 日,国内智能体平台 AiPy 发布《AiPy 适配度评测报告 · DeepSeek-V4.1-Flash(0910)》,这是全网首份针对 DeepSeek-V4.1-Flash 的适配度测评报告。报告显示,该模型在 63 项真实办公与开发任务中成功交付 59 项,综合成功率达 93.7%,反超前代旗舰 V4-Pro,峰值输出速度达到 V4-Pro 的 7 倍以上。
本次评测基于 AiPy Pro 2.0.1 客户端,以 DeepSeek-V4.1-Flash(0910)为执行内核,覆盖多模态理解、文档与数据处理、联网检索与调研、系统与桌面操控、代码与工具开发、内容创作与设计六大能力维度。所有任务均要求产出 HTML、Word、PPT、PDF、图片、音视频或可执行程序等真实交付物,而非简单的问答对话。
数据显示,DeepSeek-V4.1-Flash(0910)综合成功率为 93.7%,前代旗舰 V4-Pro 为 88.4%,前代 V4-Flash 为 82.6%。速度方面,V4.1-Flash(0910)最高输出速度可达 500+ tokens/s,峰值速度约为 V4-Flash 的 2.3 倍、V4-Pro 的 7 倍以上。细分维度中,多模态理解、文档与数据处理、代码与工具开发、内容创作与设计均实现 100% 通过;联网检索与调研成功率为 90.5%;系统与桌面操控维度成功率为 77.8%,报告认为其中 3 项失败任务属于工程适配问题,而非模型能力短板。
公开资料显示,DeepSeek-V4.1-Flash(0910)是深度求索于 2026 年 9 月 8 日开启限时内测的中间版本大模型,采用全新模型结构,原生支持多模态输入,最长支持 100 万 tokens 上下文,计费标准与 DeepSeek-V4-Flash 持平。AiPy 方面表示,将持续推进模型适配评测工作。
- 2026-09-10 13:47 | 新浪财经:轻量反超旗舰,大模型史上第一次:AiPy 发布 DeepSeek-V4.1-Flash 测评报告阅读原文
2026 年 9 月 10 日,国内领先的智能体平台 AiPy 正式发布《AiPy 适配度评测报告 · DeepSeek-V4.1-Flash(0910)》。这是全网首份针对 DeepSeek-V4.1-Flash 的适配度测评报告。报告显示,该模型在 63 项真实办公与开发任务中成功交付 59 项,综合成功率达 93.7%,不仅反超前代旗舰 V4-Pro,其峰值输出速度更达到 V4-Pro 的 7 倍以上,标志着国产大模型在“智能体适配”这一关键赛道上实现代际跃升。一、从“对话”到“交付”:AiPy 重新定义智能体评测标尺在全球人工智能产业加速从“模型竞赛”迈向“应用落地”的当下,如何衡量一...