梁文锋坚守Agent主线,DeepSeek多模态探索背后的产品逻辑与生态共建
在人工智能领域,多模态技术的发展一直是行业关注的焦点。DeepSeek创始人梁文锋曾在投资人交流会上表示,多模态布局对公司而言是持续推进的工作,对于产品尤其是面向C端用户的产品十分重要,但从智能上限的角度看,它只是组件而非主线,后续V4版本会支持原生多模态。如今,这一表述有了新的进展。
2026年8月21日,DeepSeek推出了多模态视觉理解模型DeepSeek V4 Flash Vision Exp。与V4 Flash以及V4 Pro不同,该模型既没有发布技术报告,也未开源,官方仅公布了性能表和几个演示案例。这一情况引发了外界的诸多猜测,有人认为它不符合梁文锋口中“组件”的定位,更像是“主线”模型,怀疑梁文锋对多模态的看法是否发生了改变。不过从实际情况来看,梁文锋或许只是在产品策略上做出了调整,更加注重与用户的交流互动。
此前,梁文锋认为通往AGI需要经过产品阶段,但无需在C端和B端产品上投入过多精力。然而,随着DSH的爆火,发布不到一周就进行了更新,提升了多模态能力。过去,梁文锋对产品要求极为严格,不完美就不发布,DeepSeek V3.2版本和V4预览版之间相隔4个半月,从V3正式发布到V4预览版更是用了1年零4个月。如今不仅更新速度加快,还将DeepSeek V4 Flash Vision Exp这种实验性质的模型开放给公众,这表明他的态度有了一定的转变。
DeepSeek V4 Flash Vision Exp的发布有着独特的意图。在官方公布的测评中,出现的是一串Agent基准,如Terminal Bench 2.1得分83.9,DeepSWE得分59.3。在AI视觉模型圈,通常新视觉模型发布会展示MMMU、MathVista、DocVQA、ChartQA、OCRBench等基准,其他知名模型发布新版本时也是如此。即便DeepSeek V4 Flash Vision Exp也展示了一些多模态基准,但这些基准充满“Agent味”,如Chartography考专业人士读专业图表做决策,ApexBench是多模态Agent基准,Agents’ Last Exam是通用Agent评测,没有一项是简单的“看图答题”,而是“看完图,把事做下去”。这暗示着DeepSeek V4 Flash Vision Exp是DeepSeek在Agent和推理主线上的产物,多模态只是手段,目的是强化产品的推理能力。
DeepSeek V4 Flash Vision Exp并非凭空出现。4月29日晚,DeepSeek多模态负责人陈小康在X平台发文预告多模态识图功能开启灰度测试,第二天在GitHub发布技术报告《Thinking with Visual Primitives》及配套仓库,论文作者单位包含DeepSeek、北京大学、清华大学,属于三方联合研究成果。但这篇论文在5月1日凌晨被删除,相关推文和仓库也无法访问,DeepSeek未作任何解释。好在社区保留了拷贝版本,论文提出传统多模态模型用自然语言描述图片对象在复杂场景中容易混乱,DeepSeek的解法是将点坐标和边界框提升为“思维的最小单元”嵌进推理链,让模型“边推理边指向”。6月,DeepSeek官方确认客户端和网页端上线的Vision模式底层就是这套视觉原语机制,而DeepSeek V4 Flash Vision Exp是将该技术嫁接到了V4 - Flash的API基座上,重点强化多模态Agent能力。
除了DeepSeek V4 Flash Vision Exp,DeepSeek在多模态方面的进展还体现在DSH上。8月19日晚,DSH更新了rc.8版本,提升了Agent的多模态能力。rc.8采用“两条腿”走路的方式,一条是“原生直通”,给模型适配器加可配置的原生图片请求能力,只要底层模型支持视觉输入,图片就能原封不动送进模型;另一条是“工具层视觉”,服务纯文本模型,当纯文本模型直接读图失败时,会自动降级成工具链,先做OCR识别文字,再统计图片颜色比例等,把信息拆成结构化证据交给文本模型推理。此前DSH在rc.8之前甚至没有“伪视觉”,全靠社区的视觉插件和通过pi2dsh桥接进来的视觉方案。
在产品发布节奏上,DeepSeek曾面临一些挑战。2025年,DeepSeek R1惊艳全球后,社区期待V4的发布,但直到2026年4月24日,V4才以预览版形式登场,同时放出V4 - Pro和V4 - Flash。正式版更是历经多次延期,7月31日V4 - Flash正式版上线,8月12日晚V4 - Pro正式版才上线。梁文锋对待产品一向严谨,不做到满意绝不发布。然而,在DeepSeek V4 Flash Vision Exp上,情况有所不同。模型上线当晚社区就进行检测,发现它连梁文锋本人照片都无法识别,还存在理解复杂图表漏关键信息、中文场景处理偏弱、对话插入图片影响上下文缓存机制等问题,社区普遍认为效果一般。这或许是因为梁文锋感受到了优秀产品的压力,如Anthropic的Claude Code和OpenAI的Codex。8月20日OpenAI开源Codex Harness,将多模态放在Agent运行时的核心位置,减少了信息损耗,实现了视觉理解和行动闭环的连接。而DSH在多模态方面此前是割裂的,这也是其目前所欠缺的,所以DeepSeek在OpenAI开源后迅速开源DeepSeek V4 Flash Vision Exp。
