怎么评价 DeepSeek-V4-Flash-Vision-Exp 发布,多模态能力表现如何?
DeepSeek于8月21日发布实验性多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,并上线API平台。该模型支持图片、文本及简单视频帧输入,在图像描述、OCR识别和视觉问答方面表现良好。测试显示其推理速度快且显存占用低,在视觉理解的AgentBenchmark上较DeepSeek-V4-Flash有大幅提升,多模态Agent能力接近Opus-4.8。
热搜汇
共 2 条相关内容
DeepSeek于8月21日发布实验性多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,并上线API平台。该模型支持图片、文本及简单视频帧输入,在图像描述、OCR识别和视觉问答方面表现良好。测试显示其推理速度快且显存占用低,在视觉理解的AgentBenchmark上较DeepSeek-V4-Flash有大幅提升,多模态Agent能力接近Opus-4.8。
谷歌DeepMind近期发布了Gemini 3.6 Flash系列模型,该模型在提升代码编写、知识理解及多模态能力的同时,实现了Token使用量降低17%。Gemini 3.6 Flash支持1.0M上下文窗口,提供推理、视觉、工具调用及网页搜索等功能,旨在优化高吞吐量生产工作负载。在行业竞争方面,谷歌推出该模型及3.5 Flash-Lite旨在应对来自Kimi K3和DeepSeek V4 Flash等中国模型的竞争。