模型发布与功能特性

8月21日,多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp正式上线DeepSeek API平台。该模型被定义为实验性质模型,用户可通过设置model='deepseek-v4-flash-vision-exp'进行访问。

在功能方面,DeepSeek-V4-Flash-Vision-Exp支持多模态输入,能够处理文本、图片以及简单的视频帧。其在图像描述、OCR识别以及简单的视觉问答任务中表现良好。实测显示,该模型能够准确识别复杂流程图中的节点逻辑关系,但在颜色或位置等细节描述上偶尔会出现偏差。

性能表现与能力对比

在能力对比方面,DeepSeek-V4-Flash-Vision-Exp在纯文本能力(包括世界知识、推理、Agent等)上与DeepSeek-V4-Flash正式版持平。但在需要视觉理解的AgentBenchmark测试中,该模型相比DeepSeek-V4-Flash实现了大幅跃升,其多模态Agent能力已接近Opus-4.8。

在性能与成本控制上,该模型在推理速度上具有优势。实测数据显示,在A100显卡上处理单张图片的时间约为1-2秒,显存占用可控制在4GB。此外,该模型可在RTX 4090显卡上流畅运行。

部署指南与技术要求

DeepSeek已在Hugging Face提供模型权重(仓库路径为deepseek-ai/deepseek-v4-flash-vision-exp),开发者可通过transformers库加载。

在本地部署的技术要求方面,建议使用Python 3.10以上版本,并安装最新的torch、transformers以及deepseek-ai包。部署过程中需注意CUDA与cuDNN的版本匹配问题,以避免报错。此外,针对中文场景,处理器的部分参数默认值可能需要手动调整。