2026-09-01 · AI 资讯
DeepSeek 发布首个视觉多模态模型:专为 Agent“读图”打造

DeepSeek 在 Hugging Face 上开源了其首款多模态实验模型 DeepSeek-V4-Flash-Vision-Exp。与主打视觉问答的传统多模态模型不同,这款拥有 305B 参数的模型被明确定义为“Agent 专用”,旨在让智能体具备读取软件界面、网页截图及图表的能力,从而实现更高效的工具调用与任务执行。

模型开源内容十分详尽,涵盖了视觉编码器、Aligner 以及核心推理逻辑,社区响应迅速,目前已适配 llama.cpp、Ollama 等量化环境。在性能表现上,该模型在多模态 Agent 基准测试中的表现已超越 Claude Opus 4.8,展示了强大的视觉理解潜力。这也是 DeepSeek 继 API 服务后,将多模态能力下放给开源社区的重要落子。
从技术布局来看,DeepSeek 正在拼装完整的 Agent 技术栈:由模型负责推理与调用,Vision 视觉模型负责感知与信息读取。这种“先商用 API 再开源权重”的策略,凸显了 DeepSeek 在推动 Agent 行业标准中的野心。随着此次开源,开发者将能更便捷地构建能够“直面电脑屏幕”的自动化智能体。
相关模型(97AI 可直接调用)
