昊梵体育网

DeepSeek 终于“睁眼”了 👀 今天上线了新的多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp,现在不只是 OCR 识字,而是真的可以理解图片、截图、UI、图表,再结合推理和 Agent 能力继续完成任务。 不过目前要注意:它主要先开放在 DeepSeek API 平台,不是说你打开 DeepSeek 网页/App 就已经能直接 ​

DeepSeek 终于“睁眼”了 👀

今天上线了新的多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp,现在不只是 OCR 识字,而是真的可以理解图片、截图、UI、图表,再结合推理和 Agent 能力继续完成任务。

不过目前要注意:它主要先开放在 DeepSeek API 平台,不是说你打开 DeepSeek 网页/App 就已经能直接用了。

怎么用?进入 DeepSeek API 平台,在调用模型时选择/填写:

deepseek-v4-flash-vision-exp

然后就可以同时传入图片 + 文字进行提问。图片支持直接上传、图片链接、Base64,以及新的 Files API。

以前的 DeepSeek:脑子很强,但看不见。现在:眼睛终于补上了。

而我觉得更值得关注的是——它补上的不只是“识图”,而是 Agent 最重要的一块能力:看见屏幕 → 理解界面 → 判断下一步 → 调用工具执行。

DeepSeek 距离真正能“自己干活”的 AI,又近了一步。