群发资讯网

DeepSeek 今天在 X 上发布公告: 实验性多模态视觉理解模型 V4-Flash-Vision-Exp 已上线 API。 三个要点: 1. 文本能力与 V4-Flash 相当(代理、推理、世界知识); 2. 多模态 Agent 基准测试大幅提升,4 项评测与 Anthropic Opus-4.8 打成 2 胜 2 负(Agents' Last Exam 27.3 对 25.7、ZeroBench ​

DeepSeek 今天在 X 上发布公告:

实验性多模态视觉理解模型 V4-Flash-Vision-Exp 已上线 API。

三个要点:

1. 文本能力与 V4-Flash 相当(代理、推理、世界知识);

2. 多模态 Agent 基准测试大幅提升,4 项评测与 Anthropic Opus-4.8 打成 2 胜 2 负(Agents' Last Exam 27.3 对 25.7、ZeroBench 35.0 对 34.0、ApexBench 36.5);

3. DeepSeek Harness 0.1.1 同步发布,内置支持新模型,另上线免费 Files API。

用人话说:以前 AI 只能读文字,现在它能看截图、看屏幕、边看边干活——

给它一张报错截图,它能自己看、自己改,不用你先把信息翻译成文字。

我的看法:

实验版适合尝鲜和测试,生产环境慎用。

但方向值得盯:

接下来 AI 最卷的地方,是谁能看懂你的屏幕、替你干活。

DeepSeekAI多模态AI产品人工智能