据 ChainCatcher 报道,DeepSeek 发布了其 V4-Flash-Vision-Exp 模型在多模态 Agent 任务上的基准测试结果,并以 2:2 的成绩与 Anthropic 的 Opus 4.8 战平。DeepSeek 在 Agents' Last Exam(27.3 对 25.7)和 ZeroBench(35.0 对 34.0)中胜出,但在 ApexBench(36.5 对 39.4)和 Chartography(64.3 对 65.0)中落败。与仅支持文本的 V4-Flash-0731 相比,支持视觉的版本表现出显著提升:ApexBench 从 26.2 提升至 36.5,Agents' Last Exam 从 25.2 提升至 27.3。基于文本的 Agent 能力依然强劲,在七项文本基准测试中有六项超过上一版本,其中 DeepSWE 达到 59.3,超过 Opus 4.8 的 58.0。