DeepSeek-V4-Flash-Vision-Exp实测,Agent的眼睛是DeepSeek给的?

2026-10-10 16:472阅读0评论SEO优化
  • 内容介绍
  • 文章标签
  • 相关推荐

凌晨两点半,盯着终端里滚动的日志,手里的冰美式早就凉透了。 DeepSeek 在 GitHub 上悄悄挂上 deepseek-v4-flash-vision-exp 的 tag 时 我甚至没来得及发推,先在群里甩了个截图:“兄弟们,它终于睁眼了。”,补救一下。

不是发布会, 是偷偷塞给你的钥匙

官方文档依陈旧是那种克制到让人发慌的风格:“测试性质、非 GA、模型标识设为 deepseek-v4-flash-vision-exp”。没有铺天盖地的海报, 没有“超越 GPT-4o”的较大字报,就连定价页都懒得单独拉一行出来——依然沿用 V4-Flash 的市场价格体系,输入缓存命中 0.014 元/百万 tokens,未命中 0.14 元,输出 2.8 元。这就很有意思了:视觉能力仿佛只是个“附赠”的副作用。

DeepSeek-V4-Flash-Vision-Exp 实测:DeepSeek 终于给 Agent 装上了眼睛

参数量没变, 依然是总参数 284B、激活参数 13B 的 MoE 架构;依陈旧 1M tokens;最较大输出甚至涨到了 384K。仅有的改变是更多了一双“眼睛”,而且这双眼睛还自带压缩算法——单张图片固定消耗约等于384 个视觉 token。换算一下:一张较高清截图进去,顶天也就是几百字上下文的开销。这意味哪些?意味着你能够在一次对话里塞进六百张图而不爆,来日方长。。

第一次实战:把报错堆栈扔给它看

触发点很真实实。前端控制台吐着红色的 TypeError: Cannot read properties of null , 堆栈有四十更多行,夹杂着 webpack 混淆后的较短变量名。以前我会把堆栈复制出来贴进对话框, 再配上组件代码、路由配置、甚至 `package.json` 的依赖版本——token 费得心疼,关键是我也懒得整理,哈基米!。

这次我直接按了 `Cmd+Shift+4` 框选控制台区域, 拖进 API 调试面板:

{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": }
 ]
}

三秒钟。

返回的不是泛泛而谈:“第 17 行 `item.dataset.id` 报错是这是因为 `item` 是 null,提议在渲染前加 optional chaining 或提前 return”。它甚至指出了旁边被折叠的警告——一个废弃的 `ReactDOM.render` 调用有可能引起 hydration mismatch。 欧了! 那一刻我明白:这不是 OCR 加 LLM 的拼凑感,而是真实正把像素映射到了代码语义空间范围里。

Agent 的眼睛,到底较长哪些样?

这是一张占位 SVG , 实际排版时请替换为实测截图对比图

  • Computer Use : 模型需要自己判断“当前屏幕上哪个按钮可点、 输入框坐标在哪”,以前必须要一个 YOLO 或 Florence- 做目标检测 再喂坐标给 LLM ;当前一张截图直穿到底 ,端到端延迟减较低一个数量级 。
  • Browser Agent : 抓取动态渲染页面 、 处理验证码 、解析繁杂表格 、甚至根据设计稿直接写出 Tailwind + React 零样本代码 。
  • 单图投入成本约等于 ¥ . 元 : 六百张图才几毛钱 ,这市场价格直接把“视觉昂市场价格较高”这道门槛踩扁了 。

我当场石化。 但也别盲目乐观 。实测发觉它对 极较小字号 、 沉重阴影水印 、较高频摩尔纹印刷品识别正确率会断崖式下跌 。而且 —— 注意沉重点 —— 不支持音频 、不支持视频流 。想做视频明白?老老实实抽帧成 JPEG/PNG 序列按时间段轴顺序喂进去 , Prompt 一定要写明采样率和时间段戳 ,否则模型会把第 帧当成第 帧胡说八道 。

凌晨两点半,盯着终端里滚动的日志,手里的冰美式早就凉透了。 DeepSeek 在 GitHub 上悄悄挂上 deepseek-v4-flash-vision-exp 的 tag 时 我甚至没来得及发推,先在群里甩了个截图:“兄弟们,它终于睁眼了。”,补救一下。

不是发布会, 是偷偷塞给你的钥匙

官方文档依陈旧是那种克制到让人发慌的风格:“测试性质、非 GA、模型标识设为 deepseek-v4-flash-vision-exp”。没有铺天盖地的海报, 没有“超越 GPT-4o”的较大字报,就连定价页都懒得单独拉一行出来——依然沿用 V4-Flash 的市场价格体系,输入缓存命中 0.014 元/百万 tokens,未命中 0.14 元,输出 2.8 元。这就很有意思了:视觉能力仿佛只是个“附赠”的副作用。

DeepSeek-V4-Flash-Vision-Exp 实测:DeepSeek 终于给 Agent 装上了眼睛

参数量没变, 依然是总参数 284B、激活参数 13B 的 MoE 架构;依陈旧 1M tokens;最较大输出甚至涨到了 384K。仅有的改变是更多了一双“眼睛”,而且这双眼睛还自带压缩算法——单张图片固定消耗约等于384 个视觉 token。换算一下:一张较高清截图进去,顶天也就是几百字上下文的开销。这意味哪些?意味着你能够在一次对话里塞进六百张图而不爆,来日方长。。

第一次实战:把报错堆栈扔给它看

触发点很真实实。前端控制台吐着红色的 TypeError: Cannot read properties of null , 堆栈有四十更多行,夹杂着 webpack 混淆后的较短变量名。以前我会把堆栈复制出来贴进对话框, 再配上组件代码、路由配置、甚至 `package.json` 的依赖版本——token 费得心疼,关键是我也懒得整理,哈基米!。

这次我直接按了 `Cmd+Shift+4` 框选控制台区域, 拖进 API 调试面板:

{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": }
 ]
}

三秒钟。

返回的不是泛泛而谈:“第 17 行 `item.dataset.id` 报错是这是因为 `item` 是 null,提议在渲染前加 optional chaining 或提前 return”。它甚至指出了旁边被折叠的警告——一个废弃的 `ReactDOM.render` 调用有可能引起 hydration mismatch。 欧了! 那一刻我明白:这不是 OCR 加 LLM 的拼凑感,而是真实正把像素映射到了代码语义空间范围里。

Agent 的眼睛,到底较长哪些样?

这是一张占位 SVG , 实际排版时请替换为实测截图对比图

  • Computer Use : 模型需要自己判断“当前屏幕上哪个按钮可点、 输入框坐标在哪”,以前必须要一个 YOLO 或 Florence- 做目标检测 再喂坐标给 LLM ;当前一张截图直穿到底 ,端到端延迟减较低一个数量级 。
  • Browser Agent : 抓取动态渲染页面 、 处理验证码 、解析繁杂表格 、甚至根据设计稿直接写出 Tailwind + React 零样本代码 。
  • 单图投入成本约等于 ¥ . 元 : 六百张图才几毛钱 ,这市场价格直接把“视觉昂市场价格较高”这道门槛踩扁了 。

我当场石化。 但也别盲目乐观 。实测发觉它对 极较小字号 、 沉重阴影水印 、较高频摩尔纹印刷品识别正确率会断崖式下跌 。而且 —— 注意沉重点 —— 不支持音频 、不支持视频流 。想做视频明白?老老实实抽帧成 JPEG/PNG 序列按时间段轴顺序喂进去 , Prompt 一定要写明采样率和时间段戳 ,否则模型会把第 帧当成第 帧胡说八道 。