
你把一张截图丢进 AI 的对话框,那大概是你最近最省心的一步。以前要喂给 AI 的图,一张扫描合同、一个报错界面、一页 PDF 表格,都得先变成它能一个字一个字读的东西,也就是一行行字。现在这张图扔过去,它就接住了。
接住它的代价,以前不低。能让模型看见的这一路,在不少厂商那儿往往更贵,跟你要的不在同一个价位。就在昨天,DeepSeek 把它也补上了,补得很干脆,按它自己的说法,这只刚睁开的眼睛,看图干活的本事已经接近现在最顶的那一档。
以前你多干的那些活,本来可以不干
跑分先放一边,先算一件每天都在发生的小事。
以前你让 AI 读一张表格,得先让它知道你说的是文字还是图。表格要是 PDF 里生成的还好,能选中复制;碰到扫描件或者手机拍的,那堆字是图,选不中,只能手敲。就像你报销时拍的那张打车票,票面一溜小字,日期、金额、起终点挤在一块,以前得自己把一列数字敲成文本再贴给 AI;现在一整张照片丢进去,它自己把字段读出来,你扫一眼对不对就行。一张表二十行,先手敲一遍再交给它,这一截你自己干的是纯重复,还容易敲错。敲错一格,后面全跟着错,你还得回头对着原图再核一遍。
DeepSeek 昨天放出的这个模型,就是冲省掉你这一截来的。它名字里的 vision 就是视觉,专管看图。它跟已经正式上线的 Flash 版比,写字的功夫持平,多的就是这一双眼睛。多出来的这双眼睛,恰好落在你最容易烦的那段活上。
能把你手敲那一截省掉的,才是真值钱。
平价档的国产模型,把「看见」也补上了
那它凭什么说能打?先把它的话原封不动摆出来。按官方说法,这只带上视觉的模型,在多模态 Agent 的活儿上已经接近 Opus-4.8(Anthropic 那家的旗舰模型)。多模态 Agent,就是又能看图、又能替你动手把活干成的那类智能体。这句话得扭着听:它自己说的接近,跟真追平了之间还隔着一截,官方没把这截抹掉。
它拿什么撑这话?官方在一个叫 Terminal Bench 的榜上给了个分数,83.9。这个榜专考让模型像干活的工程师一样,对着终端把事办成,不是背答案能糊弄过去的。83.9 什么概念?等于一张专门考动手干活的卷子,它答对了八成多,已经能排队进真干活的那群人里。
以前让模型看见,在不少厂商那儿往往更贵;现在平价档的国产模型把它补上了。这一截,才是这则消息最容易被忽略的那一层。
一个「实验版」,凭什么跟最顶那档比
可它到底是不是真追上了,还是只在特定那几道题上讨巧?这得说说它没摆在最前面的那部分。
它挑着讲。好的这一路,是让模型对着终端或界面、把活干成,像 Terminal Bench 那个 83.9。这类任务很垂直,栽进去的是专门训练过的赛道。换一类让它看着图去干活的题——多模态 Agent 那类基准,像 ApexBench——分数就又掉下来了,36.5;还有几道考视觉的题,都在三五十分以下。它会看、能干活,但从这些分数看,还看不出它真懂图;懂图,和在这一类图上把活干成,是两码事。

有一处我想让你留个心眼。它把最漂亮那一项的分数顶在最前头,就是那个 83.9;至于考视觉的那几道题,分数就没那么好看了。这不算作弊,任何一家发实验版模型都这么干,先把能打的亮出来。你拿到手的东西,是不是最该看的那一面,得你自己翻。
大多数人还没反应过来,变的是「喂进去的东西」
讲到这,别再把它当成又一次跑分竞赛。它动的这一端,很难被注意到。
以前你喂给模型的,是被你翻译过一遍的东西。把表、把界面、把纸页,翻成它一个字一个字能读的文本。现在这一层翻译省了。你得把图讲给它听那种日子,正在过去。
对大多数正在拿 AI 干活的人来说,这一截才是让工作流变轻的地方。你不用再雇那个「会替你把截图描述成文字」的人,也不用自己中途停下来干那截纯体力活。这一层,比它分数涨了多少更值得你多看两眼。

从「帮你写」到「帮你看见」
我看到这则消息的第一反应,挺意外的是它居然能省掉这一截。它还拖着实验版三个字,分数也有一半是挑着报的。但当把图丢给 AI 变得跟把字丢给 AI 一样顺手那天,你会发现那个替你把表格敲成字的人,不管那是你自己还是一个岗位,已经被悄悄省掉了。
再往前说一步,这轮升级让 AI 从帮你写,走到帮你看见。你上一次对着截图手敲了半天字,是给哪张表?那件事现在也许一秒钟就过去了。

本文事实来源
- DeepSeek 官方网站:《API 更新日志》(deepseek-v4-flash-vision-exp,2026-08-21 发布;官方口径「纯文本能力与 V4-Flash 正式版持平」「多模态 Agent 能力已接近 Opus-4.8」;Terminal Bench 2.1: 83.9)
【引用出处】
- DeepSeek 官方《API 更新日志》— https://api-docs.deepseek.com/zh-cn/updates (对应文中:发布日期 2026-08-21、模型名与实验性质、「纯文本与 V4-Flash 正式版持平」、「多模态 Agent 能力已接近 Opus-4.8」原话、Terminal Bench 2.1: 83.9 与 ApexBench 等基准分值)