V4-Flash-Vision-Exp 已上线

DeepSeek网页版
深寻

深寻——不止懂文字,现在会看图了

多模态Agent能力接近 Opus-4.8 ApexBench 36.5 Agents' Last Exam 27.3 反超 Opus ZeroBench 35.0 反超 Opus

chat.deepseek.com 复制到浏览器直接打开
🖼️
图片描述 · 截图识别
描述图片内容,识别截图中的文字,让模型“看见”你的世界。
📊
图表分析 · 视觉推理
解读数据图表,进行视觉推理,Chartography 得分 64.3。
🔧
Agent看图 · 工具协同
在 Agent 框架内调用工具,多模态任务无缝协同。
完全免费 · 无广告
官方网页版与 App 完全免费,无任何广告和付费项目。
1M
超长上下文 Token
384
单图最多 Token
64.3
Chartography 得分
27.3
Agents' Last Exam

官方渠道与“深寻”产品定位

DeepSeek 由杭州深度求索人工智能基础技术研究有限公司开发,没有官方中文名,被媒体与用户亲切地称为“深寻”——Deep 意为“深”,Seek 意为“寻”。

01 网页版即开即用

DeepSeek 网页版无需下载、无需安装。打开任意浏览器,访问 chat.deepseek.com,点击“开始对话”即可使用。支持手机号、微信、邮箱三种登录方式。官方网页端与移动 App 完全免费,不包含任何广告和付费项目

2026 年 4 月,网页版上线“快速模式”与“专家模式”分层设计。快速模式适合日常对话、即时响应;专家模式擅长复杂问题,在高峰时段可能需要等待。两种模式下均可开启“深度思考”与“联网搜索”。

02 从纯文本到原生多模态

2026 年 8 月 21 日,DeepSeek 上线首个多模态视觉理解模型 V4-Flash-Vision-Exp,标志着“深寻”从纯文本大模型正式进化为原生多模态引擎

该模型在 DeepSeek-V4-Flash 架构基础上加入视觉模块并进行持续训练,在保留原有文本推理、代码与智能体能力的同时,获得图像理解能力。支持的图片格式包括 JPEG、PNG、GIF、WebP。

在纯文本能力(Agent、推理、世界知识等)方面,V4-Flash-Vision-Exp 与 V4-Flash 正式版持平;在需要视觉理解的 Agent Benchmark 上实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。

“深寻”长眼睛了:多模态视觉能力详解

2026 年 8 月 21 日,DeepSeek 正式上线 V4-Flash-Vision-Exp 多模态视觉理解模型,这是 DeepSeek-V4 系列首个实验性多模态模型。

视觉理解能力

模型支持在文本之外输入图片,可以让模型描述图片、识别截图中的文字、分析图表等。图片传入支持三种方式:Base64 内联、外部 URL、以及 Files API 的 file_id 引用。

支持的格式包括 JPEG、PNG、GIF、WebP。在 API 服务中,图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。这意味着在高峰价格下,一分钱可以请模型看 8 张图。

多模态解锁的 Agent 场景

V4-Flash-Vision-Exp 在各类 Agent 框架内展现出较好的多模态适配能力,能够有效支持借助多样化的 Agent 工具解锁更多实用的工作场景:

图片描述与截图识别 —— 描述图片、识别截图文字、分析图表;图表分析 —— Chartography 评测得分 64.3,与 Opus-4.8 的 65.0 基本持平;Agent 框架下的多模态任务 —— 官方展示了生成商业定制西藏自驾游 PPT、对 DeepSeek Harness 官网进行二次创作、制作黏土怪物风格动态特效前端 Mini Demo 三个典型场景。

评测基准 V4-Flash-Vision-Exp V4-Flash-0731 Opus-4.8
ApexBench (Pass@1) 36.5 26.2 39.4
Agents' Last Exam 27.3 25.2 25.7
Chartography 64.3 65.0
ZeroBench (Pass@5) 35.0 34.0
Terminal Bench 2.1 83.9 82.7 85.0

* 数据来源:DeepSeek 官方 API 文档及 Hugging Face 模型页公开评测结果。加粗绿色表示反超 Opus 数据。

Files API 与开源生态

随着视觉模型上线,DeepSeek 同步推出 Files API,开发者可以先上传图片文件,随后通过 file_id 在不同请求中引用同一文件,无需重复上传。

上传图片 → 获取 file_id
引用 file_id → 多请求复用
按 Token 计费 → 单图最多 384 tokens

Files API 免费使用。在 API 服务中,图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。

2026 年 8 月 31 日,DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT License 开源。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。

完全免费与核心能力

DeepSeek 官方 App 与网页端完全免费,不包含任何广告和付费项目。搭载 DeepSeek-V4 系列旗舰模型,支持 1M 超长上下文(约 75 万中文字)、联网搜索与深度思考模式。

2026 年 4 月 8 日,网页版已上线“快速模式”与“专家模式”分层设计。2026 年 4 月 24 日,DeepSeek-V4 预览版本正式上线并开源,1M 上下文成为所有官方服务的标配。

网页版使用引导

无需下载、无需安装——打开任意浏览器(Chrome / Safari / Edge),访问 https://chat.deepseek.com/,点击“开始对话”,支持手机号、微信、邮箱三种方式登录。

登录成功后即可开始对话,网页版提供“快速模式”和“专家模式”两种选择,同时可开启“深度思考”和“联网搜索”。

网页版使用指南

三步开启深寻多模态体验,全程无需下载安装。

打开浏览器

使用 Chrome、Safari 或 Edge 等任意现代浏览器。

访问入口

地址栏输入 chat.deepseek.com 并回车。

登录对话

选择手机号 / 微信 / 邮箱登录,点击“开始对话”。

上传图片

在对话中上传 JPEG / PNG / GIF / WebP 图片,体验看图能力。

常见问题

关于 DeepSeek 网页版与多模态能力的常见疑问解答。

DeepSeek 网页版需要付费吗?
完全免费。DeepSeek 官方 App 与网页端不包含任何广告和付费项目。登录 chat.deepseek.com 即可免费使用全部对话功能,包括多模态视觉理解。
“深寻”是什么?是官方名称吗?
DeepSeek 没有官方中文名。“深寻”是媒体与用户根据 Deep(深)+ Seek(寻)的组合给出的中文称呼,在社区中广泛使用。官方品牌标识仍为 DeepSeek 及蓝色鲸鱼 Logo。
网页版支持哪些图片格式?
V4-Flash-Vision-Exp 支持 JPEG、PNG、GIF、WebP 四种图片格式。格式由文件实际内容判断,而非文件名或声明的 MIME 类型。
上传图片会消耗多少 Token?
在 API 服务中,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。网页版对话中上传图片同样受此规则约束。Files API 本身免费使用。
网页版有哪几种对话模式?
网页版提供“快速模式”与“专家模式”。快速模式适合日常对话、即时响应;专家模式擅长复杂问题,高峰时段可能需要等待。两种模式下均可开启“深度思考”和“联网搜索”。

现在就开始,让深寻看见你的世界

打开浏览器,访问 chat.deepseek.com
体验多模态视觉理解,完全免费,无广告。