DeepSeek 识图上线:5 大入口保姆级配置

发布于 · 1,009 字 · 约 3 分钟#Models#CLI原文链接
DeepSeek 识图上线:5 大入口保姆级配置 封面图
  • DeepSeek-V4-Flash-Vision-Exp 与 Flash 同价,支持低价的图像理解 API 调用
  • 官方 Chat、DeepSeek Harness、cc-switch、ZCode 和 Obsidian 都可作为识图入口
  • dsh 运行在本地 Web GUI,选择 Vision 模型并上传图片即可完成测试
  • cc-switch 可将 DeepSeek Vision 配置带入 Claude Code CLI 等兼容客户端
  • 同一图片测试中,dsh 约 4 秒、Claude Code CLI 约 6 秒、ZCode 约 13 秒响应

大家期待已久的 DeepSeek 多模态模型终于上线了。8 月 21 日,官方 X 发布公告上线多模态支持,模型 ID 为 deepseek-v4-flash-vision-exp,价格与 deepseek-v4-flash 保持一致。

DeepSeek 识图上线 X 公告
DeepSeek 识图上线 X 公告

使用 model='deepseek-v4-flash-vision-exp' 即可调用。此外,DeepSeek Harness 0.1.1 已于 8 月 21 日发布,内置对新模型的支持。

模型性能与价格

DeepSeek V4 Flash Vision Exp benchmark
DeepSeek V4 Flash Vision Exp benchmark

价格方面,与 deepseek-v4-flash 一致。百万 tokens 输入缓存命中,空闲时段为 0.05 元,高峰时段为 0.1 元。百万 tokens 输出,空闲时段为 4.5 元,高峰时段为 9.0 元。

空闲时段价格为高峰时段价格的一半。高峰时段为北京时间 9:00 至 12:00、14:00 至 18:00,其余时间为空闲时段。

官方定价说明见 DeepSeek API 定价。

模型价格信息
模型价格信息

官方 Chat 入口

打开 DeepSeek 官网,选择「识图模式」。

DeepSeek 官方 Chat 入口中的识图模式
DeepSeek 官方 Chat 入口中的识图模式

上传图片即可测试效果。

DeepSeek Chat 识别梁文峰图片的结果
DeepSeek Chat 识别梁文峰图片的结果

在 DeepSeek Harness 中使用

桌面客户端,适合新手

如果你没有 Mac 和 Node.js 环境,或不想一直开着浏览器标签页,可以使用社区基于 DeepSeek Harness 构建的开源桌面客户端 DSH Desktop。

它让 dsh 脱离浏览器、以原生窗口直接运行,支持多窗口和系统托盘常驻。官网提供 Mac 与 Windows 的安装包,启动时会自动拉起 dsh web 本地服务,对新手更友好。

DSH Desktop 桌面客户端
DSH Desktop 桌面客户端

更新 dsh 到最新版本

第一次安装 dsh,可参考博客的 DeepSeek Harness 安装配置保姆教程。

如果此前已经安装过 dsh,使用下面的命令升级到最新版:

npx @deepseek-ai/dsh@latest web

如果命令太慢或卡住,可以从下面几种方式里选择一种。

# 换 npm 镜像源
npx --registry=https://registry.npmmirror.com @deepseek-ai/dsh@latest web

# 永久使用镜像源
npm config set registry https://registry.npmmirror.com

# 全局安装,后续直接运行
npm install -g @deepseek-ai/dsh
dsh web

# 通过代理下载
HTTPS_PROXY=http://127.0.0.1:7890 npx @deepseek-ai/dsh@latest web

# 查看命中的 registry 和下载阶段
npm --loglevel=http npx @deepseek-ai/dsh@latest web

更新后运行 dsh --version,确认版本已经更新。不了解 DeepSeek Harness 的读者,也可以先阅读 官方介绍。

dsh 更新后的版本信息
dsh 更新后的版本信息

启动 Web GUI

执行 dsh web,然后打开 http://127.0.0.1:3080/。

dsh web

启动后,在 DeepSeek 模型分组中会出现新增的「DeepSeek-V4-Flash-Vision-Exp」选项,选择它即可测试。

dsh Web GUI 中的 DeepSeek Vision 模型
dsh Web GUI 中的 DeepSeek Vision 模型

上传一张图片测试,响应时间约为 4 秒。

dsh Web GUI 图像识别测试结果
dsh Web GUI 图像识别测试结果

通过 API Key 接入

cc-switch

这里演示用 cc-switch 配置。前往 DeepSeek 开放平台 获取 API Key,然后按截图填写信息。

cc-switch 中添加 DeepSeek API 配置
cc-switch 中添加 DeepSeek API 配置

点击「获取模型列表」,在默认兜底模型中选择 deepseek-v4-flash-vision-exp,勾选 1M,再点击上方的「一键设置」。

cc-switch 选择 DeepSeek Vision 模型
cc-switch 选择 DeepSeek Vision 模型

以下是配置完成后的效果。

cc-switch 配置完成
cc-switch 配置完成

回到 cc-switch 首页,点击「启用」,配置即完成。

cc-switch 启用配置
cc-switch 启用配置

选择刚才添加的模型后,直接在 Claude Code CLI 中测试。同一张图片约 6 秒即可响应,内容也比较简洁准确,会从「人物」「场景」「特征」三个角度描述画面。

Claude Code CLI 图像识别测试结果
Claude Code CLI 图像识别测试结果

智谱 ZCode

ZCode 是智谱官方的 AI Agents Harness 项目,官网介绍是「简单、迅捷、氛围十足」。下载地址见 ZCode。

ZCode 下载页面
ZCode 下载页面

选择刚才添加的模型,使用同一张图片测试。

ZCode 中选择 DeepSeek Vision 模型
ZCode 中选择 DeepSeek Vision 模型

约 13 秒成功响应,内容与前面的测试基本一致,速度稍慢一些。

ZCode 图像识别测试结果
ZCode 图像识别测试结果

Obsidian,可选

如果你使用 Obsidian,配置好 Claudian 插件后即可直接对话。插件会自动加载 Claude Code CLI 的模型,也就是前面在 cc-switch 中配置的模型。

Obsidian 中的 Claudian 插件
Obsidian 中的 Claudian 插件
Obsidian 使用 DeepSeek Vision 测试图像识别
Obsidian 使用 DeepSeek Vision 测试图像识别

这次识图能力意味着什么

放在更大的背景看,这次更新补上了开源阵营长期缺失的一块:好用的视觉理解。

过去想在 Agent 工作流里加图片识别,选择其实很有限:要么走 MCP 方案(例如 GML),要么依赖 ChatGPT、豆包 seed 系列这类闭源多模态模型,门槛不低——就连 Claude Code 官方,至今也不支持图片识别。

而现在,一个与 Flash 同价、实测几秒内响应、还能直接挂进 Claude Code CLI 生态的开源视觉模型出现了。对开发者来说,「用得起」和「用得上」第一次同时成立,它很可能成为第一个兼顾性价比与实用性的开源图像识别方案。

往后看,它可以接入更多现有工作流与 Agent,衍生出图片识别、图片修复和编辑等场景,进一步拓宽 AIGC 开源生态的应用边界。

评论互动

© 2026 王若风的技术博客 · Powered by Astro