尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

DeepSeek 多模态 API 调用完全指南:从调用到效果,一篇讲透

DeepSeek 多模态 API 调用完全指南:从调用到效果,一篇讲透 2026年8月21日DeepSeek 正式上线 V4 系列首款视觉模型DeepSeek-V4-Flash-Vision-Exp开放多模态 API 服务。这是 DeepSeek 从纯文本大模型正式迈入多模态 Agent 赛道的重要一步。本文将从 API 调用、实际效果、中间层架构三个维度帮你一次讲透。一、模型速览项目详情模型名称DeepSeek-V4-Flash-Vision-Exp性质实验性模型上线日期2026年8月21日基于DeepSeek-V4-Flash 正式版总参数量2840 亿284B激活参数 130 亿13B/每 token架构Mixture-of-Experts (MoE)上下文窗口1,048,576 tokens约 100 万最大输出384,000 tokens默认并发限制2,500 请求是否开源权重未开源核心能力定位在纯文本能力Agent、推理、世界知识等上与 DeepSeek-V4-Flash 正式版完全持平在需要视觉理解的 Agent Benchmark 上实现大幅跃升多模态 Agent 能力已接近 Claude Opus 4.8。简单来说DeepSeek 不再只是别人负责看、DeepSeek 负责想而是变成了自己看、自己理解、自己推理、自己调用工具完成任务的完整 Agent 闭环。二、如何调用 API2.1 调用入口只需将model参数设置为deepseek-v4-flash-vision-exp即可通过 DeepSeek API 调用视觉理解能力。# 最简调用示例 from openai import OpenAI client OpenAI( base_urlhttps://api.deepseek.com, api_keyYOUR_API_KEY ) response client.chat.completions.create( modeldeepseek-v4-flash-vision-exp, messages[ { role: user, content: [ {type: text, text: 请描述这张图片的内容}, {type: image_url, image_url: {url: https://example.com/chart.png}} ] } ] ) print(response.choices[0].message.content)2.2 三种 API 调用格式本次多模态 API 同时兼容三种格式方便接入各类 Agent 工具格式说明Chat Completions标准 OpenAI 兼容格式支持图文混合输入MessagesAnthropic 兼容格式ResponsesDeepSeek 原生格式三种格式均支持图文混合输入在用户消息中同时包含文本和图片即可。注意图片只能出现在用户消息中。如果图片出现在 system 或 assistant 消息中会返回 400 错误。2.3 三种图片传入方式方式说明适用场景Base64 内联将图片编码为 Base64 字符串直接嵌入请求体小图片、离线环境外部 URL提供图片的 HTTP/HTTPS 链接图片已托管在服务器Files API先上传图片获取 file_id后续请求中引用同一图片反复使用、省带宽方式一Base64 内联import base64 with open(screenshot.png, rb) as f: img_b64 base64.b64encode(f.read()).decode(utf-8) response client.chat.completions.create( modeldeepseek-v4-flash-vision-exp, messages[{ role: user, content: [ {type: text, text: 分析这张截图中的错误信息}, {type: image_url, image_url: { url: fdata:image/png;base64,{img_b64} }} ] }] )方式二外部 URLresponse client.chat.completions.create( modeldeepseek-v4-flash-vision-exp, messages[{ role: user, content: [ {type: text, text: 这个图表说明了什么}, {type: image_url, image_url: { url: https://cdn.example.com/report-chart.png }} ] }] )方式三Files API推荐完全免费# 第一步上传图片获取 file_id upload_response client.files.create( fileopen(report-chart.png, rb), purposevision ) file_id upload_response.id # 例如: file_abc123 第二步在请求中引用 file_id response client.chat.completions.create( modeldeepseek-v4-flash-vision-exp, messages[{ role: user, content: [ {type: text, text: 分析这张图表的趋势}, {type: image_url, image_url: { url: ffile://{file_id} }} ] }] ) 第三步同一张图片可反复使用无需重复上传 适用于多轮 Agent 工作流中持续处理同一批视觉素材2.4 支持的文件格式格式支持JPEG✅PNG✅GIF✅WebP✅格式检测基于文件的实际内容而非扩展名或 MIME 类型。2.5 图片输入限制限制项内联Base64/URLFiles API单文件大小上限32 MiB64 MiB最大图片边长8,192 px≥15 张图时降至 4,096 px—单请求最多图片数600 张—请求体大小上限48 MiB200 MiB图片 token 预算最多 384 tokens/张同样重要提示所有图片会被自动缩放到约800×800 像素等效分辨率超过该有效分辨率的细节会被丢弃——这是 384 token 固定预算的直接结果。三、调用效果基准测试全面对比3.1 核心结论在 11 项基准测试中DeepSeek-V4-Flash-Vision-Exp 的表现可以概括为赢下 3 项vs Opus 4.8DeepSWE1.3、Agents Last Exam1.6、ZeroBench1.0多项差距在 1-2 分以内Terminal Bench、Toolathlon-Verified、Chartography、AutomationBench差距最大的 2 项NL2Repo差 12 分、DSBench-Hard差 8.1 分3.2 完整基准测试数据3.2.1 文本型 Agent 评估基准测试Vision-ExpFlash-0731Opus 4.8Terminal Bench 2.183.982.785.0NL2Repo57.754.269.7Cybergym75.376.778.3DeepSWE59.354.458.0Toolathlon-Verified75.970.376.2DSBench-Hard63.659.671.7AutomationBench (Public)25.725.127.23.2.2 多模态 Agent 评估基准测试Vision-ExpFlash-0731Opus 4.8ApexBench (Pass1)36.526.2**39.4Agents Last Exam27.325.2**25.7Chartography64.3—65.0ZeroBench (Pass5)35.0—34.0注Flash-0731 在这两项多模态基准上是无视其中包含的多模态元素进行评分的纯文本模型盲测对比不完全对等。3.3 实际应用场景官方展示了 V4-Flash-Vision-Exp 在各类 Agent 框架内的多模态适配能力商业 PPT 制作模型可以理解真实摄影图片风格、野性原始探索感等抽象风格化要求网站视觉重构对 DeepSeek Harness 官网进行二次创作前端 Mini Demo制作黏土怪物风格动态特效的前端 Mini Demo图片内容描述自然语言描述图片内容截图文字识别OCR识别截图中的文字图表分析解析图表数据并给出洞察四、中间层架构详解DeepSeek Harness 0.1.1多模态 API 的上线并非孤立事件DeepSeek 同日发布了Harness v0.1.1-rc.1版本更新这是整个多模态生态的中间层——连接开发者与模型能力的关键桥梁。4.1 版本迭代历程自开发者预览版 v0.1.0-rc.6 首日发布以来DeepSeek Harness 已连续完成三次版本更新版本核心内容v0.1.0-rc.7多模态核心能力开放v0.1.0-rc.8多模态基础支持v0.1.1-rc.1原生图片请求、多模态模型选项、持久化附件4.2 多模态能力增强功能说明模型适配器新增 DeepSeek-V4-Flash-Vision-Exp 多模态模型选项支持配置原生图片请求/goal、/plan 命令从纯文本升级为支持图文混合输入 菜单从仅引用文件扩展为可引用文件和历史会话MCP/ACP 附件持久化图片附件在多次调用间保持不会随单次调用结束而消失PTC Mode支持转发嵌套图片4.3 子代理与插件架构功能说明Codex 与 Claude Code从捆绑分发改为按需安装的 Profile BundleCodex 非交互权限模式支持在无人值守流程中运行Codex 多命名实例允许同时运行多个配置不同、名称各异的子智能体回报路径优化reportDelivery 及时反馈并唤醒父任务消除盲目等待插件注册插件可自行注册设置卡片能力扩展与任务管理更便捷4.4 稳定性与性能优化项目说明web_search支持并发查询Windows PTY正式加入持久 PowerShell 会话支持极简模式默认开启SQLite 后端读写和分叉性能显著提升存储体积降低修复项长会话、终端兼容、模型请求、沙箱权限等问题交互细节提问卡片、Markdown 表格、多行输入、会话切换优化4.5 架构关系图五、价格一张图不到 1 分钱5.1 计费方式图片会转换为 token 后按 token 计费一张图片最多占 384 tokens计费价格与 DeepSeek-V4-Flash 完全一致。5.2 价格表每百万 tokens费率非高峰时段高峰时段输入缓存未命中$0.22$0.44输入缓存命中$0.007$0.014输出$0.66$1.32高峰时段UTC 时间 01:00–04:00 和 06:00–10:005.3 换算成每张图场景单张图片成本非高峰缓存未命中约$0.000084不到 1 美分高峰时段最高约0.001152 元不到 0.002 元5.4 Files API项目详情费用完全免费单文件上限64 MiB总存储容量约 25 GiB核心价值同一张图片无需重复上传省带宽六、注意事项1.实验性质该模型为实验性版本能力可能随后续迭代调整2.权重未开源不同于 V4-Flash-0731 和 V4-Pro 0813Vision-Exp 权重未公开3.图片分辨率所有图片会被自动缩放到约 800×800 像素等效超过此分辨率的细节会丢失4.基准测试所有对比数据来自 DeepSeek 内部跑分DeepSeek Harness Minimal Mode尚无独立实验室复现5.费率变动非高峰费率较 7 月 31 日 V4-Flash-0731 发布时$0.14/$0.28有所上涨七、总结DeepSeek-V4-Flash-Vision-Exp 的上线标志着 DeepSeek 正式进入多模态 Agent 赛道。核心亮点可以概括为三句话能力文本能力不降级视觉能力逼近 Opus 4.8价格一张图不到 1 分钱Files API 免费生态Harness 中间层同步更新Agent 框架开箱即用对于开发者来说现在就可以用modeldeepseek-v4-flash-vision-exp开始接入多模态能力无需等待正式版。
返回列表