1 minrss原文 ↗

DeepSeek Vision API 使用指南

为什么值得读DeepSeek Vision 模型的官方完整 API 指南:三种传图方式、token 计算规则、文件大小限制和 Anthropic 兼容格式。搞多模态调用的速查文档。

deepseek-v4-flash-vision-exp 模型支持图像理解:图片描述、截图文字提取、图表分析。支持 JPEG/PNG/GIF/WebP,格式按实际文件内容检测。

三种传入图片的方式:

  1. Base64 内联编码 — 最简单,适合本地文件。编码后计入 48MiB 请求体上限。
  2. 外部图片 URL — 公开可访问的 http(s) 链接,最长 8192 字符,图片文件 ≤32MiB,下载限时 60 秒。
  3. Files API — 上传一次,通过 file_id 引用。适合重复使用、大图片(最大 64MiB),不占请求体限制。

detail 参数控制处理精度:low(快速缩略图)、high(高分辨率裁切)、original(原图)、auto(自适应)。

Token 计算:所有图片自动缩放到约 800×800 以内,单张图片上限 384 tokens。多图各自独立计数。

限制:仅支持用户消息中的图片,仅 vision 模型接受。同时兼容 OpenAI 和 Anthropic API 格式,也支持 Responses API 的 input_image。

如果可以重来,你还愿意花这段时间读它吗?

· 匿名阅读记录只用于改进推荐

DeepSeek Vision API 使用指南 | DeepRead