deepseek-v4-flash-vision-exp 模型支持图像理解:图片描述、截图文字提取、图表分析。支持 JPEG/PNG/GIF/WebP,格式按实际文件内容检测。
三种传入图片的方式:
- Base64 内联编码 — 最简单,适合本地文件。编码后计入 48MiB 请求体上限。
- 外部图片 URL — 公开可访问的 http(s) 链接,最长 8192 字符,图片文件 ≤32MiB,下载限时 60 秒。
- Files API — 上传一次,通过 file_id 引用。适合重复使用、大图片(最大 64MiB),不占请求体限制。
detail 参数控制处理精度:low(快速缩略图)、high(高分辨率裁切)、original(原图)、auto(自适应)。
Token 计算:所有图片自动缩放到约 800×800 以内,单张图片上限 384 tokens。多图各自独立计数。
限制:仅支持用户消息中的图片,仅 vision 模型接受。同时兼容 OpenAI 和 Anthropic API 格式,也支持 Responses API 的 input_image。