多模态输入
在同一条用户消息中发送文本和图片内容。
多模态输入让支持该能力的模型同时处理文本和图片等内容。本页以图文聊天请求为例,不表示所有模型都支持图片、音频或视频。
选择模型
调用前请在模型目录中确认:
- 模型支持图片输入。
- 模型支持聊天补全接口。
- 图片格式、数量、大小和分辨率符合限制。
- 当前 API Key 可以访问该模型。
图文消息示例
{
"model": "YOUR_MULTIMODAL_MODEL_ID",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "请描述图片中的主要内容。"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}这是兼容结构示例。URL、Base64 或其他输入方式是否可用,以所选模型说明为准。
准备图片
| 检查项 | 说明 |
|---|---|
| 可访问性 | 图片地址必须能被执行请求的服务访问 |
| 文件格式 | 使用模型明确支持的 MIME 类型 |
| 文件大小 | 不要超过单图和总请求体限制 |
| 图片数量 | 不要超过单次请求允许的数量 |
| 数据权限 | 确认你有权提交和处理图片内容 |
本地文件路径或需要浏览器登录的网页地址通常不能直接作为远程图片输入。不要为了调用接口而随意公开私密文件。
控制用量
图片可能采用不同于普通文本的计量规则。删除不必要的图片和重复历史,并按照模型说明核对媒体用量和费用。
常见问题
- 无法读取图片:检查地址是否返回真实图片,以及服务端是否可以访问。
- 格式不支持:转换为模型支持的格式,不要只修改文件扩展名。
- 请求过大:压缩、缩小或减少图片数量。
- 响应结构不同:按照所选模型的接口说明读取结果。