多模态输入
支持视觉能力的模型可以在对话中接收图片和 PDF,与文本一起处理。发送图片(URL)
发送图片(本地 base64)
detail 参数
image_url 对象支持 detail 字段,控制图片处理精度:
"auto"(默认):由模型根据图片大小自动选择。"low":降采样到 512×512,消耗 token 更少,适合不需要细节的场景。"high":保留高分辨率,消耗 token 更多,适合需要识别文字或细节的图片。
支持的能力
本网关当前不提供音频转录或语音输入能力。如需处理音频内容,请先在本地转录为文本后再发送。