Skip to main content

多模态输入

支持视觉能力的模型可以在对话中接收图片和 PDF,与文本一起处理。

发送图片(URL)

发送图片(本地 base64)

detail 参数

image_url 对象支持 detail 字段,控制图片处理精度:
  • "auto"(默认):由模型根据图片大小自动选择。
  • "low":降采样到 512×512,消耗 token 更少,适合不需要细节的场景。
  • "high":保留高分辨率,消耗 token 更多,适合需要识别文字或细节的图片。

支持的能力

本网关当前不提供音频转录或语音输入能力。如需处理音频内容,请先在本地转录为文本后再发送。