多模态能力是否可用取决于模型本身和 API 密钥限制。调用前请在模型广场确认模型能力标签。
图像理解
让模型读取图片内容,完成描述、识别、对比、信息抽取和视觉问答。
图像生成
根据文本提示生成图像,或基于已有图片进行风格调整与编辑。
PDF 文件
将 PDF 内容作为上下文输入模型,用于总结、问答、提取字段和生成结构化结果。
Markdown 文件
将 README、说明文档、变更记录等 Markdown 内容作为文本上下文输入对话或 API。
图像理解
图像理解用于让模型读取图片,并返回文字分析结果。常见任务包括图片描述、商品识别、票据字段提取、截图问答和图文混合推理。图像生成
图像生成用于根据提示词创建图片,或以已有图片作为参考进行编辑。你可以把生成任务用于配图、草图、海报、概念设计和素材迭代。PDF 文件
PDF 文件通常先作为文档内容输入模型,再让模型执行总结、问答、字段抽取或格式转换。对于长文档,建议先拆分章节或页码,并在请求中明确需要处理的范围。Markdown 文件
Markdown 文件适合处理 README、接口说明、项目笔记、知识库条目和变更记录。“对话”支持直接上传.md 与 .markdown 文件;接口调用时,将 Markdown 正文作为文本放入 messages.content,模型即可按普通上下文读取。
后续步骤
- 查看图像示例:参阅 视觉与图像生成。
- 处理 Markdown:参阅 Markdown 文件。
