Skip to main content
Moxus AI 支持图像理解、图像生成和图像编辑。不同模型的输入格式、尺寸、数量和返回格式可能不同;本页示例分别使用 gpt-5.4 进行图像理解,以及 grok-imagine-image 进行图像生成。

图像理解

发送公网图片 URL,或读取本地图片并以 Base64 方式传入。

图像生成

根据文本提示词生成图片,并将返回的 Base64 内容保存为本地文件。

图像编辑

基于已有图片进行编辑,具体能力取决于所选模型。

提示词建议

用主体、风格、构图和约束描述你需要的图片。
如果你还在调试提示词,可以先到网页端“对话”选择图像生成模型直接生成图片。确认模型和提示词效果后,再使用本页的 API 示例接入外部程序。

图像理解

图像理解使用 OpenAI 兼容的 chat/completions 接口。图片可以传公网 URL,也可以把本地图片转为 Base64 后通过 data: URI 传入。示例模型为 gpt-5.4

使用本地图片

本地图片会由代码读取并自动转换为 Base64,再随请求发送。Python 示例中的 IMAGE_PATH = "photo.jpg" 表示图片与 Python 文件放在同一项目文件夹,且文件名必须与实际图片完全一致,包括扩展名和大小写;图片在其他位置时,改为完整本地路径。Node.js 示例使用 const IMAGE_PATH = "photo.png",将图片与 .mjs 文件放在同一项目文件夹后,从该文件夹终端运行代码。若文件名或格式不同,修改 IMAGE_PATHIMAGE_MIME_TYPE
Python 和 Node.js 示例的依赖安装、运行方式及环境问题,参阅 常见问题

图像生成

图像生成使用 OpenAI 兼容的 /v1/images/generations 接口。本页示例使用 grok-imagine-image;不同模型支持的尺寸、数量和返回格式可能不同,接入前请先在模型广场确认模型名称与计费方式。

图像编辑

图像编辑用于基于已有图片修改背景、局部内容或整体风格。编辑接口、文件上传方式和可用参数由模型决定;调用前请在模型广场确认所选模型支持图像编辑。

提示词建议

  • 描述主体、风格、构图、光线、色调及背景。
  • 明确图片用途和限制,例如尺寸比例、需要保留或避免的元素。
  • 需要稳定字段时,将图像理解与 结构化输出 结合使用。

计费说明

  • 图像理解:图像会被换算为一定数量的输入 Token 参与计费,图像越大或越清晰,Token 越多。
  • 图像生成与编辑:通常按次固定计费,也可能随尺寸或模型而变化。
具体价格参见 模型与定价

注意事项

  • 仅使用模型广场标记支持对应能力的模型。
  • 过大的图像会消耗更多 Token 或被拒绝,必要时先压缩。
  • 使用图片 URL 时,确保该 URL 可被公网访问。

后续步骤