1. 接入指南
拍我AI 开放平台
  • 开始使用
    • 快速开始
    • API 工作流程
    • 如何购买API 服务
    • paiwo-PixVerse-api-llm.txt
  • 模型与能力
    • 模型总览
    • 能力矩阵
    • C1
    • V6
    • 模型与点数消耗
  • 接入指南
    • 检查账户余额
    • 获取视频生成状态
    • 特效模板使用指南
    • 文本生成视频使用指南
    • 图像生成视频使用指南
    • 图片模板使用指南
    • 视频编辑(Modify) 功能使用指南
    • 主体替换(Swap)使用指南
    • 首尾帧功能使用指南
    • 续写(Extend)功能使用指南
    • 对口型(Lipsync)接口使用指南
    • 音效生成(背景音乐)使用指南
    • 多主体(参考生)功能使用指南
    • 多主体(参考生)功能-v6 视频参考调用指南
    • 重绘功能使用指南
    • 多帧(Multi-transiton)功能 使用指南
    • 动作模仿(Mimic) 功能使用指南
    • 如何使用Webhook 回调?
    • 获取特效模板列表
    • 图片数字人(Avatar)接口使用指南
  • API 接口
    • 视频生成
      • 生成文生视频
      • 生成图生视频
      • 生成视频模版
      • 首尾帧生成视频
      • 生成延长(Extend)视频
      • 多主体(多参考)生成视频
      • 获取视频状态
      • 生成对口型(Lipsync)视频
      • 获取TTS 音色
      • 音效生成(sound_effect)接口
      • 重绘视频生成视频
      • 重绘效果列表
      • 主体替换(Swap) Mask 生成
      • 主体替换(Swap) 视频生成
      • 多帧(Multi-transition) 视频生成
      • 动作模仿(Mimic) 视频生成
      • 视频编辑(Modify) 生成视频
      • 超清视频
      • 图片数字人(Avatar)接口
    • 图片生成
      • 图片模版生成接口
      • 图片结果查询接口
    • 查询账号余额
    • 上传图片
    • 上传资源(视频/音频)
    • 获取特效模板列表
    • 创建自定义音色
    • 删除自定义音色
  • 问题排查
    • 常见错误及解决方案
    • FAQ
  • 资源中心
    • 技术支持/联系我们
    • 更新日志
    • 服务条款
    • 隐私协议
    • 附加工具
    • 预付资源包与企业定制
  1. 接入指南

图片数字人(Avatar)接口使用指南

图片数字人(Avatar)接口使用已上传的人物图片、数字人模型和声音生成视频。图片必须先通过上传图片接口取得 img_id;声音可以使用已上传的成品音频,也可以使用平台内置或用户自定义的 TTS 音色。

接口形式图片数字人#

创建图片数字人:图片数字人(Avatar)接口文档
上传图片:上传图片接口文档
上传成品音频或音色样本:上传资源(视频/音频)接口文档
查询 TTS 音色:获取 TTS 音色接口文档
创建自定义音色:创建自定义音色接口文档
删除自定义音色:删除自定义音色接口定义
查询视频状态:获取视频状态接口文档

前提条件#

开始之前,请确保您拥有:
有效的拍我 AI API 密钥;
每次请求唯一的 Ai-Trace-Id;
上传图片接口返回的 img_id;
以下两种声音来源之一:
上传资源接口返回的成品音频 media_id;
TTS 台词和有效的 speaker_id。
上传图片接口支持:
本地图片文件,通过 image 上传;
图片 URL,通过 image_url 上传。
两种方式都只用于取得 img_id,不能把图片文件或 URL 直接传给图片数字人生成接口。上传图片支持 png、webp、jpeg、jpg,最大 20MB,图片尺寸在 10000px 以内。

快速调用#

1. 上传图片并取得 img_id
2. 准备声音
3. 创建图片数字人任务
4. 查询生成状态并获取视频
5. 删除不再使用的自定义音色(可选)

使用步骤#

步骤 1:上传图片#

调用上传图片接口,通过以下任一字段提交图片:
字段类型使用规则
imagebinary上传本地图片文件时使用
image_urlstring通过图片 URL 上传时使用
image 和 image_url 二选一。无论使用哪种方式,下一步都只使用接口返回的 Resp.img_id。

步骤 2:准备声音#

创建图片数字人任务支持两种声音来源:
声音来源请求字段处理方式
已上传的成品音频audio_media_id直接使用成品音频驱动口型,不执行 TTS
TTSlip_sync_tts_content + lip_sync_tts_speaker_id使用指定的系统音色或自定义音色朗读台词并驱动口型
声音字段必须遵守以下规则:
audio_media_id 和 lip_sync_tts_content 二选一;
两者都不传时,接口返回缺少声音来源;
两者同时传入时,接口返回声音来源冲突;
使用 TTS 时,lip_sync_tts_content 为 30–200 个字符;
lip_sync_tts_speaker_id 可以是有效的系统音色 ID、自定义音色 ID,或表示使用默认音色的 auto;
音色不存在或当前账号无权使用时,接口返回参数错误。

步骤 3:创建图片数字人任务#

请求地址:
Header:
字段类型必填说明
API-KEYstring是API 鉴权
Ai-Trace-Idstring是每次请求使用唯一值
Content-Typestring是固定为 application/json
Request Body:
字段类型必填规则说明
img_idint64必填上传图片接口返回的图片资源 ID,仅支持一张图片
qualitystring必填当前支持 360p、540p 、720p、1080p
promptstring否描述人物动作、姿态、表情或画面要求
audio_media_idint64条件必填已上传的成品音频 media_id;与 lip_sync_tts_content 二选一
lip_sync_tts_contentstring条件必填TTS 台词,30–200 个字符;与 audio_media_id 二选一
lip_sync_tts_speaker_idstring条件必填使用 TTS 时传入的系统或自定义音色 ID;可传 auto
webhook_idstring否使用平台已经配置的 webhook

使用上传的成品音频#

{
  "img_id": 1233333,
  "quality": "720p",
  "prompt": "人物双手交叠,保持静止不动",
  "audio_media_id": 23424143
}

使用平台内置或默认 TTS 音色#

{
  "img_id": 1233333,
  "quality": "720p",
  "prompt": "人物双手交叠,保持静止不动",
  "lip_sync_tts_content": "大家晚上好",
  "lip_sync_tts_speaker_id": "auto"
}

使用自定义 TTS 音色#

{
  "img_id": 1233333,
  "quality": "720p",
  "prompt": "人物双手交叠,保持静止不动",
  "lip_sync_tts_content": "大家晚上好",
  "lip_sync_tts_speaker_id": "speaker_custom_123"
}
此时不传 audio_media_id。音色样本只在创建自定义音色时使用;图片数字人任务只引用创建接口或音色列表接口返回的 speaker_id。
成功响应字段:
字段类型说明
ErrCodeint0 表示成功
ErrMsgstring错误信息
Resp.video_idint64生成任务 ID
Resp.creditsint本次任务消耗或预计消耗的积分

步骤 4:查询状态并获取视频#

调用获取视频状态接口:
status含义处理方式
1生成成功使用 Resp.url 获取视频
5生成中继续轮询
7内容审核未通过停止轮询
8生成失败停止轮询

自定义音色生命周期#

1.
**上传样本:**调用上传资源接口,取得样本音频的 Resp.media_id。样本音频时长小于 30 秒。
2.
**创建音色:**调用 POST /openapi/v2/video/tts_speaker,将样本 media_id 作为 audio_media_id,取得 Resp.speaker_id。
3.
**查询音色:**调用 GET /openapi/v2/video/lip_sync/tts_list;传 speaker_type=custom 可查询当前用户的自定义音色,通过返回的 speaker_id 和 name 识别音色。
4.
**使用音色:**创建图片数字人任务时,将自定义 speaker_id 传入 lip_sync_tts_speaker_id,同时传入 lip_sync_tts_content。
5.
**删除音色:**调用 DELETE /openapi/v2/video/tts_speaker/{speaker_id}。该接口没有请求体。
字段流转关系:
阶段取得的字段下一步用途
上传音色样本Resp.media_id创建音色请求的 audio_media_id
创建自定义音色Resp.speaker_id图片数字人请求的 lip_sync_tts_speaker_id
查询音色列表Resp.data[].speaker_id重新选择或确认可用的自定义音色
删除自定义音色speaker_id作为 DELETE 接口的 Path 参数

自定义音色无法使用时#

确认创建音色接口返回 ErrCode=0,并取得了 Resp.speaker_id;
使用 speaker_type=custom 查询音色列表,确认该音色属于当前 API 账户;
将返回的 speaker_id 原样传入 lip_sync_tts_speaker_id,并同时传入 lip_sync_tts_content;
不要把创建音色时使用的样本 media_id 传入图片数字人的 TTS 请求。

调用规则核对#

生成请求只接收上传图片接口返回的 img_id,不接收图片文件或图片 URL;
img_id、quality 均为必填字段;
成品音频字段为 audio_media_id;
成品音频和 TTS 台词不能同时使用;
使用 TTS 时,同时传入 lip_sync_tts_content 和 lip_sync_tts_speaker_id;
当前已确认的清晰度只有 720p 和 1080p;
删除自定义音色接口没有请求体。
修改于 2026-07-22 08:39:00
上一页
获取特效模板列表
下一页
生成文生视频
Built with