PPIO多模态:文本生成图像视频与语音 - Openclaw Skills

时间:2026-07-24 11:06:01 来源:互联网

什么是 PPIO 多模态执行?

PPIO 多模态技能通过集成最先进的生成能力,使 AI 智能体超越文本处理。此 Openclaw Skills 扩展支持广泛的创意和实用任务,包括文本生成图像 (T2I)、图像生成视频 (I2V) 以及高级语音服务,如文本转语音 (TTS) 和语音转文本 (STT)。

该技能专为响应速度和透明度而构建,包含内置的进度通知、成本估算和异步任务轮询逻辑。无论您是使用 Seedream 5.0 Lite 生成营销资产,还是使用 Vidu Q3 Pro 生成电影感视频,此集成都为多模态内容创建提供了强大的框架。

下载入口:https://github.com/openclaw/skills/tree/main/skills/ximasadila/ppio-multimodal

安装与下载

1. ClawHub CLI

从源直接安装技能的最快方式。

npx clawhub@latest install ppio-multimodal

2. 手动安装

将技能文件夹复制到以下位置之一

全局模式 ~/.openclaw/skills/ 工作区 <project>/skills/

优先级:工作区 > 本地 > 内置

3. 提示词安装

将此提示词复制到 OpenClaw 即可自动安装。

请帮我使用 Clawhub 安装 ppio-multimodal。如果尚未安装 Clawhub,请先安装(npm i -g clawhub)。

PPIO 多模态执行 应用场景

  • 根据文本提示生成高质量图像或使用参考文件编辑现有图像。
  • 使用 Vidu Q3 Pro 创建短视频和动画以实现动态内容。
  • 使用各种男声和女声配置文件将文本转换为自然听感的旁白 (TTS)。
  • 将音频文件转录为文本 (STT),用于文档记录或会议摘要。
  • 针对视频渲染等长时间运行的生成任务进行实时进度跟踪。
PPIO 多模态执行 工作原理
  1. 任务识别:AI 智能体将用户请求识别为多模态任务(例如,“生成一张猫的图片”)。
  2. 身份验证:该技能从用户消息、本地配置文件或环境变量中获取所需的 API Key。
  3. 进度启动:在调用 API 之前,该技能向用户发送强制性的进度更新,包括正在使用的模型和估计成本。
  4. API 执行:该技能向 PPIO 端点(例如 /v3/seedream-5.0-lite)发送请求。
  5. 状态轮询:对于视频生成等异步任务,该技能每 15 秒轮询一次任务状态,向用户更新队列和处理状态。
  6. 结果交付:完成后,该技能返回媒体资产的最终 URL 以及实际消耗成本。

PPIO 多模态执行 配置指南

要在 Openclaw Skills 生态系统中使用此功能,请使用以下方法之一配置您的 API Key:

选项 1:配置文件(推荐)

mkdir -p ~/.ppio && echo '{"api_key": "YOUR_API_KEY"}' > ~/.ppio/config.json

选项 2:环境变量

export PPIO_API_KEY="YOUR_API_KEY"

选项 3:直接参数

您也可以直接在提示词中传递 Key:Use API Key sk_xxx to generate an image of...

PPIO 多模态执行 数据架构与分类体系

该技能根据任务类型和模型端点组织请求如下:

任务类型 端点 主要模型
文本生成图像 /v3/seedream-5.0-lite Seedream 5.0 Lite
文本生成视频 /v3/async/vidu-q3-pro-t2v Vidu Q3 Pro
文本转语音 /v3/async/minimax-speech-2.8-turbo MiniMax Speech 2.8
语音转文本 /v3/glm-asr GLM ASR

所有任务均返回包含用于轮询的 task_id 或用于同步结果的直接 url 的 JSON 响应。

name: ppio-multimodal
description: |
  使用 PPIO 执行多模态任务:文生图、图生图、文生视频、图生视频、TTS、STT。
  适用于:生成图片、生成视频、文字转语音、语音识别。

PPIO 多模态执行

配置方式(三选一,按优先级)

方式1:配置文件(推荐)

创建文件 ~/.ppio/config.json

{
  "api_key": "你的API_Key"
}

一条命令完成配置:

mkdir -p ~/.ppio && echo '{"api_key": "你的API_Key"}' > ~/.ppio/config.json

方式2:环境变量

export PPIO_API_KEY="你的API_Key"

方式3:直接传参

在请求中直接提供:请用 API Key sk_xxx 生成一张图片...


API Key 读取逻辑

1. 检查用户消息中是否包含 API Key(sk_ 开头)
2. 检查配置文件 ~/.ppio/config.json
3. 检查环境变量 PPIO_API_KEY
4. 都没有 → 返回配置引导

配置引导消息(仅在未配置时显示):

您还没有配置 PPIO 的 API Key。

快速配置(复制运行):
mkdir -p ~/.ppio && echo '{"api_key": "你的Key"}' > ~/.ppio/config.json

获取 Key:https://ppio.com/settings/key-management

执行流程(重要!)

用户请求 → 识别任务 → 获取 Key → ?? 先发提示 → 执行任务 → 返回结果

?? 必须先发送进度提示

在调用 API 之前,必须先回复用户一条消息:

?? 收到!正在为您生成图片...

任务类型:文生图
使用模型:Seedream 5.0 Lite
预计耗时:5-15秒
预计费用:约 ¥0.245

请稍等,生成完成后会立即发送给您 ?

这条消息必须在执行 API 调用之前发送! 这样用户就知道任务已经开始处理,不会以为系统卡住了。

不同任务的提示模板

文生图:

?? 收到!正在为您生成图片...
使用模型:Seedream 5.0 Lite
预计耗时:5-15秒

文生视频:

?? 收到!正在为您生成视频...
使用模型:Vidu Q3 Pro
预计耗时:1-3分钟(视频生成较慢,请耐心等待)

TTS:

?? 收到!正在为您生成语音...
使用模型:MiniMax Speech 2.8 Turbo
预计耗时:5-15秒

完成后的回复

? 生成完成!

[图片/视频/音频 URL]

实际消耗:¥0.245

视频任务的轮询提示

视频生成需要轮询,每 15 秒更新一次状态:

?? 视频生成中...
当前状态:处理中
已等待:30 秒
预计还需:1-2 分钟

API 配置

配置项
Base URL https://api.ppio.com
鉴权 Authorization: Bearer <API_KEY>
获取 Key https://ppio.com/settings/key-management

任务类型与端点

任务 端点 模型
文生图 /v3/seedream-5.0-lite Seedream 5.0 Lite
图片编辑 /v3/seedream-5.0-lite Seedream 5.0 Lite
文生视频 /v3/async/vidu-q3-pro-t2v Vidu Q3 Pro
图生视频 /v3/async/vidu-q3-pro-i2v Vidu Q3 Pro
TTS /v3/async/minimax-speech-2.8-turbo MiniMax Speech 2.8
STT /v3/glm-asr GLM ASR
任务查询 /v3/async/task-result?task_id=xxx -

执行模板

文生图

curl -X POST "https://api.ppio.com/v3/seedream-5.0-lite" r
  -H "Authorization: Bearer $API_KEY" r
  -H "Content-Type: application/json" r
  -d '{"prompt": "描述"}'

图片编辑

curl -X POST "https://api.ppio.com/v3/seedream-5.0-lite" r
  -H "Authorization: Bearer $API_KEY" r
  -H "Content-Type: application/json" r
  -d '{"prompt": "编辑指令", "reference_images": ["图片URL"]}'

文生视频

curl -X POST "https://api.ppio.com/v3/async/vidu-q3-pro-t2v" r
  -H "Authorization: Bearer $API_KEY" r
  -H "Content-Type: application/json" r
  -d '{"prompt": "描述", "duration": 4}'

图生视频

curl -X POST "https://api.ppio.com/v3/async/vidu-q3-pro-i2v" r
  -H "Authorization: Bearer $API_KEY" r
  -H "Content-Type: application/json" r
  -d '{"prompt": "动作描述", "images": ["图片URL"]}'

TTS

curl -X POST "https://api.ppio.com/v3/async/minimax-speech-2.8-turbo" r
  -H "Authorization: Bearer $API_KEY" r
  -H "Content-Type: application/json" r
  -d '{
    "text": "要转换的文字",
    "voice_setting": {"voice_id": "male-qn-qingse", "speed": 1.0},
    "audio_setting": {"format": "mp3"}
  }'

可用声音:

  • 男声:male-qn-qingse(青涩)、male-qn-jingying(精英)
  • 女声:female-shaonv(少女)、female-yujie(御姐)

STT

curl -X POST "https://api.ppio.com/v3/glm-asr" r
  -H "Authorization: Bearer $API_KEY" r
  -H "Content-Type: application/json" r
  -d '{"file": "音频URL或Base64"}'

任务结果查询

curl "https://api.ppio.com/v3/async/task-result?task_id=$TASK_ID" r
  -H "Authorization: Bearer $API_KEY"

状态: TASK_STATUS_QUEUEDTASK_STATUS_PROCESSINGTASK_STATUS_SUCCEED


错误处理

错误码 含义 处理
401 Key 无效 检查配置
402 余额不足 https://ppio.com/billing 充值
429 请求过快 等待重试

定价

https://ppio.com/pricing