PPIO多模态:文本生成图像视频与语音 - Openclaw Skills
什么是 PPIO 多模态执行?
PPIO 多模态技能通过集成最先进的生成能力,使 AI 智能体超越文本处理。此 Openclaw Skills 扩展支持广泛的创意和实用任务,包括文本生成图像 (T2I)、图像生成视频 (I2V) 以及高级语音服务,如文本转语音 (TTS) 和语音转文本 (STT)。
该技能专为响应速度和透明度而构建,包含内置的进度通知、成本估算和异步任务轮询逻辑。无论您是使用 Seedream 5.0 Lite 生成营销资产,还是使用 Vidu Q3 Pro 生成电影感视频,此集成都为多模态内容创建提供了强大的框架。
下载入口:https://github.com/openclaw/skills/tree/main/skills/ximasadila/ppio-multimodal
安装与下载
1. ClawHub CLI
从源直接安装技能的最快方式。
npx clawhub@latest install ppio-multimodal
2. 手动安装
将技能文件夹复制到以下位置之一
全局模式~/.openclaw/skills/
工作区
<project>/skills/
优先级:工作区 > 本地 > 内置
3. 提示词安装
将此提示词复制到 OpenClaw 即可自动安装。
请帮我使用 Clawhub 安装 ppio-multimodal。如果尚未安装 Clawhub,请先安装(npm i -g clawhub)。
PPIO 多模态执行 应用场景
- 根据文本提示生成高质量图像或使用参考文件编辑现有图像。
- 使用 Vidu Q3 Pro 创建短视频和动画以实现动态内容。
- 使用各种男声和女声配置文件将文本转换为自然听感的旁白 (TTS)。
- 将音频文件转录为文本 (STT),用于文档记录或会议摘要。
- 针对视频渲染等长时间运行的生成任务进行实时进度跟踪。
- 任务识别:AI 智能体将用户请求识别为多模态任务(例如,“生成一张猫的图片”)。
- 身份验证:该技能从用户消息、本地配置文件或环境变量中获取所需的 API Key。
- 进度启动:在调用 API 之前,该技能向用户发送强制性的进度更新,包括正在使用的模型和估计成本。
- API 执行:该技能向 PPIO 端点(例如
/v3/seedream-5.0-lite)发送请求。 - 状态轮询:对于视频生成等异步任务,该技能每 15 秒轮询一次任务状态,向用户更新队列和处理状态。
- 结果交付:完成后,该技能返回媒体资产的最终 URL 以及实际消耗成本。
PPIO 多模态执行 配置指南
要在 Openclaw Skills 生态系统中使用此功能,请使用以下方法之一配置您的 API Key:
选项 1:配置文件(推荐)
mkdir -p ~/.ppio && echo '{"api_key": "YOUR_API_KEY"}' > ~/.ppio/config.json
选项 2:环境变量
export PPIO_API_KEY="YOUR_API_KEY"
选项 3:直接参数
您也可以直接在提示词中传递 Key:Use API Key sk_xxx to generate an image of...
PPIO 多模态执行 数据架构与分类体系
该技能根据任务类型和模型端点组织请求如下:
| 任务类型 | 端点 | 主要模型 |
|---|---|---|
| 文本生成图像 | /v3/seedream-5.0-lite |
Seedream 5.0 Lite |
| 文本生成视频 | /v3/async/vidu-q3-pro-t2v |
Vidu Q3 Pro |
| 文本转语音 | /v3/async/minimax-speech-2.8-turbo |
MiniMax Speech 2.8 |
| 语音转文本 | /v3/glm-asr |
GLM ASR |
所有任务均返回包含用于轮询的 task_id 或用于同步结果的直接 url 的 JSON 响应。
name: ppio-multimodal
description: |
使用 PPIO 执行多模态任务:文生图、图生图、文生视频、图生视频、TTS、STT。
适用于:生成图片、生成视频、文字转语音、语音识别。
PPIO 多模态执行
配置方式(三选一,按优先级)
方式1:配置文件(推荐)
创建文件 ~/.ppio/config.json:
{
"api_key": "你的API_Key"
}
一条命令完成配置:
mkdir -p ~/.ppio && echo '{"api_key": "你的API_Key"}' > ~/.ppio/config.json
方式2:环境变量
export PPIO_API_KEY="你的API_Key"
方式3:直接传参
在请求中直接提供:请用 API Key sk_xxx 生成一张图片...
API Key 读取逻辑
1. 检查用户消息中是否包含 API Key(sk_ 开头)
2. 检查配置文件 ~/.ppio/config.json
3. 检查环境变量 PPIO_API_KEY
4. 都没有 → 返回配置引导
配置引导消息(仅在未配置时显示):
您还没有配置 PPIO 的 API Key。
快速配置(复制运行):
mkdir -p ~/.ppio && echo '{"api_key": "你的Key"}' > ~/.ppio/config.json
获取 Key:https://ppio.com/settings/key-management
执行流程(重要!)
用户请求 → 识别任务 → 获取 Key → ?? 先发提示 → 执行任务 → 返回结果
?? 必须先发送进度提示
在调用 API 之前,必须先回复用户一条消息:
?? 收到!正在为您生成图片...
任务类型:文生图
使用模型:Seedream 5.0 Lite
预计耗时:5-15秒
预计费用:约 ¥0.245
请稍等,生成完成后会立即发送给您 ?
这条消息必须在执行 API 调用之前发送! 这样用户就知道任务已经开始处理,不会以为系统卡住了。
不同任务的提示模板
文生图:
?? 收到!正在为您生成图片...
使用模型:Seedream 5.0 Lite
预计耗时:5-15秒
文生视频:
?? 收到!正在为您生成视频...
使用模型:Vidu Q3 Pro
预计耗时:1-3分钟(视频生成较慢,请耐心等待)
TTS:
?? 收到!正在为您生成语音...
使用模型:MiniMax Speech 2.8 Turbo
预计耗时:5-15秒
完成后的回复
? 生成完成!
[图片/视频/音频 URL]
实际消耗:¥0.245
视频任务的轮询提示
视频生成需要轮询,每 15 秒更新一次状态:
?? 视频生成中...
当前状态:处理中
已等待:30 秒
预计还需:1-2 分钟
API 配置
| 配置项 | 值 |
|---|---|
| Base URL | https://api.ppio.com |
| 鉴权 | Authorization: Bearer <API_KEY> |
| 获取 Key | https://ppio.com/settings/key-management |
任务类型与端点
| 任务 | 端点 | 模型 |
|---|---|---|
| 文生图 | /v3/seedream-5.0-lite |
Seedream 5.0 Lite |
| 图片编辑 | /v3/seedream-5.0-lite |
Seedream 5.0 Lite |
| 文生视频 | /v3/async/vidu-q3-pro-t2v |
Vidu Q3 Pro |
| 图生视频 | /v3/async/vidu-q3-pro-i2v |
Vidu Q3 Pro |
| TTS | /v3/async/minimax-speech-2.8-turbo |
MiniMax Speech 2.8 |
| STT | /v3/glm-asr |
GLM ASR |
| 任务查询 | /v3/async/task-result?task_id=xxx |
- |
执行模板
文生图
curl -X POST "https://api.ppio.com/v3/seedream-5.0-lite" r
-H "Authorization: Bearer $API_KEY" r
-H "Content-Type: application/json" r
-d '{"prompt": "描述"}'
图片编辑
curl -X POST "https://api.ppio.com/v3/seedream-5.0-lite" r
-H "Authorization: Bearer $API_KEY" r
-H "Content-Type: application/json" r
-d '{"prompt": "编辑指令", "reference_images": ["图片URL"]}'
文生视频
curl -X POST "https://api.ppio.com/v3/async/vidu-q3-pro-t2v" r
-H "Authorization: Bearer $API_KEY" r
-H "Content-Type: application/json" r
-d '{"prompt": "描述", "duration": 4}'
图生视频
curl -X POST "https://api.ppio.com/v3/async/vidu-q3-pro-i2v" r
-H "Authorization: Bearer $API_KEY" r
-H "Content-Type: application/json" r
-d '{"prompt": "动作描述", "images": ["图片URL"]}'
TTS
curl -X POST "https://api.ppio.com/v3/async/minimax-speech-2.8-turbo" r
-H "Authorization: Bearer $API_KEY" r
-H "Content-Type: application/json" r
-d '{
"text": "要转换的文字",
"voice_setting": {"voice_id": "male-qn-qingse", "speed": 1.0},
"audio_setting": {"format": "mp3"}
}'
可用声音:
- 男声:
male-qn-qingse(青涩)、male-qn-jingying(精英) - 女声:
female-shaonv(少女)、female-yujie(御姐)
STT
curl -X POST "https://api.ppio.com/v3/glm-asr" r
-H "Authorization: Bearer $API_KEY" r
-H "Content-Type: application/json" r
-d '{"file": "音频URL或Base64"}'
任务结果查询
curl "https://api.ppio.com/v3/async/task-result?task_id=$TASK_ID" r
-H "Authorization: Bearer $API_KEY"
状态: TASK_STATUS_QUEUED → TASK_STATUS_PROCESSING → TASK_STATUS_SUCCEED
错误处理
| 错误码 | 含义 | 处理 |
|---|---|---|
| 401 | Key 无效 | 检查配置 |
| 402 | 余额不足 | https://ppio.com/billing 充值 |
| 429 | 请求过快 | 等待重试 |
定价
https://ppio.com/pricing