历史 DSL 案例卡
本页先处理 3 个代表案例,后续再批量补齐全部 DSL。
案例一:古诗词Mv生产-总
| 字段 | 内容 |
|---|
| 原始文件 | 古诗词Mv生产-总.yml |
| 应用名 | 古诗词Mv生产-总 |
| 适用场景 | 用一个入口串联音乐生成、歌词提取、视频生成,最终产出古诗词 MV |
| 工作流形态 | 总控编排型 |
| 节点规模 | 6 个节点、5 条边 |
输入
| 变量 | 说明 | 类型 |
|---|
name | 古诗词名称 | text-input |
content | 古诗词内容 | paragraph |
target_user | 目标用户 | text-input |
music_style | 音乐风格 | text-input |
art_style | 美术风格 | text-input |
subtitle | 是否需要字幕 | select |
is_mxr | 是否喵星人 | select |
ratio | 横竖屏 | select |
核心流程
- Start 收集古诗词、用户、音乐、美术、字幕、画幅要求。
- Tool 调用
古诗词Mv生产-音乐 生成音乐。 - Tool 调用
古诗词Mv生产-提取歌词 处理歌词时间轴。 - Tool 调用
古诗词Mv生产-视频 生成视频。 - Code 汇总结果,End 输出。
可复用点
| 可复用内容 | 适用场景 |
|---|
| 总控 DSL 调多个子生产线 | 新建复合型生产车间 |
| Start 统一收口业务输入 | 多阶段生产任务 |
| 子 DSL 拆分音乐、歌词、视频 | 需要分阶段测试和复用的任务 |
测试重点
| 测试项 | 通过标准 |
|---|
| 子生产线调用 | 三个 Tool 都能被触发并返回结果 |
| 参数传递 | 古诗词内容、风格、画幅能传到下游 |
| 输出完整 | 最终结果包含可用 MV 输出 |
案例二:AI萌宠·拟人化视频创作(单图拼接版)
| 字段 | 内容 |
|---|
| 原始文件 | AI萌宠·拟人化视频创作-单图拼接版.yml |
| 应用名 | AI萌宠·拟人化视频创作(单图拼接版) |
| 适用场景 | 上传 1 张宠物照片,生成拟人化短视频并拼接成最终视频 |
| 工作流形态 | 单图生成视频型 |
| 节点规模 | 15 个节点、13 条边 |
输入
| 变量 | 说明 | 类型 |
|---|
pet_image_1 | 宠物照片 | file |
pet_role_preset | 宠物人物设定 | text-input |
target_platform | 目标平台 | text-input |
voice_gender | 主角音色 | text-input |
topic | 选题 | text-input |
pet_name | 宠物名称 | text-input |
pet_type | 宠物类型 | text-input |
核心流程
- LLM 完成角色基础建模。
- LLM 生成拟人角色三视图设定。
- Image Generation 生成三视图。
- LLM 做故事规划和分镜提示词。
- Iteration 批量生成镜头图和视频。
- 火山视频点播工具拼接最终视频。
- Code 校验最终视频 URL。
可复用点
| 可复用内容 | 适用场景 |
|---|
| 单图角色建模 | 单图生视频、IP 角色视频 |
| LLM 分镜规划 | 多镜头短视频生产 |
| Iteration 批量生成镜头 | 多片段视频生产 |
| 视频拼接工具 | 最终视频合成 |
测试重点
| 测试项 | 通过标准 |
|---|
| 图片输入 | 文件能被下游图像节点读取 |
| 分镜数量 | 分镜能形成可遍历列表 |
| 视频 URL | 最终输出为可访问视频 URL |
案例三:AI课件-图片+音频生成视频
| 字段 | 内容 |
|---|
| 原始文件 | AI课件-图片+音频生成视频.yml |
| 应用名 | AI课件-图片+音频生成视频 |
| 适用场景 | 用人物图片和音频生成口型视频,并按需要做透明视频、超分、格式转换 |
| 工作流形态 | 课件媒体处理型 |
| 节点规模 | 51 个节点、58 条边 |
输入
| 变量 | 说明 | 类型 |
|---|
image | 人物绿幕图片 | file |
audio | 音频,时长不能超过 20 秒 | file |
image_url | 绿幕图片地址,HeyGem 时传视频地址 | paragraph |
audio_url | 音频地址 | paragraph |
prompt | 动作提示词 | paragraph |
AI_model | 生成口型的模型 | select |
need_mov | 是否需要 MOV | select |
need_VSR | 是否视频超分 | select |
out_type | 输出类型 | select |
tts_text | TTS 内容 | paragraph |
核心流程
- 读取图片和音频文件或 URL。
- 获取音频时长并校验上限。
- 根据
AI_model 选择 InfiniteTalk、HeyGem、Seedance、即梦等路径。 - 调用数字人、透明视频、超分、格式转换等工具。
- 汇总输出透明视频、MP4、MOV 或增强后视频。
可复用点
| 可复用内容 | 适用场景 |
|---|
| 文件和 URL 双输入 | 兼容上传文件和已有资源地址 |
| 音频时长校验 | 所有音频驱动视频能力 |
| 多模型条件分支 | 同一能力支持多个生成模型 |
| 后处理工具链 | 透明视频、超分、格式转换 |
测试重点
| 测试项 | 通过标准 |
|---|
| 音频时长 | 超过限制时明确失败 |
| 模型分支 | 不同 AI_model 能进入正确路径 |
| 输出类型 | 按 out_type 返回对应视频格式 |
待批量补充案例