制作指南

创作者制作笔记

AI Rap Duo:规划清晰的双人说唱画面

用明确的 A/B 站位、双人首帧和四段镜头计划组织说唱搭档画面,并区分表演视觉与精确音频口型同步。

更新于 2026-10-11约 5 分钟阅读
制作示意图03
AB
表演者 A轮廓分开表演者 B
分镜构思示意,并非模型生成效果。

双人说唱视频首先要让观众看懂:谁在主导,谁在回应。给两位表演者固定的 A/B 身份和站位,每个镜头只安排一个主要动作。两个人在画面中做手势,可以构成表演视觉,但不能证明他们正在准确说出录音里的歌词。

AI Genjutsu 准备的是无声视觉片段。精确轮流说唱需要在本站之外完成音频和口型工作流。你可以先按下面的方法准备首帧和镜头描述,开始制作前再查看工作台的当前服务状态。

先建立双人关系,再安排动作

写一张简短的连续性卡片:A 在画面左侧,穿铁锈色外套;B 在右侧,穿深灰色衬衫。两人之间留出约一个肩宽的空隙,身后是一面简单的墙。每个镜头都复用这些描述,不要每次添加不同的服装细节。

如果采用图片引导,上传的一张首帧图片应当已经清楚显示两个人。避免脸部重叠、极端侧脸、一人的手臂挡住另一人,或者身后出现人群。画面边缘也要为小幅手势留出空间。

本站不支持把两张独立肖像作为联合身份输入。你可以拍摄两人同框的照片,或者在外部图片编辑器中制作有权使用的合成画面;先检查光线、比例和站位是否合理,再把它作为一张首帧。参考帧能够引导外观,但不能保证人物身份在整个片段中始终不变。

用四个短镜头分配不同任务

下面的计划是四个独立的四秒片段,最后在外部剪辑器中拼成十六秒视频。每个片段都保持同一面墙、光线方向、服装和 A/B 站位。

镜头画面描述剪辑作用
1:建立关系腰部以上双人镜头;A 和 B 保持站位,镜头轻缓推进。在第一次切换之前介绍两位表演者。
2:A 主导A 做一次张开手掌的手势;B 双手放低,安静回应。配合 A 的段落,减少动作竞争。
3:B 主导B 做一次小幅向前的手势;A 保持平稳。让视觉主导权的变化更容易识别。
4:共同收尾两人轻轻点头一次;机位固定。落在结尾重音上,避免交叉走位。

剪辑可以表现两人的接力关系,却不能让没有同步录音的无声嘴部动作自动对齐歌词。如果准确演唱很重要,应让表演者对着最终音轨拍摄,或者使用经过单独验证的外部音频驱动口型流程,然后在剪辑器里逐段检查说话者。

一个原创镜头提示词

下面用于规划第 2 段,并非已验证的生成结果:

四秒,腰部以上的双人镜头,两位原创表演者站在有纹理的混凝土墙前。A 始终在画面左侧,穿铁锈色外套,在胸前做一次张开手掌的手势。B 始终在右侧,穿深灰色衬衫,双手放低,安静倾听。两人的脸都清楚可见并保持间隔。固定机位,柔和侧光,克制的表演感,不出现额外人物,不交换站位,没有可读文字。

第 3 段只替换主导动作的表演者,其余条件保持一致。“不交换站位”表达的是创作目标,仍然需要检查输出是否遵循。

先诊断画面,再减少复杂度

问题下一次调整
两张脸似乎交换了身份用更易区分的服装,拉开头部距离,减少转身。
手臂或身体穿插取消同时做手势,让其中一人保持平稳。
多出第三个人简化背景,并明确描述画面中恰好只有两人。
看不出谁在主导在音轨交接位置切换镜头,不要让两个人同时抢动作。
嘴部动作与录音不符改用经过验证的外部口型流程,或替换为不强调嘴部的补充镜头。

导出前的常见问题

能在本站让两个人唱出我的歌词吗?

不能。本站输出无声视频,不接受音轨,也不提供精确的歌词驱动口型动画。

Seedance 的音频能力会改变这一点吗?

字节跳动介绍了 Seedance 1.5 Pro 的联合音视频能力。本站配置关闭音频,模型能力不等于这里已开放的功能。

可以使用知名歌手的脸或声音吗?

围绕原创表演者和你有权使用的素材制作。提示词中写入一个熟悉的名字,并不代表获得授权,也不能证明作品真实。AI Genjutsu 是独立网站。

继续阅读先锁定音轨的说唱视频计划、Migos AI 的来源辨认与流程选择,或橙色舞台场景规划。

继续完成下一步