双人说唱视频首先要让观众看懂:谁在主导,谁在回应。给两位表演者固定的 A/B 身份和站位,每个镜头只安排一个主要动作。两个人在画面中做手势,可以构成表演视觉,但不能证明他们正在准确说出录音里的歌词。
AI Genjutsu 准备的是无声视觉片段。精确轮流说唱需要在本站之外完成音频和口型工作流。你可以先按下面的方法准备首帧和镜头描述,开始制作前再查看工作台的当前服务状态。
先建立双人关系,再安排动作
写一张简短的连续性卡片:A 在画面左侧,穿铁锈色外套;B 在右侧,穿深灰色衬衫。两人之间留出约一个肩宽的空隙,身后是一面简单的墙。每个镜头都复用这些描述,不要每次添加不同的服装细节。
如果采用图片引导,上传的一张首帧图片应当已经清楚显示两个人。避免脸部重叠、极端侧脸、一人的手臂挡住另一人,或者身后出现人群。画面边缘也要为小幅手势留出空间。
本站不支持把两张独立肖像作为联合身份输入。你可以拍摄两人同框的照片,或者在外部图片编辑器中制作有权使用的合成画面;先检查光线、比例和站位是否合理,再把它作为一张首帧。参考帧能够引导外观,但不能保证人物身份在整个片段中始终不变。
用四个短镜头分配不同任务
下面的计划是四个独立的四秒片段,最后在外部剪辑器中拼成十六秒视频。每个片段都保持同一面墙、光线方向、服装和 A/B 站位。
| 镜头 | 画面描述 | 剪辑作用 |
|---|---|---|
| 1:建立关系 | 腰部以上双人镜头;A 和 B 保持站位,镜头轻缓推进。 | 在第一次切换之前介绍两位表演者。 |
| 2:A 主导 | A 做一次张开手掌的手势;B 双手放低,安静回应。 | 配合 A 的段落,减少动作竞争。 |
| 3:B 主导 | B 做一次小幅向前的手势;A 保持平稳。 | 让视觉主导权的变化更容易识别。 |
| 4:共同收尾 | 两人轻轻点头一次;机位固定。 | 落在结尾重音上,避免交叉走位。 |
剪辑可以表现两人的接力关系,却不能让没有同步录音的无声嘴部动作自动对齐歌词。如果准确演唱很重要,应让表演者对着最终音轨拍摄,或者使用经过单独验证的外部音频驱动口型流程,然后在剪辑器里逐段检查说话者。
一个原创镜头提示词
下面用于规划第 2 段,并非已验证的生成结果:
四秒,腰部以上的双人镜头,两位原创表演者站在有纹理的混凝土墙前。A 始终在画面左侧,穿铁锈色外套,在胸前做一次张开手掌的手势。B 始终在右侧,穿深灰色衬衫,双手放低,安静倾听。两人的脸都清楚可见并保持间隔。固定机位,柔和侧光,克制的表演感,不出现额外人物,不交换站位,没有可读文字。
第 3 段只替换主导动作的表演者,其余条件保持一致。“不交换站位”表达的是创作目标,仍然需要检查输出是否遵循。
先诊断画面,再减少复杂度
| 问题 | 下一次调整 |
|---|---|
| 两张脸似乎交换了身份 | 用更易区分的服装,拉开头部距离,减少转身。 |
| 手臂或身体穿插 | 取消同时做手势,让其中一人保持平稳。 |
| 多出第三个人 | 简化背景,并明确描述画面中恰好只有两人。 |
| 看不出谁在主导 | 在音轨交接位置切换镜头,不要让两个人同时抢动作。 |
| 嘴部动作与录音不符 | 改用经过验证的外部口型流程,或替换为不强调嘴部的补充镜头。 |
导出前的常见问题
能在本站让两个人唱出我的歌词吗?
不能。本站输出无声视频,不接受音轨,也不提供精确的歌词驱动口型动画。
Seedance 的音频能力会改变这一点吗?
字节跳动介绍了 Seedance 1.5 Pro 的联合音视频能力。本站配置关闭音频,模型能力不等于这里已开放的功能。
可以使用知名歌手的脸或声音吗?
围绕原创表演者和你有权使用的素材制作。提示词中写入一个熟悉的名字,并不代表获得授权,也不能证明作品真实。AI Genjutsu 是独立网站。