先完成音轨,再围绕一个短段落组织画面。关键决定是:观众是否必须看见准确唱出歌词的嘴部动作?跟随节奏的补充画面与精确对词的表演特写,需要不同的制作路径。
AI Genjutsu 使用 Seedance 1.5 Pro 制作无声视频,可使用文字和一张可选首帧图片。本站不生成音乐,不接受配乐,也不会让嘴部动作自动对齐歌词。开始制作前,请先查看工作台的当前服务状态。下面的分镜是制作计划,并非已实测的生成结果。
先锁定音轨,再决定镜头
准备自己的原创录音、歌词,以及有权使用的伴奏。剪辑时固定使用一个最终音频文件,在时间线上标记乐句起点、主要重音和一个完整的结尾,再安排视觉切换。
对于简单的 4/4 拍,一拍时长为 60 / BPM 秒,一个四拍小节为 240 / BPM 秒。例如 100 BPM 时,一拍为 0.6 秒,一小节为 2.4 秒。这只是规划网格;人声可能提前进入,也可能把一个音节拖过拍点,最终仍要以实际听感为准。
如果你需要外部写歌步骤,Suno 的自有歌词说明介绍了在 Custom 模式输入歌词。Add Vocals 指南说明了在器乐基础上加入歌词人声;该功能需要符合资格的付费方案。这些属于独立外部服务,不是本站功能;使用前需检查当前可用条件和与你项目相关的使用条款。
选择嘴部表演,或跟随节奏的补充画面
当某一句歌词的准确演唱是作品重点时,使用表演特写。可以对着已锁定的音轨拍摄,或者先验证外部音频驱动口型流程,再决定分镜。看起来自然的无声嘴部动作,也可能与实际歌词完全不符。
如果节奏、场景和情绪足以承载副歌,可以选择补充画面:手搭在栏杆上、风吹动外套、空舞台,都能配合音轨,又不暗示准确同步演唱。不要在本站提示词中写“唱出这些歌词”,并期待得到带音频的结果。
一份原创十四秒分镜
分别准备本站 4–12 秒范围内的候选片段,然后在外部剪辑器中裁切组合。最终成片可以是十四秒,但这不是一个本站支持的单次生成时长。
| 时间线 | 镜头描述 | 音轨处理 |
|---|---|---|
| 0–3 秒 | 一位原创表演者站在安静的屋顶,广角远景缓慢接近。 | 在前奏或弱起部分建立地点。 |
| 3–7 秒 | 中景,表演者向城市天际线轻转肩膀,不强调歌词特写。 | 在主要重音附近切入,人声保持连续。 |
| 7–10 秒 | 手搭在旧栏杆上的插入镜头,外套袖口可见。 | 覆盖歌词最密集的部分。 |
| 10–14 秒 | 回到广角构图,表演者保持站位,镜头逐渐停稳。 | 等最后一个词结束,再结束画面。 |
写一张统一的连续性卡片:深蓝色工装外套、屋顶旧栏杆、画面左侧的淡晨光、低饱和配色。各段描述都复用这些条件,首帧图片也应当属于同一场景。
开场镜头的原创提示词
六秒电影感远景,一位原创表演者穿深蓝色工装外套,站在安静屋顶的旧金属栏杆旁。淡淡晨光从画面左侧进入。表演者保持放松站姿,望向城市天际线。镜头只做一次缓慢稳定的推进。低饱和配色,自然的衣料运动,没有人群,没有可读文字。为原创说唱短片提供视觉氛围。
这是一段视觉描述,不是按音乐节拍自动同步的指令。字节跳动的 Seedance 1.5 Pro 公告介绍了底层模型,本站仍以关闭音频的配置为准。
导出前先修正剪辑问题
| 问题 | 实际修正方法 |
|---|---|
| 切镜感觉慢半拍 | 把切点向重音附近移动几帧,边听边比较。 |
| 服装或光线突然变化 | 换掉不一致的镜头,或按连续性卡片重写描述。 |
| 嘴部动作与歌词冲突 | 改用不强调嘴部的插入画面,或独立完成同步表演镜头。 |
| 结尾切断了一个词 | 保留音频尾部,让最后一个可用镜头或画面多停留一段时间。 |
可以在本站上传歌曲吗?
不可以。你需要在外部剪辑器中组合无声片段和有权使用的音频。当前输出还会带水印。
可以在其他音乐服务中使用自己的声音吗?
Suno 的 Voices 指南介绍了自有声音的验证流程。使用你自己的声音,检查资格条件,不要把这个功能当成克隆歌手声音的许可。
最终文件要检查什么?
完整播放导出文件,检查歌词起止、意外黑帧、人物脸部变化、音频削波、裁切安全区,以及目标屏幕上的水印位置。