资料与来源
ElevenLabs 官方 Text to Speech 指南与内嵌视频 ↗
ElevenLabs 官方视频:Create Realistic Text to Speech in 111 Seconds with AI ↗
拿一段中文短稿,完成选声、试听、改停顿与导出;最后把声音放回视频,检查读音和节奏。
下方提供操作步骤、示例提示词和结果检查方法。
准备下面三句原创短稿,以及三段画面:磨豆、注水、端起咖啡。时间以实际生成音频为准,不预设每句话恰好占用固定秒数。 最后交付:一条读音正确、停顿合适的 MP3 或 WAV 旁白,以及与三段画面对齐的剪辑预览。
输入三句旁白,保留句号和段落。先把 15g、225ml 等缩写改成希望听到的中文读法,并大声读一遍确认语气。
检查点:文稿中的数字和单位只有一种明确读法。
打开 Text to Speech,先听候选声音的预览,再用第一句话分别试听两种声音。选择更适合平静咖啡画面的那一种,并记下声音名称。
检查点:以实际中文效果判断,选定一个贯穿整条视频的声音。
选择当前可用且支持目标语言的模型,点击 Generate Speech(部分界面为 Generate),生成三句完整稿件。把这版保存为 A,记录声音、模型和修改前的文本。
检查点:能完整听到三句话,没有漏字或错误的数字读音。
如果节奏太急,先缩短长句或调整标点,再生成版本 B;只在所选模型支持时使用语速或音频标签控制。不要把用于其他模型的停顿标签直接照搬。
检查点:对照 A 与 B,保留停顿自然、句尾没有突然截断的一版。
打开右侧生成记录(窄屏点击生成按钮上方的历史图标),点击下载图标,选择 MP3 或 WAV。放进剪辑时间线,让磨豆、注水和成品镜头分别接上对应语句。
检查点:完整观看一遍,确认音量清楚、语句与画面对应,片尾没有吞字。
以下为 FindGoodAI 编写的练习示例,可替换成自己的素材与主题。
周末,先给自己留一点慢下来的时间。
十五克咖啡豆,搭配两百二十五毫升热水,让香气慢慢展开。
等最后一滴落下,今天的第一杯,就准备好了。
先把短稿改成想让观众听到的完整读法,再单独重听含该词的句子;不要仅凭声音预览判断。
固定同一个声音、模型和设置,短稿尽量完整生成,检查接句位置;不要让每句使用不同的参数。
核对所选模型的说明。当前官方指南明确 Eleven v3 与 v4 使用音频标签和标点,不支持 SSML break;其他部分模型可用 SSML。入门练习先用短句和标点控制。
先减少一句里的信息量,或给对应镜头多一点时间,再重新生成;调整后完整检查,别只听开头几秒。
当前官方文档已列出 Eleven v4。视频和当前界面的模型名称可能不同,按自己账户提供的声音与模型选择;不要把旧视频中的模型称作最新。
视频由 ElevenLabs 发布;本站根据官方资料整理了跟练步骤、示例和检查清单。练习时间为估计,生成排队时间另计。
ElevenLabs 官方 Text to Speech 指南与内嵌视频 ↗
ElevenLabs 官方视频:Create Realistic Text to Speech in 111 Seconds with AI ↗