专注用 ElevenLabs 做 AI 配音。从短视频旁白、有声书、广告片,到游戏角色和外语视频配音,每一类配音该选什么声音、怎么调参数、怎么和剪辑软件配合,这里都有完整流程。
不同类型的配音,对声音、节奏和情绪的要求完全不同。先确定你做的是哪一类,再往下看对应的流程。
中文配音是"你写好文案,AI 念出来",核心是选对声音、写好文本、调好参数,用的是文本转语音。外语配音是"你已经有一条视频,让 AI 换一种语言再说一遍",核心是原视频的人声质量,用的是 Dubbing 配音功能。很多人第一次用时把两者混在一起,结果越调越乱。
AI 配音听起来"假",九成是这六个地方没处理好,而不是模型不行。
书面语念出来生硬。长句拆短,去掉括号和注释,数字写成想听到的读法,AI 念起来自然得多。
选错声音,参数怎么调都救不回来。先在声音库里多试几个,确定"对味"的声音再细调。
一次生成太长,后半段容易跑调。按段落或镜头分开生成,出问题只重做那一段。
每次生成都略有不同。开场白、口号这类关键句生成三次,挑最好的那一版。
逗号是短停,句号是长停,省略号带犹豫语气。想让某句话更有分量,就在它前面断句。
AI 生成的是干声。导入剪辑软件后配上背景音乐、压低音乐音量,成片听感会提升一大截。
选择你要做的配音类型,按步骤走一遍就能出成品。
小技巧:解说类视频语速可以略快一点,信息密度高的段落前后留出停顿,观众更容易跟上。
小技巧:先完整做一章当样章,确认声音和节奏都满意,再批量做全书,返工成本最低。
小技巧:口播、访谈、课程类视频效果最好。背景音乐很响或多人抢话的视频,建议先处理好人声再上传。
小技巧:广告片节奏紧,文案要比常规旁白更短、更口语,每句话只说一件事。
小技巧:同一角色的台词尽量用同一组参数生成,否则不同批次之间音色会有细微差异。
文案量大时,用 Python 循环调用 API,一次生成几十上百条配音。
pip install elevenlabs
import os from elevenlabs.client import ElevenLabs # 密钥放在环境变量里,不要写死在代码中 client = ElevenLabs(api_key=os.environ["ELEVENLABS_API_KEY"]) lines = [ "欢迎收看本期节目。", "今天我们聊一聊 AI 配音。", ] for i, text in enumerate(lines, 1): audio = client.text_to_speech.convert( text=text, voice_id="JBFqnCBsd6RMkjVDRZzb", # 换成你选的声音 ID model_id="eleven_multilingual_v2", output_format="mp3_44100_128", ) with open(f"line_{i:03d}.mp3", "wb") as f: for chunk in audio: f.write(chunk)
API 同样按字符消耗额度。批量生成前先估算总字数,并注意账号的并发上限,调用过快会被限流。
在声音库里可以按语言、性别、年龄、用途筛选。下表是不同内容的选声方向和参数起点,生成后再按耳朵微调。
| 内容类型 | 声音方向 | 推荐模型 | 稳定性 | 风格强度 |
|---|---|---|---|---|
| 知识科普 | 清晰、中速、亲和 | Multilingual v2 | 中偏高 | 低 |
| 纪录片解说 | 低沉、沉稳、有磁性 | Multilingual v2 | 高 | 低 |
| 情感故事 | 温柔、有呼吸感 | Eleven v3 | 偏低 | 中 |
| 带货口播 | 明亮、语速快、有活力 | Eleven v3 | 中 | 中 |
| 儿童内容 | 轻快、夸张、表情丰富 | Eleven v3 | 偏低 | 中 |
| 企业宣传 | 稳重、专业、字正腔圆 | Multilingual v2 | 高 | 低 |
想让配音用你自己的声音,就用声音克隆。即时克隆只需要 1 到 2 分钟干净的单人录音,几分钟就能用;专业克隆需要至少 30 分钟的高质量素材,还原度更高,适合长期做同一个 IP 的创作者。
录音时用同一支麦克风、同一个房间一次录完,用你希望成片呈现的语气说话。只克隆你自己的声音,或取得本人明确授权的声音,即时克隆需要付费套餐。
成片发布或交给客户之前,对照下面几项过一遍,能避免大部分返工。
付费套餐包含商用授权,可以用于广告、带货、付费课程等商业内容。免费版不含商用授权,并且需要注明来源。具体条款以官网为准。
可以。用 Dubbing 配音功能上传视频,选择目标语言,AI 会自动转写、翻译并尽量保留原说话人的音色。生成后建议逐句核对翻译。
日常旁白、解说、课程类内容,AI 配音已经很接近真人,而且改稿只需重新生成一句。对表演要求极高的品牌大片、影视剧,真人配音员仍然更可控。
文本转语音默认导出 MP3,付费档位可选更高音质。下载后直接拖进剪映、Premiere、Final Cut 等剪辑软件的音频轨,与画面对齐即可。
坦白说:中国大陆不在 ElevenLabs 官方支持的服务地区内,注册、访问和付费都可能受限。身在海外或有海外主体的团队使用会顺畅很多。
注册免费账号,粘贴一段文案、选一个声音,一分钟内就能听到成品。