数字人口播
基于 EchoMimic v3 数字人引擎 · 照片/视频驱动对口型 · TTS 系统生成或声音克隆
角色形象
上传图片/视频
AI 生成形象
我的角色
性别
男
女
年龄段
风格
专业商务
休闲亲切
活力动感
形象描述
生成引擎
SenseNova U1 Fast (云端)
Bernini/ComfyUI (本地)
🎨 AI 生成形象
💾 保存到我的角色
🔄 刷新
① 图片 + 音频
上传形象照与音频,声音完全用音频
② 图片 + 文字(克隆)
上传形象照+参考音视频,文字经克隆音色合成
③ 视频 + 文字
用视频形象与声音克隆,基于文字生成语音
④ 多音色画外音
画面人物+多个画外音,适合采访场景
音频(最终声音)
口播文字
✨ AI文案生成
克隆参考音 / 视频
口播文字
✨ AI文案生成
画面人物口播文字
✨ AI文案生成
画面人物音色
系统生成(按情绪)
声音克隆
画面人物克隆参考音/视频
画外音(可多个)
+ 添加画外音
语言
🇨🇳 中文简体
🇹🇼 中文繁體
🇺🇸 English
🇯🇵 日本語
🇰🇷 한국어
🇫🇷 Français
🇩🇪 Deutsch
🇪🇸 Español
🇵🇹 Português
🇸🇦 العربية
🇷🇺 Русский
生成数字人视频
✨ AI文案生成
主题/关键词
目标时长(秒)
风格
专业
口语化
热情
💡 提示:你可以在主题中写个性化需求,如“最后要有二维码”、“不要出现竞品logo”等,系统会自动识别并优先满足。
取消
生成文案