数字人口播

基于 EchoMimic v3 数字人引擎 · 照片/视频驱动对口型 · TTS 系统生成或声音克隆

上传图片/视频
AI 生成形象
我的角色
① 图片 + 音频上传形象照与音频,声音完全用音频
② 图片 + 文字(克隆)上传形象照+参考音视频,文字经克隆音色合成
③ 视频 + 文字用视频形象与声音克隆,基于文字生成语音
④ 多音色画外音画面人物+多个画外音,适合采访场景