音频转字幕Transcribe
将音视频转写为带时间轴的字幕,支持自动检测与 50 余种语言;可说话人分离,本地离线或云端识别均可。
核心能力
从语音到文字、从文字到语音、从原片到成片,覆盖音视频本地化的关键环节。
将音视频转写为带时间轴的字幕,支持自动检测与 50 余种语言;可说话人分离,本地离线或云端识别均可。
覆盖 600 余种目标语言互译,可选多种大模型;支持一键字幕与批量任务,译文可直接进入配音流程。
按字幕时间轴自动对齐配音,提供分步、全流程与批量模式;多引擎、多音色,覆盖 600 余种配音语言。
用参考音频克隆音色,内置 IndexTTS、CosyVoice、OmniVoice、Qwen3、Fish Speech 等十余种引擎,也可调用云端 TTS。
用 AI 把音轨中的人声与伴奏分开,便于先清轨再转录或配音,减少背景音乐对识别的干扰。
内置全网下载、格式转换、烧录 / 去硬字幕、压缩、裁剪、水印与说话人编辑,无需在多个软件间切换。
语言覆盖
转录可选自动检测;翻译与 OmniVoice 配音覆盖 600 余种语言与方言。
以上为常见语种示例。转录 50 余种,翻译与配音 600 余种,完整列表以软件内为准。
工作流
每一步都可单独使用;也可用一键字幕或全流程配音串成自动化流水线。
本地文件或在线视频链接,批量导入队列。
50+ 语言转写,可做人声与说话人分离。
600+ 语言互译,生成目标语字幕。
按时间轴生成配音,可克隆参考音色。
烧录字幕、转码压缩,一键输出。
为什么选择 TRANSVOX
音视频与字幕数据优先在本机处理,敏感素材无需上云,降低外泄风险。
GPU 加速本地转写与导出;需要时再调用云端识别、翻译与配音引擎。
下载与本地处理永久免费,云端增强服务按量计费,按需付费。