全自动视频翻译配音
导入视频后选好源语言与目标语言,软件会按顺序完成语音识别、字幕翻译、AI 配音、视频合成,最终输出带新语言字幕与配音的成片。
从一段视频到一段带字幕配音的多语言视频,pyVideoTrans 把流程拆成清晰的功能模块,可以单独使用,也可以串成完整流水线。
导入视频后选好源语言与目标语言,软件会按顺序完成语音识别、字幕翻译、AI 配音、视频合成,最终输出带新语言字幕与配音的成片。
把一批音频或视频直接转成 srt 字幕文件。支持 faster-whisper、openai-whisper、阿里的 Paraformer 等多种识别渠道,可批量处理。
已有 srt 字幕文件时,可以直接批量合成配音。Microsoft Edge TTS、OpenAI TTS、ElevenLabs、GPT-SoVITS 等几十种声音随意切换。
把现成的 srt 字幕批量翻译为其他语言,支持单语字幕和双语字幕输出。微软、Google、百度、DeepL、ChatGPT、DeepSeek 等翻译渠道均可使用。
录制 3-10 秒参考音频即可克隆音色;内置 F5-TTS、CosyVoice、Clone-Voice、GPT-SoVITS 等本地克隆方案,适合做多角色剧情解说。
合并视频与音频、合并视频与字幕、提取音轨、添加图片水印、人声与背景音乐分离、字幕格式互转、YouTube 下载等 14 项独立功能。
pyVideoTrans 同时提供桌面 GUI、WebUI 网页界面与 CLI 命令行三种使用方式,可以根据使用场景自由选择。
所有功能集中在左侧导航栏,参数选项都放在主面板上。视频路径、识别渠道、翻译渠道、配音渠道、配音角色、对齐方式、是否嵌入字幕等一目了然,不需要反复点进子菜单。

只想要字幕、不需要翻译和配音时,可以直接使用"语音转录"功能。把整批视频拖入窗口,选择识别模型和原始语言,点开始就能批量输出 srt 文件。

当字幕已经处理好,可以单独使用"文字配音"模块。支持导入 srt 或 txt 字幕,选择配音渠道与角色,调整语速、音量、语调后批量输出 wav / mp3。

"翻译字幕"模块可以在不重新识别语音的情况下,直接把已有字幕翻译成另一种语言,时间戳和行号会原样保留。如果开启"发送完整字幕",还能附带行号给 AI 翻译,断句更准。

对于长视频合集、播客批量翻译、课程字幕整理等场景,可以同时启用多项功能模块并行处理。界面分区清晰,CPU 任务与 GPU 任务分开调度,避免相互抢占资源。

语音识别、字幕翻译、文本配音分别可以选用不同的渠道。免费渠道覆盖大多数日常使用,需要更高质量时可切换到付费 API,效果会更好。
pyVideoTrans 对硬件没有硬性最低要求,笔记本和台式机都能跑。有英伟达显卡时建议开启 CUDA 加速,识别和配音速度会快很多。
汇总下载、安装、使用过程中最常遇到的问题与对应解决方案。如果下面的内容没覆盖到,可以查看软件根目录 logs 文件夹的日志。
pyVideoTrans 本体完全免费且开源(GPL-V3 协议),所有功能无任何使用限制,不需要登录、不需要卡密。商业销售版本(淘宝、闲鱼、拼多多等平台上的付费版)均非官方授权,与开发者无关,请认准本页网盘链接或 GitHub 源码仓库。
如果使用 ChatGPT、DeepSeek、ElevenLabs 等第三方在线 API,需要自行申请密钥并承担对应服务商的 API 费用,与 pyVideoTrans 无关。
Windows 10 与 Windows 11 提供预打包版(sp.exe),下载后解压到任意英文目录双击即可运行。macOS 与 Linux 仅支持从 GitHub 源码部署,需要先安装 Python 3.10 与 FFmpeg。
Windows 7 及更早的操作系统不支持,软件依赖的 PyTorch、PySide6 等组件已停止对 Win7 的兼容。
可以。pyVideoTrans 对硬件没有最低要求,没有 NVIDIA 显卡也能完整运行所有功能,只是语音识别与配音的运算会跑在 CPU 上,速度会比 GPU 慢一些。
如果配备了英伟达显卡,安装好 CUDA 12.8+ 与 cuDNN 9.x 后,勾选界面上的「CUDA 加速」即可启用 GPU 运算,识别速度能提升数倍。
首次启动需要初始化 PySide6 界面与本地资源,耗时从 5 秒到 2 分钟不等,取决于电脑性能。遇到长时间没反应,请先耐心等待一段时间。
如果一直打不开,可以依次排查:① 关闭杀毒软件或把软件目录加入信任区;② 把软件移到纯英文、无空格、无中文的目录;③ 仅下载了补丁包会报"缺少 python310.dll",需要重新下载完整包。
预打包版使用 PyInstaller 打包,未做免杀处理和数字签名,杀软存在普遍误报,属于开源工具的常见现象,并非真有病毒。请把软件目录加入杀软的白名单或信任区后再使用。
如果对安全性要求严格,可以从 GitHub 仓库 jianchang512/pyvideotrans 拉取源码本地部署,从源头避免打包工具带来的告警。
不同语言表达同一内容时音节数不同,这是翻译配音中无法绕开的现象。三种应对方法可以同时使用:① 启用「音频加速」,把配音压缩到与字幕等长;② 启用「视频慢速」,把画面放慢以匹配配音;③ 在高级选项里把配音语速调高 10% 左右。
如果需要更精准的时间轴,可以勾选「二次识别」,在配音完成后再次识别新音频,重新生成时间戳更准确的字幕。
large-v3 模型在 8GB 显存以下容易触发显存不足。推荐按以下顺序处理:① 把识别模型从 large-v3 降到 medium 或 small;② 在高级选项里把 CUDA 数据类型改为 float16 或 int8,beam_size 改为 1,best_of 改为 1;③ 如果是双显卡或单卡显存超过 24G,可以在高级选项里手动指定使用哪块显卡。
这是微软 Edge TTS 的限流机制,短时间请求过多会触发。把高级选项中的「同时配音线程数」设为 1,再把「配音后暂停秒数」调到 5-10 秒,问题基本可以解决。
如果使用了网络代理,Edge TTS 可能因为代理问题失败。在软件根目录下新建一个名为 edgetts-noproxy.txt 的空文件,软件会强制绕过代理直连微软服务器。
通常是 AI 在翻译时把多行字幕合并成一行造成的。处理方法:① 取消勾选高级选项里的「发送完整字幕」;② 把翻译并发数(trans_thread)调成 1;③ 改用上下文窗口更大的在线模型,如 DeepSeek-V3、GPT-4o。
本地小模型(如 7B)的翻译能力有限,更适合短句翻译;处理长文档或长视频建议使用在线模型。
这是 GPT-SoVITS 的 API 版本不匹配导致的。检查启动的是 api.py 还是 api_v2.py,在 pyVideoTrans 的 TTS 设置里勾选对应的 api_v2? 选项。
同时确认填写的是 API 地址(默认 9880),而不是网页版地址(7860)。如果地址写成 0.0.0.0,请改成 127.0.0.1。
默认的视频压缩率偏向质量,输出文件会偏大。如果更在意文件体积,可以:① 在高级选项里把"视频输出质量控制"调到 25-51,数字越大文件越小;② 把 264/265 编码改成 265,同等质量下体积能小 30%-50%。
如果想尽量保留原画质,建议原始视频本身就是 H.264 编码的 mp4,并且不勾选"视频自动慢速"、不嵌入硬字幕。
不能。pyVideoTrans 的字幕识别是基于音频轨道的人声识别,不具备图像文字识别(OCR)能力。如果需要从画面里提取硬字幕,可以使用另一款专门做 OCR 的工具。
软件根目录下有一个 logs 文件夹,里面按日期存放当天的 .log 日志文件。报错时,复制日志最后约 30 行内容,配合 AI 或论坛帖子可以快速定位问题。
在报错弹窗上点击"报告错误",软件会自动把当前日志提交到官方论坛;也可以把日志粘贴到搜索引擎或 AI 助手查询。
通过下方任一网盘链接下载 Windows 预打包版。下载后解压到纯英文目录,双击 sp.exe 即可使用。