Skip to content

Latest commit

 

History

History
138 lines (84 loc) · 5.28 KB

README.zh.md

File metadata and controls

138 lines (84 loc) · 5.28 KB
VideoLingo Logo

连接世界每一帧

Website | Documentation

English中文

QQ群:875297969

🌟 简介(在线体验!

VideoLingo 是一站式视频翻译本地化配音工具,能够一键生成 Netflix 级别的高质量字幕,告别生硬机翻,告别多行字幕,还能加上高质量的克隆配音,让全世界的知识能够跨越语言的障碍共享。

主要特点和功能:

  • 🎥 使用 yt-dlp 从 Youtube 链接下载视频

  • 🎙️ 使用 WhisperX 进行单词级时间轴字幕识别

  • 📝 使用 NLP 和 GPT 根据句意进行字幕分割

  • 📚 GPT 总结提取术语知识库,上下文连贯翻译

  • 🔄 三步直译、反思、意译,媲美字幕组精翻效果

  • ✅ 按照 Netflix 标准检查单行长度,绝无双行字幕

  • 🗣️ 使用 GPT-SoVITS 等方法对齐克隆配音

  • 🚀 整合包一键启动,在 streamlit 中一键出片

  • 📝 详细记录每步操作日志,支持随时中断和恢复进度

与同类项目相比的优势:绝无多行字幕,最佳的翻译质量,无缝的配音体验

🎥 效果演示

俄语翻译


ru_demo.mp4

GPT-SoVITS配音


sovits.mp4

语言支持

输入语言支持:

🇺🇸 英语 🤩 | 🇷🇺 俄语 😊 | 🇫🇷 法语 🤩 | 🇩🇪 德语 🤩 | 🇮🇹 意大利语 🤩 | 🇪🇸 西班牙语 🤩 | 🇯🇵 日语 😐 | 🇨🇳 中文* 😊

*中文使用单独的标点增强后的 whisper 模型

翻译语言支持所有语言,配音语言取决于选取的TTS。

安装

Windows 用户可以双击运行 OneKeyInstall&Start.bat 一键安装(确保 Git 已安装),该脚本会下载 Miniconda 并安装完整环境。对于使用 NVIDIA GPU 的用户,还需要先安装 CUDA 12.6CUDNN 9.3.0,并在安装完成后添加 C:\Program Files\NVIDIA\CUDNN\v9.3\bin\12.6 到系统环境变量并重启。

MacOS/Linux 用户请从源码安装,需要 python=3.10.0 环境。

  1. 下载项目代码
git clone https://github.com/Huanshere/VideoLingo.git
cd VideoLingo
  1. 安装依赖
conda create -n videolingo python=3.10.0
conda activate videolingo
python install.py
  1. 启动
streamlit run st.py

还可以选择使用 Docker,要求CUDA版本为12.4,NVIDIA Driver版本大于550,详见Docker文档

docker build -t videolingo .
docker run -d -p 8501:8501 --gpus all videolingo

API

本项目支持 OpenAI-Like 格式的 api 和多种配音接口:

  • claude-3-5-sonnet-20240620, gemini-1.5-pro-002, gpt-4o, qwen2.5-72b-instruct, deepseek-coder, ...(按效果排序)
  • azure-tts, openai-tts, siliconflow-fishtts, fish-tts, GPT-SoVITS

详细的安装、 API 配置、汉化、批量说明可以参见文档:English | 简体中文

当前限制

  1. WhisperX 转录效果可能受到视频背景声影响,因为使用了 wav2vac 模型进行对齐,但尽管如此,WhisperX 已经能在 99% 情况下解决 Whisper 本身的幻觉问题。

  2. 使用较弱模型时容易在中间过程报错,这是因为对响应的 json 格式要求较为严格。如果出现此错误,请删除 output 文件夹后更换 llm 重试,否则重复执行会读取上次错误的响应导致同样错误。

  3. 配音功能由于不同语言的语速和语调差异,还受到翻译步骤的影响,可能不能 100% 完美,但本项目做了非常多的语速上的工程处理,尽可能保证配音效果。

  4. 多语言视频转录识别仅仅只会保留主要语言,这是由于 whisperX 在强制对齐单词级字幕时使用的是针对单个语言的特化模型,会因为不认识另一种语言而删去。

  5. 无法多角色分别配音,whisperX 的说话人区分效果不够好用。

📄 许可证

本项目采用 Apache 2.0 许可证,衷心感谢以下开源项目的贡献:

whisperX, yt-dlp, json_repair, BELLE

📬 联系我们

⭐ Star History

Star History Chart