🎬 基于 Qwen3-ASR-1.7B 的视频/音频语音转录工具,转录零 token 消耗。支持本地视频/音频文件及B站链接输入,自动进行语音识别、语义分段、标点补充,并生成带小标题的段落式 Markdown 文字稿。支持多语言翻译,需 CUDA GPU。
| 能力 | 说明 |
|---|---|
| 🎬 本地文件输入 | 支持视频(mp4/mkv/avi/webm)和音频(mp3/wav/flac/aac/m4a/ogg)文件 |
| 🔗 B站链接输入 | 自动通过浏览器获取B站视频音频流,处理防盗链下载 |
| 🎵 多音轨选择 | 多音轨文件列出轨道信息供用户选择 |
| ✂️ 音频分片 | 超过 90 秒的音频自动按 90 秒切分 |
| 🎤 语音转录 | 使用 Qwen3-ASR-1.7B,零 token 消耗,需 CUDA GPU |
| 📝 段落式排版 | 依据语义分段、补充标点、生成小标题和全文总结 |
| 🌐 多语言翻译 | 非中文内容自动翻译为中文并置于原文之前 |
| ✅ 环境预检 | 自动检测 ffmpeg、Python 依赖、模型文件完整性及显存 |
video-analyzer/
├── LICENSE ← GPL 3.0 许可证
├── README.md ← 本文件
├── .gitignore ← Git 忽略规则
│
├── video-analyzer-v1/ ← 早期版本
├── video-analyzer-v2/ ← 中期版本
├── video-analyzer-v3/ ← 稳定版本
│
└── video-analyzer-v3.5/ ← 最新版本(推荐使用)
├── README.md ← 版本说明
├── SKILL.md ← Agent 配置文件
├── dependencies/ ← 运行依赖(需自行下载)
│ ├── ffmpeg/
│ │ ├── ffmpeg.exe
│ │ └── ffprobe.exe
│ └── Qwen3-ASR-1.7B/ ← 语音识别模型(~4.7GB)
├── output/ ← 文字稿输出目录
└── sessions/ ← 处理过程文件目录
- 操作系统:Windows 10/11
- Python:3.8+
- GPU:支持 CUDA 的 NVIDIA 显卡,显存 ≥ 6GB
- 依赖:ffmpeg、Qwen3-ASR-1.7B 模型
git clone https://github.com/LazyHashBrown/video-analyzer.git
cd video-analyzerpip install qwen-asr- 访问 https://www.gyan.dev/ffmpeg/builds/
- 下载
ffmpeg-release-essentials.7z - 解压后将
bin/目录下的ffmpeg.exe和ffprobe.exe放入:video-analyzer-v3.5/dependencies/ffmpeg/
方式一:Hugging Face(推荐)
访问 https://huggingface.co/Qwen/Qwen3-ASR-1.7B/tree/main 下载以下 10 个文件到 video-analyzer-v3.5/dependencies/Qwen3-ASR-1.7B/:
config.jsongeneration_config.jsonpreprocessor_config.jsontokenizer_config.jsonchat_template.jsonmerges.txtvocab.jsonmodel.safetensors.index.jsonmodel-00001-of-00002.safetensorsmodel-00002-of-00002.safetensors
方式二:ModelScope(国内用户)
pip install modelscope
modelscope download --model Qwen/Qwen3-ASR-1.7B --local_dir ./video-analyzer-v3.5/dependencies/Qwen3-ASR-1.7B将 video-analyzer-v3.5/SKILL.md 安装到你的 AI Agent 的 skills 目录,然后在对话中输入:
视频转文字稿 <文件路径>音频转文字稿 <文件路径>视频转文字稿 <B站链接>
# 即将支持
python video_analyzer.py <input_file>转录完成后,会在 video-analyzer-v3.5/output/ 目录生成 Markdown 格式的文字稿,包含:
- 中文翻译(如原视频为外语)
- 按语义分段的转录文本
- 补充的标点符号
- 总结性小标题
- 全文总结
Q: 提示显存不足怎么办?
A: Qwen3-ASR-1.7B 需要约 6GB 显存(bfloat16)。请确保你的显卡有足够显存,或关闭其他占用显存的程序。
Q: B站视频下载失败怎么办?
A: 可能是防盗链拦截或流地址过期。请重新尝试,或检查网络连接。
Q: 转录结果不准确怎么办?
A: ASR 准确率受音频质量影响。建议使用清晰的音频源,避免背景噪音过大的视频。
- v3.5 - 最新版本,支持 B站链接、多音轨选择、环境预检
- v3 - 稳定版本,基础功能完善
- v2 - 中期版本
- v1 - 早期原型
本项目采用 GNU General Public License v3.0 许可证。
LazyHashBrown - GitHub
欢迎提交 Issue 和 Pull Request!
- Fork 本仓库
- 创建你的特性分支 (
git checkout -b feature/AmazingFeature) - 提交你的改动 (
git commit -m 'Add some AmazingFeature') - 推送到分支 (
git push origin feature/AmazingFeature) - 打开一个 Pull Request