Skip to content

Latest commit

 

History

2 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Video Analyzer

🎬 基于 Qwen3-ASR-1.7B 的视频/音频语音转录工具,转录零 token 消耗。支持本地视频/音频文件及B站链接输入,自动进行语音识别、语义分段、标点补充,并生成带小标题的段落式 Markdown 文字稿。支持多语言翻译,需 CUDA GPU。

功能特性

能力 说明
🎬 本地文件输入 支持视频(mp4/mkv/avi/webm)和音频(mp3/wav/flac/aac/m4a/ogg)文件
🔗 B站链接输入 自动通过浏览器获取B站视频音频流,处理防盗链下载
🎵 多音轨选择 多音轨文件列出轨道信息供用户选择
✂️ 音频分片 超过 90 秒的音频自动按 90 秒切分
🎤 语音转录 使用 Qwen3-ASR-1.7B,零 token 消耗,需 CUDA GPU
📝 段落式排版 依据语义分段、补充标点、生成小标题和全文总结
🌐 多语言翻译 非中文内容自动翻译为中文并置于原文之前
✅ 环境预检 自动检测 ffmpeg、Python 依赖、模型文件完整性及显存

目录结构

video-analyzer/
├── LICENSE                          ← GPL 3.0 许可证
├── README.md                        ← 本文件
├── .gitignore                       ← Git 忽略规则
│
├── video-analyzer-v1/               ← 早期版本
├── video-analyzer-v2/               ← 中期版本
├── video-analyzer-v3/               ← 稳定版本
│
└── video-analyzer-v3.5/             ← 最新版本(推荐使用)
    ├── README.md                    ← 版本说明
    ├── SKILL.md                     ← Agent 配置文件
    ├── dependencies/                ← 运行依赖(需自行下载)
    │   ├── ffmpeg/
    │   │   ├── ffmpeg.exe
    │   │   └── ffprobe.exe
    │   └── Qwen3-ASR-1.7B/         ← 语音识别模型(~4.7GB)
    ├── output/                      ← 文字稿输出目录
    └── sessions/                    ← 处理过程文件目录

环境要求

  • 操作系统:Windows 10/11
  • Python:3.8+
  • GPU:支持 CUDA 的 NVIDIA 显卡,显存 ≥ 6GB
  • 依赖:ffmpeg、Qwen3-ASR-1.7B 模型

安装

1. 克隆仓库

git clone https://github.com/LazyHashBrown/video-analyzer.git
cd video-analyzer

2. 安装 Python 依赖

pip install qwen-asr

3. 下载 ffmpeg

  1. 访问 https://www.gyan.dev/ffmpeg/builds/
  2. 下载 ffmpeg-release-essentials.7z
  3. 解压后将 bin/ 目录下的 ffmpeg.exeffprobe.exe 放入:
    video-analyzer-v3.5/dependencies/ffmpeg/
    

4. 下载 Qwen3-ASR-1.7B 模型

方式一:Hugging Face(推荐)

访问 https://huggingface.co/Qwen/Qwen3-ASR-1.7B/tree/main 下载以下 10 个文件到 video-analyzer-v3.5/dependencies/Qwen3-ASR-1.7B/

  • config.json
  • generation_config.json
  • preprocessor_config.json
  • tokenizer_config.json
  • chat_template.json
  • merges.txt
  • vocab.json
  • model.safetensors.index.json
  • model-00001-of-00002.safetensors
  • model-00002-of-00002.safetensors

方式二:ModelScope(国内用户)

pip install modelscope
modelscope download --model Qwen/Qwen3-ASR-1.7B --local_dir ./video-analyzer-v3.5/dependencies/Qwen3-ASR-1.7B

使用方法

作为 Agent Skill 使用

video-analyzer-v3.5/SKILL.md 安装到你的 AI Agent 的 skills 目录,然后在对话中输入:

  • 视频转文字稿 <文件路径>
  • 音频转文字稿 <文件路径>
  • 视频转文字稿 <B站链接>

命令行使用(待开发)

# 即将支持
python video_analyzer.py <input_file>

输出示例

转录完成后,会在 video-analyzer-v3.5/output/ 目录生成 Markdown 格式的文字稿,包含:

  • 中文翻译(如原视频为外语)
  • 按语义分段的转录文本
  • 补充的标点符号
  • 总结性小标题
  • 全文总结

常见问题

Q: 提示显存不足怎么办?

A: Qwen3-ASR-1.7B 需要约 6GB 显存(bfloat16)。请确保你的显卡有足够显存,或关闭其他占用显存的程序。

Q: B站视频下载失败怎么办?

A: 可能是防盗链拦截或流地址过期。请重新尝试,或检查网络连接。

Q: 转录结果不准确怎么办?

A: ASR 准确率受音频质量影响。建议使用清晰的音频源,避免背景噪音过大的视频。

版本历史

  • v3.5 - 最新版本,支持 B站链接、多音轨选择、环境预检
  • v3 - 稳定版本,基础功能完善
  • v2 - 中期版本
  • v1 - 早期原型

许可证

本项目采用 GNU General Public License v3.0 许可证。

致谢

作者

LazyHashBrown - GitHub

贡献

欢迎提交 Issue 和 Pull Request!

  1. Fork 本仓库
  2. 创建你的特性分支 (git checkout -b feature/AmazingFeature)
  3. 提交你的改动 (git commit -m 'Add some AmazingFeature')
  4. 推送到分支 (git push origin feature/AmazingFeature)
  5. 打开一个 Pull Request

About

🎬 基于 Qwen3-ASR-1.7B 的视频/音频语音转录工具,转录零 token 消耗。支持本地视频/音频文件及B站链接输入,自动进行语音识别、语义分段、标点补充,并生成带小标题的段落式 Markdown 文字稿。支持多语言翻译,需 CUDA GPU。

Resources

Stars

2 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors