RTT(Real-Time Translator) 是一款面向 Web/PWA、Android 和 Windows 的开放翻译平台。实时字幕把外语影片、直播、会议、语音聊天或画面字幕转换成可悬浮显示的双语字幕;专业翻译机则处理文字、PDF、Office、结构化文本、字幕文件,并可从视频生成带时间轴的翻译字幕。
产品首页 · Web 工作台 · 中文镜像 · 模型目录 · 下载最新版本 · 中文使用指南 · English guide
两个域名的根路径是产品首页,首页可直接注册、登录或进入 Web 工作台;/app/ 是受账户门禁保护的翻译工作台。浏览器支持实时语音、主动共享画面后的字幕区域 OCR、文字与文件翻译、视频转字幕、能力档案、模型目录和 PWA 安装。GitHub Pages 地址保留作为备用镜像。
- 看外语电影、视频和直播:捕获允许录制的应用音频,实时显示原文与简体中文字幕。
- 听外语会议或语音聊天:通过麦克风识别扬声器播放的远端声音,适合外放场景。
- 翻译画面中的原文字幕:在 Android 上框选字幕区域,设备端 OCR 稳定识别后再翻译。
- 处理文字、PDF、Office 与字幕文件:翻译机提供文本、文档、字幕和可下载任务队列,显示分析、OCR、翻译和结果生成进度。
- 从视频制作字幕:导入视频后提取音轨,使用当前 ASR 与翻译路线生成
SRT / VTT / ASS / TXT,可选择纯译文或双语字幕。 - 保留文档格式或完全本地处理:DeepL 等原生文档接口可返回保留格式的 PDF、DOCX、PPTX、XLSX;普通文字模型则对 PDF 文本层或 OCR 结果做本地分段翻译,并明确输出为可编辑文本。
RTT 不修改原视频;生成的字幕始终保存为独立文件。延迟式中文播报也不会被宣传为口型同步配音。
- 从 Releases 下载对应平台的安装包,并核对同版本的
SHA256SUMS.txt。 - 在 RTT 的“模型”中保留内置模型,或按源语言下载、导入并选择自己的本地模型;也可以分别配置语音识别和文字翻译 API。
- 在“字幕”中选择 语音、画面字幕 或 同时启用,授予需要的权限后点击“开始”。画面字幕模式会先让你框选字幕区域。
- 需要离线处理整段视频时,进入“翻译机 → 视频”,选择格式和双语选项后导入视频;结果可预览并保存到下载目录。
Android 翻译会话运行在前台服务中。回到桌面、打开播放器后仍会继续,且会显示常驻通知;点击通知中的停止操作或悬浮字幕右上角关闭按钮即可结束会话。系统重启、屏幕捕获授权被撤销或某些厂商强制清理后台后,需要重新启动并授权。
Web、Android 和 Windows 都会先显示登录或注册界面,并统一使用 Supabase 在线账户;没有有效会话时不能进入工作台,不再提供离线账户。支持邮箱注册、强制邮箱验证、邮箱密码登录、GitHub OAuth、会话恢复、显示名称跨端同步和密码重置。Android 与 Windows 的“忘记密码”会打开同一套 Web 恢复流程。API Key 会保留设备加密副本,并以 AES-256-GCM 密文同步到账户;Android 断网保存或删除的操作会排队,在恢复登录和网络后补同步。模型文件、模型路径、音频、字幕和译文正文仍只保存在本机。在线账户部署、RLS 和双域名回调配置见 在线账户部署。
| 需求 | 推荐选择 | 说明 |
|---|---|---|
| 优先速度 | Vosk 小模型 | 适合英语、日语等已选定源语言;资源占用低。 |
| 多语种本地识别 | SenseVoiceSmall INT8 | 默认准确模式,适合英语、中文、日语、韩语、粤语等。 |
| 尽量多的语言 | Omnilingual CTC 300M INT8 | 面向广语言覆盖;没有标点模型时 RTT 使用 VAD 与语言规则分句。 |
| 更高准确率 | Qwen3-ASR 0.6B INT8 | 约 879 MB,适合大内存 Android 设备和 Windows。 |
| 不想上传内容 | 本地 ASR + 本地翻译 | 下载完成后可断网使用,不会隐式请求云端。 |
| 想要更好的译文 | 本地 ASR + 翻译 API | 文字翻译可选择 DeepL、百度翻译、LibreTranslate 或兼容 API 平台。 |
| 给整段视频制作字幕 | 本地 ASR + 任意翻译路线 | 默认不上传内容;云端 ASR 必须单独确认后才上传分段音频,视频画面不会上传。 |
语音识别、文字翻译、分句与标点、OCR、TTS 在 RTT 中是独立能力。比如可以使用“本地 SenseVoice + DeepL 翻译”,或“阿里云实时语音识别 + 本地翻译”。能力档案支持多个命名配置,避免一个 API Key 被错误用于另一个模型或接口。
Omnilingual CTC 300M INT8:若你看到
OmnilingualRecognizerFactory cannot be cast to AccurateRecognizerFactory,这是旧构建的启动代码问题,不是模型文件损坏。更新到最新 RTT 构建后无需重新下载模型。
- 应用内下载:保留 Vosk 和其他语言模型的下载入口,可按语言筛选并自行选择已安装模型。模型卡片提供“下载并验证/安装并验证”,未完成运行时检查的条目不会伪装成可用。
- Android 本地模型限制:单个可下载模型包上限为 1 GB;基础模型随 APK 提供,其余模型由用户主动下载。
- 本地文字翻译:支持 ML Kit 语言包和经过 Marian ONNX 布局验证的导入模型。导入模型可以添加自己的说明;尚未验证的目录会显示为参考资料,不会假装可以运行。
- 翻译 API:除了通用模型 API,单独提供 DeepL、百度翻译与 LibreTranslate 的翻译配置页。
- 文档翻译 API:原生文档能力与普通文字翻译分开声明。没有文档能力的模型不会被标记为可保留 PDF/Office 版式。
推荐模型、下载来源、许可证、平台建议和验证状态见 推荐模型与许可证。具备完整下载元数据的模型会明确显示“可直接下载安装(自动校验)”,而不是提供一个没有动作入口的“待验证”状态。
Windows 开发环境可以直接执行下面的命令,把首批模型下载/复用到 F:\RTT\models、解压安装并检查布局,然后运行真实推理验收:
.\scripts\download-install-verify-models.ps1 -RunWindowsInference结果写入本机的 artifacts/model-install-verification.json,汇总说明见 模型安装与验证记录。报告中的 WINDOWS_REAL_INFERENCE_PASSED 表示已经用 RTT 的实际 ASR 或翻译运行时处理测试音频/文本;INSTALLED_LAYOUT_VERIFIED 只表示文件和布局正确,通常还需要对应原生运行时或设备测试。
应用音频 / 麦克风 屏幕字幕区域
│ │
▼ ▼
16 kHz 单声道 PCM → VAD / ASR OCR → 稳定帧去重
│ │
└──────────────┬─────────────────┘
▼
分句、标点、稳定前缀与上下文
▼
本地或云端文字翻译
▼
双语悬浮字幕 / 全文记录 / 可选中文播报
为了减少“字幕半句就翻”和“已经显示的句子被改写”,RTT 将 VAD、最终识别结果、标点和语言规则一起用于分句;稳定前缀保持不动,只刷新仍可能变化的尾部。翻译会保留最近少量上下文,旧请求的晚到结果不能覆盖新修订。
- 设备内部音频或麦克风输入
- 双语悬浮字幕,可拖动、手动缩放、调整宽度与透明度
- 语音、画面字幕或两者同时翻译
- 设备端 ML Kit OCR 与字幕区域框选
- 模型下载、导入、校验和删除
- “全文”记录与“翻译机”文字/文件翻译队列
- 翻译机支持批量选择文件、PDF 逐页设备端 OCR、SRT/VTT 时间轴保护,以及原生文档 API 的格式保留结果
- 视频导入后流式解码音轨并生成 SRT、VTT、ASS 或 TXT;长视频使用自动清理的临时 PCM 文件,不会一次性载入内存
Android 的受保护通话音频不能直接内录。用于语音聊天时,请使用扬声器播放远端声音,并让麦克风收音;耳机中的远端声音通常不会进入麦克风。
- WASAPI 播放设备回环捕获,可在字幕页选择具体输出设备
- 透明置顶字幕窗和系统托盘控制
- 本地模型和云端能力档案
- PDF 文本层提取、Office/PDF 原生文档翻译、文件任务进度与结果定位
- 视频转写、逐段翻译、双语字幕预览,以及 SRT、VTT、ASS、TXT 导出
- 默认设备切换后可重新选择设备并恢复会话
插拔耳机、切换默认输出设备或从睡眠恢复后,如音量表不再变化,请停止会话,在“音频输入”中重新选择播放设备后再开始。
Windows 视频解码使用系统 Media Foundation。MP4、MOV、M4V 和 AVI 通常可直接读取;MKV、WebM 等格式是否可用取决于系统已安装的媒体编解码器。
RTT 不收集遥测。诊断日志默认关闭,且不得写入音频、字幕正文或 API Key。Android 使用 Keystore,Windows 使用 DPAPI/Credential Locker 保存设备副本;云端只保存 AES-256-GCM 密文、指纹与同步元数据。只有用户主动显示或复制,或开发者管理员在近期重新认证、填写原因并留下审计记录后,才会临时解密指定密钥。
- 本地模式不会上传音频、画面或字幕正文。
- 视频转字幕使用云端 ASR 时只上传分段后的音轨,并要求用户明确确认;视频帧始终不会上传。翻译 API 会接收识别后的字幕文本。
- 使用云端功能时,RTT 会明确显示实际使用的能力、模型和服务商。
- DRM 内容、禁止
AudioPlaybackCapture的应用以及FLAG_SECURE画面无法绕过。 - “压低原声”不可用时,中文播报会自动退化为叠加播放。
RTT 使用 Apache-2.0 许可证。公开仓库只提供面向用户的产品资料、静态站点和发行包;模型与第三方组件保留各自的许可证,详见 第三方声明。
开发、构建和贡献说明在 CONTRIBUTING.md;完整技术文档与模型清单在 docs/ 和 models/ 目录中。
