OpenAI Whisper:视频语音转文本在线体验及本地部署
文章目录
Whisper 是什么
Whisper 是 OpenAI 开发并开源的一个自动语音识别(ASR)系统。该模型基于从网络上收集的 680,000 小时多语种和多任务监督数据进行训练,具有极高的准确性,并且支持多种语言的识别。Whisper 使用了 Transformer 架构,能够处理各种复杂的音频条件,如不同的背景噪声水平、说话者的口音和语速等。

Whisper 可以做什么
在语音转录方面,Whisper可以将音频转换为文字,方便记录和整理。 此外,Whisper 还可以用于语音助手、智能客服和在线教育等领域,为用户提供更加智能和高效的服务。 为了方便开发者使用,OpenAI 还提供了详细的文档和推理代码。 开发者可以根据自己的需求对模型进行微调,以适应特定领域的应用。
Whisper 在线体验
Hugging Face 体验地址,如果打不开请使用富强上网。
-
Whisper Web:支持通过URL、文件、录音来转录文字
pyVideoTrans
pyVideoTrans一键将视频从一种语言翻译为另一种语言,支持 30+ 语言
- 支持系统:Windows、MacOS
- 全自动视频翻译:一键完成语音识别 → 字幕翻译 → AI 配音 → 视频合成,自动生成带有目标语言字幕和配音的全新视频。
- 独立的语音转录/语音合成功能:配有批量语音转录、批量字幕配音、批量翻译SRT字幕功能。
- 多种 AI 模型支持:集成 Faster-Whisper、F5-TTS、Qwen3-ASR、Edge-TTS 等 30+ 种渠道,支持本地离线与在线 API,自由组合搭配。
- 桌面软件与浏览器及命令行三模式:桌面 GUI + WebUI 网页界面 + CLI 命令行,适配本地使用、远程访问、服务器部署、Docker 容器化等多种场景。
- 无最低硬件要求:有无英伟达显卡均可运行,笔记本、台式机都可跑。若有英伟达显卡支持开启 CUDA加速
Buzz
Buzz 在您的个人电脑上离线转录和翻译音频。由 OpenAI 的 Whisper 提供支持。
- 导入音频和视频文件,并将转录内容导出为 TXT、SRT 和 VTT 格式(演示)
- 从电脑麦克风转录和翻译为文本(资源密集型,可能无法实时完成,演示)
- 支持 Whisper、 Whisper.cpp、Faster Whisper、 Whisper 兼容的 Hugging Face 模型 和 OpenAI Whisper API
- 命令行界面
- 支持 Mac、Windows 和 Linux
Vibe
Vibe 在设备上直接转录音频和视频
- 🌍 Transcribe almost every language
🌍 几乎所有语言都要转录 - 🔒 Ultimate privacy: fully offline transcription, no data ever leaves your device
🔒 终极隐私:完全离线转录,数据绝不会流出你的设备 - 🎨 User friendly design
🎨 用户友好设计 - 🎙️ Transcribe audio / video
🎙️ 转录音频/视频 - 🎶 Option to transcribe audio from popular websites (YouTube, Vimeo, Facebook, Twitter and more!)
🎶 提供从热门网站(YouTube、Vimeo、Facebook、Twitter等)转录音频的选项! - 📂 Batch transcribe multiple files!
📂 批量转录多个文件! - 📝 Support
SRT,VTT,TXT,HTML,PDF,JSON,DOCXformats
📝 支持SRT、VTT、TXT、HTML、PDF、JSON、DOCX格式 - 👀 Realtime preview 👀 实时预览
- 🤖 Supports Whisper, Nemotron 3.5, and Parakeet TDT v3 models
🤖 支持Whisper、Nemotron 3.5和Parakeet TDT v3型号 - ✨ Summarize transcripts: Get quick, multilingual summaries using the Claude API
✨ 摘要文字稿:使用 Claude API 获取快速多语言摘要 - 🧠 Ollama support: Do local AI analysis and batch summaries with Ollama
🧠 Ollama 支持:用 Ollama 进行本地 AI 分析和批量摘要 - 🌐 Translate to English from any language
🌐 从任何语言翻译成英文 - 🖨️ Print transcript directly to any printer
🖨️ 直接将文字记录打印到任何印刷厂 - 🔄 Automatic updates 🔄 自动更新
- 💻 Optimized for
GPU(macOS,Windows,Linux)
💻 针对GPU优化(macOS、Windows、Linux) - 🎮 Optimized for
Nvidia/AMD/IntelGPUs! (Vulkan/CoreML)
🎮 针对Nvidia/AMD/IntelGPU 优化!(Vulkan/CoreML) - 🔧 Total Freedom: Customize Models Easily via Settings
🔧 完全自由:通过设置轻松自定义模型 - ⚙️ Model arguments for advanced users
⚙️ 高级用户模型论证 - ⏳ Transcribe system audio
⏳ 转录系统音频 - 🎤 Transcribe from microphone
🎤 麦克风转录 - 🖥️ CLI support: Use Vibe directly from the command line interface! (see
--help)
🖥️ CLI支持:直接在命令行界面使用Vibe!(见--help) - 👥 Speaker diarization
👥 说话者日记 - 🎬 Stable timestamps mode for subtitle/movie-grade timing (VAD-backed, slower)
🎬 字幕/电影级时间点稳定模式(VAD支持,较慢) - 📱
iOS & Android support(coming soon)
📱 iOS和 Android 支持(即将推出) - 📥 Integrate custom models from your own site: Use
vibe://download/?url=<model url>
📥 从你自己的网站整合自定义模型:使用vibe://download/?url=<model url> - 📹 Choose caption length optimized for videos / reels
📹 选择针对视频/短视频优化的字幕长度 - ⚡ HTTP API with Swagger docs and agent skills
⚡ HTTP API 包含 Swagger 文档和代理技能
Whisper-WebUI
Whisper-WebUI (Whisper Webui - Hugging Face 体验地址)基于 Gradio 的 Whisper 浏览器界面。您可以将其用作简易字幕生成器!
CapsWriter-Offline
HaujetZhao/CapsWriter-Offline : CapsWriter 的离线版,一个好用的 PC 端的语音输入工具
- 完全离线、无限时长、低延迟、高准确率、中英混输、自动阿拉伯数字、自动调整中英间隔
- 热词功能:可以在
hot-en.txt hot-zh.txt hot-rule.txt中添加三种热词,客户端动态载入 - 日记功能:默认每次录音识别后,识别结果记录在
年份/月份/日期.md,录音文件保存在年份/月份/assets - 关键词日记:识别结果若以关键词开头,会被记录在
年份/月份/关键词-日期.md,关键词在keywords.txt中定义 - 转录功能:将音视频文件拖动到客户端打开,即可转录生成 srt 字幕
- 服务端、客户端分离,可以服务多台客户端
- 编辑
config.py,可以配置服务端地址、快捷键、录音开关……
Whisper
Whisper 高性能 GPGPU 推理 OpenAI 的 Whisper 自动语音识别 (ASR) 模型,是 whisper.cpp 实现的 Windows 移植。
Faster Whisper transcription with CTranslate2
faster-whisper 是使用 CTranslate2 对 OpenAI 的 Whisper 模型的重新实现,CTranslate2 是用于 Transformer 模型的快速推理引擎。
与 openai/whisper 相比,在相同精度下,这种实现方式的速度最多可提高 4 倍,同时使用的内存更少。在 CPU 和 GPU 上进行 8 位量化后,效率还能进一步提高。
video-subtitle-master
buxuku/video-subtitle-master : 批量为视频生成字幕,并可将字幕翻译成其它语言。这是一个客户端工具, 跨平台支持 mac 和 windows 系统
distil-whisper
huggingface/distil-whisper 语音识别 Whisper 的精馏变体。速度快 6 倍,体积小 50%,单词错误率在 1%以内。
Voice Recognition to Text Tool
Voice Recognition to Text Tool 是一个离线运行的本地语音识别转文字工具,基于 fast-whipser 开源模型,可将视频/音频中的人类声音识别并转为文字,可输出json格式、srt字幕带时间戳格式、纯文字格式。可用于自行部署后替代 openai 的语音识别接口或百度语音识别等,准确率基本等同openai官方api接口。
fast-whisper 开源模型有 base/small/medium/large-v3, 内置base模型,base->large-v3识别效果越来越好,但所需计算机资源也更多,根据需要可自行下载后解压到 models 目录下即可。
- 支持系统:Win
Chenyme-AAVT
Chenyme-AAVT: 这是一个全自动(音频)视频翻译项目。利用Whisper识别声音,AI大模型翻译字幕,最后合并字幕视频,生成翻译后的视频。
- 支持识别和翻译多种语言
- 支持 全流程本地化、免费化部署
- 支持对视频 一键生成博客内容、营销图文
- 支持 自动化翻译、二次修改字幕、预览视频
- 支持开启 GPU 加速、VAD 辅助、FFmpeg 加速
- 支持使用 ChatGPT、Claude、Gemini、DeepSeek 等众多大模型翻译引擎
Voice-Pro
Voice-Pro 先进的AI驱动多媒体处理工具 | Whisper语音识别WebUI
Voice-Pro 是一款旨在革新多媒体内容处理的尖端AI驱动的Web应用程序。通过提供YouTube视频下载、语音分离、语音识别、翻译和文本转语音等全面功能,为内容创作者、研究者和多语言通信专业人士提供了一站式解决方案。
- 🔊 尖端语音识别 (Whisper, Faster-Whisper, Whisper-Timestamped)
- 🎤 使用F5-TTS和E2-TTS进行零样本语音克隆
- 🎥 YouTube视频处理和音频提取
- 🔇 专业语音分离(UVR5技术)
- 📢 多语言文本转语音(Edge-TTS)
- 🌍 跨100多种语言的即时翻译
- 🔥 AI封面制作(RVC技术)
Voice-Pro为ElevenLabs提供了一个现实的替代方案,满足寻求先进文本转语音解决方案的内容创作者、播客、研究人员和开发者的需求。
MacWhisper
其他推荐
你觉得这篇文章怎么样?
共有 0 条评论