OpenWhispr:本地 Whisper/Parakeet 驱动的跨平台语音桌面助手
一个给桌面用户做语音输入、会议转写和 AI 操作的开源助手,能用本地 Whisper/Parakeet 而非必须上传音频。
GitHub OpenWhispr/openwhispr 更新 2026-09-05 分支 main 星标 6.8K 分叉 902
JavaScript/TypeScript Electron 41 Whisper/Parakeet 语音转文字 macOS/Windows/Linux

🧭 决策指南

适合,如果你

  • 你要在 macOS、Windows 或 Linux 的任意应用中用全局热键输入语音。
    README 的 Features:Voice dictation;Download 章节列出 macOS、Windows、Linux 安装包。
  • 你希望音频留在设备上,并接受 Whisper 或 NVIDIA Parakeet 本地模型。
    README 正文明确写明 local speech-to-text、Whisper、NVIDIA Parakeet 以及“your audio never leaves your device”。
  • 你需要把 GPT-5、Claude、Gemini 或本地模型接成命名语音助手。
    README 的 Features:AI agent,列出 GPT-5、Claude、Gemini、Groq、Tinfoil、OpenRouter 和 local models。
  • 你要处理 Zoom、Teams 或 FaceTime 会议,并使用本地说话人标注。
    README 的 Features:Meeting transcription 与 Local speaker diarization。

不适合,如果你

  • 你使用 Intel Mac,且必须要 live speaker identification 或 voice fingerprinting。
    README Download 注释明确说明 Intel Macs 不提供 live speaker identification 和 voice fingerprinting。
  • 你使用 Intel Mac,且必须保留 Notes 的 semantic search。
    README Download 注释说明 Intel Mac 的 notes search 会退回 keyword matching。
  • 你的开发环境低于 Node.js 24+,无法升级到 README 要求的版本。
    README Quick start 明确写有 Requires Node.js 24+。
  • 你的目标平台不是 README 下载表中的 macOS、Windows 或 Linux。
    README Download 仅列出 macOS、Windows、Linux 安装包。

前置条件

  • 开发安装需要 Node.js 24+。
  • Quick start 使用 npm install 和 npm run dev。
  • 可选本地 GPU 加速包括 Metal、CUDA、Vulkan(AMD/Intel)。
  • Intel Mac 的 ONNX Runtime 依赖在 1.24 后不再提供 macOS x86_64 binaries。

第一步命令(README 原文)

git clone https://github.com/OpenWhispr/openwhispr.git

要注意

  • Intel Mac 会议仍可录音转写,但没有 live speaker identification。
    README Download 的 Intel Mac 注释。
  • 没有可写入的文本光标时,Voice Assistant 会输出到 floating panel 并复制到 clipboard。
    README Features:Voice Assistant hotkey。
  • 启用截图上下文会把当前屏幕截图作为 AI assistant 上下文发送。
    README Features:Voice Assistant hotkey 明确提供 screenshot opt-in。
  • 云模型、企业 SSO、SCIM 和 Bedrock/Azure OpenAI 的具体配置不在 README 正文展开。
    README Features 仅列出 Enterprise controls,配置链接指向 Documentation。

材料未说明

  • README 没有给出 Whisper、Parakeet 或各云模型的转写延迟和准确率。
  • README 没有说明不同 GPU、CPU 和内存配置下的资源占用。
  • README 没有给出 Zoom、Teams、FaceTime 自动检测的支持版本范围。
  • README 没有说明本地模型下载体积、模型切换流程和离线首次安装要求。
  • README 没有给出云服务商 BYOK 的具体密钥配置、费用或数据保留规则。
  • README 没有提供 1.9.2 版本的变更细节或已知缺陷清单。

💡 深度解析

6
不适合 我使用 Intel Mac,需要自动识别 Zoom、Teams 和 FaceTime 会议中的说话人,并依赖语义搜索整理笔记;OpenWhispr 能否完整满足这个工作流?
适合读者: 在 Intel Mac 上使用会议转录、说话人识别和笔记搜索的会议记录维护者

不适合完整满足,因为 Intel Mac 缺少项目依赖的实时说话人识别和语音指纹能力,语义搜索也会降级。

  • README 的 Download 注释明确指出,Intel Mac 无法使用 live speaker identification 和 voice fingerprinting。
  • 原因是 ONNX Runtime 自 1.24 起停止提供 macOS x86_64 二进制文件。
  • 会议仍可正常录音和转录,因此基础会议文字记录可用。
  • Notes 的 semantic search 在该平台会退化为 keyword matching,不能提供同等的语义检索能力。

如果你的硬约束是参与者级别标注和语义搜索,平台限制直接阻断了完整方案;若只需要 Zoom、Teams 或 FaceTime 的录音与转录,项目仍可覆盖这一部分。

  • Download:On Intel Macs, live speaker identification and voice fingerprinting are unavailable
  • Download:Meetings still record and transcribe normally
  • Download:notes search falls back to keyword matching instead of semantic search
  • Features:Meeting transcription;Local speaker diarization
材料未说明:README 未说明 Intel Mac 上是否存在可选的云端说话人识别实现。;README 未给出不同会议规模、重叠发言或音频质量下的识别准确率。
适合 我每天在多个桌面应用中选中文本,希望用一个快捷键把语音发送给 GPT-5、Claude、Gemini 或本地模型,并让结果原地替换选区;OpenWhispr 是否适合?
适合读者: 希望让语音直接编辑光标处选中文本,并使用 GPT-5、Claude、Gemini 或本地模型的 AI 重度用户

适合,因为它把全局快捷键、语音指令和选中文本原地编辑组合成了 README 明确支持的工作流。

  • Voice dictation 支持 global hotkey,并将文字自动粘贴到任意应用。
  • AI agent 支持 GPT-5、Claude、Gemini、Groq、Tinfoil、OpenRouter 或本地模型。
  • Voice Assistant hotkey 会将语音直接作为 AI 命令发送,无需 wake word 或 cleanup pass。
  • README 明确写明 highlighted text is edited in place;有可写光标时自动粘贴,没有时输出到 floating panel 并复制到剪贴板。

因此,跨应用改写、格式化和草稿生成与目标一致。是否能在某个具体应用中原地写回,仍取决于该窗口是否提供可写光标及系统自动化权限。

  • Features:Voice dictation — global hotkey to dictate into any app with automatic pasting
  • Features:AI agent — talk to GPT-5, Claude, Gemini, Groq, Tinfoil, OpenRouter, or local models
  • Features:highlighted text is edited in place
  • Features:answers paste at a focused text cursor or stream into a floating panel
材料未说明:README 未列出各桌面应用对选区读取、原地替换和自动粘贴的兼容矩阵。;README 未说明 GPT-5、Claude、Gemini 等服务的具体密钥配置、费用和速率限制。
适合 我处理内部会议和敏感笔记,要求音频不离开设备;我的设备是 Apple Silicon、CUDA GPU 或支持 Vulkan 的 AMD/Intel GPU,OpenWhispr 是否适合替代云端语音转文字服务?
适合读者: 处理内部会议和敏感笔记、要求音频不离开设备,并在 Apple Silicon、CUDA 或 Vulkan GPU 上运行本地模型的隐私敏感用户

适合,前提是你接受本地模型带来的硬件占用和速度差异;README 明确支持音频不离开设备的本地路径。

  • 项目介绍说明可使用 Whisper 或 NVIDIA Parakeet 的 fully private offline transcription,音频不会离开设备。
  • README 的 Local or cloud — your choice 章节写明转录、AI 推理、说话人分离和语义搜索都可使用本地模型或云端提供商。
  • 本地 Whisper 支持 Metal、CUDA,以及 AMD/Intel 的 Vulkan GPU 加速路径。
  • 项目声明 no data collection、no telemetry,并采用开源 MIT License。

因此,基础听写和会议转录可以按本地隐私边界运行;但云端 AI、同步或外部模型一旦启用,就不能再视为完全离线处理。

  • 项目介绍:fully private offline transcription;your audio never leaves your device
  • Features:Local or cloud — your choice
  • Features:GPU-accelerated local Whisper on Metal, CUDA, and Vulkan (AMD/Intel)
  • 项目介绍:No data collection, no telemetry, fully open source
材料未说明:README 未列出 Whisper 或 Parakeet 各模型的下载大小、最低内存和实时性要求。;README 未说明云同步功能在启用本地模型时具体同步哪些数据。
适合 我正在维护一个基于 Electron 41、React 19、TypeScript 和 better-sqlite3 的跨平台桌面应用,目标平台是 macOS、Windows 和 Linux;OpenWhispr 的架构和技术栈是否适合作为集成或二次开发基础?
适合读者: 需要在 macOS、Windows 和 Linux 上维护 Electron 41 应用,并希望复用 React 19、TypeScript 和 better-sqlite3 的桌面应用开发者

适合,因为它的桌面架构和你的技术栈高度重合,但原生模块与系统权限会增加构建成本。

  • README 明确列出 React 19、TypeScript、Electron 41、better-sqlite3,以及 whisper.cpp 和 sherpa-onnx。
  • 项目原生代码包含 C 和 Objective-C,说明语音推理及平台能力不只是 JavaScript 层封装。
  • README 提供 macOS、Windows、Linux 下载包,并覆盖 API、MCP 和平台指南,便于按平台扩展。
  • 项目采用 MIT License,允许商业使用和二次开发。

因此,界面、数据层和 Electron 集成可以直接参考;但原生推理、自动粘贴、麦克风和键盘监听的构建与权限细节仍需单独处理。

  • Tech stack:React 19, TypeScript, Tailwind CSS v4, Electron 41, better-sqlite3, whisper.cpp, sherpa-onnx
  • Download:macOS、Windows、Linux
  • 项目数据:MIT License;语言分布包含 JavaScript、TypeScript、C、Objective-C
  • Features:Public API & MCP
git clone https://github.com/OpenWhispr/openwhispr.git
cd openwhispr
npm install
npm run dev
材料未说明:README 未说明原生模块在三种操作系统上的完整构建依赖和签名流程。;README 未说明二次开发后的 API 兼容承诺和数据库迁移策略。
适合 我需要自动处理 Zoom、Teams 和 FaceTime 会议,生成带说话人区分的笔记,还要批量导入音视频文件和 YouTube/audio URL;OpenWhispr 能否覆盖这套会议资料流程?
适合读者: 需要从 Zoom、Teams 和 FaceTime 会议自动生成带说话人标注的笔记,并通过文件批量导入或 YouTube/audio URL 处理历史录音的会议运营人员

适合,因为 README 同时覆盖通话自动检测、实时转录、说话人能力、笔记管理和历史媒体导入。

  • Meeting transcription 支持自动识别 Zoom、Teams 和 FaceTime 通话,并提供 live speaker diarization、voice fingerprinting 及 Google、Microsoft、Apple Calendar 集成。
  • Local speaker diarization 可在设备上标注说话人,并跨会议识别语音指纹,不依赖云端。
  • Audio import 支持音频和视频拖放、批量上传,以及 YouTube/audio URL 转录,并可选择说话人检测。
  • Notes 支持文件夹、搜索、semantic search、cloud sync 和 AI actions,能够承接转录后的整理流程。

所以它适合把实时会议和历史录音放进同一套笔记流程;但多人重叠发言、噪声和录音质量对说话人标注的实际效果,README 没有给出保证。

  • Features:Meeting transcription — auto-detect Zoom, Teams, and FaceTime calls
  • Features:live speaker diarization, voice fingerprinting, and calendar integration
  • Features:Audio import — drag in files, batch-upload, or paste a YouTube/audio URL
  • Features:Notes — folders, semantic search, cloud sync, and AI actions
材料未说明:README 未说明 Zoom、Teams 和 FaceTime 自动检测对各平台版本及系统权限的具体要求。;README 未说明批量导入的文件格式、单批次规模和长录音处理上限。;README 未给出说话人分离和语音指纹在重叠发言场景下的准确率。
视情况 我需要把语音转录和笔记接入自动化平台,并为组织统一管理 SSO、SCIM 以及 Amazon Bedrock 或 Azure OpenAI 访问;OpenWhispr 是否能作为企业集成入口?
适合读者: 需要把桌面语音、笔记和转录接入现有自动化平台,并计划通过 Public API、MCP、SSO 和 SCIM 管理组织访问的企业集成工程师

视情况:接口和企业控制面已经明确存在,但 README 没有证明这些能力可完全自托管或满足你的审计要求。

  • Features 列出 Public API & MCP,可通过 API 管理 notes 和 transcriptions,或将 AI assistant 接入 MCP server。
  • Enterprise controls 支持组织策略、company SSO、SCIM,以及集中管理的 Amazon Bedrock 或 Azure OpenAI 访问,不必向用户分发云端密钥。
  • Team spaces 支持角色、邀请和 server-enforced membership,适合组织协作边界。
  • 项目采用 MIT License,但 README 没有把云同步、团队空间和企业身份能力描述为完整离线自托管组件。

如果你的目标是连接现有 AI 自动化并集中管控,方向匹配;若要求所有后端、审计日志和数据驻留都由企业自行部署,当前资料不足以确认。

  • Features:Public API & MCP
  • Features:Enterprise controls — organization policy, company SSO and SCIM
  • Features:centrally managed Amazon Bedrock or Azure OpenAI access without distributing cloud keys
  • Features:Team spaces & sharing — roles, invitations, and server-enforced membership
  • Usage limitations:云同步、团队空间、企业 SSO/SCIM 等服务能力可能依赖 OpenWhispr Cloud 或相关后端
材料未说明:README 未说明企业功能的授权方式、部署拓扑、审计日志和数据驻留选项。;README 未确认 OpenWhispr Cloud 是否支持完整自托管,以及 API/MCP 的认证和权限粒度。

✨ 核心亮点

  • Whisper 与 NVIDIA Parakeet 支持本地离线转写
  • Electron 41 覆盖 macOS、Windows、Linux
  • GPT-5、Claude、Gemini 与本地模型可作语音助手
  • Zoom、Teams、FaceTime 支持会议转写与说话人标注

🔧 工程化

  • 全局热键把语音转文字并自动粘贴到任意应用
  • whisper.cpp、sherpa-onnx 提供本地模型推理
  • Notes 提供文件夹、语义搜索、云同步和 AI 操作
  • API 与 MCP server 可程序化管理笔记和转写

⚠️ 风险

  • Intel Mac 因 ONNX Runtime 1.24 不支持说话人识别
  • Intel Mac 的 Notes 语义搜索会退回关键词匹配
  • 本地 GPU 加速依赖 Metal、CUDA 或 Vulkan 后端
  • 开发环境要求 Node.js 24+,低版本无法按 Quick start 安装

👥 适合谁?

  • 需要 macOS、Windows 或 Linux 桌面语音输入的开发者
  • 使用 React 19、TypeScript 或 Electron 41 的贡献者
  • 需要 Whisper、Parakeet 本地转写和 MCP 集成的团队