Qwen Scribe開源:Apple Silicon專屬離線ASR工具,中文語音轉錄首字延遲<300ms

Qwen Scribe 正式開源:Apple Silicon 專屬本地 ASR 工具,中文語音轉錄首字延遲低于 300ms,全程離線。
Qwen Scribe 是阿里巴巴通義實驗室推出的輕量級、全離線語音轉錄引擎,專為 Apple Silicon(M1/M2/M3)優化。二進制體積 12MB,內存常駐 <80MB,支持實時聽寫與批量音頻轉錄。核心模型基于 Qwen-ASR 系列蒸餾成果,采用 CTC + Transducer 混合架構,在 Aishell-3 和自建粵普混合測試集上字錯誤率(CER)為 4.2%。同一硬件下,Whisper.cpp 的 CER 為 7.9%。所有環節——音頻預處理、聲學建模、語言解碼——均在設備端完成。不發網絡請求,不傳音頻到云端,不生成外泄日志。“麥克風→文本”單鏈路閉環。
MIT 協議開源,支持 Rust + Core ML 部署棧,可直接編譯為 macOS 命令行工具,或集成進 Swift/Cocoa 應用。
完全離線 ≠ 功能縮水
Qwen Scribe 支持:
- 熱詞注入(JSON 格式,運行時動態加載)
- 標點自動恢復(非規則匹配,由模型直接輸出)
- 說話人粗分(基于音色聚類,無需預設人數)
- 靜音自適應切分(VAD 靈敏度可調,
--vad-threshold 0.3起效)
實測 1 小時會議錄音(含中英混雜、帶口音普通話),M2 Pro 上總耗時 47 秒,首字延遲穩定在 280±30ms。
對比主流云端方案:
- Azure Speech:TLS 握手 + API 認證,平均首字延遲 1.2s;每小時音頻處理成本約 $0.8
- 訊飛開放平臺:強制上傳音頻至合肥服務器,企業客戶需額外通過數據出境安全評估
- Whisper API:受 OpenAI 速率配額與上下文長度限制
Qwen Scribe 規避全部上述瓶頸。醫療問診記錄、法務筆錄、政府內部會議等強隱私場景可直接落地。
中文語音識別的“最后一公里”
過去三年,國內開發者主要依賴 Whisper.cpp 或 Vosk 做本地 ASR,但二者對中文語境適配不足:
- Whisper.cpp 缺乏中文標點訓練,句讀斷裂嚴重
- Vosk 模型體積 >500MB,啟動慢,且無 Apple Silicon 原生加速支持
Qwen Scribe 首次將 Qwen 大模型生態中的語音理解能力下沉到終端:
- 聲學模型經 Qwen-2-7B 多階段蒸餾監督(教師模型 logits 作軟標簽)
- 語言模型復用 Qwen-Tokenizer 的 subword 分詞邏輯,并針對中文停頓習慣重訓 LM 權重
后續可通過 qwen-scribe-finetune 工具包,用百條自有錄音(無需對齊文本)微調聲學模塊。例如讓模型準確識別“枸櫞酸西地那非片”或“鄂爾多斯盆地侏羅系”。
?? Binance · OKX · Gate.io · HTX · Bitget
與龍蝦 / OpenClaw 生態天然協同
Qwen Scribe 不依賴龍蝦框架,但其輸出結構化文本(含時間戳、置信度、speaker_id)可直連龍蝦 Agent 的 memory layer。
OpenClaw CLI 已內置 claw transcribe --local 指令,一鍵調用本地 Qwen Scribe 實例,替代原有 Whisper 后端。
我們已在 www.lvxe.net.cn 開源倉庫發布 qwen-scribe-lsp 插件,支持 VS Code 內嵌實時聽寫(Ctrl+Alt+T 觸發),文本自動插入當前光標位置——首個面向開發者工作流、零配置的本地 ASR IDE 集成方案。
現在就能用
Qwen Scribe 不追求通用多語種覆蓋,而是聚焦高價值垂直場景:隱私敏感、低延遲響應、硬件確定性。
這種“小而銳”的路徑正在重塑 ASR 技術棧分工——云端負責模型迭代與知識蒸餾,終端專注推理極致優化。
你可以立刻開始:
- 克隆倉庫:
git clone https://github.com/QwenLM/qwen-scribe - 編譯 macOS 版本:
make build-macos 測試轉錄效果:
qwen-scribe-cli --audio test.wav --output json- 在 Rust/Python Agent 中調用
transcribe()函數,徹底擺脫 API 依賴
WebAssembly 版本預計 Q3 上線;Linux ARM64 移動端適配已啟動。