AVA開源語音AI代理:全棧自托管企業(yè)級IVR框架,支持AudioSocket/RTP與Python閉環(huán)STT-LLM-TTS

開源語音AI代理AVA正式發(fā)布:首個可全棧自托管、深度集成Asterisk/FreePBX的企業(yè)級IVR框架,支持AudioSocket/RTP原生協(xié)議與Python引擎閉環(huán)(STT→LLM→TTS),數(shù)據(jù)零出域,隱私合規(guī)與工程可控性同步落地。該方案直擊金融、政務(wù)、醫(yī)療等強監(jiān)管行業(yè)的核心痛點——模型再強,若無法嵌入現(xiàn)有通信基礎(chǔ)設(shè)施、無法離線調(diào)度、無法審計每幀音頻流向,就只是演示Demo。AVA不是又一個Web界面語音玩具,而是面向AI工程師與通信系統(tǒng)開發(fā)者的生產(chǎn)級語音Agent底座。
技術(shù)架構(gòu):AudioSocket原生接入,Python閉環(huán)不繞路
AVA跳過WebRTC或HTTP音頻中轉(zhuǎn),直接通過Asterisk 21+的AudioSocket協(xié)議建立低延遲RTP流通道。語音輸入毫秒級進入本地Python運行時。STT模塊默認(rèn)集成Whisper.cpp(CPU輕量部署)或VAD+Streaming-Whisper(GPU加速),輸出文本后交由本地或遠(yuǎn)程LLM處理——已實測兼容Claude-3.5-Sonnet、DeepSeek-V3、Qwen2.5-72B-Instruct及Llama-3.1-405B(via Ollama/Ollama Lite)。響應(yīng)文本經(jīng)TTS模塊實時合成,支持ElevenLabs API、XTTSv2本地部署、Piper聲學(xué)模型三軌并行。整個鏈路無中間服務(wù)依賴,端到端延遲穩(wěn)定在800ms內(nèi)(實測Asterisk+RTX4090環(huán)境)。
工程友好:開箱即用對接主流API,也支持完全本地化
開發(fā)者無需重寫呼叫流程邏輯。AVA提供標(biāo)準(zhǔn)FreePBX模塊安裝包(.tar.gz),安裝后自動注冊為Asterisk應(yīng)用(AVA()),可直接在Dialplan中調(diào)用:
exten => s,1,AVA(model=deepseek-v3, tts=local-piper) 配置文件ava.yaml以YAML聲明式定義pipeline:指定STT后端(如whisper-cpp: /opt/whisper.bin)、LLM路由策略(按意圖關(guān)鍵詞切分至不同模型)、TTS fallback鏈(API失敗時自動降級至本地XTTS)。所有LLM調(diào)用均走本地http://localhost:8000/v1/chat/completions抽象層,無論背后是Ollama、vLLM還是OpenRouter代理,上層IVR邏輯完全解耦。
隱私與合規(guī):數(shù)據(jù)不出機房,審計粒度達(dá)RTP包級
AVA默認(rèn)禁用任何外呼日志上傳,全部會話音頻、ASR文本、LLM prompt/response均落盤于本地/var/log/ava/,支持按日期/主叫號/IVR節(jié)點三級索引。RTP流全程不經(jīng)過公網(wǎng)——Asterisk從SIP終端收音后,直接通過Unix socket將PCM幀送入AVA Python進程,避免NAT穿透與第三方中繼。某省級醫(yī)保熱線實測表明:啟用AVA后,PCI DSS語音數(shù)據(jù)存儲合規(guī)項一次性通過,且因取消云ASR/TTS訂閱,年通信成本下降63%。“Agent主權(quán)”在這里是實打?qū)嵉模耗P涂梢哉{(diào)用Claude或DeepSeek,但控制權(quán)、數(shù)據(jù)權(quán)、調(diào)度權(quán)必須握在自己手中。

行業(yè)意義:填補語音Agent從Demo到產(chǎn)線的最后一塊拼圖
當(dāng)前多數(shù)AI語音方案卡在兩極:一端是Cursor/Copilot式工具鏈,只解決開發(fā)者單點效率;另一端是Devin/Manus類全自動Agent,但黑盒封閉、不可審計。AVA錨定中間地帶——通信系統(tǒng)工程師能用它升級傳統(tǒng)IVR,AI工程師能基于其pipeline快速驗證新模型在真實通話場景的表現(xiàn)(例如測試Qwen2-Audio在方言客服中的喚醒率)。它不替代龍蝦或OpenClaw,但為二者提供了語音觸點:龍蝦Agent可通過AVA暴露的REST API接收來電事件并返回結(jié)構(gòu)化決策;OpenClaw工作流可將語音任務(wù)拆解為ava.stt()→openclaw.route()→ava.tts()原子操作。
下一步行動建議
如果你正在評估語音Agent落地路徑:
- 克隆GitHub倉庫(github.com/ava-ivr/ava),用
docker-compose up -d啟動完整環(huán)境,5分鐘內(nèi)接入現(xiàn)有FreePBX; - 將生產(chǎn)環(huán)境中一條非核心IVR線路(如“營業(yè)時間查詢”)切換至AVA,對比傳統(tǒng)IVR的平均處理時長與一次解決率(FCR);
- 在
ava.yaml中插入llm: deepseek-v3@http://10.0.1.5:8000,用本地部署的DeepSeek-V3跑通端到端閉環(huán)。
語音AI的下一階段不是更大參數(shù),而是更可控的鏈路。AVA證明:當(dāng)AudioSocket遇見Python閉環(huán),當(dāng)Asterisk擁抱LLM,企業(yè)不必在“用大模型”和“守合規(guī)”之間二選一。