全双工语音系统 · Full-Duplex Voice Agent

会听、会想、
会说话的语音智能体

JuWei 是一套完整的全双工语音系统:随时打断、即时回应,像人与人之间一样自然对话。 它不只是一个聊天机器人 —— 而是一个会呼吸的桌宠语音 Agent,连接 OpenClaw 网关与各大模型生态。

待机中
完整状态机:聚入 · 待机 · 聆听 · 说话 · 工作 · 弹窗 · 散出 · 笑脸 · 隐藏
全双工边听边说 · 随时打断
242MBSenseVoiceSmall 内置 ASR · 多语种离线
1.1BFireRedASR2 可选 · INT8 本地识别
2.49MDPDFNet2 深度降噪 · 双 AEC 回声消除
7.2ms音频帧实时处理 · 10ms 帧预算
500+唤醒词拼音变体 · 常驻聆听
Features

为「自然对话」而生的
每一项能力

从声学前端到语音合成,每一环都为低延迟、高自然度而设计 —— 全部可以在你的本机离线运行。

🗣️

全双工对话,随时打断

真正的全双工语音链路:它在说话的同时依然在听。你可以像打断一位朋友一样随时插话—— 插话检测快速通道最快 0.3 秒停播自己的声音,回声防线四道门保证它绝不会被自己干扰。 对话不再是「对讲机」,而是自然的你来我往。

自定义唤醒词

叫它「贾维斯」,或任何你喜欢的名字。内置 500+ 拼音变体(多音字 × 平翘舌 × 全声调), 自定义 2~6 字唤醒词一键生成。本地 KWS 唤醒链常驻聆听,离线可用,随叫随到。

本地唤醒 · 零云端依赖
🎭

声音克隆

基于 QwenTTS 1.7B,只需一段 3~10 秒的 24kHz 参考音频,即可克隆任何音色。GPU Vulkan 本地推理, 另内置 9 种预设音色一键切换。

你的声音样本 它的声音
💜

有情感的 AI 回复

不是冷冰冰的文本朗读。JuWei 的回复带有语气与温度 —— 开心时轻快、安慰时柔和, 让每一次对话都像在和一个真正懂你的伙伴交谈。

情感化语音合成
🔒

本地离线,隐私优先

SenseVoiceSmall 与 FireRedASR2 在本机完成语音识别,QwenTTS 本地合成。 你的声音数据不必离开这台电脑 —— 离线可用,隐私可控。

数据不出本机
🎙️

ASR 三引擎自由换

SenseVoiceSmall 内置默认(中/英/粤/日/韩 · 带标点),FireRedASR2 1.1B 按需下载, 或接入 MiniMax 在线识别。推理设备 CPU / GPU DirectML 一键切换。

多引擎即插即用
📡

启动声学校准

启动时播放校准音,GCC-PHAT 相位对齐锁定系统延迟;蓝牙 A2DP 延迟漂移 ±10~20ms 逐集自适应跟踪,始终不失同步。

自适应延迟跟踪
🎧

专业级语音前端:双 AEC 融合引擎

回声消除由 LocalVQE 双引擎接力——pi-v1-49K 常驻主用,v1.4-200K 大模型兜底, 能量裁判 300ms 完成换将,稳态深度 43~60dB;配合 DPDFNet2 深度降噪(2.49M 参数)、 WebRTC AGC2 自动增益与 FireRed 流式 VAD,无论你在播放音乐、身处嘈杂环境, 它都能清晰捕捉你说的每一句话。

Core Terminal

单击球体,打开
核心终端

WKS 终端风设置面板,五大模块统一管理语音链路的每一层 —— 全部本地化,即点即用。

核心终端 VOICE TERMINAL
PWR ● ONLINE SIGNAL ▮▮▮▮▯ 92% WKS-OS v3.0.1
🧠
智能模块

OpenClaw 本地网关(localhost:18789/v1,OpenAI 兼容),DeepSeek 在线回退, 5 秒轮询实时检测在线状态。

👁️
视觉模块

本地 Qwen3.5-2B 多模态视觉(128K 上下文),Pi Agent 工具调用: 网页搜索 · 内容抓取 · 本地时间。

📣
唤醒模块

默认「贾维斯」,自定义 2~6 字唤醒词:多音字 × 平翘舌 × 全声调模板生成, 热重载即测即用。

👂
听觉模块

SenseVoiceSmall 内置 · FireRedASR2 1.1B 下载 · MiniMax 在线, 推理设备 CPU / GPU DirectML 切换。

🗣️
发声模块

微软晓晓 / 云希 SAPI · QwenTTS 1.7B 九音色 · 声音克隆 · MiniMax 在线 TTS。

切换后端或修改配置后,需重启桌宠生效
Pipeline

V2 双链路,一条为实时而生
的全链路语音管线

主链与唤醒链并行运转,从麦克风到 AI 再到扬声器,每一环都可以独立替换、自由组合。

Main Chain 主链~7.2ms / 帧 · 10ms 帧预算
MIC麦克风 + WASAPI 系统音频环回采集
TRKGCC-PHAT 延迟跟踪对齐
AEC双 AEC 融合 · 49K 主用 + 200K 兜底
DNSDPDFNet2 2.49M 深度降噪
AGCWebRTC AGC2 自动增益控制
VADFireRed 流式语音活动检测
ASRSenseVoice / FireRedASR2 本地识别
AIOpenClaw 网关 · 大模型思考与工具调用
TTSQwenTTS 情感化合成 · 声音克隆
Wake Chain 唤醒链常驻聆听 · 检出开门 10s
MIC麦克风原始采样
DNS轻量降噪
AGC自动增益
KWSsherpa-onnx 唤醒词 · 500+ 变体
GATE检出开门 · 对话启动
⚡ 插话即停播 · 快速通道 ~0.3s 🛡️ 回声防线 · 四道门 🔁 双 AEC 能量裁判 · 300ms 换将 🎯 GCC-PHAT 延迟跟踪 · 蓝牙自适应 🔇 开播 1.2s 保护期 · 防误打断
Ecosystem

不只是一个 Agent
它是你的语音中枢

JuWei 通过开放协议连接你已有的 AI 工具链 —— 说一句话,就能驱动整个 Agent 生态为你工作。

Agent Gateway

原生支持 OpenClaw 本地网关(localhost:18789/v1,OpenAI 兼容)。语音指令直达你的 OpenClaw 智能体, 让它替你操作电脑、执行工作流;启动时自动同步配置并重启网关。

Bridge

内置 MiniMax 在线桥接:TTS 语音合成与 ASR 识别即插即用;与本地 Hermes 网关端口协调避让(WS 8767), 云端能力随时接入。

Extensible

标准化的接入层设计,VQE / DNS / AGC / VAD / ASR / TTS / LLM 每一层都可独立替换, 任何兼容的工具与 Agent 框架都可以挂接,你的声音就是统一的入口。

DeepSeek MiniMax 智谱 GLM 通义千问 Kimi 豆包
Desktop Companion

住在你桌面上的
AI 语音伙伴

JuWei 以桌宠形态常驻桌面:它的名字叫 Claw,球体上还可以贴上你自己的标签(默认「HunDun」)—— 一个会呼吸、会倾听、有粒子动效的小生命。无需打开窗口,说出唤醒词,它随时都在。

  • 单击球体 — 打开核心终端,五大模块即点即用
  • 常驻聆听 — 唤醒链 24 小时待机,随叫随到
  • 灵动动效 — 9 态粒子系统:聚入 · 待机 · 聆听 · 说话 · 工作 · 弹窗 · 散出 · 笑脸 · 隐藏
  • 拖放附件 — 最多 5 个 · 单文件 5MB · 图片自动压缩,弹窗查看
  • 模块化架构 — VQE / DNS / AGC / VAD / ASR / TTS / LLM 每层都可自由替换
Ctrl + Shift + M · 静音 Ctrl + Shift + H · 隐藏 Ctrl + Shift + O · 设置
「贾维斯,帮我总结一下今天的邮件」
加载语音管线加载中…
校准播放校准音 · GCC-PHAT 锁定延迟
就绪已就绪 · 说「贾维斯」唤醒
断线 3s 自动重连 · 崩溃退避重启 3s→30s · 启动问候「你已启动语音功能,向我问好!

说一声,它就懂了

下载 JuWei,让你的电脑第一次真正学会倾听。