Skip to content

Hermes Agent 语音模式

Hermes Agent 的语音模式(Voice Mode)是一套集成了语音识别(STT)、大语言模型推理(LLM)和语音合成(TTS)的全双工语音交互系统。它允许用户通过麦克风与智能体进行实时对话,并接收智能体的口语化回复。该系统支持在终端(CLI)、网页终端(TUI)以及主流社交平台(Discord、Telegram)上运行。

按照如下步骤在Ubuntu系统中使用Hermes Agent 语音模式:

1) 在对应系统中需要安装相关依赖:

shell
# macOS 
brew install portaudio ffmpeg opus
brew install espeak-ng   # 可选,用于本地 NeuTTS 语音合成

# Ubuntu/Debian
sudo apt update
sudo apt install portaudio19-dev ffmpeg libopus0
sudo apt install espeak-ng

2) 安装python依赖

进入到Hermes Agent使用的python环境:“~/.hermes/hermes-agent/venv/bin/python”,在该python环境中安装对应python依赖。

#进入到对应路径
cd ~/.hermes/hermes-agent
# 一键安装所有组件或者分别安装“pip install sounddevice numpy faster-whisper”
uv pip install "hermes-agent[all]"

3) 配置APIkey或者使用本地模型(可选)

语音模式遵循“本地优先”原则以降低延迟和成本。

  • STT (语音转文本):强烈推荐使用本地 faster-whisper(无需 API Key,首次运行自动下载模型)。若使用云端,可在 ~/.hermes/.env中配置 GROQ_API_KEY或 VOICE_TOOLS_OPENAI_KEY。
  • TTS (文本转语音):默认使用微软 Edge TTS(免费且无 Key)。如需更高拟真度,可配置 ELEVENLABS_API_KEY。

4) Hermes Agent Cli 语音对话测试

#先执行导入 hf-mirror.com 镜像站,从镜像下载 whisper 模型
export HF_ENDPOINT=https://hf-mirror.com 

#启动Hermes
hermes

在交互界面中,使用内置斜杠命令管理语音状态:

  • /voice on:激活语音模式,首次自动下载faster-whisper模型。
  • /voice tts:激活语音回复(Agent 的回复将同步朗读)。
  • /voice status:查看当前麦克风与扬声器状态。

输入 “/voice on” ,唤醒录音,用户按下预设快捷键(默认为 Ctrl+B),终端会发出一声提示音,并开始收音。一次交互结束后,系统会自动进入下一次录音准备状态。用户只需再次按下 Ctrl+B即可打断并重新录入。

输入 “/voice off” ,关闭录音。

输入“/voice tts”,Agent 回复内容后,将使用语音读出,如果默认使用的英语,可以对话中让Hermes Agent 自动配置成中文。

输入“/voice status”查看状态:

Hermes Agent WebUI

Hermes WebUI是Hermes Agent的轻量级浏览器前端,是 Hermes Agent 的可视化入口,为运行在服务器上的Hermes Agent提供与 CLI 完全一致的 Web 操作体验(该WebUI中暂不支持语音输入输出)。项目地址:https://github.com/nesquena/hermes-webui

安装并启动Hermes Agent WebUI步骤如下:

git clone https://github.com/nesquena/hermes-webui.git hermes-webui
cd hermes-webui
# 0.0.0.0 表示任意节点都可以访问
python3 bootstrap.py --host 0.0.0.0

安装启动好WebUI后,可以在Window 浏览器中输入 http://IP:8787 访问WebUI:

设置中文显示,然后点击页面

进行对话: