Skip to main content

语音交互

在支持的渠道上使用语音与 Agent 交流。

支持的引擎

文字转语音(TTS)

5 种 TTS 引擎,用于 Agent 语音输出。 两条 TTS 路径(职责分离):
  • Settings > Voice — 渠道回复、WebRTC、IM 语音气泡(5 家 provider + Edge 免费回退 + 流式 + 智能摘要)
  • Agent 配置 TTS — 对话中说「读出来」→ tts_generate 工具产出 Audio 工件(OpenAI/ElevenLabs + Gateway 计费)
双路径均已生产验证:632+ 渠道语音测试 + harness llms/tts 23 项单测(98% 覆盖)。

语音转文字(STT)

5 种 STT 引擎:本地 Whisper(免费、隐私优先)、OpenAI Whisper、Groq、Deepgram 和 xAI Grok STT。支持通过 Base URL 设置接入任意 OpenAI 兼容 STT 端点。

视频音频转录

视频消息(包括 Telegram 圆形视频消息)会自动通过 STT 管道转录。Agent 无需额外配置即可理解视频中的语音内容。

音频文件上传

在 WebUI 对话框中直接上传音频文件,支持 8 种格式:mp3、wav、ogg、flac、m4a、aac、wma、opus。 支持三种上传方式:
  • 点击附件按钮选择文件
  • 拖拽音频文件到对话区域
  • 粘贴(部分格式)
音频文件大小限制为 25MB。上传后系统自动通过 STT 管道转录为文本,作为上下文交给 Agent 处理。 Tauri 桌面客户端同样支持音频上传,原生文件对话框覆盖 30+ 种文件格式。

语音模式

Myrm Agent 支持 4 种语音交互模式,在设置 > 语音中可选:

原生 Function Calling(Realtime 与 Gemini Live)

在 Realtime 和 Gemini Live 模式下,工具声明从所选智能体的 Profile 中动态注入。AI 可在语音对话过程中直接调用工具(网络搜索、记忆、文件操作、代码执行、浏览器、看板、后台任务)——无需服务端 Agent 中转,延迟更低。

设置

  1. 进入 设置 > 语音
  2. 选择偏好的 TTS 与 STT 引擎
  3. 配置语言与音色偏好
  4. 如需自定义 STT 端点,设置 Base URL 字段(OpenAI 和 xAI 提供商可用)
  5. 使用 Realtime 模式需在 设置 > 模型供应商 中配置 OpenAI API Key
  6. 使用 Gemini Live 模式需在 设置 > 模型供应商 中配置 Google API Key

安全

所有语音数据端到端加密(E2EE)处理。除非显式配置,否则不存储音频。