语音交互
在支持的渠道上使用语音与 Agent 交流。支持的引擎
文字转语音(TTS)
5 种 TTS 引擎,用于 Agent 语音输出。 两条 TTS 路径(职责分离):- Settings > Voice — 渠道回复、WebRTC、IM 语音气泡(5 家 provider + Edge 免费回退 + 流式 + 智能摘要)
- Agent 配置 TTS — 对话中说「读出来」→
tts_generate工具产出 Audio 工件(OpenAI/ElevenLabs + Gateway 计费)
llms/tts 23 项单测(98% 覆盖)。
语音转文字(STT)
5 种 STT 引擎:本地 Whisper(免费、隐私优先)、OpenAI Whisper、Groq、Deepgram 和 xAI Grok STT。支持通过 Base URL 设置接入任意 OpenAI 兼容 STT 端点。视频音频转录
视频消息(包括 Telegram 圆形视频消息)会自动通过 STT 管道转录。Agent 无需额外配置即可理解视频中的语音内容。音频文件上传
在 WebUI 对话框中直接上传音频文件,支持 8 种格式:mp3、wav、ogg、flac、m4a、aac、wma、opus。 支持三种上传方式:- 点击附件按钮选择文件
- 拖拽音频文件到对话区域
- 粘贴(部分格式)
语音模式
Myrm Agent 支持 4 种语音交互模式,在设置 > 语音中可选:原生 Function Calling(Realtime 与 Gemini Live)
在 Realtime 和 Gemini Live 模式下,工具声明从所选智能体的 Profile 中动态注入。AI 可在语音对话过程中直接调用工具(网络搜索、记忆、文件操作、代码执行、浏览器、看板、后台任务)——无需服务端 Agent 中转,延迟更低。设置
- 进入 设置 > 语音
- 选择偏好的 TTS 与 STT 引擎
- 配置语言与音色偏好
- 如需自定义 STT 端点,设置 Base URL 字段(OpenAI 和 xAI 提供商可用)
- 使用 Realtime 模式需在 设置 > 模型供应商 中配置 OpenAI API Key
- 使用 Gemini Live 模式需在 设置 > 模型供应商 中配置 Google API Key