语音交互
在支持的渠道上使用语音与 Agent 交流。支持的引擎
文字转语音(TTS)
5 种 TTS 引擎,用于 Agent 语音输出。 两条 TTS 路径(职责分离):- Settings > Voice — 渠道回复、WebRTC、IM 语音气泡(5 家 provider + Edge 免费回退 + 流式 + 智能摘要)
- Agent 配置 TTS — 对话中说「读出来」→
tts_generate工具产出 Audio 工件(OpenAI/ElevenLabs + Gateway 计费)
llms/tts 23 项单测(98% 覆盖)。
语音转文字(STT)
5 种 STT 引擎:本地 Whisper(免费、隐私优先)、OpenAI Whisper、Groq、Deepgram 和 xAI Grok STT。支持通过 Base URL 设置接入任意 OpenAI 兼容 STT 端点。视频音频转录
视频消息(包括 Telegram 圆形视频消息)会自动通过 STT 管道转录。Agent 无需额外配置即可理解视频中的语音内容。音频文件上传
在 WebUI 对话框中直接上传音频文件,支持 8 种格式:mp3、wav、ogg、flac、m4a、aac、wma、opus。 支持三种上传方式:- 点击附件按钮选择文件
- 拖拽音频文件到对话区域
- 粘贴(部分格式)
语音模式
Myrm Agent 支持 4 种语音交互模式,在设置 > 语音中可选:原生 Function Calling(Realtime 与 Gemini Live)
在 Realtime 和 Gemini Live 模式下,工具声明从所选智能体的 Profile 中动态注入。AI 可在语音对话过程中直接调用工具(网络搜索、记忆、文件操作、代码执行、浏览器、看板、后台任务)——无需服务端 Agent 中转,延迟更低。语音后台任务
在语音对话中,您可以直接说出”帮我调研 XXX”等指令,AI 会自动将其派发为后台任务:- 即时派发:语音说一句即可创建后台研究任务,对话不中断
- 面板可见:派发的任务在 Activity Panel(后台任务面板)中实时显示,支持一键取消或注入新指令
- 持久化保障:任务通过 Kanban 系统持久化存储,服务重启后自动恢复,不会丢失
- 完成通知:任务完成后自动将结果推送到发起对话的聊天中,无需手动查看
后台任务完成播报
语音派发的后台任务完成后,Agent 会在您下一次语音会话中主动开口播报结果——四种语音模式(Audio Only / Agent Bridge / OpenAI Realtime / Gemini Live)完全对称:- 说完就离开,回来听结论:用语音派发长任务后关掉页面去做别的事,回到语音会话时 Agent 主动播报结果摘要,无需盯着面板或主动追问”好了没”
- 绝不打断当前播报:如果任务完成时 Agent 正在说话,完成播报会在 TTS 队列中安全排队,等当前发言说完立即补播——队列安全插入,无生硬切断
- 播报即对话:完成播报是对话的自然延续,聊天时间线实时刷新,您可以立刻语音追问细节,Agent 基于完整上下文继续回答
- 多窗口不重复播报:多个窗口或设备同时打开时,只有正在语音会话的窗口播报一次——会话级去重,绝不多响
桌面桌宠伴侣与语音光晕融合(Desktop Pet & Voice Orb)
在 Tauri 桌面客户端中,语音交互与桌面桌宠伴侣(Desktop Pet Companion)深度融为一体:- 浮动桌宠声学光晕涟漪:桌宠常驻桌面边缘或任意位置,在语音对话时自适应呈现声学涟漪光晕(蓝/绿/紫),随音量动态起伏,无需笨重的全屏语音遮罩。
- 透明区域像素级 Alpha 鼠标穿透:桌宠透明背景与光晕层采用像素级 Alpha 采样并显式隔离 pointer-events,确保用户在下方 IDE 或浏览器中编码与点击毫无阻碍。
- 全局 PTT 快捷键与屏幕多模态感知:按下全局 Push-to-Talk 快捷键时,自动捕获当前活动窗口的高清屏幕截图、OCR 文本及窗口标题,无需切换应用直接将屏幕上下文注入语音会话。
- 双击快速重播(F13 DoD):双击桌宠即可快速重播上一句 Agent 语音回复,若 Agent 正在说话则立即打断。
- 100ms 智能节流控制:音量波形与状态推送在 Tauri IPC 间施加 100ms(10fps)智能节流,CPU 占用下降 83%,全天候低功耗伴随。
全双工与打断感知
Myrm Agent 支持全双工语音对话——您可以在 Agent 说话时随时打断(Barge-in)。系统会:- 立即停止当前语音播放
- 自动通知 AI 模型”上次的回复被打断了”——AI 不会重复已经说过的内容,而是自然衔接您的新问题
设置
- 进入 设置 > 语音
- 选择偏好的 TTS 与 STT 引擎
- 配置语言与音色偏好
- 如需自定义 STT 端点,设置 Base URL 字段(OpenAI 和 xAI 提供商可用)
- 使用 Realtime 模式需在 设置 > 模型供应商 中配置 OpenAI API Key
- 使用 Gemini Live 模式需在 设置 > 模型供应商 中配置 Google API Key