视觉与图片理解
Myrm 支持在 WebUI 对话、IM 渠道和桌面端上传图片。当主模型不支持视觉时,系统会自动通过 Vision Fallback(视觉备选模型) 将图片转为文字描述,再交给主模型继续对话——无需手动切换模型。工作原理
- 在 WebUI 中粘贴、拖拽或上传任意文件(图片、PDF、文档、视频、音频、代码等)或在支持的渠道发送文件。
- Myrm 检测当前主模型是否支持视觉(
supports_vision)。 - 支持 — 图片作为原生多模态内容直接发给主模型。
- 不支持 — 界面显示 「正在分析图片…」,调用你配置的 Vision Fallback 模型生成描述,替换图片块后继续用主模型回答。
配置步骤
- 打开 设置 → 模型。
- 选择 主模型(任意提供商均可)。
- 设置 Vision Fallback 为支持视觉的模型(如 GPT-4o、Gemini Flash、Qwen-VL)。
- 点击 测试视觉链路,验证完整有序降级链(失败时展示
resolved_model与接口地址)。 - 若主模型为纯文本且未配置备选,可能出现 使用此模型 一键推荐卡片——从已启用 Provider 中选取首个
supports_vision模型。 - 可选:在模型选择器中查看能力图标——带眼睛图标的模型原生支持视觉。
未配置视觉能力时
若上传图片/视频但主模型与 Vision Fallback 均无法分析,Myrm 会弹出 警告 toast,并提供 前往设置 按钮,深链至 设置 → 模型 → 默认模型 Tab。上传不会被硬性阻止(与联网搜索 config gap 一致):仍可发送文件,但分析需先完成配置。典型场景
- 截图问答 — 粘贴截图,询问问题或下一步操作。
- 6 工具图片标注器 — 在内置编辑器中使用画笔、矩形、椭圆、箭头、文字、模糊 6 种工具标注截图或图片,标注后自动作为附件发送,Agent 直接以多模态方式理解标注内容。
- 指哪改哪 Element Picker — 在 HTML 工件预览中切换 picker 模式,点击任意 UI 元素。系统自动获取 CSS selector、DOM 路径和 outerHTML,输入一句修改指令即可让 Agent 精准定位代码并修改。
- 选中即操作工具栏 — 在代码编辑器中选中代码(修改/解释/优化/注释)或在文档预览中选中文字(修改/解释/重写),选区上下文含 artifact ID 和行号范围,自动发送给 Agent。
- VisualApproval 操作审批可视化 — Agent 请求浏览器或桌面操作权限时,截图上以坐标高亮展示操作目标位置,支持桌面端 OS 原生覆盖层,审批决策一目了然。
- 文本主模型 + 视觉备选 — 主模型选低成本文本模型,图片由 Vision Fallback 处理。
- 渠道图片 — Telegram、Discord、iMessage 等渠道的图片进入同一套管线。
- PDF 与文档 — 扫描版或图片型 PDF 在文本稀疏时可走视觉分析。
状态与缓存
Vision Fallback 运行期间,聊天区显示 正在分析图片(或 正在分析视频)提示,完成后自动消失。 同一会话内内容相同的图片会按哈希缓存,重复发送不会重复调用视觉 API。异步图片生成
当智能体已启用 图片生成 工具且凭证就绪时,说「帮我画一张 banner」不会让对话空等 30–120 秒。- Agent 将任务入队并立刻返回
task_id。 - 消息区出现 ImageTaskCard,通过 SSE 实时展示进度(另有轮询兜底)。
- 生图过程中可继续聊天、改 prompt 或发起新任务。
- 完成后卡片展示成图,并可进入媒体库。
tasks.db 之前即 AES-GCM 加密——备份与沙箱卷内无明文密钥。
在 设置 → 模型(或智能体工具面板)中启用图片模型并选择提供商(LiteLLM 20+ 模型,支持自动 Failover)。
使用建议
- 若频繁发送截图,可为 Vision Fallback 配置更快、更省的模型。
- 大图会在调用视觉模型前自动压缩。
- 分析失败时会给出明确错误提示,不影响消息其余部分的正常处理。