Skip to main content

视觉与图片理解

Myrm 支持在 WebUI 对话、IM 渠道和桌面端上传图片。当主模型不支持视觉时,系统会自动通过 Vision Fallback(视觉备选模型) 将图片转为文字描述,再交给主模型继续对话——无需手动切换模型。

工作原理

  1. 在 WebUI 中粘贴、拖拽或上传任意文件(图片、PDF、文档、视频、音频、代码等)或在支持的渠道发送文件。
  2. Myrm 检测当前主模型是否支持视觉(supports_vision)。
  3. 支持 — 图片作为原生多模态内容直接发给主模型。
  4. 不支持 — 界面显示 「正在分析图片…」,调用你配置的 Vision Fallback 模型生成描述,替换图片块后继续用主模型回答。
视频走相同管线:支持原生视频的模型直传;否则通过帧提取 + 视觉分析降级为文字描述。

配置步骤

  1. 打开 设置 → 模型
  2. 选择 主模型(任意提供商均可)。
  3. 设置 Vision Fallback 为支持视觉的模型(如 GPT-4o、Gemini Flash、Qwen-VL)。
  4. 点击 测试视觉链路,验证完整有序降级链(失败时展示 resolved_model 与接口地址)。
  5. 若主模型为纯文本且未配置备选,可能出现 使用此模型 一键推荐卡片——从已启用 Provider 中选取首个 supports_vision 模型。
  6. 可选:在模型选择器中查看能力图标——带眼睛图标的模型原生支持视觉。
Myrm 通过 LiteLLM 与 models.dev 自动探测模型能力;也可在模型卡片中手动覆盖。

未配置视觉能力时

若上传图片/视频但主模型与 Vision Fallback 均无法分析,Myrm 会弹出 警告 toast,并提供 前往设置 按钮,深链至 设置 → 模型 → 默认模型 Tab。上传不会被硬性阻止(与联网搜索 config gap 一致):仍可发送文件,但分析需先完成配置。

典型场景

  • 截图问答 — 粘贴截图,询问问题或下一步操作。
  • 6 工具图片标注器 — 在内置编辑器中使用画笔、矩形、椭圆、箭头、文字、模糊 6 种工具标注截图或图片,标注后自动作为附件发送,Agent 直接以多模态方式理解标注内容。
  • 指哪改哪 Element Picker — 在 HTML 工件预览中切换 picker 模式,点击任意 UI 元素。系统自动获取 CSS selector、DOM 路径和 outerHTML,输入一句修改指令即可让 Agent 精准定位代码并修改。
  • 选中即操作工具栏 — 在代码编辑器中选中代码(修改/解释/优化/注释)或在文档预览中选中文字(修改/解释/重写),选区上下文含 artifact ID 和行号范围,自动发送给 Agent。
  • VisualApproval 操作审批可视化 — Agent 请求浏览器或桌面操作权限时,截图上以坐标高亮展示操作目标位置,支持桌面端 OS 原生覆盖层,审批决策一目了然。
  • 文本主模型 + 视觉备选 — 主模型选低成本文本模型,图片由 Vision Fallback 处理。
  • 渠道图片 — Telegram、Discord、iMessage 等渠道的图片进入同一套管线。
  • PDF 与文档 — 扫描版或图片型 PDF 在文本稀疏时可走视觉分析。

状态与缓存

Vision Fallback 运行期间,聊天区显示 正在分析图片(或 正在分析视频)提示,完成后自动消失。 同一会话内内容相同的图片会按哈希缓存,重复发送不会重复调用视觉 API。

异步图片生成

当智能体已启用 图片生成 工具且凭证就绪时,说「帮我画一张 banner」不会让对话空等 30–120 秒。
  1. Agent 将任务入队并立刻返回 task_id
  2. 消息区出现 ImageTaskCard,通过 SSE 实时展示进度(另有轮询兜底)。
  3. 生图过程中可继续聊天、改 prompt 或发起新任务。
  4. 完成后卡片展示成图,并可进入媒体库。
安全(云托管与桌面): API Key 与 Gateway Token 在写入本地 tasks.db 之前即 AES-GCM 加密——备份与沙箱卷内无明文密钥。 设置 → 模型(或智能体工具面板)中启用图片模型并选择提供商(LiteLLM 20+ 模型,支持自动 Failover)。

使用建议

  • 若频繁发送截图,可为 Vision Fallback 配置更快、更省的模型。
  • 大图会在调用视觉模型前自动压缩。
  • 分析失败时会给出明确错误提示,不影响消息其余部分的正常处理。

相关文档