模型配置
Myrm 通过 LiteLLM 统一访问 26+ 内置提供商的 100+ 模型,支持三种兼容协议(OpenAI-like、Gemini-like、Anthropic-like)无限扩展自定义提供商。每个内置提供商预填 API URL 并支持国内/国际区域一键切换,真正零配置即用。首次配置引导
首次启动 Myrm 时,引导向导会帮你快速完成模型配置:- 本地模型自动探测:自动扫描运行中的 Ollama 或 LM Studio 实例,推荐最佳可用模型,一键激活。
- 云端快速开始:没有本地 GPU?向导会展示含免费方案的云端提供商——Google Gemini(免费方案)、SiliconFlow(注册送额度)、OpenRouter(免费开源模型)——一键跳转配置页。
- Smart Routing 引导:配置两个及以上模型时,向导提供一键启用 Smart Routing,自动将模型分为 quick/standard/reasoning 三档并展示预估节省比例(40–70%)。
- 工作区选肤:向导末步可从 3 款精选 Theme Profile(官方默认 / Calm 可读 / Ocean)中选一款,或跳过保持默认;选择经 ConfigSync 同步至聊天、看板与设置,Agent 生成的 HTML Widget 也会自动跟随同色。
- 持续引导:即使跳过向导,聊天首屏也会显示温和的提示横幅,引导你配置模型提供商后即可开始对话。
添加 API Key
进入 设置 > 模型 或设置环境变量:智能路由
三维复杂度路由器根据任务需求、隐私敏感度和提供商健康状态自动选择最优模型: 阶段 1 — 规则引擎(零 LLM 成本): 跨 6 类信号进行多维评分——关键词(30+ 中英双语)、代码块、数学/LaTeX 公式、URL/文件路径、图片和消息长度。99% 的请求瞬间完成分类。 阶段 2 — LLM Judge(仅模糊场景): 对边界情况,由轻量级 Judge 模型分类。结果经 SHA-256 缓存(5 分钟 TTL,256 条 LRU 缓存),避免重复调用。 Session Momentum(会话动量): 短消息(如”好”、“是”)继承会话的复杂度层级,不降级为 SIMPLE。基于消息长度的权重衰减确保长消息独立分类。 PenaltyTracker — 自学习: 当你标记路由决策为错误时,该层级获得惩罚分(24 小时半衰期)。后续查询需要更强信号才能激活被惩罚的层级,路由准确度随使用持续提升。 用户模型偏好记忆(Dialectic 推导): Harness 记忆提取引擎在后台对话析取中自动识别用户对特定模型与任务类型的喜好(如编程偏好 Claude 3.7、推理偏好 DeepSeek-R1),沉淀为结构化model_affinity 画像;遵循「显式配置 > 全局默认 > 偏好建议」不可逾越铁律,在保持 100% 确定性与前缀缓存的同时提供透明个性化推荐。
Fast Lane(快速通道): 被判定为 SIMPLE 的任务跳过重量级中间件链,直接以最小开销到达模型。日常闲聊、问候、短跟进等高频消息响应延迟降低约 30-50%——你最常发的消息获得最快回复。
模型测速
在选定模型之前,可以直接在设置中测试其真实性能。进入 设置 > 模型服务,点击右上角的测速按钮。 测量指标:- TTFT(首 Token 延迟) — 模型开始响应的速度
- TPS(每秒 Token 数) — 持续生成吞吐量
- 总 Token 数 — 测试提示的完整响应长度
- 点击 全部测试 依次对所有已启用模型进行基准测试
- 点击单个模型旁的重试图标可单独重测
- 结果以颜色编码徽章显示成功/失败状态
推理强度控制
对于支持推理能力的模型(Claude 3.7+、o1/o3/o4-mini、Gemini 2.5、DeepSeek-R1、DeepSeek-Reasoner、Qwen3 等),Myrm 提供精细的”思考深度”控制与智能路由全自动对齐。 开闭源混合智能路由编排(Onboarding): 在系统引导向导中,Myrm 原生复用经全面单测守护的单一真相源(isReasoningModelByName),秒级识别官方 deepseek-reasoner、Gemini 思考模型与各大前沿推理模型。检测到本地自建算力(Ollama / 局域网分机)与云端商业模型时,系统自动启发式将本地端点推荐为 $0 边际成本日常高吞吐路由(lite),将云端商业端点推荐为攻坚兜底路由(reasoning),帮助用户将整体 API 费用降低 75%+,真正实现开箱即用的开闭源黄金协同。
6 级预设: 关闭 / 低 / 中 / 高 / 超高 / 最大 — 从快速回答到深度多步推理,覆盖所有场景。
自定义 Token 预算: 输入任意数值(如 16384),为支持精确 budget 的 Provider(如 Claude 的 budget_tokens)设定思考上限。
按模型记忆偏好: 推理强度偏好按模型自动保存。在 Claude 和 GPT 间切换时,各自记住上次的设置,无需重新配置。
自动检测: 推理强度按钮仅在当前模型支持推理时出现。非推理模型(如 GPT-4o-mini)不显示按钮,零干扰。检测采用双层机制:API 上报的能力优先,正则匹配覆盖 25+ 模型家族作为兜底。
选中的强度通过完整管道传递 — 前端 model_kwargs → Server 透传 → Harness extra_body → LiteLLM → Provider API — 三层零耦合。
智能推理预算(自动生效): 所有主流推理模型(Claude 4.6+、DeepSeek R1、OpenAI o 系列、Gemini 2.5+)都将思考 Token 计入 max_tokens 预算。如果 max_tokens 设置过小,思考阶段会耗尽预算导致回复被截断。Myrm 根据选择的思考强度自动提升 max_tokens 到安全下限(低=8K、中=16K、高=32K、超高/最大=65K)。未显式设置时,默认应用 16K 保守下限(因为所有思考模型默认开启推理)。该机制与 stream recovery 形成双层防线 — 事前预防 + 事后恢复。调整完全透明,不增加 API 费用(供应商按实际使用 Token 计费,而非 max_tokens 上限)。
推理模型答案提取
DeepSeek-R1、Qwen-QwQ、OpenAI o 系列、minimax M3 等推理模型会把最终答案放进reasoning_content 而不是 content。对多数 Agent 框架来说这是暗坑——生成的脚本、工具结果、界面输出要么空白,要么打印 None。
Myrm 通过与模型无关的统一提取层,自动保证用户可见答案的稳定输出:
content为空时自动回退reasoning_content——推理模型开箱即用,无需等待模型白名单- 全链路剥离
<think>…</think>思考块——答案保持干净,原始思考不会泄露进脚本、知识库文章或结构化结果 - 兼容 Anthropic 块式结构 与纯字符串响应——所有供应商共用同一条提取路径
按模型家族自适应提示词
不同的 AI 模型有不同的行为倾向。Myrm 会自动为每个模型家族调整系统提示词,以获得最佳效果:- GPT / Codex / Grok:工具持久性强制、事实查询必须使用工具、主动执行而非反复询问
- Claude:减少免责声明、执行优先
- Gemini / Gemma:绝对路径构建、依赖验证
- DeepSeek / Qwen / GLM:简洁的中文适配纪律
- Claude Opus 5+:针对 Anthropic 官方文档的三大行为偏差自动调优——范围扩展(做超出要求的事)、自我纠正叙述(不必要的”我刚才说错了”)、默认冗长(回复超出需要的长度)
对话内模型透明度
每条助手消息的操作栏都有一个 Token 经济学徽章。点击即可查看本次请求使用的模型、路由方式、费用和性能:- 模型名称 + 路由层级 — 看到实际使用的模型(如
gpt-4o、claude-sonnet-4)及其路由分类(简单 / 标准 / 推理) - 提示词缓存命中率 — 缓存 token 百分比、节省金额估算、缓存失效归因分析
- 成本分解 — 单消息成本 + 实际/估算标签,多模型分解、工具级 token 消耗
- 性能基线对比 — TTFT、每秒 token 数、延迟与会话平均值的对比,带色彩偏差指示
- 上下文预算环形图 — 环形进度展示上下文窗口使用率,健康/警告/危险三色阈值
- 隐私级别 — 数据敏感度分类(S1 公开 / S2 内部 / S3 机密)和路由路径(本地 / 云端)
Key 轮换
为同一提供商添加多个 API Key,Myrm 自动轮换并智能故障切换。当有 2 个以上活跃 Key 时,密钥池状态栏会显示策略选择器——选择最适合你的轮换模式:
遇到限流 (429) 时,自动指数退避 + ±15% 抖动并切换到下一个可用 Key,用户完全无感。
隐私路由
隐私路由按数据敏感度自动选择云端或本地模型,无需手动切换:
隐私路由在标准接口后包装模型。Agent、中间件与执行循环对路由无感,与普通模型交互。
配合 Ollama、LM Studio 或 vLLM 本地后端,敏感负载可完全气隙运行。
模型编排最佳实践看板 (Model Orchestration Playbook)
为帮助用户理解现代大模型的最佳分工与成本效益,Myrm 在主聊天首屏与设置中心内置了交互式模型编排最佳实践看板(Playbook):- Brain & Hands(大脑与双手)双模协同:将重型思考模型(如 Claude 3.7 Sonnet / DeepSeek-R1)作为“大脑”,负责意图规划与架构拆解;将超轻高吞吐模型(如 GPT-4o-mini / Gemini Flash)作为“双手”,负责高频工具调用与环境验证。
- 三大开箱即用配方:
- 极简轻量 (Frugal):全轻量模型驱动,适合高频日常问答与自动化巡检,Token 成本降低 85%+;
- 动静均衡 (Balanced Brain & Hands):大脑攻坚 + 双手执行,兼顾顶级推理能力与 4x 经济学优势;
- 多元共识 (Consensus MoA):多模型交叉验证,针对金融、法律或安全敏感业务消除单一模型幻觉。
- 就地订阅一键发现:支持一键连接 GitHub Copilot、ChatGPT Plus/Pro、xAI SuperGrok 与 Claude Pro 现有订阅,免去海外信用卡充值 API 的门槛。
统一网关预置与支出可观测性 (Vercel AI Gateway)
Myrm 将 Vercel AI Gateway 作为内置一等公民支持:- 零厂商前缀协议冲突:聚合网关使用包含厂商名的高级模型 ID(如
anthropic/claude-3-5-sonnet)。Myrm 自动注入openai/协议包装层,确保底层以标准 OpenAI-compatible Wire Protocol 稳定通信,彻底杜绝 LiteLLM 厂商前缀误判问题。 - 归属可观测性头自动注入:针对
ai-gateway.vercel.sh请求,传输层底层自动携带HTTP-Referer: https://myrmagent.ai、X-Title: Myrm Agent与标识版本客户端,确保在 Vercel 控制台中精确归属 Myrm 业务流量。 - 官方控制台深度直达:在模型服务卡片中,提供一键直达 Vercel AI Gateway 支出仪表盘的深链,实时掌握调用量与预算消耗。
本地模型与硬件管家
Myrm 自动探测本地模型服务和硬件能力,实现零配置的本地 AI 体验: 首次启动 — 自动发现: 在引导流程中,Myrm 自动探测 Ollama 和 LM Studio。发现后一键激活——自动配置 Provider、选择推荐模型、设为默认模型,一步到位。 硬件管家: 设置面板中的硬件管家展示你的电脑配置(CPU、RAM、GPU、VRAM、磁盘空间),并为每个可用本地模型计算 Fit Score。根据 VRAM 或 RAM 评为 perfect / good / fair / poor 四级。磁盘空间不足时下载按钮自动禁用,从根本杜绝下载爆盘导致系统死机。 推理速度预览(~tok/s): 每个模型卡片在 VRAM 估算旁同步展示预估推理速度标签,基于你的 GPU 内存带宽和模型参数量(Q4_K_M 量化)计算,色彩直观:- 🟢 ≥ 20 tok/s — 丝滑实时对话
- 🟡 8–19 tok/s — 可用但略有延迟感
- 🔴 < 8 tok/s — 实时对话明显卡顿
配置自愈
所有模型配置在保存时自动清洗,避免常见的复制粘贴错误导致连接失败:- API URL — 自动移除尾部斜杠和空白字符(防止 404)
- API Key — 自动去除首尾空格和换行符(防止鉴权失败)
- 模型名称 — 自动去除多余空格(防止模型找不到)
- 空白值 — 自动转为未设置状态,安全降级而非崩溃
- 旧版 providerType — 从旧工具导入时若 compat 类型写成
openai而非openai-like,启动时自动迁移并按 provider id 回退路由,不会白屏 - 开发者系统健康 — Context Bundle 面板走
/context-bundle相对路径,避免/api/v1/api/...双前缀导致 404
多设备配置同步
Myrm 在浏览器标签、桌面端与 SaaS 之间保持设置一致——刷新页面不会反复弹出「配置冲突检测」。 你能得到什么:- 在手机上改语言、朗读或默认模型——桌面端自动同步
- 多标签或硬刷新——不会误报配置冲突
- 离线编辑——变更本地排队,联网后自动同步
- 改坏了?配置时光机 可一键回滚任意配置键
- 智能合并 — 两台设备改不同字段时,两边变更都会保留
- 诚实冲突 — 两台设备改同一字段时,由你选择保留哪一版
- 同设备静默 — 本机标签页刷新不会触发冲突弹窗
- 幂等同步 — 内容相同时不会无意义地 bump 版本号
Vision Fallback(视觉备选)
当主模型不支持视觉时,在 设置 → 模型 中配置 Vision Fallback。Myrm 会自动将图片转为文字描述再交给主模型,聊天区显示实时进度,同会话重复图片会缓存以避免重复调用。 GUI 能力(2026-07-31):- 测试视觉链路 — 探测完整有序 provider 链,展示实际应答模型或失败步骤。
- 使用此模型 — 文本主模型时,从已启用 Provider 一键写入首个视觉模型。
- 聊天 attach 警告 — 缺视觉能力时 toast + 前往设置,深链默认模型 Tab。
多模型顾问叠加 (MoA)
在不更换主模型绑定的前提下,让轻量参考模型在工具环每次主模型调用前提供多视角顾问意见。适用于合同审查、架构决策、关键结论交叉验证。 一次性配置(按智能体 Profile): 设置 → 智能体 → 能力 → Agent 环顾问叠加 — 开启、添加参考模型、调整 fan-out / 隐私 / 输出上限。 每个聊天会话: 输入框旁 模型选择器 → 多智能体混合 分组 → 选 标准 / 深度审查 / 快速(再点同一项可关闭)。仅当选中 preset 时才跑 ref 调用;未选则不额外计费。选择会写入chats.active_moa_preset_id(跨设备 F5 恢复);无痕会话不读写 MoA 偏好。
三档强度(共用同一组参考模型,运行时参数不同):
- 标准 — 使用 Profile 默认参数
- 深度审查 — 提高参考模型推理强度
- 快速 — 降低推理强度并收紧参考输出上限
- Fan-out 策略 — 每用户轮一次(默认)/ 每次模型调用 / 每 N 次
- 顾问隐私过滤 — 关闭 / 仅展示脱敏 / 完整脱敏
- 参考输出上限 — 默认 600 token(控费)
- 未选参考模型 → 跳过叠加(amber 警告,不做 silent fake MoA)
- 预算压力 / unattended → 自动 skip
ConsensusThinkingPanel通过 SSEmoa_ref_done渐进展示各顾问- Prompt Cache 安全 — 仅瞬态注入,不修改 SystemMessage
说明: 独立 Consensus ActionMode 已移除;旧 APIHermes 迁移: 向导 confirm 时,defaultaction_mode=consensus返回 400 — 请使用action_mode=agent并携带active_moa_preset_id。
moa.presets 参考模型写入目标智能体 overlay(hermes_moa_migrator)。见 数据迁移 — Hermes MoA 参考模型导入。
验证(2026-08-03,189 轮复测): MoA picker 54 项定向单测(11 FE vitest + 43 server pytest,0 失败)— 含 PATCH 回滚、org-policy MoA ref、consensus 400 拒绝、active_moa_preset_id 序列化。Chrome MCP / API overlay E2E 仍待补(见 materials 文档)。见 MULTI_MODEL_CONSENSUS_ADVANTAGE.md。
成本可视化
完整的 Token 经济学可视化体系,从后端到前端全链路覆盖:工具 Schema 自动规范化
切换模型时(如从 GPT-4o 切到 Gemini 或 Claude),各提供商对工具 schema 的要求各不相同。Myrm 在发送给模型前自动规范化所有工具 schema,无需任何配置。 自动修正的问题:- 孤儿
required条目(引用了不存在的properties字段)—— Gemini/Vertex AI 会返回 400 错误 - 嵌套 nullable 模式(
anyOf: [{type: X}, {type: null}])—— OpenAI strict 模式会报错 $ref/$defs内联定义 —— 大多数提供商不支持 JSON Schema 引用- 缺失
type注解 —— 严格模式提供商直接拒绝 - Anthropic 不支持的关键字(
minimum、maxItems、pattern等)—— 约束折叠为描述文本
容错
14 层错误恢复系统自动处理故障:- 限流(4 策略 Key 轮换 + 凭证池 + ManagedLLM/KeyPool 智能体内故障转移)
- 提供商宕机(熔断器 3 级冷却 + 回退预设)
- 流中断(Token 级精确续传)
- 响应截断(渐进输出预算提升 2x → 3x → 4x)
- 超大图片(自动重编码压缩)
- 模型思考模式错误(自动调整模式并重试)
- 空响应(调参重试)
- 迭代上限(grace-call 摘要 — 用户不见空白回复)