Skip to main content

모델 구성

Myrm은 LiteLLM을 사용하여 26개 이상의 내장 공급자가 제공하는 100개 이상의 모델에 대한 통합 액세스를 제공하며 무한한 맞춤형 공급자 확장을 위한 세 가지 호환성 프로토콜(OpenAI 유사, Gemini 유사, Anthropic 유사)을 제공합니다. 각 내장 공급자는 미리 채워진 API URL과 함께 제공되며 원클릭 국내/국제 지역 전환을 지원합니다. 즉, 실제로 제로 구성이 가능합니다.

최초 설정

Myrm을(를) 처음 실행하면 온보딩 마법사가 모델 구성을 안내합니다.
  • 로컬 모델 자동 감지: Myrm은(는) 실행 중인 Ollama 또는 LM Studio 인스턴스를 자동으로 검색하고 원클릭 활성화 버튼을 통해 사용 가능한 최상의 모델을 추천합니다.
  • 클라우드 빠른 시작: 로컬 GPU가 없나요? 마법사는 Google Gemini, SiliconFlow(등록 크레딧) 및 OpenRouter(무료 오픈 소스 모델)와 같은 무료 계층이 있는 클라우드 제공업체를 표시하며 원클릭으로 구성 페이지를 탐색할 수 있습니다.
  • 스마트 라우팅 온보딩: 두 개 이상의 모델이 구성된 경우 마법사는 원클릭 스마트 라우팅 활성화를 제공합니다. 모델을 빠른/표준/추론 계층으로 자동 분류하고 예상 비용 절감액(40~70%)을 보여줍니다. 복잡한 작업을 위해 강력한 모델을 예약하면서 간단한 메시지를 더 가벼운 모델에 자동으로 라우팅할 수 있습니다.
  • 작업 공간 테마 선택: 마지막 마법사 단계로 세 가지 선별된 테마 프로필(공식 기본값, Calm Readable, Ocean) 중 하나를 선택하거나 건너뛰어 기본값을 유지합니다. 선택 사항은 ConfigSync를 통해 채팅, 칸반 및 설정과 동기화되며 에이전트 HTML 위젯은 동일한 색상을 자동으로 상속합니다.
  • 지속적인 안내: 마법사를 건너뛰더라도 채팅 화면의 부드러운 배너는 채팅을 시작하기 전에 모델 공급자를 구성하라는 알림을 표시합니다.
세 가지 배포 모드(로컬 WebUI, Tauri 데스크톱, 클라우드 호스팅)는 모두 설정 > 모델에서 동일한 구성 UI를 공유합니다.

API 키 추가

설정 > 모델로 이동하거나 환경 변수를 설정합니다.

스마트 라우팅

3차원 복잡성 라우터는 작업 요구 사항, 개인 정보 보호 민감도 및 공급자 상태를 기반으로 최적의 모델을 자동으로 선택합니다. 1단계 — 규칙 엔진(비용 LLM 없음): 키워드(30개 이상의 이중 언어), 코드 블록, 수학/LaTeX, URL/파일 경로, 이미지 및 메시지 길이 등 6가지 신호 유형에 대한 다차원 채점. 요청의 99%가 즉시 해결됩니다. 2단계 — LLM 판사(모호한 경우에만 해당): 경계선 사례의 경우 경량 판사 모델이 쿼리를 분류합니다. 반복 호출을 방지하기 위해 결과는 SHA-256 캐시(5분 TTL, 256개 항목 LRU)입니다. 세션 모멘텀: 짧은 후속 조치(예: “ok”, “yes”)는 SIMPLE로 다운그레이드되는 대신 세션의 복잡성 계층을 상속합니다. 메시지 길이 기반 가중치 감소는 긴 메시지가 독립적으로 분류되도록 보장합니다. PenaltyTracker — 자가 학습: 라우팅 결정이 잘못된 것으로 표시되면 해당 계층은 페널티 점수(24시간 반감기)를 받습니다. 향후 쿼리에는 페널티 계층을 활성화하기 위해 더 강력한 신호가 필요하므로 시간이 지남에 따라 라우팅 정확도가 향상됩니다. Fast Lane: SIMPLE로 분류된 작업은 무거운 미들웨어 파이프라인을 건너뛰고 최소한의 오버헤드로 모델로 직접 이동합니다. 이를 통해 일상적인 채팅, 인사말, 짧은 후속 조치에 대한 응답 지연 시간이 최대 30~50% 감소합니다. 가장 자주 보내는 메시지가 가장 빠르게 느껴집니다.

모델 속도 테스트

모델을 커밋하기 전에 설정에서 바로 실제 성능을 테스트해 보세요. 설정 > 모델 서비스로 이동하여 오른쪽 상단에 있는 속도 테스트 버튼을 클릭하세요. 측정 대상:
  • TTFT(Time to First Token) — 모델이 응답하기 시작하는 속도
  • TPS(초당 토큰 수) — 지속적인 생성 처리량
  • 총 토큰 — 테스트 프롬프트에 대한 전체 응답 길이
사용 방법:
  • 활성화된 모든 모델을 순차적으로 벤치마킹하려면 모두 실행을 클릭하세요.
  • 다시 테스트하려면 개별 모델의 재시도 아이콘을 클릭하세요.
  • 결과는 색상으로 구분된 배지로 성공/오류 상태를 표시합니다.
속도 테스트 결과는 합성 벤치마크가 아닌 실제 네트워크 상태와 API 주요 할당량을 반영합니다. Smart Routing의 자동 모델 선택과 결합하면 올바른 모델이 각 작업을 처리하고 있다는 데이터 기반 확신을 얻을 수 있습니다.

사고 강도 조절

추론 가능 모델(Claude 3.7+, o1/o3/o4-mini, Gemini 2.5, DeepSeek R1, Qwen3 등)의 경우 Myrm은 모델이 응답하기 전에 얼마나 깊이 “생각”하는지에 대한 세밀한 제어를 제공합니다. 6가지 사전 설정 레벨: 꺼짐 / 낮음 / 중간 / 높음 / 매우 높음 / 최대 - 빠른 답변부터 심층적인 다단계 추론까지 모든 것을 포괄합니다. 맞춤형 토큰 예산: 이를 지원하는 제공업체(예: Claude의 budget_tokens)에 대한 정확한 사고 예산을 설정하려면 임의의 값(예: 16384)을 입력하세요. 모델별 메모리: 귀하의 강도 기본 설정은 모델별로 자동으로 저장됩니다. Claude와 GPT 사이를 전환하세요. 각각은 자신의 마지막 설정을 기억합니다. 재구성이 필요하지 않습니다. 자동 감지: 사고 강도 버튼은 현재 모델이 추론을 지원할 때만 나타납니다. 비추리 모델(예: GPT-4o-mini)에는 버튼이 표시되지 않습니다. 감지는 이중 계층 접근 방식을 사용합니다. API 보고된 기능이 우선순위를 가지며 25개 이상의 모델 계열을 포괄하는 정규식 폴백이 적용됩니다. 선택한 강도는 프레임워크 결합이 전혀 없는 전체 파이프라인(프런트엔드 model_kwargs → 서버 통과 → 하네스 extra_body → LiteLLM → 공급자 API)을 통해 전달됩니다. 사고 여유 공간(자동): 모든 주요 추론 모델(Claude 4.6+, DeepSeek R1, OpenAI o-시리즈, Gemini 2.5+)은 max_tokens 예산에 대해 사고 토큰을 계산합니다. max_tokens이 너무 작으면 응답이 시작되기 전에 사고 단계에서 예산이 소진되어 잘림이 발생합니다. Myrm은(는) 선택한 사고 강도(낮음 8K, 중간 16K, 높음 32K, x높음/최대 65K)에 따라 max_tokens을 안전한 바닥으로 자동으로 올립니다. 강도가 명시적으로 설정되지 않은 경우 모든 사고 모델이 사고에 대한 기본 설정이므로 보수적인 16K 기본 바닥이 적용됩니다. 이는 사전 예방과 사후 대응이라는 이중 계층 방어로 스트림 복구와 함께 작동합니다. 조정은 완전히 투명하며 API 비용을 증가시키지 않습니다(제공자는 max_tokens 한도가 아닌 사용된 실제 토큰을 청구합니다).

추론 모델 답변 추출

DeepSeek-R1, Qwen-QwQ, OpenAI o시리즈, minimax M3 등 추론 모델은 최종 답변을 content 대신 reasoning_content에 넣습니다. 대부분의 Agent 프레임워크에는 이는 잠재된 함정입니다 — 생성된 스크립트, 툴 결과, UI 출력이 비어 있거나 None으로 출력되기 쉽습니다. Myrm은(는) 모델과 무관한 통합 추출 레이어를 통해 사용자에게 보이는 답변이 안정적으로 나오도록 자동 보장합니다.
  • content가 비어 있으면 reasoning_content로 자동 폴백 — 추론 모델이 별도의 화이트리스트 없이 바로 사용됩니다
  • 전체 파이프라인에서 <think>…</think> 블록 제거 — 답변이 깨끗하게 유지되고, 원본 사고가 스크립트·위키 문서·구조화 결과에 새어 나오지 않습니다
  • Anthropic 블록 구조와 일반 문자열 응답 모두 호환 — 모든 프로바이더가 동일한 추출 경로를 사용합니다
판정형 출력(작업 완료 판정, 의미 비교, 목표 평가)도 동일한 견고한 파싱을 사용합니다. Markdown 펜스, JSON 주변의 산문 프레임, 문자열 내 이스케이프되지 않은 줄바꿈까지 모두 처리되어 추론 모델이 칸반이나 목표 파이프라인을 망가뜨릴 수 없습니다. 결과: 새 모델이 바로 작동합니다 — OpenAI 호환 또는 Anthropic 호환 추론 모델을 연결하면 전체 제품(채팅, Agent, 칸반, 위키, 스크립트)이 계속 깨끗하고 안정적인 답변을 반환합니다.

모델별 프롬프트 적응

AI 모델마다 행동 경향이 다릅니다. Myrm은(는) 최상의 결과를 얻기 위해 각 모델 계열에 대한 시스템 프롬프트를 자동으로 조정합니다.
  • GPT / Codex / Grok: 도구 지속성 시행, 사실 확인을 위한 필수 도구 사용, 묻지 말고 행동하는 편향
  • Claude: 고지사항 최소화, 실행 우선 사고방식
  • Gemini/Gemma: 절대 파일 경로 구성, 종속성 확인
  • DeepSeek / Qwen / GLM: 간결한 중국어 인식 규율
  • Claude Opus 5+: 인류가 문서화한 세 가지 문제에 대한 자동 행동 조정 - 범위 확장(요청한 것보다 더 많은 작업 수행), 자기 교정 내레이션(불필요한 “내가 틀렸어요” 진술) 및 기본 장황함(필요보다 긴 응답)
모든 프롬프트 적응은 에이전트 초기화 시 수정되고 시스템 프롬프트에 캐시되므로 KV 캐시 적중률에 영향을 주지 않습니다. 아무것도 구성할 필요가 없습니다. Myrm은 모델 이름에서 모델 패밀리를 감지하고 적절한 분야를 자동으로 적용합니다.

채팅 내 모델 투명성

모든 보조 메시지에는 작업 표시줄에 토큰 경제 배지가 표시됩니다. 클릭하면 요청을 처리한 모델, 라우팅 방법, 비용, 실행 속도를 정확하게 확인할 수 있습니다.
  • 모델 이름 및 라우팅 계층 — 정확한 모델(예: gpt-4o, claude-sonnet-4) 및 해당 라우팅 분류(단순/표준/추론)를 확인하세요.
  • 신속한 캐시 적중률 — 캐시된 토큰의 비율, 예상 비용 절감액, 캐시가 무효화될 때 캐시 중단 속성
  • 비용 분석 — 실제/예상 배지를 포함한 메시지당 비용, 여러 모델을 사용하는 라우팅 시 다중 모델 분석, 도구별 토큰 소비
  • 성능 기준 — 세션 평균과 비교한 TTFT, 초당 토큰 및 지연 시간(색상으로 구분된 델타 표시기 포함)
  • 컨텍스트 예산 링 — 정상/경고/위험 임계값과 함께 컨텍스트 창 사용량을 보여주는 순환 진행
  • 개인 정보 보호 수준 — 데이터 민감도 분류(S1 공개/S2 내부/S3 기밀) 및 라우팅 경로(로컬/클라우드)
블랙박스가 없습니다. 모든 라우팅 결정은 채팅에서 직접 확인하고 확인할 수 있습니다.

키 순환

공급자당 여러 개의 API 키를 추가하면 Myrm이 스마트 장애 조치를 통해 키를 자동으로 순환합니다. 활성 키가 2개 이상인 경우 풀 상태 표시줄에 전략 선택기가 나타납니다. 설정에 가장 적합한 회전 모드를 선택하세요. 속도 제한 오류가 발생하면 풀은 지터가 ±15%인 지수 백오프를 적용하고 자동으로 사용 가능한 다음 키로 전환하므로 사용자는 전환을 눈치채지 못합니다.

개인 정보 보호 라우팅

Myrm의 개인 정보 보호 라우팅은 데이터 민감도에 따라 클라우드 또는 로컬 모델을 자동으로 선택하므로 수동 전환이 필요하지 않습니다. 개인 정보 보호 라우팅은 표준 인터페이스 뒤에 모델을 래핑합니다. 에이전트, 미들웨어 및 실행 루프는 라우팅을 전혀 인식하지 못하며 일반 모델과 상호 작용합니다. 로컬 백엔드용 Ollama, LM Studio 또는 vLLM과 결합하면 민감한 워크로드에 대해 완전한 에어갭 작업이 가능합니다.

로컬 모델 및 하드웨어 설명서

Myrm은 원활한 로컬 AI 경험을 위해 로컬 모델 서비스와 하드웨어 기능을 자동 감지합니다. 첫 번째 실행 - 자동 검색: 온보딩 중에 Myrm은(는) 기본 포트에서 Ollama 및 LM Studio를 검색합니다. 발견되면 원클릭 활성화를 제공합니다. 즉, 공급자 구성, 권장 모델 선택, 단일 단계로 기본값으로 설정이 가능합니다. 하드웨어 설명서: 설정에서 하드웨어 설명서 패널은 컴퓨터 사양(CPU, RAM, GPU, VRAM, 디스크 공간)을 표시하고 사용 가능한 각 로컬 모델에 대한 적합 점수를 계산합니다. 모델은 VRAM 또는 RAM을 기준으로 완벽함/좋음/보통/나쁨 등급으로 평가됩니다. 디스크 공간이 부족하면 다운로드 버튼이 비활성화되어 맞지 않는 모델을 다운로드할 때 시스템이 중단되는 것을 방지할 수 있습니다. 추론 속도 미리보기(~tok/s): VRAM 추정치와 함께 Myrm은 GPU의 메모리 대역폭과 모델의 매개변수 수(Q4_K_M 양자화)에서 계산된 각 모델의 사전 다운로드 추론 속도 배지를 표시합니다. 즉각적인 가독성을 위해 속도는 색상으로 구분됩니다.
  • 🟢 ≥ 20 tok/s — 원활한 실시간 대화
  • 🟡 8–19 tok/s — 약간의 대기 시간으로 사용 가능
  • 🔴 < 8 tok/s — 실시간 채팅의 경우 눈에 띄게 느림
즉, 다중 GB 다운로드를 수행하기 전에 모델이 빠르게 느껴지거나 느리게 느껴지는지 알 수 있습니다. 공급업체 효율성이 고려됩니다(Apple Silicon, Nvidia, AMD, Intel은 각각 실제 대역폭 활용도가 다릅니다). 스마트 권장 사항 — 최적 적합 우선: 모델은 하드웨어 적합성 수준에 따라 정렬된 다음 각 계층 내의 기능(매개변수 수)에 따라 정렬됩니다. 이는 Myrm이 가장 작은 모델이 아닌 하드웨어가 처리할 수 있는 가장 강력한 모델을 권장한다는 의미입니다. 최상위 모델은 “Best Fit” 배지로 강조 표시됩니다. MoE 인식 속도 추정: DeepSeek R1 32B와 같은 전문가 혼합 모델은 토큰당 전체 매개변수의 일부만 활성화합니다(예: 32B 중 7B). Myrm은(는) 속도 추정을 위해 활성 매개변수 수를 사용하므로 MoE 모델은 전체 매개변수를 기반으로 한 잘못된 추정이 아닌 실제 추론 속도를 보여줍니다. 100% 오프라인 — 네트워크 종속성 없음: 전체 추천 흐름은 인터넷 연결 없이 작동합니다. 모델 사양은 애플리케이션과 함께 제공되는 정적 자산으로 번들로 제공됩니다. 외부 API 호출, 캐시 만료, “첫 번째 실행에는 인터넷 필요” 요구 사항이 없습니다. 하드웨어 감지는 로컬 시스템 호출이며 Ollama 검색은 localhost만 대상으로 합니다. 이는 Hardware Cookbook이 공기가 차단된 환경, 비행기, 오프라인 서버실 또는 연결이 없는 어느 곳에서나 동일하게 작동한다는 것을 의미합니다. 선별 및 사기 방지 모델 목록: 모델 저장소를 동적으로 스크랩하고 부풀려진 벤치마크 점수로부터 방어해야 하는 도구와 달리 Myrm의 하드웨어 요리책은 팀에서 선별한 모델 목록을 사용합니다. 모든 데이터 포인트(매개변수 수, VRAM 요구 사항, 디스크 크기, 활성 매개변수)는 주관적인 벤치마크 점수가 아니라 객관적이고 검증 가능한 사실입니다. 이렇게 하면 순위표 순위가 귀하의 권장 사항에 영향을 미칠 위험이 제거됩니다. 원클릭 설치 및 제거: 스트리밍 진행률이 SSE인 UI에서 직접 모델을 다운로드하고 지원을 취소합니다. 설치 후 모델이 선택기에 즉시 나타납니다. 제거하면 디스크 공간이 즉시 회수됩니다. 배포 모드 인식: SaaS 모드에서는 로컬 모델 기능이 자동으로 숨겨지므로 클라우드 전용 사용자가 복잡해지지 않습니다. 로컬 WebUI 또는 데스크탑 모드에서는 전체 하드웨어 설명서를 사용할 수 있습니다. 로컬 엔드포인트에 대한 적응형 중단 감지: API URL이 로컬 주소(localhost, 192.168.x.x, 10.x.x.x 또는 모든 개인 네트워크)를 가리키는 경우 Myrm은 자동으로 내부 시간 초과 임계값을 완화합니다. 대규모 로컬 모델(70B+)은 대규모 컨텍스트를 사용하여 초기 토큰 생성에 몇 분이 걸릴 수 있습니다. 클라우드에 최적화된 60초 제한 시간은 이러한 요청을 조기에 종료하여 쓸데없는 재시도 루프를 트리거합니다. Myrm은 RFC1918/IPv6 주소 분석을 통해 로컬 엔드포인트를 감지하고 제한 시간을 5~30분으로 연장하여 로컬 추론이 성공적으로 완료되도록 합니다. 원격 API 동작은 변경되지 않습니다. 구성이 필요하지 않습니다. 그냥 작동합니다.

자동 복구 구성

모든 모델 구성 값은 저장 시 자동으로 삭제되어 일반적인 복사-붙여넣기 오류로 인해 연결 오류가 발생하는 것을 방지합니다.
  • API URL — 후행 슬래시 및 공백이 제거되었습니다(404 오류 방지).
  • API 키 — 선행/후행 공백 및 줄바꿈 제거(인증 실패 방지)
  • 모델 이름 — 추가 공백이 제거되었습니다(모델을 찾을 수 없는 오류 방지).
  • 빈 값 — 설정되지 않은 상태로 정상적으로 변환됨(충돌 방지)
  • 레거시 공급자 유형 값openai-like 대신 openai과 같은 기본 ID를 사용한 이전 내보내기는 로드 시 자동 정규화됩니다. 라우팅은 앱을 충돌시키는 대신 공급자 ID로 대체됩니다.
  • 개발자 시스템 상태 — 컨텍스트 번들 상태 패널은 API 기본 URL에서 /context-bundle를 호출합니다(접두사 /api을 두 번 사용하지 마십시오(404).
이는 문서나 터미널에서 붙여넣을 때 입력에 추가 공백, 슬래시 또는 줄 바꿈이 있어도 시스템이 올바르게 작동한다는 의미입니다. 포맷에 대해 걱정할 필요가 없습니다.

다중 장치 구성 동기화

Myrm은(는) 새로 고칠 때마다 잔소리를 하지 않고도 브라우저 탭, 데스크톱 앱, SaaS 전반에서 설정을 일관되게 유지합니다. 얻을 수 있는 것:
  • 휴대폰의 언어, TTS 또는 모델 기본값을 변경하세요. 데스크톱이 자동으로 선택합니다.
  • 여러 탭 열기 또는 새로 고침 — 거짓 “구성 충돌” 대화 상자 없음
  • 오프라인으로 작업 - 대기열을 로컬에서 변경하고 다시 온라인 상태가 되면 동기화합니다.
  • 뭔가 고장났나요? Config Time Machine은 모든 키를 이전 버전으로 롤백합니다.
작동 방식(사용자 측):
  • 스마트 병합 — 두 장치가 다른 필드를 편집하는 경우 두 변경 사항이 모두 자동으로 적용됩니다.
  • 정직한 충돌 — 두 장치가 동일한 필드를 편집하는 경우 유지할 버전을 선택합니다.
  • 동일 기기 무음 — 탭을 새로 고쳐도 충돌 메시지가 표시되지 않습니다.
  • 멱등성 동기화 — 동일한 콘텐츠가 버전 번호를 바꾸거나 소음을 발생시키지 않습니다.
파일 기반 에이전트(OpenClaw, Hermes CLI): 설정은 병합 UI 없이 분산된 파일에 존재합니다. 다중 장치 사용은 수동 복사 또는 git 충돌을 의미합니다. Myrm은 엔터프라이즈급 구성 동기화 전체 GUI을 갖춘 유일한 에이전트 워크스테이션입니다.

네트워크 프록시(제한된 네트워크의 경우)

Myrm은(는) 자동으로 시스템의 프록시 설정을 따릅니다. OS 수준에서 VPN 또는 프록시(예: ClashX, V2Ray)가 이미 구성되어 있는 경우 모든 LLM API 통화는 추가 구성 없이 이를 통해 라우팅됩니다. 작동 방식:
  • HTTP 클라이언트(httpx)의 기본값은 trust_env=True이며 자동으로 HTTP_PROXY/HTTPS_PROXY/ALL_PROXY 환경 변수를 읽습니다.
  • 시스템 수준 프록시 설정(macOS 네트워크 기본 설정, Windows 인터넷 옵션)이 자동으로 적용됩니다.
  • 다시 시작할 필요 없음 — 프록시 변경 사항은 다음 API 호출에 적용됩니다.
대안: 맞춤 기본 URL: 릴레이/전달 서비스(예: one-api, new-api)를 선호하는 경우 각 공급자의 기본 URL을 릴레이 엔드포인트로 설정하기만 하면 됩니다. Myrm은(는) 이 공급자별 지원을 제공합니다. 필요에 따라 직접 연결과 릴레이를 혼합할 수 있습니다. 클라우드 사용자: SaaS 모드에서는 제어 플레인의 LLM 릴레이가 모든 공급자 연결을 처리하므로 프록시 구성이 필요하지 않습니다.

비전 대체

메인 모델이 비전을 지원하지 않는 경우 설정 → 모델에서 비전 폴백 모델을 설정하세요. Myrm은(는) 첨부된 이미지를 기본 모델로 보내기 전에 자동으로 텍스트 설명으로 변환합니다. 채팅의 실시간 진행 상황과 중복 이미지에 대한 세션 수준 캐싱이 포함됩니다. GUI 도구(2026-07-31):
  • 비전 체인 테스트 — 주문된 전체 공급자 체인을 조사하고 응답한 모델(또는 실패한 단계)을 표시합니다.
  • 이 모델 사용 — 기본 모델이 텍스트 전용인 경우 활성화된 비전 지원 제공업체로부터 원클릭 추천을 받을 수 있습니다.
  • 채팅 첨부 경고 — 비전이 누락된 경우 기본 모델 탭에 대한 설정으로 이동 딥 링크가 포함된 알림이 표시됩니다.
설정 및 사용법은 비전 및 이미지 이해 가이드를 참조하세요.

다중 모델 자문 오버레이(MoA)

경량 참조 모델은 기본 모델 바인딩을 변경하지 않고 각 도구 루프 반복 전에 작동 모델에 조언합니다. 계약 검토, 아키텍처 결정, 고위험 답변 교차 확인에 이상적입니다. 설정(에이전트 프로필당 한 번): 설정 → 에이전트 → 기능 → 에이전트-루프 조언자 오버레이 — 활성화, 1개 이상의 참조 모델 추가, 팬아웃/개인 정보 보호/출력 제한 조정. 채팅 세션당: 입력 옆에 있는 모델 선택기 열기 → 에이전트 혼합 그룹 → 표준, 심층 검토 또는 빠름을 선택합니다(또는 끄려면 다시 클릭). MoA는 프리셋이 선택된 경우에만 실행됩니다. 그렇지 않은 경우에는 추가 참조 호출이 없습니다. 선택 항목은 chats.active_moa_preset_id까지 유지됩니다(새로 고침 및 장치 간 동기화 유지). 시크릿 채팅에서는 MoA 기본 설정을 읽거나 쓰지 않습니다. 사전 설정된 강도(동일한 참조 풀, 다른 런타임 매개변수):
  • 표준 — 프로필 기본값
  • 심층 검토 — 더 높은 참조 추론 노력
  • 빠름 — 더 적은 노력 + 더 엄격한 기준 출력 한도
주요 매개변수(설정):
  • 팬아웃 정책Once per user turn(기본값), Every model call 또는 Every N model calls
  • 어드바이저 개인정보 보호 필터Off / Display only / Full
  • 참조 출력 제한 — 기본 600개 토큰(비용 관리)
보호 조치:
  • 참조 모델 없음 → 오버레이 건너뛰기(황색 경고, 자동 가짜 MoA 없음)
  • 예산 압박/무인 실행 → 오버레이 자동 건너뛰기
  • ConsensusThinkingPanel은 SSE moa_ref_done을 통해 각 조언자를 보여줍니다.
  • 프롬프트 캐시 안전 — 권고자는 임시 컨텍스트만 주입합니다(SystemMessage 변형 없음).
참고: 독립형 합의 ActionMode가 제거되었습니다. 기존 API action_mode=consensus400을 반환합니다. 대신 action_mode=agentactive_moa_preset_id와 함께 사용하세요.
Hermes 마이그레이션: 마법사 확인 시 기본 moa.presets 참조 모델이 대상 에이전트 오버레이(hermes_moa_migrator)에 기록됩니다. 데이터 마이그레이션 - Hermes MoA 참조 가져오기를 참조하세요. 검증됨(2026년 8월 3일, 재실행 189): MoA 선택기 54개의 대상 단위 테스트(11개의 FE vitest + 43개의 서버 pytest, 0개의 실패) — 패치 롤백, 조직 정책 MoA 참조, 합의 400 거부, active_moa_preset_id 직렬화. Chrome MCP / API 오버레이 E2E는 아직 보류 중입니다(자료 문서 참조). MULTI_MODEL_CONSENSUS_ADVANTAGE.md을 참조하세요. 백엔드에서 프런트엔드까지 완전한 토큰 경제 시각화 파이프라인:

도구 스키마 자동 정규화

모델 간에 전환하는 경우(예: GPT-4o → Gemini → Claude) 각 공급자는 도구 스키마에 대한 요구 사항이 다릅니다. Myrm은 모든 도구 스키마를 모델로 보내기 전에 자동으로 정규화하므로 수동 구성이 필요하지 않습니다. 자동으로 수정되는 사항:
  • 고아 required 항목(필수로 나열되지만 속성에 정의되지 않은 필드) - Gemini/Vertex AI에서 400 오류 발생
  • 중첩된 null 허용 패턴(anyOf: [{type: X}, {type: null}]) — 엄격한 OpenAI 함수 호출 시 오류가 발생합니다.
  • $ref/$defs 인라인 정의 — 대부분의 공급자는 JSON 스키마 참조를 지원하지 않습니다.
  • 중첩된 개체에 type 주석이 없습니다. 엄격한 공급자가 이를 거부합니다.
  • 인류가 지원하지 않는 키워드(minimum, maxItems, pattern 등) — 제약 조건이 설명에 포함되어 있습니다.
중요한 이유: MCP 도구는 다양한 스키마 품질을 갖춘 타사 서버에서 제공됩니다. 정규화가 없으면 에이전트를 한 모델에서 다른 모델로 전환하면 도구 호출이 완전히 중단되는 경우가 많습니다. Myrm은 모든 도구가 모든 모델에서 투명하게 작동하도록 보장합니다.

내결함성

14계층 오류 복구 시스템은 오류를 자동으로 처리합니다.
  • 비율 제한 오류(4-전략 키 순환 + 자격 증명 풀 + ManagedLLM/KeyPool 에이전트 내 장애 조치)
  • 공급자 중단(3단계 쿨다운 + 대체 사전 설정이 포함된 회로 차단기)
  • 스트림 중단(토큰 수준의 정확한 이력서)
  • 응답 잘림(점진적 출력 예산 부스트 2배 → 3배 → 4배)
  • 대형 이미지(자동 재인코딩 및 압축)
  • 모델사고 모드 오류(자동 모드 조정 및 재시도)
  • 빈 응답(매개변수 조정 및 재시도)
  • 반복 제한(유예 호출 요약 - 사용자에게 빈 응답이 표시되지 않음)
전체 14계층 아키텍처는 오류 복구를 참조하세요.