모델 구성
Myrm은 LiteLLM을 사용하여 26개 이상의 내장 공급자가 제공하는 100개 이상의 모델에 대한 통합 액세스를 제공하며 무한한 맞춤형 공급자 확장을 위한 세 가지 호환성 프로토콜(OpenAI 유사, Gemini 유사, Anthropic 유사)을 제공합니다. 각 내장 공급자는 미리 채워진 API URL과 함께 제공되며 원클릭 국내/국제 지역 전환을 지원합니다. 즉, 실제로 제로 구성이 가능합니다.최초 설정
Myrm을(를) 처음 실행하면 온보딩 마법사가 모델 구성을 안내합니다.- 로컬 모델 자동 감지: Myrm은(는) 실행 중인 Ollama 또는 LM Studio 인스턴스를 자동으로 검색하고 원클릭 활성화 버튼을 통해 사용 가능한 최상의 모델을 추천합니다.
- 클라우드 빠른 시작: 로컬 GPU가 없나요? 마법사는 Google Gemini, SiliconFlow(등록 크레딧) 및 OpenRouter(무료 오픈 소스 모델)와 같은 무료 계층이 있는 클라우드 제공업체를 표시하며 원클릭으로 구성 페이지를 탐색할 수 있습니다.
- 스마트 라우팅 온보딩: 두 개 이상의 모델이 구성된 경우 마법사는 원클릭 스마트 라우팅 활성화를 제공합니다. 모델을 빠른/표준/추론 계층으로 자동 분류하고 예상 비용 절감액(40~70%)을 보여줍니다. 복잡한 작업을 위해 강력한 모델을 예약하면서 간단한 메시지를 더 가벼운 모델에 자동으로 라우팅할 수 있습니다.
- 작업 공간 테마 선택: 마지막 마법사 단계로 세 가지 선별된 테마 프로필(공식 기본값, Calm Readable, Ocean) 중 하나를 선택하거나 건너뛰어 기본값을 유지합니다. 선택 사항은 ConfigSync를 통해 채팅, 칸반 및 설정과 동기화되며 에이전트 HTML 위젯은 동일한 색상을 자동으로 상속합니다.
- 지속적인 안내: 마법사를 건너뛰더라도 채팅 화면의 부드러운 배너는 채팅을 시작하기 전에 모델 공급자를 구성하라는 알림을 표시합니다.
API 키 추가
설정 > 모델로 이동하거나 환경 변수를 설정합니다.스마트 라우팅
3차원 복잡성 라우터는 작업 요구 사항, 개인 정보 보호 민감도 및 공급자 상태를 기반으로 최적의 모델을 자동으로 선택합니다. 1단계 — 규칙 엔진(비용 LLM 없음): 키워드(30개 이상의 이중 언어), 코드 블록, 수학/LaTeX, URL/파일 경로, 이미지 및 메시지 길이 등 6가지 신호 유형에 대한 다차원 채점. 요청의 99%가 즉시 해결됩니다. 2단계 — LLM 판사(모호한 경우에만 해당): 경계선 사례의 경우 경량 판사 모델이 쿼리를 분류합니다. 반복 호출을 방지하기 위해 결과는 SHA-256 캐시(5분 TTL, 256개 항목 LRU)입니다. 세션 모멘텀: 짧은 후속 조치(예: “ok”, “yes”)는 SIMPLE로 다운그레이드되는 대신 세션의 복잡성 계층을 상속합니다. 메시지 길이 기반 가중치 감소는 긴 메시지가 독립적으로 분류되도록 보장합니다. PenaltyTracker — 자가 학습: 라우팅 결정이 잘못된 것으로 표시되면 해당 계층은 페널티 점수(24시간 반감기)를 받습니다. 향후 쿼리에는 페널티 계층을 활성화하기 위해 더 강력한 신호가 필요하므로 시간이 지남에 따라 라우팅 정확도가 향상됩니다. Fast Lane: SIMPLE로 분류된 작업은 무거운 미들웨어 파이프라인을 건너뛰고 최소한의 오버헤드로 모델로 직접 이동합니다. 이를 통해 일상적인 채팅, 인사말, 짧은 후속 조치에 대한 응답 지연 시간이 최대 30~50% 감소합니다. 가장 자주 보내는 메시지가 가장 빠르게 느껴집니다.모델 속도 테스트
모델을 커밋하기 전에 설정에서 바로 실제 성능을 테스트해 보세요. 설정 > 모델 서비스로 이동하여 오른쪽 상단에 있는 속도 테스트 버튼을 클릭하세요. 측정 대상:- TTFT(Time to First Token) — 모델이 응답하기 시작하는 속도
- TPS(초당 토큰 수) — 지속적인 생성 처리량
- 총 토큰 — 테스트 프롬프트에 대한 전체 응답 길이
- 활성화된 모든 모델을 순차적으로 벤치마킹하려면 모두 실행을 클릭하세요.
- 다시 테스트하려면 개별 모델의 재시도 아이콘을 클릭하세요.
- 결과는 색상으로 구분된 배지로 성공/오류 상태를 표시합니다.
사고 강도 조절
추론 가능 모델(Claude 3.7+, o1/o3/o4-mini, Gemini 2.5, DeepSeek R1, Qwen3 등)의 경우 Myrm은 모델이 응답하기 전에 얼마나 깊이 “생각”하는지에 대한 세밀한 제어를 제공합니다. 6가지 사전 설정 레벨: 꺼짐 / 낮음 / 중간 / 높음 / 매우 높음 / 최대 - 빠른 답변부터 심층적인 다단계 추론까지 모든 것을 포괄합니다. 맞춤형 토큰 예산: 이를 지원하는 제공업체(예: Claude의budget_tokens)에 대한 정확한 사고 예산을 설정하려면 임의의 값(예: 16384)을 입력하세요.
모델별 메모리: 귀하의 강도 기본 설정은 모델별로 자동으로 저장됩니다. Claude와 GPT 사이를 전환하세요. 각각은 자신의 마지막 설정을 기억합니다. 재구성이 필요하지 않습니다.
자동 감지: 사고 강도 버튼은 현재 모델이 추론을 지원할 때만 나타납니다. 비추리 모델(예: GPT-4o-mini)에는 버튼이 표시되지 않습니다. 감지는 이중 계층 접근 방식을 사용합니다. API 보고된 기능이 우선순위를 가지며 25개 이상의 모델 계열을 포괄하는 정규식 폴백이 적용됩니다.
선택한 강도는 프레임워크 결합이 전혀 없는 전체 파이프라인(프런트엔드 model_kwargs → 서버 통과 → 하네스 extra_body → LiteLLM → 공급자 API)을 통해 전달됩니다.
사고 여유 공간(자동): 모든 주요 추론 모델(Claude 4.6+, DeepSeek R1, OpenAI o-시리즈, Gemini 2.5+)은 max_tokens 예산에 대해 사고 토큰을 계산합니다. max_tokens이 너무 작으면 응답이 시작되기 전에 사고 단계에서 예산이 소진되어 잘림이 발생합니다. Myrm은(는) 선택한 사고 강도(낮음 8K, 중간 16K, 높음 32K, x높음/최대 65K)에 따라 max_tokens을 안전한 바닥으로 자동으로 올립니다. 강도가 명시적으로 설정되지 않은 경우 모든 사고 모델이 사고에 대한 기본 설정이므로 보수적인 16K 기본 바닥이 적용됩니다. 이는 사전 예방과 사후 대응이라는 이중 계층 방어로 스트림 복구와 함께 작동합니다. 조정은 완전히 투명하며 API 비용을 증가시키지 않습니다(제공자는 max_tokens 한도가 아닌 사용된 실제 토큰을 청구합니다).
추론 모델 답변 추출
DeepSeek-R1, Qwen-QwQ, OpenAI o시리즈, minimax M3 등 추론 모델은 최종 답변을content 대신 reasoning_content에 넣습니다. 대부분의 Agent 프레임워크에는 이는 잠재된 함정입니다 — 생성된 스크립트, 툴 결과, UI 출력이 비어 있거나 None으로 출력되기 쉽습니다.
Myrm은(는) 모델과 무관한 통합 추출 레이어를 통해 사용자에게 보이는 답변이 안정적으로 나오도록 자동 보장합니다.
content가 비어 있으면reasoning_content로 자동 폴백 — 추론 모델이 별도의 화이트리스트 없이 바로 사용됩니다- 전체 파이프라인에서
<think>…</think>블록 제거 — 답변이 깨끗하게 유지되고, 원본 사고가 스크립트·위키 문서·구조화 결과에 새어 나오지 않습니다 - Anthropic 블록 구조와 일반 문자열 응답 모두 호환 — 모든 프로바이더가 동일한 추출 경로를 사용합니다
모델별 프롬프트 적응
AI 모델마다 행동 경향이 다릅니다. Myrm은(는) 최상의 결과를 얻기 위해 각 모델 계열에 대한 시스템 프롬프트를 자동으로 조정합니다.- GPT / Codex / Grok: 도구 지속성 시행, 사실 확인을 위한 필수 도구 사용, 묻지 말고 행동하는 편향
- Claude: 고지사항 최소화, 실행 우선 사고방식
- Gemini/Gemma: 절대 파일 경로 구성, 종속성 확인
- DeepSeek / Qwen / GLM: 간결한 중국어 인식 규율
- Claude Opus 5+: 인류가 문서화한 세 가지 문제에 대한 자동 행동 조정 - 범위 확장(요청한 것보다 더 많은 작업 수행), 자기 교정 내레이션(불필요한 “내가 틀렸어요” 진술) 및 기본 장황함(필요보다 긴 응답)
채팅 내 모델 투명성
모든 보조 메시지에는 작업 표시줄에 토큰 경제 배지가 표시됩니다. 클릭하면 요청을 처리한 모델, 라우팅 방법, 비용, 실행 속도를 정확하게 확인할 수 있습니다.- 모델 이름 및 라우팅 계층 — 정확한 모델(예:
gpt-4o,claude-sonnet-4) 및 해당 라우팅 분류(단순/표준/추론)를 확인하세요. - 신속한 캐시 적중률 — 캐시된 토큰의 비율, 예상 비용 절감액, 캐시가 무효화될 때 캐시 중단 속성
- 비용 분석 — 실제/예상 배지를 포함한 메시지당 비용, 여러 모델을 사용하는 라우팅 시 다중 모델 분석, 도구별 토큰 소비
- 성능 기준 — 세션 평균과 비교한 TTFT, 초당 토큰 및 지연 시간(색상으로 구분된 델타 표시기 포함)
- 컨텍스트 예산 링 — 정상/경고/위험 임계값과 함께 컨텍스트 창 사용량을 보여주는 순환 진행
- 개인 정보 보호 수준 — 데이터 민감도 분류(S1 공개/S2 내부/S3 기밀) 및 라우팅 경로(로컬/클라우드)
키 순환
공급자당 여러 개의 API 키를 추가하면 Myrm이 스마트 장애 조치를 통해 키를 자동으로 순환합니다. 활성 키가 2개 이상인 경우 풀 상태 표시줄에 전략 선택기가 나타납니다. 설정에 가장 적합한 회전 모드를 선택하세요.
속도 제한 오류가 발생하면 풀은 지터가 ±15%인 지수 백오프를 적용하고 자동으로 사용 가능한 다음 키로 전환하므로 사용자는 전환을 눈치채지 못합니다.
개인 정보 보호 라우팅
Myrm의 개인 정보 보호 라우팅은 데이터 민감도에 따라 클라우드 또는 로컬 모델을 자동으로 선택하므로 수동 전환이 필요하지 않습니다.
개인 정보 보호 라우팅은 표준 인터페이스 뒤에 모델을 래핑합니다. 에이전트, 미들웨어 및 실행 루프는 라우팅을 전혀 인식하지 못하며 일반 모델과 상호 작용합니다.
로컬 백엔드용 Ollama, LM Studio 또는 vLLM과 결합하면 민감한 워크로드에 대해 완전한 에어갭 작업이 가능합니다.
로컬 모델 및 하드웨어 설명서
Myrm은 원활한 로컬 AI 경험을 위해 로컬 모델 서비스와 하드웨어 기능을 자동 감지합니다. 첫 번째 실행 - 자동 검색: 온보딩 중에 Myrm은(는) 기본 포트에서 Ollama 및 LM Studio를 검색합니다. 발견되면 원클릭 활성화를 제공합니다. 즉, 공급자 구성, 권장 모델 선택, 단일 단계로 기본값으로 설정이 가능합니다. 하드웨어 설명서: 설정에서 하드웨어 설명서 패널은 컴퓨터 사양(CPU, RAM, GPU, VRAM, 디스크 공간)을 표시하고 사용 가능한 각 로컬 모델에 대한 적합 점수를 계산합니다. 모델은 VRAM 또는 RAM을 기준으로 완벽함/좋음/보통/나쁨 등급으로 평가됩니다. 디스크 공간이 부족하면 다운로드 버튼이 비활성화되어 맞지 않는 모델을 다운로드할 때 시스템이 중단되는 것을 방지할 수 있습니다. 추론 속도 미리보기(~tok/s): VRAM 추정치와 함께 Myrm은 GPU의 메모리 대역폭과 모델의 매개변수 수(Q4_K_M 양자화)에서 계산된 각 모델의 사전 다운로드 추론 속도 배지를 표시합니다. 즉각적인 가독성을 위해 속도는 색상으로 구분됩니다.- 🟢 ≥ 20 tok/s — 원활한 실시간 대화
- 🟡 8–19 tok/s — 약간의 대기 시간으로 사용 가능
- 🔴 < 8 tok/s — 실시간 채팅의 경우 눈에 띄게 느림
자동 복구 구성
모든 모델 구성 값은 저장 시 자동으로 삭제되어 일반적인 복사-붙여넣기 오류로 인해 연결 오류가 발생하는 것을 방지합니다.- API URL — 후행 슬래시 및 공백이 제거되었습니다(404 오류 방지).
- API 키 — 선행/후행 공백 및 줄바꿈 제거(인증 실패 방지)
- 모델 이름 — 추가 공백이 제거되었습니다(모델을 찾을 수 없는 오류 방지).
- 빈 값 — 설정되지 않은 상태로 정상적으로 변환됨(충돌 방지)
- 레거시 공급자 유형 값 —
openai-like대신openai과 같은 기본 ID를 사용한 이전 내보내기는 로드 시 자동 정규화됩니다. 라우팅은 앱을 충돌시키는 대신 공급자 ID로 대체됩니다. - 개발자 시스템 상태 — 컨텍스트 번들 상태 패널은 API 기본 URL에서
/context-bundle를 호출합니다(접두사/api을 두 번 사용하지 마십시오(404).
다중 장치 구성 동기화
Myrm은(는) 새로 고칠 때마다 잔소리를 하지 않고도 브라우저 탭, 데스크톱 앱, SaaS 전반에서 설정을 일관되게 유지합니다. 얻을 수 있는 것:- 휴대폰의 언어, TTS 또는 모델 기본값을 변경하세요. 데스크톱이 자동으로 선택합니다.
- 여러 탭 열기 또는 새로 고침 — 거짓 “구성 충돌” 대화 상자 없음
- 오프라인으로 작업 - 대기열을 로컬에서 변경하고 다시 온라인 상태가 되면 동기화합니다.
- 뭔가 고장났나요? Config Time Machine은 모든 키를 이전 버전으로 롤백합니다.
- 스마트 병합 — 두 장치가 다른 필드를 편집하는 경우 두 변경 사항이 모두 자동으로 적용됩니다.
- 정직한 충돌 — 두 장치가 동일한 필드를 편집하는 경우 유지할 버전을 선택합니다.
- 동일 기기 무음 — 탭을 새로 고쳐도 충돌 메시지가 표시되지 않습니다.
- 멱등성 동기화 — 동일한 콘텐츠가 버전 번호를 바꾸거나 소음을 발생시키지 않습니다.
네트워크 프록시(제한된 네트워크의 경우)
Myrm은(는) 자동으로 시스템의 프록시 설정을 따릅니다. OS 수준에서 VPN 또는 프록시(예: ClashX, V2Ray)가 이미 구성되어 있는 경우 모든 LLM API 통화는 추가 구성 없이 이를 통해 라우팅됩니다. 작동 방식:- HTTP 클라이언트(
httpx)의 기본값은trust_env=True이며 자동으로HTTP_PROXY/HTTPS_PROXY/ALL_PROXY환경 변수를 읽습니다. - 시스템 수준 프록시 설정(macOS 네트워크 기본 설정, Windows 인터넷 옵션)이 자동으로 적용됩니다.
- 다시 시작할 필요 없음 — 프록시 변경 사항은 다음 API 호출에 적용됩니다.
비전 대체
메인 모델이 비전을 지원하지 않는 경우 설정 → 모델에서 비전 폴백 모델을 설정하세요. Myrm은(는) 첨부된 이미지를 기본 모델로 보내기 전에 자동으로 텍스트 설명으로 변환합니다. 채팅의 실시간 진행 상황과 중복 이미지에 대한 세션 수준 캐싱이 포함됩니다. GUI 도구(2026-07-31):- 비전 체인 테스트 — 주문된 전체 공급자 체인을 조사하고 응답한 모델(또는 실패한 단계)을 표시합니다.
- 이 모델 사용 — 기본 모델이 텍스트 전용인 경우 활성화된 비전 지원 제공업체로부터 원클릭 추천을 받을 수 있습니다.
- 채팅 첨부 경고 — 비전이 누락된 경우 기본 모델 탭에 대한 설정으로 이동 딥 링크가 포함된 알림이 표시됩니다.
다중 모델 자문 오버레이(MoA)
경량 참조 모델은 기본 모델 바인딩을 변경하지 않고 각 도구 루프 반복 전에 작동 모델에 조언합니다. 계약 검토, 아키텍처 결정, 고위험 답변 교차 확인에 이상적입니다. 설정(에이전트 프로필당 한 번): 설정 → 에이전트 → 기능 → 에이전트-루프 조언자 오버레이 — 활성화, 1개 이상의 참조 모델 추가, 팬아웃/개인 정보 보호/출력 제한 조정. 채팅 세션당: 입력 옆에 있는 모델 선택기 열기 → 에이전트 혼합 그룹 → 표준, 심층 검토 또는 빠름을 선택합니다(또는 끄려면 다시 클릭). MoA는 프리셋이 선택된 경우에만 실행됩니다. 그렇지 않은 경우에는 추가 참조 호출이 없습니다. 선택 항목은chats.active_moa_preset_id까지 유지됩니다(새로 고침 및 장치 간 동기화 유지). 시크릿 채팅에서는 MoA 기본 설정을 읽거나 쓰지 않습니다.
사전 설정된 강도(동일한 참조 풀, 다른 런타임 매개변수):
- 표준 — 프로필 기본값
- 심층 검토 — 더 높은 참조 추론 노력
- 빠름 — 더 적은 노력 + 더 엄격한 기준 출력 한도
- 팬아웃 정책 —
Once per user turn(기본값),Every model call또는Every N model calls - 어드바이저 개인정보 보호 필터 —
Off/Display only/Full - 참조 출력 제한 — 기본 600개 토큰(비용 관리)
- 참조 모델 없음 → 오버레이 건너뛰기(황색 경고, 자동 가짜 MoA 없음)
- 예산 압박/무인 실행 → 오버레이 자동 건너뛰기
ConsensusThinkingPanel은 SSEmoa_ref_done을 통해 각 조언자를 보여줍니다.- 프롬프트 캐시 안전 — 권고자는 임시 컨텍스트만 주입합니다(SystemMessage 변형 없음).
참고: 독립형 합의 ActionMode가 제거되었습니다. 기존 APIHermes 마이그레이션: 마법사 확인 시 기본action_mode=consensus은 400을 반환합니다. 대신action_mode=agent을active_moa_preset_id와 함께 사용하세요.
moa.presets 참조 모델이 대상 에이전트 오버레이(hermes_moa_migrator)에 기록됩니다. 데이터 마이그레이션 - Hermes MoA 참조 가져오기를 참조하세요.
검증됨(2026년 8월 3일, 재실행 189): MoA 선택기 54개의 대상 단위 테스트(11개의 FE vitest + 43개의 서버 pytest, 0개의 실패) — 패치 롤백, 조직 정책 MoA 참조, 합의 400 거부, active_moa_preset_id 직렬화. Chrome MCP / API 오버레이 E2E는 아직 보류 중입니다(자료 문서 참조). MULTI_MODEL_CONSENSUS_ADVANTAGE.md을 참조하세요.
백엔드에서 프런트엔드까지 완전한 토큰 경제 시각화 파이프라인:
도구 스키마 자동 정규화
모델 간에 전환하는 경우(예: GPT-4o → Gemini → Claude) 각 공급자는 도구 스키마에 대한 요구 사항이 다릅니다. Myrm은 모든 도구 스키마를 모델로 보내기 전에 자동으로 정규화하므로 수동 구성이 필요하지 않습니다. 자동으로 수정되는 사항:- 고아
required항목(필수로 나열되지만 속성에 정의되지 않은 필드) - Gemini/Vertex AI에서 400 오류 발생 - 중첩된 null 허용 패턴(
anyOf: [{type: X}, {type: null}]) — 엄격한 OpenAI 함수 호출 시 오류가 발생합니다. $ref/$defs인라인 정의 — 대부분의 공급자는 JSON 스키마 참조를 지원하지 않습니다.- 중첩된 개체에
type주석이 없습니다. 엄격한 공급자가 이를 거부합니다. - 인류가 지원하지 않는 키워드(
minimum,maxItems,pattern등) — 제약 조건이 설명에 포함되어 있습니다.
내결함성
14계층 오류 복구 시스템은 오류를 자동으로 처리합니다.- 비율 제한 오류(4-전략 키 순환 + 자격 증명 풀 + ManagedLLM/KeyPool 에이전트 내 장애 조치)
- 공급자 중단(3단계 쿨다운 + 대체 사전 설정이 포함된 회로 차단기)
- 스트림 중단(토큰 수준의 정확한 이력서)
- 응답 잘림(점진적 출력 예산 부스트 2배 → 3배 → 4배)
- 대형 이미지(자동 재인코딩 및 압축)
- 모델사고 모드 오류(자동 모드 조정 및 재시도)
- 빈 응답(매개변수 조정 및 재시도)
- 반복 제한(유예 호출 요약 - 사용자에게 빈 응답이 표시되지 않음)