비전 및 이미지 이해
Myrm을(를) 사용하면 채팅, 채널 및 데스크톱 업로드에 이미지를 첨부할 수 있습니다. 주 모델이 비전을 지원하지 않는 경우 Myrm은 비전 폴백 모델을 통해 이미지를 자동으로 라우팅하고 텍스트 설명을 삽입하므로 수동으로 모델을 전환할 필요가 없습니다.작동 방식
- WebUI에 파일(이미지, PDF, 문서, 비디오, 오디오, 코드)을 붙여넣거나 끌거나 첨부합니다(또는 지원되는 채널에서 파일을 보냅니다).
- Myrm은(는) 선택한 기본 모델이 비전(
supports_vision)을 지원하는지 확인합니다. - 그렇다면 - 이미지가 기본 다중 모드 블록으로 기본 모델에 전송됩니다.
- 아니요 — Myrm은 실시간 “이미지 분석 중…” 상태를 표시하고 구성된 Vision Fallback 모델을 호출하고 이미지를 간결한 텍스트 설명으로 바꾼 다음 기본 모델과의 대화를 계속합니다.
설정
- 설정 → 모델을 엽니다.
- 기본 채팅 모델(모든 제공자)을 선택하세요.
- Vision Fallback을 비전 지원 모델(예: GPT-4o, Gemini Flash, Qwen-VL)로 설정합니다.
- 비전 체인 테스트를 클릭하여 전체 순서 폴백 체인을 확인합니다(실패 시
resolved_model및 엔드포인트 표시). - 기본 모델이 텍스트 전용이고 대체가 설정되지 않은 경우 Myrm에서는 이 모델 사용을 제공할 수 있습니다. 한 번의 클릭으로 활성화된 제공업체에서 첫 번째 비전 지원 모델을 선택할 수 있습니다.
- 선택 사항: 기본 모델이 텍스트 전용이지만
.mp4파일을 업로드하는 경우 비디오 폴백을 별도로 설정합니다. Myrm은 프레임 추출로 폴백하기 전에 해당 슬롯을 통해 비디오 분석을 라우팅합니다. - 선택 사항: 모델 선택기의 기능 아이콘을 사용합니다. 눈 아이콘이 있는 모델은 기본적으로 시력을 지원합니다.
Vision이 구성되지 않은 경우
이미지나 동영상을 첨부했지만 기본 모델이나 Vision Fallback 모두 이를 분석할 수 없는 경우 Myrm에서는 설정으로 이동을 통해 경고 토스트를 표시합니다. 설정 → 모델 → 기본값에 대한 딥 링크를 통해 한 번의 클릭으로 Vision Fallback을 설정할 수 있습니다. 업로드가 차단되지 않습니다(웹 검색 구성 간격과 동일한 철학). 파일을 계속 보낼 수 있지만 분석에는 구성이 필요합니다.당신이 할 수 있는 일
- 스크린샷 Q&A — 스크린샷을 붙여넣고 무엇이 잘못되었는지, 다음에는 무엇을 클릭해야 하는지 물어보세요.
- 6가지 도구 이미지 주석 — 자유형, 직사각형, 타원, 화살표, 텍스트 및 흐림 도구를 사용하여 내장 편집기에서 이미지나 스크린샷을 엽니다. 주석이 달린 이미지는 첨부 파일로 업로드되며 에이전트는 이를 다중 모드 입력으로 읽습니다.
- 지점 편집 요소 선택기 — HTML 아티팩트 미리 보기에서 선택기 모드를 전환하고 요소를 클릭합니다. Myrm은 CSS 선택기, DOM 탐색경로 및
outerHTML을 캡처한 다음 에이전트가 정확한 요소를 수정할 수 있도록 한 줄 명령을 입력할 수 있도록 합니다. - Select-to-AI 도구 모음 — 모나코 편집기에서 코드(수정 / 설명 / 최적화 / 설명)를 선택하거나 문서 미리 보기에서 텍스트(수정 / 설명 / 재작성)를 선택합니다. 아티팩트 ID 및 라인 범위를 포함한 선택 컨텍스트가 에이전트에 자동으로 전송됩니다.
- 시각적 승인 — 에이전트가 브라우저 또는 데스크톱 작업에 대한 권한을 요청하면 좌표가 강조 표시된 스크린샷에 작업 대상 위치가 정확히 표시되므로 전체 시각적 컨텍스트를 통해 승인하거나 거부할 수 있습니다.
- 비비전 기본 모델 — 비전 폴백이 이미지를 처리하는 동안 추론을 위해 저렴한 텍스트 모델을 사용합니다.
- 채널 이미지 — Telegram, Discord, iMessage 및 기타 채널은 이미지를 동일한 파이프라인으로 전달합니다.
- PDF 및 문서 — 스캔되었거나 이미지가 많은 PDF는 텍스트 추출이 드물 때 비전을 통해 라우팅될 수 있습니다.
- 에이전트 활성 작업 공간 비전 — 에이전트가 샌드박스(OCR, 영역 읽기, 두 이미지 비교)에 이미 있는 파일에 대해
vision_semantic_tool를 호출하고 픽셀 수준 차이에 대해vision_geometry_tool을 호출할 수 있도록 사전 빌드된 스킬인 **vision-toolkit**을 활성화합니다. 채팅에서 수동으로 다시 업로드할 필요가 없습니다. - 투명한 다운그레이드 배지 — 대체가 실행되면 채팅에
vision_backend:vlm(풀 비전 모델),native_video(모델이 비디오를 직접 읽음) 또는frame(FFmpeg 프레임 추출)이 표시됩니다.
상태 및 캐싱
대체 분석이 실행되는 동안 채팅에는 이미지 분석 중(또는 비디오 분석 중) 표시기가 표시됩니다. 완료되면 자동으로 지워집니다. 동일한 세션의 동일한 이미지는 콘텐츠 해시에 의해 캐시됩니다. 반복 업로드는 중복된 비전 API 호출을 트리거하지 않습니다.비동기 이미지 생성
에이전트에 이미지 생성 도구가 활성화되어 있고 자격 증명이 준비된 경우 “배너 그리기”라고 말해도 30~120초 동안 채팅이 차단되지 않습니다.- 에이전트는 백그라운드 작업을 대기열에 추가하고 즉시
task_id을 반환합니다. - ImageTaskCard는 실시간 진행 상황(SSE, 폴링 폴백 포함)과 함께 메시지 스레드에 나타납니다.
- 이미지가 렌더링되는 동안 채팅을 계속하거나 프롬프트를 수정하거나 다른 작업을 시작할 수 있습니다.
- 완성된 이미지가 카드에 나타나고 미디어 라이브러리로 흘러 들어갈 수 있습니다.
tasks.db에 기록되기 전에 AES-GCM으로 봉인됩니다. 백업 및 샌드박스 볼륨은 일반 텍스트 비밀을 저장하지 않습니다.
설정 → 모델(또는 에이전트의 도구 패널)에서 이미지 모델을 활성화하고 공급자를 선택합니다(LiteLLM을 통해 20개 이상, 자동 장애 조치 포함).
팁
- 많은 스크린샷을 보내는 경우 Vision Fallback을 위한 빠르고 비용 효율적인 모델을 구성하세요.
- 큰 이미지의 경우 Myrm은 비전 모델을 호출하기 전에 자동으로 압축합니다.
- 분석이 실패하면 명확한 오류 메시지가 표시됩니다. 나머지 메시지는 계속 처리됩니다.