> ## Documentation Index
> Fetch the complete documentation index at: https://docs.myrmagent.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 비전 및 이미지 이해

> 기본 모델이 비전을 지원하지 않는 경우에도 에이전트에 이미지를 보냅니다.

# 비전 및 이미지 이해

Myrm을(를) 사용하면 채팅, 채널 및 데스크톱 업로드에 이미지를 첨부할 수 있습니다. **주 모델이 비전을 지원하지 않는** 경우 Myrm은 **비전 폴백** 모델을 통해 이미지를 자동으로 라우팅하고 텍스트 설명을 삽입하므로 수동으로 모델을 전환할 필요가 없습니다.

## 작동 방식

1. WebUI에 파일(이미지, PDF, 문서, 비디오, 오디오, 코드)을 붙여넣거나 끌거나 첨부합니다(또는 지원되는 채널에서 파일을 보냅니다).
2. Myrm은(는) 선택한 기본 모델이 비전(`supports_vision`)을 지원하는지 확인합니다.
3. **그렇다면** - 이미지가 기본 다중 모드 블록으로 기본 모델에 전송됩니다.
4. **아니요** — Myrm은 실시간 **“이미지 분석 중…”** 상태를 표시하고 구성된 **Vision Fallback** 모델을 호출하고 이미지를 간결한 텍스트 설명으로 바꾼 다음 기본 모델과의 대화를 계속합니다.

**비디오**에도 동일한 파이프라인이 적용됩니다. 기본 비디오 지원 모델은 파일을 직접 수신합니다. 다른 사람들은 프레임 추출과 비전 분석을 얻습니다.

## 설정

1. **설정 → 모델**을 엽니다.
2. **기본** 채팅 모델(모든 제공자)을 선택하세요.
3. **Vision Fallback**을 비전 지원 모델(예: GPT-4o, Gemini Flash, Qwen-VL)로 설정합니다.
4. **비전 체인 테스트**를 클릭하여 전체 순서 폴백 체인을 확인합니다(실패 시 `resolved_model` 및 엔드포인트 표시).
5. 기본 모델이 텍스트 전용이고 대체가 설정되지 않은 경우 Myrm에서는 **이 모델 사용**을 제공할 수 있습니다. 한 번의 클릭으로 활성화된 제공업체에서 첫 번째 비전 지원 모델을 선택할 수 있습니다.
6. 선택 사항: 기본 모델이 텍스트 전용이지만 `.mp4` 파일을 업로드하는 경우 **비디오 폴백**을 별도로 설정합니다. Myrm은 프레임 추출로 폴백하기 전에 해당 슬롯을 통해 비디오 분석을 라우팅합니다.
7. 선택 사항: 모델 선택기의 기능 아이콘을 사용합니다. 눈 아이콘이 있는 모델은 기본적으로 시력을 지원합니다.

Myrm은 LiteLLM 및 models.dev를 통해 모델 기능을 자동 감지합니다. 필요한 경우 모델 카드에서 모델별로 재정의할 수 있습니다.

## Vision이 구성되지 않은 경우

이미지나 동영상을 첨부했지만 기본 모델이나 Vision Fallback 모두 이를 분석할 수 없는 경우 Myrm에서는 **설정으로 이동**을 통해 **경고 토스트**를 표시합니다. **설정 → 모델 → 기본값**에 대한 딥 링크를 통해 한 번의 클릭으로 Vision Fallback을 설정할 수 있습니다. 업로드가 차단되지 않습니다(웹 검색 구성 간격과 동일한 철학). 파일을 계속 보낼 수 있지만 분석에는 구성이 필요합니다.

## 당신이 할 수 있는 일

* **스크린샷 Q\&A** — 스크린샷을 붙여넣고 무엇이 잘못되었는지, 다음에는 무엇을 클릭해야 하는지 물어보세요.
* **6가지 도구 이미지 주석** — 자유형, 직사각형, 타원, 화살표, 텍스트 및 흐림 도구를 사용하여 내장 편집기에서 이미지나 스크린샷을 엽니다. 주석이 달린 이미지는 첨부 파일로 업로드되며 에이전트는 이를 다중 모드 입력으로 읽습니다.
* **지점 편집 요소 선택기** — HTML 아티팩트 미리 보기에서 선택기 모드를 전환하고 요소를 클릭합니다. Myrm은 CSS 선택기, DOM 탐색경로 및 `outerHTML`을 캡처한 다음 에이전트가 정확한 요소를 수정할 수 있도록 한 줄 명령을 입력할 수 있도록 합니다.
* **Select-to-AI 도구 모음** — 모나코 편집기에서 코드(수정 / 설명 / 최적화 / 설명)를 선택하거나 문서 미리 보기에서 텍스트(수정 / 설명 / 재작성)를 선택합니다. 아티팩트 ID 및 라인 범위를 포함한 선택 컨텍스트가 에이전트에 자동으로 전송됩니다.
* **시각적 승인** — 에이전트가 브라우저 또는 데스크톱 작업에 대한 권한을 요청하면 좌표가 강조 표시된 스크린샷에 작업 대상 위치가 정확히 표시되므로 전체 시각적 컨텍스트를 통해 승인하거나 거부할 수 있습니다.
* **비비전 기본 모델** — 비전 폴백이 이미지를 처리하는 동안 추론을 위해 저렴한 텍스트 모델을 사용합니다.
* **채널 이미지** — Telegram, Discord, iMessage 및 기타 채널은 이미지를 동일한 파이프라인으로 전달합니다.
* **PDF 및 문서** — 스캔되었거나 이미지가 많은 PDF는 텍스트 추출이 드물 때 비전을 통해 라우팅될 수 있습니다.
* **에이전트 활성 작업 공간 비전** — 에이전트가 샌드박스(OCR, 영역 읽기, 두 이미지 비교)에 이미 있는 파일에 대해 `vision_semantic_tool`를 호출하고 픽셀 수준 차이에 대해 `vision_geometry_tool`을 호출할 수 있도록 사전 빌드된 스킬인 \*\*`vision-toolkit`\*\*을 활성화합니다. 채팅에서 수동으로 다시 업로드할 필요가 없습니다.
* **투명한 다운그레이드 배지** — 대체가 실행되면 채팅에 `vision_backend`: `vlm`(풀 비전 모델), `native_video`(모델이 비디오를 직접 읽음) 또는 `frame`(FFmpeg 프레임 추출)이 표시됩니다.

## 상태 및 캐싱

대체 분석이 실행되는 동안 채팅에는 **이미지 분석 중**(또는 **비디오 분석 중**) 표시기가 표시됩니다. 완료되면 자동으로 지워집니다.

동일한 세션의 동일한 이미지는 **콘텐츠 해시에 의해 캐시**됩니다. 반복 업로드는 중복된 비전 API 호출을 트리거하지 않습니다.

## 비동기 이미지 생성

에이전트에 **이미지 생성** 도구가 활성화되어 있고 자격 증명이 준비된 경우 "배너 그리기"라고 말해도 30\~120초 동안 채팅이 차단되지 **않습니다**.

1. 에이전트는 백그라운드 작업을 대기열에 추가하고 즉시 `task_id`을 반환합니다.
2. **ImageTaskCard**는 실시간 진행 상황(SSE, 폴링 폴백 포함)과 함께 메시지 스레드에 나타납니다.
3. 이미지가 렌더링되는 동안 채팅을 계속하거나 프롬프트를 수정하거나 다른 작업을 시작할 수 있습니다.
4. 완성된 이미지가 카드에 나타나고 미디어 라이브러리로 흘러 들어갈 수 있습니다.

**보안(클라우드 및 데스크톱):** API 키와 게이트웨이 토큰은 작업이 로컬 `tasks.db`에 기록되기 전에 **AES-GCM으로 봉인됩니다**. 백업 및 샌드박스 볼륨은 일반 텍스트 비밀을 저장하지 않습니다.

**설정 → 모델**(또는 에이전트의 도구 패널)에서 이미지 모델을 활성화하고 공급자를 선택합니다(LiteLLM을 통해 20개 이상, 자동 장애 조치 포함).

## 팁

* 많은 스크린샷을 보내는 경우 Vision Fallback을 위한 **빠르고 비용 효율적인** 모델을 구성하세요.
* 큰 이미지의 경우 Myrm은 비전 모델을 호출하기 전에 자동으로 압축합니다.
* 분석이 실패하면 명확한 오류 메시지가 표시됩니다. 나머지 메시지는 계속 처리됩니다.

## 관련된

* [모델 구성](/docs/guides/model-configuration) — 슬롯, 라우팅 및 API 키
* [음성 상호작용](/docs/guides/voice-interaction) — 오디오 및 비디오 메시지 전사
* [브라우저 자동화](/docs/guides/browser-automation) — 비전 지원 페이지 확인
