OmniParser v2
Microsoft Research에서 개발하여 2025년 2월 v2.0 메이저 업데이트를 공개한 **OmniParser v2**는 컴퓨터 화면의 복잡한 그래픽 사용자 인터페이스(Graphical User Interface, GUI) 스크린샷을 기계가 이해할 수 있는 구조화된 픽셀 데이터로 정밀 변환하는 최첨단 비전 기반 UI 파싱 도구입니다. 사람이 모니터 화면의 버튼, 아이콘, 텍스트 상자를 눈으로 확인하고 마우스로 클릭하듯이, 대형 시각-언어 모델(Vision-Language Model, VLM)이 화면 객체의 위치와 의미를 완
Microsoft Research에서 개발하여 2025년 2월 v2.0 메이저 업데이트를 공개한 OmniParser v2는 컴퓨터 화면의 복잡한 그래픽 사용자 인터페이스(Graphical User Interface, GUI) 스크린샷을 기계가 이해할 수 있는 구조화된 픽셀 데이터로 정밀 변환하는 최첨단 비전 기반 UI 파싱 도구입니다. 사람이 모니터 화면의 버튼, 아이콘, 텍스트 상자를 눈으로 확인하고 마우스로 클릭하듯이, 대형 시각-언어 모델(Vision-Language Model, VLM)이 화면 객체의 위치와 의미를 완벽하게 인지할 수 있도록 돕는 일종의 시각적 번역기 역할을 수행합니다. OmniParser v2는 화면 내 개별 UI 요소의 경계 상자(Bounding Box)를 정확하게 검출하는 아이콘 탐지 모델(Icon Detection Model)과 각 요소의 시각적 아이콘이 상징하는 기능적 의미를 텍스트로 설명하는 아이콘 캡션 모델(Icon Captioning Model)이라는 두 가지 핵심 딥러닝 아키텍처의 유기적 결합으로 동작합니다. 이 파이프라인을 통해 입력된 단일 이미지 스크린샷은 각 요소의 상대 좌표, 클릭 가능 여부, 텍스트 라벨 및 시각적 기능 캡션이 포함된 구조화된 JSON 데이터로 손쉽게 자동 변환됩니다. 기존의 컴퓨터 조작 에이전트(GUI Agent) 구축 방식은 웹 브라우저의 문서 객체 모델(Document Object Model, DOM) 트리나 특정 사설 API에 과도하게 의존하는 한계를 지니고 있었습니다. 이로 인해 소스 코드가 공개되지 않은 전용 데스크톱 소프트웨어나 이미지 기반으로 렌더링되는 가상 데스크톱 환경에서는 버튼의 위치나 클릭 영역을 제대로 파악하지 못해 에이전트의 작동이 자주 중단되곤 했습니다. 자연어 처리 분야에서 GPT가 임베딩을 통해 복잡한 문맥을 이해하듯, OmniParser v2는 화면 픽셀 배열에서 클릭 가능한 모든 기하학적 객체를 추출하여 VLM이 즉시 조작할 수 있는 시각적 토큰으로 변환합니다. 특히 v2.0 버전은 이전 버전 대비 60% 이상 향상된 추론 처리 속도(Low Latency)를 달성하여 1초 미만의 지연 시간 내에 고해상도 화면을 실시간 분석해 냅니다. 또한 미세하게 작거나 복잡한 디자인의 아이콘을 정확하게 인식할 수 있도록 정교하게 개선된 비전 어텐션 데이터셋과 최적화된 바운딩 박스 회귀 알고리즘을 탑재함으로써 기존 OCR 중심 접근법의 고질적 한계였던 그래픽 아이콘 오인식 및 오작동 문제를 근본적으로 해결하였습니다. 이러한 픽셀 기반 UI 파싱 기술은 생명공학 및 다학제 연구 환경에서 오랜 기간 자동화의 사각지대에 놓여 있던 전용 전자실험노트(Electronic Lab Notebook, ELN) 및 바이오 연구 장비 제어 소프트웨어의 자동화 파이프라인 구축에 혁신적인 솔루션을 제공합니다. 예를 들어 폐쇄형 네이티브 Windows 기반으로 작동하는 3차원 공초점 현미경 제어 프로그램이나 자동화 액체 생체 처리 장치(Automated Liquid Handler) 소프트웨어의 경우 내부 API를 제공하지 않아 사람이 매번 직접 마우스로 수치 파라미터를 입력하고 촬영 버튼을 눌러야 했습니다. OmniParser v2를 기존 VLM 에이전트 및 컴퓨터 자동화 프레임워크인 OmniTool과 결합하면 화면 스크린샷 1장만으로도 1024x1024 이상의 고해상도 그래픽 인터페이스 내 클릭 대상 버튼 좌표와 수치 입력 폼의 위치를 95% 이상의 높은 정확도로 실시간 도출할 수 있습니다. 수집된 화면 좌표는 곧바로 마우스 클릭 및 키보드 이벤트로 변환되어 야간 혹은 대규모 바이오 스크리닝 실험 시 연구자의 개입 없이 다중 샘플 데이터 수집 절차를 완벽하게 자동 실행하는 데 기여합니다. 나아가 OmniParser v2는 단순한 스크린샷 파싱에 머무르지 않고 웹, 데스크톱, 모바일 앱을 아우르는 이종 플랫폼 간 교차 시스템 에이전트(Cross-Platform Agent) 오케스트레이션을 가능하게 합니다. PyTorch 기반으로 구현되어 단일 consumer GPU 환경에서도 빠른 패스 스루 추론이 가능하며, 텐서 기반 파이프라인 최적화를 통해 다양한 오픈소스 및 상용 LLM/VLM 프롬프트 체인과의 즉각적인 연결을 지원합니다. 연구개발 조직에서는 기존 오프라인 레거시 시스템을 수정하거나 고비용 API를 새로 개발할 필요 없이 OmniParser v2를 통해 모든 GUI 기반 소프트웨어를 지능형 에이전트의 작업 대상으로 손쉽게 통합할 수 있으므로, 디지털 전환 및 연구 데이터 수집 공정 전반의 생산성을 획기적으로 격상시킵니다.
💻 필요한 컴퓨터 사양
NVIDIA GPU 8GB+ 권장 (RTX 3060/4060 이상 실시간 추론), CPU 실행 가능 (단독 1장당 처리 시간 증가)
모델 가중치 약 3~5GB (Icon Detection + Captioning checkpoints), 전체 파이프라인 약 8GB
⚡ 설치법
### 4-1. Quick Start
```bash
git clone https://github.com/microsoft/OmniParser
cd OmniParser
conda create -n omni python=3.12 -y && conda activate omni
pip install -r requirements.txt
huggingface-cli download microsoft/OmniParser-v2.0 --local-dir weights
```
### 4-2. 상세 설치 및 기본 사용법
```bash
# 1. 저장소 복제 및 전용 환경 구축
git clone https://github.com/microsoft/OmniParser
cd OmniParser
conda create -n omni python=3.12 -y
conda activate omni
# 2. 의존성 패키지 설치
pip install -r requirements.txt
# 3. v2.0 공식 가중치 다운로드 (weights 폴더 지정)
huggingface-cli download microsoft/OmniParser-v2.0 --local-dir weights
```
```python
from utils import check_ocr_box, get_yolo_model, get_caption_model_processor
# 모델 및 프로세서 로드
yolo_model = get_yolo_model(model_path='weights/icon_detect/model.pt')
caption_model_processor = get_caption_model_processor(model_name="florence2", model_name_or_path="weights/icon_caption")
# 이미지 파싱 및 요소 좌표/캡션 획득
# (추론 실행 시 화면 내 인터랙션 가능한 모든 픽셀 좌표와 캡션 리스트 반환)
```🧬 바이오 활용
실험 장비 제어 레거시 SW 자동화**
API를 지원하지 않는 네이티브 Windows 현미경/스펙트로미터 소프트웨어 스크린샷 분석 → UI 버튼 좌표(1024x1024 해상도 1초 내 파싱) 및 수치 입력 필드 정밀 도출 후 마우스/키보드 자동 제어 연동
전자실험노트(ELN) 데이터 자동 입력 에이전트**
웹 기반/데스크톱 ELN 인터페이스에서 데이터 입력 폼 위치 및 저장 아이콘 자동 인식 → VLM 연동을 통한 최신 연구 결과 파싱 데이터 자동 전송 및 기록
대규모 무인 스크리닝 워크플로우**
다중 기기 모니터링 화면을 실시간 수집 및 분석 → 이상 상태 발생 알림 버튼 위치 자동 파악 및 경고 모듈 트리가 구동되는 자율 바이오 파이프라인 구축
📝 업데이트 노트
- vv.2.0.17/20/2026
OmniParser v2.0.1 버전에서는 보안 강화와 의존성 버전 수정, 그리고 문서 개선 작업이 진행되었습니다. 보안 업데이트를 통해 민감한 실험 데이터와 연구 자산을 더욱 안전하게 보호할 수 있게 되었습니다. 또한, 의존성 오류 수정으로 분석 파이프라인의 안정성과 실험 결과의 재현성을 높였으며, 개선된 문서를 통해 도구 활용도 한층 쉬워졌습니다.
🧪 관련 생명의 코드
관련된 생명의 코드 글이 아직 없습니다.