OmniParser (OmniParser v2)
마이크로소프트 리서치(Microsoft Research)**가 2025년 2월에 발표한 OmniParser v2는 컴퓨터 화면 스크린샷을 기계가 읽을 수 있는 정형화된 데이터로 변환해 주는 범용 스크린 파싱(Screen Parsing) 도구입니다. 기존 대형 비전 언어 모델(Vision Language Model, VLM)들이 컴퓨터 화면 이미지만을 보고 마우스 클릭 좌표를 정확하게 계산하지 못해 겪던 위치 오차 문제를 근본적으로 해결하기 위해 개발되었습니다. 대규모 언어 모델(Large Language Model)이 자연어 텍스트
마이크로소프트 리서치(Microsoft Research)가 2025년 2월에 발표한 OmniParser v2는 컴퓨터 화면 스크린샷을 기계가 읽을 수 있는 정형화된 데이터로 변환해 주는 범용 스크린 파싱(Screen Parsing) 도구입니다. 기존 대형 비전 언어 모델(Vision Language Model, VLM)들이 컴퓨터 화면 이미지만을 보고 마우스 클릭 좌표를 정확하게 계산하지 못해 겪던 위치 오차 문제를 근본적으로 해결하기 위해 개발되었습니다. 대규모 언어 모델(Large Language Model)이 자연어 텍스트를 토큰(Token)으로 쪼개어 정밀하게 처리하듯, OmniParser v2는 화면 속의 모든 그래픽 요소를 기하학적 좌표와 기능 설명이 매핑된 독립된 시각적 토큰으로 분할하여 처리합니다. 내부적으로는 화면 상의 모든 대화형 객체를 탐지하는 객체 인식(Object Detection) 모델과 탐지된 아이콘의 역할을 자연어로 설명해 주는 아이콘 캡셔닝(Icon Captioning) 모델을 이중 구조(Dual-stage Architecture)로 통합하여 완벽한 화면 해독 능력을 구현했으며, 이를 통해 다양한 운영체제 인터페이스 상에서의 에이전트 오동작률을 획기적으로 낮추었습니다. 기존의 스크린 제어 방식은 주로 애플리케이션 내부의 소스 코드나 웹 브라우저의 문서 객체 모델(Document Object Model, DOM) 트리에 전적으로 의존해 왔기 때문에, 소스 코드가 감추어진 폐쇄형 소프트웨어나 모바일 앱, 가상 머신 환경에서는 자동화 시나리오를 설계하기가 불가능에 가까웠습니다. 반면 OmniParser v2는 별도의 내부 시스템 API나 코드 소스 지원 없이 오직 화면 픽셀(Pixel) 값만을 기반으로 버튼, 입력 창, 체크박스 등의 위치를 밀리초 단위로 파악해 냅니다. 이 도구는 시각적 객체 경계 상자(Bounding Box) 탐지 기술을 극대화하여 해상도 변화나 윈도우 창 크기 변경 등의 환경 변수에도 왜곡 없이 실시간(Real-time)으로 대응합니다. 특히 아이콘의 시각적 형태를 파악한 뒤 세부 기능 묘사(Functional Description)를 텍스트로 보완함으로써 비전 언어 모델이 마우스 클릭 영역을 빗나가지 않도록 완벽하게 가이드하며, 웹사이트가 개편되거나 UI 레이아웃이 변경되어도 시각적 특징만으로 요소를 포착하여 중단 없는 자동화를 지속시킵니다. 실제 생명공학 연구 현장에서는 유전자 서열 분석이나 단백질 구조 시각화 과정에서 웹 브라우저와 로컬 레거시(Legacy) 분석 프로그램을 동시에 조작해야 하는 번거로운 GUI 반복 작업이 자주 일어납니다. OmniParser v2를 Windows 11 제어용 도구 모음인 OmniTool 및 고성능 시각 모델과 연동하면 단백질 구조 설계 자동화 파이프라인을 구축할 수 있습니다. 예를 들어, 1920x1080 크기의 분석 프로그램 화면 스크샷을 YOLOv9-E 기반 탐지기에 전달하면 화면 상의 수십 개 미세 단백질 렌더링 옵션 버튼들이 평균 1~2초 내에 탐지 완료됩니다. 이후 탐지된 타겟 클릭 지점 데이터를 바탕으로 자동화 에이전트가 단백질 데이터베이스(RCSB PDB)에서 표적 단백질을 자동으로 검색 및 선택하고, 다운로드된 분자 도킹(Molecular Docking) 데이터 파일을 열어 특정 활성 부위(Active Site)를 선점하는 마우스 조작을 실수 없이 정량적으로 수행함으로써 연구자들의 데이터 획득 시간과 분석 생산성을 극대화합니다.
💻 필요한 컴퓨터 사양
NVIDIA GPU 8GB 이상 권장 (YOLOv9-E 및 Florence-2 모델 로컬 추론 시 필수, RTX 3060 이상 권장), CPU 사용 시 단일 스크린샷 처리에 약 10~60초 소요
약 2GB (모델 체크포인트 포함 전체 패키지 설치용)
⚡ 설치법
### 4-1. Quick Start
git clone https://github.com/microsoft/OmniParser.git
cd OmniParser
conda create -n "omni" python==3.12 -y && conda activate omni
pip install -r requirements.txt
### 4-2. 상세 설치
# YOLOv9-E 검출기 가중치 다운로드 (Hugging Face PR #37 반영)
huggingface-cli download microsoft/OmniParser-v2.0 icon_detect_v3/model.pt --revision refs/pr/37 --local-dir weights
# Florence-2 캡션 가중치 다운로드 및 폴더 정리
for f in icon_caption/{config.json,generation_config.json,model.safetensors}; do \
huggingface-cli download microsoft/OmniParser-v2.0 "$f" --local-dir weights; \
done
mv weights/icon_caption weights/icon_caption_florence
# Gradio 데모 실행을 통해 웹 인터페이스에서 시각화 동작 테스트
python gradio_demo.py🧬 바이오 활용
🔬 웹 기반 PDB 분자 검색 및 분석 자동화
OmniParser v2(YOLOv9-E) + Claude 3.5 Sonnet 조합으로 RCSB PDB 웹사이트에서 특정 표적 단백질 ID 입력 및 3D 뷰어 조작 과정을 100% 시각적으로 추적하여 5초 이내에 활성 부위(Active Site) 정보 추출 및 캡처 자동화 → 가상 스크리닝 파이프라인의 전처리 고속화
🧬 대규모 서열 정렬 도구 ClustalW의 GUI 자동 제어
로컬 유전자 분석 프로그램(BioEdit) 화면에서 OmniParser v2(1920x1080)와 Windows VM 제어 툴킷(OmniTool)을 결합하여 서열 200건 로드, 파라미터 세팅(Gap Open Penalty=10.0), 실행 버튼 클릭까지 일련의 시각 기반 마우스 이벤트를 오차 범위 2픽셀 이내로 완벽히 자동 대행 → 서열 분석의 연구원 수작업 공수 90% 이상 제거
🏥 임상 시험 환자 매칭용 EMR 시스템 자율 검색
웹 EMR 솔루션의 복잡한 탭 UI 환경에서 OmniParser v2의 아이콘 캡셔닝(Florence-2) 기능을 활용해 "환자 기록 조회" 버튼과 "검색 필드"를 오인하지 않고 정확히 식별(Click Accuracy 95%+), 환자 질병 코드 및 바이오마커 정보 자동 입력 및 매칭 진행 → 정밀 임상 매칭 산업의 데이터 수집 자동화 기여
📝 업데이트 노트
아직 업데이트 노트가 없습니다.
🧪 관련 생명의 코드
관련된 생명의 코드 글이 아직 없습니다.