LightRAG
LightRAG는 홍콩대학교 데이터 지능 연구실(HKU Data Intelligence Lab)에서 2024년 10월 공개한 경량화 지식 그래프 기반 검색 증강 생성(Retrieval-Augmented Generation) 프레임워크입니다. 마치 기존 대형 언어 모델이 개별 문맥 내 텍스트 관계를 파악하듯, LightRAG는 대규모 문헌 집합 전체를 거미줄 형태의 지식 그래프(Knowledge Graph)와 고차원 벡터 임베딩(Vector Embedding)으로 통합 구조화하여 단절된 정보 조각을 유기적으로 연결합니다. 문서
LightRAG는 홍콩대학교 데이터 지능 연구실(HKU Data Intelligence Lab)에서 2024년 10월 공개한 경량화 지식 그래프 기반 검색 증강 생성(Retrieval-Augmented Generation) 프레임워크입니다. 마치 기존 대형 언어 모델이 개별 문맥 내 텍스트 관계를 파악하듯, LightRAG는 대규모 문헌 집합 전체를 거미줄 형태의 지식 그래프(Knowledge Graph)와 고차원 벡터 임베딩(Vector Embedding)으로 통합 구조화하여 단절된 정보 조각을 유기적으로 연결합니다. 문서에서 추출된 엔티티(Entity)와 이들 간의 관계(Relation)를 키-값(Key-Value) 구조와 벡터 DB에 이중으로 저장함으로써, 단일 질문에 대해 국소적인 세부 사실부터 전역적인 맥락까지 종합적으로 파악할 수 있는 차세대 RAG 엔진입니다.
기존의 단순 벡터 검색 방식은 관련 키워드가 포함된 문단 파편을 잘 찾아내지만, 여러 문서에 흩어져 있는 복합 정보를 연결해야 하는 다단계 추론(Multi-hop Reasoning) 질문에 취약한 한계를 가지고 있었습니다. 마이크로소프트의 GraphRAG 등 기존 그래프 RAG 솔루션은 이러한 한계를 극복하려 했으나, 인덱싱 과정에서 막대한 대형 언어 모델(LLM) API 토큰 비용과 지연시간이 발생하고 새 문서가 추가될 때마다 전체 그래프를 처음부터 재구축해야 하는 치명적인 비효율성이 존재했습니다. LightRAG는 이중 수준 검색(Dual-level Retrieval) 알고리즘을 도입하여 세부 엔티티 추론(Low-level)과 고차원 개념 문맥(High-level) 검색을 선별적으로 수행하고, 실시간 증분 업데이트(Incremental Update) 구조를 통해 전체 그래프의 재구축 없이 신규 문서만을 빠르게 반영하여 컴퓨팅 비용을 획기적으로 절감했습니다.
생명과학 및 의약학 연구 환경에서 LightRAG는 수만 편의 학술 논문, 특허 문서, 임상시험 보고서에 숨겨진 복합적 생물학적 메커니즘을 탐색하는 데 탁월한 성능을 발휘합니다. 유전자-단백질-질환-표적 약물 간의 다중 상호작용 네트워크를 자동으로 추출하고 지식 그래프로 변환하여, 기존 검색 엔진으로는 식별하기 어려운 "특정 타깃 단백질을 억제할 때 나타나는 신호 전달 경로의 부작용 및 관련 임상 연구"와 같은 고난도 질의에 정밀하고 출처 추적이 가능한 답변을 제시합니다. 연구자는 기존 데이터베이스 전체를 다시 인덱싱할 필요 없이 새로 발표된 바이오 논문 PDF나 연구 노트를 실시간으로 동기화하여 최신 학술 지식을 즉각적으로 분석 파이프라인에 통합할 수 있습니다.
또한 LightRAG는 단순한 텍스트 분석에 머물지 않고 RAG-Anything 파이프라인과의 결합을 통해 이미지, 분자 구조 표, 수식 등이 포함된 멀티모달(Multimodal) 문서 처리로 영역을 확장했습니다. Neo4j, MongoDB, PostgreSQL, OpenSearch 등 다양한 정규 그래프 및 벡터 데이터베이스 백엔드를 유연하게 지원하며, 로컬 오픈소스 LLM(Qwen, Llama 등)부터 클라우드 API까지 광범위하게 연동됩니다. 빠른 속도와 경량화된 아키텍처 덕분에 단일 로컬 워크스테이션부터 엔터프라이즈급 멀티 노드 서버 환경에 이르기까지 비용 효율적이면서도 강력한 지식 탐색 엔진을 구축할 수 있습니다.
💻 필요한 컴퓨터 사양
CPU 단독 실행 가능 (로컬 임베딩/LLM 미사용 시 VRAM 0GB). 로컬 LLM(7B-14B) 사용 시 8GB~24GB GPU 권장
라이브러리 및 WebUI 1GB 미만 (벡터 DB 및 Neo4j 저장소 용량은 인덱싱 문서 크기에 비례)
⚡ 설치법
4-1. Quick Start
uv를 이용한 커맨드라인 패키지 설치 및 서버 실행uv tool install "lightrag-hku[api]"
또는 pip 사용pip install "lightrag-hku[api]"
서버 실행 (기본 포트 9621)lightrag-server
4-2. 상세 설치
GitHub 소스 코드 클론git clone https://github.com/HKUDS/LightRAG.git cd LightRAG
uv 기반 가상환경 구축 및 의존성 설치uv sync --extra test --extra offline source .venv/bin/activate
WebUI 프론트엔드 빌드cd lightrag_webui bun install --frozen-lockfile bun run build cd ..
환경 설정 (.env) 생성 및 수정cp env.example .env
.env 파일 내 LLM_BINDING, EMBEDDING_BINDING, API 키 설정 LightRAG API & WebUI 서버 실행lightrag-server
FAQ
LightRAG은(는) 무엇인가요?
LightRAG는 홍콩대학교 데이터 지능 연구실(HKU Data Intelligence Lab)에서 2024년 10월 공개한 경량화 지식 그래프 기반 검색 증강 생성(Retrieval-Augmented Generation) 프레임워크입니다. 마치 기존 대형 언어 모델이 개별 문맥 내 텍스트 관계를 파악하듯, LightRAG는 대규모 문헌 집합 전체를 거미줄 형태의 지식 그래프(Knowledge Graph)와 고차원 벡터 임베딩(Vector Embedding)으로 통합 구조화하여 단절된 정보 조각을 유기적으로 연결합니다. 문서에서 추출된 엔티티(Entity)와 이들 간의 관계(Relation)를 키-값(Key-Value) 구조와 벡터 DB에 이중으로 저장함으로써, 단일 질문에 대해 국소적인 세부 사실부터 전역적인 맥락까지 종합적으로 파악할 수 있는 차세대 RAG 엔진입니다. 기존의 단순 벡터 검색 방식은 관련 키워드가 포함된 문단 파편을 잘 찾아내지만, 여러 문서에 흩어져 있는 복합 정보를 연결해야 하는 다단계 추론(Multi-hop Reasoning) 질문에 취약한 한계를 가지고 있었습니다. 마이크로소프트의 GraphRAG 등 기존 그래프 RAG 솔루션은 이러한 한계를 극복하려 했으나, 인덱싱 과정에서 막대한 대형 언어 모델(LLM) API 토큰 비용과 지연시간이 발생하고 새 문서가 추가될 때마다 전체 그래프를 처음부터 재구축해야 하는 치명적인 비효율성이 존재했습니다. LightRAG는 이중 수준 검색(Dual-level Retrieval) 알고리즘을 도입하여 세부 엔티티 추론(Low-level)과 고차원 개념 문맥(High-level) 검색을 선별적으로 수행하고, 실시간 증분 업데이트(Incremental Update) 구조를 통해 전체 그래프의 재구축 없이 신규 문서만을 빠르게 반영하여 컴퓨팅 비용을 획기적으로 절감했습니다. 생명과학 및 의약학 연구 환경에서 LightRAG는 수만 편의 학술 논문, 특허 문서, 임상시험 보고서에 숨겨진 복합적 생물학적 메커니즘을 탐색하는 데 탁월한 성능을 발휘합니다. 유전자-단백질-질환-표적 약물 간의 다중 상호작용 네트워크를 자동으로 추출하고 지식 그래프로 변환하여, 기존 검색 엔진으로는 식별하기 어려운 "특정 타깃 단백질을 억제할 때 나타나는 신호 전달 경로의 부작용 및 관련 임상 연구"와 같은 고난도 질의에 정밀하고 출처 추적이 가능한 답변을 제시합니다. 연구자는 기존 데이터베이스 전체를 다시 인덱싱할 필요 없이 새로 발표된 바이오 논문 PDF나 연구 노트를 실시간으로 동기화하여 최신 학술 지식을 즉각적으로 분석 파이프라인에 통합할 수 있습니다. 또한 LightRAG는 단순한 텍스트 분석에 머물지 않고 RAG-Anything 파이프라인과의 결합을 통해 이미지, 분자 구조 표, 수식 등이 포함된 멀티모달(Multimodal) 문서 처리로 영역을 확장했습니다. Neo4j, MongoDB, PostgreSQL, OpenSearch 등 다양한 정규 그래프 및 벡터 데이터베이스 백엔드를 유연하게 지원하며, 로컬 오픈소스 LLM(Qwen, Llama 등)부터 클라우드 API까지 광범위하게 연동됩니다. 빠른 속도와 경량화된 아키텍처 덕분에 단일 로컬 워크스테이션부터 엔터프라이즈급 멀티 노드 서버 환경에 이르기까지 비용 효율적이면서도 강력한 지식 탐색 엔진을 구축할 수 있습니다.
LightRAG은(는) 언제 사용하나요?
LightRAG는 홍콩대학교 데이터 지능 연구실(HKU Data Intelligence Lab)에서 2024년 10월 공개한 경량화 지식 그래프 기반 검색 증강 생성(Retrieval-Augmented Generation) 프레임워크입니다. 마치 기존 대형 언어 모델이 개별 문맥 내 텍스트 관계를 파악하듯, LightRAG는 대규모 문헌 집합 전체를 거미줄 형태의 지식 그래프(Knowledge Graph)와 고차원 벡터 임베딩(Vector Embedding)으로 통합 구조화하여 단절된 정보 조각을 유기적으로 연결합니다. 문서
📝 업데이트 노트
아직 업데이트 노트가 없습니다.
🧪 관련 생명의 코드
관련된 생명의 코드 글이 아직 없습니다.