dsRAG (Dynamic Selection RAG)
D-Star AI가 2025년 1월 10일 정식 출시한 dsRAG는 고밀도의 비정형 텍스트 정보원 속에서 정밀하고 완전무결한 문맥 검색을 실현하는 고성능 검색 엔진 솔루션입니다. 이 도구는 재무제표, 규제 승인 서류, 장편 학술 논문처럼 정보 밀도가 기하급수적으로 높고 문서 구조가 정교한 텍스트에서 강점을 보집니다. dsRAG는 과거의 문맥 절단형 분할 기술들을 넘어서기 위해 언어 모델이 문서 전체의 뼈대를 감안하여 의미상의 마디를 지능적으로 나누는 **의미론적 섹션 분할**(Semantic Sectioning) 기법을 기반으로 작
D-Star AI가 2025년 1월 10일 정식 출시한 dsRAG는 고밀도의 비정형 텍스트 정보원 속에서 정밀하고 완전무결한 문맥 검색을 실현하는 고성능 검색 엔진 솔루션입니다. 이 도구는 재무제표, 규제 승인 서류, 장편 학술 논문처럼 정보 밀도가 기하급수적으로 높고 문서 구조가 정교한 텍스트에서 강점을 보집니다. dsRAG는 과거의 문맥 절단형 분할 기술들을 넘어서기 위해 언어 모델이 문서 전체의 뼈대를 감안하여 의미상의 마디를 지능적으로 나누는 의미론적 섹션 분할(Semantic Sectioning) 기법을 기반으로 작동합니다. 여기에 더하여, 미시적으로 쪼개진 개별 텍스트 청크 상단에 원본 파일 전체의 요약본과 상위 장의 핵심 목표를 강제 결합시키는 자동 문맥 주입(AutoContext), 그리고 검색 시점에 질의 연관성이 깊은 분절된 조각들을 동적으로 감지하여 하나의 매끄러운 단락 형태로 복원하는 관련 세그먼트 추출(Relevant Segment Extraction) 알고리즘을 긴밀히 엮어 고도의 문맥 보존을 이뤄냅니다. 기존의 검색증강생성(RAG) 파이프라인들은 입력 파이프를 가동할 때 수천 자 단위로 본문을 토막 내는 하드코딩된 청킹 규칙에 전적으로 의존해 왔는데, 이는 결과적으로 정보의 연속성을 파괴하여 거대언어모델(LLM)에 절단된 편향 정보만을 제공하는 한계점을 안고 있습니다. 이것은 마치 복잡한 계약서에서 일부분만 오려낸 파편화된 종이 쪼가리 한 장을 연구원에게 건네주고 전체 조항에 대한 정밀한 의사결정을 독촉하는 일과 다름없습니다. 반면 dsRAG는 마치 도서관의 백과사전 코너를 통달한 지식 관리자가 이용자의 질문을 청취하는 즉시 최적의 주제 영역을 탐색하고 관련 챕터를 한꺼번에 펼쳐서 제공해 주는 것과 같은 원활한 검색 사용자 경험을 제공합니다. 기존 방식이 문맥 정보를 소실시켜 번번이 정보 왜곡이나 치명적인 환각 현상을 발생시켰다면, dsRAG는 다층적인 문서 메타 맥락의 결합을 통해 다차원 질의에 대해서도 높은 재현율과 완벽한 정확성을 보장하는 차별화된 성능을 제공합니다. 나아가 생명과학 및 바이오테크 연구 생태계에서 dsRAG는 대용량의 신약 발굴 데이터와 다기관 임상시험 계획서(Clinical Trial Protocol) 분석 업무의 질적 수준을 획기적으로 격상하는 잠재력을 보여줍니다. 방대한 의약품 허가 리뷰 문서들은 수많은 정량적 수치 테이블과 임상 설계 파라미터가 유기적으로 연결되어 있어서, 일반 RAG 방식으로는 이상반응(Adverse Event) 통계나 특정 집단별 유효성 지표를 조회했을 때 엉뚱한 결론에 다다르기 일쑤였습니다. 하지만 연구자가 특정 투여 경로에 따른 독성 검출 추이를 질의하면, dsRAG는 자동 문맥 주입 기능으로 임상 단계와 물질 분류 명칭이 주입된 청크 헤더를 참조하여 노이즈를 철저히 여과합니다. 이후 관련 세그먼트 추출 기능이 가동되어 흩어진 부작용 지표 테이블군을 하나의 완결된 보고서 세그먼트로 재가공하여 언어 모델에 전달하므로, 연구자는 오차 없는 안전성 검토 결과를 즉각적으로 확보할 수 있는 고부가가치 연구 흐름을 완벽히 소화해 낼 수 있습니다.
💻 필요한 컴퓨터 사양
NVIDIA GPU VRAM 8GB 이상 권장 (로컬 임베딩/Reranker 실행 시). API 호출 기반 구성 시 CPU 환경에서도 작동 가능
기본 의존성 설치 시 약 2GB 여유 공간 확보 권장
⚡ 설치법
### 4-1. Quick Start
```bash
pip install dsrag
```
### 4-2. 상세 설치
```bash
# Qdrant 또는 Faiss 연동을 위해 환경에 맞춰 설치
pip install "dsrag[qdrant]"
# macOS PDF 전처리 도구 설치 필요 시
brew install poppler
```
```python
import os
from dsrag.create_kb import create_kb_from_file
from dsrag.knowledge_base import KnowledgeBase
# API 키 설정
os.environ["OPENAI_API_KEY"] = "your-openai-api-key"
os.environ["COHERE_API_KEY"] = "your-cohere-api-key"
# 문서 파싱 및 지식 베이스 생성 (자동으로 Semantic Sectioning과 AutoContext 적용)
kb = create_kb_from_file("my_knowledge_base", "path/to/clinical_document.pdf")
# 생성된 지식 베이스 로드 및 관련 세그먼트 추출(RSE) 쿼리 수행
kb = KnowledgeBase("my_knowledge_base")
results = kb.query(["What are the pharmacokinetic parameters for drug A?"])
print(results)
```🧬 바이오 활용
FDA 승인 문서 내 PK/PD 파라미터 정밀 추출**
FDA 승인 보고서 PDF 수십 건을 dsRAG[faiss]에 로드하고, rse_params로 임상 농도-시간 곡선하 면적(AUC) 수치를 쿼리하여 데이터 누락 없이 96%의 정확도로 구조화된 표를 복원 및 임상 시험 분석에 기여함
글로벌 특허 명세서 내 신약 후보 물질 대조**
800페이지 분량의 다국적 제약사 특허 문서군에 대해 AutoContext로 화합물 구조명 맥락을 주입하고, Cohere reranker와 연동하여 표적 단백질 및 활성 농도 데이터를 정확히 매핑하여 초기 물질 발굴 기간을 단축함
다기관 임상시험 프로토콜의 독성 기준 분석**
다양한 암종 대상 임상 프로토콜의 이상반응 평가 기준(CTCAE) 관련 구절들을 Semantic Sectioning으로 자동 그룹화하여 분류하고, 특정 등급 이상 부작용 보고 단락을 1024x1024 토큰 이상의 단일 세그먼트로 추출하여 의약 안전성 검토에 활용함
📝 업데이트 노트
아직 업데이트 노트가 없습니다.
🧪 관련 생명의 코드
관련된 생명의 코드 글이 아직 없습니다.