lift
lift**는 Datalab이 2026년 6월 18일 공개한 9B 규모의 문서 정보 추출 특화 비전 언어 모델(Vision-Language Model, VLM)이다. 사용자가 원하는 출력 구조를 JSON Schema로 정의하면 PDF와 이미지에서 해당 필드를 찾아 구조화된 JSON으로 반환한다. 일반적인 문서 OCR이 페이지를 글자들의 평면으로 읽는다면, lift는 JSON Schema를 설계도처럼 들고 문서 전체에서 각 칸에 들어갈 정보를 찾아 조립하는 방식에 가깝다. 여러 페이지에 분산되거나 페이지 경계를 넘어 이어지는 값도 단
lift는 Datalab이 2026년 6월 18일 공개한 9B 규모의 문서 정보 추출 특화 비전 언어 모델(Vision-Language Model, VLM)이다. 사용자가 원하는 출력 구조를 JSON Schema로 정의하면 PDF와 이미지에서 해당 필드를 찾아 구조화된 JSON으로 반환한다. 일반적인 문서 OCR이 페이지를 글자들의 평면으로 읽는다면, lift는 JSON Schema를 설계도처럼 들고 문서 전체에서 각 칸에 들어갈 정보를 찾아 조립하는 방식에 가깝다. 여러 페이지에 분산되거나 페이지 경계를 넘어 이어지는 값도 단일 처리 과정에서 다루도록 설계됐으며, Hugging Face 기반 로컬 추론, vLLM 서버, 명령줄 인터페이스와 Schema Studio를 통한 사용 경로를 제공한다. 기존 문서 처리 파이프라인은 OCR, 레이아웃 분석, 필드별 규칙, 후처리 검증을 각각 연결해야 하는 경우가 많다. 양식이 조금만 달라져도 정규식이나 좌표 규칙을 다시 작성해야 하고, 범용 생성 모델을 곧바로 사용하면 문서에 없는 값을 그럴듯하게 채우는 환각(Hallucination)이 데이터베이스로 유입될 위험도 있다. lift의 차별점은 출력 계약을 JSON Schema로 명시하고, 누락된 필드를 임의로 생성하지 않도록 학습된 문서 추출 특화 모델이라는 점이다. 따라서 추출 결과를 다시 키 이름에 맞춰 변환하는 중간 코드를 줄이고, 자체 호스팅이 필요한 연구기관이나 기업이 원문 문서를 외부 API로 보내지 않는 배포 구성을 검토할 수 있다. 생명과학 연구에서는 논문 부록, 분석 성적서, 실험 기록지처럼 구조는 유사하지만 서식이 제각각인 자료를 정규화하는 데 활용할 수 있다. 예를 들어 연구자는 샘플 ID, 실험 조건, 측정값, 단위와 페이지 근거를 JSON Schema에 정의한 뒤 다중 페이지 PDF를 처리하고, 반환된 JSON을 pandas 또는 데이터베이스 적재 단계로 전달할 수 있다. 특정 필드가 문서에 없을 때 추정값을 생성하지 않는 동작은 누락과 실제 음성 결과를 구분해야 하는 품질관리 과정에서 특히 중요하다. 다만 추출 정확도, 지원 가능한 페이지 수와 이미지 해상도, 스키마 복잡도 제한 및 필드별 근거 좌표 제공 여부는 입력 정보만으로 확인되지 않았으므로 운영 도입 전에 공식 문서와 대표 문서 세트로 검증해야 한다. 또한 임상시험 보고서나 바이오 제조 품질 문서에서는 여러 페이지에 흩어진 로트 번호, 시험법, 허용 기준과 결과를 하나의 레코드로 묶는 초기 데이터화 단계에 적용할 수 있다. vLLM 서버로 모델을 제공하면 내부 애플리케이션이 공통 추론 엔드포인트를 사용할 수 있고, Schema Studio는 추출 스키마를 설계하고 시험하는 인터페이스로 활용할 수 있다. 그러나 Modified OpenRAIL-M 모델 라이선스의 사용 제한, 민감 문서 처리 시 로그·캐시 정책, 정량 성능과 하드웨어 요구량은 공식 원문 재검토가 필요하다. 따라서 lift의 출력은 자동 확정값보다는 원문 대조와 필드별 검증 규칙을 거치는 후보 데이터로 다루는 것이 적절하다.
💻 필요한 컴퓨터 사양
공식 최소·권장 용량 및 지원 정밀도 확인 필요
모델 가중치와 런타임을 포함한 공식 요구량 확인 필요
⚡ 설치법
### 4-1. Quick Start
공식 GitHub 또는 Hugging Face 문서에 기재된 설치 명령을 재확인해야 한다. 입력 정보에는 검증 가능한 패키지명과 명령이 포함되지 않아 임의의 설치 명령을 작성하지 않았다.
### 4-2. 상세 설치
Hugging Face 로컬 추론, vLLM 서버, CLI와 Schema Studio가 지원되는 것으로 수집됐으나 각 방식의 정확한 설치 명령, 모델 식별자, 의존성 버전 및 실행 인자는 공식 문서 확인 후 추가해야 한다.🧬 바이오 활용
🔬 실험 보고서 메타데이터 정규화**
샘플 ID·세포주·처리 농도·시간·측정값·단위를 JSON Schema로 지정해 여러 페이지의 PDF를 JSON으로 변환하고 pandas 검증 규칙과 연결한다. 정량 정확도와 처리 속도는 공개 원문 재확인 및 자체 평가가 필요하다.
🧬 논문 부록 데이터베이스 구축**
PDF와 표 이미지에서 유전자명·질환명·코호트 크기·효과량을 추출한 뒤 관계형 데이터베이스나 검색 인덱스로 전달한다. 누락 필드는 생성하지 않는 정책을 활용하되, 원문 페이지 대조와 필드별 품질 검사를 후속 단계로 둔다.
🧪 품질 문서 필드 통합**
다중 페이지 분석 성적서에서 로트 번호·시험법·규격·결과·판정을 단일 JSON 레코드로 묶어 LIMS 연동 후보 데이터를 만든다. vLLM 서버 배포를 검토하고, 확정 전 원문 검수와 규제 요건에 맞는 감사 추적을 별도로 적용한다.
📝 업데이트 노트
아직 업데이트 노트가 없습니다.
🧪 관련 생명의 코드
관련된 생명의 코드 글이 아직 없습니다.