AI Tools
RAG初級

lift

liftは、Datalabが2026年6月18日に公開した、9Bパラメータの文書情報抽出に特化したビジョン言語モデル(Vision-Language Model、VLM)である。ユーザーが希望する出力構造をJSONスキーマで定義すると、PDFや画像から該当するフィールドを抽出し、構造化されたJSONとして返す。一般的な文書OCRがページを文字の平面として読み込むのに対し、liftはJSONスキーマを設計図のように扱い、文書全体から各セルに入る情報を探し出して組み立てるという点で異なる。複数のページに分散していたり、ページ境界を越えて連続している値も抽出できる。

liftは、Datalabが2026年6月18日に公開した、90億パラメータ規模の文書情報抽出に特化したビジョン言語モデル(Vision-Language Model、VLM)である。ユーザーがJSON Schemaで定義した出力構造に基づいて、PDFや画像から該当するフィールドを抽出し、構造化されたJSON形式で返す。一般的な文書OCRがページを文字の平面として読み込むのに対し、liftはJSON Schemaを設計図のように扱い、文書全体から各フィールドに含める情報を探し出し、組み立てるという点で異なる。複数のページに分散していたり、ページ境界を越えて連続している値も、単一の処理プロセスで扱えるように設計されており、Hugging Faceベースのローカル推論、vLLMサーバー、コマンドラインインターフェース、およびSchema Studioを通じた利用方法が提供されている。

従来の文書処理パイプラインでは、OCR、レイアウト分析、フィールドごとのルール、後処理検証をそれぞれ接続する必要がある場合が多い。フォームが少しでも異なると、正規表現や座標ルールを再作成する必要があり、汎用的な生成モデルをそのまま使用すると、文書に存在しない値をそれらしく補完する幻覚(Hallucination)がデータベースに流入するリスクもある。liftの特長は、出力契約をJSON Schemaで明示し、欠落したフィールドを任意に生成しないように学習された、文書抽出に特化したモデルである点にある。したがって、抽出結果をキー名に合わせて変換する中間コードを減らし、自己ホストが必要な研究機関や企業が、元の文書を外部APIに送信しないデプロイ構成を検討できる。

生命科学研究では、論文の付録、分析成績書、実験記録など、構造は類似しているが書式がそれぞれ異なる資料を正規化するために活用できる。例えば、研究者はサンプルID、実験条件、測定値、単位、およびページ根拠をJSON Schemaに定義した後、複数ページのPDFを処理し、返されたJSONをpandasまたはデータベースのロード段階に渡すことができる。特定のフィールドが文書に存在しない場合に推定値を生成しないという動作は、欠落と実際の陰性結果を区別する必要がある品質管理の過程で特に重要である。ただし、抽出精度、サポート可能なページ数と画像解像度、スキーマの複雑さの制限、およびフィールドごとの根拠座標の提供の有無は、入力情報だけでは確認できないため、運用導入前に公式ドキュメントと代表的な文書セットで検証する必要がある。

また、臨床試験報告書やバイオ製造品質文書では、複数のページに分散しているロット番号、試験方法、許容基準、および結果を1つのレコードにまとめる初期データ化段階に適用できる。vLLMサーバーでモデルを提供すると、内部アプリケーションが共通の推論エンドポイントを使用でき、Schema Studioは抽出スキーマを設計およびテストするためのインターフェースとして活用できる。ただし、Modified OpenRAIL-Mモデルライセンスの使用制限、機密文書の処理時のログ・キャッシュポリシー、定量的なパフォーマンスとハードウェア要件については、公式の原文を再確認する必要がある。したがって、liftの出力は、自動的な確定値というよりも、原文との照合とフィールドごとの検証ルールを経て、候補データとして扱うことが適切である。

💻 必要なスペック

🧠RAM

公式の最小・推奨容量および対応精度を確認する必要があります。

💾ストレージ

モデルの重みとランタイムを含む公式要件を確認する必要があります。

インストール

4-1. クイックスタート

公式のGitHubまたはHugging Faceのドキュメントに記載されているインストールコマンドを再確認する必要があります。入力情報には検証可能なパッケージ名やコマンドが含まれていないため、任意のインストールコマンドを作成していません。

4-2. 詳細なインストール

Hugging Faceのローカル推論、vLLMサーバー、CLI、Schema Studioがサポートされていることが確認されましたが、各方法の正確なインストールコマンド、モデル識別子、依存関係のバージョン、および実行引数は、公式ドキュメントを確認した後に追加する必要があります。

🧬 バイオ活用シナリオ

🔬

🔬 実験レポートのメタデータ正規化

サンプルID、細胞株、処理濃度、時間、測定値、単位をJSONスキーマで指定し、複数のページのPDFをJSONに変換し、pandasの検証ルールと連携させる。定量的な正確性と処理速度については、公開された元の文書の再確認と独自の評価が必要である。

🧬

🧬 論文の付録データベースの構築

PDFと表の画像から、遺伝子名、疾患名、コホートサイズ、効果量を抽出し、関係データベースまたは検索インデックスに転送する。欠落したフィールドを作成しないポリシーを活用し、元の文書のページとの照合と、フィールドごとの品質チェックを後続のステップとして行う。

💊

🧪 品質文書のフィールド統合

複数のページにわたる分析結果レポートから、ロット番号、試験方法、規格、結果、判定を単一のJSONレコードにまとめて、LIMSとの連携候補データを作成する。vLLMサーバーのデプロイを検討し、確定前の元の文書の検証と、規制要件に準拠した監査追跡を別途適用する。

FAQ

liftとは何ですか?

liftは、Datalabが2026年6月18日に公開した、90億パラメータ規模の文書情報抽出に特化したビジョン言語モデル(Vision-Language Model、VLM)である。ユーザーがJSON Schemaで定義した出力構造に基づいて、PDFや画像から該当するフィールドを抽出し、構造化されたJSON形式で返す。一般的な文書OCRがページを文字の平面として読み込むのに対し、liftはJSON Schemaを設計図のように扱い、文書全体から各フィールドに含める情報を探し出し、組み立てるという点で異なる。複数のページに分散していたり、ページ境界を越えて連続している値も、単一の処理プロセスで扱えるように設計されており、Hugging Faceベースのローカル推論、vLLMサーバー、コマンドラインインターフェース、およびSchema Studioを通じた利用方法が提供されている。 従来の文書処理パイプラインでは、OCR、レイアウト分析、フィールドごとのルール、後処理検証をそれぞれ接続する必要がある場合が多い。フォームが少しでも異なると、正規表現や座標ルールを再作成する必要があり、汎用的な生成モデルをそのまま使用すると、文書に存在しない値をそれらしく補完する幻覚(Hallucination)がデータベースに流入するリスクもある。liftの特長は、出力契約をJSON Schemaで明示し、欠落したフィールドを任意に生成しないように学習された、文書抽出に特化したモデルである点にある。したがって、抽出結果をキー名に合わせて変換する中間コードを減らし、自己ホストが必要な研究機関や企業が、元の文書を外部APIに送信しないデプロイ構成を検討できる。 生命科学研究では、論文の付録、分析成績書、実験記録など、構造は類似しているが書式がそれぞれ異なる資料を正規化するために活用できる。例えば、研究者はサンプルID、実験条件、測定値、単位、およびページ根拠をJSON Schemaに定義した後、複数ページのPDFを処理し、返されたJSONをpandasまたはデータベースのロード段階に渡すことができる。特定のフィールドが文書に存在しない場合に推定値を生成しないという動作は、欠落と実際の陰性結果を区別する必要がある品質管理の過程で特に重要である。ただし、抽出精度、サポート可能なページ数と画像解像度、スキーマの複雑さの制限、およびフィールドごとの根拠座標の提供の有無は、入力情報だけでは確認できないため、運用導入前に公式ドキュメントと代表的な文書セットで検証する必要がある。 また、臨床試験報告書やバイオ製造品質文書では、複数のページに分散しているロット番号、試験方法、許容基準、および結果を1つのレコードにまとめる初期データ化段階に適用できる。vLLMサーバーでモデルを提供すると、内部アプリケーションが共通の推論エンドポイントを使用でき、Schema Studioは抽出スキーマを設計およびテストするためのインターフェースとして活用できる。ただし、Modified OpenRAIL-Mモデルライセンスの使用制限、機密文書の処理時のログ・キャッシュポリシー、定量的なパフォーマンスとハードウェア要件については、公式の原文を再確認する必要がある。したがって、liftの出力は、自動的な確定値というよりも、原文との照合とフィールドごとの検証ルールを経て、候補データとして扱うことが適切である。

liftはいつ使いますか?

liftは、Datalabが2026年6月18日に公開した、9Bパラメータの文書情報抽出に特化したビジョン言語モデル(Vision-Language Model、VLM)である。ユーザーが希望する出力構造をJSONスキーマで定義すると、PDFや画像から該当するフィールドを抽出し、構造化されたJSONとして返す。一般的な文書OCRがページを文字の平面として読み込むのに対し、liftはJSONスキーマを設計図のように扱い、文書全体から各セルに入る情報を探し出して組み立てるという点で異なる。複数のページに分散していたり、ページ境界を越えて連続している値も抽出できる。

liftのバイオ研究での活用例は何ですか?

🔬 実験レポートのメタデータ正規化: サンプルID、細胞株、処理濃度、時間、測定値、単位をJSONスキーマで指定し、複数のページのPDFをJSONに変換し、pandasの検証ルールと連携させる。定量的な正確性と処理速度については、公開された元の文書の再確認と独自の評価が必要である。

📄 公式ドキュメント🐙 GitHub

📝 アップデートノート

まだアップデートノートはありません。

🧪 関連「生命のコード」

関連する「生命のコード」記事はまだありません。