Boogu-Image
オープンソースのテキストから画像生成および編集を行うための拡散モデル
Boogu-Image-0.1は、boogu-projectチームが2026年6月1日に発表した最新のオープンソーステキスト-画像生成および編集用ディフュージョンモデルファミリーです。このモデルは、100億パラメータ(10Bパラメータ)規模のアーキテクチャに基づいて設計されており、Qwen3-VLテキストエンコーダーとFlux VAEの連携構造を採用することで、単純な画像生成を超えて、テキストと画像の精密なアライメント性能を最大化しています。まるで熟練した活版印刷家がキャンバスの上に一つ一つ文字を正確に配置していくように、このモデルはテキストプロンプトに記載されたスペルとレイアウトを正確に理解し、多言語テキストを高画質の画像内に美しくレンダリングするタイポグラフィーに特化した生成技術を披露します。現在、ベースモデルを筆頭に、高速推論をサポートするターボモデル、そしてコマンドベースの画像変形を提供するエディットモデルなど、多様なバリアントを提供しており、ComfyUIプラットフォームとのネイティブ連携により、別途複雑なインフラ構成を必要とせずに、強力なローカル仮想ワークフローを簡単に構築できます。 従来のオープンソース画像生成モデルは、華やかな背景や被写体をリアルに描写することには大きな進歩を遂げましたが、画像内に文字を直接レンダリングする過程で、文字のぼやけやスペルの歪みなどの技術的な限界を露呈してきました。Boogu-Imageは、これらの限界を克服するために、多言語テキストレイアウトアルゴリズムと高密度テキストレンダリングの最適化をアーキテクチャレベルで組み込み、商用のクローズドなAIツールに依存することなく、高い視覚的忠実度と可読性を保証する高解像度のデザインを生み出します。特に注目すべき点は、商用の独占モデルと比較して、トレーニングに使用されたデータ量が約1桁(10倍)程度少ないにもかかわらず、高度なデータ精製パイプラインと精密なフィードバックメカニズムに基づいて、超高解像度の商業タイポグラフィー品質を確保している点です。さらに、商業ライセンスによる悪用制限が大きい他のモデルとは異なり、Apache-2.0オープンソースライセンスを採用することで、ユーザーが開発コストや使用制限を気にすることなく、完全にローカル環境で商業利用の権利を行使できるように保証します。 実際の研究現場やデザインの実務において、Boogu-Imageは、情報の正確性が求められる複雑な科学的モデルや精密製品のインフォグラフィック作成に強力なツールとして定着しています。例えば、バイオテクノロジー分野の研究者が論文や学会ポスター発表のために、複雑なタンパク質構造や細胞膜内の遺伝子転写過程を視覚化する場合、Boogu-Imageは、ダイアグラム画像内に「mRNA Transcription」や「Cell Membrane」などの学術用語をスペルの変更なしに自然かつ明確に併記することで、不要な事後のフォトショップによる手作業を大幅に削減します。また、エディットモデルの指示ベースの局所画像修正機能を活用して、既存のバイオテクノロジー製品の試作品画像内のラベルテキストを韓国語から英語に正確に置き換えたり、特定の実験装置の色や背景の質感を一貫性を持ってリタッチすることで、試作品のプロトタイプ視覚化の生産性を劇的に向上させます。
💻 必要なスペック
NVIDIA GPU 12GB以上を推奨(Turboモデルは8GB以上、Base/Editモデルは12GB~16GB以上、2K画像の生成およびテキストエンコーダーの読み込みには24GBを推奨)
モデルの重み(Base、Turbo、Editそれぞれ10GB規模)および依存パッケージを含めて、50GB以上の空き容量を推奨
⚡ インストール
### 4-1. 簡単な始め方
```bash
git clone https://github.com/boogu-project/Boogu-Image && cd Boogu-Image
conda create -y -n boogu python=3.10 && conda activate boogu
pip install -r requirements/torch2.7-cu126.txt && pip install -e .
```
### 4-2. 詳細なインストール
```bash
# Flash Attention の最適化インストール(オプション)
python utils/get_flash_attn.py
# Python 推論の例(Hugging Face diffusers を使用)
# pip install -U diffusers transformers accelerate torch
import torch
from diffusers import DiffusionPipeline
pipe = DiffusionPipeline.from_pretrained("Boogu/Boogu-Image-0.1-Base", torch_dtype=torch.float16)
pipe.to("cuda")
prompt = "化粧品ボトルの高品質なモックアップ。ボトルには「NATURE」という文字が印刷されており、製品写真のスタイル。"
image = pipe(prompt).images[0]
image.save("boogu_output.png")
```📝 アップデートノート
まだアップデートノートはありません。
🧪 関連「生命のコード」
関連する「生命のコード」記事はまだありません。