Ollama
로컬 LLM 실행 표준 — 100+ 모델을 단일 명령으로 구동하는 런타임
Ollama는 미국 Ollama Inc.가 2023년 출시한 오픈소스 로컬 LLM 실행 엔진이에요. llama.cpp 기반 GGUF quantized 모델 + REST API + Modelfile(Dockerfile 같은 모델 정의) 통합 패키지. 한 줄로 표현하면 "Docker가 컨테이너 실행을 표준화했듯, Ollama는 로컬 LLM 실행을 표준화한다"고 할 수 있습니다. macOS/Linux/Windows 단일 바이너리로 설치 → ollama pull llama3.3:70b 한 줄로 모델 다운 → ollama run 또는 :11434 REST API 호출이면 OpenAI 호환 응답이 즉시 나옵니다.
기존 로컬 LLM 실행은 (1) Hugging Face Transformers로 모델 로드, (2) bitsandbytes/AWQ quantization 별도 처리, (3) vLLM/TGI 같은 서버 직접 구축, (4) CUDA/Metal/ROCm 환경 수동 설정 등 복잡한 사슬이었어요. Ollama는 GGUF 단일 형식 표준화로 위 4 단계를 1 단계(pull + run)로 압축합니다. Modelfile로 시스템 프롬프트·template·parameter도 모델과 함께 버전 관리하고, thinking 모드(reasoning 모델) + format=json + keep_alive 같은 production 운영 기능도 내장했어요. 마치 "Hugging Face가 Git for ML이라면, Ollama는 Docker for LLM"인 셈이죠.
생명공학·의료 연구자 관점에서는 (1) HIPAA/GDPR 보호 환자 데이터를 클라우드 전송 0으로 로컬 분석, (2) RAG 시스템 백본 — 벡터 DB + 임베딩 모델 + LLM 추론 조합으로 사내 논문/프로토콜 검색, (3) 임상 노트 STT 후 자동 SOAP 형식 변환 + ICD-10 코드 제안, (4) BioGPT·Bio-Llama·Med-PaLM 같은 도메인 특화 모델 GGUF 변환 후 즉시 운영, (5) 실험 데이터 분석 워크플로우 자동화 (예: 시퀀싱 결과 → LLM이 변이 해석 → 보고서 초안) 같은 활용이 가능해요. 외부 API 의존이 없어 데이터 주권·연구 보안·재현성 모두 확보됩니다.
production 운영 시 핵심 노하우: (a) thinking 모드 모델(gpt-oss·qwen3 reasoning 등)은 think:true root level 명시 필수 — 누락 시 응답 빈 결함, (b) 번역·임베딩 같은 비thinking 모델은 think:false 의무 — true 주면 응답 empty, (c) keep_alive 옵션으로 cold start 회피 (모델 로드 1.5-3분 절약), (d) num_ctx는 모델 컨텍스트 한도 + thinking 토큰 여유 고려해서 16384 이상 권장, (e) REST API timeout은 모델 크기와 thinking 여부에 따라 120-600초 범위로 조정.
💻 필요한 컴퓨터 사양
최소 16GB (7B Q4 모델), 권장 32GB (13B), 64GB+ (32B), 128GB+ (70B/120B unified memory 모델 — Apple M4 Ultra, NVIDIA Grace, AMD Ryzen AI MAX+)
8GB (7B Q4) / 24GB (32B Q4, RTX 4090급) / 48GB (70B Q4, A6000급) / 80GB+ (120B 또는 다중 GPU 분산). CPU 단독도 동작하지만 토큰 처리 속도는 GPU 대비 5-10배 느림. Apple Silicon(M1 Pro 이상)은 unified memory 덕에 매우 효율적
모델당 4-70GB (Q4 양자화 기준). 다중 모델 운영 시 1-2TB NVMe SSD 권장. NFS·SMB 같은 네트워크 스토리지 마운트도 가능 (OLLAMA_MODELS 환경변수)
⚡ 설치법
curl -fsSL https://ollama.com/install.sh | sh
또는 Homebrewbrew install ollama
1. 모델 풀ollama pull llama3.3:70b ollama pull gemma3:12b
2. 대화형 추론ollama run llama3.3:70b "단백질 구조 예측에서 AlphaFold와 ESMFold 차이는?"
3. REST API (포트 11434, OpenAI 호환)curl -X POST http://localhost:11434/api/chat -d '{ "model": "llama3.3:70b", "messages": [{"role": "user", "content": "안녕"}], "stream": false, "keep_alive": "24h", "options": {"num_ctx": 16384, "num_predict": 2000} }'
4. thinking 모드 모델 (gpt-oss·qwen3 reasoning)curl -X POST http://localhost:11434/api/chat -d '{ "model": "gpt-oss:120b", "messages": [{"role": "user", "content": "..."}], "stream": false, "think": true, "keep_alive": "24h" }'
5. Modelfile로 도메인 모델 커스텀cat > Modelfile <<EOF FROM llama3.3:70b SYSTEM "당신은 생명공학 분야 전문 분석가입니다." PARAMETER temperature 0.7 PARAMETER num_ctx 16384 EOF ollama create bio-analyst -f Modelfile
6. 운영 모니터링ollama ps # 현재 로드된 모델 + GPU 사용량 ollama list # 보유 모델 전체 curl http://localhost:11434/api/tags | jq .
🧬 바이오 활용
논문·실험 데이터 로컬 분석 파이프라인
PubMed RSS·연구 노트·시퀀싱 결과 같은 데이터를 cron + Ollama REST API로 자동 처리. 예: 매일 새 논문 50건 → llama3.3:70b가 abstract 요약 + emotion 태그 + 관련성 점수 산출 → DB에 DRAFT INSERT. 외부 API 비용 0, 데이터 외부 전송 0.
RAG 시스템 백본 — 사내 지식 검색 + 챗봇
논문 PDF·프로토콜 docx·연구 노트 markdown을 BGE-M3 임베딩으로 벡터화 → Qdrant·ChromaDB 적재 → 사용자 검색 시 Ollama gemma·llama 추론이 검색 결과 + 컨텍스트 종합. Streamlit/Gradio UI로 누구나 사내 지식 자연어 질의 가능.
HIPAA·GDPR 보호 환자 데이터 EMR 보조
병원 내 Mac Studio·워크스테이션에 Ollama + medllama3·BioGPT 호스팅 → 임상 노트 STT 결과를 ollama API로 자동 SOAP 형식 변환 + ICD-10 코드 제안 + 처방 점검. Modelfile에 SYSTEM 프롬프트 + temperature 0.3 + num_ctx 16384 박제. 클라우드 전송 0 = HIPAA Safe Harbor 만족.
FAQ
Ollama은(는) 무엇인가요?
Ollama는 미국 Ollama Inc.가 2023년 출시한 오픈소스 로컬 LLM 실행 엔진이에요. llama.cpp 기반 GGUF quantized 모델 + REST API + Modelfile(Dockerfile 같은 모델 정의) 통합 패키지. 한 줄로 표현하면 "Docker가 컨테이너 실행을 표준화했듯, Ollama는 로컬 LLM 실행을 표준화한다"고 할 수 있습니다. macOS/Linux/Windows 단일 바이너리로 설치 → ollama pull llama3.3:70b 한 줄로 모델 다운 → ollama run 또는 :11434 REST API 호출이면 OpenAI 호환 응답이 즉시 나옵니다. 기존 로컬 LLM 실행은 (1) Hugging Face Transformers로 모델 로드, (2) bitsandbytes/AWQ quantization 별도 처리, (3) vLLM/TGI 같은 서버 직접 구축, (4) CUDA/Metal/ROCm 환경 수동 설정 등 복잡한 사슬이었어요. Ollama는 GGUF 단일 형식 표준화로 위 4 단계를 1 단계(pull + run)로 압축합니다. Modelfile로 시스템 프롬프트·template·parameter도 모델과 함께 버전 관리하고, thinking 모드(reasoning 모델) + format=json + keep_alive 같은 production 운영 기능도 내장했어요. 마치 "Hugging Face가 Git for ML이라면, Ollama는 Docker for LLM"인 셈이죠. 생명공학·의료 연구자 관점에서는 (1) HIPAA/GDPR 보호 환자 데이터를 클라우드 전송 0으로 로컬 분석, (2) RAG 시스템 백본 — 벡터 DB + 임베딩 모델 + LLM 추론 조합으로 사내 논문/프로토콜 검색, (3) 임상 노트 STT 후 자동 SOAP 형식 변환 + ICD-10 코드 제안, (4) BioGPT·Bio-Llama·Med-PaLM 같은 도메인 특화 모델 GGUF 변환 후 즉시 운영, (5) 실험 데이터 분석 워크플로우 자동화 (예: 시퀀싱 결과 → LLM이 변이 해석 → 보고서 초안) 같은 활용이 가능해요. 외부 API 의존이 없어 데이터 주권·연구 보안·재현성 모두 확보됩니다. production 운영 시 핵심 노하우: (a) thinking 모드 모델(gpt-oss·qwen3 reasoning 등)은 think:true root level 명시 필수 — 누락 시 응답 빈 결함, (b) 번역·임베딩 같은 비thinking 모델은 think:false 의무 — true 주면 응답 empty, (c) keepalive 옵션으로 cold start 회피 (모델 로드 1.5-3분 절약), (d) numctx는 모델 컨텍스트 한도 + thinking 토큰 여유 고려해서 16384 이상 권장, (e) REST API timeout은 모델 크기와 thinking 여부에 따라 120-600초 범위로 조정.
Ollama은(는) 언제 사용하나요?
로컬 LLM 실행 표준 — 100+ 모델을 단일 명령으로 구동하는 런타임
Ollama의 바이오 연구 활용 예시는 무엇인가요?
논문·실험 데이터 로컬 분석 파이프라인: PubMed RSS·연구 노트·시퀀싱 결과 같은 데이터를 cron + Ollama REST API로 자동 처리. 예: 매일 새 논문 50건 → llama3.3:70b가 abstract 요약 + emotion 태그 + 관련성 점수 산출 → DB에 DRAFT INSERT. 외부 API 비용 0, 데이터 외부 전송 0.
📝 업데이트 노트
아직 업데이트 노트가 없습니다.
🧪 관련 생명의 코드
관련된 생명의 코드 글이 아직 없습니다.