홈서버 로컬 LLM 구축 Ollama Docker로 소형 모델 올리기

·

, ,

홈서버에서 로컬 LLM을 돌려보는 이유

책상 위에 놓인 작은 서버가 문서 요약이나 간단한 질의응답까지 해주면 생각보다 쓸모가 많습니다. 거창한 GPU 서버가 아니어도 1B~3B급 소형 LLM부터 올려보면, 홈서버에서 어디까지 가능한지 감을 잡을 수 있습니다.

이번 구성은 Rocky Linux 9.x / Docker Engine 28.x / Docker Compose v2.x / Ollama Docker 이미지 조합을 기준으로 정리했습니다. Oracle Cloud Free Tier ARM 같은 저전력 서버나 시놀로지에서 Docker를 쓰는 환경도 큰 흐름은 비슷합니다.

홈서버 로컬 LLM 구성 참고 이미지

Ollama를 Docker로 올리기

Ollama는 리눅스 설치 스크립트도 제공하지만, 홈서버에서는 나중에 지우거나 옮기기 쉬운 Docker 방식이 관리하기 편했습니다. 공식 Docker Hub 기준으로 Ollama 컨테이너는 11434 포트를 사용합니다.

mkdir -p ~/services/ollama
cd ~/services/ollama
services:
  ollama:
    image: ollama/ollama:latest
    container_name: ollama
    restart: unless-stopped
    ports:
      - "127.0.0.1:11434:11434"
    volumes:
      - ollama:/root/.ollama

volumes:
  ollama:
docker compose up -d
docker exec -it ollama ollama --version

포트를 127.0.0.1로 묶은 이유는 단순합니다. LLM API를 인터넷에 바로 노출하지 않기 위해서입니다. 내부망 밖에서 접근해야 한다면 VPN, Tailscale, 리버스 프록시 인증 같은 보호 장치를 먼저 붙이는 편이 낫습니다.

작은 모델부터 테스트하기

처음부터 7B, 14B 모델을 받으면 다운로드도 오래 걸리고 메모리도 금방 부족해집니다. 홈서버에서는 1B~3B 모델로 시작하는 편이 현실적입니다.

docker exec -it ollama ollama pull llama3.2:1b
docker exec -it ollama ollama run llama3.2:1b

간단한 호출은 curl로 바로 확인할 수 있습니다.

curl http://127.0.0.1:11434/api/chat \
  -d '{
    "model": "llama3.2:1b",
    "messages": [
      {
        "role": "user",
        "content": "홈서버에서 로컬 LLM을 돌릴 때 장점 3가지만 짧게 정리해줘."
      }
    ],
    "stream": false
  }'

응답이 느리더라도 일단 동작하면 기본 구성은 된 셈입니다. CPU만 쓰는 서버라면 속도보다 상시 실행 가능 여부와 메모리 여유를 먼저 확인하는 게 좋습니다.

로컬 서버와 인공지능 구성을 떠올리게 하는 이미지

홈서버용 소형 LLM 후보

Ollama 라이브러리 기준으로 llama3.2는 1B와 3B 모델을 제공하고, qwen2.5는 0.5B부터 3B까지 작은 선택지가 넓습니다. gemma3도 270M, 1B처럼 가벼운 모델이 있어 테스트용으로 부담이 적습니다.

순위 제품명 핵심 강점 총평 평점
1 llama3.2:1b 가볍고 시작이 빠름 CPU 홈서버에서 첫 테스트용으로 무난합니다 4.5
2 qwen2.5:1.5b 크기와 답변 품질의 균형 한국어 질문도 간단한 용도라면 꽤 버팁니다 4.3
3 qwen2.5:3b 조금 더 나은 답변 품질 메모리 여유가 있으면 1B급보다 만족도가 올라갑니다 4.2
4 gemma3:1b 작은 용량과 빠른 테스트 가벼운 질의응답, 요약 실험에 맞습니다 4.0

이 점수는 절대 성능표가 아니라 홈서버에서 굴려볼 때의 체감 기준에 가깝습니다. 특히 CPU 서버라면 3B 모델부터 답변 대기 시간이 꽤 느껴질 수 있습니다.

모델 파일과 저장공간 관리

모델 파일은 생각보다 빨리 쌓입니다. 내려받은 모델은 ollama list로 확인하고, 잘 쓰지 않는 모델은 정리하는 편이 좋습니다.

docker exec -it ollama ollama list
docker exec -it ollama ollama rm qwen2.5:3b

시놀로지나 미니PC처럼 저장공간이 넉넉하지 않은 장비라면 모델을 여러 개 받아두기보다 하나씩 비교하고 지우는 방식이 낫습니다. 백업 대상에도 모델 볼륨을 꼭 포함할 필요는 없습니다. 다시 받을 수 있는 파일이라면 설정만 따로 관리해도 충분합니다.

로컬 LLM과 홈서버 운영을 연상시키는 이미지

어디까지 기대할 수 있을까

소형 LLM은 대형 모델처럼 긴 추론이나 복잡한 코딩을 매끄럽게 처리하진 못합니다. 대신 개인 메모 요약, 짧은 문장 다듬기, 로그 설명, 내부 문서 초안 정리 같은 작업에는 꽤 현실적인 재미가 있습니다.

나중에 Open WebUI 같은 웹 인터페이스를 붙이면 개인 장비나 가족용 브라우저에서도 접근하기 편합니다. 다만 이때도 인증 없이 외부에 열어두는 구성은 피해야 합니다.

공식 안내는 아래 링크에서 확인했습니다. 모델 크기와 태그는 바뀔 수 있으니 실제 설치 전에는 한 번 더 확인하는 편이 안전합니다.

  • Ollama Linux 설치: https://ollama.com/download/linux
  • Ollama Docker 이미지: https://hub.docker.com/r/ollama/ollama
  • Ollama 모델 라이브러리: https://ollama.com/library

코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다