본문 바로가기
IT/AI

[AI] Ollama 로컬 AI 설치 및 실행 완벽 가이드 (2026 최신판)

by 수누다 2026. 4. 10.
반응형

ChatGPT 없이도 AI를 쓸 수 있다고요?

솔직히 말씀드리면, 저도 처음엔 \"로컬에서 LLM을 돌린다\"는 말이 뭔 소린지 잘 몰랐거든요. 클라우드 API 쓰면 되는 거 아닌가? 했었는데... 직접 써보고 나서 생각이 완전히 바뀌었습니다.

인터넷 연결 없이도 AI가 돌아가고, 데이터가 외부로 한 바이트도 안 나가고, API 요금 걱정도 없고. Ollama 로컬 AI 설치를 처음 해봤을 때 \"이게 왜 이렇게 쉽지?\" 싶었습니다. 진짜로요.

오늘은 제가 홈랩에서 Ollama를 세팅하면서 겪었던 삽질들까지 포함해서, 처음 시작하시는 분들도 막히지 않게 완벽하게 정리해드릴게요. 설치부터 모델 다운로드, 실제 사용, OpenAI 호환 API, Open WebUI 연동까지 전부 다룹니다.

Ollama를 통해 로컬 환경에서 LLM을 실행하는 전체 구조 — 외부 인터넷 없이 내 PC에서 AI가 동작합니다.

Ollama가 뭔지부터 짚고 넘어가요

쉽게 말해서 이런 도구입니다

Ollama 로컬 AI로컬 LLM(Large Language Model, 대형 언어 모델) 실행 플랫폼입니다. Docker를 아시는 분들이라면 이렇게 이해하시면 딱이에요. \"AI 모델을 위한 Docker\" 같은 거라고 보시면 됩니다.

Docker가 컨테이너 이미지를 pull 받아서 실행하듯이, Ollama도 AI 모델을 pull 받아서 로컬에서 실행해줍니다. 명령어 구조도 거의 비슷해서 Docker 쓰시던 분들은 더 친숙하게 느끼실 거예요.

  • 완전한 오프라인 동작 — 모델 다운로드 후엔 인터넷 불필요
  • 데이터 프라이버시 — 내 데이터가 외부 서버로 전송되지 않음
  • API 비용 절감 — 클라우드 호출 없이 로컬에서 반복 테스트 가능
  • 커스터마이징 자유도 — 모델 파라미터, Modelfile, 임베딩 모델까지 직접 제어
  • 다양한 모델 지원 — Gemma 4, Qwen3, DeepSeek-R1, Llama 계열 등 폭넓게 사용 가능

클라우드 AI vs 로컬 AI, 뭐가 다른가요?

비교 항목 클라우드 AI (ChatGPT 등) 로컬 AI (Ollama)
비용 월정액 또는 토큰 과금 설치 후 반복 실행 비용이 낮음
프라이버시 데이터 외부 전송 가능성 있음 기본적으로 로컬 처리
인터넷 대체로 필수 모델 다운로드 후 오프라인 가능
성능 최신 초대형 모델 사용 가능 내 하드웨어 범위 안에서 동작
응답 속도 네트워크 지연 영향 있음 로컬 GPU가 있으면 매우 빠름
커스터마이징 제한적 툴 호출, 임베딩, Modelfile까지 자유롭게 제어

물론 최신 초대형 모델 수준의 성능을 1:1로 기대하긴 어렵습니다. 근데 코딩 도우미, 문서 요약, 질의응답, 사내 문서 검색용 로컬 LLM 정도는 진짜 실사용이 됩니다. 특히 개인정보가 민감한 작업은 로컬 AI 쪽이 훨씬 마음 편하더라고요.

설치 전 준비사항 확인하기

하드웨어 요구사항

여기서 중요한 포인트! 모델 크기에 따라 필요한 사양이 천차만별입니다. 2026년 기준으로 자주 쓰는 모델들을 기준 삼아 정리하면 이렇습니다.

모델 크기 대표 모델 최소 RAM 권장 환경
1~4B (소형) llama3.2:3b, qwen3:1.7b 4GB 일반 노트북 입문용
7~9B (중형) qwen3:8b, qwen2.5:7b 8~12GB 일반 데스크탑 권장
12~14B (중대형) gemma4:12b, qwen3:14b 16~24GB 고사양 노트북 또는 데스크탑
30B+ (대형) gemma4:31b, deepseek-r1:32b, gpt-oss:20b 이상 32GB~64GB+ 고성능 GPU 또는 서버급 환경

💡 팁: GPU(그래픽 카드)가 있으면 속도가 몇 배는 빨라집니다. NVIDIA GPU는 CUDA, AMD는 ROCm, Mac은 Apple Silicon의 Metal/MLX 경로를 활용합니다. 특히 2026년 들어 Apple Silicon 최적화가 많이 좋아져서, M 시리즈 맥에서 체감 성능이 꽤 인상적입니다.

지원 운영체제

  • macOS — macOS Sonoma(14) 이상, Apple Silicon 권장, Intel Mac은 CPU 중심
  • Linux — Ubuntu, Debian 등 주요 배포판 지원, AMD/NVIDIA 가속 가능
  • Windows — Windows 10 22H2 이상 또는 Windows 11, 네이티브 설치 지원

Ollama 설치 방법 — OS별 완벽 가이드

Ollama 설치는 생각보다 단순합니다 — 다만 운영체제별로 최신 권장 경로는 조금씩 달라졌습니다.

1. macOS 설치

macOS는 예전처럼 dmg 설치도 좋고, 공식 설치 스크립트도 꽤 깔끔합니다. 저는 여전히 앱 설치 방식이 제일 편했습니다.

방법 1: 공식 사이트에서 dmg 다운로드

  1. ollama.com 접속
  2. \"Download for macOS\" 클릭
  3. dmg 파일 설치 후 Applications 폴더로 이동
  4. 앱 실행 후 menubar 아이콘과 CLI 링크 생성 확인

방법 2: 공식 설치 스크립트

# 공식 설치 스크립트
curl -fsSL https://ollama.com/install.sh | sh

# 버전 확인
ollama --version

방법 3: Homebrew (사용 중이면 편함)

brew install ollama
brew services start ollama

2. Linux 설치

Linux는 여전히 한 줄 설치가 가장 편합니다. 다만 서버 환경에서는 서비스 계정과 모델 저장 경로를 같이 이해해두시는 게 좋습니다.

# 공식 설치 스크립트 실행
curl -fsSL https://ollama.com/install.sh | sh

설치 후 서비스 상태를 확인해보세요.

# 서비스 상태 확인
sudo systemctl status ollama

# 서비스가 안 떠있다면
sudo systemctl start ollama
sudo systemctl enable ollama

AMD GPU를 쓰신다면 ROCm 패키지를 추가로 맞춰주는 경우가 있습니다. 이 부분은 CPU만 쓰는 설치보다 한 단계 더 확인이 필요합니다.

3. Windows 설치

Windows는 이제 WSL2를 꼭 거치지 않아도 됩니다. 네이티브 설치가 꽤 안정화됐고, NVIDIA뿐 아니라 AMD Radeon GPU도 지원 범위가 넓어졌습니다.

방법 1: 설치 파일 사용

# 가장 쉬운 방법은 공식 설치 파일 사용
# ollama.com에서 OllamaSetup.exe 다운로드

방법 2: PowerShell 설치

irm https://ollama.com/install.ps1 | iex

⚠️ Windows 주의사항: Windows 10은 22H2 이상이 권장됩니다. 설치 후 `cmd`, `PowerShell`, Windows Terminal 어디서든 `ollama` 명령어가 잡혀야 정상입니다.

4. Docker로 설치 (서버 환경 추천)

서버에서 쓰실 거라면 Docker 방식이 제일 깔끔합니다. 다만 GPU 패스스루는 Linux나 Windows(WSL2) 쪽이 훨씬 유리하고, macOS Docker Desktop은 GPU 가속이 사실상 어렵습니다.

# CPU만 사용하는 경우
docker run -d \
  -v ollama:/root/.ollama \
  -p 11434:11434 \
  --name ollama \
  ollama/ollama

# NVIDIA GPU 사용하는 경우 (nvidia-container-toolkit 필요)
docker run -d \
  --gpus=all \
  -v ollama:/root/.ollama \
  -p 11434:11434 \
  --name ollama \
  ollama/ollama

Ollama 모델 다운로드 및 실행하기

첫 번째 모델 실행해보기

설치가 됐으면 이제 진짜 재밌는 부분입니다. 모델을 받아서 실제로 대화를 해볼 차례예요.

처음 시작하시는 분들께는 llama3.2:3b, qwen3:4b, 또는 gemma4 계열의 가벼운 태그를 추천합니다. 성능과 속도 밸런스가 꽤 좋습니다.

# 가장 간단한 실행
ollama run gemma4

# 작은 모델로 가볍게 시작
ollama run llama3.2:3b
ollama run qwen3:4b

# 한국어와 범용성 밸런스
ollama run qwen3:8b

# 코딩 위주
ollama run qwen2.5-coder:7b

# 추론형 모델을 써보고 싶다면
ollama run deepseek-r1:8b

명령어를 실행하면 먼저 모델 파일을 다운로드하고, 완료되면 바로 대화 프롬프트가 뜹니다. 최근 모델은 컨텍스트 윈도우가 커지고 멀티모달까지 붙은 경우가 많아서, 파일 크기와 메모리 사용량은 예전보다 더 빨리 커질 수 있습니다. 이건 꼭 감안하셔야 해요.

자주 쓰는 Ollama 명령어 모음

# 설치된 모델 목록 확인
ollama list

# 모델 정보 확인
ollama show gemma4

# 현재 실행 중인 모델 확인
ollama ps

# 모델만 다운로드
ollama pull qwen3:8b

# 모델 삭제
ollama rm llama3.2:3b

# 서버 버전 확인
ollama --version

# 로컬 API 버전 확인
curl http://localhost:11434/api/version

API로 사용하기 — 다른 앱과 연동

Ollama는 기본적으로 11434 포트에서 REST API를 제공합니다. 여기에 OpenAI 호환 API까지 지원해서, 기존 OpenAI SDK 기반 앱을 로컬 AI 백엔드로 바꾸기 훨씬 쉬워졌습니다.

# 기본 API 호출 (curl 사용)
curl http://localhost:11434/api/generate -d '{
  "model": "gemma4",
  "prompt": "안녕하세요! 간단하게 자기소개 해주세요.",
  "stream": false
}'

# OpenAI 호환 Chat Completions 형식
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-oss:20b",
    "messages": [
      {"role": "user", "content": "파이썬으로 Hello World 출력하는 코드 작성해줘"}
    ]
  }'

# 임베딩 생성 API
curl http://localhost:11434/api/embed -d '{
  "model": "embeddinggemma",
  "input": "Ollama 로컬 AI 설치 가이드"
}'
# Python 코드 예시
from openai import OpenAI

client = OpenAI(
    base_url='http://localhost:11434/v1/',
    api_key='ollama',
)

response = client.chat.completions.create(
    model='qwen3:8b',
    messages=[
        {'role': 'user', 'content': '머신러닝이 뭔지 간단히 설명해줘'}
    ]
)

print(response.choices[0].message.content)

여기서 포인트는 두 가지입니다. 첫째, 요즘은 단순 채팅뿐 아니라 툴 호출, 임베딩, JSON 구조화 출력, Responses API까지 같이 보는 게 좋습니다. 둘째, 로컬 AI를 실제 서비스에 연결하려면 모델 성능보다 API 형태 호환성이 더 중요할 때가 많습니다.

2026년 7월 기준, 새로 달라진 점

v0.32 계열에서 체크할 변화

이 글이 처음 작성된 뒤로 Ollama는 꽤 빠르게 바뀌었습니다. 2026년 7월 기준으로는 v0.32 계열에서 체감되는 변화가 분명해요.

  • 인터랙티브 에이전트 경험 강화 — `ollama` 자체 실행 흐름이 더 똑똑해졌고, `ollama launch` 계열도 정리됐습니다.
  • Apple Silicon 성능 개선 — MLX 엔진 최적화가 크게 들어가서 M 시리즈 맥에서 응답 속도와 메모리 효율이 좋아졌습니다.
  • GGUF 호환성과 모델 폭 확대 — 더 다양한 오픈 웨이트 모델을 돌리기 쉬워졌습니다.
  • OpenAI 호환 범위 확대 — Chat Completions뿐 아니라 Responses API, 툴 호출, 추론형 모델 활용이 훨씬 자연스러워졌습니다.
  • 클라우드 기능은 선택 사항 — 필요하면 클라우드 모델을 함께 쓸 수 있지만, 로컬 전용으로 잠그는 것도 가능합니다.

즉, 예전처럼 \"로컬에서 그냥 간단히만 돌리는 도구\"를 넘어, 이제는 개발용 AI 런타임에 가까워졌다고 보시면 됩니다.

지금 추천할 만한 모델 조합

요즘 기준으로는 모델 추천도 조금 바뀌었습니다.

  • 입문용 — `llama3.2:3b`, `qwen3:4b`
  • 한국어/범용 밸런스 — `qwen3:8b`, `qwen2.5:7b`
  • 추론형 작업 — `deepseek-r1:8b` 이상
  • 멀티모달(이미지 입력) — `gemma4`
  • 임베딩/RAG — `embeddinggemma`, `qwen3-embedding`

특히 Gemma 4는 텍스트만이 아니라 이미지 입력까지 다루는 멀티모달 로컬 AI 용도로 눈여겨볼 만하고, Qwen3 계열은 한국어와 코드, 범용 대화 밸런스가 좋아서 실사용 만족도가 높습니다.

⚠️ 실제로 겪었던 문제들과 해결 방법

삽질 경험을 공유하는 게 이 블로그의 존재 이유 중 하나니까요 ㅎㅎ 제가 실제로 자주 마주쳤던 문제들 정리해드립니다.

문제 1: 모델이 너무 느려요

증상: 토큰이 초당 1~2개밖에 안 나옴

원인: GPU를 못 쓰고 CPU만 사용 중인 경우가 많습니다. 또는 모델 크기가 하드웨어보다 과한 경우도 있고요.

# GPU 사용 여부 확인
ollama ps

# NVIDIA GPU 드라이버 확인
nvidia-smi

# Windows/Linux에서 드라이버 확인 후 Ollama 재시작
ollama --version

NVIDIA GPU가 있는데 GPU를 안 쓴다면 드라이버나 컨테이너 런타임 문제일 가능성이 큽니다. Mac에서는 반대로 MLX 최적화가 잘 먹는 최신 버전으로 올리는 것만으로 개선되는 경우도 많았습니다.

문제 2: \"Error: model not found\" 오류

# 모델명 오타 확인
ollama run gemma4
ollama run qwen3:8b

# 사용 가능한 모델 태그 확인
ollama show gemma4

예전 글이나 예전 유튜브에서 본 태그가 지금은 바뀌었거나, 최신 기본 태그가 달라진 경우가 있습니다. 가장 안전한 건 공식 라이브러리에서 현재 태그를 다시 확인하는 겁니다.

문제 3: 포트 11434가 이미 사용 중

# 포트 사용 프로세스 확인 (Linux/Mac)
lsof -i :11434

# 기존 ollama 프로세스 종료
pkill ollama

# 다시 시작
ollama serve

Docker 컨테이너와 로컬 앱을 동시에 띄운 경우에도 충돌이 납니다. 한쪽만 살아있게 정리하는 게 제일 빠릅니다.

문제 4: 디스크 공간이 부족해요

요즘 모델은 7B만 해도 금방 몇 GB씩 먹고, 12B 이상 가면 체감이 확 옵니다. 저장 경로도 운영체제에 따라 다릅니다.

# 기본 모델 저장 경로
# macOS: ~/.ollama/models
# Linux(표준 설치): /usr/share/ollama/.ollama/models
# Windows: C:\Users\사용자명\.ollama\models

# 저장 위치 변경 (Linux/Mac 예시)
export OLLAMA_MODELS=/data/ollama/models

# Linux 서비스 환경이라면 권한도 맞춰야 함
sudo chown -R ollama:ollama /data/ollama/models

# 안 쓰는 모델 삭제
ollama rm qwen3:8b

문제 5: 한국어 응답 품질이 낮아요

이건 모델 선택 영향이 큽니다. 2026년 기준으로는 아래 조합이 꽤 안정적이었습니다.

  • 🥇 Qwen3 — 한국어와 범용 대화 밸런스가 좋습니다
  • 🥈 Qwen2.5 — 아직도 가볍고 실속 있는 선택지입니다
  • 🥉 Gemma 4 — 한국어도 괜찮고 멀티모달 활용까지 가능
# 한국어 성능 좋은 모델들
ollama run qwen3:8b
ollama run qwen2.5:7b
ollama run gemma4

설치 완료! 실제로 잘 작동하는지 확인해봐요

Ollama로 로컬 AI 모델과 대화하는 실제 터미널 화면 — 인터넷 없이 내 PC에서 AI가 응답합니다.

드디어 됐다! 다 설치하셨으면 아래 순서로 제대로 동작하는지 확인해보세요.

기본 동작 확인

# 1. Ollama 서버 상태 확인
curl http://localhost:11434

# 2. API 버전 확인
curl http://localhost:11434/api/version

# 3. 설치된 모델 목록 확인
ollama list

# 4. 간단한 질문으로 테스트
ollama run llama3.2:3b "안녕? 로컬 AI 테스트 중이야."

# 5. API 응답 확인
curl http://localhost:11434/api/tags

Open WebUI 연결하기 — 브라우저에서 ChatGPT처럼 사용

터미널도 좋지만, 브라우저에서 ChatGPT처럼 쓰고 싶으시다면 Open WebUI가 여전히 가장 무난합니다. 요즘은 Docker 이미지 경로와 연결 방식만 정확히 잡아주면 됩니다.

# Open WebUI 실행
# Linux에서 호스트 Ollama에 붙일 때는 --add-host 옵션이 유용합니다.
docker run -d \
  -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

실행 후 http://localhost:3000 으로 접속하세요. Docker 안의 Open WebUI가 호스트에서 돌고 있는 Ollama에 바로 붙지 않으면, 관리자 설정에서 Ollama 연결 주소를 http://host.docker.internal:11434 로 지정하면 됩니다.

이 조합의 장점은 분명합니다. Ollama는 모델 실행 담당, Open WebUI는 대화 UI와 관리 화면 담당. 역할 분리가 깔끔해서 운영하기 편해요.

자주 묻는 질문 (FAQ)

Q. Ollama 사용법이 어렵지 않나요?

전혀요. 진입 장벽이 낮은 편입니다. 사실상 `설치 → ollama run 모델명` 이 두 단계만 넘기면 바로 체감이 옵니다. CLI에 익숙하지 않다면 Open WebUI를 붙이면 훨씬 편하고요.

Q. GPU 없어도 쓸 수 있나요?

네, 됩니다. 다만 CPU만으로는 속도가 느릴 수 있어서 1~4B급 소형 모델부터 시작하시는 걸 추천합니다. `llama3.2:3b`나 `qwen3:1.7b` 같은 모델이 입문용으로 괜찮습니다.

Q. 로컬 LLM 실행 시 개인정보 보호가 확실한가요?

로컬 모델만 사용하면 프롬프트와 응답이 기본적으로 내 PC 안에서 처리됩니다. 다만 2026년 기준 Ollama에는 선택형 클라우드 기능도 들어가 있으니, 완전 로컬만 쓰고 싶다면 아래처럼 꺼두면 더 확실합니다.

# 환경변수로 클라우드 기능 비활성화
export OLLAMA_NO_CLOUD=1

또는 `~/.ollama/server.json` 에서 클라우드 비활성화를 설정하는 방식도 있습니다.

Q. 모델 업데이트는 어떻게 하나요?

# 특정 모델 최신 버전 다시 받기
ollama pull qwen3:8b

# Linux에서 Ollama 자체 업데이트
curl -fsSL https://ollama.com/install.sh | sh

macOS와 Windows 앱 설치판은 업데이트를 자동으로 내려받고, 재시작 시 반영되는 경우가 많습니다. 모델은 앱 업데이트와 별개라서, 자주 쓰는 모델만 골라서 다시 `pull` 해주시면 됩니다.

마무리 — Ollama 로컬 AI, 이제 시작해보세요

처음엔 저도 \"이걸 내가 진짜 쓸 일이 있을까?\" 싶었는데, 한 번 세팅해두고 나니까 생각보다 손이 자주 가더라고요. 특히 로컬 LLM, OpenAI 호환 API, Open WebUI 조합은 개인 프로젝트나 사내 테스트 환경에서 진짜 활용도가 높습니다.

중요한 건 처음부터 큰 모델 욕심내지 않는 겁니다. 내 하드웨어에 맞는 모델부터 가볍게 돌려보고, 그다음에 한국어 성능이나 코딩 성능 좋은 모델로 넓혀가시면 됩니다. 이 순서가 제일 덜 헤맵니다.

한 줄로 정리하면 이겁니다. Ollama는 2026년에도 여전히 가장 쉬운 로컬 AI 시작점입니다.

🔄 마지막 업데이트: 2026년 07월

반응형