Ollama 사용법은 생각보다 단순합니다. 설치 파일 하나 받고 명령어 두 줄만 치면 내 컴퓨터 안에서 ChatGPT 비슷한 대화형 AI가 돌아갑니다. 이 글은 코드를 써본 적 없는 분이 Ollama로 로컬 LLM을 처음 실행해보는 과정을 순서대로 안내합니다.

솔직히 저도 처음엔 "로컬에서 AI를 돌린다"는 말이 거창하게 들렸습니다. 그런데 막상 해보니 게임 하나 설치하는 것과 크게 다르지 않더군요. 다만 모델 크기·메모리 요구량을 모르고 아무거나 받으면 컴퓨터가 얼어붙는 함정이 있어서, 그 부분을 미리 짚고 갑니다.
Ollama가 뭐길래
Ollama는 LLM(대형 언어 모델, ChatGPT처럼 대화가 되는 AI)을 내 컴퓨터 안에서 무료로 실행할 수 있게 해주는 프로그램입니다. 인터넷 연결 없이도 동작하고, 대화 내용이 외부 서버로 나가지 않습니다.
비유하자면 "AI 모델 계의 앱스토어 + 실행기"입니다. 원하는 모델을 목록에서 골라 다운로드하고, 바로 대화하거나 다른 프로그램과 연동하면 됩니다.
| 항목 | ChatGPT (웹) | Ollama (로컬) |
|---|---|---|
| 비용 | 월 20달러 (Plus 기준) | 무료 |
| 인터넷 | 필수 | 불필요 |
| 성능 | 최상급 (GPT-4o 등) | 중상급 (모델·PC 사양에 따라) |
| 데이터 유출 걱정 | 있음 | 거의 없음 |
| 속도 | 서버 성능에 의존 | 내 PC 사양에 의존 |
한 줄 요약: 성능은 조금 떨어져도, 무료·오프라인·프라이버시가 필요할 때 쓰는 도구입니다.
설치 전 확인할 것
Ollama를 원활하게 돌리려면 최소한의 하드웨어 사양이 필요합니다. 여기서 대부분 갈립니다.
- [ ] 메모리(RAM) 최소 8GB, 권장 16GB 이상
- [ ] 저장 공간 최소 10GB 여유 (모델 하나에 4~8GB)
- [ ] 맥(M1 이상) 또는 윈도우 10/11, 리눅스
- [ ] 관리자 권한 (설치용)
제 경험상 RAM 8GB짜리 노트북에서 7B(70억 파라미터) 모델을 돌리면 답변이 나올 때마다 1분 가까이 기다려야 했습니다. 반면 16GB M1 맥에서는 5~10초 안에 답이 나옵니다.
💡 파라미터 숫자(1B, 3B, 7B, 13B)는 모델의 "뇌 크기"입니다. 클수록 똑똑하지만, 그만큼 램·시간을 많이 먹습니다. 처음이라면 3B 이하부터 시작하세요.
맥에서 설치하고 첫 실행
맥 사용자는 공식 사이트에서 dmg 파일 하나만 받으면 끝입니다. 소요 시간 약 3분.
- ollama.com 접속 → "Download" 버튼 클릭
- 맥용 파일(Ollama-darwin.zip 또는 .dmg) 다운로드
- 압축 풀고 Ollama.app을 응용 프로그램 폴더로 드래그
- 실행하면 상단 메뉴바에 라마 아이콘이 뜹니다 (백그라운드 실행 중)
여기까지가 설치입니다. 이제 실제로 대화하려면 터미널을 엽니다. 터미널은 검은 화면에 명령어를 입력하는 프로그램인데, 맥에서는 Cmd + Space 눌러 "터미널" 검색하면 나옵니다.
터미널이 열리면 아래 한 줄을 그대로 붙여 넣고 Enter를 누릅니다.
ollama run llama3.2
이 명령은 "Llama 3.2라는 모델을 다운로드하고 바로 실행해줘"라는 뜻입니다. 처음 실행할 땐 모델 다운로드(약 2GB, 대략 3~10분)가 먼저 진행되고, 끝나면 >>> 표시가 뜹니다. 여기에 한국어로 질문해도 됩니다.
>>> 파이썬으로 엑셀 파일 여는 코드 알려줘
종료할 땐 /bye를 입력하거나 Ctrl + D를 누릅니다.
윈도우에서 설치할 때 주의점
윈도우 사용자는 OllamaSetup.exe를 받아 더블 클릭하면 됩니다. 다만 초보자가 자주 막히는 지점이 몇 개 있습니다.
터미널 열기: 시작 메뉴에서 "PowerShell" 또는 "명령 프롬프트"를 검색해 실행합니다. 검은 창이 뜨면 맥과 똑같이 ollama run llama3.2를 입력합니다.
방화벽 경고: 첫 실행 시 "네트워크 접근을 허용하시겠습니까?" 창이 뜹니다. 허용을 눌러야 모델 다운로드가 됩니다.
GPU 인식: 엔비디아 그래픽카드가 있으면 자동으로 잡히지만, 인식 안 되는 경우가 있습니다. 저는 노트북 내장 그래픽으로 강제 실행되는 문제가 있어서, CUDA 드라이버(엔비디아 공식 GPU 가속 소프트웨어)를 최신으로 업데이트하고 나서야 해결됐습니다.
CPU만으로도 돌아가긴 하는데, 답변 속도가 GPU 대비 5~10배 느립니다.
모델 고르는 기준
Ollama는 200개 넘는 모델을 지원합니다. 하지만 초보라면 아래 3~4개만 알면 충분합니다.
| 모델 | 크기 | 특징 | 추천 대상 |
|---|---|---|---|
| llama3.2 (3B) | 약 2GB | 가볍고 빠름, 한국어 준수 | RAM 8GB PC |
| llama3.1 (8B) | 약 4.7GB | 균형 좋음, 코딩 가능 | RAM 16GB 이상 |
| qwen2.5 (7B) | 약 4.4GB | 한국어·중국어 강함 | 다국어 작업 |
| gemma2 (2B) | 약 1.6GB | 초경량, 저사양 대응 | 오래된 노트북 |
새 모델을 받으려면 터미널에 ollama pull 모델이름을 입력합니다. 예를 들어:
ollama pull qwen2.5
이 명령은 "qwen2.5 모델을 다운로드만 하고 실행은 안 함"이라는 뜻입니다. 받아둔 모델 목록은 ollama list로 확인합니다.
솔직한 사용 후기 하나. 3B 모델은 간단한 요약·번역·코드 스니펫 정도는 잘합니다. 하지만 긴 문서 분석이나 복잡한 논리 추론은 GPT-4o에 확실히 못 미칩니다. "무료 대체품" 관점에서 접근해야 실망이 적습니다.
자주 막히는 부분
제가 처음 셋업할 때 헤맸던 것들, 그리고 커뮤니티에 자주 올라오는 질문들입니다.
ollama: command not found 에러 설치는 됐는데 터미널이 명령어를 못 찾을 때 뜹니다. 맥은 터미널을 완전히 종료(Cmd + Q)했다가 다시 열면 대부분 해결됩니다. 그래도 안 되면 재부팅.
답변이 너무 느립니다
- 모델을 더 작은 것으로(예: 8B → 3B) 바꿉니다
- 다른 무거운 프로그램을 종료합니다
- 그래도 느리면 하드웨어 한계입니다. 5~7B 모델은 최소 16GB RAM에서 쾌적합니다.
한국어가 어색합니다 Llama 계열은 영어에 최적화돼 있어 한국어가 종종 어색합니다. 한국어 위주라면 qwen2.5나 한국어 파인튜닝 모델(예: EEVE-Korean 계열)을 찾아보세요. Ollama 공식 라이브러리 페이지에서 "korean"으로 검색하면 몇 개 나옵니다.
디스크가 부족합니다 모델은 기본적으로 ~/.ollama/models(맥·리눅스) 또는 C:\Users\사용자명\.ollama\models(윈도우)에 저장됩니다. 쓸모없어진 모델은 ollama rm 모델이름으로 삭제하면 됩니다.
⚠️ 모델 하나가 4~8GB라 몇 개만 받아도 SSD 20~30GB가 훅 사라집니다. 저는 이걸 몰라서 저장 공간 경고를 두 번 겪었습니다.
웹 UI로 편하게 쓰는 법
터미널 검은 화면이 부담스럽다면 Open WebUI라는 무료 도구로 ChatGPT처럼 예쁜 웹 화면에서 대화할 수 있습니다. 대화 내역 저장, 여러 모델 전환도 됩니다.
다만 설치가 조금 복잡해서(Docker라는 별도 프로그램 필요) 이 글에서는 이름만 소개합니다. 어느 정도 익숙해진 뒤 검색해보시면 튜토리얼이 많이 나옵니다.
터미널만으로 부족하지 않은지, 기본기부터 며칠 써보고 결정하시길 권합니다. 저는 처음엔 웹 UI에 욕심냈다가 설치가 꼬여서 하루를 날렸습니다.
마무리
Ollama의 진입 장벽은 낮습니다. 파일 하나 받고 명령어 한 줄만 알면 오늘 안에 로컬 LLM을 굴려볼 수 있습니다.
다만 기대치 관리가 중요합니다. GPT-4o 대체품이라기보단 "인터넷 끊긴 비행기 안에서 요약·번역·간단한 코드 도우미가 필요할 때" 진가가 나옵니다. 회사 문서처럼 외부 유출이 조심스러운 자료를 다룰 때도 좋고요.
오늘 해볼 액션은 이렇습니다. 먼저 ollama.com에서 설치 파일을 받고, ollama run llama3.2로 3B 모델을 실행해 평소 ChatGPT에 묻던 질문을 그대로 던져보세요. 답변 품질과 속도가 내 용도에 맞는지 감이 잡히면, 그때부터 더 큰 모델이나 웹 UI로 확장하면 됩니다.
함께 보면 좋은 글
'개발 & 기술 > DevOps·인프라' 카테고리의 다른 글
| 홈서버 소음 줄이는 법: 팬·케이스·설치 위치 점검 순서 (0) | 2026.07.17 |
|---|---|
| 홈서버 전기요금 계산법: 미니PC·NAS·라즈베리파이 비교 (0) | 2026.07.16 |
| Cloudflare Tunnel 5분 입문: 포트포워딩 없이 외부 접속 (0) | 2026.06.27 |
| Docker로 AI 모델 로컬 실행하기 — Ollama 5분 가이드 (0) | 2026.06.24 |
| Claude Desktop 메모리 너무 먹을 때 1.8GB 줄이는 법 (0) | 2026.06.21 |