Ollama · 로컬 LLM · REST API
Ollama로 로컬 LLM 실행 구조 이해하기
Ollama의 CLI·로컬 API·모델 저장소가 연결되는 흐름을 확인하고 가장 작은 채팅 요청을 실행합니다.
무료 공개 · 최근 수정
로컬 모델과 애플리케이션 연결하기
LLM을 사용하는 가장 익숙한 방법은 클라우드 API에 요청을 보내는 것입니다. 시작은 쉽지만 네트워크 연결, 외부 전송 정책과 사용량 기반 비용을 함께 고려해야 합니다. 반대로 개인 PC나 사내 서버에서 모델을 실행하면 데이터 경로와 실행 환경을 직접 통제할 수 있습니다. 이때도 모델 파일만 내려받는다고 애플리케이션이 곧바로 대화할 수 있는 것은 아닙니다. 모델을 읽고 계산을 수행하며 요청을 받을 실행기가 필요합니다.
Ollama는 모델을 내려받고 로컬에서 실행하며 HTTP API로 노출하는 런타임입니다. 모델 자체와 Ollama를 같은 것으로 보지 않는 것이 중요합니다. 모델은 학습된 가중치와 설정이고, Ollama는 이를 저장·적재해 추론을 수행하는 프로그램입니다. CLI와 Python 애플리케이션은 Ollama에 요청하는 클라이언트입니다. 이 구분을 알면 “모델이 없다”, “서버에 연결할 수 없다”, “메모리가 부족하다”는 서로 다른 문제를 구별할 수 있습니다.
다음 그림은 클라이언트, 로컬 API, 런타임과 모델 저장소의 관계를 보여 줍니다.
그림: 클라이언트 요청을 Ollama 런타임이 로컬 모델 추론으로 연결합니다.
설치 뒤 터미널에서 모델을 실행합니다. 처음 지정한 모델이 로컬에 없다면 다운로드가 먼저 진행됩니다. 모델 이름의 태그는 크기나 변형을 구분하므로, 필요한 메모리와 기대 품질을 실제 장비에 맞춰 선택합니다.
ollama run gemma3:1b다른 터미널에서는 로컬 채팅 API를 호출할 수 있습니다.
curl http://localhost:11434/api/chat -d '{
"model": "gemma3:1b",
"messages": [{"role": "user", "content": "한 문장으로 자신을 소개해 줘."}],
"stream": false
}'성공하면 JSON 응답의 message.content에 모델의 답이 들어갑니다. stream: false는 예제를 한 번의 JSON 응답으로 확인하기 위한 설정이며, 대화형 화면은 스트리밍 응답을 받아 생성되는 내용을 바로 표시할 수도 있습니다. 모델 다운로드가 끝나지 않았거나 서버가 실행 중이 아니면 먼저 ollama list와 프로세스 상태를 확인합니다.
요청 경로를 순서대로 점검하면 문제를 빨리 좁힐 수 있습니다. 먼저 CLI에서 같은 모델이 실행되는지 확인하고, 다음으로 localhost:11434의 API가 응답하는지 확인합니다. 마지막으로 애플리케이션의 모델 이름과 메시지 형식이 API 요청과 일치하는지 살펴봅니다. 모델 실행 문제와 클라이언트 코드 문제를 한꺼번에 고치려 하면 원인이 흐려집니다.
로컬 실행의 범위 이해하기
로컬 실행은 입력이 외부 모델 API로 자동 전송되지 않게 구성할 수 있다는 장점이 있습니다. 그러나 애플리케이션이 별도의 검색 API나 원격 도구를 호출하면 그 데이터는 외부로 나갈 수 있습니다. 운영체제의 로그, 백업과 원격 관측 서비스도 데이터 경로에 포함됩니다. 로컬 모델 실행과 전체 시스템의 오프라인 동작 또는 개인정보 보호는 같은 뜻이 아닙니다.
모델 크기, 양자화 방식, 컨텍스트 길이에 따라 메모리와 응답 시간이 달라집니다. 작은 모델은 설치와 응답이 가벼운 대신 복잡한 지시나 긴 문맥에서 품질이 낮을 수 있습니다. 큰 모델도 장비 메모리를 넘으면 느려지거나 실행되지 않습니다. 이름만 보고 선택하기보다 대표 질문으로 첫 응답 시간, 초당 생성량, 메모리 사용량과 답변 품질을 함께 측정합니다.
로컬 모델은 민감한 초안 작성, 네트워크가 불안정한 현장, 반복 호출이 많은 실험에 특히 유용합니다. 다만 운영할 장비가 제각각이거나 최고 수준의 모델 품질이 우선이라면 원격 API가 더 단순할 수 있습니다. 요구 사항에 따라 로컬과 원격 모델을 같은 인터페이스 뒤에 두는 방식도 가능합니다. 다음 단계에서는 LCEL 파이프라인으로 Ollama 호출 전후 처리를 연결합니다.
참고 문서
설명이 어렵거나 잘못된 부분을 발견하셨나요?
문서 수정 의견 보내기