Ollama CUDA 오류: GPU 실행 실패 원인과 해결 방법

Quick Answer
먼저 보는 핵심 답변
Ollama CUDA 오류로 NVIDIA GPU 실행이 실패하거나 CPU로 전환될 때 초기화 오류 코드, 드라이버 호환성, VRAM 부족, Linux·Windows·WSL2·Docker 설정을 진단하고 해결하는 방법입니다.
Search Intent
이 글에서 해결할 문제
- 이런 분께
- Ollama CUDA 초기화 오류, GPU 실행 실패, VRAM 부족 또는 CPU 전환 원인을 로그와 실행 환경별로 찾아 해결하려는 사용자
- 읽고 나면
- GPU 인식, CUDA 초기화, 메모리 할당, 서비스 환경과 Container Runtime 중 실패 단계를 구분하고 동일 모델로 복구 여부를 검증할 수 있습니다.
- 다루는 범위
- NVIDIA CUDA 기반 GPU 인식·초기화·모델 실행 오류에 집중하며 AMD ROCm·Apple Metal 설정은 다루지 않습니다.
- 직접 확인
- 호스트와 실제 Ollama 실행 환경에서 nvidia-smi가 각각 성공하는지 확인합니다.
- 모델 실행 중 ollama ps의 PROCESSOR 열과 Ollama 서버 로그를 함께 확인합니다.
- 설정 변경 뒤 동일 모델·프롬프트로 GPU 사용률과 PROCESSOR 결과를 다시 기록합니다.
Ollama CUDA 오류는 GPU를 아예 찾지 못하는 경우뿐 아니라 장치는 보이지만 CUDA 초기화나 VRAM 할당에서 모델 실행이 실패하는 경우도 포함합니다. CUDA Toolkit 하나를 다시 설치하기 전에 NVIDIA 드라이버, Ollama가 실행되는 서비스·WSL2·Docker의 장치 접근, 모델 크기와 동시 실행 설정을 분리해서 확인해야 합니다. 이 글은 GPU 인식 안됨, CPU 전환, CUDA 오류 코드와 GPU runner 실행 실패를 한 대표 URL에서 진단하는 방법을 설명합니다.
기존 GPU 인식 진단에 CUDA 초기화 오류 코드 3·46·100·999, 드라이버 호환 오류, VRAM 할당 실패, 강제 LLM library 설정과 상세 로그 수집 절차를 추가했습니다. 같은 검색 의도의 문서를 새로 만들지 않고 기존 대표 글을 확장해 중복 콘텐츠와 키워드 자기 경쟁을 피했습니다.
nvidia-smi로 호스트 드라이버를 확인한 뒤 모델을 실행하고 ollama ps의 PROCESSOR 열을 확인하세요. Linux는 journalctl -u ollama, Windows는 %LOCALAPPDATA%\Ollama\server.log, Docker는 docker logs에서 GPU discovery 오류를 찾습니다. 호스트에서는 GPU가 보이지만 Ollama에서만 보이지 않는다면 서비스 환경 변수, NVIDIA UVM, WSL 드라이버 또는 NVIDIA Container Toolkit을 차례로 점검합니다.Ollama 실행에서 우선 확인할 것은
nvcc --version이 아니라 nvidia-smi가 정상인지입니다. nvidia-smi의 CUDA Version은 현재 드라이버가 지원하는 CUDA 수준을 나타내며 PC에 설치된 Toolkit 버전과 같은 의미가 아닙니다. CUDA 코드를 직접 컴파일하지 않는다면 Toolkit 설치 여부보다 지원 GPU, NVIDIA 드라이버와 Ollama 실행 환경의 장치 접근이 더 중요합니다.Connection refused나 11434 접속 실패는 Ollama 서버 연결 오류 가이드, command not found·model not found는 설치 경로와 모델 설정 가이드, GPU가 보이지만 모델 로드 중 메모리 할당이 실패하면 RAM·VRAM 부족 가이드가 대표 문서입니다. 오류 문구에 맞는 한 문서부터 적용하면 설정을 중복 변경하는 일을 줄일 수 있습니다.2026년 9월 24일 Ollama와 NVIDIA 공식 문서를 기준으로 확인했습니다. 특정 PC에서 실행한 성공 후기나 성능 수치가 아니라 사용자가 자신의 Linux, Windows·WSL2 또는 Docker 환경에서 결과를 기록할 수 있는 진단 절차입니다. 드라이버와 Ollama 지원 범위는 바뀔 수 있으므로 업데이트 전 연결된 공식 문서를 다시 확인하세요.
Ollama가 정말 GPU를 사용하지 않는지 확인하기
응답이 느리다는 이유만으로 GPU 인식 실패라고 판단하면 안 됩니다. 모델 크기, context 길이, VRAM 부족과 첫 로딩 시간도 속도에 영향을 줍니다. 모델을 실제로 실행한 상태에서 별도 터미널을 열고 다음 두 명령을 확인하세요.
# Ollama에 현재 로드된 모델과 CPU·GPU 비율 확인
ollama ps
# NVIDIA GPU, 드라이버, VRAM과 실행 프로세스 확인
nvidia-smi
Ollama 공식 FAQ에 따르면 PROCESSOR가 100% GPU이면 모델 전체가 GPU에 올라간 상태이고, 100% CPU이면 시스템 메모리에서 실행됩니다. 48%/52% CPU/GPU처럼 표시되면 일부만 GPU에 올라간 것이므로 GPU를 전혀 인식하지 못한 상태와 구분해야 합니다.
5분 진단표
| 확인 결과 | 가능성이 높은 원인 | 다음 단계 |
|---|---|---|
nvidia-smi 자체가 실패 | 드라이버 미설치·손상, 장치 비활성화 | Ollama보다 NVIDIA 드라이버부터 복구 |
| 호스트에서는 성공, Docker에서 실패 | Container Toolkit 또는 --gpus 누락 | 컨테이너 Runtime 검증 |
| Windows에서는 성공, WSL에서 실패 | WSL·Windows 드라이버 연결 문제 | WSL 업데이트와 드라이버 설치 위치 확인 |
모두 성공하지만 100% CPU | 지원 범위, 환경 변수, GPU discovery 실패 | Ollama 로그와 서비스 환경 확인 |
| CPU/GPU 혼합 표시 | VRAM보다 모델·context 요구량이 큼 | 작은 양자화 모델과 context로 재검증 |
| 절전 복귀 뒤 CPU로 전환 | Linux NVIDIA UVM 재개 문제 | 작업 종료 후 UVM 모듈 재적재 검토 |
Ollama CUDA 오류 메시지별 원인과 해결 방향
| 로그·증상 | 의미 | 먼저 확인할 항목 |
|---|---|---|
| 오류 코드 3 | CUDA가 초기화되지 않은 상태의 예 | 드라이버 재부팅, UVM, 서비스 로그 |
| 오류 코드 46 | GPU 장치를 현재 사용할 수 없음 | 다른 작업, device 접근, container Runtime |
| 오류 코드 100 | CUDA 장치를 찾지 못함 | nvidia-smi, visible devices, WSL·Docker 전달 |
| 오류 코드 999 | 드라이버가 반환한 알 수 없는 오류 | dmesg, NVRM·Xid, 재부팅과 최신 드라이버 |
cudaErrorCallRequiresNewerDriver | 사용 기능에 더 새 드라이버가 필요 | NVIDIA 최소 드라이버와 Ollama 지원 기준 |
| 메모리 할당 실패·GPU runner 종료 | 모델·context·병렬 실행이 VRAM을 초과했을 가능성 | ollama ps, nvidia-smi, 작은 모델 비교 |
Ollama 공식 문제 해결 문서는 3·46·100·999를 GPU discovery나 초기화 실패에서 볼 수 있는 예로 제시합니다. 오류 숫자 하나만으로 부품 고장이나 재설치 필요성을 단정하지 말고 같은 시각의 Ollama 로그, nvidia-smi와 커널 로그를 함께 보세요.
NVIDIA GPU와 드라이버 지원 범위 확인
현재 Ollama 공식 하드웨어 문서는 NVIDIA GPU의 compute capability 5.0 이상과 드라이버 550 이상을 지원 기준으로 제시합니다. compute capability 5.0~6.2 GPU는 드라이버 570 이상이 필요하다고 별도로 안내합니다. GPU 이름만 보고 판단하지 말고 공식 지원표에서 architecture와 compute capability를 함께 확인하세요.
nvidia-smi
nvidia-smi -L
첫 명령에서 GPU 이름과 Driver Version이 표시돼야 합니다. 두 번째 명령은 여러 GPU의 index와 UUID를 보여줍니다. 여러 장을 사용한다면 숫자 index는 재부팅 후 순서가 달라질 수 있으므로 Ollama 문서가 권장하는 UUID를 기록하는 편이 안전합니다.
CUDA 버전 불일치라고 표시될 때 이해할 점
nvidia-smi의 CUDA Version과 nvcc --version 결과가 달라도 곧바로 오류는 아닙니다. NVIDIA는 CUDA 11 이후 같은 major 계열에서 최소 드라이버 조건을 만족하면 minor version compatibility가 적용될 수 있다고 설명합니다. 예를 들어 NVIDIA 문서상 CUDA 12.x의 최소 드라이버 범위는 525 이상, CUDA 13.x는 580 이상입니다. 하지만 Ollama 자체의 현재 지원 기준은 별도로 확인해야 하므로 NVIDIA 일반 호환성 표만 보고 구형 드라이버를 유지하지 마세요.
nvidia-smi실패: 드라이버 단계 문제입니다.nvidia-smi성공·nvcc없음: CUDA 개발 도구가 없다는 뜻이며 Ollama GPU 실패의 직접 증거는 아닙니다.- 로그에 initialization·device unavailable 오류: Ollama가 실제로 GPU를 여는 단계에서 실패한 것입니다.
- 새 드라이버 설치 뒤에도 이전 모듈 사용: 재부팅 후 버전을 다시 확인합니다.
CUDA 초기화는 되지만 모델 실행이 실패할 때
GPU inventory가 로그에 나오는데 모델을 불러오는 순간 실패하면 discovery 단계보다 VRAM, context와 병렬 실행을 먼저 확인합니다. Ollama는 모델을 일정 시간 메모리에 유지할 수 있으므로 이전 모델이 VRAM을 차지하고 있을 수도 있습니다.
# 현재 로드된 모델 확인
ollama ps
# 사용하지 않는 모델을 명시적으로 내리기
ollama stop <model-name>
# GPU별 VRAM과 프로세스 확인
nvidia-smi
- 사용하지 않는 모델과 다른 CUDA process를 종료합니다.
- 같은 계열의 더 작은 양자화 모델로 실행 여부를 비교합니다.
- context 길이와 병렬 요청 수를 낮춰 메모리 요구량을 줄입니다.
- 작은 모델은 성공하고 큰 모델만 실패하면 드라이버 재설치보다 VRAM 예산을 조정합니다.
- 모든 모델이 같은 초기화 오류로 실패하면 driver·UVM·container 계층으로 돌아갑니다.
Ollama FAQ는 병렬 요청이 늘면 필요한 메모리가 OLLAMA_NUM_PARALLEL × OLLAMA_CONTEXT_LENGTH에 따라 증가한다고 설명합니다. 임계값을 무작정 크게 잡기보다 한 모델·한 요청으로 복구를 확인한 뒤 단계적으로 늘리세요.
LLM Library 강제 설정이 남아 있는지 확인
Ollama는 여러 GPU·CPU용 LLM library 가운데 환경에 맞는 항목을 자동 선택합니다. 과거 문제 해결을 위해 OLLAMA_LLM_LIBRARY=cpu 또는 cpu_avx2를 강제로 설정했다면 GPU가 정상이어도 CPU library를 사용할 수 있습니다.
# 현재 shell 확인
printenv OLLAMA_LLM_LIBRARY
# systemd 서비스 확인
sudo systemctl show ollama --property=Environment
강제 설정은 Ollama 문서에서도 실험적 override로 설명합니다. 값이 필요한 이유를 확인할 수 없다면 설정을 제거하고 서비스를 재시작한 뒤 자동 감지 로그를 다시 확인하세요. 임의의 CUDA library 이름을 추측해 강제하는 방식은 권장하지 않습니다.
CUDA 상세 로그를 수집하는 방법
기본 로그만으로 원인을 구분하기 어렵다면 한 번의 재현에 한해 상세 로그를 켜고 오류 시각과 전체 문맥을 보존합니다. Linux에서 Ollama 공식 문서는 CUDA_ERROR_LEVEL=50을 추가 진단에 사용할 수 있다고 안내합니다.
# 터미널에서 직접 재현하는 예시
CUDA_ERROR_LEVEL=50 OLLAMA_DEBUG=1 ollama serve
systemd 서비스는 systemctl edit ollama의 [Service] 아래에 두 변수를 추가한 뒤 daemon reload와 재시작이 필요합니다. 로그에는 사용자 경로, 모델 이름과 환경 설정이 포함될 수 있으므로 공개 게시 전 민감 정보를 제거하세요. 진단이 끝나면 debug 변수를 제거해 불필요한 로그 증가를 막습니다.
Linux에서 Ollama GPU 인식 안됨 해결 순서
1. 호스트 드라이버와 Ollama 상태 확인
nvidia-smi
ollama -v
sudo systemctl status ollama --no-pager
sudo journalctl -u ollama --no-pager -n 200
로그에서 GPU inventory, CUDA library와 VRAM 관련 메시지를 찾습니다. Ollama 공식 문제 해결 문서는 GPU discovery 실패 시 오류 코드 3은 초기화되지 않음, 46은 장치 사용 불가, 100은 장치 없음, 999는 알 수 없는 오류의 예로 안내합니다. 코드만 검색해 임의 패키지를 설치하지 말고 바로 앞뒤 로그와 dmesg를 함께 보세요.
2. 서비스가 받은 환경 변수 확인
sudo systemctl show ollama --property=Environment
sudo systemctl cat ollama
현재 shell에 설정한 환경 변수는 systemd 서비스에 자동 전달되지 않습니다. 특히 CUDA_VISIBLE_DEVICES=-1 또는 존재하지 않는 ID는 GPU를 숨기고 CPU 사용을 강제할 수 있습니다. 여러 GPU를 제한하려는 목적이라면 먼저 nvidia-smi -L로 UUID를 확인하고 서비스 override에 정확히 설정하세요.
sudo systemctl edit ollama
[Service]
Environment="CUDA_VISIBLE_DEVICES=GPU-여기에-확인한-UUID"
sudo systemctl daemon-reload
sudo systemctl restart ollama
sudo journalctl -u ollama --no-pager -n 100
3. NVIDIA UVM 상태 확인
lsmod | grep nvidia_uvm
sudo nvidia-modprobe -u
Ollama 공식 문서는 Linux에서 suspend/resume 뒤 GPU가 사라지는 경우 NVIDIA UVM 모듈 재적재를 해결책으로 제시합니다. 다음 명령은 GPU 작업에 영향을 줄 수 있으므로 실행 중인 CUDA 작업과 모델을 종료하고, 원격 서버라면 복구 경로를 확보한 뒤 사용하세요.
sudo systemctl stop ollama
sudo rmmod nvidia_uvm
sudo modprobe nvidia_uvm
sudo systemctl start ollama
4. 커널 로그에서 드라이버 오류 확인
sudo dmesg | grep -i nvrm
sudo dmesg | grep -i nvidia
Xid, NVRM, 장치 이탈 메시지가 반복된다면 Ollama 설정만 바꾸기보다 드라이버, 전원, PCIe와 GPU 상태를 확인해야 합니다. 변경 전 로그, 드라이버 버전과 재현 시각을 보존하면 원인 비교가 쉬워집니다.
Windows에서 GPU가 인식되지 않을 때
Windows용 Ollama를 직접 실행한다면 먼저 PowerShell 또는 명령 프롬프트에서 nvidia-smi를 확인하세요. 그다음 작업 표시줄의 Ollama를 완전히 종료한 뒤 로그를 확인합니다.
# PowerShell
nvidia-smi
Get-Content "$env:LOCALAPPDATA\Ollama\server.log" -Tail 200
추가 로그가 필요하면 공식 안내대로 tray 앱을 종료하고 PowerShell에서 debug 모드로 시작합니다.
$env:OLLAMA_DEBUG="1"
& "ollama app.exe"
- NVIDIA Windows 드라이버를 최신 지원 버전으로 업데이트한 뒤 재부팅합니다.
- 사용자·시스템 환경 변수에 잘못된
CUDA_VISIBLE_DEVICES가 남아 있지 않은지 확인합니다. - 환경 변수를 바꿨다면 실행 중인 Ollama를 종료하고 시작 메뉴에서 다시 실행합니다.
- Windows 앱과 WSL 내부 Ollama를 동시에 실행 중인지 확인하고 어느 서버에 접속하는지 구분합니다.
WSL2에서 NVIDIA CUDA 연결 확인
WSL2에서는 Windows 호스트에 NVIDIA Windows 드라이버를 설치해야 합니다. NVIDIA 공식 가이드는 WSL 안에 Linux display driver를 별도로 설치하지 말라고 명시합니다. Windows 드라이버가 libcuda.so를 WSL에 제공하므로 Linux 드라이버 패키지로 이를 덮어쓰면 충돌할 수 있습니다.
# Windows PowerShell
wsl.exe --update
wsl.exe --shutdown
# WSL을 다시 연 뒤
nvidia-smi
CUDA 프로그램을 직접 컴파일해야 할 때만 WSL용 Toolkit을 검토하세요. NVIDIA는 WSL에서 cuda, cuda-12-x, cuda-drivers처럼 Linux 드라이버 설치를 시도하는 meta package를 피하고 cuda-toolkit-12-x 계열만 사용하라고 안내합니다. Ollama 진단에서는 Toolkit 설치보다 WSL 내부 nvidia-smi와 Ollama 로그가 우선입니다.
Docker에서 Ollama가 CPU만 사용할 때
Docker는 호스트 드라이버가 정상이어도 NVIDIA Container Toolkit과 GPU 전달 옵션이 없으면 GPU를 사용할 수 없습니다. 다음 순서로 컨테이너 계층을 분리해 확인하세요.
# 1. 호스트 확인
nvidia-smi
# 2. 컨테이너 Runtime 확인
docker run --rm --gpus all ubuntu nvidia-smi
# 3. 실행 중인 Ollama 로그 확인
docker logs --tail 200 ollama
두 번째 명령이 실패하면 Ollama container를 다시 만드는 것보다 NVIDIA Container Toolkit 설정을 먼저 고쳐야 합니다. Toolkit 설치 뒤 Docker Runtime을 구성하고 daemon을 재시작합니다.
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
GPU 전달 옵션을 포함해 Ollama container를 새로 실행하는 공식 예시는 다음과 같습니다. 기존 container 이름과 volume을 먼저 확인하고 데이터 volume을 삭제하지 마세요.
docker run -d --gpus=all \
-v ollama:/root/.ollama \
-p 11434:11434 \
--name ollama \
ollama/ollama
macOS의 Docker Desktop은 GPU passthrough가 없어 Ollama container의 GPU 가속을 사용할 수 없다고 Ollama FAQ가 안내합니다. Apple Silicon에서는 Docker 안의 CUDA가 아니라 macOS용 Ollama의 Metal 가속을 사용하는 구조가 다릅니다.
VRAM 부족과 GPU 미인식을 구분하는 방법
GPU가 정상 인식돼도 모델 전체가 VRAM에 들어가지 않으면 CPU와 GPU에 나눠 로드될 수 있습니다. 이는 discovery 실패가 아닙니다. 작은 양자화 모델과 짧은 context로 먼저 재검증하세요.
- 큰 모델을 중지하고 다른 GPU 작업의 VRAM을 비웁니다.
- 작은 모델을 실행한 뒤
ollama ps의PROCESSOR를 기록합니다. nvidia-smi에서 VRAM 사용량과 Ollama process가 나타나는지 확인합니다.- 작은 모델은 GPU, 큰 모델은 혼합으로 표시된다면 드라이버보다 VRAM 요구량 문제를 우선 봅니다.
context 길이와 병렬 요청 수가 커지면 필요한 메모리도 증가합니다. GPU를 억지로 고정하기보다 모델 크기, 양자화, context와 동시 실행 수를 함께 조정해야 합니다.
여러 NVIDIA GPU 중 하나만 사용하기
Ollama 공식 문서는 CUDA_VISIBLE_DEVICES에 쉼표로 구분한 GPU ID를 지정할 수 있다고 설명합니다. 숫자 index보다 UUID가 안정적입니다.
nvidia-smi -L
# 터미널에서 Ollama를 직접 실행할 때 예시
CUDA_VISIBLE_DEVICES=GPU-확인한-UUID ollama serve
systemd 서비스라면 terminal 앞에 붙인 값이 적용되지 않으므로 systemctl edit ollama에 설정해야 합니다. Windows 앱은 사용자 환경 변수를 바꾼 뒤 완전히 종료하고 다시 시작해야 합니다.
변경 후 GPU 사용을 검증하는 절차
# 터미널 1: 모델 실행
ollama run <model-name> "GPU 확인"
# 터미널 2: 로드 위치 확인
ollama ps
# 터미널 3: GPU와 VRAM 변화 관찰
watch -n 1 nvidia-smi
Windows PowerShell에서는 watch 대신 nvidia-smi -l 1을 사용할 수 있습니다. 수정 전후에 같은 모델, 같은 context와 같은 프롬프트를 사용하고 다음 내용을 기록하세요.
| 기록 항목 | 정상 판단 기준 | 주의점 |
|---|---|---|
Ollama PROCESSOR | GPU 또는 CPU/GPU 비율 표시 | 모델이 로드된 동안 확인 |
| GPU VRAM | 모델 실행 뒤 사용량 증가 | 다른 프로세스와 구분 |
| 서버 로그 | 반복되는 discovery 오류 없음 | 오류 앞뒤 문맥 보존 |
| 응답 결과 | 동일 요청이 정상 완료 | 속도만으로 성공 판단 금지 |
Ollama NVIDIA GPU 진단 체크리스트 CSV 내려받기
하지 않는 것이 좋은 해결 방법
- 원인을 확인하지 않고 CUDA Toolkit과 드라이버를 여러 경로로 중복 설치하지 않습니다.
- WSL2 안에 Linux NVIDIA display driver를 설치하지 않습니다.
- 지원 여부를 확인하지 않고 임의의 CUDA library를 Ollama 폴더에 복사하지 않습니다.
- GPU 작업이 실행 중인 서버에서 바로
rmmod를 실행하지 않습니다. CUDA_VISIBLE_DEVICES=-1이 남은 상태에서 드라이버만 반복 재설치하지 않습니다.- 큰 모델의 CPU/GPU 혼합 로드를 GPU 미인식으로 단정하지 않습니다.
최종 해결 체크리스트
호스트와 Ollama 실행 환경에서
nvidia-smi가 성공한다. GPU가 현재 Ollama 지원 범위에 포함된다. 서비스에 GPU를 숨기는 환경 변수가 없다. Docker라면 --gpus=all과 NVIDIA Runtime이 작동한다. WSL2라면 Windows 드라이버만 설치되고 WSL이 최신이다. 모델 실행 중 ollama ps에 GPU 비율이 표시된다. 서버 로그에 반복되는 GPU discovery 오류가 없다. 같은 모델로 수정 전후 결과를 기록했다.편집부 결론
Ollama GPU 인식 문제는 드라이버, 서비스, 가상화와 container 계층을 섞어서 보면 해결 시간이 길어집니다. nvidia-smi로 호스트를 먼저 확인하고, 실제 Ollama가 실행되는 환경에서도 같은 검사를 통과하는지 본 뒤 로그와 ollama ps로 판정하세요.
가장 흔한 오해는 CUDA Toolkit이 없다는 사실을 곧바로 GPU 인식 실패로 연결하는 것입니다. Ollama를 실행하려는 목적이라면 지원 GPU와 최신 드라이버, 장치 접근 권한이 먼저입니다. 변경은 한 번에 하나씩 적용하고 동일 모델로 재검증해야 어떤 조치가 효과가 있었는지 알 수 있습니다.
공식 문서와 함께 읽을 글
자주 묻는 질문
Ollama를 사용하려면 CUDA Toolkit을 반드시 설치해야 하나요?
GPU 드라이버가 정상이고 Ollama가 GPU를 발견하는지가 우선입니다. CUDA 프로그램을 직접 컴파일하지 않는다면 nvcc가 없다는 사실만으로 Ollama GPU 가속 실패라고 판단할 수 없습니다. 먼저 nvidia-smi, 서버 로그와 ollama ps를 확인하세요.
nvidia-smi에는 GPU가 나오는데 Ollama는 CPU만 사용합니다
Ollama가 다른 사용자·systemd 서비스·container 또는 WSL에서 실행되는지 확인하세요. CUDA_VISIBLE_DEVICES, NVIDIA UVM, 지원 드라이버와 Ollama 로그를 점검하고 작은 모델로 다시 검증합니다.
ollama ps에 CPU/GPU가 함께 표시되면 오류인가요?
반드시 오류는 아닙니다. 모델이나 context가 VRAM에 전부 들어가지 않아 일부가 시스템 메모리에 로드된 상태일 수 있습니다. 작은 모델에서 GPU 비율이 정상적으로 표시되는지 비교하세요.
Docker에서 --gpus all만 추가하면 되나요?
호스트 NVIDIA 드라이버와 NVIDIA Container Toolkit도 정상이어야 합니다. 먼저 docker run --rm --gpus all ubuntu nvidia-smi가 성공하는지 확인한 뒤 Ollama container를 점검하세요.
WSL2 안에도 NVIDIA Linux 드라이버를 설치해야 하나요?
아닙니다. NVIDIA 공식 가이드는 Windows 호스트 드라이버를 설치하고 WSL 안에는 Linux display driver를 설치하지 말라고 안내합니다. WSL용 개발 Toolkit이 필요하다면 드라이버를 포함하지 않는 전용 패키지를 선택해야 합니다.
절전 모드 이후에만 GPU를 인식하지 못합니다
Linux의 NVIDIA UVM resume 문제일 수 있습니다. 실행 중인 GPU 작업을 종료한 뒤 Ollama 공식 문서의 UVM 모듈 재적재 절차를 검토하거나 시스템을 재부팅하세요.
CUDA 오류 코드 999가 나오면 GPU가 고장 난 것인가요?
코드 999만으로 하드웨어 고장을 확정할 수 없습니다. 같은 시각의 Ollama 로그와 dmesg의 NVRM·NVIDIA 메시지를 확인하고, 실행 중인 CUDA 작업 종료와 재부팅, 최신 지원 드라이버 적용 후 동일 조건으로 재현되는지 확인하세요.
GPU를 인식하지만 모델 실행 때 메모리 오류가 발생합니다
다른 모델과 CUDA process를 내리고 더 작은 양자화 모델, 짧은 context와 병렬 요청 1개로 비교하세요. 작은 모델이 실행된다면 GPU discovery보다 모델·context·동시 실행에 필요한 VRAM 문제일 가능성이 높습니다.
드라이버를 업데이트한 뒤 무엇을 확인해야 하나요?
재부팅 후 nvidia-smi의 Driver Version, 실제 Ollama 실행 환경의 GPU 접근, 서버 로그와 모델 실행 중 ollama ps를 차례로 확인하세요. 이전과 같은 모델·프롬프트로 비교해야 합니다.
Evidence & Limitations
근거·검증 범위·업데이트 기록
확인한 근거
Ollama Hardware Support 공식 문서를 기준으로 핵심 사실을 확인하고, 사실과 편집부 해석을 구분했습니다.
경험 정보와 한계
직접 사용 후기나 자체 성능 시험이 아닌 공개 원문·공식 문서 기반 분석입니다. 실제 화면과 기능은 계정·기기·배포 시점에 따라 다를 수 있습니다.
게시·수정 기록
최초 게시 2026.09.24 11:35 · 최종 수정 2026. 09. 24.
전문 검토 영역
IT 매거진 편집부가 AI·소프트웨어·개발·모바일·보안·테크 비즈니스 관점에서 구성하고 팩트체크 데스크가 출처와 표현을 검토했습니다.
Related Articles
이 주제를 더 깊게 읽어보세요
현재 기사와 연결되는 배경·기술·시장 분석을 골라 바로 이동할 수 있습니다.


