올라마가 몇 분 동안 생각만 하고 답을 안 쓸 때

먼저 결론

겪은 일: 모델이 271초 동안 생각만 하고 답을 한 글자도 쓰지 않았습니다.

원인: 안 죽고 남은 llama-server 두 개가 램 48GB를 붙잡아, 올라마가 컨텍스트를 4,095토큰으로 줄였고 생각이 그 자리를 다 써 버렸습니다.

이렇게 풀었다: 작업 관리자에서 llama-server를 전부 끝내면 여유 램이 9.2GB에서 49.5GB로 돌아옵니다.

생각 표시만 길게 이어지고 답이 비었다

Qwen3.6-35B-A3B를 올라마로 돌리던 중이었습니다. 질문을 던지자 생각(thinking) 단계가 시작됐고, 271초가 지나도록 생각만 이어졌습니다. 그리고 답은 한 글자도 나오지 않은 채 끝났습니다.

평소에는 같은 모델이 짧은 질문에 몇 초 안에 답했습니다. 모델이 바뀐 것도, 질문이 특별히 긴 것도 아니었습니다. 그래서 모델 문제가 아니라 PC 상태 문제로 보고 로그부터 열었습니다.

유령 llama-server가 램을 먹고 있었다

올라마는 모델을 실제로 돌릴 때 llama-server라는 별도 프로세스를 띄웁니다. 설정을 바꾸느라 올라마를 여러 번 껐다 켜는 사이, 이 프로세스 두 개가 죽지 않고 남아 있었습니다. 각각 24GB, 합쳐 48GB를 붙잡고 있었습니다.

램 64GB 가운데 남은 것은 9.2GB뿐이었습니다. 이 상태에서 올라마는 모델을 올리면서 기억 용량(컨텍스트)을 4천 토큰 남짓으로 줄였습니다. 생각이 기본으로 켜진 모델이라, 생각하는 데 그 자리를 다 써 버리고 답을 쓸 자리가 남지 않은 것입니다.

항목 정리 전 정리 후
남아 있던 llama-server 2개 (각 24GB, 합 48GB) 0개
여유 램 9.2GB 49.5GB
로그의 컨텍스트 n_tokens = 4095, truncated = 1 (다시 재지 않음)
정리 전 결과 271초 생각, 답 0자

여기서 헷갈리기 쉬운 점이 있습니다. 환경 변수로 기억 용량을 32768로 정해 두었어도, 남은 램이 모자라면 올라마는 그보다 작게 잡습니다. 설정값만 보고 "기억 용량은 충분하다"고 판단하면 원인을 놓칩니다. 실제로 잡힌 값은 로그와 실행 상태 API로 봐야 합니다.

server.log에서 잘림 표시를 찾는다

이 증상인지는 올라마 서버 로그로 가릴 수 있습니다. 메모장으로 열어 truncated를 찾습니다.

C:\Users\<사용자>\AppData\Local\Ollama\server.log

아래 같은 줄이 있으면 입력이 컨텍스트 한도에서 잘린 것입니다. 숫자 4095는 한도가 4천 남짓으로 잡혔다는 뜻입니다.

n_tokens = 4095, truncated = 1

지금 램에 올라와 있는 모델과 잡힌 기억 용량은 브라우저 주소창으로도 볼 수 있습니다. 올라마의 실행 상태 API입니다.

http://127.0.0.1:11434/api/ps

프로세스 셋을 다 끝내고 다시 켠다

  1. 작업 관리자의 세부 정보 탭에서 llama-server를 찾아 전부 끝냅니다.
  2. 올라마를 껐다 켤 때는 ollama, ollama app, llama-server 셋을 다 끝낸 뒤 새로 실행합니다.
  3. 다시 질문을 던지고, server.log에 잘림 표시가 새로 찍히지 않는지 봅니다.

파워셸로 남은 프로세스를 먼저 세어 보고 끝낼 수도 있습니다.

Get-Process llama-server -ErrorAction SilentlyContinue
Get-Process ollama*, llama-server -ErrorAction SilentlyContinue | Stop-Process

이 PC에서는 끝내자마자 여유 램이 9.2GB에서 49.5GB로 돌아왔습니다. 램이 돌아오면 올라마가 기억 용량을 억지로 줄일 이유도 사라집니다. 올라마를 껐다 켜야 하는 일, 예를 들어 모델 저장 위치를 바꾼 뒤에는 이 프로세스가 남기 쉬우니 특히 챙깁니다.

평소에 느려졌을 때도 같은 순서로 봅니다. 먼저 유령 llama-server가 있는지, 다음은 대화가 너무 길어지지 않았는지, 마지막으로 기억 용량이 너무 크게 잡히지 않았는지입니다. 기억 용량 기본값은 OLLAMA_CONTEXT_LENGTH=32768로 두었습니다.

한 가지 덧붙이면, 이 사고는 한 번 겪은 것입니다. 컨텍스트 값을 일부러 바꿔 가며 같은 증상을 다시 만들어 보지는 않았습니다. 생각이 답 자리를 먹는 문제 자체는 Qwen 생각 모드를 끄면 생기는 일과도 이어집니다.

확인한 환경

항목 값
운영체제 윈도우
램 64GB
올라마 0.34.4
모델 qwen3.6:35b-a3b-q4_K_M
확인한 날짜 2026년 9월 27일에서 28일

이 글의 내용은 2026년 10월 5일에 마지막으로 확인했습니다. 틀린 곳을 발견하시면 연락처로 알려 주세요.