GTX 1660 6GB에서 35B 로컬 모델 돌리기 실측

측정 결과부터

증상: 그래픽카드 메모리가 6GB라서 14B 이상 밀집 모델은 CPU로 넘쳐 매우 느렸습니다.

원인: 밀집 모델은 글자 하나를 만들 때마다 전체가 일하지만, MoE 모델은 일부(3B)만 일합니다.

해결: MoE 구조인 Qwen3.6-35B-A3B의 4비트판(23GB)을 올라마로 받아 램 64GB에 올리니 쓸 만한 속도로 돌았습니다.

6GB 그래픽카드로는 7B가 한계인 줄 알았다

제 PC의 그래픽카드는 GTX 1660 SUPER, 메모리 6GB입니다. 이 크기에 통째로 들어가는 밀집(dense) 모델은 4비트로 눌러도 7B 정도까지였습니다. 14B 이상은 그래픽카드에 다 못 올라가 CPU로 넘치고, 그러면 답이 매우 느리게 나왔습니다.

점수만 보면 더 좋은 모델이 있었습니다. 코딩 점수 77.2점인 Qwen3.6-27B와 한국어가 강한 국산 32B 모델입니다. 하지만 둘 다 밀집 구조라 이 그래픽카드에서는 쓸 수 없었습니다. 점수표만 보고 고르면 받아 놓고 못 쓰게 됩니다.

밀집 모델과 MoE 모델은 일하는 양이 다르다

밀집 모델은 글자 하나를 만들 때 모든 파라미터가 계산에 참여합니다. 그래서 모델 전체가 빠른 메모리(그래픽카드)에 있어야 속도가 납니다.

MoE(Mixture of Experts) 모델은 덩치는 크지만 한 번에 일하는 부분이 작습니다. Qwen3.6-35B-A3B는 전체 35B 가운데 3B만 한 글자마다 일합니다. 그래서 자주 쓰는 부분만 그래픽카드에 두고 나머지는 램에 두어도 전체 속도가 크게 떨어지지 않습니다.

대신 램이 넉넉해야 합니다. 이 PC는 램이 64GB라서 23GB짜리 모델을 올릴 수 있었습니다. 램이 32GB였다면 이 방법은 쓰지 못했을 것입니다.

모델 구조 이 PC에서
Qwen3.6-27B (77.2점) 밀집 너무 느려 못 씀
국산 32B 모델 밀집 못 씀
Qwen3.6-35B-A3B (73.4점) MoE, 한 번에 3B 씀

받는 법: 4비트판을 올라마로

원본 모델은 70GB가 넘어서 이 PC에 들어가지 않습니다. 4비트로 눌러 담은 판(q4_K_M, 23GB)을 받습니다. 모델 저장 위치를 먼저 정해 두지 않으면 C 드라이브가 금방 차니, 받기 전에 올라마 모델 저장 위치 바꾸는 글을 먼저 보시는 편이 좋습니다.

ollama pull qwen3.6:35b-a3b-q4_K_M
ollama list

이름은 이렇게 읽습니다. qwen3.6은 모델 계열, 35b는 전체 크기, a3b는 한 번에 일하는 부분 3B, q4_K_M은 4비트로 눌러 담은 판이라는 뜻입니다.

같은 계열에 다른 판도 있습니다. 고르기 전에 구조부터 봅니다.

태그 내용
qwen3.6:35b-a3b-q4_K_M 이 글에서 쓴 다용도판(글, 그림 읽기, 도구)
qwen3.6:35b-a3b-coding 코딩 특화판, 크기 같음. 두 판의 차이는 아직 재 보지 않았습니다
qwen3.6:27b 밀집 모델이라 6GB 그래픽카드로는 못 돌립니다

참고로, 전문가 층을 더 세밀하게 CPU로 보내는 옵션은 llama.cpp의 --n-cpu-moe입니다. 올라마는 이 세밀한 제어를 지원하지 않는다고 조사되었지만, 저는 llama.cpp로 직접 재 보지는 않았습니다. 이 글의 수치는 전부 올라마 기본 설정에서 잰 것입니다.

실제로 잰 속도와 메모리

항목 결과
내려받기 약 40분 (초당 11MB)
처음 켤 때 23GB 읽기 65초
그 뒤 생성 속도 초당 약 15.4
생각(thinking)을 끈 생성 속도 초당 약 18.7, 한 문장 답 2.5초
메모리 차지 램과 그래픽카드 합쳐 29.6GB (그중 그래픽카드 3.1GB)

생성 속도의 단위는 제 기록에 "초당 글자"로 적어 두었지만, 토큰 단위였을 수도 있어 여기서는 숫자만 옮깁니다. 확실한 것은 그래픽카드는 3.1GB만 쓰고 나머지를 램이 받쳤다는 점입니다.

이 모델로 직접 확인한 기능은 글쓰기와 대화, 그림 읽기, 도구 부르기입니다. 생각(thinking)은 기본으로 켜져 있습니다. 생각을 끄면 빨라지지만 다른 문제가 생기는데, 이것은 Qwen 생각 모드를 끄면 생기는 일에 따로 정리했습니다.

제대로 돌고 있는지 보는 법

받은 뒤 ollama list에 이름이 보이면 내려받기는 끝난 것입니다. 처음 질문을 던지면 23GB를 읽느라 1분 남짓 아무 답이 없는데, 이것은 고장이 아닙니다. 이 PC에서는 65초 뒤부터 글이 나오기 시작했습니다.

두 번째 질문부터는 읽기 없이 바로 답이 나와야 정상입니다. 매번 1분씩 기다린다면 모델이 램에서 내려가고 있는 것이니, 모델을 물려 두는 시간(OLLAMA_KEEP_ALIVE)을 확인합니다. 이 PC는 60분으로 두었습니다.

측정한 환경

항목 값
운영체제 윈도우
그래픽카드 NVIDIA GeForce GTX 1660 SUPER 6GB
CPU Ryzen 7 3700X 8코어
램 64GB
올라마 0.34.4
확인한 날짜 2026년 9월 27일에서 28일

이 글의 내용은 2026년 10월 5일에 마지막으로 확인했습니다. 틀린 곳을 발견하시면 연락처로 알려 주세요.