생각(thinking)을 끄면 로컬에서는 초당 약 15.4에서 18.7로 빨라졌지만, 헛소리가 늘고 답의 구조가 조용히 달라졌습니다. 생각 출력은 버려지는 것처럼 보여도 판단의 질을 받치고 있고, 통로에 따라 기본값이 켜짐과 꺼짐으로 다릅니다. 켜고 끄는 값을 항상 명시하고, 끄기 전에 같은 입력으로 결과를 비교하는 회귀 검증을 합니다.
빨라졌는데 결과가 달라졌다
Qwen3.6-35B-A3B는 올라마에서 생각이 기본으로 켜져 있습니다. 로컬에서 생각을 끄자 생성 속도가 초당 약 15.4에서 18.7로 올랐고 한 문장 답은 2.5초에 나왔습니다. 대신 엉뚱한 말이 눈에 띄게 늘었습니다.
끄는 방법 자체도 막혔습니다. Goose 설정 화면에는 생각을 끄는 항목이 없었고, 올라마 모델 파일에 아래처럼 넣자 오류가 났습니다.
PARAMETER think false
unknown parameter 'think'
이 글은 로컬에서 겪은 일과 클라우드 API에서 겪은 일을 함께 다룹니다. 같은 Qwen 계열이라도 부르는 통로가 다르면 기본값과 결과가 달랐기 때문입니다. 두 경우가 섞이지 않게 소제목마다 어디서 겪은 일인지 밝혀 두었습니다. 공통된 교훈은 하나입니다. 생각을 끄는 것은 속도 설정이 아니라 품질 설정이라는 점입니다.
로컬에서 생각을 끄는 법과 안 되는 법
| 방법 | 결과 |
|---|---|
명령줄에 --think=false |
됨. 초당 약 18.7 |
모델 파일에 PARAMETER think false |
안 됨. unknown parameter |
| Goose 설정 화면 | 항목 없음 |
SYSTEM에 /no_think를 넣은 사본 모델 |
만들어 두었으나 실제로 생각을 안 하는지는 시험하지 않음 |
ollama run qwen3.6:35b-a3b-q4_K_M --think=false
사본 모델은 ollama create로 SYSTEM 지시에 /no_think를 넣어 만드는 방식입니다. Goose처럼 화면에 항목이 없는 프로그램에서 쓰려고 만들었지만, 효과는 확인하지 못했습니다. 로컬에서는 빠른 단답에만 생각을 끄고, 판단이 필요한 일은 켜 둡니다.
클라우드에서 같은 모델을 불렀을 때: 기본값이 조용히 꺼졌다
여기부터는 로컬이 아니라, 클라우드에서 Qwen을 API로 불렀을 때 겪은 일입니다. 중간 도구를 거쳐 부르던 판단 작업을 API 직접 호출로 바꿨습니다. 같은 지시문으로 세 번씩 재니 이렇게 나왔습니다.
| 항목 | 중간 도구 경유 | 직접 호출 |
|---|---|---|
| 시간 | 69, 73, 94초 | 34, 34, 34초 |
| 토큰 | 8,167 | 6,458 (21% 감소) |
| 답의 구조 | 세 번이 서로 달랐음 | 세 번 같음 |
함정은 그다음이었습니다. 직접 호출에서 enable_thinking을 적지 않으면 기본값으로 꺼집니다. 중간 도구를 거칠 때는 그 도구가 켜 주고 있었던 것입니다. 오류도 경고도 없고 답은 멀쩡한 JSON으로 나옵니다.
꺼진 상태로 재면 5초, 458토큰(94% 감소)까지 떨어졌습니다. 그런데 답에 담기는 항목의 개수가 바뀌었습니다. 꺼진 것을 알아챌 단서는 이렇게 지나치게 짧은 시간과 달라진 답 구조뿐이었습니다. 그래서 생각 값은 켜든 끄든 항상 적어서 보냅니다. 아래는 요청 본문에 값을 함께 싣는 모양이며, 필드를 넣는 정확한 자리는 쓰는 SDK의 문서를 따릅니다.
{"model": "...", "messages": [...], "enable_thinking": true}
생각 출력은 낭비가 아니었다
이것도 클라우드 모델 사례입니다. 다른 판단 작업에서 출력의 89%가 생각이었습니다. 생각 9,334자에 실제 답은 1,145자였고, 생각은 읽지도 않고 버렸습니다. 그래서 낭비로 보고 생각 분량을 줄였더니 판정이 무너졌습니다.
"이 낱말은 글자 그대로의 대상이 아니라 상징이다" 같은 판단은 한 번 곱씹어야 나옵니다. 그 곱씹음이 버려지던 9천 자였습니다. 읽지 않는 것과 쓸모없는 것은 다릅니다. 로컬 모델에서 생각이 답 자리를 다 먹은 경우는 반대 방향의 문제인데, 올라마가 생각만 하고 답을 안 쓸 때에 적었습니다.
설정이 먹었는지 확인하는 법
- 생각을 끄기 전에 같은 입력 몇 개로 켠 결과와 끈 결과를 나란히 받아 둡니다.
- 시간, 토큰, 답의 구조(항목 수, 형식)를 비교합니다. 시간이 크게 줄고 구조가 바뀌었다면 품질도 바뀐 것입니다.
- API로 부를 때는 생각 값을 명시했는지 코드에서 확인합니다. 통로를 바꾸면 기본값도 바뀝니다.
- 값싼 모델이 어려운 판단에 실패했다면, 능력이 없다고 결론 내기 전에 그 모델이 생각을 켠 채로 돌았는지부터 확인합니다.
확인한 환경
| 항목 | 값 |
|---|---|
| 로컬 | 윈도우, 올라마 0.34.4, qwen3.6:35b-a3b-q4_K_M, 2026년 9월 28일 |
| 클라우드 | Qwen API 직접 호출, 2026년 8월 3일 |
같이 보면 좋은 글: Goose에 올라마 로컬 모델 연결하기
이 글의 내용은 2026년 10월 5일에 마지막으로 확인했습니다. 틀린 곳을 발견하시면 연락처로 알려 주세요.