BottleCap AI 에서 Qwen3.6-27B의 지능의 손실은 없으면서 사고과정을 최적화 했다고 합니다.
사고 과정에 불필요한 토큰을 줄여서 평균 45% 정도 사고 과정이 줄였습니다.
특정 테스트에서는 결과가 나올때까지의 출력 시간이 6배 가량 빨라집니다.
MTP도 지원합니다.

huggingface : bottlecapai/ThinkingCap-Qwen3.6-27B
테스트
oMLX v0.5.1 M5 Pro (20c) 64GB
프롬프트 : 태양계 시뮬레이션하는 단독 html 파일 생성
모델 | PREFILL(T/S) | THINKING(S) | TOKEN GEN (T/S) |
|---|
Qwen3.6-27B-oQ4e-mtp | 5.3t/s (23 tok) | 19.3s (545 tok) | 30.2t/s (7630 tok) |
ThinkingCap-Qwen3.6-27B-oQ4e-mtp | 5.2t/s (23 tok) | 6.4s (108 tok) | 29.5t/s (7053 tok) |
THINKING 시간이 현저히 줄어든 것을 확인할 수 있었습니다.
결과물
일반 모델
ThinkingCap