유투브에서 2배 빨라진다는 과장된 표현에 낚여서 Exllamav3이란 것을 써봤습니다.
https://github.com/turboderp-org/exllamav3
주로 사용해야할 모델이 Qwen 3.6-35B-A3B라 찾아보니, 이게 있더라고요.
https://huggingface.co/isogen/Qwen3.6-35B-A3B-StyleTune-exl3-4bpw/
그래서 3가지 프롬프트 주고 해봤더만~ 대략 이런 통계가 나왔습니다.
총 프롬프트 토큰 74,745
총 생성 토큰 20,058
총 처리 토큰 94,803
평균 프롬프트 처리 속도 2,529.9 T/s
평균 생성 속도 139.8 T/s
평균 TTFT (첫 토큰 지연) 2.29 초
총 실행 시간 185.91 초
이전에는 90 T/s 보기도 힘들었거든요. 2배는 아니더라도, 나름 꽤 빨라진 것 같습니다.
모델 용량도 작아져서 컨텍스트 크기 늘릴 수 있는 것도 장점같아요.
( 5060ti 듀얼에 국민오버 +300, +3000 한 상태입니다. )