아래 Qwen 3.8 Splash 에 관한 정보글을 올렸었는데요
https://damoang.net/ai/7949
4비트 양자화로 인해 퀄리티가 아쉽다는 덧글들이 있어서 그 부분에 대해서 조금 더 제미니에게 질문을 했더니 아래와 같은 새로운 정보를 주네요.
※ Qwen 3.8 Splash 4비트 양자화로 성능(추론 절벽) 아쉽다는 분들을 위한 팁입니다.
최초 공개된 순정 Splash 엔진은 4비트 기반이라 복잡한 코딩이나 수학적 추론에서 지능이 떨어진다는 피드백이 많았는데요. 레딧(r/LocalLLaMA) 등 오픈소스 유저들이 엔진 코드를 개조해서 압축을 가하지 않은 순정 8비트 버전(Native 8-bit, 일명 Splash-HQ)을 구동하는 데 성공했습니다.
메모리(RAM) 용량이 여유로운 맥 유저분들은 무조건 이쪽을 추천해 드립니다.
1. 추론 능력(지능) 복구 완료
2. 역설적인 속도 향상
무리하게 압축된 양자화 모델보다 오히려 압축되지 않은 순정 8비트 가중치가 투측 디코딩(Speculative Decoding)의 적중률을 높여줍니다.
그 결과, 지능은 훨씬 높은데도 실측 속도는 초당 37~55토큰 수준으로 기존 Ollama보다 훨씬 쾌적하고 빠른 속도를 유지합니다.
3. 이런 분들께 추천
"속도 빠른 건 좋은데, 가끔 헛소리하거나 코드가 깨지는 건 싫다" 하시는 분들
통합 메모리가 48GB ~ 64GB 이상으로 넉넉해서 약 27GB 용량의 모델을 여유롭게 올릴 수 있는 사양을 가지신 분들
수만 자가 넘는 긴 소스 코드를 분석하거나, 에러 없는 정밀한 게임 개발/업무 자동화 스크립트를 짜셔야 하는 분들은 4비트 말고 레딧에 풀린 Native 8-bit 패치랑 가중치 파일 적용해서 써보세요. 밸런스가 아주 완벽합니다.