기존 사용하던 qwen3.5-122b가 생각보다 멍청하고 램을 많이 사용해서 여유램이 부족하니 다른걸 찾아 봐야지 하고 찾아 봤슴미다
허깅페이스에 nvidia에서 개조한 버전이 올라왔는데
qwen3.6-27b dense , qwen3.6-35b-a3b 이렇게 임미다
처음 덴스모델이 좋다고 해서 다운받고 사용해 봤는데... 넘넘 느리네요
그래서 다시 122b로 가야 하나 하다가 35b가 비슷한 성능이라고 해서 일단 다운받았는데 스파크용 옵션이 있슴미다
그래서 다 적용하고 vllm에 올리고 토큰생석속도를 측정해 보니
| 항목 | 27B (이전) | 35B-A3B (현재) |
| ---- | -------- | ------------ |
| 컨텍스트 | 131K | 262K |
| VRAM | 98GB | 22GB |
| RAM | 109GB | 79GB (캐시 포함) |
| 속도 | 9 tok/s | 105 tok/s |
대충 이정도 나옴미다 105토큰은 오픈코드 적용 안 한 상태에서 한거라 실제로 오픈코드 적용한건 더 낮은 토큰생성이 나오는데 그래도 80개 이상은 나와줌미다
이정도면 실사용에 아무런 문제가 없죠
스파크 2대면 딥싴4플래시를 운용 가능하다던데.... 미니맥스3도 된다던데... 부럽요