아직 llamacpp에 머지는 안되었는데,
Dflash 만든 분이 얼마전에 DFlash2 만들어서 PR로 올렸습니다.
전 strixhalo용 llamacpp 만드는 분이 이번에 머지해서 Qwen3.8 27B UD-Q5-KXL에 올려서 써봤는데, 갓플래쉬군요 -0-;
context 100K넘은 상태에서도 15t/s 정도 찍습니다. 빈상태에서는 30가까이 찍을때도 있습니다.
이로서 SSD안에 있던 수많은 모델이 숙청 당했습니다 -_-;
Qwen 3.6 35B A3B도 Orinith 1.5 나왔길래 바로 숙청
Gemma4 26B는 일단 말은 잘하니까 일단 살려두고, 31B 숙청
Ling 3.0 Tiny가 8B A1B인데, 사이즈 비해서 툴콜을 상당히 잘합니다!?
어디서 쓰느냐 따라 결과가 좀 갈리긴 한데, unsloth studio 같은데서는 해당모델로 뉴스 같은거 취합이랑 데이터 정리 상당히 잘했습니다. 당연히 빠르고요
그래서 일단 살려뒀습니다..; 안써보신분들 한번 써보시길