Bonsai27b(https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf)라는 모델을 소개합니다. Qwen 3.6 27b모델을 삼항(ternary)모델로 변환한 모델인데 크기가 겨우 2 ~8 giga밖에 하지 않습니다. 그럼에도 불구하고 벤치마크 상으로는 성능이 꽤 괜찮네요.

다만, 이게 좀 스페셜한 llama.cpp가 필요합니다.
포맷 | llama.cpp 버전 | 상태 |
|---|
1-bit (Q1_0) | 업스트림 lama.cpp (최신) | ✅ 일반 빌드로 동작 |
Ternary (Q2_0) | PrismML 포크 (prism 브랜치) | ❌ 일반 빌드는 불가 |
Ternary를 돌리는 방법
# PrismML 포크의 prism 브랜치 사용
git clone -b prism https://github.com/PrismML-Eng/llama.cpp
cd llama.cpp
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON # 또는 -DGGML_METAL=ON
cmake --build build -j
왜 필요한가?
Ternary는 {-1, 0, +1} 3개 값을 Q2_0_g128 형식으로 인코딩하는데, 표준 llama.cpp에는 이 커널이 없습니다. PrismML이 커스텀 2-bit 하이브리드 어텐션 커널을 직접 작성해서 prism 브랜치에 넣었습니다.
바이너리도 제공
빌드 귀찮으면 PrismML llama.cpp 릴리스에서 macOS/Linux/Windows 사전 빌드를 받을 수 있어요.
Sources: llama.cpp Docs · Ternary-Bonsai-8B-gguf · Ternary-Bonsai-27B-gguf