작은 gpu를 위한 tenrary모델

110.193.***.***
8

Bonsai27b(https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf)라는 모델을 소개합니다. Qwen 3.6 27b모델을 삼항(ternary)모델로 변환한 모델인데 크기가 겨우 2 ~8 giga밖에 하지 않습니다. 그럼에도 불구하고 벤치마크 상으로는 성능이 꽤 괜찮네요.

다만, 이게 좀 스페셜한 llama.cpp가 필요합니다.

포맷

llama.cpp 버전

상태

1-bit (Q1_0)

업스트림 lama.cpp (최신)

✅ 일반 빌드로 동작

Ternary (Q2_0)

PrismML 포크 (prism 브랜치)

❌ 일반 빌드는 불가

Ternary를 돌리는 방법

# PrismML 포크의 prism 브랜치 사용
git clone -b prism https://github.com/PrismML-Eng/llama.cpp
cd llama.cpp
cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON  # 또는 -DGGML_METAL=ON
cmake --build build -j

왜 필요한가?

Ternary는 {-1, 0, +1} 3개 값을 Q2_0_g128 형식으로 인코딩하는데, 표준 llama.cpp에는 이 커널이 없습니다. PrismML이 커스텀 2-bit 하이브리드 어텐션 커널을 직접 작성해서 prism 브랜치에 넣었습니다.

바이너리도 제공

빌드 귀찮으면 PrismML llama.cpp 릴리스에서 macOS/Linux/Windows 사전 빌드를 받을 수 있어요.


Sources: llama.cpp Docs · Ternary-Bonsai-8B-gguf · Ternary-Bonsai-27B-gguf

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
8.29 -0.01

2026.07.21 KEB 하나은행 고시회차 798회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!