Qwen3.8-Flash-Next 모델을 Strix Halo 128GB에서 테스트

58.183.***.***
6
  • 사용한 엔진 : llama.cpp 브랜치 pr27742

  • 사용한 모델 : Qwen3.8-Flash-Next-UD-IQ4_XS

  • 사용한 시스템 : Strix Halo (Beelink GTR9 PRO 128GB)

  • 사용한 운영체제 : Arch Linux, Vulkan VRAM 96GB 할당

  • 레퍼런스 : 링크 참조

설정해 놓고 몇 번 테스트 해 보니깐,

ctx 길이는 128k 정도 놓고 하는게 아마 최적인 것 같습니다.

64k 정도로 놓았을 때는, 상업적인 서비스에 육박하는 응답 속도가 진짜로 나옵니다.

256k 정도로 설정해서 서버를 실행해서 사용해 보면, 이 경우에는 CPU 연산자원 및 시스템 메모리까지 싹 다 박박 긁어서 시스템이 총동원됩니다. 물론 늘어난 컨텍스트 길이만큼 속도도 저하되네요.

하지만 이 경우에도 약간만 인내심이 있으면 충분히 잘 돌아가는 것 같습니다.

벤치마킹 결과들을 보면, Deepseek 4 flash를 능가하는 것은 확실하다고 하는데, 그런데도 속도가 훨씬 더 좋으니 정말 발전 속도가 무시무시 합니다.

정말로 로컬모델 가지고 쓸만한 속도도 나오면서 퍼블릭 서비스되는 모델과 동급의 품질을 가진 결과를 얻을 수 있다는게 굉장히 흥분되네요.

사실 저는 중국산 모델 말고 독파모 같은데서 이런 모델이 나오기를 매우 바라고 있는데, 독파모는 선단급 모델을 만드는데 초점이 있고 또 참여한 기업들이 상업적 이유로 오픈웨이트에 그다지 힘을 쏟을 여력이나 동기가 부족해 보이긴 합니다. 하지만 상업적인 이유로라도 로컬모델을 병행해서 끌고가 줘야 할텐데, 안타깝습니다.

▶ 원문 출처: https://www.reddit.com/r/StrixHalo/comments/1vz5yb3/qwen38flashnext_125ba6b_running_on_strix_halo/?solution=957fe3a6a547c072957fe3a6a547c072&js_challenge=1&token=7afd7253fec22262ff1c52b1703fe9ec7dbcc5482b6045fe1f50de322cb8d1eb&jsc_orig_r=

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.78 -0.01

2026.08.28 KEB 하나은행 고시회차 117회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!