Qwen3.8 Flash Next를 좀 더 빠르게 저사양(?)에서 돌리는 툴?

42
This post has not been translated to English yet. Showing the original text.

프론티어급 로칼 모델 인 Qwen3.8 Flash Next를 Starta라는 툴로 돌릴수 있던데.. 제 경우는 이 툴을 쓰지 않고도 llama.cpp 돌릴수는 있었는데 속도가 좀 느려서 거시기했는데, 이거 쓰면 같은 환경에서 3배 정도 빠르게 돌릴수 있습니다. (20tps 에서 60 tps). 게다가 저 사양에서도 잘 돌아가네요.

https://github.com/Niko1221/Strata

아래는 Gemeni의 설명...


Strata는 1,250억 개(125B)의 거대한 파라미터를 가진 대형 모델인 Qwen3.8-Flash-Next를 일반 가정용 PC 및 GPU 1장 환경에서 매우 빠르게 구동할 수 있도록 설계된 전용 추론 엔진(Inference Engine)입니다. [1, 2]

원래 이 정도 규모의 모델을 로컬에서 돌리려면 수백 GB의 VRAM(그래픽 메모리)을 가진 서버급 장비나 여러 장의 GPU가 필요하지만, Strata를 사용하면 RTX 4060 Ti, RTX 4080 등 12GB~24GB 수준의 VRAM을 가진 단 한 장의 소비자용 그래픽 카드와 64GB의 시스템 RAM 구성에서도 실사용이 가능한 빠른 속도로 모델을 구동할 수 있습니다. [1, 2, 3]

주요 특징과 작동 원리

  • 특정 모델 맞춤형 최적화: 범용적으로 여러 모델을 지원하는 엔진(vLLM 등)과 달리, Qwen3.8-Flash-Next 아키텍처에 완벽하게 맞춤 설계되어 하드웨어 자원을 극도로 쥐어짜 냅니다. [2, 4]

  • 계층형 메모리 스와핑 (Hierarchical Swap): 모델의 크기가 너무 커서 GPU VRAM에 다 들어가지 않기 때문에, 핵심 연산은 GPU에서 처리하되 대용량 가중치(Weights)나 대화 기록(KV 캐시)은 시스템 RAM과 SSD를 거쳐 실시간으로 빠르게 주고받는 파이프라인 최적화가 적용되었습니다. [2, 5, 6]

  • 비동기 PCIe 전송 기술: GPU가 토큰을 생성하고 연산하는 동시에, 다음 연산에 필요한 데이터를 PCIe 대역폭을 통해 미리 백그라운드에서 읽어오므로 지연 시간(Stall)을 획기적으로 줄여줍니다. [5, 6]

  • 빠른 속도 구현: 저사양 및 단일 GPU 환경에서도 초당 수십 토큰(환경에 따라 대략 40~70+ tokens/s) 수준의 디코딩 속도와 압도적으로 빠른 첫 토큰 반응 속도(TTFT)를 보여줍니다. [7, 8, 9]

요약하자면

Strata는 "내 그래픽 카드는 12~24GB 수준인데, 최신 초거대 로컬 모델인 Qwen3.8-Flash-Next를 API 비용 없이 내 컴퓨터에서 아주 빠르게 돌려보고 싶다"고 할 때 선택할 수 있는 가장 혁신적이고 효율적인 최적화 도구입니다. Windows와 Linux 모두 원클릭 설치에 가까운 환경을 제공하여 접근성도 높습니다. [1, 2, 6, 9]

Strata를 사용해 보시려는 하드웨어 스펙(그래픽 카드 모델 및 시스템 RAM 용량)을 알려주시면, 어느 정도의 속도(t/s)가 나올지 혹은 어떤 양자화(Quantization) 설정을 사용하는 것이 좋을지 구체적으로 가이드해 드릴 수 있습니다.


[1] https://xhinker.medium.com

[2] https://medium.com

[3] https://xhinker.medium.com

[4] https://www.reddit.com

[5] https://arxiv.org

[6] https://www.nicheloom.com

[7] https://www.reddit.com

[8] https://arxiv.org

[9] https://alphasignal.ai

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.52 ▲ 0.01

2026.10.08 KEB 하나은행 고시회차 784회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!