vLLM + Qwen 3.8 27B + 5060ti Dual 조합: 평균 88.5t/s

40

유튜브에서 "Best Ways to Run Qwen3.8-27B on Dual RTX 5060 Ti Cards"란 제목의 영상이 보여 봤더니, "measured 78.31 tokens/second for prose and 124.89 tokens/second" 이런 문구가 있습니다. 그래서 보고 따라해 봤습니다.

https://github.com/skrodahl/qwen38-27B-dual-rtx5060

프롬프트는 대충 이렇게 줬구요.


ESP32-P4 보드, I2C/SPI 기반 IMU(가속도/자이로) 센서, Wi-Fi 기능을 연동한 "온디바이스 모션 분류 및 이상 징후 알림 시스템" 개발 과제를 설계해 줘.

  • 포함할 내용:

    1. 센서 데이터를 50Hz 주기로 수집하여 큐(Queue) 또는 버퍼에 저장하는 FreeRTOS 기반의 멀티태스킹 설계 가이드

    2. 시계열 데이터(CNN/LSTM) 추론을 위한 데이터 전처리 및 TFLite Micro 실행 코드 뼈대

    3. '낙하(Fall)' 등 이상 징후 감지 시, Wi-Fi를 통해 HTTP POST 또는 MQTT로 JSON 데이터를 전송하는 네트워크 연동 코드

    4. 메모리 누수 방지 및 멀티태스킹 환경에서의 디버깅 팁


418초 정도 걸렸구요.

제미나이가 만들어준 대시보드로 관찰해보니...

같은 환경에서 llama.cpp로 돌릴 때는 구경도 못했던 수치가...

생각보다 꽤 괜찮은 조합 같습니다.

참고: GPU는 전원 153W로 제한, 메모리는 +3000 오버클럭한 상태입니다.

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.53 ▲ 0.01

2026.10.09 KEB 하나은행 고시회차 1738회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!