설정 최적값 찾는게 참 쉽지 않은 것 같습니다.

3
Postingan ini belum diterjemahkan ke Bahasa Indonesia. Menampilkan teks asli.

llm wiki는 vllm + swift 1.5 기반으로 확정하고, 설정 최적값을 좀 찾아보고 있습니다.

MTP는 기존 3보다 4가 더 나은 결과를 보여줘서 쉽게 찾은 것 같구요.

chatgpt가 max-num-batched-tokens 을 4096에서 8192로 바꿔보라고해서 해보다가...

OOM에 계속 줘 터지고 있습니다.

max-model-len 131072

gpu_memory_utilization 0.925

max-num-batched-tokens 6144

로 터지지는 않고 테스트 돌고 있는데...

nvtop으로 보면 간당간당 합니다.

안터지기를 ㅠ.ㅠ

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.53 ▼ -0.01

2026.10.08 KEB 하나은행 고시회차 468회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!