QWEN3.8 27B 간단 후기

121.226.***.***
9

현재 제 시스템과 로딩 조건에 대해 간략히 말씀 드리고 시작하겠습니다.

  • T7910 중고 + 듀얼 엔비디아 GV100 (장당 VRAM 32GB) - NVLink가 이베이에서 날아오고 있으나, NVLink + MTP 조합시 속도가 치명적으로 떨어진다는 결과를 찾아서 피눈물 중

  • 모델 Q8, KV캐시 FP16

  • 파라미터들은 권장 구성 그대로 설정 (컨텍스트 빼고)

  • 슬롯 2개, 슬롯당 컨텍스트 200K (이렇게 구성시 GV100에서 31.5GB 소모)

HP Strix Halo 미니 워크스테이션을 서버로 쓰고 있고, 과거에 Asus GX10을 사용했다가 판매하였습니다.

하기는 통제된 환경의 벤치가 아닌, 제가 어제 로딩한 후 간단하게 시험한 결과들임을 말씀 드립니다.

  • 속도는 MTP 적중률에 따라 다르지만 대강 30tps대에서 50tps대까지 다양하게 분포 (MTP=4로 설정)

  • 추론토큰은 여전히 어마무시하게 뿜어댐. 하지만 이것이 27B 파라미터로 이 성과를 내는 원동력이라 생각하기 때문에 별도로 추론을 끄거나 제한을 두지는 않음

  • 원래 오픈클로용으로 사용하지 않고 단발성으로 호출해서 사용했으나, 이번에는 주변환경을 어디까지 인지하고 컨텍스트 길어지면 어떻게 반응하는지 궁금하여 오픈클로에서 좀 사용해 봄

  • 체감적으로 툴콜링 능력이 상당히 상승한 느낌. QWEN3.6이 대거 실패하거나 못찾는 툴을 잘 찾아 쓰는 현상을 관찰

  • QWEN3.6에게 네가 무슨 모델이냐고 물으면 세션에 주입된 값만 보고 자기 모델명을 이야기하고 되물어도 같은 답을 하는 반면에, QWEN3.8은 Curl을 날려서 자기 모델네임이랑 컨텍스트 크기, 양자화 등을 확인하는 능력을 보임. 그게 진짜 맞냐고 되물으니 실제 모델 파일명까지 찾아서 자기가 무슨 모델인지 보고함.

  • 여전히 장기간 작업이 계속되면 영어+한국어를 섞어 대답하거나 중국어를 섞어서 대답하는 현상은 관찰됨. 이건 GPT 5.6 Luna에서도 간헐적으로 나온 현상이라 특별히 신경 쓰이지는 않음

  • 테일스케일 망 안에 있는 라즈베리파이5에 코드서버를 설치하고 CODEX Extension 설치하고 로그인해달라고 지시했는데, CODEX Extension까지는 설치 성공, CODEX 로그인은 헤매는 중. 이건 GPT 5.5도 실패했는데 (애초에 oauth 로그인이 가능한지도 모르겠음) 가능할지 흥미롭게 지켜보는 중 (한참 이것저것 건드려보다가 모르니까 인터넷 검색 중...)

  • 허나 정 안되겠다 싶은걸 멈추지는 않고 무한루프에 빠지는 현상은.... 여전히 관찰됨.

  • 필수적인 도구만 노출시켜주고 작업을 시키는면 로컬모델로 상당히 괜찮은 결과를 보여줄 것 같음 (쓸데없이 많은 도구들을 노출시키면 추론시간 많이 길어짐..)

개발영역별로 다르겠지만 프론티어+QWEN3.8 조합이면 꽤 스무스하게 돌아가지 않을까 고민해봅니다.

실제로 GX10 쓰던 시절 GPT Plus 구독 중인지라 Roo Code로 GPT 5.5 + QWEN3 Coder Next로 이런저런 시도를 많이 해 봤는데 QWEN3.8까지 온 지금 어떨런지.... 다른 분들의 후기를 기다려봅니다.

QWEN3.8은 다시 LLM Wiki 관리랑 이메일 수집/분류용 AI로 열심히 일하게 돌려보냈습니다. ㅎㅎ

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.97 =0.00

2026.08.16 KEB 하나은행 고시회차 1095회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!