Panduan Penggunaan StrixHalo Halogen Flash Server

63

Ini adalah implementasi yang difokuskan hanya untuk StrixHalo's Qwen3.8 Flash Next.

Masih dibagikan secara tertutup kepada beberapa pengembang, jadi saya tidak tahu bagaimana cara kerjanya, tetapi sudah berjalan.

Mengisi konteks penuh 256K hampir selalu mempertahankan 1000t/s dan dalam kondisi tersebut TG lebih dari 30 ;;;

Awalnya visi dihilangkan, tetapi sekarang visi juga berfungsi, dan pengembang telah mulai mendukung model file Qwen 3.8 FN gguf selain model yang dibuat sendiri.

Tentu saja model miliknya paling cepat. (Perplexity sedikit turun katanya)

Sepertinya KV cache menggunakan struktur 256K dengan memori 20GB per buah.

Saat ini dalam bentuk wadah terpisah, jadi agak sulit untuk digunakan bersama llamacpp lainnya. Untuk saat ini, saya telah menghubungkannya ke lemonade sebagai layanan eksternal dan mengaktifkannya agar wadah ditutup setelah 10 menit tidak aktif. Namun, performanya benar-benar luar biasa.

Awalnya ada beberapa perdebatan karena bukan open source, tetapi setelah menunjukkan performanya, semua orang menjadi tenang ㅎㅎ

Bagi yang menggunakan AIMAX 395+ 128GB, silakan kunjungi

https://github.com/peonist-ai/halogen-flash-server

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
7.52 ▼ -0.01

2026.10.09 KEB 하나은행 고시회차 1858회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!